상태 경로 기반 도구 메뉴를 활용한 온라인 에이전트 성능 향상
The Menu Is an Execution Prior: State-Path Tool Menus for Online Agents
arXiv대규모 언어 모델 에이전트가 복잡한 다단계 작업을 수행할 때, 필요한 도구의 사용 순서를 체계적으로 제시하는 '도구 메뉴' 시스템을 제안했습니다.
- 기존 방식이 단순 요청 관련성에만 의존했다면, 본 기술은 현재 상태에서 목표 결과까지 도달하는 최적의 '상태 경로(state path)'를 학습하여 실행 순서를 결정합니다.
- 실제 벤치마크 환경에서 온라인 성공률을 크게 향상시켰으며, 복잡한 전후 관계가 필요한 다단계 작업에서도 높은 성능과 신뢰성을 입증했습니다.
- 이 메뉴는 최종 행동뿐만 아니라, 목표 달성에 필수적인 모든 선행 조건(producer)들을 포함하는 완전하고 논리적인 실행 흐름을 관리한다는 점에 주목해야 합니다.
(LLM)은 도구를 통해 작동하지만, 실제 는 수천 개의 인터페이스가 포함된 방대한 라이브러리를 다루게 됩니다. 본 연구는 실행 전에 에이전트에게 보여주는 짧고 순서화된 하위 집합인 '도구 메뉴'를 도입하여, 에이전트가 이 메뉴에 있는 도구만을 호출하도록 제한합니다.
기존의 도구 구성 방식은 주로 요청 관련성에 따라 도구를 순위화하는 데 초점을 맞추어 최종 행동을 제시했지만, 이로 인해 목표 달성에 필수적인 선행 생산자(producer)가 누락되거나 적절한 순서로 지연될 수 있는 문제가 있었습니다. 이에 연구진은 관찰 가능한 현재 상태에서 원하는 결과까지 도달하는 사전 실행 경로인 '상태 경로(state path)'를 정의하고, 이를 학습하여 State-Path Tool Menu를 제안했습니다.
이 프레임워크는 메뉴를 이러한 경로에 대한 실행 우선순위로 간주하며, 인코더, 리트리버, 재랭커 등의 구성 요소를 통해 현재 상태에서 실행 가능한 도구와 누락된 입력 생산자, 그리고 최종 행동을 포함하는 완전한 흐름을 구축합니다. 이 State-Path 메뉴는 ToolBench 에서 온라인 성공률을 0.737에서 0.898로 높였으며, 에이전트 자체를 변경하지 않고도 성능 향상을 입증했습니다.
용어 풀이
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.