AI 에이전트 연구
Agents Don't Paginate: First-Chunk Selection for LLM Tool Responses
ARarXiv
LLM 기반 코딩 에이전트가 받는 도구 응답은 종종 에이전트의 턴당 토큰 예산을 초과한다.
세 줄 요약
- 연구진은 첫 번째 청크에 핵심 정보(골드 아이템)가 포함되는 비율($p_1$)을 측정하고, 이를 500개 SWE-bench 검증 작업에서 비교했다.
- 첫 번째 청크에 골드 아이템이 포함되어도 다운스트림 정확도가 체계적으로 높아지지 않았으며, 에이전트는 청크 어디서든 정보를 복구한다.
- 키워드 스코어러를 사용하면 $p_1$이 24.2%에서 35.0%로 상승했으나, 이는 순위 1에서의 이득일 뿐 다운스트림 정확도는 변하지 않았다.
LLM 기반 코딩 에이전트가 받는 도구 응답은 종종 에이전트의 턴당 토큰 예산을 초과한다.