AI 에이전트 연구

Agents Don't Paginate: First-Chunk Selection for LLM Tool Responses

ARarXiv8월 28일 발표 · 1분 · 심사 전 논문

LLM 기반 코딩 에이전트가 받는 도구 응답은 종종 에이전트의 턴당 토큰 예산을 초과한다.

세 줄 요약arXiv 원문 기반
  1. 연구진은 첫 번째 청크에 핵심 정보(골드 아이템)가 포함되는 비율($p_1$)을 측정하고, 이를 500개 SWE-bench 검증 작업에서 비교했다.
  2. 첫 번째 청크에 골드 아이템이 포함되어도 다운스트림 정확도가 체계적으로 높아지지 않았으며, 에이전트는 청크 어디서든 정보를 복구한다.
  3. 키워드 스코어러를 사용하면 $p_1$이 24.2%에서 35.0%로 상승했으나, 이는 순위 1에서의 이득일 뿐 다운스트림 정확도는 변하지 않았다.

LLM 기반 코딩 에이전트가 받는 도구 응답은 종종 에이전트의 턴당 토큰 예산을 초과한다.

원문arXiv · Agents Don't Paginate: First-Chunk Selection for LLM Tool Responses같은 주제 가이드 · 바로 써 보기매일 아침 소식, 예약 작업으로 받기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기