모델 연구

Long-Horizon State Tracking in LLMs: Executing MD5 through a Deep Sequence of Dependent Tool Calls

ARarXiv9월 2일 발표 · 1분 · 심사 전 논문

LLM이 수많은 단계에 걸쳐 복잡한 계산 과정에서 중간 상태를 얼마나 정확히 유지하는지 테스트했습니다. MD5 해시 함수처럼 196단계의 의존적 도구 호출을 통해 장기적인 '상태 추적' 능력을 검증합니다.

세 줄 요약arXiv 원문 기반
  1. 특정 LLM은 196단계 호출에서도 전체 상태를 유지하며 정확한 해시 값을 반환하는 능력을 보여주었습니다. 성공 요인은 ①모델 자체의 추론 과정 기록과 ②오류 보정 기능이 있는 외부 워커 활용에 달려있습니다.
  2. 기존 LLM 평가는 최종 결과만 측정하여, 단계별 누적되는 '상태 추적 실패'를 분리 분석하기 어려웠습니다. 본 연구는 복잡한 장기 작업에서 모델의 근본적인 계산 능력을 명확히 검증합니다.
  3. 실패 원인을 '상태 전달 문제'와 '산술 연산 오류'로 분리하여 국소화하는 것이 가능했습니다. 이는 LLM 에이전트가 복잡한 작업을 수행할 때 어떤 종류의 실수를 했는지 근본적으로 진단할 수 있음을 의미합니다.

LLM이 수많은 단계에 걸쳐 복잡한 계산 과정에서 중간 상태를 얼마나 정확히 유지하는지 테스트했습니다. MD5 해시 함수처럼 196단계의 의존적 도구 호출을 통해 장기적인 '상태 추적' 능력을 검증합니다.

원문arXiv · Long-Horizon State Tracking in LLMs: Executing MD5 through a Deep Sequence of Dependent Tool Calls같은 주제 가이드 · 바로 써 보기내 업무 예시로 AI 모델 비교하기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기