모델 연구
Long-Horizon State Tracking in LLMs: Executing MD5 through a Deep Sequence of Dependent Tool Calls
ARarXiv
LLM이 수많은 단계에 걸쳐 복잡한 계산 과정에서 중간 상태를 얼마나 정확히 유지하는지 테스트했습니다. MD5 해시 함수처럼 196단계의 의존적 도구 호출을 통해 장기적인 '상태 추적' 능력을 검증합니다.
세 줄 요약
- 특정 LLM은 196단계 호출에서도 전체 상태를 유지하며 정확한 해시 값을 반환하는 능력을 보여주었습니다. 성공 요인은 ①모델 자체의 추론 과정 기록과 ②오류 보정 기능이 있는 외부 워커 활용에 달려있습니다.
- 기존 LLM 평가는 최종 결과만 측정하여, 단계별 누적되는 '상태 추적 실패'를 분리 분석하기 어려웠습니다. 본 연구는 복잡한 장기 작업에서 모델의 근본적인 계산 능력을 명확히 검증합니다.
- 실패 원인을 '상태 전달 문제'와 '산술 연산 오류'로 분리하여 국소화하는 것이 가능했습니다. 이는 LLM 에이전트가 복잡한 작업을 수행할 때 어떤 종류의 실수를 했는지 근본적으로 진단할 수 있음을 의미합니다.
LLM이 수많은 단계에 걸쳐 복잡한 계산 과정에서 중간 상태를 얼마나 정확히 유지하는지 테스트했습니다. MD5 해시 함수처럼 196단계의 의존적 도구 호출을 통해 장기적인 '상태 추적' 능력을 검증합니다.