리서치 연구
WHALE: A Simple Recipe for Joint Harness-Weight Optimization
ARarXiv
AI 에이전트의 성능은 모델 가중치와 컨텍스트 및 제어 흐름을 관리하는 하네스 코드의 결합에 달려 있습니다. 연구진은 이 두 요소를 번갈아 최적화하는 'WHALE' 학습 방법을 제안했습니다.
세 줄 요약
- WHALE는 모델 업데이트 단계와 더 나은 하네스를 탐색하는 단계를 주기적으로 교차하며 진행합니다. 실제 테스트에서 Qwen 에이전트의 성능을 기존 방식보다 최대 24.38%까지 끌어올렸습니다.
- 기존 연구가 가중치나 프롬프트에만 집중했다면, WHALE는 시스템의 근본적인 제어 구조(하네스) 자체를 최적화하여 에이전트 성능 향상의 새로운 패러다임을 제시합니다.
- 최적화 시점의 '전환 타이밍' 설정이 핵심입니다. 단순히 단계별로 진행하기보다 모델과 하네스를 짧게 교차하며 업데이트하는 방식이 더 높은 효율을 보였습니다.
AI 에이전트의 성능은 모델 가중치와 컨텍스트 및 제어 흐름을 관리하는 하네스 코드의 결합에 달려 있습니다. 연구진은 이 두 요소를 번갈아 최적화하는 'WHALE' 학습 방법을 제안했습니다.