리서치 연구

WHALE: A Simple Recipe for Joint Harness-Weight Optimization

ARarXiv9월 2일 발표 · 1분 · 심사 전 논문

AI 에이전트의 성능은 모델 가중치와 컨텍스트 및 제어 흐름을 관리하는 하네스 코드의 결합에 달려 있습니다. 연구진은 이 두 요소를 번갈아 최적화하는 'WHALE' 학습 방법을 제안했습니다.

세 줄 요약arXiv 원문 기반
  1. WHALE는 모델 업데이트 단계와 더 나은 하네스를 탐색하는 단계를 주기적으로 교차하며 진행합니다. 실제 테스트에서 Qwen 에이전트의 성능을 기존 방식보다 최대 24.38%까지 끌어올렸습니다.
  2. 기존 연구가 가중치나 프롬프트에만 집중했다면, WHALE는 시스템의 근본적인 제어 구조(하네스) 자체를 최적화하여 에이전트 성능 향상의 새로운 패러다임을 제시합니다.
  3. 최적화 시점의 '전환 타이밍' 설정이 핵심입니다. 단순히 단계별로 진행하기보다 모델과 하네스를 짧게 교차하며 업데이트하는 방식이 더 높은 효율을 보였습니다.

AI 에이전트의 성능은 모델 가중치와 컨텍스트 및 제어 흐름을 관리하는 하네스 코드의 결합에 달려 있습니다. 연구진은 이 두 요소를 번갈아 최적화하는 'WHALE' 학습 방법을 제안했습니다.

원문arXiv · WHALE: A Simple Recipe for Joint Harness-Weight Optimization같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기