코드 실행 연습으로 최적화 전략을 텍스트 하네스로 추출하는 방법
Building the Harness Automatically: Self-Play in Code Distills a Text Harness for Black-Box Optimization
arXivAI 에이전트가 자체 플레이와 코드 실행 연습을 통해 얻은 최적화 전략을 텍스트 기반의 표준 '하네스'로 추출하는 방법을 개발했습니다.
- 이렇게 만들어진 텍스트 하네스는 Gemini Flash 등 여러 LLM의 성능을 크게 향상시켜, 기존 대비 최대 48%에 달하는 오차 감소 효과를 입증했습니다.
- 이는 복잡한 전문 지식(최적화 정책)이 실제 실행 과정을 거쳐 표준화된 텍스트 형태로 포팅될 수 있음을 보여주며 AI 활용의 새로운 가능성을 제시합니다.
- 해당 방법론은 최적화 전략 발견에 '실행 가능한 연습' 과정과 이를 텍스트로 압축하는 기술이 필수적으로 요구되는 것이 특징입니다.
가 자체 플레이와 코드 실행 연습을 통해 수치적 검색 전략을 학습하고, 이를 텍스트 기반의 표준 '하네스'로 변환할 수 있는지 연구했다. 이 과정에서 에이전트는 최적화 프로그램을 반복적으로 작성하고 평가한 후, 그 결과를 하나의 고정된 '하네스 A' (197단어)로 추출한다. 이는 언어 모델을 활용하는 블랙박스 최적화(black-box optimization)에 적용되는 방법론이다.
이렇게 만들어진 텍스트 하네스는 성능 향상을 입증했다. 독립적인 $N=30$ 연구에서 Gemini Flash의 오차(regret)를 48% 감소시켰으며, 세 가지 보류된 BBOB 지형 모두에서 평균 오차를 낮췄다. 또한 이 텍스트는 테스트된 Gemini 실행기뿐만 아니라 Claude Sonnet에도 적용되어 각각 43%, 49%의 오차 감소 효과를 가져왔다 ($p\leq.005$).
이 방법론은 독립적인 종단 간 복제(end-to-end replication)를 통해 '하네스 B'라는 다른 프로그램과 텍스트로도 동일한 성능 수준을 달성했다. 또한, 봉인된 YouTube 보상 조정 생산 에서도 가장 낮은 오차를 기록하며 그 효용성을 입증했다. 이는 실행 가능한 연습이 검색 정책 발견에 유효하며, 언어가 이를 배포하는 휴대 가능한 매개체임을 보여준다.
용어 풀이
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.