코딩 에이전트의 신뢰성 향상을 위한 학습 방법론 연구
Teaching Agents to Code Reliably
자율 코딩 에이전트가 코드 저장소의 문제를 해결하도록, 연구진은 실행 피드백과 패치 점수화 등 세 가지 핵심 행동을 모델에 체계적으로 학습시키는 방법을 제시했습니다.
코딩 에이전트가 단순히 규모만 커지는 것이 아니라, 실제 소프트웨어 개발 과정에서 특정 행동을 학습하여 높은 신뢰성을 확보할 수 있다는 점이 중요해요.
- 지도 미세 조정과 강화 학습을 결합한 훈련 방식을 통해 에이전트의 성능이 크게 향상되어, 문제 해결 성공률(pass@1)은 최대 43.0%까지 증가하는 성과를 보였습니다.
- 이는 코딩 에이전트가 단순히 규모만 커지는 것이 아니라, 특정 행동을 학습하여 실제 소프트웨어 개발 과정에서 높은 신뢰성을 확보할 수 있음을 의미합니다.
- 다만, 현재 방법론은 에이전트가 접근하는 코드 위치의 다양성이 제한적이며, 자체 테스트만으로는 모든 오류를 완벽히 검증하기 어렵다는 한계도 있습니다.
자율 코딩 는 코드 읽기, 명령어 실행, 파일 편집 및 패치 제출을 통해 저장소 문제를 해결합니다. 본 연구는 에이전트가 단순히 규모만 커지는 것이 아니라, 세 가지 핵심 행동(실행 피드백에 의한 검색 지시 및 패치 점수화)을 학습 가능한 정책으로 구현할 수 있다고 주장했습니다.
훈련 과정에서 지도 (weighted supervised fine-tuning)을 적용했을 때, 문제 해결 성공률(pass@1)은 31.9%에서 35.2%로, pass@8은 46.7%에서 51.1%로 향상되었습니다. 이후 목표를 추가하여 성능이 더욱 개선되었으며, 최종적으로 pass@1은 43.0%, pass@8은 60.7%에 도달했습니다. 이러한 성능 향상은 7B, 14B, 30B 모델 크기에서 검증되었습니다.
용어 풀이
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
- 가중치
- 학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
- 미세 조정
- 이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.
- 강화 학습
- 행동의 결과에 보상을 주면서 더 나은 행동을 익히게 하는 학습 방법.
자율 코딩 에이전트는 어떤 방식으로 저장소 문제를 해결하나요?
자율 코딩 에이전트는 코드 읽기, 명령어 실행, 파일 편집 및 패치 제출 등의 과정을 통해 저장소의 문제를 해결해요. 이 연구는 에이전트가 단순히 규모만 커지는 것이 아니라, 세 가지 핵심 행동을 학습 가능한 정책으로 구현할 수 있다고 주장했어요.
에이전트의 성능은 어떤 훈련 방식을 통해 향상되었나요?
연구진은 가중치 지도 미세 조정과 강화 학습을 결합한 훈련 방식을 적용했어요. 이 과정을 거쳐 에이전트의 성능이 크게 개선되었으며, 최종적으로 문제 해결 성공률(pass@1)은 43.0%에 도달하는 성과를 보였어요.