코드 생성 신뢰도를 높이는 CoVer 프레임워크 공개
Information-Gain Rewards over Diversity-Pruned Tests: GT-Anchored Verifier Co-Training for Reliable Code Generation
arXiv코드 생성 모델의 성능을 높이기 위해, 코드를 짜는 역할과 테스트를 만드는 역할을 동시에 학습하는 'CoVer'라는 새로운 프레임워크가 제시되었습니다.
- CoVer는 정보 획득량(IG) 보상으로 판별력이 높은 테스트만 선별하고, 다양성 필터링을 통해 비중복적인 테스트 세트를 구성하여 성능을 극대화했습니다.
- 기존 방식의 한계였던 테스트의 무작위성 및 판별력 부족 문제를 해결함으로써, 실제 환경에서 요구되는 고신뢰도의 코드 생성을 가능하게 합니다.
- CoVer는 생성과 테스트 선택 과정을 동시에 개선하는 이중적 장점을 입증했으며, 기반 모델 크기에 관계없이 높은 성능 향상을 보여주었습니다.
코드 생성 RL 분야에서, 코더와 테스트 작성자 역할을 동시에 학습하는 셀프-플레이 방식은 고정된 테스트 스위트의 한계를 극복할 것으로 기대됩니다. 하지만 기존 방법들은 '허용성 붕괴(permissiveness collapse)' 문제에 직면하여 판별력이 낮은 테스트로 보상을 최대화하거나, i.i.d. 샘플링된 테스트가 특정 모드 입력에 집중되어 추정기 분산을 증가시키는 경향이 있었습니다.
이를 해결하기 위해 CoVer(Co-trained Coder and Verifier)라는 단일 정책 GRPO 프레임워크가 제안되었습니다. CoVer는 첫째, 정보 획득량(IG) 보상을 사용하여 테스트의 패스/실패 벡터와 정답 기반 정확도 신호 y [0, 1] 간의 상호 정보를 측정합니다. 이 과정에서 양의 공분산 부호를 가진 판별적인 테스트에만 보상이 부여됩니다. 둘째, 세 단계의 다양성 인식 선택 과정을 통해 후보 풀을 행동적으로 중복되지 않은 테스트 세트로 줄여 IG 추정기의 유효 표본 크기를 높입니다.
CoVer는 LiveBench, MBPP, LiveCodeBench, CodeContests, Code-Forces 등 다섯 가지 에서 성능을 입증했습니다. Qwen2.5-Instruct 백본 대비 한 번의 시도 패스@1 점수가 7B 모델에서 +5.8점, 14B 모델에서 +7.1점 향상되었으며, 비교된 모든 방법 중 가장 높은 매크로 평균을 달성했습니다. 이는 생성과 테스트 선택 과정을 동시에 개선하는 이중적 장점을 보여줍니다.
용어 풀이
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.