리서치 연구
검증 피드백을 활용해 후보를 개선하는 LLM 방법론 연구
LLM-as-an-Improver: Turning Verification into Better Candidates
arXiv기존 LLM 성능 개선은 검증 과정을 단순히 후보군 내에서 순위를 매기는 데 그쳤으나, 이 연구는 검증 피드백을 활용해 후보 자체를 능동적으로 개선하는 방법을 제시합니다.
세 줄 요약
- 제안된 VRR(Verify--Repair--Reselect) 방법론은 검증 결과를 바탕으로 초기 우승작과 준우승작의 수정본 및 새로운 대안들을 생성하고 재선택하여 성능을 높입니다.
- 이는 LLM이 단순히 기존 해답 중 최적을 고르는 것을 넘어, 스스로 더 강력한 후보를 구성하는 '개선자(Improver)' 역할을 할 수 있음을 보여줍니다.
- 다양한 벤치마크에서 성능 향상을 입증했으며, 특히 초기 후보군 전체가 틀린 상황에서도 정답을 복구할 수 있는 높은 견고성을 보였습니다.
기존 LLM 성능 개선은 검증 과정을 단순히 후보군 내에서 순위를 매기는 데 그쳤으나, 이 연구는 검증 피드백을 활용해 후보 자체를 능동적으로 개선하는 방법을 제시합니다.