다중 에이전트 코딩 판정기, 판단의 근거를 측정하는 방법
When Is a Multi-Agent Code Judge Actually Grounded? Two Label-Free Measurements, and a Judge That Declines to Guess
arXiv기존 AI 코드 판정기는 근거 부족 여부와 관계없이 확신에 찬 답변을 내놓는 한계가 있었습니다. 연구진은 이를 개선하기 위해 다중 에이전트 검증 방식을 도입했습니다.
- 초기 방식은 판단 불가 상황에도 답을 제시했으나, 비교 자체가 불가능할 경우 거절하도록 시스템을 보완하여 성능을 크게 향상시켰습니다.
- 핵심 기여는 단순히 정확한 판정기를 만드는 것이 아니라, AI가 답변 근거 부족 시 이를 사용자에게 명확히 알리는 '불확실성 측정 방법' 제시입니다.
- 다중 에이전트 검증 방식은 효과를 위해 ①판단 대상과 독립적인 자료여야 하며, ②비교하는 두 후보 간에 차이가 존재하는 근거가 필요합니다.
일반적인 언어 모델()은 다른 코드의 정확성을 판정할 때 증거가 부족하더라도 확신에 찬 결론을 내리는 경향이 있습니다. 이러한 한계를 극복하기 위해 다중 검증 방식이 제안되었는데, 이 방법은 판단 과정을 체크 가능한 주장들로 분해하고 각 주장을 증거와 비교하여 검증합니다. 이는 특히 검색된 문서 세트를 증거로 사용할 때 효과적인 접근법입니다.
연구진은 이러한 다중 에이전트 검증 방식이 작동하기 위해서는 증거가 두 가지 조건을 충족해야 한다고 주장했습니다. 첫째, 검토 중인 답변과 독립적이어야 하며, 둘째, 비교 대상인 두 후보 간에 차이가 존재하는 근거여야 합니다. 이 두 번째 조건은 검색된 문서를 사용할 때는 자동으로 충족되지만, 코드 판정의 경우에는 그렇지 않은 경우가 발생합니다.
실제 테스트 결과, MARCH 프레임워크를 사용하여 80개 이상의 조건-셀 측정에서 코드를 판정한 결과, 해당 시스템은 비교의 78%에서 95% 사이에서 두 솔루션을 동등하게 좋다고 선언했습니다. 이는 같은 모델이 직접 질문했을 때의 정확도(43.7%)에 비해 낮은 수치입니다. 다만, 파이프라인 자체 로그를 이용한 두 가지 측정값으로 게이팅을 적용하자, 비교할 근거가 없는 판정은 거절하게 되었고, 이로 인해 정확도는 20.7%에서 36.9%로 향상되었으며 여전히 모든 비교의 절반에 답하고 있음을 보여주었습니다.
용어 풀이
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.