다중 에이전트 코딩 판정기, 판단의 근거를 측정하는 방법 — AI 생성 일러스트AI 일러스트
AI 에이전트 연구

다중 에이전트 코딩 판정기, 판단의 근거를 측정하는 방법

When Is a Multi-Agent Code Judge Actually Grounded? Two Label-Free Measurements, and a Judge That Declines to Guess

arXiv9월 28일 발표 · 3분 · 심사 전 논문

기존 AI 코드 판정기는 근거 부족 여부와 관계없이 확신에 찬 답변을 내놓는 한계가 있었습니다. 연구진은 이를 개선하기 위해 다중 에이전트 검증 방식을 도입했습니다.

세 줄 요약arXiv 원문 기반
  1. 초기 방식은 판단 불가 상황에도 답을 제시했으나, 비교 자체가 불가능할 경우 거절하도록 시스템을 보완하여 성능을 크게 향상시켰습니다.
  2. 핵심 기여는 단순히 정확한 판정기를 만드는 것이 아니라, AI가 답변 근거 부족 시 이를 사용자에게 명확히 알리는 '불확실성 측정 방법' 제시입니다.
  3. 다중 에이전트 검증 방식은 효과를 위해 ①판단 대상과 독립적인 자료여야 하며, ②비교하는 두 후보 간에 차이가 존재하는 근거가 필요합니다.

일반적인 언어 모델()은 다른 코드의 정확성을 판정할 때 증거가 부족하더라도 확신에 찬 결론을 내리는 경향이 있습니다. 이러한 한계를 극복하기 위해 다중 검증 방식이 제안되었는데, 이 방법은 판단 과정을 체크 가능한 주장들로 분해하고 각 주장을 증거와 비교하여 검증합니다. 이는 특히 검색된 문서 세트를 증거로 사용할 때 효과적인 접근법입니다.

연구진은 이러한 다중 에이전트 검증 방식이 작동하기 위해서는 증거가 두 가지 조건을 충족해야 한다고 주장했습니다. 첫째, 검토 중인 답변과 독립적이어야 하며, 둘째, 비교 대상인 두 후보 간에 차이가 존재하는 근거여야 합니다. 이 두 번째 조건은 검색된 문서를 사용할 때는 자동으로 충족되지만, 코드 판정의 경우에는 그렇지 않은 경우가 발생합니다.

실제 테스트 결과, MARCH 프레임워크를 사용하여 80개 이상의 조건-셀 측정에서 코드를 판정한 결과, 해당 시스템은 비교의 78%에서 95% 사이에서 두 솔루션을 동등하게 좋다고 선언했습니다. 이는 같은 모델이 직접 질문했을 때의 정확도(43.7%)에 비해 낮은 수치입니다. 다만, 파이프라인 자체 로그를 이용한 두 가지 측정값으로 게이팅을 적용하자, 비교할 근거가 없는 판정은 거절하게 되었고, 이로 인해 정확도는 20.7%에서 36.9%로 향상되었으며 여전히 모든 비교의 절반에 답하고 있음을 보여주었습니다.

용어 풀이

LLM
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
에이전트
목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
원문arXiv · When Is a Multi-Agent Code Judge Actually Grounded? Two Label-Free Measurements, and a Judge That Declines to Guess같은 주제 가이드 · 바로 써 보기매일 아침 소식, 예약 작업으로 받기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv