다중 LLM 추론의 중간 단계: COMED 제안
COMED: The Missing Middle Between Routing and Collaboration in Multi-LLM Inference
arXiv기존 LLM 시스템은 모델 선택(라우팅)이나 무분별한 협업에 의존했으나, 연구진은 이 둘 사이의 중간 단계인 'COMED'를 제안했습니다.
- COMED는 답변의 확신도를 기준으로 모델을 단계적으로 활용하며, 오류가 예상되는 경우에만 선별적인 협업(Controlled Model Escalation)을 요청합니다.
- 이 기술은 불필요한 계산과 토큰 사용을 줄이는 동시에, 기존 방식보다 높은 정확도를 달성하여 효율성과 성능을 모두 높입니다.
- COMED는 '복구되는 오류'가 '협업으로 인한 부정확성(Harm)'보다 클 때 가장 효과적이라는 이론적 전제 하에 작동합니다.
기존 다중 시스템은 모델 라우팅이나 모든 모델을 사용하는 밀집 협업에 의존해왔으나, 연구진은 이 둘 사이의 간극을 메울 새로운 접근 방식인 COMED(Controlled Model Escalation for Multi-LLM Deliberation)를 제안했다. COMED는 선택적 교차 모델 협업을 위한 후크 앵커 컨트롤러 역할을 수행하며, 단일 LLM이 모든 질의에 대해 균일하게 신뢰할 수 없다는 문제 인식에서 출발한다.
COMED는 답변의 확신도를 기준으로 작동하는 것이 특징이다. 이 시스템은 앵커 자체 일관성(anchor self-consistency), 라우터 마진, 그리고 경량 피어 프로브를 활용하여 자신감 있는 답변을 먼저 수용하고, 모호한 경우에만 검증하며, 협업이 실제로 유익할 때만 단계적으로 에스컬레이션을 요청한다. 연구는 '구제되는 오류'가 '협업으로 인한 손해(harm)'보다 클 때 선택적 협업이 개선된다는 이론적 전제를 제시했다.
실험 결과, COMED는 의료, 과학 및 일반 추론 에서 모든 16개의 오픈 설정에 대해 고정 및 라우팅된 앵커를 모두 개선하는 성능을 보였다. 특히 MedQA에서는 최대 +10.7 퍼센트포인트의 성능 향상을 달성했으며, 밀집 협업 방식보다 적은 디코딩 을 사용하면서도 높은 정확도를 유지했다. HLE와 최신 모델(frontier models) 테스트에서는 GPT-5.5가 23.1%에서 28.1%로 개선되는 결과를 나타냈다.
용어 풀이
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
- 가중치
- 학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.