추론 능력을 강화한 Jeeves, 의사결정 모델의 성능을 높이다
Jeeves. Reasoning improves Jev-like decision models
Hacker NewsJeeves는 대규모 언어 모델에 추론(Reasoning) 단계를 추가하여, 복잡한 의사결정 과정을 거치는 고성능 Jev 스타일의 결정 모델입니다.
- 기존 최고 성능을 보이던 경쟁 모델 대비, 외부 도메인 및 어려운 질문 유형(JevBench hard 등)에서 압도적인 정확도를 입증했습니다.
- 고객 문의 상태 분석처럼 여러 기준과 질문 유형(선택, 평점 등)을 동시에 처리해야 하는 복합적인 실무 환경에 최적화되어 있습니다.
- 추론 과정은 정확도를 높이지만 속도가 느려지므로, `max_think` 제한이나 '생각하지 않는' 모드를 활용해 성능과 속도를 조절할 수 있습니다.
Jeeves는 (LLM)에 추론(reasoning) 단계를 추가하여 복잡한 의사결정 과정을 거치는 Jev-like 결정 모델입니다. 기존의 Jev-like 모델들은 결정 확률을 제공하지만 정확도가 낮다는 한계가 있었는데, Jeeves는 Qwen3.5-9B를 기반으로 CISPO 학습 방식을 적용하여 답변을 내리기 전에 추론하는 구조로 개선되었습니다.
이러한 접근 방식 덕분에 Jeeves는 외부 도메인 및 JevBench의 어려운 항목(hard)에서 경쟁 모델 대비 높은 정확도를 입증했습니다. 예를 들어, JevBench 전체 평균 점수는 0.935를 기록하여 기존 Jev 모델(0.866)보다 우수한 성능을 보였습니다. 또한, 이 모델은 를 통해 반품/배송/청구 등 여러 기준을 가진 선택형(`choice`), 평점(`score`), 예/아니오(`noul`) 질문 유형을 하나의 요청에서 동시에 처리할 수 있습니다.
추론 과정은 정확도를 높이지만 지연 시간(latency) 증가의 원인이 될 수 있어, 사용자는 `max_think`나 `nothink_threshold` 같은 옵션을 활용하여 성능과 속도의 균형을 맞출 수 있습니다. 추론 없이 실행할 경우 요청당 약 0.3초가 소요되는 반면, 추론 과정을 거치면 H100 환경에서 중앙값 기준 3.3초가 걸릴 수 있습니다.
용어 풀이
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- API
- 프로그램끼리 기능을 주고받는 약속된 창구. AI 모델은 보통 API로 불러 써요.