추론 능력을 강화한 Jeeves, 의사결정 모델의 성능을 높이다 — AI 생성 일러스트AI 일러스트
개발도구 도구

추론 능력을 강화한 Jeeves, 의사결정 모델의 성능을 높이다

Jeeves. Reasoning improves Jev-like decision models

Hacker News9월 29일 업데이트 · 2분

Jeeves는 대규모 언어 모델에 추론(Reasoning) 단계를 추가하여, 복잡한 의사결정 과정을 거치는 고성능 Jev 스타일의 결정 모델입니다.

세 줄 요약Hacker News 원문 기반
  1. 기존 최고 성능을 보이던 경쟁 모델 대비, 외부 도메인 및 어려운 질문 유형(JevBench hard 등)에서 압도적인 정확도를 입증했습니다.
  2. 고객 문의 상태 분석처럼 여러 기준과 질문 유형(선택, 평점 등)을 동시에 처리해야 하는 복합적인 실무 환경에 최적화되어 있습니다.
  3. 추론 과정은 정확도를 높이지만 속도가 느려지므로, `max_think` 제한이나 '생각하지 않는' 모드를 활용해 성능과 속도를 조절할 수 있습니다.

Jeeves는 (LLM)에 추론(reasoning) 단계를 추가하여 복잡한 의사결정 과정을 거치는 Jev-like 결정 모델입니다. 기존의 Jev-like 모델들은 결정 확률을 제공하지만 정확도가 낮다는 한계가 있었는데, Jeeves는 Qwen3.5-9B를 기반으로 CISPO 학습 방식을 적용하여 답변을 내리기 전에 추론하는 구조로 개선되었습니다.

이러한 접근 방식 덕분에 Jeeves는 외부 도메인 및 JevBench의 어려운 항목(hard)에서 경쟁 모델 대비 높은 정확도를 입증했습니다. 예를 들어, JevBench 전체 평균 점수는 0.935를 기록하여 기존 Jev 모델(0.866)보다 우수한 성능을 보였습니다. 또한, 이 모델은 를 통해 반품/배송/청구 등 여러 기준을 가진 선택형(`choice`), 평점(`score`), 예/아니오(`noul`) 질문 유형을 하나의 요청에서 동시에 처리할 수 있습니다.

추론 과정은 정확도를 높이지만 지연 시간(latency) 증가의 원인이 될 수 있어, 사용자는 `max_think`나 `nothink_threshold` 같은 옵션을 활용하여 성능과 속도의 균형을 맞출 수 있습니다. 추론 없이 실행할 경우 요청당 약 0.3초가 소요되는 반면, 추론 과정을 거치면 H100 환경에서 중앙값 기준 3.3초가 걸릴 수 있습니다.

용어 풀이

대규모 언어 모델
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
API
프로그램끼리 기능을 주고받는 약속된 창구. AI 모델은 보통 API로 불러 써요.
원문Hacker News · Jeeves. Reasoning improves Jev-like decision models같은 주제 가이드 · 바로 써 보기오류가 나면 터미널 출력째 묻기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기