LLM 선택지별 확률 실시간 측정 웹 데모 'OpenJev' — AI 생성 일러스트AI 일러스트
모델 도구

LLM 선택지별 확률 실시간 측정 웹 데모 'OpenJev'

OpenJev

Hacker News9월 18일 발표 · 3분

OpenJev는 대규모 언어 모델(LLM)이 주어진 여러 선택지들을 각각 얼마나 높은 확률로 고려했는지 실시간으로 측정할 수 있는 웹 데모입니다.

세 줄 요약Hacker News 원문 기반
  1. 사용자는 모델의 선택지별 확률을 디코딩 과정 없이 직접 읽거나, JSON 형태로 토큰 단위로 생성하게 하여 내부 작동 방식을 투명하게 확인할 수 있습니다.
  2. 단순히 최종 답변만 보는 것이 아니라, 모델이 각 옵션을 얼마나 신뢰하는지에 대한 확률적 근거를 확인함으로써 AI의 판단 과정을 깊이 이해할 수 있습니다.
  3. 참고로 이 기능은 로컬 환경에서 실행되며, 표시되는 확률 점수는 모델의 실제 보정된 신뢰도(calibrated confidence)가 아님을 유념해야 합니다.

이 웹 데모는 (LLM)이 주어진 여러 선택지들을 각각 얼마나 높은 확률로 고려했는지 실시간으로 확인할 수 있게 합니다. 사용자는 모델의 선택지별 로짓을 직접 읽거나, 혹은 모델에게 해당 분포를 JSON 텍스트 형태로 단위로 생성하도록 요청하여 내부 작동 방식을 투명하게 관찰할 수 있습니다. 이 방식은 단순히 최종 답변만 보는 것이 아니라, 모델이 각 옵션을 얼마나 신뢰하는지에 대한 확률적 근거를 제공합니다.

실험은 사용자의 로컬 환경에서 진행되는 라이브 데모입니다. 입력 데이터는 페이지를 벗어나지 않으며(Inputs never leave this page), MiniCPM5 2B, Qwen3 0.6B, Qwen3.5 4B 등 다양한 모델을 선택하여 사용할 수 있습니다. 다만, 로컬 환경의 특성상 더 큰 모델은 로딩 시간이 길거나 저사양 기기에서는 적합하지 않을 수 있으며, 데모는 wllama를 통해 고정된 빌드를 사용합니다.

제시되는 확률 점수에는 주의가 필요합니다. 직접 측정된 점수는 표시된 옵션 토큰에 대한 소프트맥스 결과이며, 모델의 보정된 신뢰도(calibrated confidence)는 아닙니다. 또한, 평가 지표 중 Owned 컬럼은 균형 정확도(balanced accuracy)를 의미하며, TypeSafe는 동일한 102개 행 공개 서브셋에서의 동등 사례 일치율을 나타냅니다.

용어 풀이

대규모 언어 모델
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
GPU
많은 계산을 한꺼번에 처리하는 칩. AI 학습과 실행에 가장 많이 써요.
GGUF
언어 모델을 개인 PC에서 돌리기 쉽게 담는 파일 형식. llama.cpp 계열 도구에서 써요.
원문Hacker News · OpenJev같은 주제 가이드 · 바로 써 보기내 업무 예시로 AI 모델 비교하기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기