LLM 선택지별 확률 실시간 측정 웹 데모 'OpenJev'
OpenJev
Hacker NewsOpenJev는 대규모 언어 모델(LLM)이 주어진 여러 선택지들을 각각 얼마나 높은 확률로 고려했는지 실시간으로 측정할 수 있는 웹 데모입니다.
- 사용자는 모델의 선택지별 확률을 디코딩 과정 없이 직접 읽거나, JSON 형태로 토큰 단위로 생성하게 하여 내부 작동 방식을 투명하게 확인할 수 있습니다.
- 단순히 최종 답변만 보는 것이 아니라, 모델이 각 옵션을 얼마나 신뢰하는지에 대한 확률적 근거를 확인함으로써 AI의 판단 과정을 깊이 이해할 수 있습니다.
- 참고로 이 기능은 로컬 환경에서 실행되며, 표시되는 확률 점수는 모델의 실제 보정된 신뢰도(calibrated confidence)가 아님을 유념해야 합니다.
이 웹 데모는 (LLM)이 주어진 여러 선택지들을 각각 얼마나 높은 확률로 고려했는지 실시간으로 확인할 수 있게 합니다. 사용자는 모델의 선택지별 로짓을 직접 읽거나, 혹은 모델에게 해당 분포를 JSON 텍스트 형태로 단위로 생성하도록 요청하여 내부 작동 방식을 투명하게 관찰할 수 있습니다. 이 방식은 단순히 최종 답변만 보는 것이 아니라, 모델이 각 옵션을 얼마나 신뢰하는지에 대한 확률적 근거를 제공합니다.
실험은 사용자의 로컬 환경에서 진행되는 라이브 데모입니다. 입력 데이터는 페이지를 벗어나지 않으며(Inputs never leave this page), MiniCPM5 2B, Qwen3 0.6B, Qwen3.5 4B 등 다양한 모델을 선택하여 사용할 수 있습니다. 다만, 로컬 환경의 특성상 더 큰 모델은 로딩 시간이 길거나 저사양 기기에서는 적합하지 않을 수 있으며, 데모는 wllama를 통해 고정된 빌드를 사용합니다.
제시되는 확률 점수에는 주의가 필요합니다. 직접 측정된 점수는 표시된 옵션 토큰에 대한 소프트맥스 결과이며, 모델의 보정된 신뢰도(calibrated confidence)는 아닙니다. 또한, 평가 지표 중 Owned 컬럼은 균형 정확도(balanced accuracy)를 의미하며, TypeSafe는 동일한 102개 행 공개 서브셋에서의 동등 사례 일치율을 나타냅니다.
용어 풀이
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- GPU
- 많은 계산을 한꺼번에 처리하는 칩. AI 학습과 실행에 가장 많이 써요.
- GGUF
- 언어 모델을 개인 PC에서 돌리기 쉽게 담는 파일 형식. llama.cpp 계열 도구에서 써요.