개발도구 도구
Kev: 단일 추론으로 다중 질문에 확률적 답변 제공
jaredpalmer/kev
GitHubKev는 하나의 문서를 기반으로 여러 유형의 질문에 대해 단일 추론 과정만으로 정교한 확률적 답변을 제공하는 LLM 어댑터입니다.
세 줄 요약
- 문서와 모든 질문을 하나의 시퀀스로 패킹하고 블록-인과 마스크를 적용하여, 각 질문이 서로 간섭 없이 독립적으로 병렬 처리되는 것이 핵심 기술입니다.
- 단일 추론 과정으로 속도와 효율성을 극대화했으며, 업계 표준 API(System One)를 준수해 시스템에 즉시 통합하기 용이합니다.
- 답변이 텍스트 생성이 아닌 확률 분포로 제공되어 신뢰도가 높고, 낮은 정밀도(bf16)에서도 높은 성능을 유지하는 것이 특징입니다.
Kev는 Qwen3 기반 모델 위에 구현된 어댑터로, 0.6B, 4B, 또는 8B 크기로 제공됩니다. 이 모델은 하나의 문서를 한 번 읽어낸 후, 여러 유형의 질문에 대해 단일 추론 과정(single prefill pass)을 통해 병렬적으로 답변합니다. 문서와 모든 질문이 하나의 시퀀스로 패킹되며, 블록-인과 마스크를 사용하여 각 질문이 다른 질문과 간섭 없이 독립적으로 처리되는 것이 핵심 기술입니다.
Kev는 텍스트 생성이 아닌 확률 분포로 결과를 제공하며, 이는 레이블링된 결과에 대해 교차 엔트로피 방식으로 학습되었기 때문에 신뢰도가 높습니다. 지원하는 질문 유형은 `noul`(예/아니오), `choice`(2~255개 옵션), `score`(순서화된 레벨) 세 가지가 있으며, 는 TypeSafe의 System One 계약을 따르므로 공식 `typesafe-sdk`를 수정 없이 사용할 수 있습니다.
모델은 0.6B, 4B, 8B 체크포인트로 구성되어 있으며, Kev-4B는 '바이트당 최고의 정확도'를 가진 모델로 추천됩니다. 성능 측면에서 Kev-4B(bf16)는 M5 환경에서 다섯 개의 3가지 유형 질문에 대해 중앙값 추론 시간을 약 296ms로 보여주었습니다. 이 서버는 로컬 사용을 목적으로 하며 인증 절차가 없습니다.
용어 풀이
- LoRA
- 모델 전체 대신 작은 추가 부분만 학습시켜 적은 비용으로 미세 조정하는 기법.
- API
- 프로그램끼리 기능을 주고받는 약속된 창구. AI 모델은 보통 API로 불러 써요.