문맥 기반 다중 선택지 확률 예측 모델 Jevlike 소개
vinnylarouge/jevlike
GitHub문맥(Context)과 여러 선택지 목록을 입력받아 각 옵션의 확률을 한 번에 계산하는 'Jevlike' 모델이 공개되었습니다. 이는 기존처럼 단어별로 순차 생성하는 방식과는 차별화됩니다.
- 모든 선택지를 동시에 처리하여 속도가 매우 빠르며, 위키피디아 데이터 등 실제 환경에서도 높은 예측 정확도를 입증하며 효율성을 높였습니다.
- 사용자 인터페이스(UI)의 메뉴 선택, 추천 시스템 등 복잡한 문맥에서 여러 옵션 중 최적의 답을 빠르게 추론해야 할 때 활용도가 높습니다.
- 다만, 이 모델은 연구용 스타터이며 상업 제품이 아니므로, 예측 시 모든 선택지 목록을 미리 제공해야 하는 기술적 제약사항이 있습니다.
Jevlike는 주어진 문맥(Context)과 여러 개의 텍스트 옵션 목록을 입력받아, 각 옵션에 대한 확률을 단일 패스(one pass)로 계산하는 모델입니다. 이는 기존의 언어 모델처럼 답변을 단어별로 순차적으로 생성하는 방식과는 차별화됩니다. 이 모델은 모든 선택지를 동시에 처리하며, 각 옵션을 쿼리 벡터로 사용하여 문맥 에 어텐션 를 할당하고 이를 통해 하나의 컨텍스트 벡터를 얻습니다. 이후 공유된 내적 곱(dot product)을 거쳐 점수(score)가 계산되고, 소프트맥스 함수를 통해 모든 옵션의 확률이 합 1이 되도록 변환됩니다.
사용자는 이 모델을 활용하여 메뉴 선택이나 추천 시스템과 같이 복수의 옵션 중 최적의 답을 빠르게 추론해야 하는 상황에 적용할 수 있습니다. 학습 데이터는 JSON 형식으로 구성되며, 각 행은 문맥(context), 여러 개의 옵션 목록(options), 그리고 정답의 인덱스(label)를 포함합니다. 사용자는 를 생성하고, `jevlike-train` 명령어를 통해 모델을 훈련시킨 후, `jevlike-eval`로 성능을 평가하며, 최종적으로 `jevlike-predict`를 이용해 새로운 메뉴에 대한 예측을 수행할 수 있습니다.
이 연구용 스타터는 높은 효율성을 보여주어 주목받고 있습니다. 예를 들어, 합성 메뉴 데이터에서는 약 98%의 정확도를 달성했으며, 위키피디아 다음 클릭(next-click) 데이터에서도 높은 성능을 보였습니다. 또한, 사용자가 직접 데이터를 준비하거나 허깅페이스와 같은 외부 경로를 통해 사전 학습된 인코더를 연결하여 모델을 확장할 수 있습니다. 다만, 이 모델은 예측 시 모든 선택지 목록이 미리 제공되어야 하는 기술적 제약사항이 있으며, 상업 제품이 아닌 연구용 스타터임을 유의해야 합니다.
용어 풀이
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- 가중치
- 학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
- 합성 데이터
- 실제로 모은 것이 아니라 AI나 프로그램으로 만들어 낸 학습용 데이터.