RLCD와 Jev: 보상 모델을 넘어선 의사결정 프레임워크
What Is RLCD? The Secret Behind Jev
Hacker NewsJev는 기존의 언어 모델 기반 보상 평가 방식을 개선하여, 단순한 점수 부여를 넘어 구조화되고 확률적으로 보정된 다중 선택(multiway) 의사결정 프레임워크를 제시했습니다.
- 핵심은 '보상 모델'을 넘어서 '결정 모델'로 진화했다는 점입니다. RLCD는 다중 선택 확률 분포와 브라이어 점수 등을 활용해 예측된 신뢰도와 실제 정확도를 분리 측정합니다.
- 이 구조 덕분에 결과가 토큰 단위로 순차 생성되는 기존 방식과 달리 병렬 처리가 가능하며, 프로그램 실행에 필요한 타입 기반의 의사결정 출력을 제공합니다.
- 기술적으로는 새로운 알고리즘을 도입했다기보다, 트랜스포머의 시퀀스 패킹 및 어텐션 마스크 같은 기존 원리를 조합하여 효율성을 극대화한 '제품화된 구성'에 가깝습니다.
기존의 보상 모델은 컨텍스트 $x$와 후보 답변 $a$를 받아 스칼라 값(scalar)을 산출하는 방식이었습니다. 그러나 이 스칼라는 문제나 환경에 따라 의미가 불안정하며, 실제로는 상대적인 선호도(relative preference)가 핵심 신호였습니다. LLaMA-Berry의 PPRM은 이러한 비교 과정을 직접 노출하여 보상 모델링을 선호도 확률 모델링으로 전환했습니다. 여기서 한 단계 더 나아가 RLCD는 스키마 조건부 Plackett–Luce 목적 함수를 사용하며, 이는 다중 선택(multiway) 상황에서 후보들을 정규화하고 순위를 매기는 수학적 기반이 됩니다.
RLCD의 핵심은 단순히 확률 분포를 제공하는 것을 넘어 '보정(Calibration)'을 추가한다는 점입니다. 소프트맥스 벡터가 1로 합산된다고 해서 예측된 $0.8$이라는 확률이 실제로 80%의 정확도를 의미하지는 않습니다. Brier 점수와 같은 적절한 채점 규칙(proper scoring rule)은 모델이 보고하는 신뢰도와 실제 관찰되는 정확도 사이의 관계를 측정합니다. 이 과정은 단순히 '최고의 후보가 무엇인가'를 순위로 매기는 것과, '모델이 그 결정이 얼마나 자주 맞을지 아는가'라는 두 가지 목표를 분리하여 다룹니다.
Jev는 이러한 보상 모델링 구조 자체를 제품화하여 의사결정 인터페이스로 활용합니다. 기존의 스택에서 보상 모델은 생성기(generator)의 내부 구성 요소였지만, Jev는 평가자 자체가 런타임 인터페이스가 되도록 아키텍처를 역전시켰습니다. 이를 통해 `Noul`(참/거짓), `Choice`(다중 선택), `Score`(순서화된 점수)와 같은 타입 기반의 세 가지 기본 원시 요소(primitives)를 제공합니다. 기술적으로는 의 시퀀스 패킹과 어텐션 마스크라는 기존 원리를 활용하여, 모든 후보에 대한 스코어를 한 번의 병렬 순방향 계산으로 얻어내기 때문에 단위의 순차적 생성 과정 없이도 높은 처리 속도를 달성할 수 있습니다.
용어 풀이
- RLHF
- 사람이 매긴 선호 평가를 보상으로 삼아 모델을 다듬는 학습 방법.
- 트랜스포머
- 오늘날 대부분의 언어 모델이 쓰는 신경망 구조. 문장 속 단어들의 관계를 한꺼번에 계산해요.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.