LLM 추론에서 토큰별 확실성의 재고찰
Certainty Is Not Just Correctness: Rethinking Token-Level Certainty in LLM Reasoning
arXiv거대 언어 모델(LLM) 추론 과정에서 '토큰별 확실성'이 단순히 정답 여부를 나타내는 지표가 아님을 밝히고, 이를 활용한 성능 개선 방안을 제시했습니다.
LLM의 추론 과정에서 토큰별 확실성을 활용하면 정확도를 높이면서도 토큰 사용 비용을 크게 절감할 수 있는 방법을 제시했어요.
- 연구 결과에 따르면, 확실성은 질문 난이도 정보는 생성 초기에, 답변 정확성에 대한 정보는 후반부에 집중되는 등 위치별 특성이 다르게 나타납니다.
- 확실성을 응답 개수 결정 및 투표 가중치 부여에 활용하는 방식을 제안하여, 정확도를 높이는 동시에 토큰 사용 비용을 크게 절감할 수 있음을 입증했습니다.
- 다만, 확실성이 제공하는 정보는 예측 목표나 모델 종류 등 여러 조건에 따라 달라지므로 신중하게 적용해야 합니다.
별 확실성은 학습 및 추론 과정에서 정확성을 나타내는 대리 지표로 광범위하게 사용되어 왔다. 그러나 그 성능은 단순히 확실성 점수 자체의 정보에만 의존하는 것이 아니라, 이 점수를 어떻게 활용하느냐에 따라 달라진다. 연구진은 모델과 태스크 전반에 걸쳐 통제된 실증 평가를 진행하여, 확실성의 예측 능력을 직접적으로 평가했다.
실험 결과, 확실성은 모델이 정답을 맞힐 가능성이 높은 질문을 식별하는 데 더 효과적이었다. 또한, 확실성 정보는 토큰 유형과 단어 내 위치에 따라 체계적인 변화를 보였다. 구체적으로, 질문 난이도에 대한 정보는 생성 초기에 나타나는 반면, 답변 정확성에 대한 약한 정보는 응답 후반부에 집중되는 경향을 확인했다.
연구진은 이러한 발견의 실질적 가치를 테스트 시간 컴퓨팅에 적용하여 새로운 방식을 제안했다. 이 방식은 생성 초기에 확실성을 활용해 응답 개수를 할당하고, 각 응답에서 후반부의 확실성 점수로 답변 투표에 를 부여하는 것이다. 그 결과, 고정 샘플링 다수결 기준선 대비 전체 정확도를 78.71%에서 79.54%로 높이는 동시에, 생성된 토큰 비용을 82.4% 절감할 수 있음을 입증했다.
용어 풀이
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 가중치
- 학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
토큰별 확실성이란 무엇인가요?
토큰별 확실성은 거대 언어 모델(LLM)의 학습 및 추론 과정에서 정확성을 나타내는 대리 지표로 광범위하게 사용되어 왔어요. 이 점수 자체뿐만 아니라 어떻게 활용하느냐에 따라 성능이 달라져요.
확실성 정보는 응답의 어느 시점에 집중되나요?
질문 난이도에 대한 정보는 생성 초기에 나타나는 경향을 보이고, 답변 정확성에 대한 약한 정보는 응답 후반부에 집중되는 특성을 확인했어요.
제안된 방식의 실질적인 이점은 무엇인가요?
생성 초기에 확실성을 활용해 응답 개수를 할당하고 후반부 점수로 투표 가중치를 부여하는 방식을 통해 정확도를 높이면서도 토큰 사용 비용을 크게 절감할 수 있어요.