리서치 연구
LLM 사실 정보 회상 과정에서 관계 정보가 먼저 주도한다
Relation Before Entity: Deferred Commitment in Language Model Factual Recall
arXiv대규모 언어 모델이 사실 정보를 회상하는 과정에서, 관계 정보(예: 수도)가 개체별 정보보다 먼저 생성 과정을 주도하는 시간적 비대칭성이 발견되었습니다.
세 줄 요약
- 개체 정보는 초기에 이미 사용 가능하지만, 실제로 문장 생성에 결정적인 역할을 하는 시점은 최종 토큰 직전까지 지연되는 '지연된 확정(deferred commitment)' 양상을 보였습니다.
- 이는 모델이 단순히 정보를 나열하는 것이 아니라, 관계적 맥락을 먼저 구조화한 후 개별 사실 정보를 배치하여 답변을 완성함을 시사합니다.
- 본 분석은 디코더 전용 모델과 다양한 프롬프트 패밀리를 대상으로 인과적 진단(causal diagnostics)을 통해 그 결과를 입증했습니다.
(LLM)이 사실 정보를 회상하는 과정을 분석한 결과, 관계 유형 정보와 개체별 정보가 생성 과정을 제어하는 시점에 시간적 비대칭성이 발견되었습니다. 연구진은 네 가지 보완적인 인과 진단(causal diagnostics)을 사용하여, '수도' 같은 관계 유형 정보가 특정 개체에 대한 정보보다 먼저 생성 과정의 주도권을 갖는다는 것을 확인했습니다.
분석 결과에 따르면, 관계 정보의 출현 시점은 개체 정보의 출현 시점보다 10~16 테스트 레이어 앞서 발생했으며, 이는 네트워크 깊이의 31~44%에 해당합니다. 이러한 순서는 임계값(threshold) 0.2부터 0.5까지 모든 모델-임계값 조합에서 일관되게 유지되는 것으로 나타났습니다.
개체 정보가 초기에 완전히 부재한 것은 아니었습니다. 개체 패치(entity-token patching)는 초기 레이어에서도 90~100%의 성공률을 보였으나, 실제 문장 생성에 결정적인 역할을 하는 '생성 제어권'은 최종 토큰 직전까지 지연되는 '지연된 확정(deferred commitment)' 양상을 보였습니다.
용어 풀이
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.