리서치 연구
LLM의 스크립트 처리 과정: 후기 레이어에서의 확정 메커니즘
Script Choice in LLMs: Evidence for Late-Layer Commitment
arXivLLM이 다양한 스크립트 지식을 어떻게 처리하는지 분석한 연구 결과, 정보 인코딩 과정에 단계적 비대칭성이 존재함을 밝혀냈습니다.
세 줄 요약
- 모델은 초기 레이어에서 입력 및 목표 출력을 학습하지만, 실제 출력 스크립트에 대한 확정(Commitment) 과정은 네트워크의 가장 마지막 레이어에서만 일어나는 것이 핵심입니다.
- 이 결과는 스크립트 처리 과정에 모델의 깊이가 결정적인 역할을 함을 보여주며, 다국어 아키텍처 설계에 중요한 통찰을 제공합니다.
- 또한 작은 규모의 모델에서 성능이 약하다는 점과 결합하여, 언어 처리 능력을 높이기 위해서는 충분히 깊은 구조가 필수적임을 시사합니다.
본 연구는 로지스틱 회귀 프로빙(logistic regression probing)과 로짓-렌즈 분석(logit-lens analysis)이라는 두 가지 해석 가능성 방법을 활용하여 (LLM)의 레이어 전반에 걸친 스크립트 지식 분포를 조사했습니다.
프로빙 실험 결과, 스크립트 인코딩 과정에서 명확한 비대칭성이 발견되었습니다. 입력된 스크립트와 지시된 출력 스크립트는 네트워크의 가장 초기 레이어에서 인코딩되는 반면, 실제 출력 스크립트에 대한 확정(commitment)은 오직 최종 레이어에서만 나타났습니다. 이 과정 동안 모델의 중간 표현들은 대부분 라틴어로 기본 설정되어 있었습니다.
로짓-렌즈 분석을 통해 이러한 스크립트 확정 현상이 LLM의 가장 마지막 레이어에서 일관되게 발생함이 확인되었습니다. 연구진은 이를 작은 규모의 모델에서 관찰되는 약한 스크립트 준수 성능과 결합하여, 스크립트 확정이 모델 깊이와 관련됨을 보여주는 증거로 제시했습니다. 이는 충분히 깊고 포괄적인 다국어 아키텍처 설계에 중요한 시사점을 제공합니다.
용어 풀이
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.