언어 모델 레이어의 토큰 자기장 구조 발견
Some Tokens Behave like Magnets: Revealing Linguistic Organization in the Layers of Language Models
arXiv대규모 언어 모델(LLM)의 내부 레이어에 주변 토큰을 끌거나 밀어내는 '자기장 벡터'가 존재하며, 이들이 언어 정보를 기하학적으로 조직화함을 밝혀냈습니다.
- 연구 결과, 문법적 기능어가 초기 레이어에서 반발 자석 역할을 하거나, 질의응답 같은 특정 작업에서는 정답 영역을 분리하는 등 명확한 패턴이 관찰됩니다.
- 이는 LLM이 언어를 단순히 처리하는 것이 아니라, 각 레이어별로 구조화되고 목적 지향적인 계산 과정을 거친다는 새로운 통찰을 제공합니다.
- 특히 초기 레이어의 반발 자석 제거가 구문 분석 같은 통사적 작업에 치명적인 영향을 주지만, 의미론적 작업에는 큰 영향이 없다는 점에서 그 중요성이 입증되었습니다.
(LLM) 내부에는 주변 을 끌거나 밀어내는 '자기장 벡터'가 존재하며, 이들이 언어 정보를 기하학적으로 조직화하는 것이 확인되었다. 연구진은 이러한 자기장 벡터를 식별했으며, 특정 방향의 토큰들은 자석에 의해 늘어나고(elongated), 반대 방향의 토큰들은 압축되는(compressed) 현상이 관찰된다.
이러한 패턴은 LLM 아키텍처나 크기에 관계없이 일관되며 인과적 관련성을 갖는다. 특히, 기능어(function words)는 초기 레이어에서 일관되게 반발 자석 역할을 하는 통계적으로 유의미한 패턴을 보였으며, 모델 깊은 곳으로 갈수록 자기장 벡터들은 고유한 방식으로 극성을 재조직하는 것이 관찰되었다.
이러한 현상은 LLM이 특정 작업에 맞게 될 때 더욱 명확해진다. 예를 들어, 질의응답(QA)과 같은 다운스트림 태스크에서는 정답 영역 토큰이 최종 레이어에서 독특한 반발 자석 역할을 하며 주변 문맥으로부터 답을 기하학적으로 분리하는 것이 확인되었다.
실험 결과에 따르면, 초기 레이어의 반발 자석을 제거하면 구문 분석(POS tagging) 정확도가 91%에서 10% 미만으로 급격히 떨어지는 등 통사적 작업에 치명적인 영향을 주지만, 의미론적 작업에는 큰 영향이 없는 것으로 나타났다.
용어 풀이
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- 미세 조정
- 이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.