리서치 연구
사전 학습이 언어 간 지식 공유에 실패하는 이유
Why Pretraining Fails to Share Cross-Lingual Knowledge
arXivLLM이 여러 언어를 처리할 때 인간처럼 지식을 효과적으로 전이하지 못하는 근본적인 원인을 심층 분석했습니다.
세 줄 요약
- 연구 결과, 언어별로 토큰 공간을 분리하여 사용하는 것 자체가 지식의 칸막이를 만들며, 이것이 일반화 실패의 핵심 장벽임을 밝혀냈습니다.
- 언어를 공유된 토큰 공간으로 매핑하는 방식을 제안했고, 이는 기존 대비 14배에 달하는 높은 수준의 지식 전이 개선 효과를 입증했습니다.
- 이번 연구는 언어 간 지식 전이가 단순히 모델 크기 문제가 아닌 '토크나이저 설계'와 같은 구조적 문제임을 시사합니다.
(LLMs)은 여러 언어를 처리하고 모델링하는 데 상당한 발전을 이루었지만, 인간의 다국어 사용자처럼 효과적으로 지식을 전이하지 못하는 한계를 보입니다. 연구진은 360M개 및 7B개의 를 가진 LLMs를 사전 학습했으며, 이러한 낮은 언어 간 지식 일반화가 사전 학습 과정에서 나타나며 표준 개입에도 지속됨을 확인했습니다.
이 원인을 규명하기 위해 동일한 텍스트와 분할을 공유하지만 서로 다른 토큰 공간에 매핑된 두 개의 같은 언어 복사본을 사용하는 통제된 이중 언어 사전 학습 환경을 구축했습니다. 그 결과, 단순히 토큰 공간을 분리하는 것만으로도 지식의 칸막이가 생겨나며, 이는 동일한 언어의 사본 사이에서도 발생할 수 있는 근본적인 장벽임을 밝혀냈습니다.
이러한 이해를 바탕으로 연구진은 간단한 단어별 번역을 통해 언어를 공유된 토큰 공간에 매핑하는 방식을 제안했습니다. 이 방법은 언어 간 지식 일반화를 크게 개선하여, 기존 대비 최대 12.6%의 네이티브 언어 학습 효율성을 회복시키는 효과를 보였으며 이는 기준선(baseline) 대비 14배 높은 수치입니다.
용어 풀이
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 매개변수
- 모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.