사전 학습이 언어 간 지식 공유에 실패하는 이유 — AI 생성 일러스트AI 일러스트
리서치 연구

사전 학습이 언어 간 지식 공유에 실패하는 이유

Why Pretraining Fails to Share Cross-Lingual Knowledge

arXiv9월 18일 발표 · 2분 · 심사 전 논문

LLM이 여러 언어를 처리할 때 인간처럼 지식을 효과적으로 전이하지 못하는 근본적인 원인을 심층 분석했습니다.

세 줄 요약arXiv 원문 기반
  1. 연구 결과, 언어별로 토큰 공간을 분리하여 사용하는 것 자체가 지식의 칸막이를 만들며, 이것이 일반화 실패의 핵심 장벽임을 밝혀냈습니다.
  2. 언어를 공유된 토큰 공간으로 매핑하는 방식을 제안했고, 이는 기존 대비 14배에 달하는 높은 수준의 지식 전이 개선 효과를 입증했습니다.
  3. 이번 연구는 언어 간 지식 전이가 단순히 모델 크기 문제가 아닌 '토크나이저 설계'와 같은 구조적 문제임을 시사합니다.

(LLMs)은 여러 언어를 처리하고 모델링하는 데 상당한 발전을 이루었지만, 인간의 다국어 사용자처럼 효과적으로 지식을 전이하지 못하는 한계를 보입니다. 연구진은 360M개 및 7B개의 를 가진 LLMs를 사전 학습했으며, 이러한 낮은 언어 간 지식 일반화가 사전 학습 과정에서 나타나며 표준 개입에도 지속됨을 확인했습니다.

이 원인을 규명하기 위해 동일한 텍스트와 분할을 공유하지만 서로 다른 토큰 공간에 매핑된 두 개의 같은 언어 복사본을 사용하는 통제된 이중 언어 사전 학습 환경을 구축했습니다. 그 결과, 단순히 토큰 공간을 분리하는 것만으로도 지식의 칸막이가 생겨나며, 이는 동일한 언어의 사본 사이에서도 발생할 수 있는 근본적인 장벽임을 밝혀냈습니다.

이러한 이해를 바탕으로 연구진은 간단한 단어별 번역을 통해 언어를 공유된 토큰 공간에 매핑하는 방식을 제안했습니다. 이 방법은 언어 간 지식 일반화를 크게 개선하여, 기존 대비 최대 12.6%의 네이티브 언어 학습 효율성을 회복시키는 효과를 보였으며 이는 기준선(baseline) 대비 14배 높은 수치입니다.

용어 풀이

대규모 언어 모델
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
매개변수
모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
원문arXiv · Why Pretraining Fails to Share Cross-Lingual Knowledge같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv