코드 스위칭 학습으로 다국어 모델의 언어 간 정렬 달성 — AI 생성 일러스트AI 일러스트
리서치 연구

코드 스위칭 학습으로 다국어 모델의 언어 간 정렬 달성

Feeding BabyLMs Macaroni: Code-Switching Curricula Cause Cross-Lingual Convergence

arXiv9월 28일 발표 · 2분 · 심사 전 논문

연구진은 다국어 환경에서 흔히 발생하는 언어 혼용(code-switching) 데이터를 활용하여 소형 트랜스포머 모델을 사전 학습시키는 새로운 방법을 제시했습니다.

세 줄 요약arXiv 원문 기반
  1. 코드 혼용 데이터로 훈련할 경우 병렬 텍스트의 표현이 효과적으로 정렬되며, 특히 단어 수준 $\rightarrow$ 문장 수준 $\rightarrow$ 단일 언어 문서 순서의 커리큘럼 방식이 가장 뛰어난 성능을 보였습니다.
  2. 이는 코드-스위칭 학습이 다국어 사전 학습에 매우 효과적인 데이터 증강 방법임을 입증하며, AI가 인간의 복잡한 언어 사용 패턴 이해에 기여할 수 있음을 보여줍니다.
  3. 다만 이 연구는 영어, 네덜란드어, 중국어 등 특정 다국어 코퍼스를 기반으로 진행된 실험이며, 코드-스위칭 커리큘럼 학습의 효과를 입증하는 방법론적 제안입니다.

연구진은 다국어 환경에서 흔히 발생하는 언어 혼용(code-switching) 현상을 활용하여 소형 디코더 전용 를 사전 학습시키는 방법을 제시했습니다. 이 연구에서는 영어, 네덜란드어, 중국어 등 세 가지 언어로 구성된 1억 단어 규모의 다국어 코퍼스를 기반으로 베이스 코퍼스를 구축했으며, 여기에 을 이용해 단어 및 문장 수준의 코드 스위칭 데이터를 삽입하여 추가 코퍼스를 생성했습니다.

실험 결과, 코드-스위칭 데이터로 훈련할 경우 병렬 텍스트의 표현이 효과적으로 정렬되며, 특히 서로 다른 스크립트 간에 이러한 정렬이 이루어지는 것을 확인했습니다. 더욱 주목할 점은 이 언어적 정렬 상태가 모델을 단일 언어 문서로 추가 학습시키더라도 지속된다는 것입니다.

연구진은 코드-스위칭 커리큘럼 학습 방식을 제안했는데, 이는 학습 과정을 단어 수준의 코드 스위칭 $\rightarrow$ 문장 수준의 코드 스위칭 $\rightarrow$ 단일 언어 문서 순서로 진행하는 방식입니다. 이 커리큘럼을 따른 모델이 코드-스위칭 데이터 없이 훈련된 기준 모델보다 BabyLM 평가 세트에서 우수한 성능을 보였습니다.

용어 풀이

트랜스포머
오늘날 대부분의 언어 모델이 쓰는 신경망 구조. 문장 속 단어들의 관계를 한꺼번에 계산해요.
LLM
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
원문arXiv · Feeding BabyLMs Macaroni: Code-Switching Curricula Cause Cross-Lingual Convergence같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기