멜버른대, 태평양 크리올어 기계 번역 모델 개발 성과 발표 — AI 생성 일러스트
리서치 연구

멜버른대, 태평양 크리올어 기계 번역 모델 개발 성과 발표

The University of Melbourne WMT 2026 CreoleMT Submission: A Domain-Balanced Approach to Low-Resource Pacific Creole Machine Translation

arXiv9월 15일 발표 · 2분 · 프리프린트

멜버른 대학교가 태평양 크리올어(토크피신, 비슬라마 등) 기계 번역 모델을 WMT 2026에 제출하며 '도메인 균형 접근법'을 적용했습니다.

세 줄 요약arXiv 원문 기반
  1. 대규모 데이터 준비와 도메인 균형 미세 조정을 통해, 기존 최고 성능 모델 대비 모든 방향에서 3% 이상의 높은 번역 정확도를 달성했습니다.
  2. 데이터가 부족한 소수 언어의 기계 번역 품질을 높이는 중요한 기술적 진전으로, 글로벌 언어 접근성 향상에 크게 기여할 전망입니다.
  3. 현재는 특정 테스트 세트에 초점을 맞추었으며, 앞으로 솔로몬 피진 및 비슬라마의 인간 번역본 확보와 모델 경량화가 주요 과제입니다.

멜버른 대학교는 WMT26 크리올어 언어 번역 공유 과제에 제출할 머신 트랜슬레이션(MT) 모델을 개발했습니다. 이 모델은 토크피신, 비슬라마, 솔로몬 피진 등 태평양 크리올어를 대상으로 하며, 특히 광범위한 도메인 성능 구현에 중점을 두었습니다.

연구팀은 대규모의 도메인이 불균형한 데이터셋으로 사전 학습을 진행한 후, 다양한 도메인을 균형 있게 갖춘 데이터로 추가 을 수행했습니다. 이 과정에서 지원 표기 및 정렬(respelling and alignment), 역번역(back-translation), 그리고 Gemini를 통한 증류 등의 데이터 수집 및 준비 기술이 활용되었습니다.

Bouquet와 새로운 구어체 스크립트 테스트 세트를 통해 평가한 결과, 개발된 모델은 인간이 작성한 참조 자료 대비 모든 방향에서 오픈 모델 기준보다 3% 이상의 chrF++ 점수를 높게 기록했습니다. 향후 솔로몬 피진과 비슬라마에 대한 인간 번역본 확보 및 광범위한 도메인 커버리지를 유지하는 소형 모델 개발을 계획하고 있습니다.

용어 풀이

미세 조정
이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.
LLM
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
원문arXiv · The University of Melbourne WMT 2026 CreoleMT Submission: A Domain-Balanced Approach to Low-Resource Pacific Creole Machine Translation
원문 보기arXiv