리서치 연구
인도 언어 기계 번역을 위한 병렬 코퍼스 및 벤치마크 개발
COILD: An Indic-Centric Parallel Corpus and Benchmark for Machine Translation Across Indian Languages
arXiv인도 언어의 기계 번역(MT) 성능 향상을 위해, 연구진은 116만 개 이상의 문장 쌍을 담은 인도 중심 병렬 코퍼스 'COILD'를 개발했습니다.
세 줄 요약
- COILD는 영어 의존성을 벗어나 인도 원천 자료로 구축되었으며, 8개 도메인과 전문가 검증 벤치마크까지 제공하여 모델 성능 개선 효과를 입증했습니다.
- 아리아어, 드라비다어 등 다양한 언어군의 복잡한 특성을 반영했기에, 다국어 AI 및 미래 언어 모델 개발에 핵심적인 자원이 될 전망입니다.
- 연구자들은 COILD를 활용하여 인도 지역의 광범위한 언어군을 포괄하는 MT 모델 개발과 평가에 즉시 적용할 수 있습니다.
인도 언어의 기계 번역(MT) 성능 향상을 위해, 연구진은 116만 개 이상의 문장 쌍을 담은 인도 중심 병렬 코퍼스 'COILD'를 개발했습니다.