오신동가/오시크와냐마어 기계 번역 평가를 위한 새로운 벤치마크 개발
The Ongiini-Eval-OW Benchmark: A Concept Paper for the Planned Benchmarking of Machine Translation and Large Language Models on Oshindonga and Oshikwanyama
arXiv나미비아와 앙골라 지역의 오신동가/오시크와냐마어는 기계 번역 평가 자료가 전무한 저자원 언어입니다. 이에 연구진은 이 언어를 위한 새로운 표준 벤치마크인 'Ongiini-Eval-OW'를 설계했습니다.
- 이 벤치마크는 영어-오신동가/오시크와냐마어 쌍으로 총 600개 항목을 포함하며, 원어민 참고 자료 및 11가지 문법적 태그 분류를 적용합니다. 정량 평가 외에 인간의 심층 평가도 결합됩니다.
- 이는 상업 서비스나 오픈소스 모델들이 커버리지하지 못했던 소수 언어 영역의 기술적 공백을 메우는 중요한 시도로, AI 기술 접근성을 높일 기반이 될 전망입니다.
- 현재 개념 논문 단계이며 데이터셋은 2026년 4분기 공개를 목표로 합니다. 프로젝트 완성 및 성공적인 운영을 위해 커뮤니티의 적극적인 참여와 기여가 기대됩니다.
나미비아 북부 및 앙골라 남부에 걸쳐 사용되는 오신동가와 오시크와냐마어는 현재까지 공개된 기계 번역 평가 자료가 전무한 저자원 언어입니다. 연구진은 주요 상업 서비스나 오픈 다국어 MT 모델들이 이 두 표준화된 방언에 대한 커버리지가 부족하다는 문제점을 지적하며, 이를 해결하기 위해 'Ongiini-Eval-OW'라는 새로운 벤치마크를 설계했습니다.
Ongiini-Eval-OW는 영어-오신동가 및 영어-오시크와냐마어 쌍으로 구성된 총 600개 항목의 데이터셋을 목표로 합니다. 이 벤치마크에는 원어민 번역가를 통한 참고 자료, 30개 항목 규모의 번역가 간 합의 세트, 그리고 최소 30개 항목이 포함되는 11가지 현상 태그 분류(phenomenon-tagged stratification)가 적용됩니다. 평가 프로토콜은 chrF++, BLEU, COMET-22를 사용하며, 여기에 50개 항목 규모의 인간 평가 라운드가 추가되어 다각적인 검증을 거칩니다.
현재 개념 논문 단계인 이 프로젝트는 데이터셋을 2026년 4분기에 처음 공개하는 것을 목표로 합니다. 본 v1.0 개념 논문을 통해 설계 내용이 발표되었으며, 향후 프로젝트의 완성 및 성공적인 운영을 위해 참여와 기여가 요청됩니다. 데이터와 코드는 각각 CC-BY-4.0 및 MIT 라이선스로 공개될 예정입니다.
용어 풀이
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.