다국어 음성-음성 번역 코퍼스 CVSS-X 공개 — AI 생성 일러스트
리서치 연구

다국어 음성-음성 번역 코퍼스 CVSS-X 공개

CVSS-X: A Multilingual Speech-to-Speech Translation Corpus for 28 Languages

arXiv9월 15일 발표 · 2분 · 프리프린트

대규모 다국어 음성-음성 번역 코퍼스인 CVSS-X가 공개되었습니다. 이 데이터셋은 영어를 시작점으로 28개 언어로의 음성 번역을 지원하는 것이 핵심입니다.

세 줄 요약arXiv 원문 기반
  1. 기존 자료와 달리, CVSS-X는 규모가 기존 대비 약 8배 이상 커진 16,000시간 이상의 데이터를 제공하며, 음성 복제 기능까지 포함한 두 가지 변형이 추가되었습니다.
  2. CVSS와 결합하여 양방향 및 다국어 번역 연구를 가능하게 함으로써, AI 통번역 기술의 정확도와 범용성을 한 단계 끌어올릴 잠재력을 가집니다.
  3. 데이터셋은 CC-BY-NC 4.0 라이선스로 공개되었으며, 코퍼스 자체가 합성(synthetic) 방식으로 생성되었다는 점을 참고하여 활용할 수 있습니다.

CVSS-X는 대규모 합성(synthetic) 음성-음성 번역 코퍼스를 소개합니다. 기존의 CVSS가 21개 언어를 영어로 번역하는 방식이었다면, CVSS-X는 영어를 시작점으로 하여 총 16,000시간이 넘는 방대한 규모를 자랑하며, 12개의 언어군에 걸친 28개 목표 언어로의 번역을 지원합니다.

이 코퍼스는 각 언어당 약 240,000개의 병렬 음성 쌍으로 구성되어 있으며, CVSS보다 8배 더 큰 규모입니다. 또한, 두 가지 변형인 CVSS-X-C(언어별 두 개의 표준 목소리)와 CVSS-X-T(교차 언어 음성 복제)를 제공하며, 이들 모두 완전히 생성된 데이터로 구성되어 있습니다.

평가 결과에 따르면, CVSS-X는 유형론적으로 다양한 언어에서 일관된 성능을 보이며 CVSS와 비교할 만한 번역 품질을 보여주었습니다. 이 코퍼스를 기존의 CVSS와 결합하면 양방향 및 다국어 음성-음성 번역 연구를 진행하는 것이 가능해지며, 데이터셋은 CC-BY-NC 4.0 라이선스로 제공됩니다.

원문arXiv · CVSS-X: A Multilingual Speech-to-Speech Translation Corpus for 28 Languages
원문 보기arXiv