리서치 연구
동남아시아 음성 이해를 위한 대규모 다중 작업 벤치마크 개발
SEA-SpeechBench: A Large-Scale Multitask Benchmark for Speech Understanding Across Southeast Asia
arXiv기존의 영어 중심 음성 인식 평가 체계를 보완하기 위해, 동남아시아 11개 언어를 포괄하는 대규모 다중 작업 벤치마크인 SEA-SpeechBench가 개발되었습니다.
세 줄 요약
- 이 벤치마크는 음성 처리, 감정 분석, 시간적 이해 등 총 9가지 작업을 포함하며, 모델들이 특히 시간적 맥락 파악이나 번역 과정에서 성능 격차를 보였습니다.
- 이는 현재 AI 음성 모델들이 동남아시아 지역 언어와 복잡한 다국어 환경을 포괄적으로 이해하는 데 심각한 한계를 가지고 있음을 보여줍니다.
- 특히 버마어나 타밀어 같은 저자원 언어는 영어 대비 최대 41%p까지 성능이 낮게 측정되어, 모델 개발 시 다국어 프롬프팅 도입이 필수적입니다.
SEA-SpeechBench는 기존의 영어 중심 평가 체계를 보완하기 위해 개발된, 동남아시아 지역의 음성 이해 능력을 평가하는 최초의 대규모 다중 작업 입니다. 이 벤치마크는 총 11개 동남아시아 언어를 대상으로 하며, 97,194개의 샘플과 597시간 분량의 선별된 오디오 데이터를 활용하여 구축되었습니다.
SEA-SpeechBench는 세 가지 범주에 걸쳐 총 9가지 다양한 작업을 포함하고 있습니다. 이 작업들은 자동 음성 인식, 음성 번역, 구어 질문 답변 등의 음성 처리 영역 외에도 감정, 성별, 연령 식별을 위한 준언어적 분석과 최대 3분 길이의 오디오 시퀀스 내 시간적 위치 파악 등 새로운 차원의 시간 이해를 평가합니다.
선도적인 및 독점 시스템에 대한 평가 결과, 모든 모델에서 시간적 이해, 감정 인식, 음성 번역 분야에서 전반적으로 기대에 미치지 못하는 성능을 보였습니다. 특히 버마어와 타밀어 같은 저자원 언어의 경우 영어 대비 최대 41 퍼센트 포인트까지 성능 격차가 확인되어, 포괄적인 모델 개발이 필요함을 보여줍니다.
용어 풀이
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
- 오픈 소스
- 소스 코드를 공개해 누구나 보고 고치고 다시 배포할 수 있게 한 소프트웨어.