다국어 음성 에이전트 성능 측정 벤치마크 공개
$\tau$-Multilingual: Benchmarking Voice Agents Across Languages
arXiv음성 에이전트의 다국어 성능을 측정하기 위해 영어 외 스페인어, 한국어, 만다린 등 여러 언어로 확장된 새로운 벤치마크 $\tau$-Multilingual가 개발되었습니다.
기존의 영어 중심 평가만으로는 음성 에이전트가 실제 여러 언어에서 얼마나 잘 작동하는지 알기 어려웠어요. 이 벤치마크는 다국어 성능 격차를 보여주며, AI 개발 시 언어별 특성을 반드시 고려해야 함을 강조해요.
- 테스트 결과, 일부 언어는 영어와 유사한 성능을 보였으나, 한국어와 만다린은 각각 14.7점, 8.4점가량 큰 성능 저하를 보여 다국어 격차가 심각합니다.
- 기존의 영어 중심 평가는 에이전트의 실제 다국어 능력을 제대로 반영하지 못하며, AI 모델 개발 시 언어별 특성과 한계를 고려해야 함을 보여줍니다.
- 언어별로 응답 누락(한국어)이나 끼어들기(만다린) 등 고유한 실패 양상이 발견되어, 기능 수행, 상호작용, 생성 품질을 분리 측정할 필요성이 제기됩니다.
기존의 영어 중심 평가는 음성 의 행동 범위를 협소하게 보여주므로, 연구진은 $\tau$-Voice를 스페인어, 브라질 포르투갈어, 힌디어, 한국어, 만다린 등 여러 언어로 확장한 $\tau$-Multilingual을 도입했다. 이 평가는 네이티브 스피커의 검토와 평가를 거쳐 총 4,500회의 풀-듀플렉스 통화 및 다섯 가지 음성 구성을 통해 진행되었다.
테스트 결과에 따르면, 스페인어, 포르투갈어, 힌디어는 영어 대비 최대 3.2점 이내의 과제 완료 점수를 유지하며 비교적 유사한 성능을 보였다. 그러나 한국어와 만다린은 각각 14.7점과 8.4점이라는 큰 폭의 성능 저하를 보여 다국어 간 격차가 심각하게 나타났다.
또한, 언어별로 고유한 실패 양상이 발견되었다. 구체적으로 한국어 시스템은 응답 누락이 더 자주 발생했고, 만다린 시스템은 끼어들기(interrupt) 현상이 잦았다. 이러한 분석을 바탕으로 기능 수행, 상호작용, 생성 품질을 분리하여 보고할 필요성이 제기되었으며, 관련 언어 팩과 평가 도구도 공개되었다.
용어 풀이
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
기존의 음성 에이전트 평가는 어떤 한계가 있었나요?
연구진은 기존 평가 방식이 영어에만 초점을 맞추어 에이전트의 행동 범위를 너무 좁게 보여준다고 판단했어요. 그래서 스페인어, 한국어 등 여러 언어로 확장된 새로운 벤치마크를 도입하게 되었어요.
테스트 결과, 어떤 언어에서 성능 저하가 크게 나타났나요?
스페인어, 포르투갈어, 힌디어는 영어와 비슷한 점수를 유지했지만, 한국어는 14.7점, 만다린은 8.4점이라는 큰 폭의 성능 저하를 보여 다국어 간 격차가 심각했어요.
언어별로 발견된 고유한 실패 양상은 무엇인가요?
한국어 시스템에서는 응답 누락이 자주 발생했고, 만다린 시스템의 경우 끼어들기(interrupt) 현상이 잦게 나타나는 등 언어마다 다른 문제가 발견되었어요.