102개 언어 특화 음성 인식 모델 'BuzzASR' 공개
BuzzASR: A Swarm of 100+ Monolingual Speech Recognition Models
arXiv연구진은 102개 언어에 특화된 대규모 음성 인식 모델 'BuzzASR'을 개발했습니다. 이 모델은 기존 범용 다국어 모델이 취약했던 소수 언어 환경에서의 성능 향상에 초점을 맞췄습니다.
- BuzzASR은 102개 언어 중 77개 언어에서 최고 성능 모델 대비 우수한 결과를 보였으며, 평균 문자 오류율(CER)을 2.8배 이상 낮추는 성과를 거두었습니다.
- 이 기술은 범용 ASR 시스템의 소수 언어 취약성 한계를 극복하며, 다국어 환경에서 전문적이고 신뢰도 높은 음성 인식을 구현하는 새로운 기준을 제시합니다.
- 모델은 FLEURS 및 Common Voice 등 공개 데이터셋으로 검증되었으며, 연구진이 모든 모델과 코드를 공개하여 학계와 산업계의 활용 및 검증을 독려하고 있습니다.
연구진은 102개 언어를 대상으로 자동 음성 인식(ASR)에 적합하도록 된 Whisper 모델 모음인 BuzzASR을 소개했습니다. 기존의 대규모 기반 ASR 모델들은 다국어적 특성을 가지지만, 학습 데이터가 충분하지 않은 소수 언어에서는 성능이 저하되는 한계가 있었습니다. 이에 연구진은 단순한 단일 언어(monolingual) 미세 조정 전략을 102개 언어로 대규모 확장하고, 교체 및 텍스트 전용 미세 조정을 결합한 복잡한 적응 전략을 구현했습니다.
BuzzASR 모델은 성능 테스트 결과, 102개 언어 중 77개 언어에서 Whisper-large-v3보다 우수한 성능을 보였으며, 평균 문자 오류율(CER)을 2.8배 이상 낮췄습니다. 또한 FLEURS와 Common Voice를 결합한 테스트 세트에서는 27개 언어에 대해 시스템 중 최고 수준의 CER를 달성하는 성과를 거두었습니다.
기술적 측면에서, 토크나이저 교체 전략은 Whisper의 다국어 BPE 대비 압축률(당 문자 수)을 평균 3.3배 개선했으며 최대 21.7배까지 향상시키는 결과를 가져왔습니다. 연구진은 이 모델과 코드, 상세 결과 전체를 공개하여 학계와 산업계의 활용 및 검증을 독려했습니다.
용어 풀이
- 미세 조정
- 이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.
- 트랜스포머
- 오늘날 대부분의 언어 모델이 쓰는 신경망 구조. 문장 속 단어들의 관계를 한꺼번에 계산해요.
- 토크나이저
- 글을 모델이 처리할 토큰으로 잘라 주는 도구.
- 오픈 소스
- 소스 코드를 공개해 누구나 보고 고치고 다시 배포할 수 있게 한 소프트웨어.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.