리서치 연구
A Speech Corpus for Mizo Automatic Speech Recognition: Whisper and SraVaani 1.0 Fine-Tuning with Morphology-Aware Evaluation
ARarXiv
미조어 음성 인식 연구가 17.62시간 음성 데이터로 Whisper와 SraVaani 1.0을 미세 조정해 평가했다.
세 줄 요약
- Whisper-large-v3은 일반 WER 18.08%, 형태소 인식 평가 WER 7.22%였고, SraVaani 1.0은 미세 조정 후 일반 WER 29.45%, 형태소 인식 평가 WER 17.93%였다.
- 저자원 언어인 미조어 음성 인식 모델을 고를 때, 두 모델의 WER 차이가 어떤 모델이 더 낮은 오류를 내는지 비교하는 근거가 된다.
- Whisper는 미처 보지 못한 언어에 적응해도 낮은 WER을 보였지만, SraVaani 1.0은 정제된 미조어 데이터로 미세 조정해야 성능이 개선된다.
미조어 음성 인식 연구가 17.62시간 음성 데이터로 Whisper와 SraVaani 1.0을 미세 조정해 평가했다.