리서치 연구

A Speech Corpus for Mizo Automatic Speech Recognition: Whisper and SraVaani 1.0 Fine-Tuning with Morphology-Aware Evaluation

ARarXiv8월 21일 발표 · 1분 · 심사 전 논문

미조어 음성 인식 연구가 17.62시간 음성 데이터로 Whisper와 SraVaani 1.0을 미세 조정해 평가했다.

세 줄 요약arXiv 원문 기반
  1. Whisper-large-v3은 일반 WER 18.08%, 형태소 인식 평가 WER 7.22%였고, SraVaani 1.0은 미세 조정 후 일반 WER 29.45%, 형태소 인식 평가 WER 17.93%였다.
  2. 저자원 언어인 미조어 음성 인식 모델을 고를 때, 두 모델의 WER 차이가 어떤 모델이 더 낮은 오류를 내는지 비교하는 근거가 된다.
  3. Whisper는 미처 보지 못한 언어에 적응해도 낮은 WER을 보였지만, SraVaani 1.0은 정제된 미조어 데이터로 미세 조정해야 성능이 개선된다.

미조어 음성 인식 연구가 17.62시간 음성 데이터로 Whisper와 SraVaani 1.0을 미세 조정해 평가했다.

원문arXiv · A Speech Corpus for Mizo Automatic Speech Recognition: Whisper and SraVaani 1.0 Fine-Tuning with Morphology-Aware Evaluation같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기