음성 인식의 전사 모호성을 토큰 단위로 허용하는 학습 기준
A Training Criterion with Token-Level Tolerance to Transcription Ambiguity for Automatic Speech Recognition
arXiv기존 음성 인식 시스템은 전사(transcript)가 완벽하다고 가정했으나, 실제 발화에는 국소적인 발음이나 표기의 모호성이 존재합니다. 본 연구는 이러한 오차를 토큰 단위로 허용하는 새로운 훈련 기준을 제시했습니다.
- 단순히 단어 전체를 건너뛰는 방식이 아닌, 토큰 단위 우회 경로와 기존의 단어 수준 아크를 결합한 하이브리드 접근법을 사용했으며, 평균 9.45%의 상대적 WER 감소율로 성능을 개선했습니다.
- 이는 모델이 발화 전체가 아닌 특정 부분에서 발생하는 미묘하고 국소적인 오류나 모호성을 효과적으로 처리할 수 있게 함으로써 시스템 강건성을 크게 높일 수 있음을 의미합니다.
- 독립 검증자 전사 결과에 따르면, 이 토큰 단위 모델은 논란이 되는 문자 구간에서 기존 방식보다 높은 우회 확률을 부여하여 국소적 모호성 포착 능력을 입증했습니다.
자동 음성 인식(ASR)은 일반적으로 참조 전사본이 유일한 레이블이라고 가정하지만, 실제 발화에는 국소적인 발음, 철자 또는 어휘 실현의 차이가 존재하여 음향 정보만으로는 이를 명확히 결정하기 어렵습니다. 기존의 Omni-temporal Classification (OTC) 방식은 이러한 노이즈를 허용하기 위해 연결주의 시간 분류(CTC) 정렬 그래프에 와일드카드 경로를 추가했지만, 단어 수준의 아크는 너무 거칠하여 하나의 지원되지 않는 을 우회할 경우 전체 단어에 대한 감독 정보가 손실되는 문제가 있었습니다.
본 연구에서는 이러한 한계를 극복하기 위해 와일드카드 아크를 토큰 단위로 이동시켜, 지원되지 않는 토큰만 건너뛰고 나머지 단어는 계속 감독받도록 했습니다. 또한, 토큰 수준의 아크와 기존의 단어 수준 아크를 상호 보완적인 탈출 경로로 결합하는 하이브리드 방식을 제시했습니다. 이와 함께 와일드카드 완화 방식도 에포크 인덱스 기반에서 예측 엔트로피 인덱스 스케줄링으로 대체하여, 훈련 길이에 대한 의존도를 줄이면서도 유사한 성능을 유지하도록 개선했습니다.
제안된 토큰 단위 OTC는 19개 언어와 세 가지 코퍼스를 대상으로 테스트되었으며, 모든 25개 작업에서 CTC 대비 성능 향상을 보였습니다. 특히, 이 하이브리드 그래프와 새로운 스케줄링 방식을 결합했을 때 모든 코퍼스에서 가장 낮은 평균 단어 오류율(WER)을 달성했습니다. 독립 검증자 전사 결과에 따르면, 토큰 단위 모델은 논란이 되는 문자 구간에서 CTC보다 유의미하게 더 높은 와일드카드 우회 확률을 부여하여 국소적인 전사 모호성을 효과적으로 처리할 수 있음을 입증했습니다.
용어 풀이
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- 가중치
- 학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.