개발도구 연구
Dual-Form ASR: Semantics-Aware Inverse Text Normalization for Chinese Speech Recognition
ARarXiv
기존 음성 인식(ASR) 시스템은 음성 기록과 텍스트 정규화 과정이 분리되어 오류에 취약했습니다. 본 연구는 두 가지 형태를 동시에 처리하는 DF-ASR 프레임워크를 제안합니다.
세 줄 요약
- DF-ASR은 LLM 기반의 쌍방향 감독 학습을 활용하여 의미론적 맥락을 고려한 텍스트 정규화 능력을 강화했으며, 기존 오픈소스 시스템 대비 우수한 성능을 입증했습니다.
- 이 기술은 단순 전사 수준을 넘어 숫자나 복잡한 문맥적 의미까지 반영하는 정확하고 자연스러운 기록 작성을 가능하게 하여 신뢰도를 높입니다.
- 수작업 주석 기반 중국어 데이터셋에서 검증되었으며, 사용자가 음성 형태와 텍스트 형태 중 원하는 출력 방식을 선택적으로 제어할 수 있습니다.
기존 음성 인식(ASR) 시스템은 음성 기록과 텍스트 정규화 과정이 분리되어 오류에 취약했습니다. 본 연구는 두 가지 형태를 동시에 처리하는 DF-ASR 프레임워크를 제안합니다.