개발도구 연구

Dual-Form ASR: Semantics-Aware Inverse Text Normalization for Chinese Speech Recognition

ARarXiv9월 4일 발표 · 1분 · 심사 전 논문

기존 음성 인식(ASR) 시스템은 음성 기록과 텍스트 정규화 과정이 분리되어 오류에 취약했습니다. 본 연구는 두 가지 형태를 동시에 처리하는 DF-ASR 프레임워크를 제안합니다.

세 줄 요약arXiv 원문 기반
  1. DF-ASR은 LLM 기반의 쌍방향 감독 학습을 활용하여 의미론적 맥락을 고려한 텍스트 정규화 능력을 강화했으며, 기존 오픈소스 시스템 대비 우수한 성능을 입증했습니다.
  2. 이 기술은 단순 전사 수준을 넘어 숫자나 복잡한 문맥적 의미까지 반영하는 정확하고 자연스러운 기록 작성을 가능하게 하여 신뢰도를 높입니다.
  3. 수작업 주석 기반 중국어 데이터셋에서 검증되었으며, 사용자가 음성 형태와 텍스트 형태 중 원하는 출력 방식을 선택적으로 제어할 수 있습니다.

기존 음성 인식(ASR) 시스템은 음성 기록과 텍스트 정규화 과정이 분리되어 오류에 취약했습니다. 본 연구는 두 가지 형태를 동시에 처리하는 DF-ASR 프레임워크를 제안합니다.

원문arXiv · Dual-Form ASR: Semantics-Aware Inverse Text Normalization for Chinese Speech Recognition같은 주제 가이드 · 바로 써 보기오류가 나면 터미널 출력째 묻기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기