X2-NativeCursor: 스트리밍 TTS의 실시간 텍스트 진행 추적 기술
X2-NativeCursor: Native-Token Text Progress Tracking for Incremental-Text Streaming Codec TTS
arXiv실시간 음성 합성(TTS) 과정에서 현재 읽은 위치를 정확히 추적하는 것이 핵심 과제입니다. 연구진은 이를 해결하기 위해 'X2-NativeCursor'라는 경량 옵저버를 개발했습니다.
- 이 기술은 최종 파형 디코딩 전 단계의 네이티브 토큰을 활용하여 진행 상황을 추적하며, 기존 방식 대비 오차율(MAE)과 실시간 처리 지연 시간을 획기적으로 개선했습니다.
- 정확한 위치 추적 기능은 음성 기반 인터페이스의 사용자 경험을 혁신합니다. 이를 통해 실시간 하이라이팅이나 대화 기록 업데이트 등 고도화된 기능을 구현할 수 있습니다.
- X2-NativeCursor는 TTS 생성기 자체를 수정하지 않는 경량 구조라는 장점이 있으나, 다른 백본 모델에 적용하려면 각 모델별로 옵저버 학습 과정이 필요합니다.
증분형(Incremental) 텍스트 스트리밍 음성 합성(TTS) 과정에서는 하이라이팅, 중단 처리, 대화 기록 업데이트 등을 위해 온라인 텍스트 진행 상황 추적이 필수적입니다. 기존의 파형 기반 정렬 방식은 완전한 오디오가 필요하거나 스트리밍 중에 추가적인 음향 처리를 요구하는 한계가 있었습니다. 연구진은 이러한 문제를 해결하기 위해 X2-NativeCursor라는 경량 옵저버를 제안했습니다. 이 기술은 TTS 생성기를 변경하지 않으면서, 파형 디코딩 이전 단계의 네이티브 음성 을 활용하여 진행 상황을 추적합니다.
X2-NativeCursor는 정규화 계획(normalization plan)을 통해 발화된 레이블을 원본 텍스트 범위에 연결하며, 텍스트 및 네이티브 토큰 인코더가 로컬 매처를 거쳐 현재 레이블 위치를 추정합니다. 이 시스템은 수정 가능한 위치 추정치를 절대 뒤로 움직이지 않는 커서 형태로 변환하는 출력 규칙을 사용합니다. 실험 결과, 온라인 파형 기준선 대비 80-ms 예측 시 평균 절대 오차(MAE)는 0.151 중국어 문자였으며, 이는 320-ms 예측 시의 1.253 문자에 비해 낮은 수치를 보였습니다.
개발된 X2-NativeCursor는 Qwen3-TTS에 적용되어 검증되었으며, CosyVoice2와 같은 다른 백본 모델에도 적응할 수 있습니다. 이를 위해 각 백본별로 별도의 옵저버를 학습시키는 방식으로 확장성을 확보했습니다. 이 기술은 음성 기반 인터페이스에서 실시간 하이라이팅이나 대화 기록 업데이트 등 고도화된 기능을 구현하는 데 활용될 수 있습니다.
용어 풀이
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.