모델 도구
네테이즈 유다오, 고정확도 실시간 ASR 모델 발표
netease-youdao/Confucius4-R2T2
Hugging Face네테이즈-유다오가 공개한 Confucius4-R2T2는 낮은 지연 시간과 높은 정확도를 자랑하는 실시간 스트리밍 음성 인식(ASR) 모델입니다.
세 줄 요약
- 발화 내용을 수정 없이 확정된 형태로만 출력하는 'append-only' 방식을 채택하여, 라이브 캡셔닝이나 LLM 에이전트 등에서 발생하는 텍스트 깜빡임을 원천 차단했습니다.
- 오프라인 인식 수준에 근접한 높은 정확도를 유지하면서도 평균 200~600ms의 낮은 지연 시간을 달성하여 실시간 서비스의 안정성을 극대화했습니다.
- 중국어와 영어에 최적화되었으며, vLLM 백엔드 등 고성능 추론 환경을 통해 높은 처리량과 범용적인 성능 구현이 가능합니다.
Confucius4-R2T2는 낮은 지연 시간과 높은 정확도를 갖춘 스트리밍 자동 음성 인식(ASR) 모델입니다. 이 모델은 'append-only' 출력 모드를 특징으로 하여, 전사 텍스트를 이전 단어 수정 없이 영구적으로 확정하여 기록합니다. 이러한 방식은 실시간 라이브 자막이나 등에서 발생할 수 있는 텍스트 깜빡임(flickering) 현상을 원천적으로 방지하는 데 핵심적인 역할을 합니다.
R2T2는 Qwen3-ASR 모델을 기반으로 하며, 안정 접두사 데이터와 강제 시간 정렬 데이터를 포함한 독특한 학습 기법을 활용합니다. 이 덕분에 오프라인 인식 정확도에 근접하면서도 평균 200ms에서 600ms 사이의 낮은 지연 시간을 달성했습니다. 또한, 사용자는 80ms부터 2s까지 디코딩 청크를 설정할 수 있는 유연성을 가지며, vLLM 백엔드를 통해 높은 처리량을 구현합니다.
이 모델은 중국어와 영어에 최적화되어 있으며 다양한 언어를 지원합니다. 성능 비교 결과에 따르면, AMI 데이터셋에서 R2T2는 160ms 지연 시간 설정 시 11.37의 WER을 기록하며 여러 및 상용 시스템과 비교되었습니다. 이 모델은 실시간 스트리밍 환경에서의 안정성과 정확성을 동시에 확보한 것이 특징입니다.
용어 풀이
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
- 오픈소스
- 소스 코드를 공개해 누구나 보고 고치고 다시 배포할 수 있게 한 소프트웨어.