네테이즈 유다오, 고정확도 실시간 ASR 모델 발표 — AI 생성 일러스트AI 일러스트
모델 도구

네테이즈 유다오, 고정확도 실시간 ASR 모델 발표

netease-youdao/Confucius4-R2T2

Hugging Face발표일 미상 · 2분

네테이즈-유다오가 공개한 Confucius4-R2T2는 낮은 지연 시간과 높은 정확도를 자랑하는 실시간 스트리밍 음성 인식(ASR) 모델입니다.

세 줄 요약Hugging Face 원문 기반
  1. 발화 내용을 수정 없이 확정된 형태로만 출력하는 'append-only' 방식을 채택하여, 라이브 캡셔닝이나 LLM 에이전트 등에서 발생하는 텍스트 깜빡임을 원천 차단했습니다.
  2. 오프라인 인식 수준에 근접한 높은 정확도를 유지하면서도 평균 200~600ms의 낮은 지연 시간을 달성하여 실시간 서비스의 안정성을 극대화했습니다.
  3. 중국어와 영어에 최적화되었으며, vLLM 백엔드 등 고성능 추론 환경을 통해 높은 처리량과 범용적인 성능 구현이 가능합니다.

Confucius4-R2T2는 낮은 지연 시간과 높은 정확도를 갖춘 스트리밍 자동 음성 인식(ASR) 모델입니다. 이 모델은 'append-only' 출력 모드를 특징으로 하여, 전사 텍스트를 이전 단어 수정 없이 영구적으로 확정하여 기록합니다. 이러한 방식은 실시간 라이브 자막이나 등에서 발생할 수 있는 텍스트 깜빡임(flickering) 현상을 원천적으로 방지하는 데 핵심적인 역할을 합니다.

R2T2는 Qwen3-ASR 모델을 기반으로 하며, 안정 접두사 데이터와 강제 시간 정렬 데이터를 포함한 독특한 학습 기법을 활용합니다. 이 덕분에 오프라인 인식 정확도에 근접하면서도 평균 200ms에서 600ms 사이의 낮은 지연 시간을 달성했습니다. 또한, 사용자는 80ms부터 2s까지 디코딩 청크를 설정할 수 있는 유연성을 가지며, vLLM 백엔드를 통해 높은 처리량을 구현합니다.

이 모델은 중국어와 영어에 최적화되어 있으며 다양한 언어를 지원합니다. 성능 비교 결과에 따르면, AMI 데이터셋에서 R2T2는 160ms 지연 시간 설정 시 11.37의 WER을 기록하며 여러 및 상용 시스템과 비교되었습니다. 이 모델은 실시간 스트리밍 환경에서의 안정성과 정확성을 동시에 확보한 것이 특징입니다.

용어 풀이

LLM
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
에이전트
목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
오픈소스
소스 코드를 공개해 누구나 보고 고치고 다시 배포할 수 있게 한 소프트웨어.
원문Hugging Face · netease-youdao/Confucius4-R2T2같은 주제 가이드 · 바로 써 보기내 업무 예시로 AI 모델 비교하기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기