실시간 무제한 길이 처리가 가능한 음성 인식 모델 — AI 생성 일러스트AI 일러스트
모델 도구

실시간 무제한 길이 처리가 가능한 음성 인식 모델

Edge0/Audio8-ASR-Infinite

Hugging Face발표일 미상 · 3분

Audio8 ASR Infinite는 실시간 스트리밍 처리에 특화된 음성 인식 모델로, 80/120/160ms의 선택 가능한 오디오 클럭과 설정 가능한 지연 시간을 제공합니다.

세 줄 요약Hugging Face 원문 기반
  1. 롤링 KV 캐시를 활용하여 메모리와 지연 시간이 일정하게 유지되는 무제한 길이 전사(transcription)가 가능하며, 24시간 연속 작동에 최적화되었습니다.
  2. 단순 인식 수준을 넘어 말더듬이나 생각의 멈춤까지 구분하는 시맨틱 VAD 기능을 탑재했으며, 중국어와 영어 등 다국어를 지원합니다.
  3. 최고의 성능을 위해 제시된 오디오 클럭 및 지연 시간 조합을 사용해야 하며, 안정적인 운영을 위해서는 vLLM 환경에서의 배포가 권장됩니다.

Audio8 ASR Infinite는 실시간 스트리밍에 최적화된 음성 인식 모델로, 선택 가능한 오디오 클럭(80/120/160 ms)과 전사 지연 시간(240–560 ms)을 제공합니다. 이 모델은 롤링 를 활용하여 메모리와 지연 시간을 일정하게 유지하며, 24시간 동안 무제한 길이의 오디오를 끊김 없이 전사할 수 있습니다. 또한, 전통적인 음향 VAD가 어려움을 겪는 생각의 멈춤이나 말더듬까지 구분하는 시맨틱 VAD 기능을 갖추고 있으며 중국어와 영어 등 이중 언어를 지원합니다.

최적의 성능을 위해서는 프레임 길이와 지연 시간 조합이 중요하며, 예를 들어 오디오 클럭 80ms를 사용할 경우 `frame_len`은 4, `streaming_n_left_pad_tokens`는 18이며 목표 지연 시간(`target_delay_ms`)으로 240/320/480/560 ms가 선택 가능합니다. 성능 테스트 결과에 따르면, Audio8 ASR Infinite는 aishell1/test에서 CER 1.750을 기록하여 다른 모델 대비 낮은 오류율을 보였습니다.

이 모델은 Voxtral의 실시간 오디오 아키텍처와 DSM 스타일 스트리밍 방식을 계승했습니다. 주요 구성 요소로는 Causal Audio Tower(Voxtral Realtime 4B)가 있으며, 디코더 및 LM Head에는 Qwen2.5-3B-Instruct가 사용됩니다. 안정적인 운영을 위해서는 Docker Compose를 이용한 배포 경로가 권장되며, 이를 통해 웹 데모 클라이언트와 함께 환경을 구축할 수 있습니다.

용어 풀이

KV 캐시
모델이 앞에서 계산한 값을 저장해 두고 다음 토큰을 만들 때 다시 쓰는 메모리. 입력이 길수록 커져요.
원문Hugging Face · Edge0/Audio8-ASR-Infinite같은 주제 가이드 · 바로 써 보기내 업무 예시로 AI 모델 비교하기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기