실시간 무제한 길이 처리가 가능한 음성 인식 모델
Edge0/Audio8-ASR-Infinite
Hugging FaceAudio8 ASR Infinite는 실시간 스트리밍 처리에 특화된 음성 인식 모델로, 80/120/160ms의 선택 가능한 오디오 클럭과 설정 가능한 지연 시간을 제공합니다.
- 롤링 KV 캐시를 활용하여 메모리와 지연 시간이 일정하게 유지되는 무제한 길이 전사(transcription)가 가능하며, 24시간 연속 작동에 최적화되었습니다.
- 단순 인식 수준을 넘어 말더듬이나 생각의 멈춤까지 구분하는 시맨틱 VAD 기능을 탑재했으며, 중국어와 영어 등 다국어를 지원합니다.
- 최고의 성능을 위해 제시된 오디오 클럭 및 지연 시간 조합을 사용해야 하며, 안정적인 운영을 위해서는 vLLM 환경에서의 배포가 권장됩니다.
Audio8 ASR Infinite는 실시간 스트리밍에 최적화된 음성 인식 모델로, 선택 가능한 오디오 클럭(80/120/160 ms)과 전사 지연 시간(240–560 ms)을 제공합니다. 이 모델은 롤링 를 활용하여 메모리와 지연 시간을 일정하게 유지하며, 24시간 동안 무제한 길이의 오디오를 끊김 없이 전사할 수 있습니다. 또한, 전통적인 음향 VAD가 어려움을 겪는 생각의 멈춤이나 말더듬까지 구분하는 시맨틱 VAD 기능을 갖추고 있으며 중국어와 영어 등 이중 언어를 지원합니다.
최적의 성능을 위해서는 프레임 길이와 지연 시간 조합이 중요하며, 예를 들어 오디오 클럭 80ms를 사용할 경우 `frame_len`은 4, `streaming_n_left_pad_tokens`는 18이며 목표 지연 시간(`target_delay_ms`)으로 240/320/480/560 ms가 선택 가능합니다. 성능 테스트 결과에 따르면, Audio8 ASR Infinite는 aishell1/test에서 CER 1.750을 기록하여 다른 모델 대비 낮은 오류율을 보였습니다.
이 모델은 Voxtral의 실시간 오디오 아키텍처와 DSM 스타일 스트리밍 방식을 계승했습니다. 주요 구성 요소로는 Causal Audio Tower(Voxtral Realtime 4B)가 있으며, 디코더 및 LM Head에는 Qwen2.5-3B-Instruct가 사용됩니다. 안정적인 운영을 위해서는 Docker Compose를 이용한 배포 경로가 권장되며, 이를 통해 웹 데모 클라이언트와 함께 환경을 구축할 수 있습니다.
용어 풀이
- KV 캐시
- 모델이 앞에서 계산한 값을 저장해 두고 다음 토큰을 만들 때 다시 쓰는 메모리. 입력이 길수록 커져요.