개발도구 도구
마이크로소프트의 화자 분리 스트리밍 음성 인식 모델
microsoft/VibeVoice-ASR-Streaming-7B
Hugging Face마이크로소프트가 화자(Who)와 내용(What)을 실시간으로 추적하는 통합 스트리밍 ASR 모델, VibeVoice를 공개했습니다.
세 줄 요약
- 화자 분리 전사 기능 외에도 사용자 지정 핵심 단어(Hotwords) 기능을 제공하며, 중국어를 포함한 10개 언어를 지원합니다.
- 회의록 작성이나 콜센터 통화 분석 등 복잡한 다자 대화 상황에서 발언자를 구분하고 내용을 정확히 파악하는 데 혁신적입니다.
- 스트리밍 방식으로 작동하며, 깃허브 레포지토리를 통해 코드를 확인할 수 있습니다. 프로젝트는 MIT 라이선스로 공개되어 활용이 용이합니다.
VibeVoice-ASR-Streaming은 누가(Who) 어떤 내용(What)을 말했는지 추적하는 통합 스트리밍 ASR 모델입니다. 이 모델은 음성이 도착함에 따라 발언자를 구분하고 내용을 지속적으로 전사(transcribe)할 수 있는 기능을 제공합니다.
사용자는 도메인별 콘텐츠, 예를 들어 이름이나 기술 용어의 인식을 개선하기 위해 사용자 지정 핵심 단어(Customized Hotwords)를 제공할 수 있습니다. 또한, 중국어, 영어, 프랑스어, 독일어, 이탈리아어, 일본어, 한국어, 포르투갈어, 러시아어, 스페인어를 포함한 총 10개 언어를 지원합니다.
이 프로젝트는 Microsoft Research에서 개발되었으며, 코드는 깃허브 레포지토리(microsoft/VibeVoice)를 통해 확인할 수 있습니다. 사용자는 라이브 플레이그라운드에서도 데모 버전을 이용할 수 있으며, MIT 라이선스로 공개되어 활용이 용이합니다.