토크나이저 없는 다국어 TTS 시스템 VoxCPM2 소개 — AI 생성 일러스트AI 일러스트
개발도구 도구

토크나이저 없는 다국어 TTS 시스템 VoxCPM2 소개

OpenBMB/VoxCPM

GitHub9월 2일 업데이트 · 3분

200만 시간 이상의 데이터를 학습한 VoxCPM2는 토크나이저 없이 연속적인 음성 표현을 생성하는 차세대 TTS 시스템입니다.

세 줄 요약GitHub 원문 기반
  1. 단순 텍스트를 넘어, 자연어 설명 기반의 '음성 디자인'과 감정/속도 제어가 가능한 고정밀 음성 클로닝 기능을 제공합니다.
  2. 48kHz 스튜디오급 고음질 출력과 매우 낮은 실시간 처리 속도(RTF)를 구현하여 전문 미디어 및 상업 콘텐츠 제작에 최적화되었습니다.
  3. Apache 2.0 라이선스로 상업적 사용이 자유로운 오픈 소스이며, 최고 성능을 위해 Nano-vLLM 같은 전용 추론 엔진 활용을 확인하세요.

VoxCPM은 를 사용하지 않는 텍스트-음성 변환(TTS) 시스템으로, 엔드투엔드 확산 자기회귀 아키텍처를 통해 연속적인 음성 표현을 직접 생성합니다. 최신 버전인 VoxCPM2는 20억 개(2B)의 를 사용하며 2백만 시간 이상의 다국어 음성 데이터로 학습되었습니다. 이 모델은 총 30개 언어를 지원하며, 음성 디자인, 제어 가능한 음성 클로닝 기능 등을 제공하고 스튜디오 품질의 48kHz 오디오 출력을 지원합니다.

VoxCPM2는 단순한 TTS를 넘어 다양한 고급 기능을 구현했습니다. 사용자는 자연어 설명만으로 새로운 목소리를 생성하는 '음성 디자인'을 할 수 있으며, 짧은 레퍼런스 클립을 이용해 감정이나 속도 같은 스타일 제어가 가능한 '제어형 클로닝'이 가능합니다. 또한, 참고 오디오와 정확한 스크립트를 모두 제공하여 모든 성대 미묘함(timbre, rhythm, emotion, style)까지 재현하는 궁극의 클로닝 기능도 지원합니다.

실시간 성능과 상업적 활용성 측면에서도 강점을 보입니다. NVIDIA RTX 4090 환경에서 실시간 처리 속도(RTF)가 ~0.13에 달하며, 이는 표준 PyTorch 구현 시의 ~0.3보다 낮은 수치입니다. 모델 와 코드는 Apache-2.0 라이선스로 공개되어 상업적 사용이 자유로우며, 고처리량 서비스 제공을 위해 Nano-vLLM과 같은 전용 추론 엔진 활용이 권장됩니다.

용어 풀이

토크나이저
글을 모델이 처리할 토큰으로 잘라 주는 도구.
파라미터
모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
가중치
학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
원문GitHub · OpenBMB/VoxCPM같은 주제 가이드 · 바로 써 보기오류가 나면 터미널 출력째 묻기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기GitHub