개발도구 도구
로컬에서 구동되는 오픈소스 AI 음성 스튜디오 'Voicebox'
jamiepine/voicebox
GitHubVoicebox는 녹음된 오디오를 이용해 목소리를 복제하고, 23개 언어로 음성을 생성하는 등 모든 기능을 로컬에서 구동하는 오픈소스 AI 음성 스튜디오입니다.
세 줄 요약
- 단순한 TTS나 STT 도구를 넘어, 입력(STT)과 출력(TTS)을 모두 담당하는 통합 음성 I/O 스택을 구축하여 사용자 경험의 완성도를 높였습니다.
- 모든 데이터가 기기 내에서 처리되므로 민감한 정보 처리가 필수적인 환경에서 클라우드 의존도를 낮추고 높은 프라이버시를 보장합니다.
- 다양한 TTS 엔진, 스토리 편집 기능, LLM 기반 페르소나 부여 등 전문적이고 복잡한 워크플로우까지 지원하는 강력한 기능을 갖췄습니다.
Voicebox는 로컬 환경에서 작동하는 AI 음성 스튜디오입니다. 이 도구는 TTS(Text-to-Speech)와 STT(Speech-to-Text)를 모두 처리하는 통합적인 음성 I/O 스택을 구축하여, 클라우드 기반 서비스의 대안으로 기능합니다. 모든 모델과 데이터가 사용자의 기기 내에서만 처리되므로 높은 수준의 프라이버시를 보장하며, 로컬 을 결합해 정교한 처리가 가능합니다.
사용자는 이 스튜디오를 통해 클로닝 방식으로 목소리를 복제할 수 있으며, 영어부터 아랍어까지 23개 언어를 지원합니다. 또한, 전역 단축키를 이용한 음성 입력(STT) 기능과 더불어, -aware 가 사용자가 복제한 목소리로 응답하게 하는 출력 기능을 제공하여 양방향의 음성 상호작용을 구현할 수 있습니다.
다양하고 전문적인 워크플로우를 위해 Qwen3-TTS, LuxTTS 등 7개의 TTS 엔진을 선택적으로 사용할 수 있으며, 피치 시프트, 리버브 등의 후처리 효과(8가지)도 적용 가능합니다. 또한, 스크립트나 긴 기사 같은 콘텐츠는 문장 경계에서 자동 분할 및 크로스페이딩 처리를 거쳐 최대 50,000자까지 끊김 없이 생성하는 기능을 지원합니다.
용어 풀이
- 오픈소스
- 소스 코드를 공개해 누구나 보고 고치고 다시 배포할 수 있게 한 소프트웨어.
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 제로샷
- 예시를 하나도 주지 않고 바로 과제를 시키는 방식.
- MCP
- AI가 외부 도구·데이터와 연결되는 방식을 정한 공개 표준. Anthropic이 처음 공개했어요.
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.