로컬에서 구동되는 오픈소스 AI 음성 스튜디오 'Voicebox' — AI 생성 일러스트AI 일러스트
개발도구 도구

로컬에서 구동되는 오픈소스 AI 음성 스튜디오 'Voicebox'

jamiepine/voicebox

GitHub8월 9일 업데이트 · 2분

Voicebox는 녹음된 오디오를 이용해 목소리를 복제하고, 23개 언어로 음성을 생성하는 등 모든 기능을 로컬에서 구동하는 오픈소스 AI 음성 스튜디오입니다.

세 줄 요약GitHub 원문 기반
  1. 단순한 TTS나 STT 도구를 넘어, 입력(STT)과 출력(TTS)을 모두 담당하는 통합 음성 I/O 스택을 구축하여 사용자 경험의 완성도를 높였습니다.
  2. 모든 데이터가 기기 내에서 처리되므로 민감한 정보 처리가 필수적인 환경에서 클라우드 의존도를 낮추고 높은 프라이버시를 보장합니다.
  3. 다양한 TTS 엔진, 스토리 편집 기능, LLM 기반 페르소나 부여 등 전문적이고 복잡한 워크플로우까지 지원하는 강력한 기능을 갖췄습니다.

Voicebox는 로컬 환경에서 작동하는 AI 음성 스튜디오입니다. 이 도구는 TTS(Text-to-Speech)와 STT(Speech-to-Text)를 모두 처리하는 통합적인 음성 I/O 스택을 구축하여, 클라우드 기반 서비스의 대안으로 기능합니다. 모든 모델과 데이터가 사용자의 기기 내에서만 처리되므로 높은 수준의 프라이버시를 보장하며, 로컬 을 결합해 정교한 처리가 가능합니다.

사용자는 이 스튜디오를 통해 클로닝 방식으로 목소리를 복제할 수 있으며, 영어부터 아랍어까지 23개 언어를 지원합니다. 또한, 전역 단축키를 이용한 음성 입력(STT) 기능과 더불어, -aware 가 사용자가 복제한 목소리로 응답하게 하는 출력 기능을 제공하여 양방향의 음성 상호작용을 구현할 수 있습니다.

다양하고 전문적인 워크플로우를 위해 Qwen3-TTS, LuxTTS 등 7개의 TTS 엔진을 선택적으로 사용할 수 있으며, 피치 시프트, 리버브 등의 후처리 효과(8가지)도 적용 가능합니다. 또한, 스크립트나 긴 기사 같은 콘텐츠는 문장 경계에서 자동 분할 및 크로스페이딩 처리를 거쳐 최대 50,000자까지 끊김 없이 생성하는 기능을 지원합니다.

용어 풀이

오픈소스
소스 코드를 공개해 누구나 보고 고치고 다시 배포할 수 있게 한 소프트웨어.
LLM
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
제로샷
예시를 하나도 주지 않고 바로 과제를 시키는 방식.
MCP
AI가 외부 도구·데이터와 연결되는 방식을 정한 공개 표준. Anthropic이 처음 공개했어요.
에이전트
목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
원문GitHub · jamiepine/voicebox같은 주제 가이드 · 바로 써 보기오류가 나면 터미널 출력째 묻기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기