로컬 구동형 오디오 제작 툴, VoiceStudio 소개 — AI 생성 일러스트
개발도구 도구

로컬 구동형 오디오 제작 툴, VoiceStudio 소개

debpalash/VoiceStudio

GitHub9월 11일 발표 · 3분

음성 클로닝, 영상 더빙, 받아쓰기 등 전문 오디오 제작 기능을 통합했으며, 16개 TTS 및 11개 ASR 엔진을 활용하여 다양한 콘텐츠를 생성할 수 있습니다.

세 줄 요약GitHub 원문 기반
  1. 가장 큰 특징은 모든 작업이 사용자 로컬 하드웨어에서 구동되어, 별도의 계정이나 API 키 없이도 독립적인 오디오 워크플로우 구축이 가능하다는 점입니다.
  2. 646개 언어 카탈로그와 CUDA, MPS 등 다양한 컴퓨팅 백엔드를 지원하여 전문 콘텐츠 제작자에게 높은 자유도와 확장성을 제공합니다.
  3. 로컬 구동 방식이라 시스템 리소스를 많이 사용하며, 최신 기능은 활성 베타이므로 안정적인 작업 시에는 공식 릴리스 버전을 사용하는 것이 권장됩니다.

VoiceStudio는 음성 클로닝, 영상 더빙, 받아쓰기(Dictation) 등 전문적인 오디오 콘텐츠 제작 기능을 통합한 도구입니다. 이 워크스페이스는 모든 작업이 사용자의 로컬 하드웨어에서 구동되도록 설계되어, 별도의 계정, 키, 구독 또는 사용량 제한 없이 독립적인 오디오 워크플로우 구축을 가능하게 합니다. 주요 기능으로는 음성 클로닝 및 디자인, 영상 더빙, 그리고 장편 오디오북 제작 등이 포함됩니다.

이 시스템은 16개의 TTS 엔진과 11개의 ASR 엔진을 제공하며, 총 646개 언어 카탈로그를 지원합니다. 플랫폼 측면에서는 macOS(Apple Silicon), Windows(x64), Linux(x86_64) 및 Docker 환경을 지원하며, , Apple Silicon MPS/MLX, ROCm 등 다양한 컴퓨팅 백엔드를 활용할 수 있습니다.

사용자는 'From audio' (클로닝), 'By design', 'Convert' 세 개의 탭에서 워크플로우를 시작할 수 있습니다. 예를 들어 음성 클로닝을 수행하려면 깨끗한 음성 샘플(3초 권장, 5~15초가 더 좋음)을 추가하고 텍스트와 언어를 선택한 후 'Generate' 버튼을 누르는 순서로 진행합니다.

설치 시에는 각 플랫폼에 맞는 패키지(macOS DMG, Windows MSI, AppImage 등)를 다운로드하거나 Docker 이미지를 사용하여 실행할 수 있습니다. 특히 macOS의 경우 첫 실행 시 한 번의 우클릭 후 'Open' 승인이 필요하며, Intel Mac은 로컬 Python 백엔드 사용이 불가능하여 원격 백엔드를 사용해야 합니다.

용어 풀이

API
프로그램끼리 기능을 주고받는 약속된 창구. AI 모델은 보통 API로 불러 써요.
CUDA
엔비디아 GPU에서 계산 프로그램을 돌리게 해 주는 개발 플랫폼.
원문GitHub · debpalash/VoiceStudio
원문 보기GitHub