로컬 구동형 오디오 제작 툴, VoiceStudio 소개
debpalash/VoiceStudio
GitHub음성 클로닝, 영상 더빙, 받아쓰기 등 전문 오디오 제작 기능을 통합했으며, 16개 TTS 및 11개 ASR 엔진을 활용하여 다양한 콘텐츠를 생성할 수 있습니다.
- 가장 큰 특징은 모든 작업이 사용자 로컬 하드웨어에서 구동되어, 별도의 계정이나 API 키 없이도 독립적인 오디오 워크플로우 구축이 가능하다는 점입니다.
- 646개 언어 카탈로그와 CUDA, MPS 등 다양한 컴퓨팅 백엔드를 지원하여 전문 콘텐츠 제작자에게 높은 자유도와 확장성을 제공합니다.
- 로컬 구동 방식이라 시스템 리소스를 많이 사용하며, 최신 기능은 활성 베타이므로 안정적인 작업 시에는 공식 릴리스 버전을 사용하는 것이 권장됩니다.
VoiceStudio는 음성 클로닝, 영상 더빙, 받아쓰기(Dictation) 등 전문적인 오디오 콘텐츠 제작 기능을 통합한 도구입니다. 이 워크스페이스는 모든 작업이 사용자의 로컬 하드웨어에서 구동되도록 설계되어, 별도의 계정, 키, 구독 또는 사용량 제한 없이 독립적인 오디오 워크플로우 구축을 가능하게 합니다. 주요 기능으로는 음성 클로닝 및 디자인, 영상 더빙, 그리고 장편 오디오북 제작 등이 포함됩니다.
이 시스템은 16개의 TTS 엔진과 11개의 ASR 엔진을 제공하며, 총 646개 언어 카탈로그를 지원합니다. 플랫폼 측면에서는 macOS(Apple Silicon), Windows(x64), Linux(x86_64) 및 Docker 환경을 지원하며, , Apple Silicon MPS/MLX, ROCm 등 다양한 컴퓨팅 백엔드를 활용할 수 있습니다.
사용자는 'From audio' (클로닝), 'By design', 'Convert' 세 개의 탭에서 워크플로우를 시작할 수 있습니다. 예를 들어 음성 클로닝을 수행하려면 깨끗한 음성 샘플(3초 권장, 5~15초가 더 좋음)을 추가하고 텍스트와 언어를 선택한 후 'Generate' 버튼을 누르는 순서로 진행합니다.
설치 시에는 각 플랫폼에 맞는 패키지(macOS DMG, Windows MSI, AppImage 등)를 다운로드하거나 Docker 이미지를 사용하여 실행할 수 있습니다. 특히 macOS의 경우 첫 실행 시 한 번의 우클릭 후 'Open' 승인이 필요하며, Intel Mac은 로컬 Python 백엔드 사용이 불가능하여 원격 백엔드를 사용해야 합니다.
용어 풀이
- API
- 프로그램끼리 기능을 주고받는 약속된 창구. AI 모델은 보통 API로 불러 써요.
- CUDA
- 엔비디아 GPU에서 계산 프로그램을 돌리게 해 주는 개발 플랫폼.