Gemini 3.8 TTS: 표현력과 확장성을 갖춘 음성 생성 기술 공개
Gemini 3.8 text-to-speech says hello
Hacker News구글이 제미나이 3.8 버전의 Flash 및 Flash-Lite TTS 모델을 공개하며, 단순한 음성 생성을 넘어 창의적이고 표현력이 풍부한 오디오 제작 환경을 제공합니다.
- 사용자는 자연어 프롬프트로 독창적인 캐릭터 음성을 만들고, 대본의 각 문장별 연기 지시를 통해 장시간 콘텐츠에서도 화자의 톤과 속도를 정교하게 제어할 수 있습니다.
- 이 기술은 게임, 팟캐스트 등 다양한 분야에 적용 가능하며, 100개 이상의 언어와 방언을 지원하여 고품질의 다국어 콘텐츠 제작을 혁신적으로 확장합니다.
- 개인 목소리 복제 시 소유자의 명시적 동의가 필수이며, 모든 생성된 오디오에는 출처 확인을 위한 SynthID 워터마킹이 적용되어 투명성을 확보했습니다.
구글은 Gemini 제품군에 두 가지 새로운 텍스트-음성 변환(TTS) 모델인 Gemini 3.8 Flash TTS와 Gemini 3.8 Flash-Lite TTS를 도입했습니다. 이 모델들은 단순한 음성 프리셋을 넘어, 크리에이터와 개발자가 더욱 풍부하고 표현력이 뛰어난 오디오 경험을 만들 수 있도록 합니다. 특히 Flash는 깊이 있는 창의적 연출과 캐릭터 디자인에 초점을 맞추었으며, Flash-Lite는 고용량 및 비용 효율적인 확장에 최적화되어 있습니다.
사용자는 자연어 를 활용하여 역할, 억양 등 세부 특성을 지정해 완전히 새로운 음성을 제작할 수 있으며, 100개 이상의 언어와 방언을 지원합니다. 또한, 대본의 각 문장별로 연기 지시를 하거나 <laughs>, |mhm| 같은 비언어적 신호(backchanneling)를 추가하여 전달력을 정교하게 제어할 수 있습니다. 이 기능은 팟캐스트나 오디오북처럼 장시간 콘텐츠에서도 일관된 음질과 캐릭터의 톤을 유지하는 데 도움을 줍니다.
Gemini 3.8 Flash TTS는 Hume AI의 Voice Design 에서 #1 자리를 차지하며 높은 성능을 입증했습니다. 또한, 모든 생성되는 오디오 클립에는 출처 확인을 위한 SynthID 워터마킹이 적용되어 콘텐츠 투명성을 확보합니다. 개발자들은 Google AI Studio나 Gemini 를 통해 이 기능을 이용할 수 있으며, 기업 고객에게는 향후 Gemini Enterprise를 통해 제공될 예정입니다.
용어 풀이
- 프롬프트
- AI에게 주는 지시나 질문 글.
- Benchmark
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
- API
- 프로그램끼리 기능을 주고받는 약속된 창구. AI 모델은 보통 API로 불러 써요.
