Gemini 3.8 TTS: 표현력과 확장성을 갖춘 음성 생성 기술 공개 — AI 생성 일러스트
모델 뉴스공식 자료어제 발표

Gemini 3.8 TTS: 표현력과 확장성을 갖춘 음성 생성 기술 공개

Gemini 3.8 text-to-speech says hello

Hacker News9월 23일 발표 · 3분

구글이 제미나이 3.8 버전의 Flash 및 Flash-Lite TTS 모델을 공개하며, 단순한 음성 생성을 넘어 창의적이고 표현력이 풍부한 오디오 제작 환경을 제공합니다.

세 줄 요약Hacker News 원문 기반
  1. 사용자는 자연어 프롬프트로 독창적인 캐릭터 음성을 만들고, 대본의 각 문장별 연기 지시를 통해 장시간 콘텐츠에서도 화자의 톤과 속도를 정교하게 제어할 수 있습니다.
  2. 이 기술은 게임, 팟캐스트 등 다양한 분야에 적용 가능하며, 100개 이상의 언어와 방언을 지원하여 고품질의 다국어 콘텐츠 제작을 혁신적으로 확장합니다.
  3. 개인 목소리 복제 시 소유자의 명시적 동의가 필수이며, 모든 생성된 오디오에는 출처 확인을 위한 SynthID 워터마킹이 적용되어 투명성을 확보했습니다.

구글은 Gemini 제품군에 두 가지 새로운 텍스트-음성 변환(TTS) 모델인 Gemini 3.8 Flash TTS와 Gemini 3.8 Flash-Lite TTS를 도입했습니다. 이 모델들은 단순한 음성 프리셋을 넘어, 크리에이터와 개발자가 더욱 풍부하고 표현력이 뛰어난 오디오 경험을 만들 수 있도록 합니다. 특히 Flash는 깊이 있는 창의적 연출과 캐릭터 디자인에 초점을 맞추었으며, Flash-Lite는 고용량 및 비용 효율적인 확장에 최적화되어 있습니다.

사용자는 자연어 를 활용하여 역할, 억양 등 세부 특성을 지정해 완전히 새로운 음성을 제작할 수 있으며, 100개 이상의 언어와 방언을 지원합니다. 또한, 대본의 각 문장별로 연기 지시를 하거나 <laughs>, |mhm| 같은 비언어적 신호(backchanneling)를 추가하여 전달력을 정교하게 제어할 수 있습니다. 이 기능은 팟캐스트나 오디오북처럼 장시간 콘텐츠에서도 일관된 음질과 캐릭터의 톤을 유지하는 데 도움을 줍니다.

Gemini 3.8 Flash TTS는 Hume AI의 Voice Design 에서 #1 자리를 차지하며 높은 성능을 입증했습니다. 또한, 모든 생성되는 오디오 클립에는 출처 확인을 위한 SynthID 워터마킹이 적용되어 콘텐츠 투명성을 확보합니다. 개발자들은 Google AI Studio나 Gemini 를 통해 이 기능을 이용할 수 있으며, 기업 고객에게는 향후 Gemini Enterprise를 통해 제공될 예정입니다.

용어 풀이

프롬프트
AI에게 주는 지시나 질문 글.
Benchmark
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
API
프로그램끼리 기능을 주고받는 약속된 창구. AI 모델은 보통 API로 불러 써요.
원문Hacker News · Gemini 3.8 text-to-speech says hello다음 이야기 · 3 / 8유튜브 뮤직, AI 기반 대화형 기능으로 음악 탐색 강화
원문 보기Hacker News