제미나이 3.8 모델 공개: 실시간 음성 에이전트 기능 강화 — AI 생성 일러스트
기업·산업 뉴스

제미나이 3.8 모델 공개: 실시간 음성 에이전트 기능 강화

Gemini 3.8 Live and 3.8 Live Extended Thinking

Hacker News9월 15일 발표 · 3분

구글이 실시간 대화 및 음성 에이전트 기능을 강화한 두 가지 모델, Gemini 3.8 Live와 Extended Thinking을 공개하며 AI 상호작용의 새로운 기준을 제시했습니다.

세 줄 요약Hacker News 원문 기반
  1. Gemini 3.8 Live는 비용 효율적인 대규모 사용과 시각 정보 처리에 강점을 보이며, Extended Thinking은 복잡한 다단계 추론 및 엔터프라이즈급 작업 완료 능력을 제공합니다.
  2. 이 모델들은 사용자가 음성만으로도 복잡한 작업을 수행하게 하며, Google Workspace나 검색 등 다양한 환경에서 더욱 직관적이고 협업적인 AI 경험을 가능케 합니다.
  3. 개발자들은 Gemini Live API를 통해 이 강력한 기능을 구현할 수 있으며, 모든 생성 오디오는 허위 정보 방지를 위해 SynthID 워터마크가 적용됩니다.

구글은 실시간 추론 기능을 대폭 개선한 두 가지 신규 모델, Gemini 3.8 Live와 Gemini 3.8 Live Extended Thinking을 발표했습니다. 이 모델들은 음성 를 효과적으로 구현하고 AI와의 대화를 더욱 직관적이고 지능적으로 만드는 것을 목표로 합니다. Gemini 3.8 Live는 확장성과 비용 효율성에 중점을 두어 설계되었으며, 반면 Gemini 3.8 Live Extended Thinking은 높은 복잡도의 작업을 처리하기 위해 강화된 다단계 추론 능력을 제공합니다.

성능 면에서 Gemini 3.8 Live Extended Thinking은 엔터프라이즈급 작업 완료 능력과 지능을 보여주며, Artificial Analysis의 Speech to Speech Quality Index에서 82.6점을 기록했습니다. 또한 Big Bench Audio에서는 97.7%를 달성하는 등 강력한 추론 능력을 입증했습니다. Gemini 3.8 Live는 비용 효율성을 유지하면서도 높은 사용자 선호도를 보여주며, Speech Agent Arena에서 2위를 차지했습니다.

Gemini 3.8 Live는 시각적 입력을 근접 실시간으로 처리하여 대화에 맥락을 더하며, 대화 도중 자동으로 감지하고 97개 지원 언어 간 전환이 가능합니다. 또한 사용자가 요청하는 동안 백그라운드에서 도구 및 호출을 실행할 수 있습니다. 개발자들은 Gemini Live API를 활용해 Agora, LangChain 등 다양한 플랫폼을 통해 고성능의 음성 기반 인터페이스를 구축할 수 있습니다.

모든 AI 생성 오디오는 허위 정보 방지를 위해 SynthID 가 적용됩니다. 이 모델들은 Gemini 앱, Google Workspace, Search와 같은 환경에서 사용자의 가장 복잡한 작업을 처리하는 데 도움을 주며, 개발자 및 기업 고객 모두에게 생산 준비가 된 음성 에이전트의 기반을 제공합니다.

용어 풀이

에이전트
목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
API
프로그램끼리 기능을 주고받는 약속된 창구. AI 모델은 보통 API로 불러 써요.
워터마크
AI가 만든 글이나 이미지에 눈에 잘 띄지 않게 넣는 식별 표시.
원문Hacker News · Gemini 3.8 Live and 3.8 Live Extended Thinking
원문 보기Hacker News