AI 언어 기술, 텍스트를 넘어 인간의 소통까지 이해하다
AI for everyone in every language
Google AIAI 기술을 단순한 텍스트 번역 수준을 넘어, 사람의 감정, 억양, 문맥까지 이해하는 '음성 지능'으로 확장하여 언어 장벽 해소에 집중하고 있습니다.
- Gemini 3.5 Live Translate는 실시간 대화 번역을 지원하며, 범용 음성 모델은 데이터가 부족한 전 세계 1,000개 언어까지 지식을 확장하는 데 활용됩니다.
- 지역 사회와의 협력을 통해 소외된 언어 데이터를 확보하고, 수화 통역 등 접근성을 고려하여 기술의 포용성과 깊이를 높이고 있습니다.
- 오프라인 환경을 위한 경량 모델(TranslateGemma)과 저사양 피처폰용 음성 AI 비서 지원으로 전 세계적인 기술 접근성의 격차를 해소하고 있습니다.
기술은 단순한 텍스트 번역을 넘어 사람들의 실제 의사소통 방식, 즉 어조, 속도, 감정, 문맥 등을 포착하는 방향으로 발전하고 있습니다. 과거에는 오디오를 텍스트로 변환한 후 다시 음성으로 합성하는 단계를 거쳤으나, 현재는 Gemini와 같은 모델이 오디오 자체를 직접 처리하며 소리와 의도를 동시에 파악합니다. 이를 통해 Gemini 3.5 Live Translate는 실시간 대화 번역을 70개 언어에서 지원하고, 코드 스위칭이나 감정적 신호까지 자연스럽게 포착할 수 있습니다.
AI의 언어 장벽 해소 목표는 전 세계 1,000개 언어를 지원하는 것입니다. 데이터가 부족한 언어에 대한 이해도를 높이기 위해 범용 음성 모델은 12백만 시간의 오디오 데이터를 기반으로 교차 언어 전이 학습(cross-lingual transfer learning) 기법을 활용합니다. 또한, 웹상의 편향성을 극복하기 위해 지역 사회와의 협력이 중요해졌으며, WAXAL 프로젝트는 27개 사하라 이남 아프리카 언어를 포괄하는 대규모 오픈 음성 데이터셋을 구축했습니다.
기술의 접근성을 높이기 위한 노력도 병행되고 있습니다. 인터넷 연결이 불안정한 환경을 위해 Gemini 기반의 경량 번역 모델인 TranslateGemma를 개발하여 기기 구동을 가능하게 했습니다. 또한, 저사양 피처폰 사용자들을 위해 음성 AI 비서가 표준 휴대폰에서도 작동하도록 지원하고 있습니다. 더 나아가 수화 통역의 경우, 50개 이상의 수어 언어를 학습한 Sign Language-to-Text (SL2T) 기술을 통해 접근성을 높이고 있습니다.
용어 풀이
- 온디바이스
- 서버를 거치지 않고 휴대폰이나 PC 안에서 직접 돌아가는 AI.
