LLM 기반 인과성 인식 실시간 음성 번역 프레임워크 제안
All In Good Time: Causality-Aware Framework for LLM-Based Simultaneous Speech-to-Speech Translation
arXiv대규모 언어 모델(LLM)을 활용한 실시간 음성-음성 번역은 데이터 부족과 화자 고정성을 유지하는 것이 핵심 기술적 과제였습니다.
- 연구진은 '인과성 인식' 기반의 FAST-CAP 프레임워크를 제안하여, 기존 방식 대비 품질 저하 없이 지연 시간을 획기적으로 줄이는 데 성공했습니다.
- 이 기술은 적은 학습 데이터만으로도 최고 수준의 번역 품질과 화자 고정성을 유지하며, 실시간 글로벌 소통 환경에 혁신적인 변화를 가져올 잠재력을 가집니다.
- 스페인어, 독일어, 프랑스어 등 다국어 실험을 통해 검증되었으며, 기존 방식 대비 높은 번역 품질과 낮은 지연 시간을 동시에 입증했습니다.
(LLMs)은 저자원 오프라인 번역에서 강력한 성능을 보였으나, 동시 음성-음성 번역(Simul-S2ST)으로 확장하는 것은 여전히 어려운 과제입니다. 이는 높은 교차 언어 화자 충실도를 가진 인과적으로 정렬된 훈련 데이터의 부족 때문이며, 기존 접근 방식들은 고정된 번역 정책이나 신뢰도 휴리스틱에 의존하여 최적화되지 않은 품질과 높은 지연 시간을 초래했습니다.
연구진은 이러한 문제를 해결하기 위해 '인과성 인식(causality-aware)' 기반의 Simul-S2ST 프레임워크를 제안했습니다. 이 프레임워크는 새로운 데이터 파이프라인을 도입하여 고충실도 및 인과적으로 정렬된 세그먼트를 생성하며, (i) 분해된 S2ST 아키텍처(FAST), (ii) 인과성 인식 적응 정책(CAP), 그리고 (iii) 인과성 인식 지연 시간 측정 기준을 포함합니다.
CVSS 스페인어, 독일어, 프랑스어를 대상으로 한 실험 결과에 따르면, FAST-CAP은 고정된 정책 대비 품질-지연 시간 트레이드오프를 지속적으로 개선했습니다. 이는 최대 +1.2 BLEU의 성능 향상과 26%의 상대적 지연 시간 감소를 달성했으며, 기존 시스템보다 훨씬 적은 학습 데이터만 사용했음에도 불구하고 최고 수준의 번역 품질과 화자 충실도를 유지하며 최대 38.8%의 상대적 지연 시간 감소율을 보였습니다.
용어 풀이
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.