동시 통역의 지연 문제를 해결하는 LLM 기반 접근법 — AI 생성 일러스트AI 일러스트
리서치 연구

동시 통역의 지연 문제를 해결하는 LLM 기반 접근법

Dynamic Lagging for Simultaneous Translation

arXiv9월 9일 발표 · 2분 · 심사 전 논문

실시간 동시 통역 시스템의 지연 및 불안정성 문제를 해결하기 위해, 소스 입력 접두사(prefix)를 인식하는 LLM 기반 접근법을 제안합니다.

세 줄 요약arXiv 원문 기반
  1. 안정적인 접두사를 활용하여 모델을 미세 조정하고, 단일 디코딩 과정에서 번역 결과를 지속적으로 전진시켜 시스템의 깜빡임 현상을 근본적으로 제거했습니다.
  2. 복잡한 지연 제어 방식 대신, 단순한 신뢰도 임계값 설정만으로 우수한 품질과 낮은 지연 시간을 동시에 달성하는 효율성을 입증했습니다.
  3. 이 기술은 실시간 음성 번역 서비스의 신뢰도를 혁신적으로 개선하며, 고품질의 끊김 없는 언어 통역 구현에 중요한 진전을 의미합니다.

기존의 캐스케이드 동시 음성 번역 시스템에서 기계 번역(MT) 시스템은 상위 인식기가 읽고 쓰는 스케줄을 제어하기 어렵다는 문제가 있습니다. 본 연구는 이러한 문제를 해결하기 위해, 안정적인 접두사(stable prefixes)와 전체 문장 쌍으로 을 하여 전처리된(prefix-aware) 모델을 구축했습니다.

이 시스템은 단일 강제 디코딩 턴(single force-decode turn)을 통해 이미 확정된 목표 텍스트를 유지하며 소스 입력이 도착함에 따라 지속적으로 전진시키기 때문에, 구조적으로 깜빡임 현상 없이 작동합니다. 연구팀은 Qwen3-8B 모델을 EN에서 DE, JA, ZH로 미세 조정했으며, 참조 트랜스크립트 접두사를 사용하여 소스 스트림을 시뮬레이션했습니다.

이러한 전처리 과정은 전체 문장의 품질을 유지하면서도 최악의 위치에서의 청크 품질을 개선하고, 단위 커밋 신뢰도의 보정(calibration) 능력을 향상시킵니다. 비교된 세 가지 지연 제어 방식 중 단일 훈련 불필요 임계값 설정이 가장 효과적이었으며, 이는 FLEURS, WMT24++, CoVoST~2 테스트 세트에서 COMET 및 MetricX를 통해 검증되었습니다.

용어 풀이

LLM
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
미세 조정
이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.
토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
원문arXiv · Dynamic Lagging for Simultaneous Translation같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv