스트리밍 멀티모달 디코더를 위한 대역폭 제어 기술
Reading Less While Writing: A Closed-Form Bandwidth Dial for Streaming Multimodal Decoders
arXiv기존의 영상/음성 기반 텍스트 변환기는 전체 입력을 처리한 후에만 출력이 가능했지만, ZENDAYA는 실시간 스트리밍 환경에 최적화된 새로운 스케줄링 방식을 제시합니다.
- 단일 연속 매개변수 $\gamma$를 도입하여 오프라인과 실시간 디코딩을 하나의 모델군으로 통합했으며, 소스 입력 의존성을 구조적으로 보장하는 것이 핵심입니다.
- 실험 결과, 오히려 소스를 적게 보는 것이 더 좋은 텍스트를 생성하며, 특히 지연 시간이 중요한 라이브 자막 등에서 성능 향상을 입증했습니다.
- 이 기술은 소스 소비 비율을 하나의 매개변수로 해석할 수 있어(Latency Dial), 시스템의 처리 지연 시간과 자원 배분을 정밀하게 제어하는 장점을 제공합니다.
기존의 영상 또는 음성 기반 텍스트 변환기는 일반적으로 전체 입력 데이터를 소비한 후에야 단어를 출력하는 방식이었습니다. 이는 오프라인 환경에서는 과도할 수 있으며, 실시간 스트리밍 환경에서는 아예 불가능합니다. 기존 시스템들은 보통 'wait-$k$'와 같은 고정 규칙을 적용하여, 입력의 길이나 속도에 관계없이 일정 횟수의 을 기다리는 방식을 사용했습니다.
제안된 ZENDAYA는 이러한 고정 오프셋 방식 대신 단일 연속 $\gamma$로 제어되는 스케줄링 방식을 도입합니다. 이 방식은 가시적인 소스 접두사(visible source prefix)를 생성 진행도와 입력의 예측 길이에 따른 폐쇄형 함수로 만듭니다. 이는 일반적인 오프라인 디코더와 실시간 스트리밍 디코더가 별개의 모델이 아닌 하나의 계열에 속하게 하며, $\gamma$는 소스 소비 비율을 나타내는 지연 시간 조절기(latency dial) 역할을 합니다.
실험 결과에 따르면, 오히려 소스를 적게 보는 것이 더 좋은 텍스트를 생성하는 것으로 확인되었습니다. 이는 과도한 소스의 유입이 모델의 주의력을 분산시키기 때문입니다. Charades-STA, ActivityNet Captions, LibriHeavy 세 가지 코퍼스에서 테스트된 29M 매개변수의 디코더는 고정 스케줄을 능가하거나 동등한 성능을 보였으며, 특히 지연 시간이 낮은 환경에서 가장 큰 개선 효과를 나타냈습니다.
용어 풀이
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- 매개변수
- 모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.