영상 생성의 병목 현상을 해결한 Video DeltaNet 아키텍처 — AI 생성 일러스트AI 일러스트
리서치 연구

영상 생성의 병목 현상을 해결한 Video DeltaNet 아키텍처

Video DeltaNet: A Video-Native Hybrid Attention for Livestream Video Generation

arXiv9월 17일 발표 · 3분 · 심사 전 논문

장시간 영상 생성 시 발생하는 계산 부하를 줄이기 위해, VDN은 로컬 Softmax와 양방향 선형 메모리를 결합한 새로운 아키텍처입니다.

세 줄 요약arXiv 원문 기반
  1. 특히 비디오 간의 상호작용(video-to-video)에 하이브리드 방식을 적용하여, 기존 대비 14.5배 빠른 속도로 고화질 장시간 영상 생성이 가능합니다.
  2. 이 기술은 대규모 모델의 연산 병목 현상을 해소하여, 고화질 장편 영상 생성 및 실시간 스트리밍 서비스 구현에 핵심적인 역할을 할 것으로 기대됩니다.
  3. VDN의 강점은 비디오 간 상호작용에만 선형 메모리를 적용하고, 텍스트/오디오 등 다른 모달리티는 Softmax를 유지하는 유연한 하이브리드 구조입니다.

비디오 은 디노이징 과정에서 긴 시공간 시퀀스를 반복적으로 처리해야 하므로, 어텐션 메커니즘이 주요 계산 병목 지점(computational bottleneck)으로 작용합니다. 이에 Video DeltaNet (VDN)은 로컬 Softmax 어텐션과 양방향 선형 메모리를 결합한 비디오 네이티브 하이브리드 어텐션을 제시했습니다.

VDN의 선형 분기에는 Video Delta Attention (VDA)가 도입되었으며, 이는 프레임당 한 번씩 메모리를 업데이트하며 공간 토큰을 공동으로 통합합니다. 별도의 출력 투영(output projections)과 학습 가능한 게이트를 통해 두 가지 분기를 보정하고, 단계적 교사 정렬 방식(staged teacher-alignment recipe)을 사용하여 사전 훈련된 모델에 새로운 경로를 점진적으로 적용할 수 있습니다.

MiniMax H3에서 VDN을 구현했을 때, 비디오 간 상호작용(video-to-video interactions)에 하이브리드 방식을 적용하고 텍스트나 오디오가 관련된 상호작용에는 Softmax를 유지하는 유연성을 보였습니다. 또한, 최적화된 SGLang 서빙 스택을 통해 VDN-H3는 NVIDIA B200 에서 14.3초 길이의 768p 비디오 디노이징을 6.70초 만에 완료하며, 이는 기존 50단계 밀집 H3 기준 대비 14.5배 향상된 속도입니다.

용어 풀이

확산 모델
잡음에서 시작해 조금씩 다듬으며 이미지나 영상을 만들어 내는 생성 모델.
토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
GPU
많은 계산을 한꺼번에 처리하는 칩. AI 학습과 실행에 가장 많이 써요.
원문arXiv · Video DeltaNet: A Video-Native Hybrid Attention for Livestream Video Generation같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv