비디오 확산 모델의 시간적 주의 집중 패턴 분석
Temporal-Attention Head Specialization During Video Diffusion Training
arXiv비디오 확산 트랜스포머가 프레임 간 정보를 어떻게 처리하는지 이해하기 위해, 연구진은 학습 과정 중 개별 시간적 주의(temporal-attention) 헤드의 변화를 추적했습니다.
- 전체적인 평균 주의력은 평탄하거나 감소하지만, 극소수의 특정 헤드들이 시간적 블록 단위로만 뚜렷하게 정보를 집중시키는 특이점(Specialization)을 보였습니다.
- 이는 모델이 전역적인 연결보다는 '자체 프레임'이나 '인접 블록' 같은 국지적 모티프를 반복적으로 활용하여 영상을 생성함을 시사합니다.
- 다만, 이러한 헤드의 특화가 영상 품질 개선의 직접적인 인과관계는 아니며, 다른 모델 분석에 적용 가능한 새로운 방법론을 제시했다는 점이 핵심입니다.
영상 확산 는 프레임 간 정보를 조정하기 위해 시간적 어텐션(temporal attention)에 의존하지만, 이 메커니즘이 훈련 과정 중 언제, 어디서 구조를 형성하는지에 대한 이해가 부족했습니다. 연구진은 이러한 문제를 해결하기 위해 세 가지 모델 규모(306M에서 1.03B 까지)에 걸쳐 총 아홉 번의 Open-Sora STDiT 훈련 과정을 대상으로 체크포인트별 시간적 어텐션 헤드 전수 조사를 수행했습니다.
분석 결과, 전체적인 평균 주의력 집중도(CFAC)는 평탄하거나 감소하는 경향을 보였으나, 극소수의 특정 헤드가 두드러진 집중도를 보이는 특이점(Specialization)이 발견되었습니다. 이 특화된 헤드는 전체의 약 4~13%를 차지하며, 그 신호가 위치적으로 재현 가능하지만 블록 단위로 나타나는 경향을 보였습니다.
분석된 760M개의 선택적 헤드들은 전역적인 연결보다는 '자체 프레임 대각선'이나 '인접 프레임 밴드'와 같은 국지적인 프레임 라우팅 모티프(local frame-routing motifs)로 수렴하는 경향을 보였습니다. 다만, 이러한 특화된 헤드가 생성되는 비디오 품질 개선과 직접적인 인과관계는 확립되지 않았습니다.
본 연구의 핵심 기여는 이 STDiT 계열 모델에 국한되지 않습니다. 체크포인트별, 개별 헤드 분석을 고정된 선택 규칙 하에 수행하는 방법론은 다른 분해형 비디오 확산 트랜스포머나 결합된 시공간 아키텍처에서도 시간적 조직화를 밝혀내는 데 활용될 수 있습니다.
용어 풀이
- 트랜스포머
- 오늘날 대부분의 언어 모델이 쓰는 신경망 구조. 문장 속 단어들의 관계를 한꺼번에 계산해요.
- 파라미터
- 모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.