생성 과정에 직접 최적화하는 확산 모델의 표현 학습 기술
Representation by Design in Generation: Cross-View Class-Token Alignment in Diffusion Transformers
arXiv확산 모델의 표현 학습을 개선하기 위해, 생성 과정의 부산물로만 사용되던 의미론적 표현 능력을 직접 최적화하는 새로운 방법을 제시했습니다.
- 핵심은 이미지의 두 독립적인 관점(cross-view)에서 얻은 정보를 비교하고 클래스 토큰을 정렬하여 모델의 표현력을 극대화한 것입니다.
- 이 연구는 표현 학습이 생성 과정에 의존할 필요 없이, 생성과 동등하게 최적화될 수 있음을 입증하며 AI 모델 설계 패러다임의 변화를 예고합니다.
- 특정 클래스 토큰만 목표로 설정해도 전체 패치 표현력이 강화되며, 높은 성능 향상에도 불구하고 기존의 우수한 생성 품질을 유지했습니다.
현재 생성(Generative)과 표현 학습(Representation learning)은 비대칭적으로 연결되어 있어, 의미론적 표현이 확산 생성을 개선하는 데 사용되지만, 모델 자체의 표현력은 종종 합성 과정의 부가적인 결과물로 취급되는 경향이 있습니다. 본 연구는 이 단순히 생성 품질을 위한 도구에 머무르지 않고, 강력한 의미론적 표현 능력을 직접 학습하도록 훈련하는 방법을 제시합니다.
이를 위해 DINO 및 iBOT에서 영감을 받아 '교차 뷰 클래스 정렬(cross-view class-token alignment)' 프레임워크를 확장했습니다. 구체적으로, 각 이미지에 대해 두 개의 독립적인 노이즈가 추가된 이중 타임스텝 관측을 생성하고, 한 관측의 학생 클래스 토큰 표현을 다른 관측의 stop-gradient EMA-teacher 목표와 정렬합니다. 이 목적 함수는 기존의 흐름 매칭 및 로컬 패치 목적과 공동으로 최적화됩니다.
이러한 추가적인 표현 학습 목표를 적용한 결과, 모델의 성능 향상이 입증되었습니다. ImageNet 선형 프로빙 정확도는 클래스 토큰 사용 시 9.4%, 평균 풀링된 패치 토큰 사용 시 10.1% 개선되었으며, VOC2012 분할 작업은 3.6 mIoU가 향상되었습니다. 또한, 텍스트-이미지 생성에서 FID 점수는 2.52에서 2.37로 감소하여 우수한 생성 품질을 유지하면서 표현력을 강화했음을 보여줍니다.
본 연구 결과는 모델의 표현 능력이 더 이상 생성 과정의 부산물이나 단순한 개선 도구에 머무를 필요가 없으며, 생성과 동등하게 최적화될 수 있는 1급 기능(first-class capability)으로 직접 설계되어야 함을 시사합니다.
용어 풀이
- 확산 모델
- 잡음에서 시작해 조금씩 다듬으며 이미지나 영상을 만들어 내는 생성 모델.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.