생성 과정에 직접 최적화하는 확산 모델의 표현 학습 기술 — AI 생성 일러스트AI 일러스트
리서치 연구

생성 과정에 직접 최적화하는 확산 모델의 표현 학습 기술

Representation by Design in Generation: Cross-View Class-Token Alignment in Diffusion Transformers

arXiv9월 30일 발표 · 3분 · 심사 전 논문

확산 모델의 표현 학습을 개선하기 위해, 생성 과정의 부산물로만 사용되던 의미론적 표현 능력을 직접 최적화하는 새로운 방법을 제시했습니다.

세 줄 요약arXiv 원문 기반
  1. 핵심은 이미지의 두 독립적인 관점(cross-view)에서 얻은 정보를 비교하고 클래스 토큰을 정렬하여 모델의 표현력을 극대화한 것입니다.
  2. 이 연구는 표현 학습이 생성 과정에 의존할 필요 없이, 생성과 동등하게 최적화될 수 있음을 입증하며 AI 모델 설계 패러다임의 변화를 예고합니다.
  3. 특정 클래스 토큰만 목표로 설정해도 전체 패치 표현력이 강화되며, 높은 성능 향상에도 불구하고 기존의 우수한 생성 품질을 유지했습니다.

현재 생성(Generative)과 표현 학습(Representation learning)은 비대칭적으로 연결되어 있어, 의미론적 표현이 확산 생성을 개선하는 데 사용되지만, 모델 자체의 표현력은 종종 합성 과정의 부가적인 결과물로 취급되는 경향이 있습니다. 본 연구는 이 단순히 생성 품질을 위한 도구에 머무르지 않고, 강력한 의미론적 표현 능력을 직접 학습하도록 훈련하는 방법을 제시합니다.

이를 위해 DINO 및 iBOT에서 영감을 받아 '교차 뷰 클래스 정렬(cross-view class-token alignment)' 프레임워크를 확장했습니다. 구체적으로, 각 이미지에 대해 두 개의 독립적인 노이즈가 추가된 이중 타임스텝 관측을 생성하고, 한 관측의 학생 클래스 토큰 표현을 다른 관측의 stop-gradient EMA-teacher 목표와 정렬합니다. 이 목적 함수는 기존의 흐름 매칭 및 로컬 패치 목적과 공동으로 최적화됩니다.

이러한 추가적인 표현 학습 목표를 적용한 결과, 모델의 성능 향상이 입증되었습니다. ImageNet 선형 프로빙 정확도는 클래스 토큰 사용 시 9.4%, 평균 풀링된 패치 토큰 사용 시 10.1% 개선되었으며, VOC2012 분할 작업은 3.6 mIoU가 향상되었습니다. 또한, 텍스트-이미지 생성에서 FID 점수는 2.52에서 2.37로 감소하여 우수한 생성 품질을 유지하면서 표현력을 강화했음을 보여줍니다.

본 연구 결과는 모델의 표현 능력이 더 이상 생성 과정의 부산물이나 단순한 개선 도구에 머무를 필요가 없으며, 생성과 동등하게 최적화될 수 있는 1급 기능(first-class capability)으로 직접 설계되어야 함을 시사합니다.

용어 풀이

확산 모델
잡음에서 시작해 조금씩 다듬으며 이미지나 영상을 만들어 내는 생성 모델.
토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
원문arXiv · Representation by Design in Generation: Cross-View Class-Token Alignment in Diffusion Transformers같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv