확산 모델의 조건 인식 표현 정규화 기법 'CARE'
CARE: Condition-Aware Representation Regularization for Diffusion Models
arXiv확산 모델의 샘플 품질 향상을 위해 개발된 'CARE'는 기존 방식이 간과했던 조건(레이블, 텍스트 등) 정보를 활용하는 새로운 정규화 기법입니다.
- CARE는 조건 유사성에 따라 특징 분포를 동적으로 조절하여 표현 공간을 안내하며, ImageNet에서 FID 19.08% 감소 등 높은 성능 향상을 입증했습니다.
- 복잡한 정렬 손실이나 외부 감독 없이도 모델의 시각적 충실도와 수렴 안정성을 높여, 고품질 AI 이미지 생성의 효율성과 정확도를 동시에 확보합니다.
- 기존 정규화 방식과 쉽게 통합 가능한 플러그앤플레이 구조를 갖추고 있어 활용도가 높으며, 다양한 조건 기반 작업에 적용 가능합니다.
최근 (Diffusion Models) 분야에서 샘플 품질 향상을 위해 표현 정규화가 중요하게 다루어지고 있습니다. 하지만 기존에 사용되던 정규화 방법들은 생성 목표를 직접적으로 결정하는 조건 정보, 예를 들어 레이블이나 텍스트 등의 내재된 조건을 간과한다는 한계가 있었습니다. 본 연구에서는 이러한 문제를 해결하기 위해 CARE (Condition-Aware Representation regularization)라는 경량의 플러그앤플레이 프레임워크를 제시했습니다.
CARE는 빌트인 조건 신호(built-in conditioning signals)를 활용하여 특징 분포를 동적으로 조절함으로써 표현 공간을 안내합니다. 이 방식은 명시적인 정렬 손실이나 외부 감독에 의존하지 않으면서도, 유사한 조건 간의 특징 클러스터를 더욱 타이트하게 형성하도록 유도하는 것이 핵심입니다. CARE는 기존의 정규화 방법과도 원활하게 통합되어 추가적인 성능 향상을 가져올 수 있습니다.
실험 결과에 따르면, CARE는 ImageNet에서 40만 단계(400k training steps) 학습을 통해 FID를 19.08% 감소시키고 3.5배의 속도 향상을 달성했습니다. 또한 텍스트-이미지 생성 작업에 적용했을 때는 20만 반복(200k iterations) 만에 FID를 16.61% 낮추었으며, 이는 생성된 샘플과 입력된 텍스트 간의 의미론적 정렬을 개선했음을 보여줍니다.
용어 풀이
- 확산 모델
- 잡음에서 시작해 조금씩 다듬으며 이미지나 영상을 만들어 내는 생성 모델.
- 프롬프트
- AI에게 주는 지시나 질문 글.