AcFlow: 학습된 흐름으로 이미지 생성 모델 제어
AcFlow: Controlling Text-to-Image Diffusion Transformers via Learned Conditional Activation Flow
arXiv텍스트 기반 이미지 생성 모델(DiT)은 강력하지만, 단순 프롬프트만으로는 스타일이나 특정 개념을 정교하게 제어하기 어렵다는 한계가 있었습니다.
- 연구진은 추론 시간 컨트롤러 'AcFlow'를 개발하여, 학습된 개념 기반 속도장(velocity field)을 통해 이미지 토큰 활성화를 정밀하게 제어합니다.
- AcFlow는 스타일과 콘텐츠의 균형을 최적화할 뿐만 아니라, 기존 방식이 실패했던 다양한 개념까지 성공적으로 억제하는 성능을 입증했습니다.
- 기본 DiT 모델을 고정하고 개념군별로 파라미터를 공유하는 구조 덕분에, 학습하지 않은 새로운 개념에도 높은 일반화 성능을 보여줍니다.
텍스트 기반 이미지 확산 변환기(DiT)는 강력한 이미지 생성 도구이지만, 단순 만으로는 스타일 강도나 특정 개념을 정교하게 제어하는 데 한계가 있었습니다. 연구진은 이러한 문제를 해결하기 위해 AcFlow라는 추론 시간 컨트롤러를 도입했습니다. AcFlow는 기본 DiT 모델을 고정(frozen)한 상태에서 작동하며, 학습된 개념 기반 속도장(velocity field)을 통해 중간 레이어의 이미지- 활성화를 전달하여 제어를 수행합니다.
AcFlow는 텍스트로 지정된 개념 설명을 원하는 개입 지점으로 사용하고, 통합 호라이즌(integration horizon)을 연속적인 제어 로 활용합니다. 이 속도장은 토큰마다 다른 업데이트를 생성하며, 그 방향은 각 토큰의 활성화 상태에 따라 달라지는 적응형 제어 메커니즘으로 작용합니다. 또한, 개념군 내에서 파라미터를 공유하는 구조 덕분에 학습 과정에서 보지 못한 새로운 개념에도 일반화가 가능합니다.
스타일 제어 측면에서 AcFlow는 평가된 기준 모델들 중 높은 스타일 정렬(style-alignment) 영역에서 최적의 스타일 대 콘텐츠 균형을 달성했습니다. 특정 작동 지점에서 AcFlow는 0.5365/0.2860의 스타일-콘텐츠 정렬 값을 기록했으며, 이는 가장 높은 스타일 정렬을 보인 기준 모델의 0.4397/0.2684와 비교됩니다.
용어 풀이
- 프롬프트
- AI에게 주는 지시나 질문 글.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- 매개변수
- 모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.