텍스트-이미지 확산 모델의 만족도와 다양성 탐색
Traversing the Satisfaction-Diversity Frontier in Text-to-Image Diffusion
arXiv텍스트를 이용해 이미지를 생성할 때, 단순히 높은 품질만 추구하는 것이 아니라 충분한 다양성을 갖추는 것이 핵심 과제입니다.
텍스트로 이미지를 만들 때, 단순히 품질이 높은 이미지뿐만 아니라 사용자에게 다양한 선택지를 제공하는 것이 중요해요.
- 연구진은 이미지 생성을 '만족성-다양성'이라는 두 가지 기준을 모두 충족시키는 방식으로 정의하고, 이를 위한 새로운 기법 SatisDive를 제안했습니다.
- 이 방법은 개별 후보 이미지의 품질(만족도)과 전체 결과물의 다양성을 동시에 끌어올려 사용자에게 훨씬 더 풍부한 선택지를 제공합니다.
- 핵심 원리는 '최소 만족도 하한선'과 '다양성 임계치'라는 두 가지 조건을 설정하고, 이 경계를 탐색하여 최적의 이미지 후보군을 찾아내는 것입니다.
텍스트를 이용한 이미지 생성(Text-to-image generation)은 사용자에게 동일한 로 여러 이미지를 탐색할 수 있는 기회를 제공합니다. 이러한 결과물이 유용하려면, 각 이미지는 학습된 보상 점수(reward)로 측정되는 사용자의 선호도를 반영해야 하며 동시에 시각적으로 차이를 가져 다양성을 유지해야 합니다. 기존 방법들은 이 두 가지 요소를 개별적으로 다루거나 단일 집계 점수로 결합하는 데 그쳐 한계가 있었습니다.
본 연구는 이미지 생성을 '만족성-다양성(satisficing)' 문제로 정의하며, 모든 후보 이미지가 특정 보상 하한선(reward floor)을 충족하고 배치 전체가 다양성 임계치(diversity cutoff)를 만족해야 한다고 제안합니다. 이러한 조건을 통해 파레토 프론티어를 정의할 수 있으며, 이를 탐색하기 위해 훈련이 필요 없는 추론 시간 기법인 SatisDive를 도입했습니다.
SatisDive는 배치 상대 보상 절단점(batch-relative reward cutoff)을 사용하여 낮은 보상의 후보 이미지에는 개선에 중점을 두고, 높은 보상의 후보 이미지들 사이의 다양성에 중점을 두어 작동합니다. 실험 결과, SatisDive는 FLUX.1-dev와 HPSv3를 사용했을 때 기존 FK steering 방식 대비 최악의 후보 이미지 보상을 최대 0.43까지 향상시켰으며, SANA-1.6B와 ImageReward 조합에서는 최대 0.70까지 개선하는 것으로 나타났습니다.
용어 풀이
- 프롬프트
- AI에게 주는 지시나 질문 글.
이미지 생성에서 '만족성'과 '다양성'은 어떻게 정의되나요?
모든 후보 이미지가 특정 보상 하한선을 충족해야 하고, 동시에 전체 배치 결과물이 다양성 임계치를 만족해야 해요. 이러한 조건을 통해 파레토 프론티어를 정의할 수 있어요.
SatisDive는 어떤 원리로 이미지 후보군을 찾나요?
배치 상대 보상 절단점을 사용해요. 낮은 보상의 후보 이미지는 개선에 중점을 두고, 높은 보상을 가진 이미지들 사이의 다양성을 높이는 방식으로 작동합니다.
SatisDive를 적용했을 때 어떤 성능 향상이 있었나요?
기존 방식과 비교하여 최악의 후보 이미지 보상을 최대 0.43까지, 특정 조합에서는 최대 0.70까지 개선하는 것으로 나타났어요.