확산 모델의 탐색 효율성을 높이는 ExploreNet 연구
ExploreNet: Learning Where to Explore in Diffusion GRPO
기존 확산 모델의 RL 방식은 모든 잠재 영역을 균일하게 탐색했지만, 본 연구는 각 잠재 요소가 이미지 생성에 미치는 영향이 다르다는 점에 착안하여 적응형 탐색 분포를 학습한 ExploreNet을 제안했습니다.
생성형 AI 모델의 성능 개선은 단순히 많은 데이터를 활용하는 양적 접근보다, 어느 부분을 집중적으로 탐색할지 결정하는 질적인 전략(탐색 품질)에 달려있다는 것을 보여줘요.
- 이는 생성 AI 모델의 성능 개선이 단순히 많은 데이터를 활용하는 양적 접근보다, 어느 부분을 집중적으로 탐색할지 결정하는 질적인 전략(탐색 품질)에 달려있음을 시사합니다.
- Stable Diffusion 3.5 Medium에서 기존 방식 대비 GenEval2 성능을 14% 향상시켰으며, 인간 선호도 테스트에서도 높은 우위를 기록하며 효과를 입증했습니다.
- ExploreNet은 보상을 관찰하기 이전에 잠재 요소별 노이즈 스케일을 예측하도록 훈련되며, 학습 후에는 추론 과정에 영향을 주지 않도록 설계된 것이 핵심 특징입니다.
기존 그룹 상대 RL 방식(예: Flow-GRPO)은 모든 잠재 영역에 등방성 가우시안 노이즈를 추가하여 디노이징 단계마다 균일하게 탐색하는 방식을 사용했습니다. 하지만 본 연구는 잠재 요소들이 생성 이미지에 미치는 영향의 정도가 다르다는 점에 착안하여, 이러한 차이를 반영한 적응형 탐색 분포를 학습할 수 있는 EXPLORENET을 제안합니다.
EXPLORENET은 보상을 관찰하기 이전에 현재 잠재 값, 디노이징 단계, 그리고 를 기반으로 모든 잠재 요소별 노이즈 스케일을 예측하는 정책입니다. 이는 각 롤아웃 그룹의 보상 분포를 통해 학습되며, 학습 후에는 추론 과정에 영향을 주지 않도록 설계되었습니다.
Stable Diffusion 3.5 Medium 모델에서 EXPLORENET은 기존 Flow-GRPO 대비 GenEval2 성능을 14% 향상시켰으며, 두 개의 독립적인 구성 요소 와 다섯 가지 선호도 및 이미지 품질 모델에서도 효과를 입증했습니다. 전반적으로 그룹 상대 확산 RL 실험 결과, 탐색의 형태가 그 크기보다 중요하며, 롤아웃의 질이 양보다 더 효과적임을 확인했습니다.
용어 풀이
- 프롬프트
- AI에게 주는 지시나 질문 글.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
ExploreNet은 어떻게 탐색의 초점을 맞추나요?
현재 잠재 값, 디노이징 단계, 그리고 프롬프트를 기반으로 모든 잠재 요소별 노이즈 스케일을 예측하는 정책을 사용해요. 이 과정은 보상을 관찰하기 전에 이루어지며 각 롤아웃 그룹의 보상 분포를 통해 학습됩니다.
기존 방식과 비교했을 때 어떤 점이 개선되었나요?
기존 방식은 모든 잠재 영역에 등방성 가우시안 노이즈를 추가하여 디노이징 단계마다 균일하게 탐색했지만, ExploreNet은 각 잠재 요소가 이미지 생성에 미치는 영향의 정도가 다르다는 점을 반영해 적응형 탐색 분포를 학습한다는 것이 핵심이에요.
이 기술을 적용해도 이미지 생성 과정에 문제가 없나요?
ExploreNet은 보상을 관찰하기 이전에 잠재 요소별 노이즈 스케일을 예측하도록 훈련되지만, 학습 후에는 추론 과정에 영향을 주지 않도록 설계되었기 때문에 실제 사용 시 모델의 작동 방식에 변화를 주지 않습니다.