훈련 없는 프롬프트 기반 이미지 편집 네트워크 소개
Refinement Is Inherently Editable: Training-Free Prompt-to-Prompt Image Editing with Generative Refinement Network
arXiv기존 이미지 편집 방식의 배경 손상 및 수정 누락 문제를 해결하기 위해, 'RefineEdit'이라는 훈련 없는(Training-Free) 프롬프트 기반 이미지 편집 시스템이 개발되었습니다.
- 핵심은 생성적 정제 네트워크를 활용하여 이미지 코드를 전역적으로 다듬고, 편집 증거를 지속적으로 재평가함으로써 원본 배경 보존과 수정을 동시에 달성하는 것입니다.
- 추가 학습이나 외부 마스크 없이도 원하는 부분만 정확하게 수정하며 주변 맥락을 유지할 수 있어, 전문적인 콘텐츠 제작에 높은 활용도를 기대할 수 있습니다.
- 편집 안정성을 높이기 위해 적응형 공간 동결 및 유한 비트 잠금 같은 메커니즘을 도입하여, 정교하고 신뢰성 높은 결과물을 제공하는 것이 특징입니다.
기존의 텍스트 안내형(Text-guided) 이미지 편집 방식은 요청된 변경 사항을 도입하는 동시에 원본 콘텐츠와 무관한 영역을 보존해야 하는 과제를 안고 있습니다. 특히 확산 기반 에디터는 공간 제어의 부정확성으로 인해 수정이 불완전하거나 관련 없는 영역이 변형될 수 있으며, 인과적 자기회귀(Causal autoregressive) 에디터는 고정된 디코딩 순서 때문에 초기 결정에 대한 수정이 어렵다는 한계가 있었습니다.
연구진은 이러한 문제를 해결하기 위해 생성적 정제 네트워크(Generative Refinement Network)를 기반으로 하는 훈련 없는 -투-프롬프트 이미지 편집 프레임워크인 RefineEdit을 제안했습니다. 이 방법의 핵심 아이디어는 편집 위치 지정과 콘텐츠 생성을 결합하는 것입니다. 이는 바이너리 이미지 코드를 전역적으로 정제함으로써, 이미지가 발전함에 따라 편집 증거를 지속적으로 재평가할 수 있게 합니다.
RefineEdit은 중간 소스 상태에서 편집 브랜치를 초기화하며, 이 과정에서 발생하는 레이아웃을 재사용합니다. 시스템은 두 개의 브랜치가 동일한 소스 샘플링 비트에 할당하는 확률을 비교하고, 그 부호 차이를 이용해 편집 가능한 위치와 비트를 선택합니다. 선택된 비트는 편집 정제를 따르고 나머지 비트는 진화하는 소스 상태를 복사하며, 적응형 공간 동결과 유한 비트 잠금 메커니즘을 통해 편집 안정성을 유지합니다.
이 프레임워크는 추가적인 훈련, 외부 마스크 또는 어텐션 제어를 필요로 하지 않습니다. PIE-Bench의 아홉 가지 편집 범주에 걸쳐 테스트되었으며, 평가된 다른 방법들 대비 PSNR, LPIPS, MSE, SSIM에서 최고의 배경 보존 점수를 달성했습니다. 또한 전체 이미지 및 편집 영역 CLIP 점수에서도 가장 높은 성능을 기록했습니다.
용어 풀이
- 프롬프트
- AI에게 주는 지시나 질문 글.