단일 이미지 생성 모델의 구조적 일관성 개선 방안 (FRPSS) — AI 생성 일러스트AI 일러스트
리서치 연구

단일 이미지 생성 모델의 구조적 일관성 개선 방안 (FRPSS)

FRPSS: Feature Rearrangement in Pre-Shape Space for Single-Image Generation

arXiv9월 16일 발표 · 3분 · 심사 전 논문

단일 이미지 기반 생성 모델이 구조적 일관성과 지역 다양성 균형을 맞추기 어렵다는 문제를 해결하기 위해, 전처리된 형태 공간(Pre-Shape Space)에서 특징을 재배열하는 FRPSS 기법이 제안되었습니다.

세 줄 요약arXiv 원문 기반
  1. FRPSS의 핵심인 'MSR-FAGS' 모듈은 무작위 초기화 대신 재배열된 전처리 특징을 활용하여 이미지 생성 과정을 안내함으로써 구조적 오정렬 위험을 효과적으로 낮춥니다.
  2. 세 가지 데이터셋 모두 최고 수준의 SIFID 점수를 기록하며 우수한 성능을 입증했고, 스타일 변환 등 다양한 후속 작업에서도 높은 범용성을 보여줍니다.
  3. 나아가 응용 분야를 위해 'Scale-adaptive Sliding-window Patch Extraction(SSPE)' 전략과 방향성 언어-이미지 사전 학습 모듈까지 추가하여 활용도를 높였습니다.

단일 이미지를 기반으로 하는 생성 모델은 전역적인 구조적 무결성과 국소적인 다양성을 균형 있게 유지하는 데 어려움을 겪습니다. 기존 방법들은 주로 무작위 노이즈에 의존하여 생성을 진행하며 명시적인 글로벌 구조 제약 조건이 부족하기 때문에, 구조적 변화가 발생할 경우 공간적 구조 오정렬 위험을 내포하고 있습니다. 이러한 문제를 해결하기 위해 전처리된 형태 공간(Pre-Shape Space)에서 특징을 재배열하는 FRPSS 기법이 제안되었습니다.

FRPSS의 핵심 구성 요소는 'Manifold Structural Rearrangement with Feature Augmentation on Geodesic Surface (MSR-FAGS)' 모듈입니다. 이 모듈은 저규모 생성기의 무작위로 초기화된 특징을 재배열된 전처리 형태 특징으로 대체하고, 이를 활용하여 후속 스케일의 이미지 생성을 안내합니다. 이러한 과정을 통해 구조적 오정렬 위험을 효과적으로 줄이는 것이 목표입니다.

나아가 스타일 변환과 같은 다양한 다운스트림 작업을 지원하기 위해 'Scale-adaptive Sliding-window Patch Extraction (SSPE)' 전략이 추가되었으며, SSPE를 활용한 방향성 Contrastive Language-Image Pre-training supervision 모듈(CLIP-SSPE)까지 구축되었습니다. 실험 결과에 따르면 FRPSS는 세 가지 데이터셋 모두에서 최고 수준의 Single Image Fréchet Inception Distance (SIFID) 점수를 달성했으며, 경쟁력 있는 Learned Perceptual Image Patch Similarity (LPIPS)를 유지하는 것으로 확인되었습니다.

원문arXiv · FRPSS: Feature Rearrangement in Pre-Shape Space for Single-Image Generation같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv