FLUX 3 Image: 바운딩 박스로 이미지 구조를 제어하는 기술
FLUX 3 Image
블랙 포레스트 랩스가 이미지 생성 모델 FLUX 3 Image를 공개했습니다. 이 모델은 사용자가 바운딩 박스를 이용해 각 요소를 배치하고, 이를 기반으로 전체 장면을 구성하거나 수정할 수 있습니다.
이 모델은 단순한 텍스트 설명만으로는 어려웠던, 요소 간의 관계가 중요한 복잡하고 구조적인 이미지를 정교하게 만들고 편집할 수 있게 해줘요.
- 단순한 프롬프트를 넘어 개별 요소(바운딩 박스)를 지정해 이미지를 생성하며, 편집 시에도 건드리지 않은 부분은 완벽하게 유지하는 '픽셀 단위 편집'이 가능합니다.
- 요소 간 관계가 중요한 포스터, 콜라주, 복잡한 장면 등 전문적인 시각 콘텐츠 제작에 혁신적입니다. 기존 AI의 구도 및 구성 한계를 극복했습니다.
- 상업적 라이선스로 제공되며, 정확하고 정교한 이미지를 위해서는 사용자가 요소별 바운딩 박스를 활용하여 이미지의 구조를 제어하는 것이 핵심 기술입니다.
FLUX 3 Image는 블랙 포레스트 랩스의 모델 중 이미지 생성 및 편집을 담당하는 부분이다. 이 모델은 사용자가 원하는 모든 요소를 캔버스에 바운딩 박스로 배치하고, 이를 기반으로 전체 장면을 구성하거나 수정할 수 있게 한다. 요소가 중요한 역할을 하는 복잡한 구도나 콜라주 등 전문적인 시각 콘텐츠 제작에 활용 가능하다.
이미지를 생성하기 위해서는 '레이아웃 '라는 구조화된 입력이 필요하다. 이는 전반적인 내용을 설명하는 글로벌 캡션과 함께, 각 요소의 ID, 바운딩 박스(JSON 배열), 그리고 상세 설명을 담은 요소 테이블로 구성된다. 이 방식을 통해 모델은 개별 요소 간의 관계를 이해하고 이미지를 생성한다.
이 모델은 높은 수준의 편집 제어 기능을 제공한다. 사용자가 특정 요소를 재설명하거나 다른 것으로 대체해도, 건드리지 않은 나머지 부분은 정확하게 유지되어 여러 번의 수정에도 이미지의 일관성을 유지할 수 있다. 또한, 가 단순한 지침만으로도 레이아웃을 계획하고 요소 테이블을 작성해준다.
FLUX 3 Image는 상업적 라이선스로 제공되며 대규모 이미지 생성에 활용 가능하다. 특히 여러 부분이 엄격한 관계를 가지거나 패널 그리드, 콜라주처럼 구성된 복잡한 장면을 만들 때 그 강점을 발휘한다.
용어 풀이
- 멀티모달
- 글뿐 아니라 이미지·음성·영상처럼 여러 형태의 입력을 함께 다루는 것.
- 프롬프트
- AI에게 주는 지시나 질문 글.
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
이미지 생성 시 구체적으로 어떻게 구조를 제어하나요?
사용자는 원하는 모든 요소를 캔버스에 바운딩 박스로 배치하고, 이를 기반으로 전체 장면을 구성하거나 수정할 수 있어요. 이미지를 생성하려면 전반적인 내용을 설명하는 글로벌 캡션과 함께 각 요소의 ID, 바운딩 박스, 상세 설명을 담은 '레이아웃 프롬프트'라는 구조화된 입력이 필요해요.
이미지를 수정할 때 어떤 장점이 있나요?
사용자가 특정 요소를 재설명하거나 대체하더라도, 건드리지 않은 나머지 부분은 정확하게 유지되어 여러 번의 수정에도 이미지의 일관성을 지킬 수 있어요. 또한 에이전트가 단순한 지침만으로도 레이아웃 계획과 요소 테이블 작성이 가능해요.
이 모델이 특히 강점을 보이는 이미지 유형은 무엇인가요?
요소 간의 관계가 중요한 포스터나 콜라주처럼 복잡한 구도를 가진 전문적인 시각 콘텐츠 제작에 활용할 수 있어요. 여러 부분이 엄격한 관계를 가지거나 패널 그리드 형태로 구성된 대규모 장면을 만들 때 강점을 발휘해요.