Qwen의 통합 이미지 생성 및 편집 모델 'Qwen-Image-2.1' 공개 — AI 생성 일러스트AI 일러스트
개발도구 뉴스

Qwen의 통합 이미지 생성 및 편집 모델 'Qwen-Image-2.1' 공개

QwenLM/Qwen-Image-2.1

GitHub9월 20일 업데이트 · 2분

Qwen이 텍스트를 이용해 이미지를 생성하고 기존 사진을 수정하는 기능을 하나로 통합한 'Qwen-Image-2.1' 모델을 오픈소스로 공개했습니다.

세 줄 요약GitHub 원문 기반
  1. 시각 생성 부품은 7B 파라미터로 효율성을 높였으며, 투명 배경(RGBA) 이미지 생성과 최대 10장의 레퍼런스 이미지를 활용하는 전문적인 편집 기능이 핵심입니다.
  2. 단순한 생성을 넘어 투명도 처리나 다중 요소 합성 등 전문가급의 복잡한 이미지 편집 기능을 제공하여 활용 범위가 크게 확장되었습니다.
  3. 최적의 결과물을 얻으려면 전용 프롬프트 리라이팅 모델을 사용하고, 대규모 처리는 vLLM 같은 고성능 서빙 환경에서 진행하는 것이 권장됩니다.

Qwen은 텍스트를 이용한 이미지 생성과 기존 사진을 수정하는 기능을 하나로 통합한 'Qwen-Image-2.1' 모델을 로 공개했습니다. 이 모델은 시각 생성 컴포넌트가 7B 로 구성되어, 높은 생성 품질과 추론 효율성 및 범용성을 동시에 갖추도록 설계되었습니다.

이 버전에서는 네 가지 주요 개선 사항이 특징입니다. 첫째, 혼합 정밀도 어텐션(mixed-granularity attention)을 통해 낮은 계산 비용으로 우수한 이미지 품질을 제공합니다. 둘째, 텍스트만으로 일반 또는 투명 배경(RGBA) 이미지를 생성하고, 투명 레이어를 편집하거나 사진에서 피사체를 추출하는 등 통합적인 기능을 지원합니다. 또한 최대 10장의 레퍼런스 이미지를 활용한 다중 주체 합성 및 원본의 정체성 보존이 가능합니다.

최적의 결과물을 얻기 위해서는 전용 리라이팅 모델을 사용하는 것이 권장됩니다. 이 모델은 짧은 프롬프트를 상세하고 고품질의 설명으로 확장해줍니다. 대규모 서비스 환경에서는 vLLM-Omni와 같은 고성능 서빙 솔루션을 통해 프리픽스 KV 캐싱, Graph 디코드 등을 활용하여 효율적인 추론이 가능합니다.

용어 풀이

오픈소스
소스 코드를 공개해 누구나 보고 고치고 다시 배포할 수 있게 한 소프트웨어.
파라미터
모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
프롬프트
AI에게 주는 지시나 질문 글.
CUDA
엔비디아 GPU에서 계산 프로그램을 돌리게 해 주는 개발 플랫폼.
원문GitHub · QwenLM/Qwen-Image-2.1같은 주제 가이드 · 바로 써 보기오류가 나면 터미널 출력째 묻기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기