개발도구 뉴스
Qwen의 통합 이미지 생성 및 편집 모델 'Qwen-Image-2.1' 공개
QwenLM/Qwen-Image-2.1
GitHubQwen이 텍스트를 이용해 이미지를 생성하고 기존 사진을 수정하는 기능을 하나로 통합한 'Qwen-Image-2.1' 모델을 오픈소스로 공개했습니다.
세 줄 요약
- 시각 생성 부품은 7B 파라미터로 효율성을 높였으며, 투명 배경(RGBA) 이미지 생성과 최대 10장의 레퍼런스 이미지를 활용하는 전문적인 편집 기능이 핵심입니다.
- 단순한 생성을 넘어 투명도 처리나 다중 요소 합성 등 전문가급의 복잡한 이미지 편집 기능을 제공하여 활용 범위가 크게 확장되었습니다.
- 최적의 결과물을 얻으려면 전용 프롬프트 리라이팅 모델을 사용하고, 대규모 처리는 vLLM 같은 고성능 서빙 환경에서 진행하는 것이 권장됩니다.
Qwen은 텍스트를 이용한 이미지 생성과 기존 사진을 수정하는 기능을 하나로 통합한 'Qwen-Image-2.1' 모델을 로 공개했습니다. 이 모델은 시각 생성 컴포넌트가 7B 로 구성되어, 높은 생성 품질과 추론 효율성 및 범용성을 동시에 갖추도록 설계되었습니다.
이 버전에서는 네 가지 주요 개선 사항이 특징입니다. 첫째, 혼합 정밀도 어텐션(mixed-granularity attention)을 통해 낮은 계산 비용으로 우수한 이미지 품질을 제공합니다. 둘째, 텍스트만으로 일반 또는 투명 배경(RGBA) 이미지를 생성하고, 투명 레이어를 편집하거나 사진에서 피사체를 추출하는 등 통합적인 기능을 지원합니다. 또한 최대 10장의 레퍼런스 이미지를 활용한 다중 주체 합성 및 원본의 정체성 보존이 가능합니다.
최적의 결과물을 얻기 위해서는 전용 리라이팅 모델을 사용하는 것이 권장됩니다. 이 모델은 짧은 프롬프트를 상세하고 고품질의 설명으로 확장해줍니다. 대규모 서비스 환경에서는 vLLM-Omni와 같은 고성능 서빙 솔루션을 통해 프리픽스 KV 캐싱, Graph 디코드 등을 활용하여 효율적인 추론이 가능합니다.
용어 풀이
- 오픈소스
- 소스 코드를 공개해 누구나 보고 고치고 다시 배포할 수 있게 한 소프트웨어.
- 파라미터
- 모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
- 프롬프트
- AI에게 주는 지시나 질문 글.
- CUDA
- 엔비디아 GPU에서 계산 프로그램을 돌리게 해 주는 개발 플랫폼.