노드 그래프 기반, 자동화된 AI 파이프라인 구축
Rebuilding AUTOMATIC1111 with Gradio Workflow
Hugging Face BlogGradio Workflow를 활용하여 AUTOMATIC1111의 복잡한 기능을 노드 그래프로 재구성했습니다. 이를 통해 하나의 캔버스에서 다양한 AI 파이프라인을 통합적으로 구현할 수 있습니다.
- 텍스트-이미지 생성, 고해상도 개선, VLM 질의 등 총 11가지 미디어 파이프라인을 통합하여 광범위한 기능을 제공하며, 73개의 노드로 구성되었습니다.
- 사용자가 별도의 GPU 없이 외부 서비스(Inference Providers)를 통해 모델을 호출할 수 있으며, 모든 결과는 REST 엔드포인트로 자동 노출되어 코드 연동성이 뛰어납니다.
- 순수 Python 함수 기반의 커스텀 노드를 지원하여 로컬 실행도 가능하고, 사용자 계정으로 로그인해 할당량을 관리하며 서비스를 이용할 수 있습니다.
Workflow1111은 Gradio의 워크플로우 기능을 활용하여 AUTOMATIC1111과 같은 복잡한 이미지 생성 웹 UI의 핵심 기능들을 노드 그래프 형태로 재구성한 프로젝트입니다. 이 시스템은 총 73개의 노드로 구성되어 있으며, 텍스트-이미지 생성(text-to-image), 고해상도 개선(hi-resolution fix), 이미지-투-이미지 변환, 질의응답, 탐지 기반 인페인팅 마스크 등 11가지 미디어 파이프라인을 하나의 캔버스에서 통합적으로 구현합니다.
파이프라인은 Python 함수(`fn`), 모델 호출(`model`), Gradio Space(`space`), 데이터셋(`dataset`) 네 가지 유형의 연산자(operator)를 기반으로 구축됩니다. 특히, 이 시스템의 특징 중 하나는 모든 모델 호출을 사용자의 로컬 없이 외부 Inference Providers나 Hub의 Space를 통해 처리할 수 있다는 점입니다. 이를 통해 과 등 다양한 모달리티의 기능을 하나의 워크플로우에 통합할 수 있습니다.
워크플로우는 복잡한 자동화 기능도 지원합니다. 예를 들어, DETR을 이용해 사진 속 객체를 탐지하고 그 결과를 인페인팅 마스크로 변환하는 과정이 가능하며, 매트릭스 그리드처럼 하나의 기본 프롬프트를 여러 접미사와 결합하여 다양한 결과물을 생성할 수 있습니다. 또한, 워크플로우의 모든 출력 노드는 자동으로 REST 엔드포인트가 되어 외부 나 코드에서 쉽게 호출하고 결과를 활용할 수 있도록 설계되었습니다.
용어 풀이
- VLM
- 이미지와 글을 함께 이해하는 모델.
- GPU
- 많은 계산을 한꺼번에 처리하는 칩. AI 학습과 실행에 가장 많이 써요.
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 확산 모델
- 잡음에서 시작해 조금씩 다듬으며 이미지나 영상을 만들어 내는 생성 모델.
- 프롬프트
- AI에게 주는 지시나 질문 글.
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
