MLLM의 지식으로 강화하는 객체 분할 방법 — AI 생성 일러스트
리서치 연구

MLLM의 지식으로 강화하는 객체 분할 방법

Exploiting Target Knowledge from MLLMs for Robust Few-Shot Segmentation

arXiv9월 25일 발표 · 3분 · 프리프린트

적은 예시로 새로운 객체를 분할하는 'Few-shot segmentation' 기술의 한계를 극복하기 위해, MLLM의 강력한 추론 능력을 활용하여 목표 지식을 추출하는 신규 프레임워크가 제안되었습니다.

세 줄 요약arXiv 원문 기반
  1. 이 방법은 MLLM을 통해 얻은 공간적 위치 정보와 텍스트 기반의 의미론적 지식 두 가지를 모두 활용합니다. 이 정보를 각각 처리하고 결합하여 목표물에 대한 다각적이고 견고한 표현을 생성하는 것이 핵심입니다.
  2. 기존 방식이 시각적 유사성에만 의존했던 한계를 넘어, 위치 정보와 개념 설명 등 다양한 지식을 통합함으로써 분할의 신뢰도와 포괄적인 성능을 크게 향상시킵니다.
  3. 광범위한 실험 결과에서 기존 방법론들을 능가하는 뛰어난 성능을 입증했습니다. MLLM 기반 지식 활용이 FSS 분야에 새로운 돌파구를 제시할 것으로 기대됩니다.

소수샷 분할(FSS)은 소수의 레이블링된 예시만으로 새로운 객체 카테고리를 분할하는 것을 목표로 합니다. 기존 모델들은 주로 지원 이미지와 질의 이미지 간의 외관 기반 시각적 매칭에 의존했기 때문에, 상당한 외관 차이나 가려짐이 발생하면 성능에 어려움을 겪었습니다. 이를 개선하기 위해 본 연구는 MLLM( Large Language Models)의 강력한 추론 능력을 활용하여 목표 지식을 추출하는 새로운 프레임워크를 제안했습니다.

제안된 방법은 MLLM을 통해 얻은 두 가지 상호 보완적인 지식 형태, 즉 잠재적 목표 위치를 나타내는 공간적 지식(spatial knowledge)과 텍스트로 대상을 설명하는 의미론적 지식(semantic knowledge)을 활용합니다. 공간적 지식은 메모리 표현으로 인코딩된 후, 지원 기반 메모리 특징과 DMDF(dual-memory debate-fusion) 모듈을 통해 통합되어 더욱 견고한 목표 메모리 특징을 생성합니다.

한편, 의미론적 지식은 텍스트 특징으로 인코딩되며, PCPG(progressive cross-modal generator)를 거쳐 다중 스케일 질의 특징과 결합됩니다. 이 과정을 통해 목표 인식 능력을 갖춘 멀티모달 프롬프트가 생성되고, 최종적으로 두 가지 메모리 특징과 멀티모달 프롬프트가 종합적인 대상 표현을 제공하여 분할의 견고성을 높입니다.

광범위한 실험 결과에서 MK-FSS는 기존 방법론들을 능가하는 유망한 결과를 보여주었으며, MLLM 기반 지식 활용이 FSS 분야에 새로운 돌파구를 제시할 것으로 기대됩니다.

용어 풀이

Multimodal
글뿐 아니라 이미지·음성·영상처럼 여러 형태의 입력을 함께 다루는 것.
prompt
AI에게 주는 지시나 질문 글.
원문arXiv · Exploiting Target Knowledge from MLLMs for Robust Few-Shot Segmentation
원문 보기arXiv