범용 멀티모달 학습을 위한 기반 모델 제안 — AI 생성 일러스트
리서치 연구

범용 멀티모달 학습을 위한 기반 모델 제안

Generalized Multimodal Foundation Model

arXiv9월 22일 발표 · 2분 · 프리프린트

기존 멀티모달 모델은 정해진 모달리티와 단일 작업에 국한되는 한계가 있었으나, 본 연구는 이를 극복할 범용적인 통합 기반 모델을 제안했습니다.

세 줄 요약arXiv 원문 기반
  1. 이 모델은 다양한 인과 구조를 가진 대규모 합성 데이터로 학습하여 특정 모달리티에 의존하지 않는 전이 가능한 상관관계를 포착했으며, 18개 실제 데이터셋에서 우수한 성능을 입증했습니다.
  2. 특정 작업이나 데이터 종류에 구애받지 않고 일반화된 지식을 활용할 수 있어, AI의 응용 범위를 새로운 모달리티와 예측 과제까지 확장할 잠재력을 가집니다.
  3. 다만 모델이 다양한 인과 구조를 가진 '합성' 데이터를 기반으로 훈련되었으므로, 실제 세계 데이터와의 차이(Sim-to-Real Gap) 발생 가능성은 고려해야 합니다.

기존의 융합 모델들은 사전에 정의된 특정 모달리티(예: 비전, 텍스트, 오디오)와 단일 작업에만 적용 가능하다는 한계가 있었습니다. 이에 따라 연구진은 임의의 모달리티 조합과 예측 과제에 모두 적용할 수 있는 범용적인 통합 멀티모달 모델의 존재 가능성을 제기했습니다.

이러한 문제를 해결하기 위해, 특정 모달리티에 의존하지 않고 멀티모달 상관관계의 전이 가능한 패턴을 인코딩하는 것이 중요하다고 주장하며 새로운 학습 패러다임을 제시했습니다. 이들은 다양한 인과 구조를 가진 대규모 합성 멀티모달 데이터셋으로 훈련하여 일반화된 멀티모달 기반 모델을 구축했습니다.

제안된 모델은 훈련 과정에서 전이 가능한 멀티모달 상관관계를 인코딩하며, 추론 시에는 컨텍스트 내 예시를 통해 적절한 연관성을 활성화합니다. 이 모델은 12개 모달리티와 11가지 예측 과제를 아우르는 18개의 실제 데이터셋에 대한 실험을 거쳤으며, 특정 작업별 적응 없이도 전문화된 모델과 경쟁할 수 있는 성능을 입증했습니다.

용어 풀이

멀티모달
글뿐 아니라 이미지·음성·영상처럼 여러 형태의 입력을 함께 다루는 것.
원문arXiv · Generalized Multimodal Foundation Model
원문 보기arXiv