지속적인 교사 증류를 통한 파운데이션 모델 확장 프레임워크 — AI 생성 일러스트
리서치 연구

지속적인 교사 증류를 통한 파운데이션 모델 확장 프레임워크

GRAFT: Growing Agglomerative Foundation Models via Continual Teacher Distillation

arXiv10월 5일 발표 · 3분 · 프리프린트

기존에 개별적으로 존재하는 다양한 비전 기반 모델들의 지식을 하나의 백본으로 점진적이고 효율적으로 통합하는 프레임워크입니다.

왜 중요해요AI 정리

다양한 분야의 인공지능 지식을 하나의 모델에 효율적으로 통합할 수 있게 해줘요. 새로운 능력을 추가해도 전체를 다시 학습할 필요가 없다는 점이 중요해요.

세 줄 요약arXiv 원문 기반
  1. 핵심은 새로운 능력이 추가될 때마다 기존 학습 내용을 유지하면서(Continual) 전 과정을 다시 거치지 않고 효율적으로 지식을 확장한다는 점입니다.
  2. 이미지 이해, 3D 비전, 시각-언어 등 이질적인 다중 도메인의 기능을 하나의 확장 가능한 모델로 통합할 수 있어 활용 범위가 매우 넓습니다.
  3. 서로 다른 구조를 가진 여러 교사 모델들의 지식을 결합하기 위해 '교사별 출력 토큰'과 같은 복잡한 기술적 장치를 도입했습니다.

DINOv2, SigLIP2, MASt3R와 같은 비전 기반 파운데이션 모델들은 각기 다른 사전 학습 목표에서 상호 보완적인 능력을 개발하지만, 이 지식들이 개별적이고 전문화된 여러 모델에 분산되어 있습니다. 기존의 다중 교사 방식은 고정된 교사 세트를 가정하며, 새로운 교사를 통합하려면 전체 교사 세트에 걸쳐 값비싼 공동 증류 과정을 반복해야 하는 한계가 있었습니다.

GRAFT는 이러한 문제를 해결하기 위해 개발된 지속적인(continual) 다중 교사 증류 프레임워크입니다. 이 시스템은 단일한 백본 구조를 통해 개방형 순서로 파운데이션 모델의 능력을 점진적으로 습득할 수 있게 합니다. 새로운 교사가 추가될 때, GRAFT는 기존에 증류된 모델을 하나의 교사로 간주하여 학습된 능력을 보존하고, 현재 학생 모델이 이전 모델과 새로 유입되는 교사로부터 동시에 지식을 학습하도록 설계되었습니다.

또한, 이질적인 여러 교사들의 비호환적인 표현 기하학(representation geometries) 문제를 해결하기 위해 '교사별 출력 (Teacher Specific Readout Tokens)'을 도입했습니다. 이를 통해 각 교사는 공유된 인코더로부터 독립적인 출력을 얻게 됩니다. GRAFT 모델은 이미지 이해, 2D 밀집 예측, 3D 인간 자세 추정, 3D 비전, 시각-언어 등 다섯 가지 도메인을 통합하는 단일하고 확장 가능한 백본을 제공하며, 새로운 능력을 습득할 때마다 전체 재증류가 아닌 단 한 번의 증류만으로 높은 성능을 유지합니다.

용어 풀이

지식 증류
큰 모델의 답을 작은 모델이 따라 배우게 해서 가볍고 빠른 모델을 만드는 방법.
토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
궁금한 점AI 정리 · 원문 기반
기존의 여러 비전 모델 지식을 통합할 때 어떤 어려움이 있었나요?

기존 방식은 고정된 교사 세트를 가정했기 때문에, 새로운 능력을 추가하려면 전체 교사 세트에 걸쳐 값비싼 공동 증류 과정을 반복해야 하는 한계가 있었습니다.

GRAFT는 새로운 능력을 추가할 때 어떻게 지식을 효율적으로 확장하나요?

GRAFT는 단일한 백본 구조를 통해 개방형 순서로 파운데이션 모델의 능력을 점진적으로 습득해요. 새로운 교사가 추가될 때는 기존에 증류된 모델을 하나의 교사로 간주하여 학습된 능력을 보존하고, 이전 모델과 새로 유입되는 교사로부터 동시에 지식을 학습하도록 설계되었어요.

서로 다른 구조의 여러 모델 지식을 결합하는 기술적 장치는 무엇인가요?

이질적인 교사들의 비호환적인 표현 기하학 문제를 해결하기 위해 '교사별 출력 토큰'이라는 것을 도입했어요. 이를 통해 각 교사는 공유된 인코더로부터 독립적인 출력을 얻을 수 있어요.

원문arXiv · GRAFT: Growing Agglomerative Foundation Models via Continual Teacher Distillation
궁금한 점 3개AI 정리