리서치 연구
표현 기반 마스크 확산 모델(RMDM) 소개
Representation-based Masked Diffusion Model
arXiv기존 마스크 확산 모델(MDM)은 병렬 업데이트 방식을 사용하지만, 마스킹된 토큰 간의 복잡한 상호 의존성을 무시하고 독립적으로 처리하는 한계가 있었습니다.
세 줄 요약
- 연구진은 '표현 기반 마스크 확산 모델(RMDM)'을 제안했습니다. 이 모델은 텍스트를 의미적 공간에 인코딩하여 전역적인 문맥 정보를 추출하고, 이를 통해 토큰 업데이트를 정교하게 조정합니다.
- RMDM은 전체적인 의미 구조를 활용해 병렬 토큰 생성을 효과적으로 조정함으로써, 기존 방식보다 높은 일관성과 우수한 생성 품질을 입증했습니다. 특히 적은 단계로 샘플링할 때 성능 향상이 두드러집니다.
- 핵심 기술은 텍스트를 연속적인 의미 공간으로 변환하는 사전 학습 인코더와, 이 잠재적 표현(latent representation)을 확산 과정에 조건부 지침으로 활용하여 전역적 문맥을 유지하는 것입니다.
기존의 마스크 (MDMs)은 병렬 텍스트 생성을 위한 효과적인 패러다임으로 주목받고 있으나, 여러 개의 마스킹된 간에 존재하는 복잡한 상호 의존성을 무시하고 각 토큰을 독립적으로 업데이트하는 한계가 있었습니다. 이러한 개별적 업데이트 방식은 전역적인 조정이 부족하여 때때로 일관성이 떨어지는 출력을 초래할 수 있습니다.
이러한 문제를 해결하기 위해 연구진은 표현 기반 마스크 확산 모델(RMDM)을 제안했습니다. RMDM은 먼저 사전 학습된 인코더를 사용하여 텍스트를 연속적인 의미 공간으로 인코딩하고, 이 분포를 가우시안 사전에 맞게 정규화하는 역변환을 학습합니다. 이후 이 잠재적 의미 표현(latent semantic representation)에 조건화하여 마스크 확산 모델을 훈련하게 됩니다.
이 과정에서 추출된 의미 표현은 전역적인 의미 지침 역할을 수행하며, 병렬 토큰 업데이트를 정교하게 조정하고 목표 분포를 충실히 근사합니다. 실험 결과는 RMDM이 특히 공격적인 소수 단계 샘플링 영역에서 기존 방식 대비 생성 품질을 크게 향상시키는 것을 입증했습니다.
용어 풀이
- 확산 모델
- 잡음에서 시작해 조금씩 다듬으며 이미지나 영상을 만들어 내는 생성 모델.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.