대규모 언어 모델을 위한 연속 확산 방식 연구
Large Language Continuous Diffusion Models
arXiv기존 이산형 확산 언어 모델(dLMs)의 비연속성 문제를 해결하기 위해, 연구진은 연속적인 잠재 궤적을 활용하는 대규모 확산 언어 모델 'Sigma'를 개발했습니다.
기존 언어 모델의 한계를 넘어 연속적인 잠재 궤적을 활용하는 새로운 방식이 개발되어, 수학이나 코딩 같은 복잡한 추론 과정에서 더 높은 품질과 제어력을 갖춘 결과물을 만들 수 있게 되었어요.
- Sigma는 표준 수학 및 코딩 벤치마크에서 기존 이산 모델과 동등한 성능을 보였으며, 연속 경로 덕분에 추론 과정의 품질-다양성 균형 조절이 가능하다는 점을 입증했습니다.
- 이 기술은 언어 생성 과정의 추론 효율성을 높일 뿐만 아니라, 낮은 컴퓨팅 자원에서도 지식 전수(Distillation)나 모델 경량화가 가능한 새로운 패러다임을 제시합니다.
- 특히, 높은 정확도를 유지하기 위해서는 추론 시 클래시파이어 프리 가이던스 및 스코어 온도가 필수적이며, 이는 연속 확산 모델의 활용에 중요한 기술적 요소입니다.
기존의 이산형 확산 언어 모델(dLMs)은 빠른 병렬 디코딩에 성공했음에도 불구하고, 비연속적이고 고차원적인 공간 구조 때문에 추론 및 추론 가속을 위한 궤적 조향이 어렵다는 한계가 있었습니다. 연구진은 이러한 문제를 해결하기 위해, 조향 가능한 저차원의 ODE/SDE 잠재 궤적을 기반으로 하는 대규모 연속 dLM인 'Sigma'를 개발했습니다. Sigma는 가우시안 노이즈로 손상된 을 공동으로 디노이징하면서 최적의 임베딩 기하학을 학습하도록 블록 단위로 훈련되었습니다.
추론 과정에서는 높은 충실도의 추론 및 코딩 성능을 위해 클래시파이어 프리 가이던스와 스코어 온도가 필수적인 요소임이 확인되었습니다. Sigma는 사전 훈련된 자기회귀(AR) 모델의 를 활용하여 학습 속도를 높였으며, 표준 수학 추론 및 코딩 평가(예: GSM8K, Minerva, HumanEval, MBPP)에서 기존 이산 모델과 경쟁할 만한 성능을 보였습니다. 또한 MATH-500이나 AIME 같은 어려운 추론 과제에서는 지도 (SFT) 후 우수한 결과를 달성했습니다.
연속 dLM은 독특한 구조적 특성을 가지는데, 임베딩 공간 조향이 품질과 다양성의 균형을 효과적으로 제어하여 높은 pass@k 성능을 보여줍니다. 또한 연속적인 궤적 덕분에 낮은 NFE에서도 우아한 성능 저하가 가능하며 효율적인 (distillation)를 할 수 있습니다. 이러한 특성들은 연속 dLM이 효율적인 언어 생성 패러다임으로서 큰 잠재력을 가짐을 입증합니다.
용어 풀이
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- 임베딩
- 글이나 이미지의 의미를 숫자 목록으로 바꾼 것. 의미가 비슷한 것을 찾을 때 써요.
- 가중치
- 학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
- 미세 조정
- 이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.
- 지식 증류
- 큰 모델의 답을 작은 모델이 따라 배우게 해서 가볍고 빠른 모델을 만드는 방법.
기존의 이산형 언어 모델은 어떤 한계가 있었나요?
이전의 이산형 확산 언어 모델(dLMs)은 빠른 병렬 디코딩에 성공했지만, 비연속적이고 고차원적인 공간 구조 때문에 추론 과정이나 궤적 조향을 하기가 어렵다는 한계가 있었어요.
높은 정확도를 유지하기 위해 필수적인 기술 요소는 무엇인가요?
추론 과정에서 높은 충실도의 성능을 위해서는 클래시파이어 프리 가이던스와 스코어 온도가 반드시 필요한 것으로 확인되었어요. Sigma 모델은 이러한 요소를 활용하여 학습했어요.
연속 확산 언어 모델의 가장 큰 장점은 무엇인가요?
연속적인 궤적 덕분에 임베딩 공간 조향을 통해 결과물의 품질과 다양성 사이의 균형을 효과적으로 제어할 수 있어요. 또한, 낮은 컴퓨팅 자원에서도 지식 증류가 가능해요.