연속 확산 언어 모델의 추론 능력 향상 연구
ELF-REG: Scaling Continuous Diffusion Language Models to Reasoning Tasks
arXiv연구진은 연속 확산 언어 모델(dLMs)의 추론 능력을 강화하기 위해 ELF-REG라는 새로운 방법을 개발했습니다. 이 방법은 dLMs가 어려움을 겪던 수학 및 코딩 같은 복잡한 논리적 작업에 적용되었습니다.
- ELF-REG는 고정된 AR 교사 모델의 지도를 받아 중간 특징을 정렬하고 결합하는 REPA+REG 기법을 도입했습니다. 그 결과, GSM8K에서 55.96% 등 기존 dLMs 대비 높은 성능 향상을 입증했습니다.
- 본 연구는 복잡한 추론 작업에서도 순차적 방식(AR)에 의존하지 않는 연속 확산 모델이 강력한 성능을 발휘할 수 있음을 보여주며, 차세대 AI 아키텍처의 가능성을 제시합니다.
- 특히 초기 중단(early-stop) 기법을 활용하면 적은 계산량으로도 높은 추론 능력을 유지하는 효율성이 뛰어나, 실용적인 저비용 고성능 모델 구현에 유리합니다.
완전히 연속적인 확산 언어 모델(dLMs)은 중간 이산화 과정 없이 연속 표현을 디노이징하고 최종 단계에서 모든 응답 을 병렬로 디코딩하는 방식을 사용합니다. 그러나 이러한 dLMs는 여전히 자가회귀(AR) 이나 마스크드 dLMs에 비해 까다로운 추론 작업에서의 성능 확립이 필요했습니다.
연구진은 임베디드 언어 플로우(ELF)를 확장하여 수학적 추론 및 코드 생성에 적용한 ELF-REG를 제안했습니다. 이 방법은 표현 정렬과 얽힘(REPA+REG)을 통해 학습을 개선하며, 고정된 AR 교사가 중간 디노이저 특징을 감독하고 응답과 공동으로 디노이징할 수 있는 전역 표현을 제공합니다. 그 결과, ELF-REG-L 모델은 GSM8K에서 64 네트워크 함수 평가(NFE) 시 pass@1 기준 55.96%를 달성했습니다.
ELF-REG-L은 MATH-500에서 128 NFE 조건으로 pass@1 13.39%, HumanEval에서 같은 조건으로 22.56%를 기록하며 기존 dLMs 대비 우수한 성능을 보였습니다. 특히, ELF-L 기준선이 MATH-500 pass@1 10.55%였던 것에 비해 13.39%로 향상되었으며, 적은 NFE만으로도 초기 중단(early-stop) 기법을 통해 높은 추론 능력을 유지하는 효율성을 입증했습니다.
용어 풀이
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.