리서치 연구
dQwen3.5: 하이브리드 구조를 활용한 확산 언어 모델 개발
dQwen3.5: Hybrid-Attention Diffusion Language Models
arXivQwen3.5의 하이브리드 구조를 활용하여 확산 언어 모델(DLM)로 변환한 dQwen3.5 계열을 개발했습니다.
세 줄 요약
- 기존 완전 어텐션 방식 대비, 하이브리드 백본은 동일 학습 손실 도달에 필요한 토큰 수를 절반 수준으로 줄이는 높은 효율성을 입증했습니다.
- RNN 레이어 포함 등 구조적 난제가 있던 하이브리드 백본을 DLM에 성공적으로 적용하여 새로운 모델 설계 가능성을 제시합니다.
- dQwen3.5는 다양한 규모에서 완전 어텐션 DLM과 유사한 성능을 보이며, 특히 병렬 디코딩 환경에서 강력함을 보여줍니다.
사전 학습된 자기회귀(AR) 모델을 확산 언어 모델(DLM)로 변환하는 것은 비용 효율적인 방법입니다. 일반적으로 이러한 변환은 완전 어텐션 를 기반으로 하지만, AR 모델링은 최근 주의(attention) 레이어와 RNN 레이어를 혼합한 하이브리드 아키텍처로 변화하고 있습니다. 이 구조적 차이는 난제가 되는데, RNN은 본질적으로 인과적(causal)이어서 DLM에 필요한 양방향 처리 방식으로 변환하기가 어렵기 때문입니다.
연구진은 이러한 구조적 불일치에도 불구하고 Qwen3.5를 0.8B, 2B, 4B, 9B 규모로 적응시켜 dQwen3.5 계열을 개발했습니다. 그 결과, 하이브리드 백본이 효과적인 시작점임을 확인했으며, 완전 어텐션 방식의 모델과 비교했을 때 동일한 학습 손실에 도달하는 데 필요한 수가 약 절반 수준으로 줄어드는 높은 효율성을 입증했습니다.
dQwen3.5는 다양한 규모에서 완전 어텐션 DLM과 유사하게 '어떤 순서로든 디코딩' 동작을 보였으며, 특히 병렬 디코딩 환경에서도 강력한 성능을 보여주었습니다. 이는 하이브리드 백본 구조가 의 새로운 설계 가능성을 제시함을 의미합니다.
용어 풀이
- 트랜스포머
- 오늘날 대부분의 언어 모델이 쓰는 신경망 구조. 문장 속 단어들의 관계를 한꺼번에 계산해요.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.