계층적 연속 확산 언어 모델(HC-DLM) 제안
Hierarchical Continuous Diffusion Language Models
토큰 생성과 연속적인 잠재 공간 변화를 결합한 계층적 연속 확산 언어 모델(HC-DLM)이 제안되었습니다. 이는 기존 방식들이 가진 구조적 의존성 부족 문제를 해결하는 것이 목표입니다.
복잡한 구조 추론이나 언어 모델링 작업에서 토큰 간의 통계적 의존성을 유지하며 높은 정확도를 보여주기 때문이에요.
- HC-DLM은 잠재 상태를 유일하고 영속적인 생성 기반으로 활용하며, 매 단계 추출된 토큰 정보가 다음 잠재 업데이트의 구조적 지지대(scaffold) 역할을 수행합니다.
- 스도쿠나 수학적 계획 같은 복잡한 구조 추론 및 일반 언어 모델링 작업에서 기존 확산 모델 대비 높은 정확도와 낮은 예측 오차를 보입니다.
- 본 연구는 학술 논문으로 발표되었으며, 동일 규모의 이산형 및 연속형 확산 모델과의 비교를 통해 성능 개선을 입증했습니다.
이산형 확산 언어 모델은 양방향 추론과 전역 제약 조건 만족이 필요한 작업에 유용한 대안이지만, 병렬 디코딩 시 들이 독립적인 주변 분포에서 샘플링되어 통계적 의존성이 끊기는 구조적 한계를 가집니다. 연속 은 공유된 연속 상태를 노이즈 제거하지만, 이 과정에서는 해당 상태만 볼 뿐 최종적으로 유효한 토큰 구성과 연결되지 않는 문제가 있었습니다. 이를 해결하기 위해 연구진은 계층적 연속 확산 언어 모델(HC-DLM)을 제안했습니다.
HC-DLM은 이산형 토큰 생성 과정을 단일하고 원칙적인 노이즈 제거 과정 내의 연속 잠재 궤적과 결합합니다. 학습 목표는 토큰 가능도에 대한 변분 경계에서 파생되었습니다. 기존 방식들이 독립된 이산 체인에 연속 컨텍스트를 부착하는 것과 달리, HC-DLM은 잠재 상태만을 유일하고 지속적인 생성 상태로 활용하며, 매 단계마다 추출된 토큰 정보가 다음 잠재 업데이트의 구조적 지지대(scaffold) 역할을 수행합니다.
HC-DLM은 스도쿠 같은 구조화 추론, 수학적 계획(Countdown), 그리고 언어 모델링(LM1B) 등 다양한 분야에 적용 가능함을 보여주었습니다. 연구 결과에 따르면, HC-DLM은 동일한 규모의 이산형 및 연속형 확산 모델 대비 퍼즐 정확도와 LM1B에서의 생성 예측 오차(perplexity) 측면에서 성능 개선을 입증했습니다.
용어 풀이
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- 확산 모델
- 잡음에서 시작해 조금씩 다듬으며 이미지나 영상을 만들어 내는 생성 모델.
기존 확산 모델들은 어떤 구조적 한계를 가지고 있었나요?
이산형 확산 언어 모델은 병렬 디코딩 시 토큰들이 독립적인 주변 분포에서 샘플링되어 통계적 의존성이 끊기는 구조적 한계를 가졌어요. 또한 연속 확산 모델은 공유된 상태만 볼 뿐 최종적으로 유효한 토큰 구성과 연결되지 않는 문제가 있었답니다.
HC-DLM이 기존 방식들과 다른 점은 무엇인가요?
기존 방식들이 독립된 이산 체인에 연속 컨텍스트를 부착하는 것과 달리, HC-DLM은 잠재 상태만을 유일하고 지속적인 생성 상태로 활용해요. 특히, 매 단계마다 추출된 토큰 정보가 다음 잠재 업데이트의 구조적 지지대(scaffold) 역할을 수행한다는 점이 가장 큰 차이점이에요.
이 모델은 어떤 분야에 적용할 수 있나요?
스도쿠 같은 구조화 추론, 수학적 계획(Countdown), 그리고 언어 모델링(LM1B) 등 다양한 분야에 적용 가능함을 보여주었어요. 이 연구 결과는 퍼즐 정확도와 생성 예측 오차 측면에서 성능 개선을 입증했어요.