인프라 연구
Serving Masked Diffusion LLMs: Characterization and Design Principles from Real Hardware
ARarXiv
연구진은 실제 동시 서비스 부하 환경에서 마스크 확산 LLM(dLLMs)의 작동 방식을 분석했다.
세 줄 요약
- LLaDA-8B-Instruct를 NVIDIA H200 GPU에 적용한 결과, 요청 난이도는 11개 고정 단계 수준으로 이산적이며 배치 처리는 처리량을 16.0배 향상시킨다.
- 단일 요청의 전체 시간 중 GPU 계산은 24%만 차지하고 나머지는 CPU 측 디스패치 오버헤드이다. 따라서 배치 처리가 중요해진다.
- dLLM 서비스는 각 디노이징 단계 수준에서 병렬성이 필요하며, 이는 AR 모델의 서비스 방식과 상호작용하는 방식이 다르다.
연구진은 실제 동시 서비스 부하 환경에서 마스크 확산 LLM(dLLMs)의 작동 방식을 분석했다.