인프라 연구

Serving Masked Diffusion LLMs: Characterization and Design Principles from Real Hardware

ARarXiv8월 26일 발표 · 1분 · 심사 전 논문

연구진은 실제 동시 서비스 부하 환경에서 마스크 확산 LLM(dLLMs)의 작동 방식을 분석했다.

세 줄 요약arXiv 원문 기반
  1. LLaDA-8B-Instruct를 NVIDIA H200 GPU에 적용한 결과, 요청 난이도는 11개 고정 단계 수준으로 이산적이며 배치 처리는 처리량을 16.0배 향상시킨다.
  2. 단일 요청의 전체 시간 중 GPU 계산은 24%만 차지하고 나머지는 CPU 측 디스패치 오버헤드이다. 따라서 배치 처리가 중요해진다.
  3. dLLM 서비스는 각 디노이징 단계 수준에서 병렬성이 필요하며, 이는 AR 모델의 서비스 방식과 상호작용하는 방식이 다르다.

연구진은 실제 동시 서비스 부하 환경에서 마스크 확산 LLM(dLLMs)의 작동 방식을 분석했다.

원문arXiv · Serving Masked Diffusion LLMs: Characterization and Design Principles from Real Hardware

평일 아침 메일로 받아 보기 ›틀린 곳 알리기