모델 도구

vLLM v0.28.0

HNHacker News8월 29일 발표 · 1분

vLLM v0.28.0은 Kimi-K3, DeepSeek V4 등 주요 LLM에 대한 광범위한 최적화와 함께 모델 아키텍처 지원을 대폭 확장하며 성능 향상을 이뤘습니다.

세 줄 요약Hacker News 원문 기반
  1. 추측 디코딩(Speculative Decoding) 고도화 및 계층적 KV 캐시 오프로딩 기능을 통해 장기 컨텍스트 처리의 메모리 효율성과 속도가 크게 개선되었습니다.
  2. AMD ROCm, Intel XPU 등 다양한 이종 아키텍처와 CPU 환경까지 지원 범위를 넓혀 하드웨어 제약 없이 LLM 서빙이 가능해졌습니다.
  3. 플러그인 마이그레이션 및 API 변경 사항이 많으므로, 사용 전 반드시 Breaking Changes 목록을 확인하고 환경 설정을 점검해야 합니다.

vLLM v0.28.0은 Kimi-K3, DeepSeek V4 등 주요 LLM에 대한 광범위한 최적화와 함께 모델 아키텍처 지원을 대폭 확장하며 성능 향상을 이뤘습니다.

원문Hacker News · vLLM v0.28.0
원문 보기Hacker News