모델 연구
LeanStream: A Speculate-and-Refine Streaming Framework for Efficient on-Device LLM Inference
ARarXiv
모바일 및 임베디드 장치에서 LLM 추론의 어려움을 해결하기 위해 'LeanStream'이라는 스트리밍 프레임워크가 개발되었습니다.
세 줄 요약
- 이 기술은 부분적 GPU 결과를 활용하여 연산, 로딩, 캐시 유지 우선순위를 점진적으로 개선하는 '추측 및 정제(Speculate-and-Refine)' 방식을 사용합니다.
- LeanStream은 기존 시스템 대비 메모리 사용량을 4.8배~7.5배 절감하고 토큰 생성 처리량도 크게 향상시키는 성능을 입증했습니다.
- 이는 온디바이스 LLM 추론의 근본적인 시스템적 한계를 극복하며, 프라이버시와 빠른 응답성이 중요한 모바일 환경에 혁신을 가져올 잠재력을 보여줍니다.
모바일 및 임베디드 장치에서 LLM 추론의 어려움을 해결하기 위해 'LeanStream'이라는 스트리밍 프레임워크가 개발되었습니다.