활용 사례 연구
DAMP: Decay-Aware Mixed-Precision Recurrent-State Quantization
ARarXiv
대규모 언어 모델의 추론 시 메모리 사용량을 줄이기 위해 도입된 순환 상태(recurrent state)를 효율적으로 양자화하는 새로운 기법 DAMP가 개발되었습니다.
세 줄 요약
- DAMP는 양자화 오류 에너지와 상태 지속성 분석을 결합하여 핵심 채널만 고정밀도로 유지하고 나머지를 INT8로 처리함으로써, 저장 공간을 69.1% 줄이면서도 FP32에 근접한 정확도를 달성했습니다.
- 이는 순환 상태 업데이트 커널을 최대 2.01배 가속하고 전체 모델 크기까지 축소하여, 대규모 AI 서비스의 배포 효율성과 추론 속도를 극대화할 수 있습니다.
- 다만, DAMP는 GDN이나 KDA 같은 특정 아키텍처에 적용되며, 최적화를 위해서는 오프라인 캘리브레이션 과정이 필수적으로 요구된다는 점을 고려해야 합니다.
대규모 언어 모델의 추론 시 메모리 사용량을 줄이기 위해 도입된 순환 상태(recurrent state)를 효율적으로 양자화하는 새로운 기법 DAMP가 개발되었습니다.