모델 연구
QTEA: Ternary LLMs with Sparse Residual Salient Weight and By-Column Optimization
ARarXiv
대규모 언어 모델(LLMs)의 연산 부하를 줄이기 위해, 가중치를 삼원(ternary) 값으로 양자화하는 새로운 프레임워크 'QTEA'가 개발되었습니다.
세 줄 요약
- QTEA는 가중치를 서브-2비트로 압축하고, 중요한 가중치(salient weights)를 활용해 잔여 오차를 보정하며 정확도를 높였습니다.
- 이 기술은 모델을 효과적으로 1.7비트 수준으로 압축하면서도, 기존 대비 높은 정확도를 유지하고 추론 속도를 최대 7.2배 향상시킵니다.
- 열 단위 스케일 조정 및 오차 감쇠 기법을 결합한 QTEA는 전용 커널이 필요하며, 관련 코드가 공개되어 있어 활용도가 높습니다.
대규모 언어 모델(LLMs)의 연산 부하를 줄이기 위해, 가중치를 삼원(ternary) 값으로 양자화하는 새로운 프레임워크 'QTEA'가 개발되었습니다.