모델 연구

Why Gated DeltaNet Survives 4-Bit Quantization: NVFP4 W4A4 for the Recurrent Half of a Hybrid 27B LLM

ARarXiv9월 3일 발표 · 1분 · 심사 전 논문

연구진은 하이브리드 LLM의 핵심 구성 요소인 Gated DeltaNet(GDN)을 포함한 모든 레이어를 4비트로 양자화하는 새로운 기법 'Minima'를 개발했습니다.

세 줄 요약arXiv 원문 기반
  1. 이 방식은 기존 고정밀도 모델과 유사한 성능을 유지하면서 메모리 사용량을 대폭 줄이고 추론 속도를 높이는 높은 효율성을 입증했습니다.
  2. 특히 LLM의 재귀적 구조가 양자화 오류에 강하다는 점을 밝혀, 대규모 언어 모델의 경량화 및 온디바이스 배포 가능성을 크게 높였습니다.
  3. 최적의 성능을 위해서는 모든 모듈을 일괄적으로 양자화하고 KV 캐시 스케일링 등 시스템 전반의 최적화가 필수적임을 제시합니다.

연구진은 하이브리드 LLM의 핵심 구성 요소인 Gated DeltaNet(GDN)을 포함한 모든 레이어를 4비트로 양자화하는 새로운 기법 'Minima'를 개발했습니다.

원문arXiv · Why Gated DeltaNet Survives 4-Bit Quantization: NVFP4 W4A4 for the Recurrent Half of a Hybrid 27B LLM같은 주제 가이드 · 바로 써 보기내 업무 예시로 AI 모델 비교하기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기