LLM의 추론 비용 절감을 위한 상관관계 인식 구조적 가지치기 — AI 생성 일러스트AI 일러스트
리서치 연구

LLM의 추론 비용 절감을 위한 상관관계 인식 구조적 가지치기

Correlation-Aware Structured Pruning for Large Language Models

arXiv9월 22일 발표 · 3분 · 심사 전 논문

대규모 언어 모델(LLM)의 막대한 추론 비용을 줄이기 위해 '상관관계 인식 구조적 가지치기' 기법이 제안되었습니다.

세 줄 요약arXiv 원문 기반
  1. 기존 방식들이 단위별 독립성을 가정했던 한계를 넘어, 모델 가중치의 비직교성과 단위 간 상관관계를 명시적으로 고려하여 최적화합니다.
  2. 단순한 경량화를 넘어 정확도와 효율성 사이의 균형을 개선했기에, 고성능 AI 모델의 실제 상용 배포에 큰 기여를 할 수 있습니다.
  3. 모델의 복잡한 단위 간 의존성을 다루기 위해, 최적화 문제를 풀 때 '의존성 인식 탐욕 상호작용 알고리즘'을 적용했습니다.

(LLMs)의 막대한 추론 비용을 줄이기 위해 '구조적 가지치기(Structured pruning)'가 유망한 접근법으로 제시됩니다. 기존 방식들은 채널이나 헤드 같은 단위들의 중요도를 개별적으로 평가하며, 가지치기 오류가 독립적으로 누적된다고 암묵적으로 가정했습니다. 그러나 모델 의 비직교성 및 단위 활성화 간의 강한 상관관계로 인해 이러한 독립성 가정이 무효화될 수 있으며, 이는 성능 저하를 초래할 수 있습니다.

이러한 문제를 해결하기 위해 '상관관계 인식 구조적 가지치기(Correlation-Aware Structured Pruning)' 방법이 제안됩니다. 이 방법은 재구성 오차에서 단위 간 의존성을 명시적으로 모델링하는, 카디널리티 제한을 가진 이진 이차 프로그램으로 가지치기 목표를 공식화합니다. 하지만 해당 이진 이차 프로그램은 NP-hard 문제로 정확하게 풀기 어렵습니다.

따라서 연구진은 단위 선택 최적화를 위해 '의존성 인식 탐욕 상호작용 알고리즘(dependency-aware marginal costs)'을 기반으로 한 그리디 인터랙션 알고리즘을 개발했습니다. 또한, 모델 전체에 걸쳐 적응적인 레이어별 희소성 할당을 달성하기 위해 경사 기반 전략을 통합했습니다. 주요 LLM에 대한 광범위한 실험 결과, 상관관계 정보를 포함하는 것이 대표적인 구조적 가지치기 기준선 대비 경쟁력 있는 정확도-효율성 트레이드오프를 제공함을 입증했습니다.

용어 풀이

대규모 언어 모델
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
가중치
학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
원문arXiv · Correlation-Aware Structured Pruning for Large Language Models같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv