플래시 메모리를 활용한 LLM 추론 가속화 연구 — AI 생성 일러스트AI 일러스트
리서치 연구

플래시 메모리를 활용한 LLM 추론 가속화 연구

LLM Inference in a Flash!

arXiv9월 16일 발표 · 2분 · 심사 전 논문

LLM 추론 작업의 복잡도 증가와 메모리 대역폭 한계에 대응하기 위해, 연산을 메모리 근처로 옮기는 Compute-in-Flash 기술이 주목받고 있습니다.

세 줄 요약arXiv 원문 기반
  1. 연구진은 부동소수점 계산을 제거하는 정수 전용 양자화 기법과 쓰기 내구성을 보완한 KV 캐시 압축 전략을 결합했습니다.
  2. 이 알고리즘 개선은 모델 가중치와 KV 캐시 모두에 적용되어, 동적 KV 캐시 트래픽을 최대 15배까지 줄이는 성과를 보였습니다.
  3. 결과적으로 데이터 전송 비용을 최소화하여 LLM 배포 효율성을 높이며, 하드웨어 제약을 극복한 알고리즘 기반의 접근 방식입니다.

(LLMs)의 추론 작업은 자연어 처리 분야에서 핵심적인 워크로드가 되었으나, 요청이 길고 복잡해지면서 메모리 대역폭 요구 사항이 증가하고 있습니다. Compute-in-Flash는 연산을 메모리 근처로 이동시켜 이러한 메모리 대역폭 한계를 극복할 유망한 해결책으로 주목받고 있습니다. 하지만 이 기술을 LLM에 적용하기 위해서는 높은 정밀도의 부동소수점 연산 지원 부족과 제한적인 쓰기 내구성과 같은 하드웨어적 과제를 해결해야 합니다.

연구진은 이러한 제약을 극복하고자 두 가지 알고리즘 개선 방안을 제시했습니다. 첫째, 값비싼 부동소수점 계산 자체를 제거하는 정수 전용 접근법입니다. 둘째, 제한된 쓰기 내구성을 보완하기 위해 희소 사전 코딩(sparse dictionary coding) 기반의 딕셔너리 방식 압축 전략을 설계했습니다. 이 개선 사항들은 모델 와 KV 캐시 모두에 적용되어 데이터 전송 비용을 최소화하는 것을 목표로 합니다.

이러한 알고리즘적 개선들을 결합하여 Llama-3.1-8B 및 Qwen-2.5-7B 모델에서 테스트를 진행했습니다. 그 결과, 이 방법은 정확도 저하를 제한적으로 유지하면서 동적 KV 캐시 트래픽을 최대 15배까지 줄이는 성과를 보였습니다. 이는 하드웨어의 제약을 알고리즘 개선으로 극복하여 LLM 배포 효율성을 높인 사례입니다.

용어 풀이

대규모 언어 모델
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
양자화
모델 숫자의 정밀도를 낮춰 크기와 메모리 사용을 줄이는 기법. 품질이 조금 떨어질 수 있어요.
KV 캐시
모델이 앞에서 계산한 값을 저장해 두고 다음 토큰을 만들 때 다시 쓰는 메모리. 입력이 길수록 커져요.
가중치
학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
원문arXiv · LLM Inference in a Flash!같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv