LLM 추론 최적화의 비용-품질-지연시간 파레토 아틀라스 분석 — AI 생성 일러스트AI 일러스트
리서치 연구

LLM 추론 최적화의 비용-품질-지연시간 파레토 아틀라스 분석

The Inference Engineering Pareto Atlas: Which Optimizations Dominate the Cost, Quality, and Latency Frontier?

arXiv9월 17일 발표 · 3분 · 심사 전 논문

LLM 추론 최적화는 모델, GPU, 품질 지표가 달라 비교하기 어려웠으나, 연구진이 비용-품질-지연시간을 통합한 파레토 아틀라스를 구축하여 최적 구성을 제시했습니다.

세 줄 요약arXiv 원문 기반
  1. 개별적인 방법보다 여러 최적화를 조합하는 것이 성능 우위를 점했으며, 특히 FP8 가중치 사용은 정확도를 유지하면서 지연시간과 비용을 크게 줄이는 핵심 결과를 보여주었습니다.
  2. 최적의 선택은 사용 목적과 제약 조건에 따라 달라지며, H100은 낮은 지연시간에, A100은 높은 처리량 및 저비용 구현에 유리함을 구체적으로 알려줍니다.
  3. 단순히 속도만으로는 충분하지 않으며 품질 테스트가 필수적입니다. 따라서 최적의 솔루션은 사용하려는 GPU 종류와 시스템이 요구하는 정확한 제약 조건에 따라 결정해야 합니다.

(LLM)의 추론 최적화는 사용되는 모델, 종류, 및 품질 지표가 다양하여 비교하거나 결합하기 어려웠습니다. 이에 연구진은 비용, 품질, 지연시간을 통합한 파레토 아틀라스를 구축하여 다양한 배포 제약 조건에 맞는 최적 구성을 식별했습니다. 이들은 Qwen2.5-7B-Instruct 모델을 vLLM 0.12를 사용하여 L4, A100, H100 GPU에서 총 54가지 구성을 측정하고 이를 시뮬레이터의 기준으로 삼았습니다.

개별적인 최적화 방법보다 여러 방법을 조합했을 때 파레토 프론티어에 도달하는 경우가 더 많다는 결과가 나왔습니다. 예를 들어, AWQ 4bit는 L4에서 당 지연시간을 기준 대비 0.34배로 줄였으나, GSM8K 정확도를 5.9% 감소시키는 트레이드오프를 보였습니다. 반면 FP8 는 모든 GPU에서 기준 대비 0.61~0.65배의 낮은 지연시간과 높은 정확도(99.4%)를 유지하며 여러 우수 영역에서 발견되었습니다.

최적의 선택은 시스템이 요구하는 제약 조건에 따라 달라지며, 단순히 속도만으로는 충분하지 않아 품질 테스트가 필수적입니다. 분석 결과, H100 GPU는 낮은 지연시간 측면에서 강점을 보였으며, A100 GPU는 처리량과 저비용(밀리언 토큰당 0.106달러) 측면에서 유리한 것으로 나타났습니다.

용어 풀이

대규모 언어 모델
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
GPU
많은 계산을 한꺼번에 처리하는 칩. AI 학습과 실행에 가장 많이 써요.
프롬프트
AI에게 주는 지시나 질문 글.
토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
가중치
학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
원문arXiv · The Inference Engineering Pareto Atlas: Which Optimizations Dominate the Cost, Quality, and Latency Frontier?같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv