실시간 에이전트를 위한 거대 모델 압축 기술 연구 — AI 생성 일러스트AI 일러스트
리서치 연구

실시간 에이전트를 위한 거대 모델 압축 기술 연구

Distilling Foundation Models for Agentic What-If Reasoning:Cost, Latency, and Governance in a Hybrid LLM+SLM Architecture

arXiv9월 16일 발표 · 2분 · 심사 전 논문

고성능의 거대 기반 모델(Foundation Models)은 정확도가 높지만, 긴 추론 지연 시간 때문에 실시간 에이전트 시스템에 적용하기 어려웠습니다.

세 줄 요약arXiv 원문 기반
  1. 연구진은 이 모델을 경량화하여 수천만 개의 파라미터를 수천 개 수준으로 압축했음에도 95% 이상의 높은 정확도를 유지했습니다.
  2. 이는 AI의 추론 성능을 극대화하면서 속도까지 획기적으로 개선해, 실시간 의사결정이 필요한 지능형 에이전트 구축을 가능하게 합니다.
  3. 모델 경량화 과정에서 발생하는 성능 손실을 최소화하려면 원본 모델의 부드러운 목표값(soft targets) 활용이 핵심입니다.

표 형식의 기반 모델(Tabular foundation models)은 인컨텍스트 학습을 통해 높은 예측 성능을 제공하지만, 추론 지연 시간(inference latency)이 길어 실시간 상호작용 루프에서 활용하기 어렵다는 문제가 있습니다. 본 연구는 이러한 문제를 해결하기 위해 TabPFN 교사 모델을 작고 효율적인 피드포워드 학생 모델로 증류하는 방법을 제시했습니다.

UCI Adult 및 5개의 OpenML 를 대상으로 한 비즈니스 의사결정 시뮬레이션에서, 이 경량화 과정은 상당한 압축률을 보여주었습니다. 분류 헤드의 경우 53.2M 를 8,546개로 (6,220배) 줄였으며, 배포된 두 개의 헤드 대출 파이프라인은 111.4M 파라미터를 17,059개로 (6,532배) 압축했습니다.

압축에도 불구하고 학생 모델은 높은 성능을 유지하여 95.4-100.5%의 정확도와 96.8-100.0%의 AUC를 보였습니다. 가장 낮은 정확도 유지율은 credit-g에서 95.4%로 기록되었습니다. 또한, 교사의 소프트 타겟을 활용한 alpha = 0 하드 레이블 제어 방식과 비교했을 때, 소프트 타겟이 2.1-7.0 AUC 포인트의 성능 향상을 제공하는 것으로 나타났습니다.

용어 풀이

에이전트
목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
파라미터
모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
원문arXiv · Distilling Foundation Models for Agentic What-If Reasoning:Cost, Latency, and Governance in a Hybrid LLM+SLM Architecture같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv