실시간 에이전트를 위한 거대 모델 압축 기술 연구
Distilling Foundation Models for Agentic What-If Reasoning:Cost, Latency, and Governance in a Hybrid LLM+SLM Architecture
arXiv고성능의 거대 기반 모델(Foundation Models)은 정확도가 높지만, 긴 추론 지연 시간 때문에 실시간 에이전트 시스템에 적용하기 어려웠습니다.
- 연구진은 이 모델을 경량화하여 수천만 개의 파라미터를 수천 개 수준으로 압축했음에도 95% 이상의 높은 정확도를 유지했습니다.
- 이는 AI의 추론 성능을 극대화하면서 속도까지 획기적으로 개선해, 실시간 의사결정이 필요한 지능형 에이전트 구축을 가능하게 합니다.
- 모델 경량화 과정에서 발생하는 성능 손실을 최소화하려면 원본 모델의 부드러운 목표값(soft targets) 활용이 핵심입니다.
표 형식의 기반 모델(Tabular foundation models)은 인컨텍스트 학습을 통해 높은 예측 성능을 제공하지만, 추론 지연 시간(inference latency)이 길어 실시간 상호작용 루프에서 활용하기 어렵다는 문제가 있습니다. 본 연구는 이러한 문제를 해결하기 위해 TabPFN 교사 모델을 작고 효율적인 피드포워드 학생 모델로 증류하는 방법을 제시했습니다.
UCI Adult 및 5개의 OpenML 를 대상으로 한 비즈니스 의사결정 시뮬레이션에서, 이 경량화 과정은 상당한 압축률을 보여주었습니다. 분류 헤드의 경우 53.2M 를 8,546개로 (6,220배) 줄였으며, 배포된 두 개의 헤드 대출 파이프라인은 111.4M 파라미터를 17,059개로 (6,532배) 압축했습니다.
압축에도 불구하고 학생 모델은 높은 성능을 유지하여 95.4-100.5%의 정확도와 96.8-100.0%의 AUC를 보였습니다. 가장 낮은 정확도 유지율은 credit-g에서 95.4%로 기록되었습니다. 또한, 교사의 소프트 타겟을 활용한 alpha = 0 하드 레이블 제어 방식과 비교했을 때, 소프트 타겟이 2.1-7.0 AUC 포인트의 성능 향상을 제공하는 것으로 나타났습니다.
용어 풀이
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
- 파라미터
- 모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.