LLM 프롬프트 압축을 위한 학습 불필요 결정론적 파이프라인 연구
Lexical Prompt Compression for Large Language Models: A Training-Free, Deterministic Pipeline with Empirical Pareto Analysis Across Eleven Task Categories
arXivLLM 프롬프트의 크기 증가로 인한 비용 및 지연 시간 문제를 해결하기 위해, 학습 과정이 필요 없는 결정론적(deterministic) 고전 NLP 기반 압축 파이프라인을 제시했습니다.
- 본 파이프라인은 최대 평균 토큰 40.3%를 줄였음에도 불구하고, 원본 프롬프트 대비 높은 성능(BERTScore-F1: 0.876)을 유지하는 것으로 실증되었습니다.
- 복잡한 학습 모델 없이도 프롬프트 길이를 효율적으로 압축할 수 있어, LLM 서비스의 추론 비용과 속도를 개선하는 데 큰 실용적 가치를 제공합니다.
- 다만, 압축률이 높아질수록 성능 저하가 발생하며, 특히 상식 추론(commonsense reasoning) 같은 영역에서는 시스템적인 실패 양상이 관찰되는 한계도 확인되었습니다.
최근 의 발전으로 인해 가 복잡하고 커지면서 추론 비용과 지연 시간이 증가하는 문제가 발생했습니다. 기존에 제시된 LLMLingua나 Selective Context 같은 학습 기반 압축 방법들은 높은 압축률을 보이지만, 보조 언어 모델이 필요하며 결정론적이지 않다는 한계가 있습니다. 본 연구는 이러한 문제점을 해결하기 위해 고전적인 어휘 NLP(lexical NLP)를 기반으로 하며, 훈련 과정이 필요 없고 완전히 결정론적인 CPU 전용 파이프라인을 구축하는 데 초점을 맞췄습니다.
제안된 파이프라인은 불용어 제거, 채움 구문 삭제, 축약 및 약어 대체, 품사 기반 가지치기 등 총 열한 가지의 토글 가능한 어휘 변환 기법들을 조합하여 구성되었습니다. 연구진은 이들 중 15가지의 다양한 설정을 평가했으며, Dolly-15k, LMSYS-Chat-1M 등 여섯 개 출처에서 수집된 1,242개의 영어 전용 프롬프트를 대상으로 총 열한 가지 자동 분류된 태스크 카테고리에서 실험을 진행했습니다.
실험 결과, 가장 공격적인 압축 설정은 평균 을 40.3% 감소시키면서도 BERTScore-F1 점수 0.876을 기록하여 원본 프롬프트 대비 높은 출력 보존율을 입증했습니다. 특히 불용어만 제거한 설정에서는 29.6%의 토큰 감소와 0.913의 BERTScore-F1을 달성했습니다. 다만, 압축률이 높아질수록 성능 저하가 발생하며, 상식 추론(commonsense reasoning)과 같은 영역에서 시스템적인 실패 양상이 관찰되는 한계점도 확인되었습니다.
용어 풀이
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 프롬프트
- AI에게 주는 지시나 질문 글.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.