LLM 프롬프트 압축을 위한 학습 불필요 결정론적 파이프라인 연구 — AI 생성 일러스트
리서치 연구

LLM 프롬프트 압축을 위한 학습 불필요 결정론적 파이프라인 연구

Lexical Prompt Compression for Large Language Models: A Training-Free, Deterministic Pipeline with Empirical Pareto Analysis Across Eleven Task Categories

arXiv9월 15일 발표 · 3분 · 프리프린트

LLM 프롬프트의 크기 증가로 인한 비용 및 지연 시간 문제를 해결하기 위해, 학습 과정이 필요 없는 결정론적(deterministic) 고전 NLP 기반 압축 파이프라인을 제시했습니다.

세 줄 요약arXiv 원문 기반
  1. 본 파이프라인은 최대 평균 토큰 40.3%를 줄였음에도 불구하고, 원본 프롬프트 대비 높은 성능(BERTScore-F1: 0.876)을 유지하는 것으로 실증되었습니다.
  2. 복잡한 학습 모델 없이도 프롬프트 길이를 효율적으로 압축할 수 있어, LLM 서비스의 추론 비용과 속도를 개선하는 데 큰 실용적 가치를 제공합니다.
  3. 다만, 압축률이 높아질수록 성능 저하가 발생하며, 특히 상식 추론(commonsense reasoning) 같은 영역에서는 시스템적인 실패 양상이 관찰되는 한계도 확인되었습니다.

최근 의 발전으로 인해 가 복잡하고 커지면서 추론 비용과 지연 시간이 증가하는 문제가 발생했습니다. 기존에 제시된 LLMLingua나 Selective Context 같은 학습 기반 압축 방법들은 높은 압축률을 보이지만, 보조 언어 모델이 필요하며 결정론적이지 않다는 한계가 있습니다. 본 연구는 이러한 문제점을 해결하기 위해 고전적인 어휘 NLP(lexical NLP)를 기반으로 하며, 훈련 과정이 필요 없고 완전히 결정론적인 CPU 전용 파이프라인을 구축하는 데 초점을 맞췄습니다.

제안된 파이프라인은 불용어 제거, 채움 구문 삭제, 축약 및 약어 대체, 품사 기반 가지치기 등 총 열한 가지의 토글 가능한 어휘 변환 기법들을 조합하여 구성되었습니다. 연구진은 이들 중 15가지의 다양한 설정을 평가했으며, Dolly-15k, LMSYS-Chat-1M 등 여섯 개 출처에서 수집된 1,242개의 영어 전용 프롬프트를 대상으로 총 열한 가지 자동 분류된 태스크 카테고리에서 실험을 진행했습니다.

실험 결과, 가장 공격적인 압축 설정은 평균 을 40.3% 감소시키면서도 BERTScore-F1 점수 0.876을 기록하여 원본 프롬프트 대비 높은 출력 보존율을 입증했습니다. 특히 불용어만 제거한 설정에서는 29.6%의 토큰 감소와 0.913의 BERTScore-F1을 달성했습니다. 다만, 압축률이 높아질수록 성능 저하가 발생하며, 상식 추론(commonsense reasoning)과 같은 영역에서 시스템적인 실패 양상이 관찰되는 한계점도 확인되었습니다.

용어 풀이

LLM
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
프롬프트
AI에게 주는 지시나 질문 글.
토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
원문arXiv · Lexical Prompt Compression for Large Language Models: A Training-Free, Deterministic Pipeline with Empirical Pareto Analysis Across Eleven Task Categories
원문 보기arXiv