GRASP: 에이전트 AI 기반 전략적 계획 수립 프레임워크
GRASP: Generating, Revising, and Assessing for Strategic Planning with Agentic AI
arXiv복잡한 계획 수립 시 LLM의 신뢰도 저하 문제를 해결하기 위해, GRASP는 전역 가이드라인 생성(GenPlan), 국소 전략 탐색(RevPlan), 독립 평가(VerPlan)의 3단계 모듈로 작동하는 다단계 프레임워크입니다.
- GRASP는 다양한 데이터셋에서 최고 수준의 성능을 입증했으며, 특히 여러 작업을 동시에 수행해야 하는 복합 환경에서도 성능 저하를 완벽히 방지하며 최대 16.7%의 절대적 정확도 개선을 달성했습니다.
- 이 연구는 단순한 계획 생성을 넘어, 다단계 추론과 전략적 판단이 필수적인 실제 에이전트 기반 시스템에서 LLM의 안정성과 실용성을 혁신적으로 높일 수 있음을 보여줍니다.
- GRASP가 최고 성능 모델을 능가하는 핵심은 컨텍스트를 분리하고 엄격한 매크로 규제(macro-regularization)를 적용하여 계획 과정의 구조적 안정성과 신뢰도를 극대화했기 때문입니다.
(LLMs)은 일반적으로 작업 복잡도가 증가함에 따라 신뢰성 성능이 저하되는 경향을 보입니다. 이러한 문제를 해결하기 위해, 연구진은 GRASP라는 전략 인식 다단계 계획 프레임워크를 도입했습니다. GRASP는 계획 파이프라인을 전문화되고 컨텍스트가 격리된 여러 모듈로 분리합니다. 구체적으로 전역 거시 가이드라인을 미리 컴파일하는 GenPlan, 고립된 내에서 대안적 국소 전략을 탐색하는 RevPlan, 그리고 다중 기준 판별기를 사용하여 궤적을 독립적으로 평가하는 VerPlan으로 구성됩니다.
실험적 평가는 GRASP가 다양한 데이터셋에서 최고 수준의 성능을 지속적으로 달성했음을 보여줍니다. 특히 Natural Plan Calendar Scheduling에서는 직접적인 LLM 플래너 대비 약 12.4%의 정확도 향상을, ZebraLogic에서는 약 30.8%의 향상을 기록했습니다. 또한, 컨텍스트를 격리하고 엄격한 거시 규제(macro-regularization)를 적용함으로써 GRASP는 GPT-5-mini와 같은 최첨단 보다 14.5% 높은 성능을 보였습니다.
GRASP의 핵심 강점 중 하나는 다중 작업 확장성입니다. 기존 플래너들이 즉각적인 성능 붕괴를 겪는 다중 작업 환경에서도 GRASP는 이러한 성능 저하 페널티를 완전히 평탄화합니다. 인터리브된 이중 작업 환경에서는 직접적인 LLM 플래너 대비 최대 16.7%의 절대적 정확도 향상을 달성하며, 복잡한 계획 수립에 있어 높은 안정성과 실용성을 입증했습니다.
용어 풀이
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 컨텍스트 창
- 모델이 한 번에 읽고 참고할 수 있는 입력의 최대 길이. 보통 토큰 수로 나타내요.
- 추론 모델
- 답하기 전에 단계별로 생각하는 과정을 거치도록 만든 모델.