리서치 연구
LLM 에이전트의 도구 환각 문제와 폐쇄 세계 해결책
Closed-World Resolution Against Tool Hallucination in LLM Agents
arXivLLM 에이전트가 존재하지 않는 가상의 도구를 호출하거나 잘못된 인자를 사용하는 '도구 환각' 문제가 심각한 구조적 취약점으로 밝혀졌습니다.
세 줄 요약
- 기존의 도구 선택이나 게이트 방식으로는 막을 수 없는 이 문제를 해결하기 위해, 등록된 정보만을 기반으로 검증하는 폐쇄 세계 방식의 전용 검증기가 필수적입니다.
- 특히 여러 시스템을 통합하는 복잡한 환경(MCP)에서는 충돌이나 가림 현상으로 인해 새로운 환각 문제가 발생할 수 있어 아키텍처 설계에 중요한 시사점을 줍니다.
- 본 연구는 측정 및 벤치마크에 초점을 맞추었으며, 모든 검증기가 비교 가능한 기준을 제공하기 위해 '환각 도구 벤치마크(HTB)'를 공개했습니다.
도구를 활용하는 (LLM) 는 존재하지 않는 가상의 도구를 호출하거나 스키마가 선언하지 않은 인자를 전달하는 '도구 (Tool Hallucination)' 문제에 직면한다. 기존의 방어 기법들은 올바른 도구 선택이나 실제 도구 사용을 제한하는 방식이었으나, 이는 발화된 호출이 실제로 존재하는 도구를 참조한다는 전제하에만 작동하며, 이로 인해 구조적인 취약점이 발생함을 밝힌다.
연구진은 이러한 문제를 해결하기 위해 등록된 정보만을 기반으로 검증하는 '폐쇄 세계 리졸버(closed-world resolver)'가 필수적이며, 이는 인과적 게이트보다 선행되어야 한다고 주장한다. 본 연구는 5가지 클래스의 도구 환각 분류 체계(H1-H5)를 제시하고, 측정 및 연구를 통해 이 문제를 분석했다.
특히 여러 서버를 하나의 네임스페이스로 통합하는 (MCP)과 같은 복잡한 환경에서는 단일 레지스트리가 표현할 수 없는 환각 표면이 생성될 수 있다. 실제 MCP 환경에서 154건의 환각 사례가 측정되었으며, 연구진은 모든 검증기가 비교 가능하도록 버전별 '환각 도구 벤치마크(HTB)'를 공개했다.
용어 풀이
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
- 환각
- AI가 사실이 아닌 내용을 그럴듯하게 지어내는 현상.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
- 모델 컨텍스트 프로토콜
- AI가 외부 도구·데이터와 연결되는 방식을 정한 공개 표준. Anthropic이 처음 공개했어요.