모델 연구
The Calls are Coming from Inside the Model: Investigating Probe-based Detection of Tool-Calling Errors in LLMs
ARarXiv
LLM이 외부 도구를 사용할 때 발생하는 오류를 탐지하기 위해, 모델의 숨겨진 내부 상태 정보를 활용하는 새로운 기법을 제안했습니다.
세 줄 요약
- 모델의 숨겨진 상태에 '프로빙' 기법을 적용하여, 일반적인 로깅으로는 감지하기 어려웠던 잘못된 인자 사용 등 다양한 도구 호출 오류들을 성공적으로 포착했습니다.
- 이 기술은 LLM 기반 시스템의 신뢰성을 높이는 데 필수적이며, 실제 배포 환경에서 발생하는 미지의 오류에도 일반화하여 대응할 수 있는 가능성을 보여줍니다.
- 다만, 오류 감지 성능은 모델의 크기, 분석에 사용되는 내부 레이어(층), 그리고 모델의 후처리 훈련 방식 등 다양한 요소에 영향을 받는 것으로 확인되었습니다.
LLM이 외부 도구를 사용할 때 발생하는 오류를 탐지하기 위해, 모델의 숨겨진 내부 상태 정보를 활용하는 새로운 기법을 제안했습니다.