리서치 연구
구조화된 반증적 추론을 위한 엔진 검증 벤치마크 'ArgGYM'
ArgGYM: A Procedural, Engine-Verified Benchmark for Structured Defeasible Reasoning
arXivLLM의 추론 능력을 평가하기 위해, 정보가 불완전하고 수정 가능한 현실적 상황을 다루는 '반증적 추론(defeasible reasoning)' 벤치마크인 ArgGYM이 개발되었습니다.
세 줄 요약
- ArgGYM은 논증 엔진을 활용해 추론 과정을 구조화하여 점수화하며, 모델들이 전체 문제를 풀지 못해도 부분적인 답안 복구 등 성능의 미묘한 차이를 측정합니다.
- 기존처럼 정답이 고정된 환경을 넘어, 실제 복잡하고 변화무쌍한 상황에서의 LLM 추론 능력을 객관적으로 평가할 수 있는 새로운 기준을 제시했습니다.
- 고정된 테스트 세트에 의존하지 않고도 새로운 인스턴스를 생성하여 재현성이 높으며, 구조화된 반증적 추론에 초점을 맞춘 것이 특징입니다.
LLM의 추론 능력을 평가하기 위해, 정보가 불완전하고 수정 가능한 현실적 상황을 다루는 '반증적 추론(defeasible reasoning)' 벤치마크인 ArgGYM이 개발되었습니다.