모델 연구
From Causal Plausibility to Causal Reliability: Evaluating LLMs as Calibrated Direct Causal-Edge Classifiers
ARarXiv
대규모 언어 모델(LLM)의 구조적 인과 발견 활용 가능성을 평가하고, 그들의 간선 판단 신뢰도를 분석했다.
세 줄 요약
- 모델들은 인과 관련성은 포착했으나, 간접 관계의 40.0%와 역방향 비간선이 직접 간선으로 오분류되었다. 또한 이들 오류 예측 중 상당수가 높은 신뢰도를 보였다.
- LLM의 판단은 구조적 인과성의 직접적인 증거라기보다 외부에서 검증된 부드러운 인과 사전 지식으로 활용하는 것이 적절하다.
- 기존의 신뢰도 추정치는 신뢰하기 어려우며, 모델 규모가 커져도 오분류를 완전히 제거하지 못하는 한계가 있다.
대규모 언어 모델(LLM)의 구조적 인과 발견 활용 가능성을 평가하고, 그들의 간선 판단 신뢰도를 분석했다.