AI의 체계적 일반화 능력 측정: 연역, 귀납, 가추 추론 통합 필요성
What Do Current Systematic Generalization Tasks Miss? A Reasoning-Centered Analysis
arXiv인간 지능의 핵심인 체계적 일반화 능력은 연역, 귀납, 가추 추론 등 복합적인 과정을 요구하지만, 기존 AI 테스트는 이러한 필수 요소를 단순화하여 측정하는 한계를 보여줍니다.
- 연구진이 개발한 'TranSGrid' 평가 도구에 따르면, 최신 트랜스포머 모델들은 통합적 추론 과정에서 현저히 낮은 성능을 기록하며, 단순 지식의 생산성만으로는 일반화 능력을 판단할 수 없음을 입증했습니다.
- 이는 AI가 단순히 학습된 패턴을 조합하는 수준을 넘어, 인간처럼 다층적이고 복잡한 추론 과정을 거쳐야 비로소 새로운 문제에 접근할 수 있음을 시사합니다.
- 따라서 체계적 일반화 능력을 정확히 측정하기 위해서는 연역적, 귀납적, 가추적 추론이 모두 요구되는 통합형 과제 설계가 필수적입니다.
체계적 일반화는 인간 지능의 핵심 요소로, 알려진 원자적 요소를 재조합하여 새로운 문제를 해결하는 능력을 의미합니다. 그러나 기존 연구들은 이러한 복잡한 능력을 통제된 환경에서 엄격하게 측정하기 어렵다는 문제에 직면해 왔습니다. 이 때문에 현재까지의 연구들은 근사적으로 선형적인 행동 조합이나 생산성 기반 테스트 등 일부 단순화된 측면에 의존하여 체계적 일반화를 다루어 왔습니다.
연구진은 이러한 한계를 극복하고자 연역, 귀납, 가추 추론을 하나의 통합된 과제에 결합한 'TranSGrid'라는 평가 도구를 도입했습니다. 7개의 모델을 대상으로 진행된 실험 결과, 가장 큰 규모의 모델조차도 일반적인 테스트 세트에서는 79.6%를 해결했지만, TranSGrid에서는 55.3%에 그쳤으며, 특히 가장 어려운 하위 집합에서는 단 15.8%만을 해결하는 등 현저히 낮은 성능을 보였습니다.
이러한 결과는 생산성만으로는 체계적 일반화 능력을 평가하기 불충분함을 보여줍니다. 또한, TranSGrid에서 귀납적 또는 가추적 요구사항 중 하나를 제거했을 때의 해결률은 다시 일반적인 테스트 세트 수준으로 돌아왔습니다. 이는 기존 과제들이 연역적 또는 귀납적/가추적 추론 중 적어도 한 가지 요소를 줄이고 있음을 보여주며, 체계적 일반화를 포괄적으로 측정하기 위해서는 세 가지 형태의 추론이 모두 요구됨을 시사합니다.
용어 풀이
- 트랜스포머
- 오늘날 대부분의 언어 모델이 쓰는 신경망 구조. 문장 속 단어들의 관계를 한꺼번에 계산해요.