모델 연구
Shared circuits predict whether LLMs generalize across formats in arithmetic reasoning
ARarXiv
LLM이 산술 추론 등에서 입력 형식의 사소한 변화에도 취약하다는 문제를 제기하고, 이 일반화 능력을 모델 내부 회로 구조 분석으로 예측하는 방법을 제시했습니다.
세 줄 요약
- 모델이 특정 형식을 풀 때 사용하는 내부 회로가 기본적인 숫자 계산 회로와 얼마나 겹치는지(중첩)를 분석한 결과, 이 중첩 정도가 일반화 난이도 및 정확도를 결정짓는 핵심 지표임을 밝혀냈습니다.
- 이는 단순히 모델의 성능을 측정하는 것을 넘어, LLM이 특정 추론 능력을 어떤 내부 구조로 습득하고 형식 변화에 맞춰 일반화하는지 근본적인 원리를 이해할 수 있게 합니다.
- 연구진은 '어트리뷰션 패칭' 기법을 활용하여 산술 추론과 같은 특정 유형의 문제에서 모델의 일반화 예측 가능성을 성공적으로 검증했습니다.
LLM이 산술 추론 등에서 입력 형식의 사소한 변화에도 취약하다는 문제를 제기하고, 이 일반화 능력을 모델 내부 회로 구조 분석으로 예측하는 방법을 제시했습니다.