AI 모델의 단순성이 작동 원리 복잡성을 예측하는가?
Representational Simplicity and Circuit Size Dissociate in a Threshold-Dependent Way: A Controlled Test via Adversarial Training
arXivAI 모델의 내부 표현 단순성이 실제 작동 원리(인과 회로)의 복잡성을 예측하는지, 연구진이 통제된 실험을 통해 검증했습니다.
- 특히 적대적 학습으로 견고성을 높인 모델은 고충실도 수준에서 표준 모델 대비 현저히 작은 인과 회로 크기를 보여 차이를 입증했습니다.
- 이는 모델의 '표현적 단순성'이 단순히 외형을 넘어, 근본적인 작동 메커니즘의 단순성을 예측하는 중요한 지표가 될 수 있음을 시사합니다.
- 다만, 이러한 인과 구조의 단순성은 높은 충실도(90%, 95%)를 유지하기 위해 모델이 적대적 학습으로 견고성을 확보했을 때 관찰되는 현상입니다.
본 연구는 모델의 표현적(representational) 또는 귀속적(attributional) 단순성이 실제로 인과 회로 크기(causal circuit size)의 단순성으로 이어지는지 통제된 실험을 통해 검증했습니다. 기존에는 희소 자동인코더 분해 가능성이나 집중된 특징 기여도가 모델의 역공학이 용이하다는 증거로 간주되었으나, 이는 인과 회로 크기를 예측하는지에 대해서는 미개척 분야였습니다. 연구진은 GPT-2 Small 체크포인트에서 시작하여 표준 및 적대적 지속 학습(adversarial continual training)을 적용하고, 모델의 행동 복구에 필요한 인과 구조의 복잡성을 역공학적으로 분석했습니다.
모델 비교는 희소 자동인코더 분해 가능성, 작업 귀속에서의 SAE 특징 참여도, 그리고 원시 계산 그래프에서 복구된 충실한 회로 크기 세 가지 축을 따라 이루어졌습니다. 그 결과, 표준 학습 모델은 IOI(간접 목적어 식별)와 같은 역량 매칭 조건에서 85% 미만의 충실도 수준에서 유사하거나 낮은 에지 수를 보였으나, 적대적 학습으로 견고성을 확보한 모델은 높은 충실도(90%, 95%)를 유지하기 위해 현저히 적은 수의 에지를 필요로 하는 패턴이 관찰되었습니다. 이러한 경향성은 여러 조건에 걸쳐 일반화됨을 확인했습니다.