경사 하강법으로 학습한 매트릭스 메모리의 구조적 연관성 구현
When the Gradient Sees Rank: Provable Necessity, Causal Recruitment, and Composition in Trained Matrix Memories
arXiv연구진은 경사 하강법을 활용하여 매트릭스 메모리에 여러 연관 관계를 저장하고 이를 조합하는 방법을 성공적으로 구현했습니다.
- 학습된 메모리의 유효 랭크가 필요한 정보량($K$)에 비례하여 증가하는 것이 확인되어, 복잡한 구조적 지식 처리가 가능함을 입증했습니다.
- 이는 AI가 단순 데이터 저장을 넘어, 여러 요소 간의 복잡하고 구조적인 연관 관계를 학습하고 추론하는 능력을 갖추었음을 보여줍니다.
- 다만, 인코더 폭을 고정했을 경우 매트릭스 차원이 커지면 메모리 복구 성능이 저하되는 한계점도 발견되었습니다.
본 연구는 경사 하강법(gradient-based training)을 활용하여 매트릭스 메모리가 여러 연관 관계를 저장하고 이를 조합하는 데 필요한 랭크를 학습할 수 있는지 탐구했습니다. 연구진은 $K$개의 새로운 키-값 바인딩에 대해 매트릭스 메모리를 훈련시켰으며, 이들의 정확한 선형 복구를 위해서는 $\mathrm{rank}(Z) \geq K$가 필요합니다. 고정된 선형 판독기(readout)는 원래의 바인딩 정보 없이 단일 매트릭스 상태만을 질의하여 정보를 회수하는 실험을 진행했습니다.
실험 결과, 학습된 유효 랭크는 테스트 그리드 전반에 걸쳐 필요한 정보량 $K$와 함께 증가하는 것이 확인되었으며 (Spearman $\rho = 1.0$ at $d = 16$), 이는 복잡한 구조적 지식 처리가 가능함을 입증합니다. 특히, 훈련 시 랭크를 제한했을 때(rank caps), $k=K$ 근처에서 회복 전환이 관찰되었습니다. 예를 들어, $d=8$, $K=4$ 조건에서 랭크 3은 최대 0.0004의 복구율을 보인 반면, 랭크 4는 0.97의 높은 복구율을 기록했습니다.
이러한 학습된 연산자는 엔티티 부분 공간(entity subspace)에서 $K$에 가까운 유효 랭크를 가지며 이상적인 사이클을 근사합니다. 또한, 네 번의 시도 중 다섯 번 모두가 21회 자가 적용 후에도 최소 0.9996 이상의 복구율을 유지하는 높은 안정성을 보였습니다. 다만, 훈련을 확장했음에도 불구하고 인코더 폭을 고정했을 경우 매트릭스 차원이 커지면 메모리 복구 성능이 저하되는 한계점도 발견되었습니다.