리서치 연구
트랜스포머 게이트 임계값은 공통 기준 방향에 의존한다
Transformer MLP Gate Thresholds Are Couplings to a Carried Reference Direction
arXiv트랜스포머의 MLP 게이트 임계값은 독립적이지 않고, 모든 입력에 공통적으로 존재하는 '캐리된 기준 방향'을 참조하여 작동하는 것이 밝혀졌습니다.
세 줄 요약
- 이 기준 방향의 투영을 제거하자 게이트 활성화가 약 9배 급감하는 것이 확인되어, 해당 방향이 모델 기능 수행에 결정적인 역할을 함을 입증했습니다.
- 이는 AI가 단순히 복잡한 계산을 넘어, 데이터 분포에서 추출된 공통 기준점을 활용하여 작동한다는 근본적인 원리를 제시합니다.
- 다만 모든 아키텍처가 동일하게 적용되는 것은 아니며, 일부 모델은 LayerNorm 바이어스 등 다른 요소로 인해 이 기준 방향이 상쇄될 수 있습니다.
모델의 잔여 스트림(residual stream)은 모든 입력에서 공유되는 '코퍼스 평균 방향'을 가지며, 이 방향이 MLP 게이트가 작동하는 핵심적인 참조점 역할을 하는 것으로 분석되었다. 기존에는 이러한 공통 방향이 표현 분석 전에 제거되어 왔으나, 연구 결과는 이것이 기능적 구성 요소임을 입증했다.
Phi-2 모델의 구체적인 게이트 비활성화(inhibition) 전 활성화를 분석한 결과, 중반 레이어에서 >99.9% 이상의 게이트가 이 캐리된 평균 방향과의 결합($w \cdot b_L$)에 의해 제어되는 것이 확인되었다. 특히, 스트림의 투영을 기준 방향에서 제거하자 임계값 초과 발화(above-threshold firing)가 약 9배 증가하는 등 기능적 의존성이 입증되었다.
이러한 메커니즘은 GELU 및 SiLU 계열의 여러 가족에서도 재현되었으나, 모든 아키텍처에 동일하게 적용되지는 않는다. 예를 들어, OPT 모델에서는 역방향 LayerNorm 바이어스가 이 캐리된 기준 방향을 상쇄시키는 것으로 관찰되었다.
용어 풀이
- 트랜스포머
- 오늘날 대부분의 언어 모델이 쓰는 신경망 구조. 문장 속 단어들의 관계를 한꺼번에 계산해요.