대규모 언어 모델의 다중 스트림 경로 사용 패턴 분석
How Does mHC Use Its Residual Streams? Selective Routing and Near-Identity Mixing
arXivLLM의 다중 스트림 구조가 실제로 어떻게 작동하는지 분석하여, 정보 흐름 패턴과 잔여 경로 혼합 정도를 심층적으로 조사했습니다.
- 분석 결과, 모델은 네 개 스트림 전체를 사용하기보다 보통 두 개 내외에 집중하며, 스트림 간 혼합(mixing) 현상은 주로 초기 레이어에서만 미미하게 나타났습니다.
- 이는 거대 AI 모델이 가진 잠재적 유연성 중 상당 부분이 실제로는 과도하거나 활용되지 않을 수 있음을 시사하며, 효율적인 구조 설계에 중요한 통찰을 제공합니다.
- 모델 성능은 모든 스트림 사용보다 필요한 소수 스트림에 집중하는 것이 효과적이며, 특정 위치별 고유 패턴 유지가 핵심임을 보여줍니다.
연구진은 DeepSeek-V4-Flash의 네 개 스트림 잔여 경로를 분석하여, 훈련된 모델이 이 용량을 어떻게 사용하는지 조사했습니다. 그 결과, 읽기/쓰기 라우팅은 집중되어 나타나며, 일반적인 어텐션 또는 FFN 사이트에서는 약 두 개의 스트림을 효과적으로 사용합니다. 지배적인 스트림은 레이어별로 변화하며 표현(representation)들은 방향성 있게 구별되는 경향을 보였고, 잔여 혼합(residual mixing)은 미미하여 주로 초기 레이어에서 발생했습니다.
특정 개입 실험을 통해 이러한 패턴의 기능적 중요성이 확인되었습니다. 후기 믹서(late mixers)를 항등 함수로 대체했을 때 C4 퍼플렉시티는 1.9% 증가에 그쳤고 여섯 가지 태스크 평균 점수는 유지되었습니다. 반면, 초기 믹서를 대체할 경우 퍼플렉시티가 41%나 증가했습니다. 또한, 각 초기 믹서를 s C4 진단 평균값으로 고정했을 때 퍼플렉시티는 0.2%만 증가하고 평균 점수는 0.25 퍼센트 포인트 감소하는 것으로 나타났습니다.
이러한 분석은 해당 모델이 네 스트림 mHC가 제공하는 유연성 중 일부만을 실제로 활용함을 시사합니다. 개별 블록들이 모든 네 개의 스트림을 필요로 하는 경우는 드물며, 후기 잔여 혼합이 측정 가능한 이점을 거의 제공하지 않았습니다. 또한, 매 사이트에서 당 가장 큰 세 가지 라우팅 를 유지하는 것이 퍼플렉시티를 최대 2.7% 증가시키고 평균 점수를 최대 0.4 포인트 변화시키는 것으로 관찰되었습니다.
용어 풀이
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- 가중치
- 학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.