모델 연구
Sparse Readout Prism: Explaining Logit-Lens Scores in Features Instead of Tokens
ARarXiv
기존 언어 모델 분석 기법(렌즈)은 예측 결과가 사용된 학습 데이터(코퍼스)에 따라 달라지는 '데이터 종속성'이라는 한계가 있었습니다.
세 줄 요약
- 이를 해결하기 위해 Sparse Readout Prism(SRP)을 도입, 모델의 출력층을 토큰이 아닌 '희소 판독 특징'으로 분해하여 분석합니다.
- SRP는 기존 방식보다 더 많은 예측 차이를 재구성하며, 토큰 단위로는 알 수 없었던 핵심적인 구조적 통찰력을 제공합니다.
- 가장 큰 강점은 구축 과정에서 코퍼스를 사용하지 않아, 학습 데이터의 영향을 받지 않는 독립적이고 안정적인 분석 기준을 제시한다는 점입니다.
기존 언어 모델 분석 기법(렌즈)은 예측 결과가 사용된 학습 데이터(코퍼스)에 따라 달라지는 '데이터 종속성'이라는 한계가 있었습니다.