모델 연구
Reward-Informed Sparse Autoencoders and the Solution-Completeness Confound
ARarXiv
연구진은 보상 신호를 활용한 희소 오토인코더(RI-SAE)를 구축하여 언어 모델의 활성화를 해석 가능한 특징으로 분해했다.
세 줄 요약
- Llama-3.1-8B에서 16,384개 중 일부 특징이 고보상/저보상 추론 경로를 분리했으나, 이 분리는 주로 해결 완료도와 관련되었다.
- TF-IDF 텍스트 분류기나 구조적 단서만으로도 유사한 클래스 분리가 가능했으며, 이는 보상 신호가 완성 형태에 더 많이 의존함을 보여준다.
- 보상 필터링은 레이블이 필요 없는 방식으로 RL 신호를 해석성에 재사용할 수 있지만, 대부분의 결과는 완료 형식과 관련된다.
연구진은 보상 신호를 활용한 희소 오토인코더(RI-SAE)를 구축하여 언어 모델의 활성화를 해석 가능한 특징으로 분해했다.