리서치 연구
Discovering Cross-Language Reasoning Invariance in LLMs with Geometry-Invariant Sparse Autoencoders
ARarXiv
다국어 모델이 여러 언어로 수학 문제를 풀 때, 공유된 특징을 사용하는지 여부를 기하학 불변 희소 오토인코더(GI-SAE)로 연구했다.
세 줄 요약
- 연구진은 MGSM 데이터셋을 이용해 영어, 독일어 등 여섯 개 언어를 다루었으며, GI-SAE는 InfoNCE 손실을 추가하여 활성화를 훈련한다.
- 언어 간 특징 공유는 모델과 아키텍처에 따라 달라지며, GI-SAE가 기존의 언어 간 구조를 증폭시키는 경향이 있다.
- GI-SAE가 높은 CKA와 Jaccard 유사도를 보였으나, 이것이 반드시 더 큰 기능적 상호 교환 가능성을 의미하는 것은 아니다.
다국어 모델이 여러 언어로 수학 문제를 풀 때, 공유된 특징을 사용하는지 여부를 기하학 불변 희소 오토인코더(GI-SAE)로 연구했다.