모델 연구
How Do Linear Probes Emerge? A Circuit-Tracing Framework with Concept-Targeted Attribution
ARarXiv
LLM의 작동 원리를 분석하기 위해 기존 방식이 토큰 예측에만 집중했던 한계를 넘어, '개념 기반 귀인(CTA)'을 활용해 모델 내부 개념 표현 과정을 추적했습니다.
세 줄 요약
- CTA는 모델이 생성할 단어(토큰) 결정 방식과 독립적으로, 내부 개념 표현의 발생 과정을 추적하며 높은 예측력을 입증했습니다.
- 이는 단순 성능 평가를 넘어, 모델 내부의 개념 구조를 기계적으로 분석하여 안전성 등 중요한 영역까지 감사할 수 있는 기반을 제공합니다.
- 특히 개념 귀인과 토큰 예측은 기능적으로 분리된 메커니즘임을 밝혀내어, 모델 작동의 원리를 더욱 정밀하게 이해할 수 있게 합니다.
LLM의 작동 원리를 분석하기 위해 기존 방식이 토큰 예측에만 집중했던 한계를 넘어, '개념 기반 귀인(CTA)'을 활용해 모델 내부 개념 표현 과정을 추적했습니다.