모델 연구
Attention Sensitivity Is Not Enough: Dissociating Attention-Level and Behavioural In-Context Learning under Fine-Tuning
ARarXiv
LLM의 인컨텍스트 학습(ICL) 안정성을 평가할 때, 단순히 어텐션 메커니즘의 변화만으로는 충분하지 않다는 연구 결과가 발표되었습니다.
세 줄 요약
- 연구진은 어텐션 민감도를 높이는 방향으로 모델을 최적화했을 때, 실제 성능 지표인 정확도가 오히려 하락하는 '굿하트 분리' 현상을 발견했습니다.
- 따라서 LLM의 학습 진단이나 개선 시에는 어텐션을 포함한 대리 지표에만 의존하기보다 행동적 간극(Behavioral Gap)을 통해 반드시 실제 성능 변화를 검증해야 합니다.
- 어텐션이 레이블 토큰 대신 포맷팅 및 예시 본문 토큰에 집중하는 등 복잡한 메커니즘을 보였기에, 행동 기반의 진단이 필수적입니다.
LLM의 인컨텍스트 학습(ICL) 안정성을 평가할 때, 단순히 어텐션 메커니즘의 변화만으로는 충분하지 않다는 연구 결과가 발표되었습니다.