미세 조정된 LLM의 내부 변화와 작업 중요성 분리 연구 — AI 생성 일러스트
리서치 연구

미세 조정된 LLM의 내부 변화와 작업 중요성 분리 연구

Decoupling Internal Representational Changes and Causal Importance in Fine-Tuned Large Language Models

arXiv9월 21일 발표 · 2분 · 프리프린트

미세 조정된 LLM이 내부적으로 어떻게 변화하는지, 그리고 이 변화가 실제 과제 수행 능력과 어떤 연관성이 있는지 분석했습니다.

세 줄 요약arXiv 원문 기반
  1. 연구 결과, 각 과제의 핵심 기능은 특정 레이어에 국한되어 나타나며, 모델 전체의 큰 구조적 변화와는 독립적으로 작동함을 확인했습니다.
  2. 이는 LLM이 특정 기능을 효율적으로 학습하면서도 모델 전체를 무분별하게 바꾸지 않는다는 점을 보여주어, AI 내부 작동 원리 이해에 중요한 단서를 제공합니다.
  3. 다만, 두 과제가 내부 기능 요소에서 유사성을 보일 경우 오히려 성능 저하(간섭)가 발생할 수 있으므로, 학습 설계 시 주의가 필요합니다.

(Fine-tuning)은 (LLM)을 다양한 다운스트림 작업에 적용하는 널리 사용되는 접근 방식이지만, 이 과정에서 모델의 내부 메커니즘이 어떻게 재구성되는지는 아직 명확히 이해되지 않은 부분이 많습니다. 본 연구는 미세 조정이 어텐션 패턴과 레이어별 활성화 같은 내부 표현을 어떻게 변화시키는지 조사하고, 이러한 변화가 과제 성능을 주도하는 EAP(예: 어텐션 헤드 및 로짓 레벨 활성화)로 식별된 작업 관련 구성 요소와 연결되는지 검토했습니다.

연구 결과에 따르면, EAP가 식별한 핵심 구성 요소들은 특정 레이어에 집중되어 나타나며, 이는 모델이 작업별 행동을 내재화하는 과정에서 기능적 국소화(functional localisation) 정도를 보여줍니다. 특히 주목할 점은 이러한 구성 요소들의 레이어 분포가 미세 조정 중 가장 큰 표현 변화를 겪는 레이어와는 대체로 상관관계가 없다는 것입니다.

또한, EAP가 식별한 구성 요소들이 여러 작업에 걸쳐 중복되더라도, 두 작업의 성격이 다를 경우(예: 분류 대 생성) 교차 작업 성능 전이로 이어지지 않는다는 점을 관찰했습니다. 더 구체적으로는, 한 작업으로 미세 조정할 경우 두 작업이 EAP 구성 요소에서 높은 수준의 중첩성을 보일 때 다른 작업의 성능 저하가 발생할 수 있습니다.

용어 풀이

미세 조정
이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.
대규모 언어 모델
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
원문arXiv · Decoupling Internal Representational Changes and Causal Importance in Fine-Tuned Large Language Models
원문 보기arXiv