오픈 가중치 모델의 방향성 출처 추적 기술 제안
Witeness Overlap: Directional Provenance Inside Open-Weight Model Families
arXiv오픈 가중치 모델의 출처 추적 어려움을 해결하기 위해, 연구진은 세 번째 '증인(witness)' 체크포인트를 활용하여 두 모델 간의 관계 방향성을 파악하는 Witness Overlap 기법을 제안했습니다.
- 이 방법은 단순히 두 모델만 비교하는 방식에서 벗어나, 증인 지점을 기준으로 각 후보가 분기된 부모와 유사한지 기하학적으로 분석하여 관계의 방향성을 추론합니다.
- 대규모 언어 모델(LLM)의 변형 과정 추적은 AI 생태계 투명성에 필수적이며, 본 기술은 16개 계열의 LLM에서 높은 방향성 판별 정확도를 입증했습니다.
- 제안된 방식은 가중치 노이즈나 희소 가지치기(pruning)에도 안정적으로 작동하며, 특히 SVD 기반 변형을 통해 더욱 높은 견고성을 확보할 수 있습니다.
오픈 () 모델들은 , 정렬, 병합 등의 과정을 거쳐 반복적으로 재출시되면서, 모델의 출처(provenance)를 감사하는 것이 복잡해지고 있습니다. 기존의 모델 추적 방법들은 주로 피해자 또는 소스 모델을 기준으로 의심 모델과의 관련성을 테스트하며, 이러한 대칭적인 쌍별 비교는 두 체크포인트 간의 관련성은 감지할 수 있으나 관계의 방향성(A가 B의 부모인지)을 자체적으로 판단하기 어렵다는 한계가 있습니다.
이러한 문제를 해결하기 위해 연구진은 'Witness Overlap'이라는 방법을 제안했습니다. 이 기법은 두 체크포인트를 직접 비교하는 대신, 같은 계열의 세 번째 체크포인트(증인, witness)를 추가하여 각 후보 지점 주변의 기하학적 구조를 비교합니다. 관계의 방향성은 어떤 후보가 분기된 부모와 더 유사하게 행동하는지를 분석함으로써 추론할 수 있습니다.
Witness Overlap은 나 학습 과정 없이도 작동하는 백색 상자(white-box) 테스트로, 16개 계열에서 가져온 176개의 체크포인트를 대상으로 실험되었습니다. Frobenius 코사인 등을 사용했을 때 부모-자식 결정의 95.3%를 방향성 있게 판별할 수 있었습니다. 또한 이 방식은 가중치 노이즈나 희소 가지치기(pruning)에도 강건하며, SVD 기반의 가중치 축소 변형을 적용하면 Frobenius 코사인보다 더 높은 견고성을 확보하는 것으로 나타났습니다.
용어 풀이
- 가중치
- 학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
- Open-weight
- 학습된 가중치를 공개해 누구나 내려받아 쓸 수 있게 한 모델. 학습 데이터까지 공개한다는 뜻은 아니에요.
- 파인튜닝
- 이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.
- 프롬프트
- AI에게 주는 지시나 질문 글.
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.