LLM 학습 데이터 오염 감지 도구 SynthSentry 공개
SynthSentry: Detecting Synthetic Data Contamination in Language Model Training Data
arXiv대규모 언어 모델(LLM)이 자체 학습으로 성능 저하를 겪는 '모델 붕괴' 문제를 해결하기 위한 코퍼스 검증 도구, SynthSentry가 공개되었습니다.
- 이 도구는 생성 모델에 대한 접근이 필요 없고, 어휘 다양성 및 N-gram 같은 세 가지 통계 지표만으로 데이터 오염도를 정확하게 측정합니다.
- 단순한 사후 진단을 넘어, 학습 전에 데이터를 선별하는 ‘데이터 큐레이션 방어’ 관점을 제시하며 LLM 개발의 신뢰성을 높이는 핵심 기준으로 작용할 전망입니다.
- 현재 검증은 영어권의 소규모 배치 모드 코퍼스에 국한되며, 오염원이 재귀적 생성이 아닌 단일 생성 기반이라는 점과 과도한 데이터 제거 시 성능 저하 위험이 있다는 한계가 있습니다.
(LLM)이 자체 생성하거나 다른 모델의 출력을 재귀적으로 학습할 경우, 분포적 꼬리 부분과 사실적 정확도가 저하되는 '모델 붕괴' 현상이 발생합니다. 기존 연구는 이미 훈련된 후의 붕괴 진단에 초점을 맞췄으나, 본 기술은 훈련 전에 알려지지 않은 출처의 코퍼스를 선별하는 데 중점을 둡니다. 개발진은 생성 모델 접근이나 생성 이력, 합성 레이블이 필요 없는 코퍼스 수준의 오염 신호인 SynthSentry를 소개했습니다.
SynthSentry는 세 가지 통계 지표—어휘 다양성 붕괴, n-gram 꼬리 절단, 참조 모델 간 퍼플렉시티 분산—에 대한 분포적 발산을 측정하여 코퍼스의 오염도를 점수화합니다. 이 도구는 소규모 오픈 생성기 및 명령어 조정된 오픈 가중치 모델로 오염된 코퍼스를 대상으로 '생성기 하나 제외' 프로토콜을 통해 평가되었습니다. 또한, 법률, 임상 기록, 소스 코드와 같이 자연적으로 반복적인 인간 텍스트에서의 위양성(false positive) 여부도 측정했습니다.
개발진은 데이터 선별 과정을 사후 진단이 아닌 '데이터 큐레이션 방어' 관점으로 재정립하며 해당 점수화 도구킷을 공개했습니다. 다만, 현재 결과는 영어권의 배치 모드 코퍼스에 국한되며, 오염원이 재귀적으로 생성된 것이 아니라 단일 생성 또는 수작업으로 작성된 경우를 다룹니다. 또한, 데이터 제거(pruning)가 실제 오염 비율을 초과할 경우 성능 저하 위험이 존재한다는 한계점도 지적했습니다.
용어 풀이
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 가중치
- 학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.