언어 모델의 학습 데이터 포함 여부 검증: 중복 카운트 분석 — AI 생성 일러스트AI 일러스트
리서치 연구

언어 모델의 학습 데이터 포함 여부 검증: 중복 카운트 분석

Detectable Only Where It Is Confounded: What Verified Duplication Counts Say About Membership Evidence in Language Models

arXiv9월 11일 발표 · 2분 · 심사 전 논문

연구진은 언어 모델이 특정 문장을 학습 데이터에서 얼마나 많이 보았는지 정확히 측정하기 위해, 코퍼스 전체의 중복 카운트를 활용하는 새로운 방법을 개발했습니다.

세 줄 요약arXiv 원문 기반
  1. 문장의 중복도가 낮은 경우 모델의 학습 흔적을 포착하기 어려우며, 높은 중복도에서도 모델은 '기억'보다 단어 선택에 보상을 주는 경향이 확인되었습니다.
  2. 이는 언어 모델이 단순히 문장을 암기하는 것이 아니라, 통계적 패턴과 미묘한 단어 선택의 차이를 활용한다는 근본적인 작동 원리를 이해하게 돕습니다.
  3. 문장의 '레지스터' 등 맥락적 차이를 이용하면 탐지 정확도를 높일 수 있지만, 중복도가 낮은 경우에는 여전히 감지에 한계가 있음을 알 수 있습니다.

연구진은 언어 모델이 특정 문장을 학습 데이터에서 얼마나 많이 노출되었는지 정확히 측정하기 위해, OLMo-2와 Pythia 두 모델의 사전 학습 코퍼스 전체에 대한 공공 인덱스를 활용했습니다. 이 방법은 기존 연구들이 추측에 의존했던 문제점을 해결하며, 모든 문장이 각 코퍼스에 몇 번 나타났는지를 정확한 카운트로 제공합니다.

분석 결과, 중복도가 낮은 일반 텍스트의 경우 1B에서 13B 까지의 모델들은 미약한 학습 흔적만을 보였습니다. 그러나 약 천 번 이상의 높은 중복도에서는 두 코퍼스가 해당 문장이 유명하기 때문에 어떤 문장인지 일치하여 노출 정도를 구분할 수 있었습니다.

모델이 멤버 문장과 단어 하나만 바꾼 비멤버 문장을 비교했을 때, 모델은 원본을 선호했지만 그 차이는 원본이 한 번 나타났든 백 번 나타났든 동일했습니다. 이는 언어 모델이 단순히 문장을 암기하는 것이 아니라 작성자의 단어 선택에 보상을 주고 있음을 시사합니다.

또한, 멤버 문장과 레지스터가 다른 제어 문장을 비교하여 탐지기를 테스트했을 때, AUC(Area Under Curve) 값이 0.83에서 0.94로 향상되는 결과를 얻었습니다.

용어 풀이

매개변수
모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
원문arXiv · Detectable Only Where It Is Confounded: What Verified Duplication Counts Say About Membership Evidence in Language Models같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv