PAC 프라이버시 기반 언어 모델 출력 보호 생성 기법 — AI 생성 일러스트AI 일러스트
리서치 연구

PAC 프라이버시 기반 언어 모델 출력 보호 생성 기법

PAC-Private Autoregressive Generation: Calibrating Noise to Ensemble Disagreement

arXiv9월 9일 발표 · 3분 · 심사 전 논문

민감한 데이터를 학습시킨 언어 모델을 API로 서비스할 때 발생하는 출력 기반의 개인정보 유출 문제를 해결하기 위해, PAC 프라이버시를 자기회귀 생성 과정에 성공적으로 확장했습니다.

세 줄 요약arXiv 원문 기반
  1. 이 기술은 예측 결과의 안정성에 따라 노이즈 양을 동적으로 조절하여, 기존 방식 대비 낮은 비용으로도 장문 생성 시 높은 성능과 강력한 개인정보 보호 효과를 유지합니다.
  2. 이는 민감 데이터를 안전하게 보존하면서 대규모 언어 모델의 활용성을 극대화할 수 있게 하여, 사생활 침해 위험을 줄인 AI 서비스 구축에 핵심적인 기반 기술이 됩니다.
  3. 다만, 이 프라이버시는 멤버십 추론(membership inference) 방지에 초점을 맞춘 것이며, 모델이 특정 내용을 기억하는지 여부와 관계없이 정보가 동일한 비율로 출력될 수 있다는 한계가 있습니다.

민감한 텍스트로 학습된 (LLM)을 형태로 서비스할 경우, 노출보다는 생성되는 출력을 통해 개인정보가 유출될 위험이 있습니다. 기존의 PMixED 같은 방식은 매번 예측 시 프라이버시 비용이 발생하며 장기적으로는 공개 모델에 의존하는 경향이 있었습니다. 본 연구에서 제안된 PAC 프라이버시는 이러한 문제를 해결하기 위해, 가능한 비밀 정보 전반에 걸쳐 출력 변동성에 맞춰 노이즈를 보정(calibrating noise)함으로써 개인정보 보호 기능을 강화했습니다.

제안된 방법론은 민감한 코퍼스로부터 $m=128$개의 중첩된 가상 세계를 구성하고, 각 세계마다 개별 어댑터를 훈련하여 공개 모델에 적용합니다. 이때 실제 환경에서 발생하는 비밀 정보가 '실현된 세계'가 됩니다. 단위로 공용 모델이 후보 집합을 정의하면, 여러 세계의 투표 결과와 그 사후 확률 가중치 기반 불일치가 PAC 노이즈를 결정하며, 만장일치(unanimity)인 경우에는 별도의 보정 노이즈가 필요하지 않습니다.

WikiText-103 데이터셋과 GPT-2-small 모델을 사용한 실험 결과에 따르면, $2^{-32}$의 토큰당 예산으로도 이득의 74%를 유지할 수 있었습니다. 멤버십 추론 성공률은 $10^6$ 토큰 이후 51.08%로 제한되었으며, 동일한 데이터 환경에서 PMixED와 비교했을 때 비(非)개인정보 영역에서의 성능 유지율이 98%에 달해 기존 방식 대비 우수한 결과를 보였습니다.

용어 풀이

대규모 언어 모델
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
API
프로그램끼리 기능을 주고받는 약속된 창구. AI 모델은 보통 API로 불러 써요.
가중치
학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
파인튜닝
이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.
원문arXiv · PAC-Private Autoregressive Generation: Calibrating Noise to Ensemble Disagreement같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv