PAC 프라이버시 기반 언어 모델 출력 보호 생성 기법
PAC-Private Autoregressive Generation: Calibrating Noise to Ensemble Disagreement
arXiv민감한 데이터를 학습시킨 언어 모델을 API로 서비스할 때 발생하는 출력 기반의 개인정보 유출 문제를 해결하기 위해, PAC 프라이버시를 자기회귀 생성 과정에 성공적으로 확장했습니다.
- 이 기술은 예측 결과의 안정성에 따라 노이즈 양을 동적으로 조절하여, 기존 방식 대비 낮은 비용으로도 장문 생성 시 높은 성능과 강력한 개인정보 보호 효과를 유지합니다.
- 이는 민감 데이터를 안전하게 보존하면서 대규모 언어 모델의 활용성을 극대화할 수 있게 하여, 사생활 침해 위험을 줄인 AI 서비스 구축에 핵심적인 기반 기술이 됩니다.
- 다만, 이 프라이버시는 멤버십 추론(membership inference) 방지에 초점을 맞춘 것이며, 모델이 특정 내용을 기억하는지 여부와 관계없이 정보가 동일한 비율로 출력될 수 있다는 한계가 있습니다.
민감한 텍스트로 학습된 (LLM)을 형태로 서비스할 경우, 노출보다는 생성되는 출력을 통해 개인정보가 유출될 위험이 있습니다. 기존의 PMixED 같은 방식은 매번 예측 시 프라이버시 비용이 발생하며 장기적으로는 공개 모델에 의존하는 경향이 있었습니다. 본 연구에서 제안된 PAC 프라이버시는 이러한 문제를 해결하기 위해, 가능한 비밀 정보 전반에 걸쳐 출력 변동성에 맞춰 노이즈를 보정(calibrating noise)함으로써 개인정보 보호 기능을 강화했습니다.
제안된 방법론은 민감한 코퍼스로부터 $m=128$개의 중첩된 가상 세계를 구성하고, 각 세계마다 개별 어댑터를 훈련하여 공개 모델에 적용합니다. 이때 실제 환경에서 발생하는 비밀 정보가 '실현된 세계'가 됩니다. 단위로 공용 모델이 후보 집합을 정의하면, 여러 세계의 투표 결과와 그 사후 확률 가중치 기반 불일치가 PAC 노이즈를 결정하며, 만장일치(unanimity)인 경우에는 별도의 보정 노이즈가 필요하지 않습니다.
WikiText-103 데이터셋과 GPT-2-small 모델을 사용한 실험 결과에 따르면, $2^{-32}$의 토큰당 예산으로도 이득의 74%를 유지할 수 있었습니다. 멤버십 추론 성공률은 $10^6$ 토큰 이후 51.08%로 제한되었으며, 동일한 데이터 환경에서 PMixED와 비교했을 때 비(非)개인정보 영역에서의 성능 유지율이 98%에 달해 기존 방식 대비 우수한 결과를 보였습니다.
용어 풀이
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- API
- 프로그램끼리 기능을 주고받는 약속된 창구. AI 모델은 보통 API로 불러 써요.
- 가중치
- 학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- 파인튜닝
- 이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.