리서치 연구
Privacy Without Regret: Differentially Private Inference-Time Alignment
ARarXiv
Best-of-N(BoN) 샘플링은 가장 널리 쓰이는 추론 시점 정렬 전략이나, 보상 해킹과 프라이버시 보호 부재 문제가 있다.
세 줄 요약
- 연구진은 노이즈를 추가하는 방식으로 이 두 문제를 해결했으며, Private Best-of-N(PrivBoN)는 Gumbel 노이즈로 $\epsilon$-차분 프라이버시와 KL-정규화된 정렬을 구현한다.
- Private Inference-Time Pessimism(PrivITP)은 $(\epsilon,\delta)$-DP를 달성하고, 응답 수 $n$과 무관한 프라이버시 비용 및 분리 가능한 정규화 매개변수를 갖는다.
- 실험 결과 PrivBoN과 PrivITP 모두 스케일링-단조성을 보였으며, PrivITP는 동등한 프라이버시 수준에서 PrivBoN과 같거나 우수한 성능을 나타냈다.
Best-of-N(BoN) 샘플링은 가장 널리 쓰이는 추론 시점 정렬 전략이나, 보상 해킹과 프라이버시 보호 부재 문제가 있다.