AI 진실성 측정 도구의 '완벽한 동의어화' 문제와 해결책 연구
The Truth Was Never Gone: Perfect Aliasing in Compliant-Context Truth Probes
arXivAI 모델의 진실성 측정 도구('트루스 프로브')가 특정 상황에만 맞춰지면 실제 사실과 수행해야 할 행동을 구별하지 못하는 '완벽한 동의어화' 문제가 발생함을 밝혀냈습니다.
- 진실성을 평가할 때, 단일 맥락 대신 상반된 여러 맥락을 혼합하여 학습시키자 모델이 거의 완벽에 가까운 수준으로 진실과 행동을 분리해내는 능력을 보여주었습니다.
- 이는 AI의 신뢰성 평가 시 특정 상황 최적화가 아닌, 다양한 환경에서 일관되게 진실성을 유지하는 일반화된 능력이 중요함을 시사합니다.
- 다만, 이 측정치가 모델이 실제로 '믿는' 지식의 보존 여부나 원인적인 사용 능력까지 증명하는 것은 아니며, 실질적인 속임수 탐지기로 활용하기에는 한계가 있습니다.
진실 보고가 수행해야 할 과제 행동과 일치하는 컴플라이언스 컨텍스트에 맞춰진 트루스 프로브는 해당 목표들을 그 자체의 레이블만으로는 구별할 수 없습니다. 이러한 현상을 '완벽한 동의어화(perfect aliasing)'라 부릅니다. 통제된 이진 보고 게임에서 진실과 규정된 행동 모두 컴플라이언스 컨텍스트에 맞춰진 프로브는 동일한 최적화 문제를 해결합니다. 하지만 라이벌 컨텍스트에서는 그 레이블들이 상보적이어서 AUROC가 합이 1이 되는 특성이 관찰되었습니다.
연구진은 무작위 코드북을 사용하여 규정된 출력 기호와 의미적 행동을 분리하고, 혼합된 컴플라이언스 및 라이벌 컨텍스트에 맞춰 프로브를 적합시켰습니다. 그 결과, 평가된 모든 라이벌 시험에서 거짓으로 답변하는 Gemma-2-9B 정책의 경우, 기존 프로브는 세 가지 학습 시드에 걸쳐 $0.006 \pm 0.005$ AUROC를 기록한 반면, 혼합 적합(mixed-fit) 프로브는 동일한 홀드아웃 활성화에서 $1.000$을 기록했습니다. 또한 두 컴플라이언스 적합 프로브는 라이벌 활성화에서 각각 $0.080$과 $0.986$의 점수를 받았습니다.
다만, 연구진은 이러한 발견들이 모델이 실제로 '기능적 믿음'을 보존하는지, 회복된 방향에 대한 인과적인 사용 능력을 증명하는 것은 아니며, 배포 가능한 속임수 탐지기로 활용하기에는 한계가 있음을 강조했습니다. 이 결과들은 궁극적으로 프로브가 무엇을 측정하고 있는지에 대한 논의를 제기합니다.