AI 워터마킹 사용 시 모델 안전성 변화 연구 결과 — AI 생성 일러스트AI 일러스트
리서치 연구

AI 워터마킹 사용 시 모델 안전성 변화 연구 결과

LLMs respond differently to harmful prompts when AI watermarking is used

Ars Technica AI Lab9월 17일 발표 · 3분

AI 생성물 출처 확인을 위한 워터마킹 기술이 모델의 안전한 거부 행동에 변화를 주어 새로운 보안 취약점을 만들 수 있다는 연구 결과가 발표되었습니다.

세 줄 요약Ars Technica AI Lab 원문 기반
  1. 워터마킹은 단순 단어 수정 수준을 넘어, 공격자가 프롬프트 주입 기법을 사용할 경우 평소 거부하던 위험 요청에 응답할 가능성을 높입니다.
  2. 이는 모델의 답변뿐 아니라 에이전트가 도구를 호출하는 후속 행동까지 영향을 미치므로, 개발 단계에서 안전성 검증이 필수적입니다.
  3. 따라서 워터마킹 적용 환경을 반드시 테스트해야 하며, 본 연구는 오픈 가중치를 사용했음을 참고하여 실제 구현 방식과 차이가 있을 수 있습니다.

최근 유럽연합 법규에 대응하여 AI 플랫폼들이 생성 콘텐츠에 워터마킹을 적용하고 있습니다. 앤트로픽의 Claude 모델 등에서 구글이 개발한 SynthID-Text와 같은 방식이 사용되는데, 이는 비밀 키를 이용해 단어 선택 과정에 미묘하게 변화를 주어 해당 출처가 AI 생성물임을 식별할 수 있게 합니다. 하지만 새로운 연구 결과는 이 워터마킹 기술이 단순한 단어 선택을 넘어 모델이 호출하는 도구(tools)나 안전 가드레일 준수 여부에도 영향을 줄 수 있음을 보여주었습니다.

AI 보안 연구원들은 워터마킹 적용이 특히 적대적 (adversarial prompt) 상황에서 모델의 행동 변화를 유발할 수 있다고 지적합니다. 이로 인해 평소에는 따르지 않던 지침들이 실행되거나, 안전하게 거부해야 할 요청에 응답하는 등 안전 동작 자체가 변경될 수 있습니다. 이러한 변화는 단순히 의 답변 내용뿐만 아니라, 모델이 로서 도구를 호출할 때 전달되는 인자(arguments)까지 영향을 미치며, 이를 '행동 효과 샘플링 드리프트(behavioral effect sampling drift)'라고 부릅니다.

실험에 따르면, 워터마킹은 유해한 요청에 대한 모델의 거부 행동을 변화시키는 것으로 나타났습니다. 특히 프롬프트 주입 기법과 결합될 경우 그 영향이 더욱 두드러졌으며, 여러 오픈 모델에서 워터마킹 적용 시 평소 거부했을 법한 위험 요청에 응답할 가능성이 높아지는 현상이 관찰되었습니다.

연구진은 이러한 결과가 AI 시스템의 안전성에 중요한 함의를 갖는다고 강조하며, 개발 단계에서 LLM과 에이전트의 행동을 철저히 테스트해야 한다고 제언했습니다. 다만 본 연구는 오픈 가중치 모델을 대상으로 진행되었기 때문에, 실제 상용화될 특정 구현 방식(예: Claude)과는 차이가 있을 수 있으며, 플랫폼 배포 전 해킹 훈련 등을 통해 안전성을 반드시 검증할 필요가 있습니다.

용어 풀이

프롬프트
AI에게 주는 지시나 질문 글.
LLM
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
에이전트
목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
가중치
학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
레드팀
공격자 입장에서 AI의 약점과 위험을 일부러 찾아내는 시험.
원문Ars Technica AI Lab · LLMs respond differently to harmful prompts when AI watermarking is used같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기