AI 모델의 텍스트 워터마크 삽입 기술과 논란
AI Models Are Watermarking Text—Will You Notice?
IEEE Spectrum AI주요 AI 기업들이 생성된 모든 텍스트 결과물에 사람이 인지할 수 없는 워터마크를 의무적으로 삽입하고 있습니다.
- 이 기술은 단어 선택 확률 분포 자체를 미묘하게 조작하여 워터마크를 삽입하며, EU 규제 준수 및 허위 정보 확산 방지에 목적을 둡니다.
- 워터마크는 단순한 출처 표식을 넘어, 콘텐츠의 데이터 출처 추적이나 모델 학습 과정 관리 등 광범위하게 활용될 수 있습니다.
- 다만, 워터마크 삽입이 텍스트 품질을 저하시킨다는 비판과 함께, 짧은 글이나 복잡한 상황에서는 탐지율 및 적용 강도에 한계가 존재합니다.
Anthropic, Google 등 주요 AI 기업들이 생성된 모든 텍스트 결과물에 사람이 인지할 수 없는 를 의무적으로 삽입하고 있습니다. 이러한 추세는 유럽연합(EU)의 AI 법안 등의 규제와 관련이 있으며, 허위 또는 조작적인 AI 콘텐츠 확산을 막기 위한 목적을 가지고 있습니다. 이 기술은 텍스트뿐만 아니라 이미지, 오디오, 비디오 등 다양한 형태의 미디어에 적용될 수 있습니다.
AI 텍스트 워터마크는 단순한 메타데이터나 눈에 보이지 않는 문자가 아닙니다. 이는 이 다음 단어를 예측할 때 부여하는 확률 분포 자체를 조작하여 삽입됩니다. 예를 들어, 특정 단어들을 '녹색 목록'으로 지정하고 그 단어들의 출현 확률을 높이는 방식으로 워터마크가 구현될 수 있으며, 이 방식은 200 분량의 응답에서 98.4%의 탐지율을 보인다고 보고되었습니다.
워터마크 삽입이 AI 출력물의 전반적인 품질을 저하시킨다는 비판도 제기됩니다. 하지만 구글의 연구에 따르면, 워터마크가 적용된 모델과 그렇지 않은 모델 간 사용자 피드백에서 유의미한 차이가 발견되지 않았습니다. 다만, 짧은 길이의 응답에서는 탐지율이 낮아지거나 워터마크 강도와 품질 유지 사이의 상충 관계가 발생할 수 있다는 지적도 있습니다.
나아가 이 기술은 단순히 AI 생성 콘텐츠를 식별하는 것을 넘어섭니다. 데이터 출처(provenance) 추적이나 모델 학습 과정 관리 등 광범위한 목적으로 활용될 수 있습니다. 예를 들어, 특정 내용을 워터마크 처리하여 모델에 학습시키면, 해당 내용이 모델의 훈련 데이터에 포함되었음을 통계적 증거로 사용할 수 있습니다.
용어 풀이
- 워터마크
- AI가 만든 글이나 이미지에 눈에 잘 띄지 않게 넣는 식별 표시.
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.