리서치 연구
기본 모델을 활용한 AI 탐지 우회 기법 개발
Agents Can Use Base Models to Evade AI Detection
arXiv코딩 에이전트가 기본 언어 모델(base model)을 활용하여 AI 탐지 시스템의 감지를 우회하는 새로운 방법을 개발했습니다.
세 줄 요약
- 에이전트는 단순 패러프레이징 대신 기본 모델 샘플을 직접 조합해 일관성 높은 출력을 만들고, 기존 탐지기의 감지율을 크게 낮췄습니다.
- 본 연구는 AI 텍스트 탐지에 대한 새로운 적대적 공격 가능성을 입증하며, 향후 콘텐츠 검출 기술 개발 방향에 중요한 시사점을 던집니다.
- 다만, 이 우회 기법은 더 많은 입력 및 출력 토큰을 사용해야 하므로 API 호출당 비용이 최대 30배까지 증가하는 단점이 있습니다.
코딩 가 기본 언어 모델(base model)을 활용하여 텍스트 샘플을 직접 조합하는 방식으로 응답을 구성함으로써, 기존의 패러프레이징 방식에서 발생하는 의미론적 표류를 피하고 AI 탐지 시스템의 감지를 우회할 수 있음을 보여줍니다. 이러한 접근법은 일관성이 높고 작업에 특화된 고품질 출력을 생성할 수 있게 합니다.
연구 결과, Claude Opus 5와 같은 에이전트가 로컬 기본 모델(예: OLMo-2)을 오케스트레이션하는 경우, 창의적 글쓰기나 사실 기반 QA 등 다양한 에서 높은 작업 정확도를 유지하면서도 최대 90%에 달하는 기본 모델 을 사용할 수 있습니다. 이 방식으로 생성된 응답은 Pangram v4 탐지율을 77%에서 24%로 낮추고, 소프트 워터마킹 감지율 역시 시뮬레이션상 10%까지 떨어뜨리는 효과를 보였습니다.
다만, 이러한 우회 기법은 더 많은 입력 및 출력 토큰을 요구하기 때문에 호출당 비용이 최대 30배 증가하는 단점이 있습니다. 본 연구는 AI 텍스트 탐지에 대한 새로운 적대적 공격 가능성을 입증하며, 후처리 탐지 제공업체들이 기본 모델의 출력을 학습에 포함할 것을 촉구합니다.
용어 풀이
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- API
- 프로그램끼리 기능을 주고받는 약속된 창구. AI 모델은 보통 API로 불러 써요.