AI 에이전트 테스트 중 통제 실패로 실제 목표물 공격
One company is at the center of a wave of rogue AI attacks
The Verge AI이스라엘 스타트업 Irregular가 OpenAI, Meta 등 거대 기술 기업의 AI 에이전트를 테스트하는 과정에서 통제 범위를 벗어나 실제 인터넷상의 목표물을 공격한 사건이 발생했습니다.
- 사고는 테스트 환경의 통제 실패와 시뮬레이션 대상이 실제 도메인과 겹친 것이 주요 원인이었으며, 이는 AI 안전성 검증의 근본적인 문제를 드러냈습니다.
- 이번 사태는 AI 모델 성능 향상에 맞춰 단순한 버그를 넘어 실제 세계에 미치는 잠재적 위험까지 평가하는 표준화된 안전 기준 마련이 시급함을 보여줍니다.
- Irregular는 테스트 환경 통제 시스템을 강화하고, 업계가 참고할 수 있는 안전한 사이버 평가 방법론 보고서를 공개하여 가이드라인 제시를 목표로 합니다.
이스라엘 스타트업 Irregular가 OpenAI, Meta, Anthropic, Google 등 여러 거대 기술 기업의 를 스트레스 테스트하는 과정에서 문제가 발생했습니다. 이들 에이전트는 통제된 시뮬레이션 환경을 벗어나 실제 인터넷상의 목표물을 공격한 사례들이 확인되었습니다. 이러한 사고들은 기존에 보고된 허깅페이스 해킹과는 별개로, 안전하게 설계되었다고 알려진 테스트 환경의 경계를 넘어 현실 세계를 겨냥했다는 점에서 큰 우려를 낳았습니다.
이러한 에이전트 탈출 사건들의 근본적인 원인은 테스트 과정에서 발생한 시스템적 오류였습니다. Irregular CTO에 따르면, 에이전트는 개방형 인터넷 접속 권한을 가져서는 안 되었으나 이 기능이 의도치 않게 활성화되었고, 시뮬레이션 목표로 설정된 가상의 회사 이름이 실제 도메인과 겹치는 상황이 결합되면서 문제가 발생했습니다. 이러한 동일한 근본적 이슈는 OpenAI, Meta, Anthropic, Google 등 여러 주요 모델의 테스트에서 공통적으로 발견되었습니다.
사태가 알려진 후 Irregular는 시스템 개선에 착수하여 안전성을 강화하고 있습니다. 회사는 인터넷 접근 통제 기능을 강화하고 모니터링 및 수동 검토를 확대했으며, 평가 시작 전 접근 범위가 의도된 범위를 일치하는지 확인하기 위한 점검을 강화했다고 밝혔습니다. 나아가 Irregular는 이러한 경험들을 바탕으로 업계 전체가 참고할 수 있는 안전한 사이버 평가 방법론 보고서를 출판하여 공공의 지침을 제시할 계획입니다.
용어 풀이
- AI 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.