클로드를 활용한 오픈AI 해킹 시도 보고서 — AI 생성 일러스트
AI 정책 뉴스언론 보도어제 발표

클로드를 활용한 오픈AI 해킹 시도 보고서

Security researchers used Claude to help them hack into OpenAI

The Verge AI9월 18일 발표 · 2분

독립 보안 연구팀이 LLM(클로드)과 HEIF 이미지 취약점을 결합하여 오픈AI 직원 계정에 접근하는 데 성공했습니다.

세 줄 요약The Verge AI 원문 기반
  1. 연구팀은 단기간에 여러 대형 기술 기업을 겨냥한 'HEIF 해킹 프로젝트'를 개발하며 공격의 높은 범용성을 입증했습니다.
  2. 이는 최첨단 AI 모델이 단순한 개발 도구를 넘어, 실제 사이버 공격의 핵심 무기로 활용될 수 있음을 보여주는 경고입니다.
  3. 취약점은 패치되었으나, AI 기술 발전 속도에 맞춰 보안 시스템과 방어책의 지속적인 업데이트가 필수적입니다.

독립 보안 연구팀인 Hacktron의 세 명의 연구원들은 앤트로픽의 Claude Opus 4.8 및 5 모델을 사용하여 오픈AI 직원 계정에 접근하는 데 성공했습니다. 이들 팀은 오픈AI의 알고리즘 비밀이 담겨 있다고 알려진 'Monorepo'라는 깃허브 저장소에 접근할 수 있었습니다.

연구팀은 코럽트된 이미지 파일과 포럼 소프트웨어를 결합하여 공격을 진행했으며, 특히 오픈AI 커뮤니티 포럼을 호스팅하는 제3자 서비스인 Discourse의 취약점을 이용했습니다. 이들은 HEIF 이미지를 처리하는 시스템의 문제를 악용하여 RCE(원격 코드 실행)를 달성하고 오픈AI 인스턴스에 접근할 수 있었습니다.

이들의 'HEIF Heist' 프로젝트는 오픈AI 외에도 Slack, Meta, GitHub Ent, Rails 등 다양한 기업을 대상으로 적응성을 입증했습니다. 이 과정에서 사용된 비용은 3,000달러 미만이었으며, Hacktron은 Discourse와 오픈AI에 보고한 취약점 발견으로 오픈AI로부터 6,500달러를 받았습니다.

용어 풀이

토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
원문The Verge AI · Security researchers used Claude to help them hack into OpenAI오늘 이야기를 다 읽었어요고른 과정과 나머지 145개 보기
원문 보기The Verge AI