비전-언어 에이전트의 블랙박스 게임 복제 성능 평가 기준 — AI 생성 일러스트
리서치 연구

비전-언어 에이전트의 블랙박스 게임 복제 성능 평가 기준

GameReplica: A Benchmark for Black-Box Visual Game Replication by Vision-Language Agents

arXiv9월 22일 발표 · 3분 · 프리프린트

연구진은 시각적 관찰과 능동적인 상호작용만으로 게임 규칙을 유추하고 실행 가능한 복제본을 만드는 과정을 평가하는 새로운 벤치마크, GameReplica를 개발했습니다.

세 줄 요약arXiv 원문 기반
  1. 실험 결과, 최고 성능의 AI 에이전트조차도 게임의 시각적 외형은 구현하지만, 핵심적인 게임 메커니즘이나 규칙 자체를 일관성 있게 재현하는 데 큰 어려움을 보였습니다.
  2. 이는 인공지능 기술이 단순한 코드 생성 단계를 넘어, 실제 환경에서 관찰하고 추론하여 복잡한 시스템의 작동 원리를 이해하는 '범용 지능' 단계로 발전해야 함을 시사합니다.
  3. 특히 난이도가 높아질수록 성능 격차가 커졌으며, 에이전트들이 게임 규칙의 일관성보다 시각적 디테일에 치중하는 경향이 두드러지게 관찰되었습니다.

기존 코딩 는 주로 목표 행동이 텍스트, 코드 또는 시연으로 명시된 경우에 구현 능력을 평가해왔다. 그러나 소스코드나 문서가 없는 블랙박스 환경에서, 오직 시각적 관찰과 능동적인 상호작용만으로 시스템의 규칙을 유추하고 이를 검증 가능한 실행 가능한 복제본으로 재현하는 것은 미개척 영역이다. 연구진은 이러한 문제를 해결하기 위해 GameReplica라는 폐쇄 루프 평가 프레임워크를 제시했다. 이 프레임워크는 인식, 탐색, 추론, 재현, 그리고 외부 프로그램에 의한 검증까지의 전 과정을 포괄한다.

GameReplica는 총 5가지 핵심 메커니즘을 아우르는 25개 게임으로 구성되어 있으며, 각 게임은 다섯 가지 난이도로 구현된 125개의 태스크를 포함한다. 에이전트는 타겟 게임에 오직 스크린샷과 액션 인터페이스만을 통해 접근해야 한다. 이 과정에서 에이전트는 픽셀 피드백과 상호작용 결과를 바탕으로 핵심 시각 요소와 게임 규칙을 유추하고, 외부 프로그램이 자동으로 검증할 수 있는 독립적인 실행 가능한 복제본을 생성하는 것이 목표다.

실험 결과에 따르면, 현재의 코딩 에이전트들은 블랙박스 환경에서의 종단 간(end-to-end) 복제 과정에서 상당한 어려움을 겪는 것으로 나타났다. 최고 성능 모델인 Claude Opus 4.8은 전체 점수 71.6%를 기록했으나, 나머지 모델들의 점수는 4.0%에서 42.9% 사이에 머물렀다. 분석 결과, 모든 모델에서 시각적 충실도(visual-fidelity) 점수가 구현 및 규칙 일관성 점수보다 현저히 높게 나타났다.

또한, 난이도가 높아질수록 성능 격차는 더욱 커지는 경향을 보였다. 약한 에이전트들의 경우 L1부터 L5까지 전체 점수가 급격하게 하락하는 반면, 최고 성능의 에이전트는 그 하락 폭이 상대적으로 작았다. 이는 에이전트들이 게임 규칙 자체의 일관성을 재현하기보다는 시각적 외형을 복제하는 데 더 능숙함을 보여준다.

용어 풀이

에이전트
목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
원문arXiv · GameReplica: A Benchmark for Black-Box Visual Game Replication by Vision-Language Agents
원문 보기arXiv