모바일 GUI 에이전트의 효율성을 높인 Jev-Mobile 연구 — AI 생성 일러스트AI 일러스트
리서치 연구

모바일 GUI 에이전트의 효율성을 높인 Jev-Mobile 연구

Jev-Mobile: Jev as an Executor for Mobile GUI Agents

arXiv9월 24일 발표 · 3분 · 심사 전 논문

자율 모바일 GUI 에이전트가 모든 상호작용 단계에서 거대 언어 모델(VLM)에 의존하는 높은 지연 시간과 비용 문제를 해결했습니다.

세 줄 요약arXiv 원문 기반
  1. Jev-Mobile은 VLM을 '저빈도 계획' 역할로 제한하고, 빠른 결정 모델(Jev)이 구조화된 액션 공간 내에서 고주파 실행을 담당하도록 설계되었습니다.
  2. 이러한 분리 설계 덕분에 평균 실행 시간은 32.7% 단축되고 API 비용은 73.4% 절감되는 등, 효율성과 성능을 동시에 확보했습니다.
  3. 이는 고수준의 추론과 저수준 액션 수행 능력을 분리하는 것이 모바일 GUI 환경 AI 에이전트의 실용성과 경제성을 혁신적으로 개선할 수 있음을 보여줍니다.

Vision-language models(s)는 자율 모바일 GUI 를 위한 일반적인 기반 기술로 자리 잡았으나, 기존 시스템들은 거의 모든 상호작용 단계에서 VLM에 의존하여 높은 지연 시간과 모델 서비스 비용을 초래하는 문제가 있었습니다. Jev-Mobile은 이러한 패러다임을 전환하여 역할을 분리함으로써, 저빈도 VLM 계획(planning)과 고주파 경량 실행(execution)의 구조를 도입했습니다.

이 새로운 설계에 따르면, VLM이 로컬 목표를 지정하고 접근성 트리(accessibility tree)가 구조화된 실행 가능한 액션 공간을 정의합니다. 이후 Jev라는 빠른 타입 결정 모델이 이 공간 내에서 반복적으로 액션을 선택하게 됩니다. 이러한 분리 설계를 통해 단일 VLM 결정만으로 여러 GUI 액션을 수행할 수 있게 되어, 값비싼 VLM 추론 횟수를 줄이는 동시에 적응형 상호작용 능력을 유지합니다.

실제 AndroidWorld 태스크 스위트에서 Jev-Mobile은 79%의 태스크 성공률을 달성했습니다. 이는 SeeAct-V의 78%, Step-wise VLM 기준선(baseline)의 84%와 비교됩니다. 또한, 성공적인 실행 경로를 분석한 결과, 평균 종단 간 실행 시간은 Step-wise VLM 대비 32.7% 감소했으며, 평균 모델 비용도 73.4% 절감하는 성과를 보였습니다.

용어 풀이

에이전트
목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
VLM
이미지와 글을 함께 이해하는 모델.
API
프로그램끼리 기능을 주고받는 약속된 창구. AI 모델은 보통 API로 불러 써요.
원문arXiv · Jev-Mobile: Jev as an Executor for Mobile GUI Agents같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv