모바일 GUI 에이전트의 효율성을 높인 Jev-Mobile 연구
Jev-Mobile: Jev as an Executor for Mobile GUI Agents
arXiv자율 모바일 GUI 에이전트가 모든 상호작용 단계에서 거대 언어 모델(VLM)에 의존하는 높은 지연 시간과 비용 문제를 해결했습니다.
- Jev-Mobile은 VLM을 '저빈도 계획' 역할로 제한하고, 빠른 결정 모델(Jev)이 구조화된 액션 공간 내에서 고주파 실행을 담당하도록 설계되었습니다.
- 이러한 분리 설계 덕분에 평균 실행 시간은 32.7% 단축되고 API 비용은 73.4% 절감되는 등, 효율성과 성능을 동시에 확보했습니다.
- 이는 고수준의 추론과 저수준 액션 수행 능력을 분리하는 것이 모바일 GUI 환경 AI 에이전트의 실용성과 경제성을 혁신적으로 개선할 수 있음을 보여줍니다.
Vision-language models(s)는 자율 모바일 GUI 를 위한 일반적인 기반 기술로 자리 잡았으나, 기존 시스템들은 거의 모든 상호작용 단계에서 VLM에 의존하여 높은 지연 시간과 모델 서비스 비용을 초래하는 문제가 있었습니다. Jev-Mobile은 이러한 패러다임을 전환하여 역할을 분리함으로써, 저빈도 VLM 계획(planning)과 고주파 경량 실행(execution)의 구조를 도입했습니다.
이 새로운 설계에 따르면, VLM이 로컬 목표를 지정하고 접근성 트리(accessibility tree)가 구조화된 실행 가능한 액션 공간을 정의합니다. 이후 Jev라는 빠른 타입 결정 모델이 이 공간 내에서 반복적으로 액션을 선택하게 됩니다. 이러한 분리 설계를 통해 단일 VLM 결정만으로 여러 GUI 액션을 수행할 수 있게 되어, 값비싼 VLM 추론 횟수를 줄이는 동시에 적응형 상호작용 능력을 유지합니다.
실제 AndroidWorld 태스크 스위트에서 Jev-Mobile은 79%의 태스크 성공률을 달성했습니다. 이는 SeeAct-V의 78%, Step-wise VLM 기준선(baseline)의 84%와 비교됩니다. 또한, 성공적인 실행 경로를 분석한 결과, 평균 종단 간 실행 시간은 Step-wise VLM 대비 32.7% 감소했으며, 평균 모델 비용도 73.4% 절감하는 성과를 보였습니다.
용어 풀이
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
- VLM
- 이미지와 글을 함께 이해하는 모델.
- API
- 프로그램끼리 기능을 주고받는 약속된 창구. AI 모델은 보통 API로 불러 써요.