구조적 DOM 기반의 초고속 웹 브라우저 에이전트 'Jev'
browser-use/jev-ultrafast
GitHubJev Ultrafast는 Browser Use와 TypeSafe가 개발한 웹 브라우저 자동화 에이전트로, 구조적 DOM 정보를 활용하여 자연어 목표를 달성하는 것이 핵심입니다.
- 기존 방식과 달리, 이 에이전트는 동작 결정과 목표 요소를 단 하나의 네트워크 요청으로 처리하여 효율성을 극대화하고 속도를 혁신적으로 개선했습니다.
- 단순 스크린샷 분석을 넘어선 구조적 이해 덕분에, 항공권 검색 같은 복잡하고 동적인 웹 환경에서도 높은 정확도와 속도로 목표를 달성하는 것이 가능해졌습니다.
- 현재는 MVP 단계이며, 성능 측정은 특정 반복 테스트에 기반합니다. 섀도우 루트, 프레임, 캔버스 등 일부 복잡한 웹 요소나 일반적인 신뢰성 검증에는 한계가 있습니다.
Jev Ultrafast는 Browser Use와 TypeSafe가 개발한 웹 브라우저 로, 단순 스크린샷 분석을 넘어선 구조적인 접근 방식을 사용합니다. 이 에이전트는 페이지의 관찰 결과(observation)를 바탕으로 동적이고 인덱싱된 액션 공간을 생성하며, `CLICK`, `TYPE_TEXT` 등 지원되는 동작과 요소를 결합하여 작동합니다. 모든 결정은 요소 테이블 형태로 구조화되어 제공되며, 이를 통해 사용자는 자연어 목표만 제시하면 에이전트가 적절한 작업을 수행할 수 있습니다.
Jev의 핵심 기술적 강점은 의사결정 과정의 효율성입니다. 기존 방식과 달리, 동작(operation) 결정과 대상 요소(target) 선택을 단 하나의 네트워크 요청으로 처리합니다. 예를 들어, 구글 항공편 검색 시 자르히에서 런던까지의 여정을 자연어 목표로 제시했을 때, 실제 텍스트 생성 및 로딩 대기 시간을 포함하여 7.1초 만에 완료하는 성능이 입증되었습니다. 반복 테스트 결과, 평균 작업 시간은 9.450초에서 7.092초로 단축되어 25%의 개선을 보였습니다.
사용자는 Python 코드를 통해 에이전트를 호출하고 목표(goal)와 URL을 지정하여 작업을 실행할 수 있습니다. 다만, 현재는 MVP 단계이며 기능적 한계도 명확합니다. Shadow roots, 프레임, 캔버스, 업로드 등 복잡한 웹 요소나 네스티드 스크롤링은 이 에이전트의 범위를 벗어납니다. 따라서 모든 동작에 대해 독립적인 결과 검증(independent outcome verification)이 필요하며, 모델 출력은 선택자나 좌표가 아닌 JSON 객체 형태로 파싱되어야 합니다.
용어 풀이
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.