시각 능력을 갖춘 대규모 모델 JEV-27B-VL 공개
autotrust/JEV-27B-VL
Hugging Faceautotrust가 시각 능력을 통합한 대규모 모델 JEV-27B-VL을 공개했습니다. 이 모델은 이미지와 텍스트를 모두 이해하며, 빠르고 확률적인 의사결정 시스템과 심층 추론 능력(System 2)을 결합합니다.
이 모델은 단순한 대화형 AI를 넘어, 로봇 공학이나 웹사이트 자동화처럼 실제 환경에서 관찰하고 판단하며 행동하는 자율 에이전트 단계로 진화했기 때문에 중요해요.
- 로봇 팔 제어 및 웹사이트 스크린샷 분석 등 복잡한 시각적 작업을 높은 성공률로 수행하는 것이 핵심입니다. 특히 텍스트 없이도 영상 추천 순위를 매기는 '제로샷' 성능이 뛰어납니다.
- 단순 대화형 AI를 넘어, 실제 환경에서 관찰하고 판단하며 행동하는 자율 에이전트 단계의 진화를 보여줍니다. 로봇 공학이나 UI 자동화 등 다양한 산업에 혁신을 가져올 잠재력이 큽니다.
- System 1은 단일 전방 통과로 확률적 결정을 내리지만, 성능은 테스트 환경 및 데이터셋에 따라 달라질 수 있습니다. 실제 적용 시에는 시스템의 한계를 고려해야 합니다.
autotrust가 시각적 이해와 확률적 의사결정 시스템을 결합한 대규모 모델인 autotrust/JEV-27B-VL을 공개했습니다. 이 모델은 System 1과 System 2를 통합하여 작동하며, 모든 단계별 결정(예: 로봇 팔 제어)을 단일 전방 통과 과정에서 다음 행동에 대한 확률로 출력합니다. System 1 기능으로는 Yes/No 판단이나 2~256개 옵션 중 하나 선택, 또는 텍스트와 이미지를 기반으로 한 평점 부여 등이 가능합니다.
JEV-27B-VL은 로봇 공학 및 UI 자동화 등 복잡한 시각적 작업을 수행하는 데 활용되었습니다. 예를 들어, 카메라 이미지에서 목표물의 위치를 파악하여 물건을 집고 트레이에 놓는 작업(MuJoCo 시뮬레이션)을 진행했으며, 20개 장면 중 75%의 성공률을 기록했습니다. 또한 스크린샷 기반으로 클릭할 요소를 선택하는 웹 사용 시나리오에서는 60개의 무작위 다단계 작업 중 95%를 완료하며 높은 성능을 입증했습니다.
이 모델은 상호작용 로그 없이도() 짧은 영상 추천 순위를 매기는 데 강점을 보입니다. MicroLens-100k 평가에서 커버 이미지만을 사용했을 때 AUC 0.727을 기록하며, 이는 기존의 협업 필터링 방식과 유사하거나 더 높은 성능을 나타냈습니다. 또한 판단(Agent Judge) 및 다중 모드 판단(Multimodal Judge)에서도 높은 정확도를 보여주며, 단순한 추론을 넘어 실제 환경에서 행동하는 자율 에이전트 단계의 진화를 보여줍니다.
용어 풀이
- 멀티모달
- 글뿐 아니라 이미지·음성·영상처럼 여러 형태의 입력을 함께 다루는 것.
- zero-shot
- 예시를 하나도 주지 않고 바로 과제를 시키는 방식.
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
모델은 어떤 방식으로 작동하나요?
autotrust/JEV-27B-VL은 시각적 이해와 확률적 의사결정 시스템을 결합한 대규모 멀티모달 모델이에요. System 1과 System 2를 통합하여, 모든 단계별 결정(예: 로봇 팔 제어)을 단일 전방 통과 과정에서 다음 행동에 대한 확률로 출력해요.
실제 환경에서 어떤 작업을 수행할 수 있나요?
로봇 공학이나 UI 자동화 같은 복잡한 시각적 작업에 활용돼요. 예를 들어, 카메라 이미지에서 목표물을 파악해 물건을 집는 MuJoCo 시뮬레이션에서는 75%의 성공률을 기록했고, 스크린샷 기반 웹 사용 시나리오에서는 60개의 무작위 다단계 작업 중 95%를 완료했어요.
특별히 강점을 보이는 기능이 있나요?
상호작용 로그가 없어도(zero-shot) 짧은 영상 추천 순위를 매기는 데 강점이 있어요. MicroLens-100k 평가에서 커버 이미지만 사용했을 때 AUC 0.727을 기록하며, 단순 추론을 넘어 실제 환경에서 행동하는 자율 에이전트 단계의 진화를 보여주었어요.