AI 에이전트 연구

Learning to Zoom Efficiently with a Contrastive Curriculum

ARarXiv9월 4일 발표 · 1분 · 심사 전 논문

고해상도 이미지 처리에 필수적인 '줌인' 기능을 시각 에이전트가 효율적으로 학습하는 새로운 방법론을 제시합니다.

세 줄 요약arXiv 원문 기반
  1. 별도의 지도 학습(SFT) 과정 없이, InfoNCE 기반의 내재적 보상과 점진적인 부정적 도구 호출 커리큘럼으로 모델 성능을 향상시킵니다.
  2. $V^*$, HRBench 등 다양한 환경에서 기존 방식보다 효율적이며, 새롭게 제안된 M&C 데이터셋은 '재현율(Recall)'의 중요성을 강조합니다.
  3. 이 방법론은 복잡한 SFT 과정을 대체할 만큼 높은 성능을 보여, 실제 상용 에이전트 개발에 매우 실용적인 대안입니다.

고해상도 이미지 처리에 필수적인 '줌인' 기능을 시각 에이전트가 효율적으로 학습하는 새로운 방법론을 제시합니다.

원문arXiv · Learning to Zoom Efficiently with a Contrastive Curriculum같은 주제 가이드 · 바로 써 보기매일 아침 소식, 예약 작업으로 받기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기