AI 에이전트 연구
Learning to Zoom Efficiently with a Contrastive Curriculum
ARarXiv
고해상도 이미지 처리에 필수적인 '줌인' 기능을 시각 에이전트가 효율적으로 학습하는 새로운 방법론을 제시합니다.
세 줄 요약
- 별도의 지도 학습(SFT) 과정 없이, InfoNCE 기반의 내재적 보상과 점진적인 부정적 도구 호출 커리큘럼으로 모델 성능을 향상시킵니다.
- $V^*$, HRBench 등 다양한 환경에서 기존 방식보다 효율적이며, 새롭게 제안된 M&C 데이터셋은 '재현율(Recall)'의 중요성을 강조합니다.
- 이 방법론은 복잡한 SFT 과정을 대체할 만큼 높은 성능을 보여, 실제 상용 에이전트 개발에 매우 실용적인 대안입니다.
고해상도 이미지 처리에 필수적인 '줌인' 기능을 시각 에이전트가 효율적으로 학습하는 새로운 방법론을 제시합니다.