VLM의 시야 전환 능력 향상: LeRF 프레임워크 연구 — AI 생성 일러스트AI 일러스트
리서치 연구

VLM의 시야 전환 능력 향상: LeRF 프레임워크 연구

LeRF: Learning Reference Coordinate Frames for Perspective Taking Reasoning

arXiv9월 30일 발표 · 2분 · 심사 전 논문

VLM이 카메라 시점(자신)에만 의존하는 한계를 극복하기 위해, LeRF는 이미지와 질의를 바탕으로 필요한 참조 좌표계를 예측하고 활용합니다.

세 줄 요약arXiv 원문 기반
  1. 이 프레임워크는 외부 인식 모델이나 복잡한 3D 재구성을 거치지 않고도, 예측된 좌표계를 시각적 단서로 활용하여 관점 기반 추론을 수행하는 것이 핵심입니다.
  2. 이는 인공지능이 단순히 '자신'의 시야를 넘어, 다른 주체의 관점에서 공간적 관계를 이해하는 중요한 '관점 전환 능력'을 갖추게 함을 의미합니다.
  3. LeRF는 지도 학습과 강화 학습을 결합하여 훈련되었으며, 다양한 관점 추론 데이터셋에서 기존 방식 대비 높은 성능 향상을 입증했습니다.

기존 Vision-Language Models(s)은 공간적 추론에서 다른 주체의 관점(perspective taking)을 해석하는 데 어려움을 겪으며, 종종 카메라 시점에 의존하는 경향이 있습니다. LeRF는 이러한 한계를 극복하기 위해 개발된 프레임워크로, 이미지와 질의를 바탕으로 명시적인 참조 좌표계(reference frames)를 구축하고 활용하도록 VLM을 훈련합니다.

LeRF는 주어진 이미지와 질의에 따라 좌표계가 필요한지 판단하며, 필요할 경우 참조 개체를 기반으로 프레임의 원점과 엔티티 중심의 참조 프레임을 예측합니다. 이 과정에서 경량 렌더러(lightweight renderer)를 사용하여 프레임을 이미지 위에 오버레이함으로써, 외부 인식 모델이나 명시적인 3D 재구성 없이도 시각적 단서에 기반한 추론을 가능하게 합니다.

LeRF를 학습시키기 위해, 먼저 선택적 도구 호출 및 참조 좌표계 예측을 위한 지도 (supervised fine-tuning)을 수행하고, 이후 공간 VQA 쌍에 대한 (reinforcement learning)을 진행하여 프레임 기반 추론 능력을 개선합니다. 다양한 관점 추론 에서 LeRF는 백본 모델 대비 일관되게 성능이 향상되었으며, 기존 방법들보다도 높은 성능을 달성했습니다.

용어 풀이

VLM
이미지와 글을 함께 이해하는 모델.
미세 조정
이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.
강화 학습
행동의 결과에 보상을 주면서 더 나은 행동을 익히게 하는 학습 방법.
벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
오픈소스
소스 코드를 공개해 누구나 보고 고치고 다시 배포할 수 있게 한 소프트웨어.
원문arXiv · LeRF: Learning Reference Coordinate Frames for Perspective Taking Reasoning같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv