VLM의 시야 전환 능력 향상: LeRF 프레임워크 연구
LeRF: Learning Reference Coordinate Frames for Perspective Taking Reasoning
arXivVLM이 카메라 시점(자신)에만 의존하는 한계를 극복하기 위해, LeRF는 이미지와 질의를 바탕으로 필요한 참조 좌표계를 예측하고 활용합니다.
- 이 프레임워크는 외부 인식 모델이나 복잡한 3D 재구성을 거치지 않고도, 예측된 좌표계를 시각적 단서로 활용하여 관점 기반 추론을 수행하는 것이 핵심입니다.
- 이는 인공지능이 단순히 '자신'의 시야를 넘어, 다른 주체의 관점에서 공간적 관계를 이해하는 중요한 '관점 전환 능력'을 갖추게 함을 의미합니다.
- LeRF는 지도 학습과 강화 학습을 결합하여 훈련되었으며, 다양한 관점 추론 데이터셋에서 기존 방식 대비 높은 성능 향상을 입증했습니다.
기존 Vision-Language Models(s)은 공간적 추론에서 다른 주체의 관점(perspective taking)을 해석하는 데 어려움을 겪으며, 종종 카메라 시점에 의존하는 경향이 있습니다. LeRF는 이러한 한계를 극복하기 위해 개발된 프레임워크로, 이미지와 질의를 바탕으로 명시적인 참조 좌표계(reference frames)를 구축하고 활용하도록 VLM을 훈련합니다.
LeRF는 주어진 이미지와 질의에 따라 좌표계가 필요한지 판단하며, 필요할 경우 참조 개체를 기반으로 프레임의 원점과 엔티티 중심의 참조 프레임을 예측합니다. 이 과정에서 경량 렌더러(lightweight renderer)를 사용하여 프레임을 이미지 위에 오버레이함으로써, 외부 인식 모델이나 명시적인 3D 재구성 없이도 시각적 단서에 기반한 추론을 가능하게 합니다.
LeRF를 학습시키기 위해, 먼저 선택적 도구 호출 및 참조 좌표계 예측을 위한 지도 (supervised fine-tuning)을 수행하고, 이후 공간 VQA 쌍에 대한 (reinforcement learning)을 진행하여 프레임 기반 추론 능력을 개선합니다. 다양한 관점 추론 에서 LeRF는 백본 모델 대비 일관되게 성능이 향상되었으며, 기존 방법들보다도 높은 성능을 달성했습니다.
용어 풀이
- VLM
- 이미지와 글을 함께 이해하는 모델.
- 미세 조정
- 이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.
- 강화 학습
- 행동의 결과에 보상을 주면서 더 나은 행동을 익히게 하는 학습 방법.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
- 오픈소스
- 소스 코드를 공개해 누구나 보고 고치고 다시 배포할 수 있게 한 소프트웨어.