프롬프트 기반 분할로 개방형 어휘 3D 객체 탐지 연구
Open-vocabulary 3D object detection with promptable segmentation
arXiv자율주행의 고정된 카테고리 한계를 극복하기 위해, 텍스트 프롬프트 기반 분할 모델(SAM3)을 활용하여 개방형 어휘로 3D 객체를 탐지하는 방법을 제시했습니다.
- 별도의 대규모 레이블링 없이도 카메라와 LiDAR 정보를 결합해 3D 객체 탐지를 수행하며, 지도 학습 방식 대비 높은 성능 개선 효과를 입증했습니다.
- 기존 시스템이 학습 범위를 벗어난 물체에 취약했던 문제를 해결하여, 자율주행차가 주변 환경의 다양한 객체를 유연하고 넓게 인식할 수 있는 기반을 마련했다는 점에서 중요합니다.
- 테스트 결과, 성능 저하가 미지의 물체가 아닌 측정 정밀도나 클래스 혼동이 주원인으로 파악되었으며, 인가 범위 내 객체의 84%를 성공적으로 탐지했습니다.
자율주행을 위한 3차원 객체 탐지는 일반적으로 사람이 주석을 단 고정된 카테고리 목록에 의존하여 학습하는 경향이 있습니다. 이 논문은 이러한 한계를 극복하고, 클래스 이름을 텍스트 로 질의하는 분할 모델(SAM3)을 활용하여 개방형 어휘 기반으로 3D 객체 탐지를 수행하는 방법을 제시했습니다. SAM3는 차량 주변 카메라에서 인스턴스 마스크를 제공하며, 이 마스크를 장면 기하학 정보를 이용해 측정 가능한 3D 박스로 변환합니다.
연구진은 nuScenes 데이터셋을 사용하여 세 단계의 통제된 비교를 수행했습니다. 이미지 정보만으로 예측한 기하학적 결과는 0.183 mAP을 달성했으며, 레이블링 비용 없이 원시 LiDAR 포인트와 학습 없는 규칙을 적용했을 때는 0.298 mAP / 0.348 NDS에 도달하는 것으로 나타났습니다. 여기에 추론 시 지도 학습된 박스 기하학 정보를 활용하자 성능은 0.413 mAP / 0.555 NDS로 향상되었습니다.
또한, 동일한 마스크를 기반으로 구축된 세 가지 상태의 카메라 증인 규칙을 사용했을 때, 기존의 지도 학습 전용 LiDAR 탐지기는 0.596에서 0.630 mAP로 개선되는 결과를 보였습니다. 이는 완전 지도 학습 방식 대비 절반 수준의 성능 향상이며 별도의 학습 과정이 필요하지 않습니다. 전체적인 커버리지 분석 결과, SAM3는 올바르게 명명된 마스크를 가진 범위 내 객체의 84%를 탐지하는 것으로 확인되었습니다.
용어 풀이
- 프롬프트
- AI에게 주는 지시나 질문 글.