3D 장면 이해를 위한 계층적 비전-언어 벤치마크 'SceneBench' — AI 생성 일러스트AI 일러스트
리서치 연구

3D 장면 이해를 위한 계층적 비전-언어 벤치마크 'SceneBench'

SceneBench: A Hierarchical Benchmark for Vision-Language Understanding of 3D Scenes

arXiv9월 16일 발표 · 3분 · 심사 전 논문

2D 이미지 이해에 강점을 보이던 시각-언어 모델의 3D 공간 추론 한계를 극복하기 위해, 계층적 의미 구조를 갖춘 대규모 벤치마크 'SceneBench'가 공개되었습니다.

세 줄 요약arXiv 원문 기반
  1. 이 데이터셋은 장면부터 방, 기능 영역까지 세분화된 계층적 주석을 포함하며, 단순 인식 외에 거리, 방향성 등 다단계 공간 지능 측정 과제를 제시합니다.
  2. 최신 AI 모델들이 기본적인 객체 인식에서는 높은 정확도를 보이지만, 실제 세계와 같은 복잡한 계층적/공간적 관계 이해에는 여전히 큰 기술적 한계가 있음을 입증했습니다.
  3. SceneBench는 가우시안 스플래팅으로 구현된 사실적인 3D 장면을 기반으로 하며, 인간의 수천 시간에 걸친 검증 과정을 거쳐 구축된 고품질 테스트 환경입니다.

시각-언어 모델()은 2D 이미지 이해에 강점을 보이지만, 3D 공간 추론에는 여전히 한계가 있습니다. 기존의 들은 포인트 클라우드를 사용하여 질감이나 텍스트 같은 풍부한 시각적 특징을 놓치거나, 장면-방-기능 영역 등 실제 세계의 계층적 조직 구조를 무시하고 객체를 개별적으로 주석 처리하는 문제가 있었습니다.

이러한 한계를 극복하기 위해 SceneBench가 도입되었습니다. 이 벤치마크는 Gaussian Splatting으로 재구성된 966개의 사실적인 3D 장면을 기반으로 하며, 장면부터 방, 기능 영역, 객체 그룹에 이르기까지 계층적 의미 구조를 갖추고 있습니다. 해당 주석은 인간의 수천 시간에 걸친 반복적인 검증 과정을 거쳐 구축되었으며, 총 18만 개 이상의 주석 노드와 텍스트 설명 및 3D 바운딩 박스를 포함합니다.

SceneBench는 세 가지 평가 과제를 정의하여 모델을 테스트합니다. 객체 속성을 확인하는 존재 기반 질문(Existence-Based Questions), 개수나 거리 등 다방향 관계를 측정하는 공간 지능 질문(Spatial Intelligence Questions), 그리고 여러 의미 레벨에 걸친 다단계 추론이 필요한 근거형 질의응답(QRA) 삼중항입니다. 실험 결과, 최신 모델들은 기본적인 인식 과제에서는 높은 정확도(예: 85%)를 보였으나, 계층적이고 구성적인 추론을 요구하는 영역에서는 성능이 크게 하락(예: 개수 세기에서 60%까지)하는 한계를 보여주었습니다.

용어 풀이

VLM
이미지와 글을 함께 이해하는 모델.
벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
원문arXiv · SceneBench: A Hierarchical Benchmark for Vision-Language Understanding of 3D Scenes같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv