장시간 고밀도 3D 장면 추적 기술 'TrackEverything' — AI 생성 일러스트
리서치 연구

장시간 고밀도 3D 장면 추적 기술 'TrackEverything'

TrackEverything: Long Horizon Dense Tracking via De-Duplicating 3D Scene Representations

arXiv9월 24일 발표 · 3분 · 프리프린트

기존 포인트 추적 모델의 장시간 관찰과 모든 점 추적 간 트레이드오프를 해결한 새로운 3D 포인트 추적 시스템입니다.

세 줄 요약arXiv 원문 기반
  1. 비디오를 월드 좌표 기반의 영구적인 3D 장면으로 재정의하고, 디듀플리케이션 및 동적 지점 분해 구조로 메모리 제약 없이 모든 가시점을 추적합니다.
  2. 1000프레임 이상의 초장기 비디오에서도 대규모 물리 환경의 변화를 높은 정확도로 모니터링할 수 있어 실세계 적용 가능성이 매우 높습니다.
  3. 로봇 공학, 자율 주행 등 장기간에 걸쳐 모든 객체와 환경의 정밀한 3D 추적이 필요한 분야에서 핵심 기술이 될 것입니다.

기존 포인트 추적 모델들은 장기간의 희소한 점 추적과 짧은 클립에서의 모든 점 추적 사이에서 근본적인 상충 관계를 가졌습니다. TrackEverything은 비디오를 월드 좌표계 기반의 영구적인 3D 장면 트랙으로 표현하여 이 한계를 극복했습니다. 이는 비디오가 본질적으로 3차원 세계의 2D 투영이라는 통찰에 기반하며, 모델 복잡도를 영상 지속 시간과 분리하고 고유한 물리적 장면 기하학을 기준으로 확장할 수 있게 합니다.

이 접근 방식은 세 가지 주요 혁신을 도입합니다. 첫째, 슬라이딩 윈도우 경계에서 복셀화 기반의 디듀플리케이션 메커니즘을 사용하여 중복된 트랙을 병합하고 동일 표면의 반복적인 관찰이 불필요하게 누적되는 것을 방지합니다. 둘째, 추적 과정을 종점 정제기(endpoint refiner)와 경량 궤적 정제기(trajectory refiner)로 분해하여 동적 점에 대해서만 밀집된 궤적을 디코딩합니다. 셋째, 메모리 제약이 큰 4D 상관 볼륨 대신 효율적인 특징 샘플링을 사용하는 3D WAFT를 제안했습니다.

TrackEverything은 현존하는 추적기 중 최초로 40 GB의 메모리 내에서 1000프레임이 넘는 비디오에 걸쳐 모든 가시 점을 추적할 수 있습니다. TAPVid-3D 데이터셋에서, 이 모델은 짧은 클립에서 기존 전 프레임 밀집 3D 추적기보다 20% 이상의 APD 성능 향상을 보였으며, 더 많은 점을 추적함에도 불구하고 장기 시퀀스에서는 최신 희소 추적기와 경쟁할 수 있는 수준을 유지했습니다.

용어 풀이

GPU
많은 계산을 한꺼번에 처리하는 칩. AI 학습과 실행에 가장 많이 써요.
오픈 소스
소스 코드를 공개해 누구나 보고 고치고 다시 배포할 수 있게 한 소프트웨어.
원문arXiv · TrackEverything: Long Horizon Dense Tracking via De-Duplicating 3D Scene Representations
원문 보기arXiv