다중 에이전트 협업을 위한 가우시안 스플래팅 기반 장면 이해 기술
CoRef-GS: Cooperative Referring Gaussian Splatting for Multi-Agent Scene Understanding
arXiv다중 에이전트 로봇이 협력하여 장면을 이해할 때, 다른 로봇의 관찰 정보와 자신의 시점을 결합해 특정 사물이나 관계를 찾아내는 기술(Referring Understanding)에 대한 CoRef-GS 프레임워크가 제안되었습니다.
- CoRef-GS는 개별 가우시안 맵을 기하학적/의미론적으로 정렬하고, 시점 기반 마스크 관계 그래프를 이용해 질의에 응답합니다. 실측 결과, 기존 방식 대비 mIoU가 52.6%에서 68.8%로 크게 향상되었습니다.
- 본 연구는 단일 관찰에 국한되지 않고, 다수의 에이전트가 복합적으로 상호작용하는 실세계 협업 환경에서 로봇의 인지 능력을 혁신적으로 끌어올릴 수 있음을 보여줍니다.
- 연구진은 실제/시뮬레이션 환경을 포괄하는 새로운 벤치마크 CoQuad-Ref를 공개했습니다. 이 기술은 단순한 공간 정합을 넘어 언어와 의미가 일치하는 협업이 핵심입니다.
체화된 로봇(embodied robots)의 다중 환경에서 참조 장면 이해는 지정된 시점으로부터 객체 및 관계 중심 언어 질의를 접지하는 것이 핵심입니다. 개별 에이전트가 관찰한 지역적 의미론적 가우시안 맵은 단일 에이전트 내에서는 이러한 접지를 지원하지만, 협력 환경에서는 독립적으로 재구성된 맵들이 정렬되고 융합된 후에도 이 능력이 효과적으로 유지되어야 합니다. 특히 참조 대상이나 맥락적 랜드마크가 다른 에이전트의 관찰에서 올 수 있으면서도, 공간 관계는 질의하는 로봇의 시점에서 해석되어야 하는 복잡성이 존재합니다.
이에 연구진은 협력적 참조 가우시안 접지(cooperative referring Gaussian grounding) 프레임워크인 CoRef-GS를 제안했습니다. 이 방법론은 로컬한 개방형 어휘 인스턴스 인식 가우시안 맵을 구축하고, 크로스 에이전트 정렬 모듈을 통해 부분적으로 중첩된 맵들을 기하학적 및 의미론적 일관성을 바탕으로 정렬합니다. 이후 시점 기반 마스크 관계 그래프를 활용하여 질의에 응답함으로써 다중 에이전트 환경에서의 장면 이해 능력을 높였습니다.
또한, 연구진은 실제와 시뮬레이션 실내 환경을 모두 아우르는 새로운 CoQuad-Ref 를 공개했습니다. 실험 결과에 따르면, CoRef-GS는 시뮬레이션 환경에서 초기화 후 회전 오차를 2.58°에서 0.15°로 줄이는 성능을 보였으며, 실제 환경의 참조 mIoU 성능은 기존 방식인 ReferSplat 대비 52.6%에서 68.8%까지 향상된 것으로 확인되었습니다.
용어 풀이
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.