인간-개체 상호작용 이해를 위한 새로운 벤치마크 HEIR 소개
HEIR: Learning Human-Entity Interactions with Functional Roles
arXiv인간-개체 상호작용을 깊이 이해하기 위해, 연구진은 참여자의 역할과 전체 이벤트 구성을 평가하는 새로운 벤치마크(HEIR)와 CoRISP 모델을 개발했습니다.
- CoRISP는 공유되는 개체 정체성 정보를 활용하여 역할을 고려한 증거들을 결합하고 전체 이벤트 세트를 예측하며, 복잡한 상황에서 높은 성능 향상을 입증했습니다.
- 이는 AI 에이전트가 단순히 사물을 인식하는 것을 넘어, 환경 속에서 누가 무엇을 어떻게 할지 종합적으로 파악하고 미래를 예측하는 핵심 기반 기술입니다.
- HEIR 벤치마크는 다수의 참여자와 행동을 포함한 복잡한 시나리오를 제시하며, 개별 관계 평가가 아닌 전체 이벤트 구성을 함께 고려해야 하는 높은 난이도를 가집니다.
기존의 인간-객체 상호작용(HOI) 측정 지표는 개별적인 링크만을 평가하여, 전체 이벤트 구성을 종합적으로 측정하는 데 한계가 있었습니다. 이를 해결하기 위해 연구진은 HEIR(Human-Entity Interactions with Functional Roles)이라는 이미지 를 도입했습니다. 이 벤치마크는 객체, 대인 관계, 자기 주도 상호작용 전반에 걸쳐 완전한 근거 기반 참여자-역할 세트를 다루며, 총 18,730개의 이미지를 포함하고 여섯 가지 역할, 105가지 행동, 그리고 437개의 명사를 담고 있습니다.
HEIR의 복잡성을 해결하기 위해 CoRISP(Compositional Role-aware Interaction Set Prediction) 모델이 제안되었습니다. 이 시스템은 공유되는 개체 정체성 정보를 활용하여 역할 조건부 증거들을 결합하고, 정규화된 참여자-역할 세트를 예측합니다. 특히 카디널리티와 역할 다중성 잠재력을 통해 이벤트 크기와 역할 구성을 고려하며 정확한 이벤트별 정규화를 수행하는 것이 특징입니다.
CoRISP는 HEIR 벤치마크에서 반복 역할 이벤트 및 공유 참여자 이미지에 대해 각각 2.87점과 3.82점의 Set mAP 포인트로 평가된 시스템 중 최고 성능을 기록했습니다. 이러한 결과는 개별 관계를 측정하는 것을 넘어, 전체 이벤트 구성을 함께 학습하고 평가하는 것이 중요함을 입증합니다.
용어 풀이
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.