VLM을 활용한 스포츠 동작 평가 및 점수 예측 연구 — AI 생성 일러스트AI 일러스트
리서치 연구

VLM을 활용한 스포츠 동작 평가 및 점수 예측 연구

Can Vision-Language Models Judge Olympic Diving? From Reasoning to Scores in Zero-Shot Action Quality Assessment

arXiv9월 18일 발표 · 2분 · 심사 전 논문

올림픽 다이빙처럼 주관적이고 복잡한 스포츠 동작 평가에 비전-언어 모델(VLM)을 적용하는 자동화 시스템 구축 방법을 제시했습니다.

세 줄 요약arXiv 원문 기반
  1. 단순히 VLM만 사용하는 것보다, 의미론적 추론 결과와 세부 점수를 결합한 회귀 프레임워크를 사용했을 때 성능이 크게 향상됨을 입증했습니다.
  2. AI가 단순 점수 산출에 그치지 않고 동작 분석 과정과 평가 근거(설명)까지 제시할 수 있는 잠재력을 보여줍니다.
  3. 특히 원시적인 숫자 점수보다, 모델이 생성한 '텍스트 기반 추론' 결과가 평가 정확도를 높이는 핵심 요소임을 확인했습니다.

올림픽 다이빙과 같은 스포츠 동작 평가는 인간 움직임의 복잡성과 심사 과정의 주관성 때문에 자동화가 어려운 과제입니다. 본 연구는 비전-언어 모델()을 활용하여 AQA-7 데이터셋으로 동작 품질 평가를 수행하는 방안을 검토했습니다.

연구진은 단순한 VLM 사용에 그치지 않고, VLM이 생성하는 의미론적 추론 결과와 단계별 세부 점수를 결합한 회귀 기반 프레임워크를 제안했습니다. 이 프레임워크는 TF-IDF 벡터화, 차원 축소, 앙상블 학습 등을 활용하여 최종 경기 점수를 예측합니다. 실험 결과, 단독 VLM은 스피어만 상관관계가 0.32 미만이었으나, 네 가지 모델로 구성된 앙상블 프레임워크는 이 수치를 0.67까지 크게 향상시켰습니다.

특히 평가 과정에서 원시적인 숫자 점수보다 모델이 생성한 '텍스트 기반 추론' 특징이 일관되게 더 높은 성능을 보였습니다. 이는 동작 품질 분석에 있어 VLM이 제공하는 설명(explanation)의 풍부함이 핵심 요소임을 시사하며, VLMs가 설명 가능한 스포츠 평가를 위한 강력한 보조 도구로서 잠재력을 가짐을 보여줍니다.

용어 풀이

오픈 소스
소스 코드를 공개해 누구나 보고 고치고 다시 배포할 수 있게 한 소프트웨어.
VLM
이미지와 글을 함께 이해하는 모델.
벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
제로샷
예시를 하나도 주지 않고 바로 과제를 시키는 방식.
원문arXiv · Can Vision-Language Models Judge Olympic Diving? From Reasoning to Scores in Zero-Shot Action Quality Assessment같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv