리서치 연구
저조도 환경 비디오 캡셔닝을 위한 불확실성 인식 보정 기술
Video Captioning in Low-Light Conditions through Efficient Uncertainty-Aware Caption Correction
arXiv어두운 조명 조건에서 비전-언어 모델(VLM)이 영상 속 행동을 정확히 설명하는 능력이 떨어지는 문제를 해결합니다.
세 줄 요약
- VLM 전체를 미세 조정할 필요 없이, 불확실성을 고려한 경량의 오류 추정 모듈을 추가해 설명을 정교하게 보정합니다.
- 적은 양의 데이터로 학습이 가능하며, 특정 VLM 아키텍처에 얽매이지 않고 광범위하게 활용할 수 있다는 점이 핵심입니다.
- 추론 시 계산 오버헤드가 매우 낮아 실제 환경 적용성이 높고, 높은 실용성을 갖춘 기술입니다.
영상 속 행동을 설명하는 비전-언어 모델()의 성능은 저조도 조건에서 크게 저하될 수 있습니다. 본 연구는 이러한 문제를 해결하기 위해 효율적인 불확실성 인지 표현 보정 프레임워크를 제안합니다. 이 방법론은 기존 VLM 전체를 하는 대신, 경량화된 희소 가우시안 프로세스 기반의 오류 추정 모듈을 도입하여 중간 표현(intermediate representation)을 정교하게 보정하는 것이 핵심입니다.
제안된 보정 모듈은 원래 투영된 표현과 검증된 목표 표현 사이의 잔차(residual)를 추정하도록 학습됩니다. 이 과정에서 새롭게 공식화된 불확실성 인지 계수(uncertainty-aware coefficient)가 사용되어 잔차가 적응적으로 스케일링되고 원본 표현에 더해집니다. 해당 모델은 ARID 데이터셋의 44개 샘플만을 사용하여 별도로 학습할 수 있으며, 추론 시 계산 오버헤드가 매우 낮아 실제 환경 적용성이 높습니다. 또한, VideoChat2를 사용했음에도 불구하고 다른 호환 가능한 VLM 아키텍처에도 적용 가능하도록 설계되었습니다.
용어 풀이
- VLM
- 이미지와 글을 함께 이해하는 모델.
- 미세 조정
- 이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.