그래프 기반 신경망으로 영상 압축 성능 개선 — AI 생성 일러스트AI 일러스트
리서치 연구

그래프 기반 신경망으로 영상 압축 성능 개선

Video Compression with Graph-inspired Neural Representation

arXiv9월 9일 발표 · 2분 · 심사 전 논문

연구진은 영상의 시간적 중복성을 명시적으로 포착하는 그래프 기반 신경망 표현 방식(G-NeRV)을 제안했습니다.

세 줄 요약arXiv 원문 기반
  1. 이 모델은 프레임 간 연결망과 메시지 전달 과정을 통해 정보를 통합하며, 기존 최고 코덱 대비 압축률 향상을 입증했습니다.
  2. 효율적인 영상 압축 기술은 고화질 콘텐츠의 스트리밍 및 저장 환경 개선에 필수적이며, 산업 전반에 중요한 영향을 미칠 것으로 기대됩니다.
  3. 제시된 성능 수치는 UVG 데이터셋을 기준으로 측정되었으므로, 실제 다양한 환경과 콘텐츠에 대한 범용성 검증이 필요합니다.

기존의 암시적 신경 표현(INR) 방식은 비디오를 공유 네트워크 와 프레임 인덱스 을 통해 표현하며, 시간적 중복성을 간접적으로 활용하는 경향이 있어 최적화된 압축 성능을 달성하기 어렵다는 한계가 있습니다. 본 연구에서는 이러한 문제를 해결하기 위해 그래프에서 영감을 받은 INR인 G-NeRV를 제안했습니다. 이 모델은 시간적 중복성 활용을 명시적으로 개선하여 비디오 압축에 적용합니다.

G-NeRV는 정보 이론의 총 상관관계 원리를 바탕으로 프레임 임베딩 간의 시간적 이웃(temporal neighborhood)을 구성하고, 메시지 전달 과정을 수행하여 인접한 프레임으로부터 재사용 가능한 정보를 통합합니다. 특히 적응형 게이트를 통해 주변 정보를 주입하며, 기존 비디오 코딩의 참조 프레임 버퍼에서 영감을 받은 메모리 뱅크 메커니즘을 추가하여 INR 학습 시 무작위 프레임 인덱스 샘플링 환경에서도 효율적인 시간적 이웃 검색이 가능하도록 설계되었습니다.

G-NeRV 압축기는 기존 최고 수준의 INR 기반 코덱인 NVRC와 최신 표준 비디오 코덱인 VVC VTM과 성능을 비교했습니다. UVG 데이터셋을 기준으로 PSNR로 측정했을 때, G-NeRV는 각각 8.86% 및 14.68%(BD-rate 기준)의 압축률 향상을 보여주며 기존 기술 대비 우수한 성능을 입증했습니다.

용어 풀이

매개변수
모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
임베딩
글이나 이미지의 의미를 숫자 목록으로 바꾼 것. 의미가 비슷한 것을 찾을 때 써요.
원문arXiv · Video Compression with Graph-inspired Neural Representation같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv