활용 사례 연구
CoViT: Instance-Correspondence Contrastive Learning for Vision Transformer
ARarXiv
Vision Transformer(ViT)가 객체 인스턴스 구분에 취약하다는 한계를 극복하기 위해, CoViT라는 새로운 자기 지도 학습 프레임워크를 제안했습니다.
세 줄 요약
- CoViT는 어텐션 맵을 이용해 개별 인스턴스 마스크를 생성하고, 내부 변동성은 압축하며 객체 간 거리를 최대화하는 대비 학습(Contrastive Learning) 방식을 적용합니다.
- 추가 디코더나 레이블 없이 순수 ViT 구조만으로 인스턴스 인식 능력을 학습했으며, 여러 작업에서 2 AP 포인트 이상의 안정적인 성능 향상을 입증했습니다.
- 이는 트랜스포머 구조가 어텐션 메커니즘과 대비 학습 제약을 통해 인스턴스 수준의 정교한 표현을 자체적으로 습득할 수 있음을 보여주는 중요한 진전입니다.
Vision Transformer(ViT)가 객체 인스턴스 구분에 취약하다는 한계를 극복하기 위해, CoViT라는 새로운 자기 지도 학습 프레임워크를 제안했습니다.