피부과 이미지 분류를 위한 병변 보존 토큰 라우팅 기법
MedTokenBudget: Lesion-Preserving Token Routing for Dermoscopic Image Classification
arXivViT 기반 피부과 이미지 분류 모델은 병변 부위에 집중된 핵심 진단 정보를 놓치는 한계가 있었습니다. 이를 해결하기 위해 'MedTokenBudget'이라는 새로운 토큰 라우팅 프레임워크가 개발되었습니다.
- 이 프레임워크는 보조적인 병변 마스크를 활용하여 중요 패치만 선별하는 '병변 인식 스코어링(LATS)' 모듈을 사용합니다. 그 결과, 기존 방식 대비 높은 병변 정보 보존율과 분류 성능을 입증했습니다.
- 의료 영상 분석에서 AI가 중요한 병변 부위를 놓치지 않고 집중 학습하게 함으로써, 인공지능 진단의 신뢰성과 정확도를 크게 향상시킬 수 있습니다.
- 다만, 이 모델은 핵심 기능인 '병변 인식'을 수행하기 위해 해당 병변 영역을 알려주는 추가적인 마스크(보조 정보)가 필수적으로 요구된다는 기술적 조건이 있습니다.
Vision Transformer(ViT) 기반의 피부과 이미징 분류 모델은 진단 증거가 특정 병변 영역에 집중되어 있음에도 불구하고, 모든 이미지 패치를 균일하게 처리하는 한계가 있었습니다. 기존의 가지치기 방법들은 일반적인 활성화나 유사도 신호만을 사용하여 토큰을 줄였으나, 이 과정에서 남아있는 하위 집합이 실제로 핵심 병변 정보를 포함하고 있는지 검증하지 못했습니다.
본 논문은 보조적인 병변 마스크가 제공되는 경우에 한해, 'MedTokenBudget'이라는 지도 학습 기반의 포스트-백본 토큰 라우팅 프레임워크를 도입합니다. 이 프레임워크는 핵심 모듈인 '병변 인식 토큰 스코어링(LATS)'을 통해 어텐션 엔트로피, 피처 노름, 국소 특징 대비도를 결합하여 점수를 산출하고, 이를 바탕으로 목표 예산 내에서 상위 $K$개의 패치를 라우팅합니다.
LATS는 예산 커리큘럼 학습, 다양성 정규화, 어텐션 증류 및 병변 마스크 감독을 통해 훈련됩니다. 성능 평가는 실제 병변 증거가 토큰 예산을 거쳐 얼마나 많이 보존되는지를 측정하는 '병변 보존율'로 이루어졌습니다. ISIC 2019 데이터셋에서 마스크 기반 LATS는 높은 예산에서도 Random 및 ToMe 대비 우수한 분류 성능을 보였으며, 더 많은 병변 패치를 유지했습니다.
용어 풀이
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.