불균형 데이터 학습을 위한 효율적인 코어셋 축소 기법 'CRISP'
CRISP: Scalable Importance-Stratified Coresets for Imbalanced Tabular Learning
arXiv불균형하고 방대한 표 형식 데이터 학습 시 발생하는 높은 비용 문제를 해결하기 위해 'CRISP'라는 효율적인 코어셋 축소 기법이 개발되었습니다.
- 실제 사기 거래 데이터를 예로 들었을 때, 전체 학습 행을 약 93% 줄이면서도 원본 데이터의 평균 정밀도를 99.7% 이상 유지하는 높은 효율성을 입증했습니다.
- 이는 금융 사기 탐지 등 대규모 클래스 불균형 환경에서 모델 개발 및 재학습 속도를 혁신적으로 높여 실무 적용 가능성을 크게 확장합니다.
- CRISP는 단순 데이터 축소가 아닌, 중요도 기반의 예산 분배와 포함 확률을 고려한 샘플 가중치 부여가 핵심적인 성능 향상 요인입니다.
대규모의 불균형 표 형식 데이터는 반복적인 그래디언트 부스팅 트리 훈련에 높은 비용을 발생시킵니다. 기존의 코어셋 방법들은 다수(majority) 예제들이 제거될 경우 정확도를 잃는 경향이 있습니다. 이에 연구진은 CRISP (Coreset Reduction via Importance-Stratified Pruning)라는 선형 시간(linear-time) 방법을 제안했습니다. 이 기법은 프록시 모델 점수의 분위수 계층(quantile strata)에 음성 클래스 예산(negative-class budget)을 할당하는 방식으로 작동합니다.
CRISP는 샘플 부여를 통해 불균등한 포함 확률을 고려하며, 이는 성능 향상의 핵심 요소로 작용합니다. 실제 사기 거래 데이터셋에서 테스트했을 때, CRISP는 95%의 음성 클래스 감소율을 달성하면서도 원본 데이터가 25M 행인 것 중 약 1.70M 행만으로 학습이 가능했습니다.
이러한 결과로 인해 전체 학습 행은 93.2%가 감소하는 효과를 보였으며, 동시에 원본 데이터의 평균 정밀도(Average Precision)는 99.7%를 유지할 수 있었습니다. 또한 공용 CriteoPrivateAds 데이터셋에서도 CRISP는 90%에서 99.4%까지 테스트된 모든 비율에서 가장 높은 평균 AP를 기록했습니다.
연구진은 추가 분석을 통해 예산 할당(budget allocation)과 역추정 확률 가중치 부여(inverse-propensity weighting)가 실제 데이터셋에서의 성능 향상을 이끌어낸 주요 원인임을 확인했습니다.
용어 풀이
- 가중치
- 학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.