불균형 데이터 학습을 위한 효율적인 코어셋 축소 기법 'CRISP' — AI 생성 일러스트AI 일러스트
리서치 연구

불균형 데이터 학습을 위한 효율적인 코어셋 축소 기법 'CRISP'

CRISP: Scalable Importance-Stratified Coresets for Imbalanced Tabular Learning

arXiv9월 24일 발표 · 3분 · 심사 전 논문

불균형하고 방대한 표 형식 데이터 학습 시 발생하는 높은 비용 문제를 해결하기 위해 'CRISP'라는 효율적인 코어셋 축소 기법이 개발되었습니다.

세 줄 요약arXiv 원문 기반
  1. 실제 사기 거래 데이터를 예로 들었을 때, 전체 학습 행을 약 93% 줄이면서도 원본 데이터의 평균 정밀도를 99.7% 이상 유지하는 높은 효율성을 입증했습니다.
  2. 이는 금융 사기 탐지 등 대규모 클래스 불균형 환경에서 모델 개발 및 재학습 속도를 혁신적으로 높여 실무 적용 가능성을 크게 확장합니다.
  3. CRISP는 단순 데이터 축소가 아닌, 중요도 기반의 예산 분배와 포함 확률을 고려한 샘플 가중치 부여가 핵심적인 성능 향상 요인입니다.

대규모의 불균형 표 형식 데이터는 반복적인 그래디언트 부스팅 트리 훈련에 높은 비용을 발생시킵니다. 기존의 코어셋 방법들은 다수(majority) 예제들이 제거될 경우 정확도를 잃는 경향이 있습니다. 이에 연구진은 CRISP (Coreset Reduction via Importance-Stratified Pruning)라는 선형 시간(linear-time) 방법을 제안했습니다. 이 기법은 프록시 모델 점수의 분위수 계층(quantile strata)에 음성 클래스 예산(negative-class budget)을 할당하는 방식으로 작동합니다.

CRISP는 샘플 부여를 통해 불균등한 포함 확률을 고려하며, 이는 성능 향상의 핵심 요소로 작용합니다. 실제 사기 거래 데이터셋에서 테스트했을 때, CRISP는 95%의 음성 클래스 감소율을 달성하면서도 원본 데이터가 25M 행인 것 중 약 1.70M 행만으로 학습이 가능했습니다.

이러한 결과로 인해 전체 학습 행은 93.2%가 감소하는 효과를 보였으며, 동시에 원본 데이터의 평균 정밀도(Average Precision)는 99.7%를 유지할 수 있었습니다. 또한 공용 CriteoPrivateAds 데이터셋에서도 CRISP는 90%에서 99.4%까지 테스트된 모든 비율에서 가장 높은 평균 AP를 기록했습니다.

연구진은 추가 분석을 통해 예산 할당(budget allocation)과 역추정 확률 가중치 부여(inverse-propensity weighting)가 실제 데이터셋에서의 성능 향상을 이끌어낸 주요 원인임을 확인했습니다.

용어 풀이

가중치
학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
원문arXiv · CRISP: Scalable Importance-Stratified Coresets for Imbalanced Tabular Learning같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv