엔비디아의 테이블 데이터 전용 파운데이션 모델 'Kumo Tabular' 공개
NVIDIA Kumo Tabular Sets a New Accuracy-Efficiency Frontier for Tabular Prediction
Hugging Face Blog엔비디아가 테이블 데이터 전용 오픈 파운데이션 모델 'Kumo Tabular'를 공개했습니다. 이 모델은 별도의 학습이나 특징 공학 없이 단일 순방향 계산만으로 분류 및 회귀 예측이 가능합니다.
기업 데이터 대부분이 테이블 형태인데, 이 모델을 사용하면 복잡한 특징 공학이나 별도의 훈련 과정 없이도 AI 예측 작업을 할 수 있게 돼요.
- 기존의 복잡한 테이블 기반 ML 작업에 대규모 언어 모델의 컨텍스트 학습 방식을 적용하여, 여러 주요 벤치마크에서 최고 성능을 기록하며 새로운 표준을 제시했습니다.
- 고객 기록이나 거래 내역 등 기업 데이터 대부분이 테이블 형태인 만큼, 이 기술은 복잡한 모델 개발 과정을 간소화하여 산업 전반의 AI 도입 장벽을 낮출 전망입니다.
- 다만, 예측하려는 데이터가 학습 범위나 분포와 다를 경우 성능 저하가 발생할 수 있으므로, 실제 환경에 적용하기 전 반드시 자체 검증이 필요합니다.
기업 환경에서 고객 기록, 거래 내역, 센서 로그 등 대부분의 데이터는 테이블 형태로 존재하며, 이를 기반으로 이탈 예측이나 수요 예측 같은 머신러닝 작업이 활발하게 이루어지고 있습니다. 기존에는 이러한 작업을 위해 특징 공학(feature engineering)과 하이퍼 검색 등의 복잡한 과정이 필요했지만, 엔비디아는 의 컨텍스트 학습 방식을 테이블 데이터에 적용한 오픈 파운데이션 모델 'Kumo Tabular'를 공개했습니다. 이 모델은 별도의 훈련이나 조정 없이 단일 순방향 계산만으로 분류 및 회귀 예측을 수행할 수 있습니다.
Kumo Tabular는 테이블 구조에 맞춰 설계된 기반의 모델입니다. 이 모델은 셀 , 행 임베딩, 그리고 인-컨텍스트 학습(In-context Learning) 메커니즘을 활용하여 작동합니다. 특히, 컨텍스트가 쿼리 데이터와 분리되어 계산되므로 예측이 오직 컨텍스트와 해당 행 자체에만 의존하게 됩니다. 또한, 테이블의 크기가 커져도 어텐션이 흐릿해지는 현상을 방지하기 위해 길이 인식 어텐션 온도를 적용하여 안정적인 성능을 유지합니다.
Kumo Tabular는 네 가지 주요 인 TabArena, BeyondArena, TALENT, ScoringBench에서 최고 성능을 기록하며 새로운 정확도-효율성 영역(Pareto front)의 기준을 제시했습니다. 이 모델은 오픈 파운데이션 모델로 허깅페이스를 통해 제공되며, 엔비디아의 네이티브 라이브러리인 structured-data-models를 통해 사용할 수 있습니다. 개발자들은 pandas DataFrame에서 예측까지 단일 순방향 계산으로 처리할 수 있으며, 상업적 사용을 위해 OpenMDW-1.1 라이선스로 공개되었습니다.
용어 풀이
- 파라미터
- 모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 트랜스포머
- 오늘날 대부분의 언어 모델이 쓰는 신경망 구조. 문장 속 단어들의 관계를 한꺼번에 계산해요.
- 임베딩
- 글이나 이미지의 의미를 숫자 목록으로 바꾼 것. 의미가 비슷한 것을 찾을 때 써요.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
- GPU
- 많은 계산을 한꺼번에 처리하는 칩. AI 학습과 실행에 가장 많이 써요.
어떤 종류의 데이터를 분석할 수 있나요?
고객 기록, 거래 내역, 센서 로그 등 기업 환경에서 흔히 볼 수 있는 테이블 형태의 데이터에 사용해요.
기존 방식과 비교했을 때 어떤 장점이 있나요?
이전에는 특징 공학이나 하이퍼파라미터 검색 같은 복잡한 과정이 필요했지만, 이 모델은 별도의 훈련 없이 단일 순방향 계산만으로 분류 및 회귀 예측을 수행할 수 있어요.