SAM 학습 효율화: Temperon 방법론으로 훈련 시간 단축
Temperon: Full-Time SAM Quality at a Third Less Wall-Clock
arXivTemperon은 고비용의 SAM(Sharpness-aware minimization) 학습 기법을 효율화한 방법론입니다. 훈련 초반에는 일반 SGD를 사용하고, 후반부에만 SAM 기반 정제 모듈을 적용하는 것이 핵심 원리입니다.
- 실험 결과, 기존 최고 수준의 정확도를 유지하면서도 목표 성능에 도달하는 시간을 대폭 단축했습니다. GPT-2 등 다양한 모델 전이 학습에도 성공적으로 확장 가능함을 입증했습니다.
- 이는 고성능 AI 모델 개발 시 막대한 컴퓨팅 자원과 훈련 시간을 절약해 주어, 최적화된 학습 방법론의 새로운 기준을 제시합니다.
- 성능은 후반부에 적용되는 Muon 리파이너와 코사인 스케줄링 설계에 크게 의존합니다. 따라서 전체 훈련 과정의 세밀한 시간 배분과 구조적 전환이 중요하게 작용합니다.
Temperon은 고비용의 Sharpness-aware minimization (SAM) 기법을 효율적으로 활용하는 방법을 제안합니다. 기존 SAM 방식은 모든 훈련 단계에서 비용이 증가하는 문제가 있었는데, Temperon은 전체 에포크 예산 중 초기 43%까지는 일반 SGD(plain-SGD)를 사용하고, 이후에만 SAM 기반의 Muon 리파이너가 적용되는 스케줄링된 전환 방식을 핵심 원리로 삼습니다. 이 접근 방식은 고성능 AI 모델 개발 시 막대한 컴퓨팅 자원과 훈련 시간을 절약할 수 있습니다.
실험 결과, Temperon은 CIFAR-10/100, SVHN, Tiny ImageNet 등 여러 데이터셋에서 기존 최고 수준의 SAM 레시피와 동일한 정확도를 유지하면서도 목표 성능에 도달하는 시간이 단축됨을 입증했습니다. 특히 GPT-2 사전 학습이나 GLUE 과 같은 대규모 모델 전이 학습에도 성공적으로 확장 가능함을 보여주었습니다.
성능 향상은 Muon 리파이너의 기여(예: CIFAR-100에서 +0.83pp)와 코사인 스케줄에 따른 체계적인 전환 설계 덕분입니다. 저자는 이 정보가 단순히 편리한 것이 아니라, 정확도 곡선이 평탄화된 후 급증하는 특성상 스케줄 자체에 내재되어 있어 구조적으로 원칙적임을 강조했습니다.
용어 풀이
- 미세 조정
- 이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.