데이터 부족 시대, MoE 모델의 과적합 문제 연구 — AI 생성 일러스트AI 일러스트
리서치 연구

데이터 부족 시대, MoE 모델의 과적합 문제 연구

Data Scarcity and Model Sparsity: Mixtures-of-Experts Overfit More to Repeated Data

arXiv9월 10일 발표 · 3분 · 심사 전 논문

데이터 부족으로 학습 데이터 반복 사용이 늘면서, 희소 구조의 Mixture-of-Experts(MoE) 모델이 기존보다 과적합에 취약하다는 연구 결과가 나왔습니다.

세 줄 요약arXiv 원문 기반
  1. 밀집형 모델은 데이터 반복률 8배까지 안정적이나, MoE는 4배부터 성능 저하가 급격하며 고유한 환경에서의 이점을 상실합니다.
  2. 이는 데이터 부족 시대에 MoE 구조의 안정성을 확보하는 것이 중요함을 의미하며, 모델 설계 시 과적합 방지 방법론이 필수적으로 요구됩니다.
  3. 드롭아웃 같은 정규화 기법으로 성능 완화는 가능하나, 현재까지 모든 고유 데이터 환경의 최고 성능 수준을 완전히 대체하기는 어렵습니다.

인간이 작성한 텍스트 공급이 고갈됨에 따라 언어 모델 학습 데이터 반복 사용이 일반화되고 있습니다. 기존 연구는 밀집 활성화 (dense Transformers)를 중심으로 데이터 반복 효과를 다루었으나, 최근 지배적인 희소 구조 아키텍처인 (MoE)의 경우 그 영향이 충분히 탐구되지 않았습니다. 본 연구에서는 MoE 모델을 포함한 다양한 설정에서 데이터 반복률에 따른 성능 변화를 분석했습니다.

연구 결과, 활성 가 80M에서 1B에 이르는 모델들에서 MoE는 데이터 반복에 의해 더 급격하게 성능이 저하되는 것으로 나타났습니다. 이러한 현상은 총 파라미터 수에 의해 결정되는 희소도와 관련됩니다. 밀집형 모델은 최소한의 성능 저하로 8배까지 데이터를 반복할 수 있었으나, MoE는 4배부터 성능 저하를 겪기 시작하며, 모든 고유 데이터 환경에서 32배 이후에는 밀집 모델보다 낮은 성능을 보였습니다.

드롭아웃과 같은 정규화 기법은 과적합을 완화하는 잠재적인 해결책으로 제시되었습니다. 특히 마스킹 기반의 정규화가 적용된 MoE는 데이터가 64배 이상 반복되더라도 밀집 모델보다 우수한 성능을 보이는 경우도 있었습니다. 하지만, 현재까지 어떤 방법도 모든 고유 학습 데이터 환경에서의 최고 성능 수준에 완전히 도달하지 못했습니다. 또한 분석 결과, MoE 라우팅은 초기에는 안정성을 유지하지만, 전문가 특화(expert specialization)가 반복 데이터 과적합과 관련이 있음이 밝혀졌습니다.

용어 풀이

트랜스포머
오늘날 대부분의 언어 모델이 쓰는 신경망 구조. 문장 속 단어들의 관계를 한꺼번에 계산해요.
Mixture-of-Experts
여러 하위 모델 중 일부만 골라 계산하는 구조. 모델이 커도 실행 비용을 줄일 수 있어요.
파라미터
모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
원문arXiv · Data Scarcity and Model Sparsity: Mixtures-of-Experts Overfit More to Repeated Data같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv