동적 희소 전문가 혼합 모델을 위한 분포 일관성 추론
Distribution-Consistent Inference for Dynamic Sparse Mixture-of-Experts
arXiv대규모 언어 모델(LLM)의 MoE 구조는 효율적이지만, 전문가를 동적으로 줄여 사용하면 학습 시와 다른 분포 변화가 발생하여 성능 저하 문제가 생깁니다.
- 연구진은 레이어별 통계 정보를 활용하는 'LDA'라는 경량 보정 기법을 제안했습니다. 이는 축소된 표현을 원래 설정과 정렬(alignment)시켜 성능 손실을 회복합니다.
- LLM 운영 비용 절감이 중요해지면서, 계산량을 줄이면서도 성능 저하 없이 최적화하는 기술은 매우 중요한 연구 분야입니다.
- LDA는 오버헤드가 미미하면서 다양한 MoE 모델과 라우팅 전략에서 높은 성능 회복력을 입증하여 효율성과 정확성을 동시에 확보했습니다.
(Mixture-of-Experts, MoE) 아키텍처는 대규모 파운데이션 모델에서 용량을 확장하면서도 효율적인 추론을 가능하게 하는 강력한 패러다임으로 부상했다. 그러나 기존의 대부분 MoE 모델은 고정된 top-$k$ 전문가 선택 정책을 사용하며, 동적 top-$k$ 라우팅이 계산량 감소를 가져오더라도 학습 시와 다른 분포 변화(distributional shift)가 발생한다는 점을 간과하는 경우가 많다.
연구진은 활성화되는 전문가 수를 줄이는 것이 SMoE 출력의 RMS 스케일과 분산을 일관되게 증가시켜 표현 불일치(representation mismatch)를 유발하며, 이는 단순히 전문가 용량 손실 외에도 다운스트림 성능 저하에 기여함을 보여주었다. 이러한 분포 변화는 모델의 정확한 작동을 방해하는 주요 원인으로 지적되었다.
이러한 문제를 해결하기 위해, 연구진은 레이어별 분포 정렬(Layer-wise Distribution Alignment, LDA)이라는 경량화된 추론 시간 보정 기법을 제안했다. LDA는 레이어별 캘리브레이션 통계를 활용하여 축소된 라우팅 표현을 기본 설정과 정렬함으로써 성능 손실을 회복한다. 이 방법은 미미한 오버헤드를 유지하면서도 효율적인 희소 추론을 보존하며, 다양한 MoE 및 라우팅 전략에서 높은 성능 회복력을 입증했다.
용어 풀이
- 전문가 혼합
- 여러 하위 모델 중 일부만 골라 계산하는 구조. 모델이 커도 실행 비용을 줄일 수 있어요.
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.