리서치 연구
WMT26 과제 적용, 라우팅 기반 전문가 가지치기를 통한 모델 압축 연구
ESTS at WMT26: Routing-Informed Expert Pruning for Model Compression
arXiv연구팀이 GPT-OSS-20B 기반의 대규모 언어 모델을 압축하여 WMT26 번역 과제에 적용한 성과를 발표했습니다.
세 줄 요약
- 과제별 라우팅 정보를 활용해 중요도가 낮은 전문가(expert)를 제거하고, MXFP4 양자화까지 적용하여 모델을 경량화하는 데 성공했습니다.
- 모델 크기를 대폭 줄여도 성능 저하가 적어, 실제 서비스 환경에서 빠르고 효율적인 고성능 번역 시스템 구축이 가능합니다.
- WMT26 환경에 맞춰 합성 데이터 재학습과 추론 검증, JSON 복원 등 견고한 시스템까지 구현하여 안정성을 확보했습니다.
연구팀이 GPT-OSS-20B 기반의 대규모 언어 모델을 압축하여 WMT26 번역 과제에 적용한 성과를 발표했습니다.