샤오미 MiMo-V2.6, 자체 개선 루프를 갖춘 옴니모달 LLM 공개
XiaomiMiMo/MiMo-V2.6-Pro-RL
Hugging Face샤오미가 텍스트, 이미지, 비디오, 오디오를 통합 이해하는 최신 거대 모델 'MiMo-V2.6-Pro-RL'을 공개하며 AI 기술의 새로운 지평을 열었습니다.
- 자체 개선 루프(Self-Improvement Loop)를 통해 성능을 극대화했으며, 100만 토큰의 초장문 컨텍스트와 Sparse MoE 구조가 핵심 특징입니다.
- 코딩, 사이버 보안, 범용 에이전트 등 다양한 고난도 영역에서 최고 수준의 성능을 입증하며 실질적인 활용성이 극대화되었습니다.
- 최고의 성능을 활용하려면 SGLang이나 vLLM 같은 전용 배포 프레임워크와 강력한 GPU 자원을 갖추는 것이 필수적입니다.
MiMo-V2.6-Pro-RL은 샤오미의 플래그십 체크포인트로, (RL)을 자체 개선 방향으로 확장하는 데 초점을 맞추었습니다. 이 모델은 텍스트, 이미지, 비디오, 오디오를 하나의 모델에서 처리할 수 있는 네이티브 옴니모달 기능을 제공하며, 최대 1M 의 긴 컨텍스트 처리가 가능합니다. 또한, 코딩, 일반 , 사이버 보안 등 다양한 도메인에 걸쳐 단일 혼합 RL(mixed RL) 실행을 통해 역량이 상호 강화되도록 설계되었습니다.
모델은 그룹별 에이전트 평가(Groupwise Agentic Grading)를 통해 자체 개선 루프를 완성합니다. 이 과정에서 Groupwise Reward Synthesis (GRS)와 Groupwise Advantage Redistribution (GAR) 같은 기법을 사용하여 보상 신호를 확장하고, 모델 스스로의 샘플을 기준으로 환경 경화 및 적대적 스크리닝을 수행하여 정렬된 RL(Aligned RL)을 구현했습니다. 아키텍처는 Sparse 구조를 채택했으며, 총 1.02T 중 42B가 활성화됩니다.
MiMo-V2.6 Pro는 다양한 평가에서 높은 성능을 보였습니다. 예를 들어, DeepSWE v1.1에서는 71.9점, AutomationBench v1.0.6에서는 53.1점을 기록했습니다. 사용자는 SGLang이나 vLLM과 같은 전용 배포 프레임워크를 사용하여 모델에 접근할 수 있으며, 각 프레임워크별로 상세한 실행 명령어 예시가 제공됩니다.
용어 풀이
- 강화 학습
- 행동의 결과에 보상을 주면서 더 나은 행동을 익히게 하는 학습 방법.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
- MoE
- 여러 하위 모델 중 일부만 골라 계산하는 구조. 모델이 커도 실행 비용을 줄일 수 있어요.
- 파라미터
- 모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.