샤오미 MiMo-V2.6: 자가 개선형 초거대 다중 모드 모델 공개 — AI 생성 일러스트AI 일러스트
모델 뉴스

샤오미 MiMo-V2.6: 자가 개선형 초거대 다중 모드 모델 공개

XiaomiMiMo/MiMo-V2.6-Flash-RL

Hugging Face발표일 미상 · 3분

샤오미가 MiMo-V2.6-Flash-RL을 공개하며, 텍스트, 이미지, 비디오, 오디오를 통합 처리하는 초거대 다중 모드(Omnimodal) 모델을 선보였습니다.

세 줄 요약Hugging Face 원문 기반
  1. '그룹별 에이전트 평가' 기반의 자가 개선 루프와 도메인 간 지식 전이를 통해 스스로 성능을 끌어올리는 것이 핵심 기술입니다.
  2. 100만 토큰의 초장문 컨텍스트 처리 능력과 강력한 에이전트 기능을 결합하여 복잡하고 장기적인 추론 및 문제 해결 능력을 제공합니다.
  3. Flash 버전은 효율성과 성능 균형에 중점을 두었으며, 최적 사용을 위해 SGLang이나 vLLM 같은 전문 배포 환경 설정이 권장됩니다.

MiMo-V2.6-Flash-RL은 MiMo-V2.6 시리즈의 효율성 균형을 맞춘 체크포인트 버전입니다. 이 시리즈는 (RL) 컴퓨팅, 환경 다양성, 평가자(grader) 컴퓨팅을 함께 확장하여 모델이 탐색과 피드백을 통해 지속적으로 역량을 넓히도록 설계되었습니다. 주요 특징으로는 텍스트, 이미지, 비디오, 오디오를 하나의 모델에서 처리하는 네이티브 다중 모드 기능과 최대 1M 의 장기 컨텍스트 처리가 가능합니다.

모델은 '그룹별 평가(Groupwise Agentic Grading)'라는 자가 개선 루프를 통해 성능을 향상시킵니다. 기존의 이진 패스/실패 판정 방식 대신, 그룹 내 롤아웃 간 비교를 통해 작업별 상세한 채점 기준(rubrics)을 오프라인으로 구축하고 이를 테스트 결과와 결합합니다. 또한, 코딩, 일반 에이전트, 시각, 사이버 보안 등 다양한 도메인의 작업을 하나의 배치에서 혼합하여 RL을 수행함으로써, 각 역량이 서로를 강화하고 학습된 전략이 훈련 과정에서 보지 못한 영역으로 전이되도록 합니다.

MiMo-V2.6은 아키텍처 측면에서도 고도화되었습니다. 총 309B 중 15B가 활성화되는 희소 (Sparse Mixture of Experts) 구조를 채택했으며, 컨텍스트 길이는 1M 토큰을 지원합니다. 모달리티 구성으로는 MiMo ViT (681M 파라미터), AudioTokenizer 및 오디오 패치 인코더 등이 포함되어 있으며, 예측 과정에서는 5-layer의 추측 디코더(speculative decoder)를 사용합니다.

실제 서비스 환경에서 모델을 활용하기 위해서는 전문적인 배포 프레임워크가 권장됩니다. 예를 들어 SGLang을 사용할 경우, `--model-path XiaomiMiMo/MiMo-V2.6-Flash-RL`과 같은 명령어를 사용하여 텐서 병렬 처리(tp) 및 메모리 관리를 설정할 수 있습니다. vLLM 환경에서도 유사하게 `vllm serve XiaomiMiMo/MiMo-V2.6-Flash-RL` 등의 명령어로 모델을 구동하며, 이 과정에서 추론 파서와 도구 호출 파서를 지정해야 합니다.

용어 풀이

강화 학습
행동의 결과에 보상을 주면서 더 나은 행동을 익히게 하는 학습 방법.
토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
에이전트
목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
파라미터
모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
MoE
여러 하위 모델 중 일부만 골라 계산하는 구조. 모델이 커도 실행 비용을 줄일 수 있어요.
원문Hugging Face · XiaomiMiMo/MiMo-V2.6-Flash-RL같은 주제 가이드 · 바로 써 보기내 업무 예시로 AI 모델 비교하기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기