2026 年 9 月 22 日凌晨,小米正式发布并开源全新一代 MiMo 大模型系列,包含全模态旗舰模型 Xiaomi MiMo-V2.6-Pro、高效推理模型 Xiaomi MiMo-V2.6-Flash,并同步上线 Pro 版本的 UltraSpeed 超高速模式以及 MiMo Desktop 桌面客户端正式版。在全球大模型测评平台 Artificial Analysis 的综合智能指数榜单中,MiMo-V2.6-Pro 以 46 分的成绩位列全球开源大模型与国产开源模型第一位,超过 Kimi K3(44 分)和 GLM-5.3(45 分),较其前代 MiMo-V2.5-Pro 的 26 分高出 20 分。
文末有免费使用的方法,点击文章末尾原文链接即可查看
一、双模型架构:Pro 与 Flash 的精准分工
MiMo-V2.6 系列并非单一模型,而是包含两个独立训练运行的检查点。两者均于 2026 年 9 月 21 日上线 Hugging Face,采用 MIT 许可证,都以可下载为先。
MiMo-V2.6-Pro 是小米迄今能力最强的模型,总参数量达到 1.02 万亿,每 token 激活 42B,采用稀疏混合专家架构。MiMo-V2.6-Flash 则主打效率与成本的平衡,总参数量 309B,每 token 仅激活 15B,拥有 48 层骨干网络,其中 39 层为滑动窗口注意力,9 层为全注意力,隐藏大小为 4096,配置 256 个路由专家、激活 8 个,滑动窗口为 128 token。
在模态支持上,两者均为原生全模态模型,将文本、图像、视频和音频纳入同一个模型体系。Flash 搭载了 681M 参数的视觉 transformer、308M 的音频 tokenizer 以及 127M 的音频 patch 编码器。两款模型均宣称支持 100 万 token 上下文,配置支持 1,048,576 token 的最大位置嵌入。
小米官方将这一代模型的定位描述为探索 RSI(递归自我改进) 路径的关键一步——以可验证的复杂任务为基础,规模化扩展强化学习算力,让模型在持续的探索与反馈中拓展智能边界。
二、性能表现:开源阵营的新天花板
MiMo-V2.6-Pro 在多个权威基准上表现亮眼。在 Artificial Analysis Intelligence Index v4.3.2 中取得 46 分,超过 Kimi K3 和 GLM-5.3,成为当前 AA 指数上排名最高的开源权重模型。小米官方同时坦承,与 Claude Fable 5.1 和 GPT-6 Astra(均为 53 分)等顶级闭源模型相比仍有差距。
在具体任务基准上,Pro 展现出接近闭源旗舰模型的实力:
- DeepSWE v1.1(软件工程) :71.9 分,接近 DeepSeek V4.1 Flash 的 74.2 分和 Claude Opus 5 的 74.0 分
- Terminal Bench 4.0:34.9 分,远超前代 MiMo-V2.5-Pro 的 1.5 分
- Toolathlon-verified(工具调用) :76.9 分,与 Claude Opus 5 的 80.6 分差距较小
- Automation Bench v1.0.6:53.1 分,超过 GPT 6 Astra 的 52.0 分和 Claude Opus 5 的 50.3 分
MiMo-V2.6-Flash 同样表现不俗,全面超越上一代旗舰 MiMo-V2.5-Pro。在 CyberGym 网络安全测试中,Flash 甚至以 95.1 分超过 Pro 的 94.0 分,位列系列第一。
一个值得关注的数据来自 Code Arena WebDev 排行榜:MiMo-V2.6-Pro 位列总榜第 10、开源模型第 3,仅次于 GPT-6 Astra 和 Claude Fable 5.1。北京大学材料科学与工程学院特聘研究员窦锦虎对 MiMo-V2.6-Pro 的评价是“达到训练有素博士研究人员水平”。
价格方面,Flash 版本每百万输入词元 1 元、输出词元 2 元;Pro 版本每百万输入 3 元、输出 6 元,同时提供 99% 缓存折扣。在智能能力升级的前提下维持原有定价,官方测算同等能力下成本仅为海外同类模型的 1/20 至 1/60。
三、训练方法论:公开直播 RL 过程
MiMo-V2.6 系列最引人注目的创新之一是训练过程的完全透明。小米 MiMo 大模型团队负责人罗福莉在 X 平台发文并发布了两款模型的实时训练数据看板,向公众“直播” MiMo-V2.6-Pro 和 Flash 的训练步数、Token 消耗等关键指标。
Pro 与 Flash 训练历时不到 6 天,成本分别约 262 万美元与 85 万美元,各完成 30 步,累计约 75 万条轨迹。训练任务平均通过率分别相对提升 25% 和 12%,样本外的长程软件工程评测基准 DeepSWE v1.1 分别提升约 17 分(48.8 至 65.7)和约 14 分(58.4 至 72.6)。
本次训练从三个维度扩展 RL 算力:更大的 Batch 与更高吞吐,单次更新使用 1568 个样本,支持 100 万上下文长度训练,单步训练 Token 达 3.5 至 3.7B;更多任务与复杂环境,构建覆盖 Code、General、Visual、Cyber 等方向的多任务训练体系;更大的 Grader 算力,通过 Group 内相对比较为长程 RL 任务提供更精准的奖励信号。高盛估计,MiMo-V2.6-Flash/Pro 的 RL 训练基于约 4000/8000 个 H200 等效 GPU 集群。
四、开源策略:全栈透明
小米对 MiMo-V2.6 的开源力度在行业内颇为罕见。除了模型权重和技术报告完整开源外,还同步放出了 MiMo-V2.6-Distill-Qwen-9B 以及全套强化学习研究资源,包括训练代码、RL 环境等技术细节,对外公开可复用的训练实践。
两款模型均采用 MIT 许可证,没有营收门槛,商业部署、修改和再分发均获允许。Flash 发布了 172.9 GB 的 FP8 权重数据,分布在 65 个分片中;Pro 的参数量约为其三倍,权重下载量达到半 TB 级别。
开源链接:huggingface.co/collections…
五、能力扩展与应用场景
MiMo-V2.6 系列在传统语言能力之外实现了显著的能力扩展。模型融合了 3D 空间推理、多模态感知与计算机操作能力,将自然语言编程任务拓展至可交互世界构建的 Vibe World 范式。
在游戏开发场景中,用户输入图片、视频或文字后,模型可将需求拆解为多个任务,由多智能体协作完成 3D 场景搭建、交互逻辑编写与视觉验证。在具身仿真环境中,MiMo-V2.6 可直接以多视角相机画面为输入,通过视觉反馈闭环控制 Franka Panda 机械臂,完成物体抓取、颜色匹配与精准放置。
在内容创作方面,模型在审美生成能力上得到增强,可完成网页、Figma 设计稿、幻灯片、SVG、视频、音乐等多种数字内容产出。
六、免费体验!
如何免费体验?
避免被系统识别为广告,点击原文链接查看,真实免费食用!!!