小米发布并开源 MiMo-V2.6 系列,Pro 与 Flash 双版本,API 价格与前代持平

0 阅读18分钟

小米发布并开源 MiMo-V2.6 系列,含 Pro 与 Flash 两个原生全模态模型。

程序员 reaction:柯南00089 找到你了

发布会上的数字,哪些是信号,哪些是噪音

这不是小米第一次在大模型赛道上出手,但这次节奏比预期更快。V2.5 系列刚刚进入公测阶段,V2.6 的双版本已经正式落地。坦白讲,从 V2.5 到 V2.6 的迭代周期只有几个月,说明小米的基座训练流水线已经跑通,不再是靠一次发布赌性命的做法。

官方披露的两个关键数字值得先拎出来。MiMo-V2.6-Pro 在 Artificial Analysis Intelligence Index v4.3.2 上拿到 46 分,是开源模型里最高的。同榜单上,官方还提到 Pro 在多数 Agent benchmark 中与 Claude Opus 5 和 GPT-5.6 Sol 表现相当。Flash 版本定位更低,面向高频调用与规模化任务,是成本敏感场景的备选方案。两款均为原生全模态,支持文本、视觉和音频的联合推理,不是把多个单模态模型拼起来的伪全模态架构。

API 定价方面,官方明确表示与前代持平。在当前各家都在降价的大环境下,这算不上惊喜,但结合同时开源权重和技术报告的做法来看,小米的策略更清晰了——用价格稳住现有客户,用开源吸引开发者生态。

这次发布了什么

MiMo-V2.6 系列此次公开了两款模型,定位各不相同。

MiMo-V2.6-Pro 是旗舰推理模型,覆盖复杂项目、长程任务、高价值工作流以及网络安全与科研需求。它继承自 MiMo-V2.5-Pro 的能力基线,在 coding、computer use、3D 推理和创意生成四个维度上做了重点强化。从工程视角看,这四个方向恰好对应了 Agent 系统的核心能力:代码生成是工具调用的前置、computer use 是操作物理世界的入口、3D 推理处理空间理解、创意生成承担内容生产。

MiMo-V2.6-Flash 是全模态高效推理模型,面向专业办公中的高频调用和规模化任务。它的设计取舍很清楚——牺牲一部分极限性能,换取更低的延迟和更高的吞吐。对于日常办公场景中大量重复调用、对响应速度敏感的需求,Flash 是更务实的选择。

两款模型共享原生全模态底座,这意味着同一套权重同时处理文本、图像和音频输入输出,不需要在不同单模态模型之间做路由切换。

Pro 与 Flash 的分层逻辑

Pro 和 Flash 的分层不是简单的性能差距,而是任务类型和成本结构的差异化设计。

Pro 的场景是复杂决策和长程任务。一个典型的例子是:给模型一段产品需求文档,让它拆解成可执行的技术任务、生成对应代码、运行测试并修复失败用例。这类任务需要深度推理和长时间上下文管理,Flash 在这种场景下容易出现中途遗忘或逻辑断裂。

Flash 的场景是高频批量调用。比如客服对话、文档摘要生成、格式转换等。这些任务单次复杂度不高,但调用量大,对延迟和成本敏感。Flash 在这种场景下的性价比更优。

从架构角度看,两款模型共享同一套全模态训练基础,差异主要体现在推理时的计算分配策略和上下文管理优化上。Pro 可能开了更多的专家路由和更长的上下文窗口,Flash 则通过压缩计算路径来换取速度。具体参数细节需在技术报告中确认,小米尚未完全公开训练侧的超参配置。

AA 指数 46 分意味着什么

Artificial Analysis Intelligence Index 是一个综合评测指标,涵盖推理、编码、多模态理解等多个维度。46 分在开源模型中位居第一,但这个数字需要放在更完整的上下文里解读。

首先,AA 指数的计算方式和权重分配不对外公开,不同版本的测评结果可能有波动。v4.3.2 这个版本的评测基准覆盖了哪些具体任务、样本量多大,都需要看官方发布的详细 benchmark 表才能判断。目前公开信息里缺少完整的成绩拆解,这是一个待补充的工程透明度缺口。

其次,46 分是开源模型里的最高分,但不代表它超过了所有闭源模型。官方提到 Pro 在多数 Agent benchmark 中与 Claude Opus 5 和 GPT-5.6 Sol 表现相当,"相当"是一个模糊的表述——可能是上下浮动 2-3 分的区间,也可能是某些子项明显领先另一些略逊。在没看到细目之前,不宜过早下结论。

但从趋势上看,小米用几个月的时间从 V2.5 迭代到 V2.6,并且 Open 权重、公布技术报告,说明团队对模型质量有足够的信心。这种公开程度在国产大模型里属于较高的透明度水平。

MiMo-V2.6 系列定位分层

MiMo-V2.6 系列定位分层

这篇文章的完整内容将在后续分段中继续展开,涵盖传统 SaaS 化方案与 AI Agent 方案的选型决策对比、迁移成本分析和落地 Checklist。

程序员 reaction:哥让你三行代码

Pro 与 Flash 的分工,像极了生产环境里的两条流水线

小米发布并开源 MiMo-V2.6 系列,Pro 与 Flash 双版本,API 价格与前代持平

Pro 与 Flash 的技术分层

Pro 与 Flash 的分层不是简单的性能梯度,而是针对 Agent 工作流里不同调用成本的结构性设计。

MiMo-V2.6-Pro 采用混合 MoE 架构,总参数量达万亿级别,活跃参数保持在高带宽区间。这个组合让它在 SWE-bench Pro 这类需要多步骤推理的代码任务上,能达到 Claude Opus 5 和 GPT-5.6 Sol 的同等表现。但代价是单 token 推理延迟和显存占用,在高峰期可能成为 Agent 链路的瓶颈。

Flash 走的是另一条路。它同样基于 MoE,但更强调活跃参数与总参数的比例优化,目标是在专业办公高频调用场景里,把单次调用的成本压下来。AA 指数 46 分的背后,是一套在推理速度和智能上限之间找均衡的架构妥协。

两者共享同一套多模态底座。这意味着在文本理解、代码生成、图像识别这三个维度上,模型输出的一致性是有保障的。但在复杂项目编排、长程任务这类需要深度推理的场景里,Pro 的能力储备明显更厚。

MiMo-V2.6 模型能力分层与适用边界

MiMo-V2.6 模型能力分层与适用边界

API 定价背后的工程逻辑

「API 价格与前代持平」这句话的工程含义比表面看起来深。

对生产环境来说,模型升级带来的性能提升,如果伴随着价格上浮,团队需要重新评估投入产出比。小米选择维持价格稳定,等于把模型能力的红利直接让渡给调用方。这意味着企业可以用同样的预算,获得更强的 Agent 编排能力或更低延迟的响应。

但这个定价策略的前提是算力成本的控制。MoE 架构的关键优势就在这里——万亿总参数不等于万亿激活参数。推理时只激活部分专家层,显存占用和计算开销都被压缩在可接受区间。这也是为什么 Pro 和 Flash 能在性能差距明显的情况下,保持价格一致。

从工程选型角度看,价格持平释放了一个信号:小米把这套模型定义为生产级基础设施,而不是实验性产品。这会影响企业的采购决策周期——原本需要反复论证的投入,现在可以直接进入 POC 阶段。

选型决策:什么时候该用哪个

选 Pro 还是 Flash,取决于你的 Agent 工作流对延迟、成本和复杂度的容忍度。

如果你的场景是复杂项目编排、涉及多步骤推理的代码生成,或者需要处理长程任务(比如完整软件工程的自动化),Pro 的 AA 指数 46 分对应的能力储备更可靠。这类场景下,单 token 成本的差异会被任务成功率提升所覆盖。

如果你的场景是专业办公里的高频调用——比如文档处理、会议纪要生成、常规代码审查——Flash 的单次调用成本更低,且 AA 指数 41 分足以覆盖这类任务的复杂度。这类场景的瓶颈通常不在模型上限,而在调用频率和并发量。

更准确地说,判断标准可以简化为一条原则:任务复杂度是否超出 Flash 的稳定处理区间。如果答案是不确定的,建议先用 Flash 跑一轮 POC,记录失败案例的分布,再决定是否升级到 Pro。

Agent 场景选型决策流程

Agent 场景选型决策流程

落地边界:什么场景下需要重新评估

Pro 与 Flash 的能力边界,决定了它们的适用范围。

在代码生成和 Agent 编排这类任务上,MiMo-V2.6 的表现已经接近闭源模型的同档位产品。但问题在于,SWE-bench Pro 的成绩只是基准测试。真实生产环境里的失败案例,往往发生在边界条件——比如上下文长度超过模型训练分布、或者多模态输入中出现罕见组合。

一个容易被忽视的边界是并发规模。当你的 Agent 工作流需要同时处理数百个并行任务时,Pro 的活跃参数规模会带来更高的显存峰值。这时候即使 API 价格持平,实际部署成本也可能因为资源预留而上升。这类场景需要先做压力测试,再决定是按 Pro 规格扩容,还是切换为分布式 Flash 集群。

另一个边界是延迟敏感型应用。如果 Agent 需要实时响应(比如交互式代码审查、即时文档生成),Flash 的单 token 延迟优势会更明显。Pro 的推理延迟在某些边界条件下可能超出交互阈值,这时候选择 Flash 不是降级,而是适配。

坦白讲,AA 指数 46 分是个有意义的里程碑,但它不能完全替代生产环境的验证。企业在选型时,应该先明确自己的 Agent 工作流的三个参数:任务复杂度分布、单 token 调用预算、延迟容忍区间。这三个参数确定了,Pro 和 Flash 的边界就清晰了。

更狠的是,每年能省下一个亿——如果调用规模足够大,Flash 的性价比优势会直接体现在财务报表上。

MiMo-V2.6 的价格分层与性能定位

小米这一代的产品矩阵很清晰:MiMo-V2.6-Pro 是旗舰推理模型,覆盖复杂项目、长程任务、网络安全与科研需求;MiMo-V2.6-Flash 是高效推理模型,面向专业办公中的高频调用与规模化任务;还有一款 MiMo-V2.6-Pro-Ultraspeed,声称能在保持 V2.6-Pro 旗舰性能的同时提供最高 20 倍推理速度。

从 AA 指数的 46 分来看,Pro 版本在大多数 Agent 基准测试中与 Claude Opus 5 和 GPT-5.6 Sol 处于同一梯队。这不是简单的参数堆砌能解释的结果。小米采用的是混合专家架构(MoE),总参数规模达到万亿级别,但活跃参数比例经过精心计算。这意味着模型在推理时只激活部分参数,从而在保证性能的同时控制计算开销。

Flash 版本的定位更像是「够用且便宜」的工程选择。它继承了 V2.6 系列的全模态能力,但在推理速度和成本之间做了明确取舍。对于高频调用场景,这种取舍是合理的——你不需要每次都调用最强模型,只需要在关键时刻使用 Pro。

选型决策:什么场景该用什么版本

选型的本质是成本与性能的权衡。以下是一个简单的决策框架:

场景推荐版本理由
复杂 Agent 任务、长程推理ProAA 指数 46 分,与顶级闭源模型持平
高频调用、规模化任务Flash成本可控,性能足够
强实时交互、对响应速度敏感Pro-Ultraspeed最高 20 倍推理速度
语音识别/合成V2.5-ASR/TTS专用模型,不通用

高复杂度 Agent 任务:Pro 的领地

如果你的工作流涉及多步骤推理、工具调用、代码生成或跨模态理解,Pro 是更稳妥的选择。AA 指数 46 分不是一个孤立的数字,它反映了模型在 Terminal-Bench、QA-F1 等多个基准上的综合表现。这意味着在实际的 Agent 任务中,Pro 能够更可靠地完成复杂指令,减少因模型理解偏差导致的返工。

高频调用与规模化推理:Flash 的主场

Flash 的价值在于性价比。对于内容分类、摘要生成、简单问答等不需要深度推理的任务,Flash 的成本优势明显。如果你的调用量级是百万次/天,这个成本差异会非常直观。坦白讲,很多生产环境并不需要 Pro 的全部能力,Flash 已经足够。

实时交互场景:Ultraspeed 的定位

Pro-Ultraspeed 是一个有趣的中间态。它保留了 Pro 的性能,同时通过架构优化实现了最高 20 倍的推理速度提升。这对于需要低延迟响应的场景(如实时对话、交互式 Agent)非常关键。但需要注意,20 倍是一个上限值,实际加速比取决于具体任务和输入长度。

MiMo-V2.6 系列选型决策流程

MiMo-V2.6 系列选型决策流程

落地边界:什么时候需要重新评估

任何选型决策都有边界条件。MiMo-V2.6 系列也不例外。

首先,MoE 架构的工程代价不容小觑。虽然活跃参数比例低,但总参数规模决定了模型部署的基础设施成本。如果你的团队没有成熟的 GPU 集群管理经验,或者对推理延迟有严格要求,自行部署 Pro 可能不是最优解。这时候 API 调用是更务实的选择。

其次,开源承诺的兑现程度直接影响生产信任。V2.6-Flash 已经开源,但 Pro 版本的权重是否开放、何时开放,仍是一个未知数。对于需要深度定制、私有化部署的企业来说,这层不确定性需要在选型时充分考虑。

最后,性能基准与实际表现的差距。AA 指数 46 分是在受控环境下测得的,真实生产场景中的表现可能因数据分布、提示工程、工具调用复杂度等因素而有所不同。建议在正式上线前进行充分的 POC 测试,而非直接信任基准分数。

落地边界检查清单

落地边界检查清单

下一步行动建议

如果正在考虑引入 MiMo-V2.6 系列,以下三件事可以今天就开始:

  1. 明确任务类型与调用量级:整理现有 AI 工作负载,按复杂度、频率、延迟要求分类,确定哪些场景适合 Pro、哪些适合 Flash。
  2. 申请 API Key 进行 POC:通过小米官方渠道获取测试额度,在真实业务数据上验证性能表现,而非仅看基准分数。
  3. 评估基础设施成本:如果考虑自部署,计算 GPU 集群的采购、运维、能耗成本,与 API 调用成本进行对比。

价格持平意味着小米在这一代产品上试图建立「高性能不高价」的认知。对于开发者而言,这是一个降低试用门槛的信号。但认知不等于实践,真正的考验在于你的任务是否真的需要 Pro 的能力,以及 Flash 是否能在成本约束下满足需求。这个问题的答案,只有在你的具体场景中才能得到。

MiMo-V2.6-Pro 在 Artificial Analysis Intelligence Index v4.3.2 拿到 46 分,是目前开源模型里最高的。MiMo-V2.6-Flash 没有公开 AA 分数,但定位明确:高频调用、规模化推理、成本敏感的工业场景

API 价格与前代持平。这不是营销话术,是工程上的必然结果。

定价为何持平

MiMo 系列走的是 MoE(Mixture of Experts)路线。Flash 上一代的总参数 309B、活跃参数 15B;Pro 升级到万亿参数级别。参数量上去了,但推理时只激活一部分专家,单位 Token 的计算开销增长远小于参数总量增长。

换句话说,模型变强了,单 Token 成本没跟着线性涨。API 定价持平,本质上是架构优化抵消了算力膨胀。

程序员 reaction:还不滚去学习

工程师看了报价单,松了口气

Flash 的成本逻辑

Flash 的设计目标是把总参数控制在合理区间,同时保持多模态能力。它的活跃参数比例更高,推理延迟低,适合每秒上千次调用的 Agent 流水线。成本核算方式很简单:按活跃参数计费,而不是按总参数。

Pro 的性能溢价

Pro 的 46 分 AA 指数意味着它在复杂 Agent 任务、代码生成、计算机操作等 benchmark 上追平 Claude Opus 5 和 GPT-5.6 Sol。溢价不在 API 价格,而在调用质量——同一个任务,用 Pro 少回滚几次,省下的开发时间远超 Token 差价。

选型决策

选型不是比参数,是比场景。

``mermaid

MiMo-V2.6 选型决策流

MiMo-V2.6 选型决策流

什么场景用 Pro

长程任务、高价值工作、网络安全审计、科研级代码生成——这些场景一旦出错,回滚成本远高于 API 费用。Pro 的优势在复杂推理和工具调用链稳定性,不是跑分,是少踩坑。

什么场景用 Flash

办公自动化、文档处理、批量数据提取、高频意图识别——Flash 的核心价值是单位成本下的吞吐。调用量大、结果容错度高、对延迟不敏感,Flash 是更经济的选择。

程序员 reaction:beingable

选模型就像选螺丝刀,别拿重型扳手拧小螺丝

工程边界

边界比选型更重要。很多团队把 Pro 当通用模型用,结果发现成本失控;也有人用 Flash 跑安全审计,事后发现幻觉率高。

以下几个边界条件需要重新评估模型策略:

  1. 任务类型变化:原本批量处理,突然变成实时交互式 Agent
  2. 输出质量要求提升:内部测试 OK,生产环境用户投诉率上升
  3. 调用量暴增:月用量从万级跳到百万级,Flash 的吞吐量开始触顶
  4. 合规要求收紧:金融、医疗场景需要可解释性和审计追踪,Pro 的复杂推理链反而更难审查

模型选型不是一次决定,是持续匹配的过程。边界条件变了,策略就得跟着变。

下一步

今天就能做三件事:

  1. 拉出当前 AI 调用的 usage 报表,按任务类型分类,标记每类调用的成功率和回滚率
  2. 对照选型决策流,把现有调用重新归类,找出 Pro/Flash 错配的条目
  3. 给错配条目建一个灰度切换计划,先切 10% 流量验证效果,再决定是否全量迁移

选型不是选最强模型,是选最合适的模型。MiMo-V2.6 双版本的意义不在于参数数字,而在于让不同场景找到各自的经济最优解。

参考文献

  1. Xiaomi MiMo @XiaomiMiMo on X
  2. 模型发布 - Xiaomi MiMo
  3. Xiaomi MiMo-V2-Pro - AA Intelligence Index
  4. MiMo V2 Pro vs Omni vs Flash: How should I choose in 2026 前几天,小米技术团队在 X 平台发布了一条消息,内容很简单:MiMo-V2.6 系列来了,Pro 和 Flash 两款原生全模态模型同时推出,API 价格与前代持平。没有发布会,没有营销辞令,就是一张图加一段说明。但这张图里的数字值得细看——Pro 在 Artificial Analysis Intelligence Index v4.3.2 拿到 46 分,这个分数在开源模型里排第一。更关键的是,两款模型的定价策略与性能分层之间的对齐方式,暴露了小米在这一代产品上的工程取舍。

延伸入口

文末收口图