2026 年 10 月 7 日,微软在旧金山一场 Windows 与 Surface 发布会上把三件事捆在一起讲:一个 137B 参数的编码模型可以下载到本地跑;GitHub 的多模型路由器 HydraFusion 开始把本地模型纳入调度;一套叫 MXC 的 Agent 执行沙箱正式 GA。官方给这套组合起的名字是 hybrid intelligence(混合智能)。
过去一年里"端侧模型"并不新鲜,新的是这次放上端侧的是一台 137B 的 MoE 编码模型——量级上已经能对标云端旗舰的部分编码任务,而不是 7B 级别的补全玩具。真正决定它能不能用的,反而是两个不那么性感的问题:内存要吃多少,以及放出去的 Agent 谁来管。
一、MAI-Code-1.1-Flash:把 137B 压到 53GB
模型本体是 Mixture-of-Experts:137B 总参数,每 token 激活 6.8B,支持 256K 上下文。据微软自家的技术数据,端侧版本用了约 3.3 bit/weight 的混合精度量化,权重体积压到约 53GB,比 bfloat16 云端版本小约 80%,同时保留完整 256K 上下文窗口。
跑在 Surface Laptop Ultra(NVIDIA RTX Spark,最高 128GB 统一内存)上,256K 满载时峰值内存 75.5GB;64K 上下文下 prompt 吞吐 923.5 token/s,128K 下 769.8 token/s。微软建议"最佳性能"用 120GB 以上内存——注意这是推荐值,不是硬性最低配置。
基准(微软 2026-10-05 自测):
| 基准 | 云端全精度 | 端侧量化 | GPT-OSS-120B(社区 GGUF) |
|---|---|---|---|
| SWE-bench Verified | 72.6% | 70.8% | 32.0% |
| Terminal-Bench 2.1 | 62.9% | 66.29% | 23.6% |
三列都要标注:厂商自测、无独立复现;GPT-OSS 那一列用的是社区 GGUF 构建,不是独立对等测试。有意思的是 Terminal-Bench 2.1 上量化版本反而更高(66.29% vs 62.9%),大概率是评测噪声或采样设置差异,不宜当成"量化提升质量"的结论。
和 6 月发布的 1.0 相比,官方称 token 流速度 +25%、完成任务所需 token -25%、成本降到 1/4;Copilot CLI 的 Terminal-Bench 2.1 +22%,.NET 任务 +15%。生产侧指标是 code survival +4%、回访 +9%。
端侧怎么"塞"进去?两个杠杆:量化把权重位宽降下来(省的是静态占用),投机解码(DFlash2)用小草稿模型提议 token 块、再由目标模型校验(省的是端到端延迟)。技术栈上,微软说这次跑在 Windows ARM64 的 llama.cpp CUDA 运行时上,Windows ML 也开始支持 llama.cpp。
一个必须说清的取舍:代码任务对量化更敏感。自然语言里错一个词还能读,代码里错一个 token 可能直接是语法错误、错标识符、无效 tool call 或者坏 diff。这正是"70.8% vs 72.6%"那 1.8 个百分点值得盯的地方——它在 SWE-bench 上看着小,但换到你自己仓库的 agent loop 里是否稳定,目前没有公开的独立数据。
二、HydraFusion:谁决定任务跑本地还是云端
本地模型不是独立入口,它是被"路由"进去的。GitHub 的 HydraFusion 起步于 2026 年 9 月的研究预览(先在 Copilot CLI,后进 VS Code 和 Copilot app),本质是运行时多模型编排:不是给你挑一个模型,而是为每个请求生成执行计划。
它建立在更早的 HyDRA(Hybrid Dynamic Routing Architecture)上,后者按推理、代码生成、调试、工具调用四类信号给任务打分。HydraFusion 用这些分数在三种模式里挑一个:
- Single:一个模型直接做完。
- Cascade:便宜模型先起草,质检门不过就升级到更强模型。
- Critique:一个模型起草,另一个家族、不带工具的评论者只读评审,起草者改一版。
官方给的对照基线是 Claude Opus 5(中等推理档,同工具同限制):
| 基准 | 成本 vs Opus 5 | 质量 vs Opus 5 |
|---|---|---|
| TerminalBench 2.1 | -67% | +4.9 pt |
| DeepSWE | -36% | -1.5 pt |
| CheckpointBench | -65% | -0.1 pt |
10 月 7 日的更新是把 HydraFusion 扩到 Windows 上的本地模型:一条路是自动编排(Copilot 综合考虑任务上下文与 cache 状态,在本地/云端之间路由),另一条是显式选择——通过 Windows ML provider 选 MAI Code 1.1 Flash,或接一个 OpenAI 兼容的本地端点。计费按实际调用到的每个底层模型的标准费率算,本地调用零推理费。
工程约束里有一条对 Agent 很关键:隔离评审——评论者跑在没有工具的上下文里,不能改仓库;工作流被取消或校验失败时不打补丁。这两条是为了避免"半成品 diff 进仓库"。Cascade 还有个隐藏成本:如果升级途中被打断,仓库里不落补丁,但账单上已经发生的 token 仍会留下。
GitHub Community 讨论 #206492 里有开发者的真实反馈:有人实测"质量不比全程 Opus 5 差太多,但额度消耗只有平时的 10%",同时抱怨看不到实现阶段到底用了哪个模型、AIC 计数与 CLI 计数对不上。这是路由类方案的典型信任问题——你得能看见它替你做了什么决定。
三、MXC:给 Agent 划一条 OS 级边界
如果只看模型,"本地跑零推理费"是纯利好;把 Agent 放进来,问题就变了。微软在发布会上演示的一个场景很直白:一个恶意 GitHub 仓库诱导编码助手执行命令,开了一个 reverse shell。
MXC(Microsoft Execution Containers)就是回应。它在 10 月 7 日 GA(Windows 11 商业客户),定位是策略驱动的执行层,可约束模型输出、插件、工具、agent harness 或整个 agent。关键设计是:策略在 agent 工作负载之外,agent 或它生成的代码不能给自己加权限。
开发者用统一的 JSON schema + 多语言 SDK 声明资源需求,MXC 把它映射到对应后端,在 Windows / macOS / Linux 上一致执行。四个后端:
| 后端 | 可用性 | 特点 |
|---|---|---|
| Process container | Win11 / macOS / Linux | 轻量;分别用 AppContainer / Seatbelt / Bubblewrap |
| Session container | 仅 Win11 | 独立 Windows 账户与会话,隔离桌面、剪贴板、UI、输入 |
| WSL container | 仅 Win11 | 面向 Linux 工具链 |
| MicroVM | Win11 + Linux,实验 | 硬件强隔离 |
策略覆盖五个面:containment、process、file system、network、user interface。举个官方口吻的例子——编码 agent 可以读写自己的仓库、调用 git,但读不到用户 Documents,也能禁掉进出站网络。
三种运行模式要分清:
- Enforcement:越界即拦,生产该用这个。
- Learning:照样拦,但把被拒的操作记进 JSON 报告,用来补权限。
- Permissive:记录但放行——只用于策略调试,不是强制。
落地状态要诚实标注:MicroVM 实验性;Intune 集中管理策略尚未 GA;Entra / Agent 365 的身份与审计接入还在路上。已支持 MXC 的有 GitHub Copilot、OpenAI Codex、OpenClaw、Replit、LM Studio、NVIDIA OpenShell、Unsloth AI;Claude Code、Perplexity 等待接入。GitHub Copilot CLI 用的是 MXC 的 process isolation(Windows 上是 ProcessContainer 的 BaseContainer 层,macOS 用 Seatbelt,Linux 用 bubblewrap),官方称这些本地后端不需要单独的 VM 或容器镜像。
还有一条容易被忽略:本地推理不等于整个会话离线。远程工具调用和另发的云端请求,仍可能把工作送出 PC 之外。MXC 管的是"能碰到什么",不是"数据去了哪里"。
四、谁真的该用
把三条线合起来,适配人群其实很窄:
- 有 128GB 级机器的重度 Agent 用户:全天跑 agent、上下文常年在 64K 以上、对代码隐私敏感(数据主权/合规场景)。本地零单次推理费 + 256K 窗口是实打实的收益。
- 企业 IT / 平台团队:MXC 的价值在于把"给 agent 最小权限"从口头约定变成 OS 强制的策略,加上 Defender 对恶意 prompt 的前置检测。这类团队该现在就开始写策略、跑 Learning 模式收集权限画像。
- 普通笔记本用户:120GB 推荐内存基本把 MAI Code 1.1 Flash 排除在外;Foundry Local 那条线(ONNX Runtime,CPU/GPU/NPU,8GB 起)才是入口。MXC 跨平台且开源,在 Linux 上自托管 agent 的人也能直接用。
成本账别只看"零推理费"。本地推理把云端的 OPEX 换成了硬件 CAPEX + 电费 + 维护,是否更便宜取决于任务频次和硬件利用率。Surface Laptop Ultra 起步 $2,599(不含顶配内存)。一句话总结取舍:省的是按次推理费,付的是前置硬件与治理成本。
五、一个最小起步
想动手,两条路。装 Foundry Local 拿一个 OpenAI 兼容端点(本地推理最省事的入口):
winget install Microsoft.FoundryLocal
foundry model run qwen2.5-7b-instruct
foundry service status # 拿到 http://localhost:<port>/v1
from foundry_local import FoundryLocalManager
from openai import OpenAI
manager = FoundryLocalManager("qwen2.5-7b-instruct")
client = OpenAI(base_url=manager.endpoint, api_key=manager.api_key) # key 是本地占位符
# 工具层自己加沙箱检查:只允许读写项目目录
# def read_file(path): # 解析后必须落在 PROJECT_ROOT 之内,否则拒绝
给 agent 写 MXC 策略时,思路是把"需要什么"写下来,而不是"禁止什么"(默认拒绝更安全):
{
"containment": "process",
"filesystem": {
"readwrite": ["~/work/my-repo"],
"readonly": ["/usr/share/git"],
"deny": ["~/Documents", "~/.ssh"]
},
"network": { "outbound": false, "loopback": true },
"ui": { "desktop": false }
}
上面这段按策略面组织的结构是示意,实际字段以后端与 SDK 文档为准。推荐流程:先在 Learning 模式下跑,把"实际想访问但被拒"的项收集齐,再切 Enforcement 上生产。
结语
这次发布的真正信息量,不在 137B 这个数字,而在它把"端侧推理"和"Agent 权限"两件事绑在一起交付:模型能跑在本地了,所以更得回答"它能碰什么"。微软给的答案是分层的——本地模型 + 路由 + OS 级沙箱。三块里最成熟的是 MXC(已 GA、跨平台、开源);本地模型和 HydraFusion 的本地路由都还是 preview,性能数据目前全是厂商自测。还没接上的一环是治理:Intune 集中管控与 Entra 身份审计尚未 GA,"Agent 作为独立身份被许可和审计"目前仍是路线图。对要落地的人来说,先把 MXC 策略跑起来,比追那 1.8 个百分点更实际。
参考链接:
- MAI-Code-1.1-Flash: Better, faster, at a quarter of the cost — microsoft.ai/news/mai-co…
- Microsoft Execution Containers: Policy-driven containment for AI agents — blogs.windows.com/windowsdeve…
- Windows platform security for AI agents — blogs.windows.com/windowsdeve…
- Project HydraFusion: Frontier quality via multi-model orchestration(GitHub Blog)— github.blog/ai-and-ml/p…
- [Research Preview] HydraFusion is live in GitHub Copilot CLI(GitHub Community Discussion #206492)— github.com/orgs/commun…
- Microsoft's Local Coding AI Has Zero Inference Fees but Recommends 120GB-Plus RAM(eWeek)— www.eweek.com/news/micros…
- Microsoft Execution Containers for AI Agents Reach GA on Windows 11(eSecurityPlanet)— www.esecurityplanet.com/endpoint-se…
- GitHub Copilot HydraFusion Preview Brings Local and Cloud Model Routing to Windows(WindowsForum)— windowsforum.com/news/github…
创作说明:本文在资料整理与成文中使用了 AI 辅助(DeepSeek),经作者审阅后发布,作者对内容负责。