2026.07.20 AI基础设施三线复盘:Helios / Frozen v2 / Agent Toolkit

28 阅读4分钟

2026年7月20日,AMD、谷歌、英伟达同日发布了三款面向AI基础设施的产品。从纯技术视角来看,这三条路线分别代表了"系统集成"、"芯片-模型垂直整合"和"开发者工具链"三个方向。


AMD Helios:机架级系统的算力池化思路

Helios是把72块MI455X GPU通过Infinity Fabric互联,形成一个统一的显存池(31TB HBM4)和算力池(2.9 EFLOPS FP4)。关键设计思路是算力池化——上层调度器按需分配计算单元,而不是传统的单卡绑定任务。

这种设计的好处是:

  • 推理任务的碎片化算力需求可以被高效聚合
  • 单Token成本理论上被压到最低
  • 客户可以按机架采购,避免复杂的集群自建

如果类比到分布式系统领域,Helios的思路类似于将GPU从"独立服务器"抽象为"Kubernetes里的Pod"——上层不关心物理拓扑,只关心算力调度。

对应的技术挑战也很明显:72卡互联的通信瓶颈、跨卡任务切分的负载均衡、电源/散热的工程一致性,这些在数据中心部署中都是需要实际验证的问题。


谷歌Frozen v2:Hardware-Software Co-design的极端形式

Frozen v2的技术路径可以用一个简单的类比理解:

通用GPU方案:模型结构 → 编译器 → 指令流 → GPU执行
Frozen v2方案:模型结构 → 硬件电路 → 直接执行

跳过指令译码和通用计算调度环节,在能效上获得6-10x的提升并不意外。这在计算机体系结构上属于最经典的ASIC优势——用灵活性换效率。

但从工程角度来看,两个问题值得关注:

1. 架构锁定风险:芯片前端设计周期(RTL验证、综合、布局布线)至少12-18个月。如果在此期间Gemini架构发生重大变化(比如注意力机制换成新范式),已冻结的RTL无法跟随。

2. 部署规模的可扩展性:Frozen v2若在2028年部署,那时的推理负载特征与今天可能完全不同。TCO模型中是否已将后续迭代成本纳入考量,是一个需要持续观察的问题。


英伟达Agent Toolkit:把Agent开发做成脚手架

Agent Toolkit的发布信息中最值得关注的是这句话:三步部署,30分钟可运行

从技术架构来看,Toolkit实际上是四个组件的整合:

Nemotron 3 Ultra (550B) ── 基础推理内核
         ↓
    NemoClaw ── Agent编排层(工具调用/记忆管理/任务规划)
         ↓
    OpenShell ── 安全运行时(沙箱隔离/权限控制/API暴露)
         ↑
    Omniverse ── 外部能力库(物理仿真/感知接口)

NemoClaw的定位类似于LangChain/AutoGen的竞品,但它是原生运行在本地硬件上的。OpenShell做安全运行时也是当前Agent工程里的关键痛点——如何防止Agent调用恶意工具、如何做权限分级。

这种"预集成+开箱即用"的模式,如果能做到文档和API质量到位,确实可以降低Agent开发的门槛。当前Agent生态最大的问题不是模型能力不够,而是开发调试体验太差。


三条技术路线的选择逻辑

从架构决策的角度看,三家公司对同一个问题——"如何让AI推理更高效/更便宜/更易用"——给出了截然不同的答案:

决策维度AMD谷歌英伟达
如何提高效率规模换效率(大机架)专用化换效率(ASIC)抽象换效率(工具链)
如何降低成本标准化硬件+规模量产极致能效比降低电费降低开发者时间成本
如何建立壁垒开放生态+性价比全栈绑定开发者锁定
风险点系统工程复杂度模型架构迭代风险竞品工具链替代

小结

三个产品在同一天发布,本质上是在宣告同一件事:AI基础设施的竞争从"谁的芯片跑分高"进入了"谁能交付完整方案"的阶段

对于开发者来说,这意味着未来选择算力方案时,需要评估的不只是单卡性能指标,还包括:系统部署复杂度、工具链成熟度、生态迁移成本和长期TCO。这本身就是AI工程化走向成熟的标志。