2026年7月20日,AMD、谷歌、英伟达同日发布了三款面向AI基础设施的产品。从纯技术视角来看,这三条路线分别代表了"系统集成"、"芯片-模型垂直整合"和"开发者工具链"三个方向。
AMD Helios:机架级系统的算力池化思路
Helios是把72块MI455X GPU通过Infinity Fabric互联,形成一个统一的显存池(31TB HBM4)和算力池(2.9 EFLOPS FP4)。关键设计思路是算力池化——上层调度器按需分配计算单元,而不是传统的单卡绑定任务。
这种设计的好处是:
- 推理任务的碎片化算力需求可以被高效聚合
- 单Token成本理论上被压到最低
- 客户可以按机架采购,避免复杂的集群自建
如果类比到分布式系统领域,Helios的思路类似于将GPU从"独立服务器"抽象为"Kubernetes里的Pod"——上层不关心物理拓扑,只关心算力调度。
对应的技术挑战也很明显:72卡互联的通信瓶颈、跨卡任务切分的负载均衡、电源/散热的工程一致性,这些在数据中心部署中都是需要实际验证的问题。
谷歌Frozen v2:Hardware-Software Co-design的极端形式
Frozen v2的技术路径可以用一个简单的类比理解:
通用GPU方案:模型结构 → 编译器 → 指令流 → GPU执行
Frozen v2方案:模型结构 → 硬件电路 → 直接执行
跳过指令译码和通用计算调度环节,在能效上获得6-10x的提升并不意外。这在计算机体系结构上属于最经典的ASIC优势——用灵活性换效率。
但从工程角度来看,两个问题值得关注:
1. 架构锁定风险:芯片前端设计周期(RTL验证、综合、布局布线)至少12-18个月。如果在此期间Gemini架构发生重大变化(比如注意力机制换成新范式),已冻结的RTL无法跟随。
2. 部署规模的可扩展性:Frozen v2若在2028年部署,那时的推理负载特征与今天可能完全不同。TCO模型中是否已将后续迭代成本纳入考量,是一个需要持续观察的问题。
英伟达Agent Toolkit:把Agent开发做成脚手架
Agent Toolkit的发布信息中最值得关注的是这句话:三步部署,30分钟可运行。
从技术架构来看,Toolkit实际上是四个组件的整合:
Nemotron 3 Ultra (550B) ── 基础推理内核
↓
NemoClaw ── Agent编排层(工具调用/记忆管理/任务规划)
↓
OpenShell ── 安全运行时(沙箱隔离/权限控制/API暴露)
↑
Omniverse ── 外部能力库(物理仿真/感知接口)
NemoClaw的定位类似于LangChain/AutoGen的竞品,但它是原生运行在本地硬件上的。OpenShell做安全运行时也是当前Agent工程里的关键痛点——如何防止Agent调用恶意工具、如何做权限分级。
这种"预集成+开箱即用"的模式,如果能做到文档和API质量到位,确实可以降低Agent开发的门槛。当前Agent生态最大的问题不是模型能力不够,而是开发调试体验太差。
三条技术路线的选择逻辑
从架构决策的角度看,三家公司对同一个问题——"如何让AI推理更高效/更便宜/更易用"——给出了截然不同的答案:
| 决策维度 | AMD | 谷歌 | 英伟达 |
|---|---|---|---|
| 如何提高效率 | 规模换效率(大机架) | 专用化换效率(ASIC) | 抽象换效率(工具链) |
| 如何降低成本 | 标准化硬件+规模量产 | 极致能效比降低电费 | 降低开发者时间成本 |
| 如何建立壁垒 | 开放生态+性价比 | 全栈绑定 | 开发者锁定 |
| 风险点 | 系统工程复杂度 | 模型架构迭代风险 | 竞品工具链替代 |
小结
三个产品在同一天发布,本质上是在宣告同一件事:AI基础设施的竞争从"谁的芯片跑分高"进入了"谁能交付完整方案"的阶段。
对于开发者来说,这意味着未来选择算力方案时,需要评估的不只是单卡性能指标,还包括:系统部署复杂度、工具链成熟度、生态迁移成本和长期TCO。这本身就是AI工程化走向成熟的标志。