Agent Infra:巨头的隐秘战场,和每个工程师的入场券

5 阅读11分钟

Agent Infra:巨头的隐秘战场,和每个工程师的入场券

刷到一期 63 分钟的播客,信息密度很高,几个判断值得顺着往下挖。这篇是我的学习笔记:梳理他的观点,沿着每个判断再做一层延伸研究,最后写下落到我自己身上的部分。

一、他的核心判断

前阵子刷到《卫诗婕|漫谈》第 81 期:嘉宾是百度智能云 AI 计算首席科学家王雁鹏,聊"Agent Infra:巨头都在布局的隐秘战场"。63 分钟听完,我的总结是一句话总纲:行业竞争焦点正从模型本身,下移到支撑智能体跑真实任务的基础设施(Agent Infra),这是巨头垂直整合、争夺"新 OS"的隐秘战场。

围绕这个总纲,他给了四个我认为最有分量的判断。先逐个复述,再附上我顺着每条查到的一层行业事实:

1. 演示易,生产难。 智能体做 demo 容易,稳定进生产的很少,最大制约是模型能力边界。生产化的硬条件:可控可信、结果可重复、覆盖边界条件、有兜底。王雁鹏给了个公式式表达——模型的智力 = 算力 = 电力。

2. Harness 三件套:主循环、工具调用、记忆。 他评价了 OpenClaw(把 agent 泛化到通用全场景)和 Hermes(技能自动沉淀,"越用越聪明")。最关键的判断是:记忆正从 RAG 走向文件系统——RAG 是按相似度召回的检索,文件系统更像通用笔记本,能沉淀更丰富、可编辑、可审计的信息。这一点在实践中体会尤其明显:给 Agent 配两层记忆——一个约 10KB 上限的精华文件(每次会话全量注入上下文)加一个不限大小的每日流水目录(不进上下文、按需检索)——就是这套范式的完整形态。还有个反直觉的细节:别用 HTML 存记忆——同样的内容 HTML 标签要多烧 2~3 倍 token,而 agent 感知文件的方式是 token 流,不是渲染画面。信息/token 密度才是格式选型的第一性原理,这就是 markdown 胜出的原因。

3. 模型即 OS。 大模型会成为操作系统式的"大脑",模型 + 智能体 + Infra 共同构成新的 OS 层。他还给了一个很妙的观察指标:CPU 消耗上升,是智能体真正在生产中规模化的信号。道理很直白:Agent 的 CPU 不烧在"思考"上(推理在云端),而是烧在"干活"上——渲染、浏览器、构建、工具执行。推广到组织层面:想看 AI 研发是不是真落地,与其盯 token 账单,不如看构建机、沙箱、CI 的真实负载。

4. 巨头殊途同归做垂直整合。 先定义一下:垂直整合 = 一家公司把产业链上下多层攥在自己手里,而不是每层靠市场交易拼接。用后文的五层蛋糕看,各家的整合路径是:

公司整合路径覆盖层
Google自研 TPU + 云 + Gemini + 搜索/办公应用,连电力采购都自己签芯片→应用全栈
英伟达从 GPU 扩到互联/机架系统/CUDA 软件,如今再伸手 Agent 运行时芯片→基础设施→运行时
OpenAI模型+应用起家,下探定制芯片(博通)与算力基建(星际之门/甲骨文长约)模型→应用,下探芯片与基建
百度"芯模一体、四层协同":昆仑芯→百舸云→文心→应用四层
Anthropic相对轻资产:模型+Claude Code 入口,算力靠多云协议与多芯片能力对冲模型→应用

为什么是现在?我的理解是两条:一是摩尔定律放缓后,性能提升靠跨层协同设计(芯片按模型定、编译器按芯片写),这种优化跨公司边界做不了;二是算力成了生产资料,只占一层就有被上下游掐脖子的风险。当然风险也明显:芯片从定义到流片要两年半以上,模型创新以月计——按今天的模型定义的芯片,两年半后可能不匹配。

这些判断不是纸上谈兵。王雁鹏团队搭了基于自研芯片的单体 3 万卡集群,他给过一组工程数字:大模型训练普遍浪费超 50% 算力,靠 RDMA 把带宽有效率从 60% 提到 95%,资源利用率从 50% 拉到 90%;万卡集群平均每 4 小时中断一次,十万卡可能 20 分钟就会中断。

二、延伸研究:把基础设施的拼图一块块拼上

顺着播客里提到的公司和交易,我又做了一圈延伸阅读,最大的收获是把它们串成了一条因果链:

摩尔定律是背景板。 过去 60 年算力是"白捡"的——同样的钱每隔 18 个月买到翻倍性能,软件不用拼命优化,等下一代硬件就行。放缓之后,每一分性能都要拿工程(专用芯片)、资本(千亿级数据中心)、电力去换。算力不再白捡,才从普通商品变成稀缺的生产资料——这是后面所有巨头动作的根本原因。

英伟达和博通是两种打法。 英伟达卖"成品平台"(GPU + NVLink + CUDA,护城河是软件生态);博通是"军火商",帮大客户设计定制 ASIC(Google TPU、OpenAI 定制芯片)+ 卖网络零件。云巨头找博通是为了"去英伟达化"。

英伟达 200 亿美元收 Groq,就是把威胁买下来。 2025 年底,英伟达用"资产 + 技术授权 + 核心团队加盟"的结构拿下 Groq(约为其上一轮估值的 2.9 倍,刻意避开正式并购以降低反垄断审查风险)。Groq 的 LPU 是确定性执行 + 片上 SRAM 的低延迟推理架构,恰好补英伟达 HBM 大 batch 架构在推理侧的短板。播客里王雁鹏说"英伟达的缝隙在推理系统",几个月后英伟达就亲手把这个缝隙焊上了。

谷歌 TPU 是垂直整合最早的样板,但红利只有整合者自己吃得着。 TPU 是静态数据流 ASIC,必须配 XLA 编译器和 JAX 才能发挥威力,动态形状难受、调试体验差、生态锁死在自家框架里——"难"只对谷歌以外的人成立。这解释了一个规律:全栈自研的效率红利,外人拿不到。

星际之门在"改弦易辙"。 OpenAI 的 5000 亿美元合资自建计划,2026 年明显转向"租而不建":旗舰站点扩建放弃,转而与甲骨文签五年 3000 亿美元 / 4.5GW 长约,同时向 AMD、博通、英伟达多方下注。平台型公司不想自己背重资产,把"入口"攥在手里,重活外包。

Fireworks AI 是纯推理侧最大的独立受益者。 不训基座,专门帮企业低成本跑开源模型,按 token 收费。年化收入约 3.15 亿美元(同比 +416%),日处理约 30 万亿 token,客户包括 Cursor 这类 AI 编程产品——典型的 token 吞金兽。它爆发,正是因为 Agent 时代的 token 消耗结构在爆炸。这个现象有个名字——杰文斯悖论:单位 token 价格越降,总消耗反而越涨,因为降价不断解锁新的"值得调用"的场景。效率提升不会缩小账单,只会扩大需求。

Pinecone 踩在记忆范式转向的浪头上。 向量数据库龙头、RAG 时代标配,但正被"大宗商品化"(存量数据库纷纷内置向量能力),而记忆范式又在从 RAG 转向文件系统——腹背受敌。

GTC 2026 把逻辑闭环了。 Vera Rubin 平台是"为代理式 AI 设计的垂直集成系统";Feynman 路线图里出现 LP40 LPU——与前述 Groq 交易形成微妙呼应;英伟达还推出 OpenShell 沙箱运行时和配套的 NemoClaw 开源栈(Apache 2.0,用来安全地跑 OpenClaw/Hermes 这类第三方 agent),正式向 Agent 运行时这一层伸手。有意思的是,NemoClaw 的三件套——沙盒隔离、网络策略、审计与生命周期管理——几乎就是下文那张一页生产化准入 checklist(五项门禁:边界清晰、可重放、可回滚、有审批、可审计)的产品化实现:英伟达把"门禁"做成了开箱即用的软件栈。整条因果链:算力不再白捡 → 变成生产资料 → 巨头垂直整合抢入口 → 推理和 Agent 运行时成为新战场 → token 成本成为生死线。

把整盘棋拉远看,"新 OS"之争其实发生在三层:模型层(OpenAI/Anthropic 赌智能本身就是入口)、运行时层(英伟达用 OpenShell/NemoClaw 赌 agent 的执行环境)、协议层(MCP、A2A 这些互联标准,赌的是 agent 世界的"USB 接口")。王雁鹏说"模型即 OS",老黄伸手运行时,巨头下注协议——三层都在争同一件事:下一代计算的定义权。这也解释了为什么每个玩家都要垂直整合:只占一层,随时可能被上下两层挤成管道。

再换一个透镜:五层蛋糕。 黄仁勋把 AI 定义为五层基础设施,从底到顶:能源、芯片、基础设施、模型、应用。把本文所有玩家放上去,整盘棋一目了然:

层解决什么本文出场玩家
能源实时智能依赖实时电力("AI 基建的第一性原理")星际之门的选址约束、3 万卡集群"要一个园区的变电站"
芯片把能源转成规模化计算英伟达、博通、Groq 的 LPU、谷歌 TPU、昆仑芯
基础设施供电/冷却/网络/编排 = AI 工厂百度百舸、英伟达 DSX、OpenShell/NemoClaw、云沙箱
模型理解语言、生物、金融等一切信息OpenAI、Anthropic、Qwen——AOL 之争就发生在这一层
应用经济价值被创造的地方Cursor、Fireworks 的客户、以及第三章那张生产化准入 checklist

这张蛋糕图解释了全文所有现象:那条因果链,就是稀缺性从底层向上传导的过程;垂直整合,是尽可能多跨几层;三层 OS 之争,是中间几层的定义权之战。而官方表述里最重要的一句话是——"每个成功的应用,都会拉动它下面的每一层"。价值在应用层产生,拉力逐层向下传导,这正是 DAA 和任务价值成为北极星指标的原因:它们度量的恰恰是最顶上那一层。我们工程团队,就站在这一层上。

三、落回工程团队:从观察到行动

聊完行业,回到我们自己:这跟普通工程团队有什么关系? 我的答案是三件事。

1. 衡量 AI 渗透率,看三层信号而不是账单。 渗透度(多少人每天有活跃 agent 会话)、深度(多少比例的需求真实流经 agent 链路)、产出(需求周期、CR 一次通过率、回归缺陷率)。前两层证明"在用",第三层证明"有用"。数据源现成:主流 agent 工具都自带会话日志和遥测,本地聚合后只上报聚合值不上报内容,是隐私红线也是能推下去的前提。治本解是架构性的——把重度构建、测试、agent 执行从个人电脑搬到云沙箱,负载自然可观测,这正是 Agent Infra 的逻辑本身。

这个思路有个更精确的表达——DAA(Daily Active Agents,日活跃智能体),王雁鹏主张用它替代 Token 做牵引指标。他把度量分成两层:底层用"token 效率"向下牵引成本,上层用 DAA 向上衡量"真实完成的任务以及任务产生的价值"——因为 token 很容易被玩坏:"我拿 token 干一些没用的事,那这个 token 消耗没有价值。"

行业数据佐证了这个迁移正在发生。计费层,OpenAI/Anthropic 的 API 仍按 token 收费(且 tokenizer 可被供应商单方面调整,同样文本多出约 30% token);评估层已全面转向任务完成率——Anthropic 官方 agent 评估用 pass@k 与 pass^k 这对指标:前者是"k 次尝试里至少成功一次"的概率,量的是能力上限;后者是"k 次全部成功"的概率,量的是可靠性下限,两者的差距恰恰是"演示易、生产难"的量化表达;第三方榜单则直接发布"每任务成本";商业层,结果计费正在起势(Intercom Fin 每成功解决一个工单收 $0.99),但纯结果计费渗透率仅约 17%,混合模式是主流。结论:DAA 不是预言,而是进行中的迁移,只是从"计量"传导到"收费"还有时滞。

2. 业务系统的 Agent 生产化是有阶梯的。 按"可控可信、可重放、覆盖边界、有兜底"四个条件,存在一条清晰阶梯:观察 → 诊断 → 建议 → 审批执行 → 自主执行。第一梯队永远是读多写少的场景(巡检诊断、测试回归);直接动钱动单的交易执行类操作排最后。我亲历过一个绝佳注脚:某个改价类场景里,我们发现交易消息里只有买卖双方主账号、没有操作人字段——连"谁操作的"都无法归因,agent 就没有资格碰执行权。这就是典型的"边界条件不满足"。另外注意辨析:很多"生产环境里的 AI"只是模型服务(一问一答),还不是 agent loop(自主规划 + 工具调用 + 多轮执行),中间差的就是那四个生产化条件。

3. 用一页 checklist 管住生产准入。 把上面第 2 点的四个生产化条件落成可执行门禁,就是我们团队在用的那张一页 checklist:五项门禁,每项一个判定问题 + 一票否决红线:

门禁判定问题红线
边界清晰能否一句话说清 agent 能碰什么、不能碰什么?可无拦截触达生产写接口
可重放出错时能否凭留痕复现当时行为?结论无法复现也无法解释
可回滚错误操作后恢复路径是什么?不可逆写操作且无备份
有审批哪些动作必须等人?高风险写操作无审批环节
可审计谁、什么版本、何时、做了什么?生产变更无法归因到发起者

配套规则:场景按 L1(观察)到 L5(自主执行)定级,升级必须过 checklist,跳级禁止;生产问题复盘先对照 checklist 找失守项,失守未修复则场景降级。

结语

王雁鹏说,现在是"Infra 的探险乐园时代"——Transformer 统一架构后,竞争焦点变成工程能力,岗位从"算法工程师"转向"AI 系统工程师"。

我想补一句:这波浪潮里,普通工程师不是观众。 五层蛋糕上,巨头在争下面四层,而我们站在最顶上那层——价值被创造、并向下拉动一切的那层。地基是他们打的,但房间是我们盖的。听播客、拆公司、验证判断、写 checklist——这条路径本身说明,Agent Infra 不是巨头的专利,每个愿意动手验证的人,都能在自己的系统里找到那个最先跑通的"生产化切口"。


参考来源