英伟达 Groq 3 LPX 量产,SpaceX 要把算力搬上太空——智能体时代的「电力账单」要重写了

3 阅读2分钟

说实话,看到这条新闻我第一反应是:终于有人把「推理芯片」和「每度电能出多少 Token」摆到台面上了。以前大家卷训练,卷的是谁先训出大模型;现在智能体一拥而上,真正的战场变成了——同样一兆瓦电,你能往外吐多少 Token。

8 月 24 日 Hot Chips 2026 上,英伟达把 Vera Rubin 平台的实测算力摊开讲了。他们在 SemiAnalysis 的 AgentX 智能体负载、跑 DeepSeek V4 Pro 的测试里,Vera Rubin NVL72 每兆瓦吞吐量最高是上一代 GB300 NVL72 的 30 倍,每 Token 成本最高降 35 倍。这数字我一开始也觉得夸张,但想想也对:GB300 那代本来就不是为「长时间挂着一个 Agent 不停调工具」设计的,推理侧架构换血后,单位能耗的产出跳一截很正常。

更让我上头的是 Groq 3 LPX。这玩意儿主打低延迟 Token 生成,在 Gemma 4 31B、10 万 Token 上下文的测试里跑到 每秒 3400 个输出 Token。什么概念?你跟一个本地挂着的 Agent 说话,它回得比你打字还快。智能体要的是「随叫随到」,不是「憋三秒给你一段长文」,Groq 这条线明显是冲着这个痛点去的。

但真正让我后脖颈发凉的是 SpaceXAI 那段。他们要把优化版的 Vera Rubin NVL72 塞进首代 Starmind AI 卫星,把英伟达的算力从地面机房直接延伸到轨道。计划 2026 年底部署超 2 吉瓦算力,2027 年第四季度把 Vera Rubin 超级计算机送进轨道。在太空里,电和散热都金贵得要命,而 Vera Rubin 在单位 Token 能耗上的优势,刚好踩中了这个最苛刻的场景。

我觉得这事的意义,不在「太空里也能跑 AI」这种噱头。而在于它把 AI 基建的经济学彻底摊牌了:以后比的不是谁的模型参数多,是「我一度电、一平米机房、一公斤发射重量,能换回多少有效智能体调用」。地面卷不动电价和土地的地方,轨道算力反而可能成了新解。

当然,我得泼盆冷水:把数据中心发射上天,成本曲线现在的确还停在 PPT 阶段。2 吉瓦是什么概念?得发多少趟火箭才铺得起来,马斯克自己都没把账算给我看。但方向摆这儿了——推理侧的经济性,会是接下来两年最硬的一仗。

抛个问题:如果「每兆瓦 Token 产出」成了芯片厂商的核心 KPI,那国产算力路线该跟着卷峰值,还是先卷能效?欢迎评论区开喷。