google/ax 单日涨1379星,Agent 运行时到底难在哪?

3 阅读1分钟

今天 GitHub 上最快的一个项目是 `google/ax`,单日涨 1,379 星,总量到 11,682。描述只有一句话:"Google's open agentic orchestration runtime." 95% 是 Go,Apache 2.0,而且挂在官方 `google` 组织下,没有"非官方支持"的免责声明。

值得开发者细看的不是热度,是它切的层。

它解决的问题不是"怎么编排",是"编排挂了怎么办"

现在做 Agent 的人手里基本都有一两个编排框架:LangGraph、ADK、CrewAI,或者自己写状态机。这些框架解决的是任务怎么拆、节点怎么连、工具怎么调。

但它们有个共同的软肋:进程是单点。

一个跑了三个半小时的长任务,编排进程被 OOM kill 掉,或者部署重启,中间的会话状态、工具调用历史、中间产物全部丢掉。你只能从头再跑一遍,然后花掉同样的 token 和时间。

AX 把自己定位在这一层之下。它的核心不是编排逻辑,而是把 agent 会话做成可以在 Kubernetes 上活下来的分布式运行时,跑在自己的数据平面上。官方 release note 里的措辞是:"a minimal, robust and opinionated distributed runtime for harnesses and agents easily deployable on Kubernetes."

从 CLI 设计能看出它的抽象是围绕"任务生命周期"来的:

```bash

交互式 shell 进沙箱,前提是任务 spec.debug: true

ax ssh task123

ax ssh task123 -- ls -la /workspace

ax ssh task123 -- python3 main.py

workspace 和 model 走同一套模式

ax get workspaces

NAME ATESPACE GIT-REPOS MCP-SERVERS

default-workspace default 1 1

ax describe workspace default-workspace

ax delete workspace default-workspace

```

注意 `ax get workspaces` 那三列:ATESPACE、GIT-REPOS、MCP-SERVERS。这说明一个 workspace 的声明式定义里,已经包含了代码来源(git repo)和工具接入(MCP server)两项。也就是说拉代码和挂工具不是脚本里手写的步骤,而是工作区规格的一部分。

如果你是做 Agent 基础设施的,建议先翻 `pkg/apis/v1alpha1` 里的 spec 定义,它决定了你现有 harness 能不能接进去。从 release changelog 看,"Restructure AX into a general-purpose orchestration layer for agentic…" 和 "feat: add support for inlined files in workspace specifications" 这两条提交,能看出他们还在快速调整抽象边界,现在接入要有心理准备。

顺手说个对比:华为的互联思路

同一天还有条技术新闻值得放在一起看。华为轮值董事长徐直军在媒体交流里讲了 Peerium 计算架构和灵衢 UnifiedBus。海思首席科学家廖恒给了一组对比数字:

• 机架内走 NVLink:1.8 TB/s

• 跨机架走 InfiniBand:降到 0.2 TB/s,协议转换延迟以微秒计

• 用 UnifiedBus 从纵向扩展网络切到横向扩展网络:约 150 纳秒,协议转换开销至少省一个数量级

UnifiedBus 的设计要点是用一种协议贯穿机架内、机架间、数据中心间,连接 CPU、NPU、内存、SSD、网卡和交换机,实现计算、存储、网络的对等互联,替代传统主从架构。目前已有一个 25.6 万张计算卡的 Atlas 950 SuperCluster 在部署测试。

为什么放一起说?因为这两件事是同一个思路的两个层次:AX 用统一的运行时抽象替掉 ad-hoc 的进程管理;UnifiedBus 用统一的协议替掉多协议转换。都是在消除中间层的隐式开销。 这也是今年基础设施方向最明显的趋势——不再堆参数,改在连接和调度上做减法。

另外两个今天值得看的项目

rohitg00/ai-engineering-from-scratch ⭐57,778(当日 +1,177)

免费开源 AI 工程课程,MIT 许可,Python 为主。覆盖 transformers、深度学习、强化学习、agents、MCP、计算机视觉、NLP,以从零手写为主而不是调包。适合团队 fork 成内部培训材料——MIT 许可对商业使用友好。

但用之前先看 issue 区:目前挂着"大部分 lesson 只有 Python 实现,虽然号称支持四种语言""Lesson 代码是 CUDA-only,没有 Apple Silicon(MPS)路径"这类问题。课程结构完整,工程细节还在补。

earthtojake/text-to-cad ⭐17.8k

一组给 coding agent 用的 CAD 技能库:

```bash

npx skills add earthtojake/text-to-cad

```

装上之后,你告诉 Claude Code 或 Codex 想要的零件、装配体、夹具,agent 去改仓库里的 CAD 源文件,然后导出 STEP、STL、3MF、DXF、GLB 或 URDF 机器人描述。底层是 Python build123d 这套参数化 BRep 建模,输出的是真几何体,不是网格或者图片。

它最值得借鉴的是"源文件优先"的工作流:改源码 → 重新生成明确目标 → 导出 review 渲染图 → 用 `@cad[...]` 引用做几何感知的精确编辑 → 源文件和产物一起提交。这个模式和前端构建产物、IaC 的逻辑是同一套路,做 Agent 工具链的同学可以直接抄。

小结

今天这三条新闻加三个项目,主题其实很集中:AI 基础设施的钱和注意力,正在从"模型本身"转向"模型周围那圈东西"。 SpaceX 要借 400 亿美元买英伟达芯片(据金融时报,阿波罗牵头,100 亿银行贷款 + 300 亿投资级债券),OpenAI 一夜甩出 722 篇数学论文,国内月之暗面估值冲到 500 亿美元——这些是需求侧;AX、UnifiedBus、text-to-cad 是供给侧在做的回应。

想问问同行:你们团队在做 Agent 项目的时候,会话状态是怎么落地的?自己写持久化、用 Temporal 这类工作流引擎,还是试过 AX 这种专门的运行时?踩过的坑欢迎评论区展开,尤其是长任务恢复这块。

(另:如果你们有 GPU 集群,可以关注一下 UnifiedBus 的协议开放情况,它是从灵衢 2.0 开始开放的,值得研究一下对等互联在多卡训练场景下的实际 MFU 表现。)