今天 GitHub 上最快的一个项目是 `google/ax`,单日涨 1,379 星,总量到 11,682。描述只有一句话:"Google's open agentic orchestration runtime." 95% 是 Go,Apache 2.0,而且挂在官方 `google` 组织下,没有"非官方支持"的免责声明。
值得开发者细看的不是热度,是它切的层。
它解决的问题不是"怎么编排",是"编排挂了怎么办"
现在做 Agent 的人手里基本都有一两个编排框架:LangGraph、ADK、CrewAI,或者自己写状态机。这些框架解决的是任务怎么拆、节点怎么连、工具怎么调。
但它们有个共同的软肋:进程是单点。
一个跑了三个半小时的长任务,编排进程被 OOM kill 掉,或者部署重启,中间的会话状态、工具调用历史、中间产物全部丢掉。你只能从头再跑一遍,然后花掉同样的 token 和时间。
AX 把自己定位在这一层之下。它的核心不是编排逻辑,而是把 agent 会话做成可以在 Kubernetes 上活下来的分布式运行时,跑在自己的数据平面上。官方 release note 里的措辞是:"a minimal, robust and opinionated distributed runtime for harnesses and agents easily deployable on Kubernetes."
从 CLI 设计能看出它的抽象是围绕"任务生命周期"来的:
```bash
交互式 shell 进沙箱,前提是任务 spec.debug: true
ax ssh task123
ax ssh task123 -- ls -la /workspace
ax ssh task123 -- python3 main.py
workspace 和 model 走同一套模式
ax get workspaces
NAME ATESPACE GIT-REPOS MCP-SERVERS
default-workspace default 1 1
ax describe workspace default-workspace
ax delete workspace default-workspace
```
注意 `ax get workspaces` 那三列:ATESPACE、GIT-REPOS、MCP-SERVERS。这说明一个 workspace 的声明式定义里,已经包含了代码来源(git repo)和工具接入(MCP server)两项。也就是说拉代码和挂工具不是脚本里手写的步骤,而是工作区规格的一部分。
如果你是做 Agent 基础设施的,建议先翻 `pkg/apis/v1alpha1` 里的 spec 定义,它决定了你现有 harness 能不能接进去。从 release changelog 看,"Restructure AX into a general-purpose orchestration layer for agentic…" 和 "feat: add support for inlined files in workspace specifications" 这两条提交,能看出他们还在快速调整抽象边界,现在接入要有心理准备。
顺手说个对比:华为的互联思路
同一天还有条技术新闻值得放在一起看。华为轮值董事长徐直军在媒体交流里讲了 Peerium 计算架构和灵衢 UnifiedBus。海思首席科学家廖恒给了一组对比数字:
• 机架内走 NVLink:1.8 TB/s
• 跨机架走 InfiniBand:降到 0.2 TB/s,协议转换延迟以微秒计
• 用 UnifiedBus 从纵向扩展网络切到横向扩展网络:约 150 纳秒,协议转换开销至少省一个数量级
UnifiedBus 的设计要点是用一种协议贯穿机架内、机架间、数据中心间,连接 CPU、NPU、内存、SSD、网卡和交换机,实现计算、存储、网络的对等互联,替代传统主从架构。目前已有一个 25.6 万张计算卡的 Atlas 950 SuperCluster 在部署测试。
为什么放一起说?因为这两件事是同一个思路的两个层次:AX 用统一的运行时抽象替掉 ad-hoc 的进程管理;UnifiedBus 用统一的协议替掉多协议转换。都是在消除中间层的隐式开销。 这也是今年基础设施方向最明显的趋势——不再堆参数,改在连接和调度上做减法。
另外两个今天值得看的项目
rohitg00/ai-engineering-from-scratch ⭐57,778(当日 +1,177)
免费开源 AI 工程课程,MIT 许可,Python 为主。覆盖 transformers、深度学习、强化学习、agents、MCP、计算机视觉、NLP,以从零手写为主而不是调包。适合团队 fork 成内部培训材料——MIT 许可对商业使用友好。
但用之前先看 issue 区:目前挂着"大部分 lesson 只有 Python 实现,虽然号称支持四种语言""Lesson 代码是 CUDA-only,没有 Apple Silicon(MPS)路径"这类问题。课程结构完整,工程细节还在补。
earthtojake/text-to-cad ⭐17.8k
一组给 coding agent 用的 CAD 技能库:
```bash
npx skills add earthtojake/text-to-cad
```
装上之后,你告诉 Claude Code 或 Codex 想要的零件、装配体、夹具,agent 去改仓库里的 CAD 源文件,然后导出 STEP、STL、3MF、DXF、GLB 或 URDF 机器人描述。底层是 Python build123d 这套参数化 BRep 建模,输出的是真几何体,不是网格或者图片。
它最值得借鉴的是"源文件优先"的工作流:改源码 → 重新生成明确目标 → 导出 review 渲染图 → 用 `@cad[...]` 引用做几何感知的精确编辑 → 源文件和产物一起提交。这个模式和前端构建产物、IaC 的逻辑是同一套路,做 Agent 工具链的同学可以直接抄。
小结
今天这三条新闻加三个项目,主题其实很集中:AI 基础设施的钱和注意力,正在从"模型本身"转向"模型周围那圈东西"。 SpaceX 要借 400 亿美元买英伟达芯片(据金融时报,阿波罗牵头,100 亿银行贷款 + 300 亿投资级债券),OpenAI 一夜甩出 722 篇数学论文,国内月之暗面估值冲到 500 亿美元——这些是需求侧;AX、UnifiedBus、text-to-cad 是供给侧在做的回应。
想问问同行:你们团队在做 Agent 项目的时候,会话状态是怎么落地的?自己写持久化、用 Temporal 这类工作流引擎,还是试过 AX 这种专门的运行时?踩过的坑欢迎评论区展开,尤其是长任务恢复这块。
(另:如果你们有 GPU 集群,可以关注一下 UnifiedBus 的协议开放情况,它是从灵衢 2.0 开始开放的,值得研究一下对等互联在多卡训练场景下的实际 MFU 表现。)