2026 年,"造一个 Agent"已经不是壁垒,"大规模、可靠、省钱地把 Agent 跑起来"才是。 本文把国内外 60+ 框架 / 工具 / 产品,按自底向上的 5 层架构分类梳理:每层解决什么、成熟度如何、有哪些真实生产故事(关键数字均附引用),并单独开一章讲国产阵营,最后给出选型建议与趋势判断。
一、市场现状:为什么"编排"成了刚需?
AI Agent 已经从"聊天机器人 + 工具"的实验,升级为企业级工作流自动化的一个平台品类——但规模化落地依然极不均衡。先看一组数字。
📊 需求侧:普遍在布局
- 🔥 Gartner:到 2026 年底,40% 的企业应用将内置任务型 AI Agent(2025 年这个比例还不到 5%)。(来源)
- 📈 McKinsey《State of AI 2025》:62% 的组织已在试验 AI Agent,23% 已在企业至少一个环节规模化落地 agentic AI。(来源)
- 🧪 Deloitte 2025:对"真正投产"更保守——仅 11% 在生产环境实际使用 agentic 系统、14% 已具备部署条件(另有 38% 在试点、30% 在探索)。(来源)
⚠️ 落地侧:鸿沟同样真实
机会是真的,失败模式也是真的:
- 💸 Gartner:预计到 2027 年底,超过 40% 的 agentic AI 项目会被取消——主因是成本高、价值不清、管控不足(即所谓"agent washing":把传统自动化/聊天机器人包装成 Agent)。(来源)
- 🛡️ 2025 AI Agent Index(MIT):在 13 个具备"前沿自主性"的 Agent 中,只有 4 个披露了 Agent 专属的安全评估——透明度与治理存在明显缺口。(来源)
一张图看清"需求增长较快、但多数仍处于早期阶段"的现状:
📖 怎么读这张图:漏斗颜色从灰(探索/试点)→ 橙(就绪)→ 绿(投产),越往下越少——约 2/3 的组织仍处在探索和试点阶段,真正投产的约为一成。上方是需求侧,下方是落地门槛。
🧩 一句话:需求增长较快,但"从 Demo 到规模化生产"仍有明显差距。而这道差距本质是工程问题——可靠性、成本、隔离、可观测、治理。这,正是"编排"这一层要解决的。
🧗 那为什么这么难?
传统后端一个请求几百毫秒就返回,而一个 Agent 任务可能要跑几分钟到几小时,中间穿插几十次 LLM 调用、工具调用、人工审批。这带来了一堆传统 Web 架构从没遇到过的难题:
- ⏱️ 长时运行:任务动辄几十分钟,普通 HTTP 请求 / Serverless 超时模型直接扛不住。
- 💥 非确定性 + 会崩溃:LLM 输出不可控、网络会抖、进程会挂——必须能崩溃重放、断点续跑,而不是从头再来。
- 😴 高空闲烧钱:Agent 大部分时间在等 LLM 返回或等人审批,进程却一直占着内存/GPU,成本压力不小。
- 🧨 要跑不可信代码:Agent 会现场生成并执行任意代码,绝不能让它直接在生产机上跑,必须沙箱隔离。
- 🕸️ 多智能体协作:真实系统往往是多个 Agent 分工协作,需要图 / 状态机来编排。
- 📈 要扩到海量并发:成千上万个会话同时在线,需要调度、扩缩容与托管。
这些难题里,最底层、最反直觉的是"又空闲又要省钱"——这正是 GitHub 上 agent-substrate/substrate 这类项目想解决的:把成千上万个空闲的有状态 Agent多路复用到少数几个 Pod 上(30 倍以上超售)。它是最底层 L1 基座层的一个代表。下面我们自底向上,一层层拆解整个技术栈。
二、一张图看懂:Agent 编排的 5 层分层架构
📖 怎么读这张图:编号越小越靠下、越贴近基础设施;编号越大越靠上、越贴近业务和"卖结果"。实线箭头 = 主依赖,虚线 = 可选直连。
真正的生产系统往往是跨层组合,例如一条典型链路: CrewAI(L3 写多智能体逻辑)→ Temporal(L2 持久化 + 崩溃重放)→ e2b-dev(L1 安全跑代码)→ AWS AgentCore(L4 托管扩缩容)。下面从最底层的 L1 开始,逐层拆解。
三、L1 计算 & 沙箱基座(最底层运行时)
这是整个栈的地基,解决两件底层的事:(a) 调度 / 海量并行——把成千上万个 Agent 任务分发到集群、批处理 LLM 调用;(b) 隔离执行——安全地跑 Agent 生成的不可信代码,并在"挂起 / 恢复"之间保留状态。其中 agent-substrate/substrate(把空闲 Agent 多路复用到少数 Pod)正属于这一层。
3.1 计算 / 调度引擎
- 🌟 Ray / Ray Serve(Anyscale)——43k⭐,2025 年 10 月加入 PyTorch 基金会。OpenAI 用它训练 ChatGPT,Cohere、Klaviyo、EleutherAI 都在用。Agent 场景下负责大规模并行执行与 LLM 调用批处理。(Klaviyo 案例)
- 🧱 Dapr Agents——CNCF 毕业项目 Dapr 的 AI 扩展,2025.3 首发、GA v1.0 于 2026.3 KubeCon EU。ZEISS、欧洲物流商已在生产使用。(首发|GA 公告)
- ☸️ KubeRay / Argo Workflows / Volcano——K8s 原生的批量 / DAG 调度,适合已有 K8s 投入的团队。
- 🧬 agent-substrate/substrate——把成千上万个空闲有状态 Agent多路复用到少数 Pod(gVisor 隔离、挂起/恢复、全状态快照、30 倍+ 超售)。理念超前,但非常早期、暂不建议用于生产。
3.2 沙箱 / 隔离执行环境(跑不可信代码)
Agent 会生成并执行任意代码,你不可能让它直接在生产机器上跑。这一层因此成了刚需基建。
⚠️ 一个容易混淆的点:这一层指的是开源、可自托管的沙箱运行时(如
e2b-dev/E2B)。而 E2B 官网主打的 Enterprise AI Agent Cloud 是在这套开源核心之上的托管平台,层级更靠上——别把"E2B 品牌"整个当成沙箱基座。下表按开源基座视角来看。
| 产品 | 🎯 特点 | 🚦 成熟度 | 🏭 生产故事 |
|---|---|---|---|
| e2b-dev(开源沙箱) 📦 | 开源、可自托管的 Firecracker 微 VM 沙箱,~150ms 启动 | 生产级(开源 13k⭐) | 其托管的 E2B 企业 Agent 云已启动 10 亿+ 沙箱、覆盖 88~94% 世界 100 强;Perplexity、HuggingFace、Manus(来源) |
| OpenSandbox(阿里开源) 🧪 | 开源沙箱平台,四层架构(SDK / Specs / Runtime / Sandbox);容器注入 Go 守护进程 execd,支持 Docker + K8s、Kata/gVisor 隔离;覆盖 Coding / GUI / Code Exec / RL 四类场景 | 早期(2026.3 开源,Apache 2.0) | 与阿里内部大规模 AI 负载同源基建;集成 Claude Code、Gemini CLI、Codex、LangGraph、ADK、Playwright(来源) |
| Kubernetes Agent Sandbox(SIG Apps)☸️ | K8s 官方 Sandbox CRD + 控制器:稳定身份 + 持久存储 + 暂停/恢复生命周期,可插拔 gVisor/Kata 隔离;含 WarmPool 预热池、Template/Claim 扩展、Go/Python SDK | 早期(v1beta1·v0.x,Apache 2.0) | 由 SIG Apps 主导、Google 发起(2025.11 官宣、2026.3 上 K8s 官博),目标是在 K8s 上跑有状态 Agent 的厂商中立标准(K8s 官博) |
| Modal 🚄 | Serverless GPU,秒级冷启动 | 生产级(1.1B 估值) | Runway、Suno、Harvey AI(来源) |
| Cloudflare Agents / Durable Objects 🌐 | 边缘原生、空闲休眠、可扩到千万级并发 | 生产级 | Cloudflare 自家 AI 产品同栈 |
| Fly.io Sprites 🧚 | 为编码 Agent 准备的持久 Firecracker VM | 早期预览(Jan'26) | — |
| Daytona ⚠️ | 曾对标 E2B | 开源仓库 2026.6 归档转私有 | 谨慎评估 |
🔎 落地较扎实的一格:E2B 企业云(构建在开源沙箱
e2b-dev之上)靠"安全跑 AI 代码"这一个切入点,覆盖了约九成世界 100 强企业。各云厂商的 Agent 运行时也大多内置了 Firecracker/微 VM 隔离——沙箱已是行业标配。(数据来源:VentureBeat)
四、L2 持久化执行引擎(可靠性底座)
这一层解决的核心是 Durable Execution(持久化执行):把每次 LLM 调用、工具调用都包成一个可重放、可重试、崩溃后能"从上次断点续跑"的步骤。
| 工具 | 🎯 解决什么 | 🚦 成熟度 | 🏭 生产故事 |
|---|---|---|---|
| Temporal 🐘 | 持久工作流、崩溃重放、重试、HITL | 生产级·久经考验(22k⭐) | Replit:每月 10 亿+ Agent 动作(来源);Stripe、Snap、Coinbase、Netflix(案例) |
| Trigger.dev ⚡ | 长任务无超时、waitpoint 人审 | Beta→生产(15.7k⭐) | TS/AI SaaS 团队,$16M A 轮 |
| Inngest 📬 | 事件驱动的持久步骤函数 | 生产级(5.6k⭐) | Resend、1Password,YC/a16z |
| Hatchet 🪓 | Postgres 持久化 + 强可观测性 | Beta→生产(7.5k⭐) | YC W24,号称"每月数十亿任务" |
| Windmill 🌀 | 脚本+流程+UI 一体开发平台 | 生产级(17k⭐) | 4000+ 组织、300+ 企业 |
| Restate / DBOS 🗄️ | 轻量持久执行(DBOS 只需 Postgres) | 生产 / 早期 | DBOS 由图灵奖得主 Stonebraker 创立 |
💡 划重点:Temporal 是这层最成熟、采用最广的选择,Replit 把整个 AI Agent 控制平面迁到了 Temporal,每月编排 10 亿+ 次 Agent 动作。做严肃的生产 Agent,它值得优先纳入评估。(数据来源:temporal.io/in-use)
🆚 L1 和 L2 到底差在哪?
很多人会把这两层搞混——它们都像"底层基建",但关注的维度完全不同:
| L1 计算 & 沙箱基座 | L2 持久化执行引擎 | |
|---|---|---|
| 一句话 | 在哪儿跑、怎么隔离、怎么并行 | 跑挂了怎么办、状态怎么不丢 |
| 维度 | 空间 / 资源(算力、隔离、调度) | 时间 / 可靠性(状态、重放、续跑) |
| 提供 | 进程 / 容器 / 微 VM / 沙箱 / 集群调度 | 事件日志、checkpoint、重试、断点续跑 |
| 崩溃时 | 不管——进程没了就没了 | 从上次断点重放继续跑 |
| 代表 | e2b-dev、Ray、Modal、Cloudflare DO、Substrate | Temporal、Trigger.dev、Inngest、Hatchet |
🧠 一个类比:L1 ≈ 操作系统进程 + 隔离沙盒(给你"算力"和"场所");L2 ≈ 带 WAL 的数据库事务(给你"记忆"和"可靠性")。
两者正交、互补,生产里常叠着用:Temporal(L2)编排工作流、保证每步崩溃可重放 → 每一步里调用 e2b-dev(L1)开一个安全沙箱跑 Agent 生成的代码。沙箱不负责帮你续跑,Temporal 也不负责隔离不可信代码。
⚠️ 边界模糊的情况:Cloudflare Durable Objects、Modal 横跨两层(既提供计算/沙箱,又带一点持久状态)——但主定位仍可区分。
五、L3 Agent 框架(带编排能力)
这一层是开发者最熟悉的"造 Agent"的地方,但现代框架早已内置了图编排、多智能体协作、检查点等能力。
| 框架 | 🚦 成熟度 | 🏭 生产故事 |
|---|---|---|
| LangGraph 🕸️(+LangSmith 部署) | 生产级 v1.0 GA(Oct'25,~37k⭐) | Klarna、Uber、LinkedIn、摩根大通(来源) |
| CrewAI 👥 | 生产级(~55k⭐,社区活跃) | 近半数世界 500 强;一年 20 亿次 Agent 运行(来源) |
| Microsoft Agent Framework 🪟(AutoGen+SK 合并) | v1.0 生产级 | 微软 Copilot 全家桶同栈 |
| OpenAI Agents SDK 🤖(前 Swarm) | GA(Mar'25,20.7k⭐) | OpenAI 生态,4900+ 依赖项目 |
| Google ADK 🔷 | GA(20k⭐,月下载百万) | Vertex Agent Engine |
| LlamaIndex Workflows 🦙 | 生产级(51k⭐) | Salesforce、波音/Jeppesen(来源) |
| Pydantic AI / Mastra / Strands(AWS) 🧩 | GA / Beta / GA v1.0 | 类型安全 / TS 原生 / AWS 原生 |
🔥 趋势注意:微软已把 AutoGen + Semantic Kernel 合并为 Microsoft Agent Framework (MAF),AutoGen 进入维护模式;LangGraph "Platform" 改名 "LangSmith Deployment"。选型时注意别踩过时文档。
六、L4 云厂商托管运行时(横切层)
三大云都推出了"把你的 Agent 代码打包成容器,我帮你托管、扩缩容、管身份、看链路"的托管服务。它横切在框架之上、产品之下,把下面几层"一键托管"。
| 云 | 产品 | 🚦 状态 | ✨ 亮点 |
|---|---|---|---|
| AWS 🟧 | Bedrock AgentCore | GA(Oct'25,来源) | Firecracker 隔离、单会话 8 小时、框架无关;Runtime/Memory/Identity/Gateway/Policy 全家桶 |
| Azure 🟦 | AI Foundry Agent Service | GA | Prompt Agents(无代码)+ Hosted Agents(自带容器) |
| GCP 🟥 | Vertex AI Agent Engine | GA | 托管会话、ADK 原生、200+ 模型目录 |
三家共同点:框架无关 + 微 VM 隔离 + 托管身份/可观测 + MCP/A2A 协议。云厂商正在把"Agent 运行时"变成和"数据库""对象存储"一样的标准云服务。
七、L5 多智能体平台 / "Agent OS"
这一层是闭源商业产品,直接卖"结果",是目前商业化最直接的一层。
- 🧑💻 Cognition / Devin——自主软件工程师。融资 10 亿美元、估值 260 亿、ARR 4.92 亿美元;高盛、戴尔、奔驰、美国陆海军在用。到 2026 年中,Cognition 约 90% 的代码由 Devin 自己写。(来源)
- 🎧 Sierra——企业级客服 Agent,ARR 突破 1.5 亿美元,按"结果"收费。前 Salesforce 高管创立。(来源)
- 🏭 Factory AI——"Droids"自主软件工程,估值 15 亿美元。(来源)
- 🤖 AutoGPT——186k⭐,GitHub 上星标最高的 AI 项目之一、赛道早期开创者(2023),现为托管平台。
八、国产阵营专题
国产阵营的形态明显不同:以云厂商托管平台为主导(规模数据可观),同时贡献了具有全球影响力的开源项目(Dify、MetaGPT、AgentScope、Coze、Eino)。它横跨上面 L1~L5 各层,因此单独成章、按厂商纵向来看。
8.1 阿里系
| 项目 | 🚦 成熟度 | 🏭 生产故事 |
|---|---|---|
| agentscope-ai/AgentScope(智能体框架) | 生产级 v2.0(28k⭐) | 多租户、多会话、K8s/Docker/沙箱、事件总线 |
| OpenSandbox(开源沙箱基座 · L1) | 早期(2026.3 开源,Apache 2.0) | 阿里版开源 Agent 沙箱运行时;四层架构 + execd,Docker/K8s、Kata/gVisor,对标 e2b-dev(来源) |
| Qwen-Agent(通义千问) | 生产级(16.7k⭐) | chat.qwen.ai 后端、MCP、并行工具调用 |
| Spring AI Alibaba(Java 框架) | 生产级 v1.1.2.2(10.1k⭐) | 持久化 graph 运行时、A2A(基于 Nacos)、JManus 在阿里内部多应用使用 |
| 百炼 Bailian(云平台) | GA | 73 万+ 开发者;零跑汽车智能座舱、盈米基金、德勤 VOC(来源) |
| Higress(AI 网关) | 生产级·CNCF Sandbox(8.9k⭐) | 蚂蚁、大疆、携程、快手;托管 MCP、Token 限流(来源) |
8.2 字节系
| 项目 | 🚦 成熟度 | 🏭 生产故事 |
|---|---|---|
| Coze 扣子 / Coze Studio | 商业版 GA / 开源 Beta(20k⭐) | 2600 万月活;Studio 2025.7 开源,Go/DDD 架构(来源) |
| Eino(Go 智能体框架) | 生产级 v0.9.12(12.4k⭐) | TikTok、豆包、Coze Studio 运行时引擎;支持 DeepAgent 多智能体、中断/恢复(来源) |
| 豆包 / 火山方舟 | GA | 占中国公有云 AI 大模型 49% 市场、日均 50 万亿 token、豆包 App 2.26 亿月活;奔驰、比亚迪、小米(来源) |
8.3 腾讯系
| 项目 | 🚦 成熟度 | 🏭 生产故事 |
|---|---|---|
| 腾讯云 ADP 3.0(智能体开发平台) | GA(Sep'25) | A.O.史密斯、洋河、顺丰、迈瑞、华润信托;异步工作流+多智能体(来源) |
| 腾讯元器 Yuanqi | GA | 首家接入 微信支付 MCP,Agent 可下单/收款/订阅;一键分发到微信/QQ(来源) |
| TencentCloudADP/Youtu-Agent(优图,开源) | Beta(v0.1.x,2025.9 开源) | 全开源模型 agent 框架、meta-agent 自动生成、GAIA 72.8%(来源) |
| TarsCloud/Tars | 生产级(约 10k⭐,10+ 年) | 通用高性能 RPC 微服务框架,支撑腾讯海量后端服务(含 AI 服务)的底座 |
8.4 百度 / 华为 / 蚂蚁 / 讯飞
| 项目 | 厂商 | 🚦 成熟度 | 🏭 生产故事 |
|---|---|---|---|
| 千帆 AppBuilder v4.0 | 百度智能云 | GA(Aug'25) | 46 万+ 企业、130 万+ Agent 应用、日均千万级调用;多智能体并行协作(来源) |
| 盘古 + ModelArts + Agentic Infra | 华为云 | GA(盘古 5.5,Jun'25) | 1300+ 企业;上海宝武、智利国家图书馆;昇腾 NPU 基座(来源) |
| AgentUniverse | 蚂蚁集团 | Beta(2.3k⭐) | 独创 PEER/DOE 多智能体模式;支付宝"智小助"金融投研(来源) |
| 星火 Astron Agent | 科大讯飞 | 生产级·CNCF Landscape | 中国电信、东华软件、烽火通信;RPA + AI,企业级高可用开源(来源) |
8.5 大模型公司 & 明星开源
| 项目 | 🚦 成熟度 | 🏭 生产故事 |
|---|---|---|
| Dify(LLMOps 平台) | 生产级(全球主流,100k+⭐) | 20 万+ 应用;$30M 融资(来源) |
| FoundationAgents/MetaGPT / MGX(多智能体软件公司) | 生产级(63k+⭐) | "软件公司"多角色协作,学术+工业双高影响力 |
| MiniMax Agent / M2 | GA | Agent 原生模型,主打长任务(来源) |
| 智谱 AutoGLM / GLM-4 | GA | 手机 GUI 操作 Agent、企业 Agent 平台 |
| 月之暗面 Kimi / K2 | GA | 长上下文 + Agent 工具调用 |
| FastGPT | 生产级(21k+⭐) | 私有化知识库 + 工作流编排,国内落地极多 |
九、📈 趋势总结
1️⃣ 技术栈正在"分层化"
底层的计算/沙箱基座(e2b-dev、Ray、Substrate)+ 持久化引擎(Temporal),中层的框架(LangGraph、CrewAI),上层的云托管运行时(AgentCore/Foundry/Vertex)与Agent OS 产品(Devin、Sierra)——赢家越来越靠"组合"而非"大一统"。
2️⃣ "持久化 + 有状态"是赛道的核心难题
Agent 长时运行、高空闲、非确定性。所有严肃平台都在围绕 检查点/恢复、崩溃重放、空闲休眠省钱 做文章——这正是 Substrate 的多路复用、Cloudflare 的休眠 Durable Objects、Fly Sprites、Temporal 重放的共同命题。
3️⃣ 沙箱已成标配基建
开源沙箱 e2b-dev / E2B 企业云靠"安全跑 AI 代码"覆盖世界 100 强;Firecracker/微 VM 隔离进入每一个云运行时。沙箱本身也在走向标准化:K8s SIG Apps 推出 Agent Sandbox(Sandbox CRD),阿里开源 OpenSandbox,都想把"有状态、单例、强隔离"的 Agent 运行时做成平台原生原语。
4️⃣ 开放协议收敛:MCP + A2A
MCP(工具)与 A2A(Agent 间通信)正逐步成为通用标准,国产平台也普遍支持(腾讯微信支付 MCP、阿里 Higress 托管 MCP、蚂蚁 AgentUniverse)。
5️⃣ 整合与已验证的商业化
微软合并 AutoGen+SK→MAF;Daytona 转私有;而 Devin(4.92 亿 ARR)、Sierra(1.5 亿 ARR)、Dify($30M 融资)证明了商业化跑通——赛道已从"实验"走向"生意"。
6️⃣ 国产的独特形态
以云厂商托管平台为主导,规模可观(豆包日均 50 万亿 token(来源)、百度 130 万 Agent 应用(来源)),叠加具有全球影响力的开源(Dify、MetaGPT、AgentScope、Coze、Eino)。偏好无代码企业平台、超级 App 分发(微信/抖音)、支付能力 Agent,而非西方创业公司偏爱的底层 substrate 原语。
7️⃣ 未来 2–3 年:从"单点工具"整合为"多层生态"
接下来的整合会沿六条主线展开:Agent 运行时、Agent 市场/商店、协议标准、数字员工治理、垂直行业 Agent、编码/软件工程 Agent。各大厂的动作已经证明——这不再是"单一厂商的工具品类",而是一个分层生态:
- 🌐 协议标准:Google A2A、Anthropic MCP、OpenAI Responses API + Agents SDK
- ☁️ 运行时 / 平台:AWS Bedrock 多智能体协作、Microsoft Foundry / Copilot Studio、Databricks Agent Bricks
- 🏢 数字员工 / 企业中枢:Salesforce Agentforce、ServiceNow AI Agent Fabric
换句话说:协议在收敛、运行时在托管化、产品在垂直化——正好对应本文自底向上的 L1→L5 分层。谁能把某一层做深做透,谁就能在这个多层生态里占住位置。
十、🧭 选型建议
| 你的场景 | 👍 推荐 |
|---|---|
| 严肃生产、要极致可靠 | Temporal(可靠性)+ 自选框架 |
| 快速搭多智能体 Demo→生产 | LangGraph / CrewAI |
| 全家桶托管、不想管基建 | AWS AgentCore / Azure Foundry / GCP Vertex |
| 需要安全跑 AI 生成代码 | e2b-dev(开源自托管)/ E2B 云(首选)/ Modal;国产自托管可看 OpenSandbox |
| Java 技术栈 | Spring AI Alibaba |
| Go 技术栈 | ByteDance Eino |
| 国内企业、要无代码 + 合规 | 百炼 / 千帆 / 腾讯 ADP |
| 私有化开源 Agent 平台 | Dify / FastGPT / Coze Studio |
| 探索"超密度跑 Agent"的前沿基建 | agent-substrate/substrate(早期,慎用于生产) |
📌 一句话总结:2026 年,"造 Agent" 已经不是壁垒,"大规模、可靠、省钱地跑 Agent" 才是。生产可用的今天 = Temporal、Ray、e2b-dev、LangGraph、CrewAI、三大云运行时、Dify + 国产云平台;早期押注 = Substrate、Fly Sprites、DBOS 这些"框架之下的运行时层"。
本文数据截至 2026 年 7 月,Star 数与指标为调研时近似值;关键生产数字均已在文中标注引用出处(点击「来源/案例/财报」链接可查证)。欢迎在评论区补充~ 觉得有用请点赞 👍 收藏 ⭐ 关注 🔔