万字长文 · Agent 编排全景:5 大分层、60+ 框架/产品,含国内阵营

85 阅读11分钟

2026 年,"造一个 Agent"已经不是壁垒,"大规模、可靠、省钱地把 Agent 跑起来"才是。 本文把国内外 60+ 框架 / 工具 / 产品,按自底向上的 5 层架构分类梳理:每层解决什么、成熟度如何、有哪些真实生产故事(关键数字均附引用),并单独开一章讲国产阵营,最后给出选型建议与趋势判断。


一、市场现状:为什么"编排"成了刚需?

AI Agent 已经从"聊天机器人 + 工具"的实验,升级为企业级工作流自动化的一个平台品类——但规模化落地依然极不均衡。先看一组数字。

📊 需求侧:普遍在布局

  • 🔥 Gartner:到 2026 年底,40% 的企业应用将内置任务型 AI Agent(2025 年这个比例还不到 5%)。(来源
  • 📈 McKinsey《State of AI 2025》62% 的组织已在试验 AI Agent23% 已在企业至少一个环节规模化落地 agentic AI。(来源
  • 🧪 Deloitte 2025:对"真正投产"更保守——仅 11% 在生产环境实际使用 agentic 系统、14% 已具备部署条件(另有 38% 在试点、30% 在探索)。(来源

⚠️ 落地侧:鸿沟同样真实

机会是真的,失败模式也是真的:

  • 💸 Gartner:预计到 2027 年底,超过 40% 的 agentic AI 项目会被取消——主因是成本高、价值不清、管控不足(即所谓"agent washing":把传统自动化/聊天机器人包装成 Agent)。(来源
  • 🛡️ 2025 AI Agent Index(MIT):在 13 个具备"前沿自主性"的 Agent 中,只有 4 个披露了 Agent 专属的安全评估——透明度与治理存在明显缺口。(来源

一张图看清"需求增长较快、但多数仍处于早期阶段"的现状:

diagram-1-market-status.png

📖 怎么读这张图:漏斗颜色从灰(探索/试点)→ 橙(就绪)→ 绿(投产),越往下越少——约 2/3 的组织仍处在探索和试点阶段,真正投产的约为一成。上方是需求侧,下方是落地门槛。

🧩 一句话:需求增长较快,但"从 Demo 到规模化生产"仍有明显差距。而这道差距本质是工程问题——可靠性、成本、隔离、可观测、治理。这,正是"编排"这一层要解决的。

🧗 那为什么这么难?

传统后端一个请求几百毫秒就返回,而一个 Agent 任务可能要跑几分钟到几小时,中间穿插几十次 LLM 调用、工具调用、人工审批。这带来了一堆传统 Web 架构从没遇到过的难题:

  • ⏱️ 长时运行:任务动辄几十分钟,普通 HTTP 请求 / Serverless 超时模型直接扛不住。
  • 💥 非确定性 + 会崩溃:LLM 输出不可控、网络会抖、进程会挂——必须能崩溃重放、断点续跑,而不是从头再来。
  • 😴 高空闲烧钱:Agent 大部分时间在 LLM 返回或等人审批,进程却一直占着内存/GPU,成本压力不小。
  • 🧨 要跑不可信代码:Agent 会现场生成并执行任意代码,绝不能让它直接在生产机上跑,必须沙箱隔离
  • 🕸️ 多智能体协作:真实系统往往是多个 Agent 分工协作,需要图 / 状态机来编排。
  • 📈 要扩到海量并发:成千上万个会话同时在线,需要调度、扩缩容与托管。

这些难题里,最底层、最反直觉的是"又空闲又要省钱"——这正是 GitHub 上 agent-substrate/substrate 这类项目想解决的:把成千上万个空闲的有状态 Agent多路复用到少数几个 Pod 上(30 倍以上超售)。它是最底层 L1 基座层的一个代表。下面我们自底向上,一层层拆解整个技术栈。


二、一张图看懂:Agent 编排的 5 层分层架构

diagram-2-architecture.png

📖 怎么读这张图编号越小越靠下、越贴近基础设施;编号越大越靠上、越贴近业务和"卖结果"。实线箭头 = 主依赖,虚线 = 可选直连。

真正的生产系统往往是跨层组合,例如一条典型链路: CrewAI(L3 写多智能体逻辑)→ Temporal(L2 持久化 + 崩溃重放)→ e2b-dev(L1 安全跑代码)→ AWS AgentCore(L4 托管扩缩容)。下面从最底层的 L1 开始,逐层拆解。


三、L1 计算 & 沙箱基座(最底层运行时)

这是整个栈的地基,解决两件底层的事:(a) 调度 / 海量并行——把成千上万个 Agent 任务分发到集群、批处理 LLM 调用;(b) 隔离执行——安全地跑 Agent 生成的不可信代码,并在"挂起 / 恢复"之间保留状态。其中 agent-substrate/substrate(把空闲 Agent 多路复用到少数 Pod)正属于这一层。

3.1 计算 / 调度引擎

  • 🌟 Ray / Ray Serve(Anyscale)——43k⭐,2025 年 10 月加入 PyTorch 基金会。OpenAI 用它训练 ChatGPT,Cohere、Klaviyo、EleutherAI 都在用。Agent 场景下负责大规模并行执行与 LLM 调用批处理。(Klaviyo 案例
  • 🧱 Dapr Agents——CNCF 毕业项目 Dapr 的 AI 扩展,2025.3 首发、GA v1.0 于 2026.3 KubeCon EU。ZEISS、欧洲物流商已在生产使用。(首发GA 公告
  • ☸️ KubeRay / Argo Workflows / Volcano——K8s 原生的批量 / DAG 调度,适合已有 K8s 投入的团队。
  • 🧬 agent-substrate/substrate——把成千上万个空闲有状态 Agent多路复用到少数 Pod(gVisor 隔离、挂起/恢复、全状态快照、30 倍+ 超售)。理念超前,但非常早期、暂不建议用于生产

3.2 沙箱 / 隔离执行环境(跑不可信代码)

Agent 会生成并执行任意代码,你不可能让它直接在生产机器上跑。这一层因此成了刚需基建。

⚠️ 一个容易混淆的点:这一层指的是开源、可自托管的沙箱运行时(如 e2b-dev/E2B)。而 E2B 官网主打的 Enterprise AI Agent Cloud 是在这套开源核心之上的托管平台,层级更靠上——别把"E2B 品牌"整个当成沙箱基座。下表按开源基座视角来看。

产品🎯 特点🚦 成熟度🏭 生产故事
e2b-dev(开源沙箱) 📦开源、可自托管的 Firecracker 微 VM 沙箱,~150ms 启动生产级(开源 13k⭐)其托管的 E2B 企业 Agent 云已启动 10 亿+ 沙箱、覆盖 88~94% 世界 100 强;Perplexity、HuggingFace、Manus(来源
OpenSandbox(阿里开源) 🧪开源沙箱平台,四层架构(SDK / Specs / Runtime / Sandbox);容器注入 Go 守护进程 execd,支持 Docker + K8s、Kata/gVisor 隔离;覆盖 Coding / GUI / Code Exec / RL 四类场景早期(2026.3 开源,Apache 2.0)与阿里内部大规模 AI 负载同源基建;集成 Claude Code、Gemini CLI、Codex、LangGraph、ADK、Playwright(来源
Kubernetes Agent Sandbox(SIG Apps)☸️K8s 官方 Sandbox CRD + 控制器:稳定身份 + 持久存储 + 暂停/恢复生命周期,可插拔 gVisor/Kata 隔离;含 WarmPool 预热池、Template/Claim 扩展、Go/Python SDK早期(v1beta1·v0.x,Apache 2.0)由 SIG Apps 主导、Google 发起(2025.11 官宣、2026.3 上 K8s 官博),目标是在 K8s 上跑有状态 Agent 的厂商中立标准K8s 官博
Modal 🚄Serverless GPU,秒级冷启动生产级(87MB轮,87M B 轮,1.1B 估值)Runway、Suno、Harvey AI(来源
Cloudflare Agents / Durable Objects 🌐边缘原生、空闲休眠、可扩到千万级并发生产级Cloudflare 自家 AI 产品同栈
Fly.io Sprites 🧚为编码 Agent 准备的持久 Firecracker VM早期预览(Jan'26)
Daytona ⚠️曾对标 E2B开源仓库 2026.6 归档转私有谨慎评估

🔎 落地较扎实的一格:E2B 企业云(构建在开源沙箱 e2b-dev 之上)靠"安全跑 AI 代码"这一个切入点,覆盖了约九成世界 100 强企业。各云厂商的 Agent 运行时也大多内置了 Firecracker/微 VM 隔离——沙箱已是行业标配。(数据来源:VentureBeat


四、L2 持久化执行引擎(可靠性底座)

这一层解决的核心是 Durable Execution(持久化执行):把每次 LLM 调用、工具调用都包成一个可重放、可重试、崩溃后能"从上次断点续跑"的步骤。

工具🎯 解决什么🚦 成熟度🏭 生产故事
Temporal 🐘持久工作流、崩溃重放、重试、HITL生产级·久经考验(22k⭐)Replit:每月 10 亿+ Agent 动作来源);Stripe、Snap、Coinbase、Netflix(案例
Trigger.dev长任务无超时、waitpoint 人审Beta→生产(15.7k⭐)TS/AI SaaS 团队,$16M A 轮
Inngest 📬事件驱动的持久步骤函数生产级(5.6k⭐)Resend、1Password,YC/a16z
Hatchet 🪓Postgres 持久化 + 强可观测性Beta→生产(7.5k⭐)YC W24,号称"每月数十亿任务"
Windmill 🌀脚本+流程+UI 一体开发平台生产级(17k⭐)4000+ 组织、300+ 企业
Restate / DBOS 🗄️轻量持久执行(DBOS 只需 Postgres)生产 / 早期DBOS 由图灵奖得主 Stonebraker 创立

💡 划重点Temporal 是这层最成熟、采用最广的选择,Replit 把整个 AI Agent 控制平面迁到了 Temporal,每月编排 10 亿+ 次 Agent 动作。做严肃的生产 Agent,它值得优先纳入评估。(数据来源:temporal.io/in-use

🆚 L1 和 L2 到底差在哪?

很多人会把这两层搞混——它们都像"底层基建",但关注的维度完全不同

L1 计算 & 沙箱基座L2 持久化执行引擎
一句话在哪儿跑、怎么隔离、怎么并行跑挂了怎么办、状态怎么不丢
维度空间 / 资源(算力、隔离、调度)时间 / 可靠性(状态、重放、续跑)
提供进程 / 容器 / 微 VM / 沙箱 / 集群调度事件日志、checkpoint、重试、断点续跑
崩溃时不管——进程没了就没了从上次断点重放继续跑
代表e2b-dev、Ray、Modal、Cloudflare DO、SubstrateTemporal、Trigger.dev、Inngest、Hatchet

🧠 一个类比:L1 ≈ 操作系统进程 + 隔离沙盒(给你"算力"和"场所");L2 ≈ 带 WAL 的数据库事务(给你"记忆"和"可靠性")。

两者正交、互补,生产里常叠着用:Temporal(L2)编排工作流、保证每步崩溃可重放 → 每一步里调用 e2b-dev(L1)开一个安全沙箱跑 Agent 生成的代码。沙箱不负责帮你续跑,Temporal 也不负责隔离不可信代码。

⚠️ 边界模糊的情况:Cloudflare Durable Objects、Modal 横跨两层(既提供计算/沙箱,又带一点持久状态)——但主定位仍可区分。


五、L3 Agent 框架(带编排能力)

这一层是开发者最熟悉的"造 Agent"的地方,但现代框架早已内置了图编排、多智能体协作、检查点等能力。

框架🚦 成熟度🏭 生产故事
LangGraph 🕸️(+LangSmith 部署)生产级 v1.0 GA(Oct'25,~37k⭐)Klarna、Uber、LinkedIn、摩根大通(来源
CrewAI 👥生产级(~55k⭐,社区活跃)近半数世界 500 强;一年 20 亿次 Agent 运行(来源
Microsoft Agent Framework 🪟(AutoGen+SK 合并)v1.0 生产级微软 Copilot 全家桶同栈
OpenAI Agents SDK 🤖(前 Swarm)GA(Mar'25,20.7k⭐)OpenAI 生态,4900+ 依赖项目
Google ADK 🔷GA(20k⭐,月下载百万)Vertex Agent Engine
LlamaIndex Workflows 🦙生产级(51k⭐)Salesforce、波音/Jeppesen(来源
Pydantic AI / Mastra / Strands(AWS) 🧩GA / Beta / GA v1.0类型安全 / TS 原生 / AWS 原生

🔥 趋势注意:微软已把 AutoGen + Semantic Kernel 合并为 Microsoft Agent Framework (MAF),AutoGen 进入维护模式;LangGraph "Platform" 改名 "LangSmith Deployment"。选型时注意别踩过时文档。


六、L4 云厂商托管运行时(横切层)

三大云都推出了"把你的 Agent 代码打包成容器,我帮你托管、扩缩容、管身份、看链路"的托管服务。它横切在框架之上、产品之下,把下面几层"一键托管"。

产品🚦 状态✨ 亮点
AWS 🟧Bedrock AgentCoreGA(Oct'25,来源Firecracker 隔离、单会话 8 小时、框架无关;Runtime/Memory/Identity/Gateway/Policy 全家桶
Azure 🟦AI Foundry Agent ServiceGAPrompt Agents(无代码)+ Hosted Agents(自带容器)
GCP 🟥Vertex AI Agent EngineGA托管会话、ADK 原生、200+ 模型目录

三家共同点:框架无关 + 微 VM 隔离 + 托管身份/可观测 + MCP/A2A 协议。云厂商正在把"Agent 运行时"变成和"数据库""对象存储"一样的标准云服务。


七、L5 多智能体平台 / "Agent OS"

这一层是闭源商业产品,直接卖"结果",是目前商业化最直接的一层。

  • 🧑‍💻 Cognition / Devin——自主软件工程师。融资 10 亿美元、估值 260 亿、ARR 4.92 亿美元;高盛、戴尔、奔驰、美国陆海军在用。到 2026 年中,Cognition 约 90% 的代码由 Devin 自己写。(来源
  • 🎧 Sierra——企业级客服 Agent,ARR 突破 1.5 亿美元,按"结果"收费。前 Salesforce 高管创立。(来源
  • 🏭 Factory AI——"Droids"自主软件工程,估值 15 亿美元。(来源
  • 🤖 AutoGPT——186k⭐,GitHub 上星标最高的 AI 项目之一、赛道早期开创者(2023),现为托管平台。

八、国产阵营专题

国产阵营的形态明显不同:以云厂商托管平台为主导(规模数据可观),同时贡献了具有全球影响力的开源项目(Dify、MetaGPT、AgentScope、Coze、Eino)。它横跨上面 L1~L5 各层,因此单独成章、按厂商纵向来看。

8.1 阿里系

项目🚦 成熟度🏭 生产故事
agentscope-ai/AgentScope(智能体框架)生产级 v2.0(28k⭐)多租户、多会话、K8s/Docker/沙箱、事件总线
OpenSandbox(开源沙箱基座 · L1)早期(2026.3 开源,Apache 2.0)阿里版开源 Agent 沙箱运行时;四层架构 + execd,Docker/K8s、Kata/gVisor,对标 e2b-dev(来源
Qwen-Agent(通义千问)生产级(16.7k⭐)chat.qwen.ai 后端、MCP、并行工具调用
Spring AI Alibaba(Java 框架)生产级 v1.1.2.2(10.1k⭐)持久化 graph 运行时、A2A(基于 Nacos)、JManus 在阿里内部多应用使用
百炼 Bailian(云平台)GA73 万+ 开发者;零跑汽车智能座舱、盈米基金、德勤 VOC(来源
Higress(AI 网关)生产级·CNCF Sandbox(8.9k⭐)蚂蚁、大疆、携程、快手;托管 MCP、Token 限流(来源

8.2 字节系

项目🚦 成熟度🏭 生产故事
Coze 扣子 / Coze Studio商业版 GA / 开源 Beta(20k⭐)2600 万月活;Studio 2025.7 开源,Go/DDD 架构(来源
Eino(Go 智能体框架)生产级 v0.9.12(12.4k⭐)TikTok、豆包、Coze Studio 运行时引擎;支持 DeepAgent 多智能体、中断/恢复(来源
豆包 / 火山方舟GA占中国公有云 AI 大模型 49% 市场、日均 50 万亿 token、豆包 App 2.26 亿月活;奔驰、比亚迪、小米(来源

8.3 腾讯系

项目🚦 成熟度🏭 生产故事
腾讯云 ADP 3.0(智能体开发平台)GA(Sep'25)A.O.史密斯、洋河、顺丰、迈瑞、华润信托;异步工作流+多智能体(来源
腾讯元器 YuanqiGA首家接入 微信支付 MCP,Agent 可下单/收款/订阅;一键分发到微信/QQ(来源
TencentCloudADP/Youtu-Agent(优图,开源)Beta(v0.1.x,2025.9 开源)全开源模型 agent 框架、meta-agent 自动生成、GAIA 72.8%(来源
TarsCloud/Tars生产级(约 10k⭐,10+ 年)通用高性能 RPC 微服务框架,支撑腾讯海量后端服务(含 AI 服务)的底座

8.4 百度 / 华为 / 蚂蚁 / 讯飞

项目厂商🚦 成熟度🏭 生产故事
千帆 AppBuilder v4.0百度智能云GA(Aug'25)46 万+ 企业、130 万+ Agent 应用、日均千万级调用;多智能体并行协作(来源
盘古 + ModelArts + Agentic Infra华为云GA(盘古 5.5,Jun'25)1300+ 企业;上海宝武、智利国家图书馆;昇腾 NPU 基座(来源
AgentUniverse蚂蚁集团Beta(2.3k⭐)独创 PEER/DOE 多智能体模式;支付宝"智小助"金融投研(来源
星火 Astron Agent科大讯飞生产级·CNCF Landscape中国电信、东华软件、烽火通信;RPA + AI,企业级高可用开源(来源

8.5 大模型公司 & 明星开源

项目🚦 成熟度🏭 生产故事
Dify(LLMOps 平台)生产级(全球主流,100k+⭐)20 万+ 应用;$30M 融资(来源
FoundationAgents/MetaGPT / MGX(多智能体软件公司)生产级(63k+⭐)"软件公司"多角色协作,学术+工业双高影响力
MiniMax Agent / M2GAAgent 原生模型,主打长任务(来源
智谱 AutoGLM / GLM-4GA手机 GUI 操作 Agent、企业 Agent 平台
月之暗面 Kimi / K2GA长上下文 + Agent 工具调用
FastGPT生产级(21k+⭐)私有化知识库 + 工作流编排,国内落地极多

九、📈 趋势总结

1️⃣ 技术栈正在"分层化"

底层的计算/沙箱基座(e2b-dev、Ray、Substrate)+ 持久化引擎(Temporal),中层的框架(LangGraph、CrewAI),上层的云托管运行时(AgentCore/Foundry/Vertex)与Agent OS 产品(Devin、Sierra)——赢家越来越靠"组合"而非"大一统"。

2️⃣ "持久化 + 有状态"是赛道的核心难题

Agent 长时运行、高空闲、非确定性。所有严肃平台都在围绕 检查点/恢复、崩溃重放、空闲休眠省钱 做文章——这正是 Substrate 的多路复用、Cloudflare 的休眠 Durable Objects、Fly Sprites、Temporal 重放的共同命题。

3️⃣ 沙箱已成标配基建

开源沙箱 e2b-dev / E2B 企业云靠"安全跑 AI 代码"覆盖世界 100 强;Firecracker/微 VM 隔离进入每一个云运行时。沙箱本身也在走向标准化:K8s SIG Apps 推出 Agent Sandbox(Sandbox CRD),阿里开源 OpenSandbox,都想把"有状态、单例、强隔离"的 Agent 运行时做成平台原生原语。

4️⃣ 开放协议收敛:MCP + A2A

MCP(工具)与 A2A(Agent 间通信)正逐步成为通用标准,国产平台也普遍支持(腾讯微信支付 MCP、阿里 Higress 托管 MCP、蚂蚁 AgentUniverse)。

5️⃣ 整合与已验证的商业化

微软合并 AutoGen+SK→MAF;Daytona 转私有;而 Devin(4.92 亿 ARR)、Sierra(1.5 亿 ARR)、Dify($30M 融资)证明了商业化跑通——赛道已从"实验"走向"生意"。

6️⃣ 国产的独特形态

云厂商托管平台为主导,规模可观(豆包日均 50 万亿 token(来源)、百度 130 万 Agent 应用(来源)),叠加具有全球影响力的开源(Dify、MetaGPT、AgentScope、Coze、Eino)。偏好无代码企业平台、超级 App 分发(微信/抖音)、支付能力 Agent,而非西方创业公司偏爱的底层 substrate 原语。

7️⃣ 未来 2–3 年:从"单点工具"整合为"多层生态"

接下来的整合会沿六条主线展开:Agent 运行时、Agent 市场/商店、协议标准、数字员工治理、垂直行业 Agent、编码/软件工程 Agent。各大厂的动作已经证明——这不再是"单一厂商的工具品类",而是一个分层生态

  • 🌐 协议标准:Google A2A、Anthropic MCP、OpenAI Responses API + Agents SDK
  • ☁️ 运行时 / 平台:AWS Bedrock 多智能体协作、Microsoft Foundry / Copilot Studio、Databricks Agent Bricks
  • 🏢 数字员工 / 企业中枢:Salesforce Agentforce、ServiceNow AI Agent Fabric

换句话说:协议在收敛、运行时在托管化、产品在垂直化——正好对应本文自底向上的 L1→L5 分层。谁能把某一层做深做透,谁就能在这个多层生态里占住位置。


十、🧭 选型建议

你的场景👍 推荐
严肃生产、要极致可靠Temporal(可靠性)+ 自选框架
快速搭多智能体 Demo→生产LangGraph / CrewAI
全家桶托管、不想管基建AWS AgentCore / Azure Foundry / GCP Vertex
需要安全跑 AI 生成代码e2b-dev(开源自托管)/ E2B 云(首选)/ Modal;国产自托管可看 OpenSandbox
Java 技术栈Spring AI Alibaba
Go 技术栈ByteDance Eino
国内企业、要无代码 + 合规百炼 / 千帆 / 腾讯 ADP
私有化开源 Agent 平台Dify / FastGPT / Coze Studio
探索"超密度跑 Agent"的前沿基建agent-substrate/substrate(早期,慎用于生产)

📌 一句话总结:2026 年,"造 Agent" 已经不是壁垒,"大规模、可靠、省钱地跑 Agent" 才是。生产可用的今天 = Temporal、Ray、e2b-dev、LangGraph、CrewAI、三大云运行时、Dify + 国产云平台;早期押注 = Substrate、Fly Sprites、DBOS 这些"框架之下的运行时层"。


本文数据截至 2026 年 7 月,Star 数与指标为调研时近似值;关键生产数字均已在文中标注引用出处(点击「来源/案例/财报」链接可查证)。欢迎在评论区补充~ 觉得有用请点赞 👍 收藏 ⭐ 关注 🔔