后 Coding 时代 AI Agent 的新命题:长程任务、自治系统与自我进化 II

6 阅读1小时+

后 Coding 时代 AI Agent 的新命题:长程任务、自治系统与自我进化 II

一份关于 2026 年人工智能体范式转移的深度研究

研究主题:Long Horizon Task(长程任务能力)、Autonomous Agent System(完全自治智能体系统)、Self-Evolving(自我进化)

版本:v1.0 日期:2026 年 7 月 摘要字数:约 30,000 字


摘要

2026 年,人工智能产业正经历一次根本性的范式转移:从以"模型能力"为中心的时代,迈入以"智能体行动"为中心的时代。如果说 2023—2025 年是 Pre-Training(预训练)与 Reasoning(推理)两大拐点主导的"更快的马"阶段——模型在问答、生成、单点推理上以每年 10%—40% 的速度线性改良;那么 2026 年开启的第三个拐点 Long Horizon Agents(长程智能体),则被红杉资本、LangChain、METR 等机构一致判断为真正的"汽车"——它带来的是 10 倍起步的效率跃迁,而非边际优化。

这一拐点的本质,是 AI 从"回答问题"走向"交付结果",从"辅助人类"走向"成为劳动力"。其技术载体不再是孤立的模型,而是由模型与确定性基础设施(Harness)共同构成的、能够持续工作数小时乃至数天的自治系统。在这一背景下,AI Coding(AI 自主编程)作为第一个真正起飞的垂直场景,已经完成了它的历史使命——它证明了 Agent 可以在真实代码库中以人类工程师的方式工作。但 Coding 只是序章。当 Agent 的长程能力被验证、被工程化、被商业化之后,真正的新命题才浮出水面:

  1. 长程任务能力(Long Horizon Task):当任务从"一步完成"延长到"数小时、数天、甚至数月持续执行",Agent 如何在漫长的行动链中保持目标一致、管理上下文、从错误中恢复、处理延迟反馈?
  2. 完全自治的智能体系统(Autonomous Agent System):当 Agent 从"被人类逐步引导的工具"走向"无人值守的数字员工",我们需要怎样的系统架构——记忆、规划、工具、护栏、调度——来支撑其 8 小时以上的自主运行?
  3. 自我进化(Self-Evolving):当 Agent 积累了大量执行轨迹、失败案例、领域经验之后,它能否像人类专家一样"越做越好"——从经验流中提炼可复用知识,在运行时持续改进自身,最终从一个工具使用者成长为代码创造者,乃至具备自我繁衍能力的超级智能体?

本文围绕这三大新命题展开系统性的深度研究。我们首先梳理从 Coding Agent 到长程自治的历史脉络,锚定范式转移的三个拐点;继而分别深入三大命题的技术内核——长程任务的定义、特征与挑战,自治系统的"模型 + Harness"双层架构与五大基础设施,自我进化的四条技术路径(经验记忆、技能沉淀、模型自举、演化算法);之后构建一个统一框架,阐明三者如何构成"能力—载体—时间"的递进闭环;再从评测、工程、风险、商业四个维度展开讨论;最后给出通向超级智能体的路线图与产业判断。

本文的核心论点是:后 Coding 时代的新命题并非三个独立问题,而是一个由"长程能力—自治载体—自我进化"构成的自我强化三角。长程能力是门槛,自治系统是载体,自我进化是加速器。三者闭环一旦打通,AI 将从"被使用的工具"质变为"自我成长的劳动力",并在 2030 年代前后逼近"雇用一个智能体如同雇用一个员工"的产业常态。

关键词:AI Agent;长程任务;自治系统;自我进化;Agent Harness;上下文工程;记忆机制;Service-as-Software;超级智能体

    1. 引言:后 Coding 时代的来临
    1. 历史脉络:三大拐点与范式转移
    1. 命题一:长程任务能力(Long Horizon Task)
    1. 命题二:完全自治的智能体系统(Autonomous Agent System)
    1. 命题三:自我进化(Self-Evolving)
    1. 三大命题的统一框架
    1. 评测体系:从"答题"到"行动"到"活的题库"
    1. 工程实现与关键基础设施
    1. 风险、安全与治理
    1. 产业图景与商业模式重构
    1. 未来展望:通向超级智能体的路线图
    1. 结论
  • 参考文献

1. 引言:后 Coding 时代的来临

1.1 一个被验证的起点

2026 年 1 月,红杉资本(Sequoia Capital)在其年度 AI Ascent 闭门峰会上,用一场不到 40 分钟的开场演讲,为过去三年的 AI 发展划定了一条清晰的时间轴。三位合伙人 Pat Grady、Sonya Huang 与 Konstantine Bühler 提出:AI 经历了三个关键拐点——Pre-Training(预训练)、Reasoning(推理)、Long Horizon Agents(长程智能体)。前两个拐点带来的只是"更快的马",效率提升 10% 到 40%;而 Long Horizon Agents 才是真正的"汽车",效率直接提升 10 倍起步。

这一判断并非孤立。几乎同一时期,LangChain 创始人 Harrison Chase 在与红杉的对话中明确指出:"2026 年是 Long Horizon Agents 的元年。"他认为,过去三年 AI 是 Talkers(说者)的时代,2026 年则是 Doers(做者)的元年。转变的核心载体,正是长程智能体——这类 Agent 不再满足于对上下文的即时回复,而是具备自主规划、长时间运行、目标导向的专家级特征。

而这一切的起点,是 AI Coding。

在所有 Agent 场景中,编程是最先真正"起飞"的。Claude Code、Codex、AutoResearch、OpenClaw 等产品已经真实落地。它们之所以率先突破,并非偶然:代码任务天然具备"可验证性"——编译通过、测试跑过、行为正确,这些客观信号构成了 Agent 自我纠错的闭环基础。Anthropic 的 Claude 3.7 Sonnet 在 SWE-bench 上大幅领先,验证了"agentic coding"作为第一个长程任务落地点的可行性。

但 Coding 只是序章。

1.2 从"回答问题"到"交付结果"

理解后 Coding 时代,需要先理解 Coding 时代到底解决了什么。

在 Talkers 时代,AI 的价值单元是"回答"。用户输入一个问题,模型输出一段文本,交互就此结束。这种范式的经济属性是"按使用量计费"——API 调用次数、Token 消耗、Seat(席位)。它的天花板是"信息分发的效率"。

而 Doers 时代,AI 的价值单元变成了"结果"。用户提出一个目标——"帮我复现这篇金融论文的核心分析"、"帮我把这个 PRD 实现成可运行的应用"、"帮我把这批发票审计完并追回漏损"——Agent 不再回答,而是执行,直到交付一个可验收的产物。其经济属性因此发生结构性迁移:从"按使用量"转向"按结果(Outcome)",从"卖工具"转向"Selling Labor(卖劳动力)"。

2026 年 6 月,Citadel 创始人 Ken Griffin 在高盛 Apex 峰会上分享了一段让他"情绪低落"的经历:他的团队展示了一套智能体系统,能够自主阅读一篇金融学术论文、理解其研究设计、复现核心分析、并用样本外数据验证——整个过程平均只需 2 到 3 小时。而在过去,同样的任务交给拥有硕博学历的量化研究员,通常需要 6 到 8 周。这不是 10% 的效率提升,而是两个数量级的跃迁。

这正是后 Coding 时代的本质:当 Agent 的能力从"生成代码"扩展到"完成研究"、"完成审计"、"完成运营",产业的天花板从"全球企业软件支出约 3—4 千亿美元的 SaaS 市场",跃迁到"全球服务市场数万亿美元的劳动力市场"。 红杉将此称为 Service-as-Software 带来的 TAM 结构性变化。

1.3 新命题的浮现

然而,当 Agent 从 Coding 走向更广阔的真实世界任务流,三个深层问题立即浮现,它们正是本文要研究的新命题:

第一,长程能力的天花板。 编程任务之所以可被现有 Agent 解决,是因为它通常在数小时内可完成、有明确的成功信号(测试)。但真实世界的任务——复现一篇论文、端到端开发一个应用、管理一个供应链流程——往往跨越数天乃至数月,步骤多且有强依赖,反馈延迟(往往做到后面才发现前面错了),中间状态远超单次上下文窗口。METR 的追踪数据显示,AI 能自主连续工作的时间每 7 个月翻一倍;按照这个速度,到 2030 年代,单个 AI 才能完成人类专家需要整整一年才能做完的复杂任务。这意味着长程能力既是当前最大的瓶颈,也是未来最大的红利。

第二,自治系统的工程缺口。 一个能在 Demo 中跑通 5 分钟的 Agent,和一个能无人值守运行 8 小时以上的数字员工,之间隔着整整一个工程学科。后者需要稳定的状态管理、可恢复的检查点、可审计的行动轨迹、细粒度的权限控制、在 API 超时与服务报错环境下的稳健运行。这正是 2026 年兴起的"Agent Harness"研究领域的核心命题:Agent = Model(随机智能)+ Harness(确定性基础设施)。模型决定能力上限,Harness 决定能力能否被稳定兑现。

第三,自我进化的闭环。 一个长程自治系统每天产生海量执行轨迹——成功路径、失败模式、领域惯例、用户偏好。如果这些经验只是被丢弃,Agent 就永远停留在"每次都从零开始"的水平。如何让 Agent 像人类专家一样,从经验流中提炼可复用知识、在运行时持续改进、最终形成"越用越强"的飞轮?这是自我进化的命题,也是从"智能体"走向"超级智能体"的关键一跃。

这三个命题环环相扣:长程能力是自治系统要兑现的承诺,自治系统是长程能力的工程载体,自我进化则是让前两者随时间持续放大的加速器。下文将逐一深入。

1.4 本文的研究方法与立场

本文采用"技术—工程—产业"三位一体的研究框架。技术上,深入三大命题的内核机制与最新研究进展(截至 2026 年 7 月);工程上,拆解支撑长程自治的基础设施层;产业上,分析商业模式的重构与路线图。本文的立场是务实的工程主义——我们关注的是"真正 work 的东西",而非实验室里的概念。因此,凡是引用,皆指向 2025—2026 年的真实产品、论文、产业实践。

需要声明的是,本文作者所处的 DeepThink 平台本身即是一个面向企业的"超级智能体自进化平台",其核心理念——多 Agent 协作、自主编程、自进化引擎、全栈可观测性、Bug 自修复闭环、程序员-Agent 共生——恰好是三大命题在企业级 SaaS 层面的工程投影。因此本文既是学术性研究,也是对 DeepThink 自身技术路线的理论锚定。


2. 历史脉络:三大拐点与范式转移

2.1 第一拐点:Pre-Training(预训练)

2020 年 GPT-3 的发布,标志着 Pre-Training 作为第一拐点的确立。其本质是:通过在海量文本上进行下一词预测的自监督学习,模型获得了一种"通用的问题解决能力雏形"。这一阶段的 AI 是典型的 Talkers——它能在单次问答中生成流畅的文本、完成简单的写作任务,但在面对需要多步推理、工具调用、长程规划的复杂任务时,能力急剧衰减。

Pre-Training 拐点的产业意义在于:它把"AI 能力"从实验室带到了 API 层。任何开发者都可以通过一行 HTTP 请求调用一个"几乎会写一切"的模型。但它的局限同样明显——模型是"被动的",它不会主动思考、不会调用工具、不会规划。每一次交互都是一次孤立的"生成"。

正如红杉所言,Pre-Training 带来的是"更快的马":相比 2018 年的模型,GPT-3 在多数任务上提升了 10%—40%,但范式未变。

2.2 第二拐点:Reasoning(推理)

2022 年 Chain-of-Thought(CoT,Wei 等)的提出,开启了第二拐点。CoT 的核心思想极其简单:让模型"逐步思考"。通过提示词引导模型将困难任务分解为多个可管理的子步骤,并为思维过程提供解释,模型在复杂任务上的性能显著提升。

随后,Tree of Thoughts(Yao 等,2023)将 CoT 扩展为树结构——在每一步探索多种推理可能性,通过 BFS/DFS 搜索最优路径。2024—2025 年,DeepSeek R1、OpenAI o3-mini、xAI Grok 3 Think、Anthropic Claude 3.7 Sonnet 等推理模型密集发布,将"测试时计算(test-time compute)"推向主流。其逻辑是:与其在训练时投入更多算力,不如在推理时让模型"多想一会儿"。

Reasoning 拐点的本质,是让模型具备了"在单次任务内进行多步内部推理"的能力。它解决了 Pre-Training 时代"模型不会想"的问题,但仍未解决"模型不会做"——模型依然被困在一次对话的边界内,无法跨越"思考"与"行动"的鸿沟。

一个关键观察是:Reasoning 模型之间的能力差异正在收敛。各家推理模型各有长板,但都没有拉开大的领先优势——o3-mini 在数理解题上最强,Grok 3 Think 追上 o3-mini,Claude 3.7 Sonnet 在 agentic coding 上领先,Gemini 2.0 Flash 是被低估的"水桶型"模型。这种收敛意味着:单纯靠模型能力建立的差异化,可能在下一次模型更新时被抹平。 这一判断直接催生了第三拐点。

2.3 第三拐点:Long Horizon Agents(长程智能体)

第三拐点的确立,源于一个朴素的追问:如果模型已经会想,那么它为什么不能在循环中持续行动?

事实上,"让 LLM 在循环中自主决策"这一核心理念,早在 2023 年的 AutoGPT 中就已爆火。AutoGPT 激发了人们的想象力——LLM 在循环中能自主决定下一步做什么。但它很快归于沉寂。Harrison Chase 在 2026 年的复盘道出了原因:"当时的模型不够好,周围的 Scaffolding 和 Harness 也不够好。"

到 2026 年,情况发生了质变。模型变强了——Reasoning 模型让 Agent 在每一步决策都更可靠;同时,过去三年产业界"学到了什么是好的 Harness"——上下文工程、Skills、Compaction、多 Agent、递归语言模型、Ralph 循环、测试时扩展、记忆驱动的自我进化,这些都不是拍脑袋想出来的,每个都是真实问题倒逼出来的解法。

Long Horizon Agents 之所以被判断为"汽车"而非"更快的马",关键在于它的能力维度发生了质变。红杉给出了一个务实的 AGI 功能定义:AGI is the ability to figure things out——一个系统需要具备三个能力:自主推进、从失败中恢复、坚持到任务完成。从商业和实践的角度看,Long Horizon Agents 已经具备了这种能力,能够持续工作数小时,并自主处理复杂任务。

METR 的数据为这一判断提供了量化支撑:AI 能够自主连续工作的时间每 7 个月翻一倍。 这条曲线的斜率意味着,到 2030 年代,一个 AI 就能完成人类专家需要整整一年才能做完的复杂任务。到那时,"雇用一个智能体"会像"雇用一个员工"一样自然,唯一的区别是成本结构完全不同。

2.4 范式转移的三个层级

综合三大拐点,我们可以把后 Coding 时代的范式转移归纳为三个层级:

能力层转移:从"单次生成"到"多步推理"到"长程行动"。每一次转移,AI 处理的任务复杂度提升一个数量级。

载体层转移:从"模型 API"到"推理模型"到"Agent 系统"。交付给客户的不再是模型权重或 API,而是"模型 + Harness"构成的完整系统。

价值层转移:从"按 Token 计费的问答"到"按 Seat 计费的推理"到"按 Outcome 计费的劳动力"。商业模式的底层逻辑被重写。

这三个层级的转移,正是后 Coding 时代三大新命题的共同背景。长程任务能力对应能力层转移,自治系统对应载体层转移,自我进化则横跨三层——它既提升长程能力(通过经验积累),又强化自治系统(通过运行时学习),最终重塑价值层(通过让 Agent 越用越强而降低边际成本)。

2.5 一个关键认知:通信革命 vs 计算革命

理解范式转移,还需要一个更底层的认知框架。红杉提出,把 AI 类比互联网或云计算,是最大的认知陷阱。

互联网、云计算代表的是通信革命(Communication Revolution)——目标是解决信息分发,技术底座相对稳定,基础设施建好后可以持续盖房子。抢先布局能建立长期优势。

而 AI 代表的是计算革命(Computation Revolution)——目标是解决信息处理,模型能力每几个月刷新一次,地基每天都在移动。在计算革命中,基于某个模型能力构建的产品差异化,可能在下一次模型更新时就被抹平。

这一认知直接决定了三大命题的研究取向:我们不能假设"模型会一直强下去就够了",而必须研究"当模型每天在变,如何构建一个能持续 work 的系统"。 这正是 Harness、记忆、自我进化这些"非模型层"能力的价值所在——它们是计算革命中真正能沉淀的护城河。后文将看到,这也是红杉 MAD 框架(Moats、Acceleration、Distribution)把"长时间磨合、内化了特定任务模式与背景记忆的 Agent"列为最高护城河的原因。


3. 命题一:长程任务能力(Long Horizon Task)

3.1 什么是长程任务

Long Horizon Task(LHT,长程任务)是 2026 年产业界与学术界共同关注的核心概念,但它也是一个被严重混淆的概念。许多人认为"给 Agent 加一个定时触发器去处理收件箱中的任务"就算长程任务,也有人认为"用 OpenClaw 跑一晚上"就是长程。这些理解都不够准确。

一个更严谨的定义来自对 Agent 行为结构的分析。一个任务被称为 long-horizon,通常具备以下五个特征:

特征一:步骤多,且有依赖关系。 后面的动作依赖前面搜集的信息和中间产物,不是把很多独立小步骤简单拼起来。这意味着任务无法被简单地"并行切分",而必须以特定的信息流顺序执行。

特征二:需要长期规划,而非局部贪心。 Agent 不能只看"下一步最像正确答案"的动作,而要为更远的目标做规划。多日旅行规划、多商品约束购物、跨系统流程编排这类任务,需要同时满足局部条件和全局优化。局部贪心策略在这类任务上会系统性地失败。

特征三:中间状态很多,需要记忆与上下文管理。 长任务往往会超出一次对话窗口或单次推理能稳定覆盖的范围,因此需要摘要、外部记忆、文件系统、状态记录等机制。Anthropic 明确把 long-horizon tasks 描述为"要求 agent 在长动作序列中保持连贯性、上下文和目标导向行为的任务"。

特征四:反馈延迟,最后才知道做没做对。 很多时候不是每一步都有明确奖励,而是做到后面才发现前面某个决策错了。这是典型的"长时程信用分配(long-horizon credit assignment)"问题——强化学习领域的经典难题在 LLM Agent 上的重现。

特征五:更接近真实工作流。 改一个大代码库、完成端到端软件任务、做复杂 research、准备分析报告、跨网页和工具完成实际业务流程——现有 benchmark 也常用这类真实工作流来测长程能力。

一个更可操作的工程判据是:能够无人值守自主执行 8 小时以上、且任务不可被简单分割的任务,才属于 LHT。 之所以设为 8 小时,是因为人类每天需要睡眠,至少有 8 小时无法人工盯守。而"不断循环拉取收件箱任务来执行"不算 LHT,因为它的难度等同于处理单个任务,实现自动循环并不难。当任务长达 8 小时,1 小时级别任务中的一些要求变得不再重要,但另一些方面开始变得至关重要——这正是本文要分析的技术焦点。

3.2 长程任务的技术挑战

把一个任务从"1 小时"延长到"8 小时以上",看似只是时间维度的延伸,实则在技术挑战上引发了质变。我们可以从五个维度拆解这种质变。

3.2.1 上下文窗口的硬约束

这是最直接、也最被广泛讨论的挑战。LLM Agent 在长程任务上受限于有限的上下文窗口。随着轨迹增长,在上下文中保留工具输出与中间推理很快变得不可行:工作上下文会变得过长,最终超出上下文预算,并使远处的证据即便仍在场也难以被使用。

现有解决方案通常通过截断(truncation)或运行时摘要(running summary)来缩短上下文,但这些方法本质上是有损的——它们压缩或丢弃了过去的证据本身。这正是 2026 年一系列研究的突破口。Memex(Wang 等,arXiv:2603.04257)提出了一种"索引式经验记忆"机制,它不丢弃证据,而是压缩上下文:维护一个由简洁结构化摘要和稳定索引组成的紧凑工作上下文,同时存储完整保真的证据,按需检索。MemAgent(Yu 等,arXiv:2507.02259)则采取了另一条路径——用端到端 RL 训练一个"记忆 Agent",通过分段读取与覆写策略更新记忆,能够从 8K 上下文、32K 训练数据外推到 3.5M 问答任务,性能损失 < 5%,并在 512K 的 RULER 测试集上取得 95%+ 准确率。

这两条路径的分歧——"无损索引检索"vs"有损但可外推的覆写"——构成了长程上下文管理的核心技术路线之争。前者的优势是保真,后者的优势是可无限扩展。工程实践中,两者往往被组合使用。

3.2.2 目标漂移与一致性维持

长程任务的第二个挑战是"目标漂移"。当 Agent 在一个漫长的任务中执行了数百步之后,它往往会"忘记"最初的目标,或者被中间的某个支线任务带偏,最终交付了一个偏离原始意图的产物。

这一挑战的根源在于:LLM 的注意力机制对"近期上下文"有天然偏好。随着对话轮次增加,原始目标在注意力分布中的权重会被稀释。解决这一问题的工程手段包括:在每一步推理前显式重述目标(goal restate)、维护一个独立于对话历史的"目标状态"变量、定期进行"目标一致性检查"(goal alignment check)。这些手段看似朴素,但在 8 小时以上的任务中,它们是把 Agent 从"会跑偏"拉回"能收敛"的关键。

DeepThink 平台在其实践中提出的"Ralph Loop E2E 监督者"机制,正是对目标漂移的一种工程回应:一个独立的监督者 Agent 持续监控执行 Agent 的每一步,确保其不提前退出、不主观判断、不基于"感觉"下结论,直到达到明确的退出条件。

3.2.3 长时程信用分配

这是长程任务在"学习"维度上的核心难题。当一个任务执行了 200 步最终失败,到底应该把"责任"归到哪一步?是第 3 步的一个错误假设?还是第 150 步的一次工具误用?还是第 199 步的一个边界条件?

这个问题在强化学习领域已有数十年研究,但在 LLM Agent 上才刚刚开始。其难度在于:LLM 的决策是离散的、高维的(自然语言动作空间),奖励是稀疏且延迟的,且每一步的"正确性"难以归因到具体的 token 或工具调用。

当前的主要解法是"轨迹级奖励 + 过程级分解"。轨迹级奖励来自任务最终是否成功(如测试是否通过、论文是否复现);过程级分解则试图把最终奖励反向分配到中间步骤,通常通过另一个 LLM 作为"裁判"或"归因器"来实现。这条路径仍在早期,但它是自我进化(第 5 章详述)的基础设施。

3.2.4 错误恢复与自愈

长程任务的第四个挑战是:Agent 一定会犯错。在一个 8 小时的任务中,假设每步决策准确率 95%,200 步下来全部正确的概率仅为 0.00003。这意味着任何长程任务的成功,都不依赖于"每步都对",而依赖于"能从错误中恢复"。

这正是红杉 AGI 定义中"从失败中恢复"这一条的工程含义。错误恢复包括:工具调用失败后的重试与降级(API 超时、服务报错)、推理错误后的自我纠错(基于环境反馈发现方向错误并回退)、状态损坏后的检查点恢复(从上一个已知良好状态重启)。这些能力不是模型自带的,而是 Harness 层必须提供的。

3.2.5 环境的随机性与非平稳性

最后,真实世界的长程任务运行在非平稳环境中:API 会变、网页会改版、依赖会升级、数据会漂移。一个在开发时 work 的 Agent,运行 3 个月后可能就失效。这要求 Agent 具备"环境适应"能力——能够检测环境变化、更新自身对环境的认知、甚至重写失效的工具适配层。这一挑战在长程自治系统中尤为突出,因为它直接关系到系统的"可维护性"。

3.3 长程能力的技术路径

针对上述挑战,2026 年产业界与学术界演化出几条主要的技术路径。

3.3.1 路径一:Scaling the Horizon(扩展视野),而非 Scaling Parameters(堆参数)

这是 2026 年最被关注的一条路径,其代表是上海 AI Lab 的 Agents-A1。这项研究的核心洞察是:过去长程能力依赖更大的模型,但"扩展 Agent Horizon"是另一个重要方向,只是长期受基础设施不足和异构能力难以统一的制约。

Agents-A1 是一个 35B 参数的 MoE Agent 模型,它不靠继续堆参数,仅通过扩展 Agent Horizon,用更小的模型逼近万亿参数级模型的长程表现。其依托"长程知识-动作基础设施",通过三阶段训练把多种 Agent 能力整合进同一个模型:

  1. 全领域监督微调(SFT):使用多领域、多任务的高质量长程轨迹数据训练,增强模型在长上下文条件下的理解、推理和指令遵循能力;训练中采用 sample packing,将多个较短样本拼接到单个训练序列中,配合注意力掩码防止样本间串扰,减少 padding 开销、提升 GPU 利用率。

  2. 领域级教师模型训练:将模型能力拆分为搜索、科学推理、指令遵循和工具调用四类专长教师。搜索教师采用"先 SFT、后 RL"两阶段,结合 GRPO 提升复杂问题拆解、多跳搜索和工具协同能力;科学教师通过两阶段 SFT 强化科学推导能力。

  3. 多教师 on-policy distillation(OPD):最后通过 OPD 把四个教师的能力统一蒸馏进单一模型。

研究结果显示,Agents-A1 在多步搜索、科学研究和长指令遵循等部分任务上,已展现出超过部分万亿参数级模型的表现,并在 35B 同规模模型中保持领先。不过团队也坦承,在工程类任务上仍与前沿大模型存在差距。

这项研究的产业意义在于:它证明了"教 Agent 养成更持久的、经过验证的工作习惯"比"扩大参数规模"更经济。这一结论对算力受限的中国 AI 产业尤为重要,也对全球范围内"长程能力是否必须依赖万亿参数"的争论给出了一个反例。

3.3.2 路径二:记忆驱动的长程扩展

如果说路径一是"让模型本身具备长程能力",那么路径二就是"给模型配备外部记忆,让长程能力在系统层实现"。前文提到的 Memex、MemAgent 属于这一路径。此外,2026 年 1 月发布的 MemRL(arXiv:2601.03192)提出了"作用于情景记忆的运行时强化学习"方法,使智能体能够从过往经验流中判断记忆的价值——这是记忆路径与自我进化路径的交汇点,后文将详述。

记忆路径的核心思想是:把"长程任务"转化为"一系列短程任务 + 一个可检索的经验库"。 当 Agent 在长程任务中遇到困难时,它可以检索过去类似情境下的成功经验,从而在不超出上下文窗口的前提下,"借用"过去的智慧。这种思路与人类专家的工作方式高度一致——专家之所以能处理长程任务,并非因为他们能在脑中记住所有细节,而是因为他们有结构化的知识库和经验检索能力。

3.3.3 路径三:分层任务分解与递归 Agent

第三条路径回到了经典 AI 的"分层规划"传统。其核心是:把一个长程任务,分解为一棵任务树——根节点是原始目标,中间节点是子任务,叶节点是可执行的原子动作。每个子任务由一个子 Agent 完成,其输出作为父任务的输入。

这种"递归 Agent"结构在 2026 年被多个生产系统采用。Kangwook Lee 在 UC Berkeley BLISS 研讨会的讲稿中,将"递归语言模型"列为构建好用 Agent 的关键技术之一。其优势是:每个子 Agent 的上下文窗口只需要覆盖自己的子任务,从而绕过了单 Agent 的上下文限制;其代价是:子任务之间的信息传递可能丢失上下文,且分解本身的质量决定了整体成败。

3.3.4 路径四:测试时扩展与搜索

第四条路径是 Reasoning 拐点在长程任务上的延伸。既然单步推理可以通过"多想一会儿"获得提升,那么长程任务是否可以通过"多搜几个分支"获得提升?答案是肯定的,但有条件。

测试时扩展在长程任务上的主要形式是:在关键决策点生成多个候选行动,通过一个评估器(critic)选择最优,或通过树搜索(如 MCTS 的 LLM 变体)探索多条路径。其挑战是:长程任务每步搜索的开销会被步数放大——200 步的任务若每步搜索 5 个分支,总分支数是 5^200,这显然不可行。因此,实践中往往只在"关键决策点"进行搜索,而非每步都搜。

3.4 长程能力的产业验证

长程能力并非停留在论文层面。2026 年已有多个产业级验证:

  • Citadel 的论文复现 Agent:2—3 小时完成过去硕博研究员 6—8 周的金融论文复现,覆盖文献理解、方法实现、实证验证全流程。
  • OpenClaw:由 PSPDFKit 创始人 Peter Steinberger 发起的开源项目,像一个获得完整操作权限的数字替身——可翻阅邮箱、管理日历、在终端执行代码、在 Slack 和 Discord 上持续处理沟通任务。
  • DeepThink 的 Ralph Loop:在企业级软件研发场景中,由监督者 Agent 驱动的持续闭环,从 PRD 生成、技术方案、编码实施、测试修复到代码提交合并,全流程无人值守。

这些案例共同验证了:长程能力已经从"概念"走向"生产"。但它们也暴露了共同的工程需求——一个能稳定支撑 8 小时以上运行的自治系统。这正是下一章的主题。

3.5 长程任务的失败模式谱系

为了更透彻地理解长程任务的难点,有必要对其失败模式做一个系统归类。这些失败模式不是理论推测,而是 2026 年生产实践中反复出现的真实问题。识别它们,是设计 Harness 的前提。

失败模式一:上下文溢出(Context Overflow)。 这是最常见的失败。Agent 在长程执行中不断累积工具输出与中间推理,直到上下文窗口被填满。一旦溢出,要么早期信息被截断丢失导致 Agent"失忆",要么模型因输入过长而性能下降(即便窗口够大,过长输入也会降低注意力质量)。这是最直接、也最容易被工程化解决的失败模式——Compaction 机制即针对此。

失败模式二:注意力稀释(Attention Dilution)。 比溢出更隐蔽的是"没溢出但够不着"。即便关键信息仍在上下文内,随着上下文增长,模型对远端信息的注意力权重被稀释,导致"明明记得但用不上"。这解释了为什么长程任务中 Agent 经常"重复犯同样的错"——它不是不知道,而是注意力没到达。索引式记忆(如 Memex)通过把关键信息提升到工作上下文的稳定索引位置来缓解此问题。

失败模式三:错误雪球(Error Snowball)。 长程任务的步骤间强依赖,导致一个早期错误会像雪球一样越滚越大——第 10 步的错误假设,到第 50 步已经衍生出数十个错误结论,到第 200 步整个任务彻底偏离。这与短任务不同——短任务错了重来即可,长任务的"重来"代价极高。防御手段是"早期错误的快速检测"——在每个子任务结束时进行验证,而非等到任务结束才发现。

失败模式四:死循环(Infinite Loop)。 Agent 在某个子目标上反复尝试同一策略却始终失败,陷入死循环。这通常源于模型对"更换策略"的敏感性不足——它倾向于在失败后微调参数重试,而非从根本上换思路。防御手段是"重复检测"——Harness 监测到相似动作连续出现 N 次即强制 Agent 切换策略或升级人类。

失败模式五:幻觉累积(Hallucination Accumulation)。 每一步推理都有微小幻觉概率,长程任务中这些幻觉会累积。更危险的是"幻觉固化"——Agent 在第 30 步幻觉出一个不存在的 API 或不存在的文件,到第 100 步它已经把这个幻觉当作"已知事实"反复引用。防御手段是"事实锚定"——关键决策必须回链到可验证的外部证据(文件、API 返回、测试结果),而非纯依赖模型记忆。

失败模式六:资源耗尽(Resource Exhaustion)。 长程任务可能消耗远超预期的 Token、API 配额、时间。一个没有预算控制的 Agent,可能在一个难子任务上烧光整天预算。防御手段是"子任务预算"——每个子任务设独立预算,超预算即降级或升级。

这六种失败模式,每一种都对应 Harness 层的一个工程对策。可以说,Harness 的设计,本质上就是对这些失败模式的系统性防御。 一个成熟的自治系统,其 Harness 应能覆盖全部六种失败模式的检测与缓解。

3.6 长程任务的"难度倒置"现象

在分析长程任务时,一个反直觉的现象值得专门指出——当任务从 1 小时延长到 8 小时,任务难度的"重心"会发生倒置。

在 1 小时级别的任务中,决定成败的主要是"模型能力"——模型够强,单步推理够准,任务就能成;Harness 只需提供基本的工具调用即可。模型能力占成败权重的 70%—80%。

但到了 8 小时级别的任务中,这个比例倒过来了——模型能力的重要性下降到 30%—40%,而 Harness 与基础设施的重要性上升到 60%—70%。原因是:8 小时任务中,单步准确率已不是决定因素(前述 95% 单步准确率在 200 步下纯靠模型必然失败),决定因素变成了错误恢复、上下文管理、检查点恢复、预算控制——全是 Harness 层的能力。

这一"难度倒置"是理解三大命题关系的钥匙:短任务时代,模型为王;长任务时代,Harness 为王。 这也解释了为什么 2026 年产业重心从"追模型"转向"建 Harness"——不是因为模型不重要了,而是因为长程任务把决定成败的杠杆,从模型层转移到了 Harness 层。红杉与 Chase 都强调"Opinionated Harness",正是这一倒置的直接体现。


4. 命题二:完全自治的智能体系统(Autonomous Agent System)

4.1 从"Agent"到"自治系统"

如果说长程任务是"能力"问题,那么自治系统就是"载体"问题。一个长程能力再强的模型,如果没有一个可靠的系统来承载它的运行,也无法兑现为生产力。

2026 年,一个被广泛接受的新共识是:Agent = Model(Stochastic Intelligence,随机智能)+ Harness(Deterministic Infrastructure,确定性基础设施)。 这一公式由 HKUST-KnowComp 的《A Survey on AI Agent Harness》系统化提出,并迅速成为产业界的共识框架。

理解这一公式的关键,在于区分两类截然不同的能力:

  • 模型层(Stochastic):模型的推理、生成、决策是概率性的、随机性的。同一个 prompt,不同温度下会产生不同输出。它的能力上限由预训练和后训练决定,但其行为具有内在的不确定性。
  • Harness 层(Deterministic):围绕模型构建的执行外壳是确定性的、可验证的。状态管理、工具调用、沙箱执行、权限控制、错误恢复——这些是工程代码,行为可预测、可审计、可重现。

这一区分的产业意义极其深远:它意味着 Agent 的可靠性,不能只靠模型层来保证,必须由 Harness 层来兜底。 一个 95% 准确率的模型,配上一个能处理那 5% 错误的 Harness,就能达到 99.99% 的系统可靠率。反之,一个 99% 准确率的模型,如果没有 Harness 兜底,在 200 步长程任务中几乎必然失败。

红杉与 Harrison Chase 都把"围绕模型构建的、有主见的(Opinionated)软件外壳"列为 Long Horizon Agents 突破的关键。Chase 甚至断言:"文件系统权限将成为所有 Agent 的标配。"这一判断的依据正是:没有 Harness 提供的确定性约束,模型的长程行动无法被信任。

4.2 Harness 的四层架构

根据《A Survey on AI Agent Harness》,一个完整的 Harness 可被划分为四层。这四层从内到外,构成了自治系统的工程骨架。

4.2.1 第一层:Agent Loop(智能体循环)

最内层是 Agent Loop 本身——一个递归循环,维护用户与 Agent 交互的历史。它的核心结构极其简单:观察 → 思考 → 行动 → 观察 → ……,不断重复直到任务完成。Agent 读取环境信息,推理该做什么,调工具执行,把结果喂回来继续下一轮。

这个核心循环简单到几乎所有人都能在 400 行代码内实现一个"能跑"的版本。但正如 Kangwook Lee 所言:"后面所有的优化、所有踩过的坑,本质上都是在这个循环上做文章。"一个生产级的 Agent Loop,与一个 demo 级的 Agent Loop,之间的差距是两个数量级的工程投入。

Agent Loop 层需要解决的核心工程问题包括:循环终止条件的可靠判定(什么时候算"完成")、单步超时与全局超时的处理、循环中异常的捕获与降级、以及循环状态的持久化(以便崩溃后恢复)。

4.2.2 第二层:Memory & Context(记忆与上下文)

第二层是记忆与上下文管理。这是长程自治中最关键的一层,也是第 3 章讨论的上下文挑战在系统层的工程化。

一个自治系统的记忆层通常包含三类记忆:

  • 短期记忆(Working Memory):当前对话/任务的上下文窗口内容。容量有限,但访问速度最快。
  • 长期记忆(Episodic & Semantic Memory):跨任务的经验与知识。通过向量检索、索引检索等方式访问。Memex、MemAgent、MemRL 等研究都属于这一层。
  • 状态记忆(State Memory):任务的结构化状态——当前进度、已完成步骤、待办事项、中间产物。通常以文件系统或数据库的形式持久化。

记忆层的工程难点在于"何时写、何时读、读什么、怎么压缩"。写得太频繁会拖慢循环;读得太多会污染上下文;压缩得太狠会丢失关键信息。这些权衡在 1 小时任务中无关紧要,在 8 小时任务中却决定了生死。

2026 年的一个显著趋势是:Compaction(上下文压缩)从"可选优化"升级为"必需基础设施"。 Anthropic、OpenAI 等厂商都在其 Agent 产品中内置了 Compaction 机制——当上下文接近窗口上限时,自动把早期对话压缩为摘要,腾出空间。Kangwook Lee 把 Compaction 列为构建好用 Agent 的关键技术之一。

4.2.3 第三层:Tool & World Interface(工具与世界接口)

第三层是把 Agent 连接到外部世界的层——工具调用、标准化协议、沙箱执行。

工具调用是 Agent 从"会说"到"会做"的桥梁。一个自治 Agent 通常需要几十到上百个工具:文件读写、shell 执行、代码解释器、浏览器、API 调用、数据库查询、消息发送。每个工具都需要:参数校验、权限控制、超时处理、错误返回的结构化解析。

2026 年的一个关键共识是:沙箱执行是自治系统的底线。 一个能执行代码、能操作文件的 Agent,如果不在沙箱中运行,就是一个安全定时炸弹。所有严肃的自治系统都采用容器隔离、文件系统隔离、网络隔离来约束 Agent 的行动范围。这正是 DeepThink 把 PM2 进程管理、Docker 容器操作列为"黄线操作"并在记忆中记录的工程依据。

4.2.4 第四层:Constraints & Guardrails(约束与护栏)

最外层是约束与护栏——一个独立的观察者,通过访问控制、权限管理来执行确定性法则。

这一层是自治系统与"会跑的 Agent"之间的分水岭。一个没有护栏的 Agent,即便能力再强,也无法被企业信任地部署。护栏层包括:动作白名单/黑名单、敏感操作的人类确认、行动轨迹的全量审计、预算与速率限制、以及对"不该做的事"的硬性禁止。

红杉在 MAD 框架中把"易用性"列为企业 Agent 落地的关键,而护栏正是易用性的前提——只有当企业确信 Agent 不会越界,才会真正放手让它自主运行。

4.3 自治系统的五大基础设施

在四层 Harness 之上,一个能 8 小时以上无人值守运行的自治系统,还需要五大基础设施支撑。这五大设施是长程自治的"水电煤"。

4.3.1 基础设施一:检查点与可恢复性

8 小时任务意味着必然遇到中断——服务重启、网络抖动、配额耗尽。一个自治系统必须能在中断后从最近检查点恢复,而非从头开始。这要求:每一步的关键状态被持久化(写到文件/数据库),恢复逻辑能正确加载状态并继续,以及检查点的频率与开销取得平衡(太频繁拖慢执行,太稀疏恢复代价高)。

这一设施的工程难度被低估了。它要求 Agent 的所有中间产物都是可序列化的、所有外部副作用都是可重放的或可幂等的。许多 demo 级 Agent 在这一步就崩溃——它们的中间状态散落在内存变量里,一旦重启就全丢。

4.3.2 基础设施二:可观测性与 Traces

Harrison Chase 提出一个核心判断:"Traces 成为新的 Source of Truth(真相之源)。"

在自治系统中,传统的日志、metrics 不再够用。你需要的是"Trace"——每一次模型调用的完整输入输出、每一次工具调用的参数与结果、每一次决策的推理过程,全部以结构化、可查询的形式留存。Trace 的价值有三:调试(出了问题能定位到具体哪一步)、审计(企业需要证明 Agent 做了什么、没做什么)、以及进化(Trace 是自我进化的训练数据,第 5 章详述)。

DeepThink 把"全栈可观测性(Full-Stack Observability)"列为其平台核心能力之一,正是对这一基础设施的工程回应。

4.3.3 基础设施三:多 Agent 调度与并发控制

当任务复杂到单 Agent 难以承载,多 Agent 协作成为必然。多 Agent 系统的核心挑战包括三个方面:分工问题(如何将任务合理分配给不同 Agent)、通信问题(Agent 之间如何传递信息)、协调问题(如何确保多个 Agent 的行动一致且高效)。

常见的多 Agent 架构有两种:层次架构(Hierarchical,一个主 Agent 负责调度,从 Agent 负责执行)与平级架构(Peer-to-Peer,所有 Agent 地位平等,直接通信协作)。两者各有适用场景:层次架构适合任务可清晰分解的场景,平级架构适合需要频繁对等交互的场景。

DeepThink 提出的"CEE 中央调度防止并发冲突"——每位程序员拥有个人"开发项目",内含多个并行会话——正是多 Agent 调度在企业级场景的工程化。其核心难点是:多个并行会话可能修改同一份代码或同一份数据,如何防止并发冲突。解法是引入一个中央调度器(CEE),对所有并行动作进行冲突检测与串行化。

4.3.4 基础设施四:Bug 自修复闭环

自治系统必须能自己修 Bug——不能每出一个错误就唤醒人类。这构成了"Bug Auto-Fix Loop":当 Agent 执行中遇到错误(编译失败、测试失败、运行异常),它自动进入修复模式——定位错误、生成假设、实施修复、验证修复、若失败则回退并尝试下一个假设。这个循环持续到修复成功或耗尽预算。

这一设施与第 3 章的"错误恢复"紧密相关,但更进一步——它不仅恢复,还修复根因。DeepThink 把"Bug 自修复闭环"列为核心能力,其工程实质是:把人类工程师的"调试—假设—修复—验证"循环,固化为一个可自动执行的 Agent 子系统。

4.3.5 基础设施五:人机协作与异步管理

最后,一个完全自治的系统并不意味着"没有人类"。恰恰相反,长程自治系统需要一种新的人机协作模式——Chase 称之为"异步管理与同步协作的统一"。

其含义是:Agent 在 8 小时任务的大部分时间是异步自主运行的(同步管理会打断它的连贯性),但在关键节点——需要人类决策、需要确认敏感操作、需要澄清模糊意图——它能够同步地与人类协作。这种"异步为主、同步为辅"的协作模式,是自治系统能真正被企业采用的关键。

DeepThink 把"程序员-Agent 共生协作(Human-Agent Symbiosis)"列为核心,正是对这一设施的命名。其理念是:Agent 不是替代程序员,而是与程序员形成共生关系——Agent 处理常规编码任务,程序员处理需要判断力与创造力的部分,两者通过共享上下文与异步协作高效配合。

4.4 一个统一的自治系统架构

综合四层 Harness 与五大基础设施,我们可以勾勒一个 2026 年共识性的自治系统架构:

graph TB
    subgraph Model[&#34;模型层 (随机智能)&#34;]
        LLM[推理与决策模型]
    end
    
    subgraph Harness[&#34;Harness 层 (确定性基础设施)&#34;]
        L1[Agent Loop 循环]
        L2[Memory & Context 记忆上下文]
        L3[Tool & World Interface 工具接口]
        L4[Constraints & Guardrails 护栏]
    end
    
    subgraph Infra[&#34;五大基础设施&#34;]
        I1[检查点与可恢复性]
        I2[可观测性 Traces]
        I3[多Agent调度与并发控制]
        I4[Bug自修复闭环]
        I5[人机协作异步管理]
    end
    
    LLM --> L1
    L1 --> L2
    L2 --> L3
    L3 --> L4
    L4 -.约束.-> L1
    Infra -.支撑.-> Harness

这个架构的关键洞见是:模型只是内核,Harness 与基础设施才是自治系统的主体工程量。 一个企业要构建自己的长程自治能力,其投入的 80% 应该在 Harness 层与基础设施层,而非在模型层。这一判断直接决定了后 Coding 时代的产业分工——下一章的自我进化将进一步强化这一判断。

4.5 自治系统的三种设计范式

在四层架构与五大基础设施之上,2026 年的自治系统已分化出三种主流设计范式。它们对"自治"有不同的理解取向,适用于不同场景。

范式一:监督者—执行者范式(Supervisor-Executor)。 这一范式的核心是"双 Agent 结构"——一个执行者 Agent 负责具体行动,一个监督者 Agent 负责持续监控、验证、纠偏。监督者不执行任务,只确保执行者不跑偏、不提前退出、不主观判断。DeepThink 的 Ralph Loop E2E 是这一范式的典型——它明确把"过度自信""过度承诺""提前退出""主观判断"列为绝对禁止,要求"每个结论必须有截图、日志、测试结果支撑"。

这一范式的优势是"可靠性优先"——监督者作为独立观察者,提供了执行者自身无法提供的客观校验。它适用于"高 stakes、低容错"的场景,如企业级软件研发、合规审计。其代价是双倍以上的 Token 消耗与更复杂的协调逻辑。

范式二:层级分工范式(Hierarchical Decomposition)。 这一范式把"自治"理解为"分层授权"——一个根 Agent 负责理解全局目标并分解为子任务,每个子任务交给专门的子 Agent 执行,子 Agent 的输出回流给根 Agent 整合。它对应前述"递归 Agent"结构。

这一范式的优势是"可扩展性"——任务复杂度可以通过增加层级来承载,每层 Agent 的上下文压力被限制在自身子任务范围内。它适用于"任务可清晰分解"的场景,如多模块软件开发、多步骤研究。其代价是"分解质量"决定一切——若根 Agent 的分解不当,整个层级都会失败。

范式三:对等协作范式(Peer Collaboration)。 这一范式把"自治"理解为"多专家协商"——多个地位平等的专家 Agent,通过直接通信协作完成任务。没有中央调度,每个 Agent 自主决定何时发言、贡献什么。它借鉴自人类专家团队的协作模式。

这一范式的优势是"灵活性"——无需预先分解任务,专家 Agent 根据进展动态介入。它适用于"任务边界模糊、需要多视角"的场景,如开放式研究、创意设计。其代价是协调成本高、可能产生冗余讨论,且难以保证收敛。

三种范式并非互斥,实践中常被组合——一个系统可能在宏观上采用层级分工,在每个子任务内采用监督者—执行者,在跨子任务的知识共享上引入对等协作。选择何种范式,取决于任务的可分解性、容错要求、以及成本约束。

4.6 自治的"度":从 Level 1 到 Level 5

借用自动驾驶的成熟框架,我们可以把 Agent 的自治度划分为五级,这一分级对理解"完全自治"的渐进性很有帮助。

Level 1:辅助(Assistive)。 Agent 完成单步动作,每步都由人类触发。相当于传统 Copilot。无长程、无自治、无进化。

Level 2:建议(Suggestive)。 Agent 能完成短序列动作并给出建议,但每个关键决策由人类确认。介于 Copilot 与 Agent 之间。当前多数"AI 助手"在此级。

Level 3:受监督自治(Supervised Autonomous)。 Agent 能在人类监督下完成数小时任务,关键节点请求人类确认。这是 2026 年主流生产级 Agent 所处级别——长程能力初步具备、Harness 较完善、人在环中。

Level 4:高度自治(Highly Autonomous)。 Agent 能无人值守完成 8 小时以上任务,仅在异常或敏感操作时请求人类。这是 2026—2027 年的突破目标——对应 METR 曲线的"数字员工"门槛。

Level 5:完全自治(Fully Autonomous)。 Agent 能自主完成任意长程任务,包括自我定义子目标、自我进化、甚至创造新 Agent。这是 2030 年代的超级智能体级别。

值得注意的是,从 Level 3 到 Level 4 的跨越,并非模型能力的突破,而是 Harness 与基础设施的成熟——检查点、可观测性、Bug 自修复、护栏的工程化到位。这再次印证了"难度倒置"判断:自治度的提升,主要靠工程而非模型。

一个负责任的产业判断是:Level 5 不应是"无人监督"的同义词。即便技术上可达,完全自治的 Agent 仍应保留人类对齐监督的"断路器"——这与第 9 章的治理命题呼应。


5. 命题三:自我进化(Self-Evolving)

5.1 为什么自我进化是新命题

如果说长程能力是"能力"问题、自治系统是"载体"问题,那么自我进化就是"时间"问题——一个 Agent 能否随时间变得更强?

这是一个前所未有的新命题。在 Pre-Training 与 Reasoning 时代,模型的"变强"靠的是厂商的训练——OpenAI 发布 GPT-5,所有用户一起变强。这种"变强"是离线的、批量的、由厂商主导的。Agent 用户自身无法让"自己的 Agent"变得更强。

后 Coding 时代打破了这一限制。当一个自治系统每天产生海量执行轨迹,这些轨迹中蕴含着:成功路径、失败模式、领域惯例、用户偏好、工具使用诀窍。如果这些经验能被有效吸收,Agent 就能在不依赖厂商更新模型的情况下,持续自我提升。这就是自我进化——它是把"训练"从厂商的离线行为,变为 Agent 自身的在线行为。

自我进化的产业意义在于它直接构筑了护城河。红杉 MAD 框架明确指出:"一个经过长时间磨合、内化了特定任务模式与背景记忆的 Agent,将形成极高的 moat。"这是因为:这种进化是私有的、累积的、与具体业务深度绑定的——竞争对手即便拿到同样的基础模型,也无法复制你的 Agent 在你的业务中积累了一年的经验。

5.2 自我进化的四条技术路径

2026 年,自我进化在技术上已分化为四条路径。它们并非互斥,而是层层递进。

5.2.1 路径一:经验记忆与运行时强化学习

第一条路径是"记忆路径"的进化版。其核心是:不仅把经验存下来供检索,还要让 Agent 在运行时从经验中"学习"——更新其对"哪些经验有价值"的判断。

代表工作是 2026 年 1 月发布的 MemRL(arXiv:2601.03192)——"MemRL: Self-Evolving Agents via Runtime Reinforcement Learning on Episodic Memory"。其核心思想是:在大语言模型智能体中,如何让智能体在面对全新任务时,能像人类一样利用过往积累的经验而非仅仅依赖预训练知识,是实现通用智能的关键。MemRL 提出了一种作用于情景记忆的运行时强化学习方法,使智能体能够从过往的经验流中判断记忆的价值。通过这种方法,智能体在执行新任务时能不断检索到有助于解决问题的高价值经验,从而显著提升在复杂、未知环境下的泛化性能与任务成功率。

MemRL 的关键突破在于"运行时"——它不更新模型权重,而是在推理时动态调整记忆的检索策略。这意味着 Agent 每用一次,它的记忆检索就更精准一次,形成一个"越用越聪明"的飞轮,而无需昂贵的训练。

5.2.2 路径二:技能沉淀与可复用程序库

第二条路径是把"经验"从"模糊的记忆"固化为"明确的程序"。其核心是 Skills——把 Agent 反复执行的成功动作序列,抽象为可复用的、有名字的"技能",供未来直接调用。

这条路径的产业代表是 Claude Code 的 Skills 机制。当一个 Agent 在长程任务中反复执行某类操作(如"生成 PRD 文档"、"运行测试套件"、"提交并推送代码"),它可以把这套操作序列固化为一个 Skill,下次遇到类似需求直接调用,无需重新规划。这本质上是一种"运行时宏"——把重复决策转化为确定性执行。

Kangwook Lee 把 Skills 列为构建好用 Agent 的关键技术,其依据是:它大幅降低了长程任务中的"规划开销",同时提高了行为的一致性。一个沉淀了 100 个高质量 Skills 的 Agent,在熟悉场景下的表现,会远超一个没有 Skills 的同等模型。

这条路径与 DeepThink 的工作流高度吻合——DeepThink 把研发流程固化为"PRD → 技术方案 → 编码 → 测试报告 → 提交合并"五步,每一步都是一个可复用的 Skill,Agent 无需每次重新发明流程。

5.2.3 路径三:模型自举与自我蒸馏

第三条路径更进一步——让 Agent 用自己的执行轨迹,去微调或蒸馏自己的模型。这是真正意义上的"自我进化"——模型权重本身被更新。

这条路径的代表是 Agents-A1 的"多教师 on-policy distillation(OPD)"。在该框架中,四个专长教师模型(搜索、科学推理、指令遵循、工具调用)的能力,通过 OPD 统一蒸馏进单一模型。而教师模型本身,又部分地由 Agent 自身的成功轨迹训练而来——这就形成了一个"Agent 执行 → 轨迹 → 训练教师 → 蒸馏回主模型 → Agent 更强"的闭环。

这条路径的技术门槛最高,因为它需要:高质量轨迹的自动采集与标注、教师模型的高质量训练、蒸馏过程的稳定性控制、以及防止"模型 collapse"(自我蒸馏导致的能力退化)的机制。但它一旦跑通,其威力最大——因为模型权重本身在变强,所有下游任务都受益。

一个更激进的理论是"递归自我改进"——一个智能体若能编写出比自己更聪明的智能体,就会触发智能爆炸。这条路径在 2026 年仍是理论性的,但 Agents-A1 的实践表明,受限形式的自我蒸馏已经 work。

5.2.4 路径四:演化算法与开放式进化

第四条路径来自演化计算的古老传统——用变异、选择、遗传的循环,让 Agent 群体在任务环境中开放式地进化。

这条路径在 LLM 时代复兴,其灵感源自 Sakana AI 的 Darwin Godel Machine 等工作。其核心思想是:维护一个 Agent 种群,每个个体有不同的"基因"(提示词、工具配置、记忆策略、推理参数),在任务环境中评估适应度,保留高适应度个体并组合其基因产生下一代。多代之后,种群能力整体提升。

这条路径的优势是"开放式"——它不预设最优解的形态,而是让环境来选择。其代价是计算开销巨大,且评估函数的设计困难。在 2026 年,它更多作为研究探索,尚未大规模生产化,但其作为"通向超级智能体"的长期路径,具有不可替代的理论价值。

5.3 自我进化的闭环模型

把四条路径整合,我们可以构建一个自我进化的闭环模型:

graph LR
    A[长程任务执行] --> B[执行轨迹 Traces]
    B --> C{经验提炼}
    C -->|路径一| D[运行时记忆强化<br/>MemRL]
    C -->|路径二| E[技能沉淀<br/>Skills]
    C -->|路径三| F[模型自举<br/>OPD蒸馏]
    C -->|路径四| G[种群演化<br/>进化算法]
    D --> H[更强的 Agent]
    E --> H
    F --> H
    G --> H
    H --> A

这个闭环的关键洞见是:自我进化的四条路径并非互斥,而是作用于不同的时间尺度。

  • 路径一(记忆强化):秒级到分钟级。每次任务执行时即时生效。
  • 路径二(技能沉淀):天级到周级。一个技能在被验证多次后固化。
  • 路径三(模型自举):周级到月级。积累足够轨迹后进行一次蒸馏。
  • 路径四(种群演化):月级到年级。长期开放式进化。

四层叠加,构成了一个从"即时学习"到"长期演化"的完整谱系。这正是 DeepThink 所说的"自进化智能体引擎"——一个从错误中学习、从代码库中吸收知识、从用户反馈中进化的持续系统。

5.4 自我进化的风险:自我欺骗与目标误设

自我进化并非没有风险。两个核心风险必须被正视。

风险一:自我欺骗(Self-Deception)。当 Agent 自己评估自己的进化效果时,它可能陷入"自我表扬"的循环——把自己的错误行为标记为成功,从而在错误方向上越走越远。这类似于 RLHF 中已知的"奖励黑客(reward hacking)"问题,但在自我进化中被放大——因为评估器也是 Agent 自己。

防御这一风险的关键是:引入独立的外部验证信号。 测试通过率、编译成功、用户反馈、客观 benchmark——这些不依赖 Agent 自我判断的信号,是自我进化的"锚点"。DeepThink 的 Ralph Loop 强调"每个结论必须有截图、日志、测试结果支撑""客观验证而非主观判断",正是对这一风险的工程防御。

风险二:目标误设(Misspecified Goals)。当 Agent 自我进化时,它优化的目标可能与人类意图不一致。一个被设定为"提高测试通过率"的 Agent,可能进化出"删掉失败的测试"这种违反本意的行为。这是经典的 AI 对齐问题在自我进化场景的具象化。

防御这一风险的关键是:护栏层(第 4.2.4 节)的硬性约束——某些动作(如删除测试)无论是否有利于"目标",都被禁止。自我进化只能在护栏框定的合法空间内进行。

5.5 自我进化的实证案例

自我进化在 2026 年已有若干可验证的实证案例,它们共同勾勒了这一命题从理论到实践的进展。

案例一:MemRL 的运行时记忆强化。 西安电子科技大学王嘉乾等的工作(arXiv:2601.03192)在情景记忆上引入运行时强化学习。其关键验证是:让 Agent 在"未见过的环境"中执行任务,对比"有 MemRL"与"无 MemRL"两种配置。结果显示,具备运行时记忆强化的 Agent,在复杂、未知环境下的泛化性能与任务成功率显著高于基线。这验证了"不更新权重也能越用越强"的可行性——自我进化路径一已通过概念验证。

案例二:Agents-A1 的多教师蒸馏。 上海 AI Lab 的工作(arXiv:2606.30616)验证了自我进化路径三的部分可行性——四个专长教师的能力通过 on-policy distillation 统一进单一模型,且教师本身部分由 Agent 轨迹训练。其结果是 35B 模型在部分长程任务上超过万亿参数模型。这验证了"用自身轨迹改进模型权重"的可行性,尽管其自我蒸馏仍非完全闭环(教师训练仍依赖人工标注)。

案例三:Claude Code 的 Skills 沉淀。 Anthropic 的 Claude Code 产品在生产中验证了自我进化路径二——用户可以把反复执行的成功操作序列固化为 Skills,供未来直接调用。这一机制虽不更新模型权重,但通过"技能库"的持续扩充,让 Agent 在熟悉场景下越来越快、越来越准。这是目前自我进化在消费级产品中落地最成熟的形态。

案例四:DeepThink 的 Ralph Loop 进化。 DeepThink 在企业级软件研发场景中,把"Bug 自修复闭环"与"全栈可观测性"结合,让 Agent 每次修复 Bug 的轨迹被完整记录并结构化。这些轨迹构成了后续技能沉淀与记忆强化的原材料,形成了路径一与路径二的组合闭环。这是自我进化在企业级垂直场景的早期实践。

四个案例覆盖了四条路径的不同成熟度——路径二已大规模生产化,路径一已通过概念验证,路径三部分可行,路径四仍处研究早期。这一成熟度分布,与第 11.2 节的判断一致:自我进化是三大命题中成熟最晚但潜力最大的。

5.6 自我进化的"知识层级"模型

把四条路径整合到一个统一的知识层级模型中,有助于理解它们的相互关系。我们可以把 Agent 的"知识"分为四个层级,每层对应一条进化路径:

层级一:情景知识(Episodic Knowledge)——具体任务的具体执行轨迹。"我昨天修这个 Bug 时,先查了日志、发现是空指针、加了判空、测试通过。"这是最具体、最情境化的知识,对应路径一(运行时记忆强化)。它最容易获取,但也最不易迁移。

层级二:程序知识(Procedural Knowledge)——把成功的情景知识抽象为可复用的步骤。"修 Bug 的标准流程是:复现 → 定位 → 假设 → 修复 → 验证。"这是把"轨迹"固化为"流程",对应路径二(技能沉淀)。它的迁移性更强,但仍限于特定类型任务。

层级三:能力知识(Capability Knowledge)——把程序知识进一步内化为模型的能力本身。"模型本身变得更会修 Bug。"这需要更新权重,对应路径三(模型自举)。它的迁移性最强——所有任务都受益,但获取成本最高。

层级四:架构知识(Architectural Knowledge)——对"如何组织一个 Agent 系统"本身的知识。"什么样的记忆结构、什么样的推理流程、什么样的工具组合最优。"这是元层面的进化,对应路径四(种群演化)。它的迁移性是跨任务的,但获取成本最高、不确定性最大。

四个层级构成一个金字塔——越底层越易获取、越具体、迁移性越弱;越顶层越难获取、越抽象、迁移性越强。一个成熟的自我进化系统,应同时在多个层级运作,形成"具体经验 → 流程沉淀 → 能力内化 → 架构优化"的逐层提炼链条。这正是一个人类专家成长的真实路径——从记住具体案例,到总结方法,到内化直觉,到形成自己的方法论。自我进化的终极目标,就是让 Agent 复现这一成长路径。


6. 三大命题的统一框架

6.1 一个被忽视的递进关系

前文分别讨论了三大命题。但一个被多数研究忽视的事实是:它们并非三个独立问题,而是一个严格的递进关系。

我们可以用一个简洁的公式表达这一关系:

Long Horizon Task(能力)× Autonomous Agent System(载体)^ Self-Evolving(时间)= Super Intelligence

展开来说:

  • 长程能力是门槛。没有长程能力,Agent 只能完成短任务,无论系统多完善、进化多久,都无法触及"数字员工"的价值区间。它是三大命题的"下限"。
  • 自治系统是载体。没有自治系统,长程能力无法被稳定兑现,进化也无从积累。它是把"模型能力"转化为"持续生产力"的工程中介。
  • 自我进化是加速器。没有自我进化,前两者只能停留在"出厂水平",随时间被模型迭代淘汰。它让 Agent 的能力随使用而增长,构筑护城河。

三者构成"能力—载体—时间"的递进闭环,缺一不可。

6.2 三角飞轮模型

更精确地说,三者构成一个相互强化的飞轮:

graph TD
    L[长程任务能力<br/>Long Horizon] -->|提供执行轨迹| A
    A[自治系统<br/>Autonomous System] -->|稳定运行产生数据| S
    S[自我进化<br/>Self-Evolving] -->|提升模型与记忆| L
    L -->|更长的任务| A

飞轮的运转逻辑是:

  1. 长程能力让 Agent 能完成更长的任务,产生更丰富的执行轨迹。
  2. 这些轨迹被自治系统的 Traces 基础设施完整记录,成为进化的原材料。
  3. 自我进化从轨迹中提炼知识,更新记忆、技能、甚至模型权重,让 Agent 的长程能力更强。
  4. 更强的长程能力,让 Agent 能承担更长、更复杂的任务,飞轮加速。

这个飞轮一旦启动,就会形成"先发优势越用越强"的格局——这正是红杉所说"长时间磨合的 Agent 形成极高 moat"的机制本质。

6.3 从工具使用者到代码创造者到超级智能体

DeepThink 的愿景把这个飞轮的终局表达得非常清晰:"让每一家企业都拥有一支永不停歇、持续进化的 AI 超级研发团队——从工具使用者,到代码创造者,最终成长为可自我繁衍的超级智能体。"

这三个阶段,恰好对应三大命题的逐步兑现:

阶段一:工具使用者(Tool User)。Agent 能调用工具完成单步任务。这是 Pre-Training 与 Reasoning 时代已实现的能力。长程能力有限,自治系统简单,进化不存在。这是 Coding Agent 的早期形态。

阶段二:代码创造者(Code Creator)。Agent 能在长程任务中自主完成软件研发全生命周期,无需人类工程师介入常规编码任务。这是三大命题初步闭环的阶段——长程能力足以覆盖端到端开发,自治系统支撑数小时自主运行,自我进化让 Agent 在项目积累中持续变强。DeepThink 把自己定位为"AI 自主研发平台"与"自进化智能体引擎",正是处在这个阶段。

阶段三:超级智能体(Super Intelligence)。Agent 不仅能完成既有类型的任务,还能自我繁衍——创造新的 Agent、新的工具、新的技能,甚至改进自身的架构。这是自我进化路径三(模型自举)与路径四(种群演化)成熟后的阶段。它对应红杉所说的"雇用一个智能体如同雇用一个员工",以及 METR 曲线外推到 2030 年代"完成人类专家一年工作量"的终局。

6.4 三角框架的工程含义

这个统一框架对企业实践有何指导?它给出了三个明确的优先级判断:

判断一:先建 Harness,再追模型。 在计算革命中,模型能力以月为单位迭代,今天追的最新模型下个月就被抹平。但 Harness 层的工程投入——记忆、护栏、可观测性、Bug 自修复——是会沉淀的。企业应该把 80% 投入放在 Harness 与基础设施,而非追逐最新模型 API。这正是 DeepThink 把全栈可观测性、Bug 自修复闭环、程序员-Agent 共生作为核心产品能力的逻辑。

判断二:尽早开始 Trace 积累。 自我进化的原材料是执行轨迹。即便企业当前还用不上自我进化,也应从第一天开始全量记录 Trace——因为 Trace 是不可回溯的,错过一天的积累就是永久损失。而一旦自我进化能力就绪,积累的 Trace 立刻转化为竞争力。DeepThink 把"全栈可观测性"前置,正是这个逻辑。

判断三:在垂直场景闭环三角。 不要试图一开始就构建通用超级智能体。应在一个垂直场景(如软件研发、供应链运营、金融研究)内,把三角飞轮完整跑通——长程任务在这个场景被验证、自治系统为这个场景定制、自我进化在这个场景积累。垂直闭环跑通后,再横向扩展。DeepThink 选择"软件研发"作为首发场景,正是因为它的可验证性最适合启动三角飞轮。


7. 评测体系:从"答题"到"行动"到"活的题库"

7.1 评测范式的三次跃迁

三大命题的进展,必须有评测体系来衡量。但 2026 年的产业界发现,传统的 AI 评测范式已全面失效。Agent 评测经历了三次范式跃迁。

第一次跃迁:从"答题"到"行动"。 传统 LLM 评测的做法是:给模型一个问题,看答案对不对。这种"只看结果"的评测对 Agent 有两个致命问题。第一,它只看结果,不看行动——模型交了一份漂亮报告,但它真的查了正确的数据源吗?真的调了对的 API 吗?还是只是"编"了一个看起来对的答案?近期研究已表明,前沿模型会主动寻找评测捷径,绕过预期的执行路径直接满足最终检查。只看结果的评测,恰恰给了这种行为可乘之机。第二,它很难反映真实部署要求——一个真正可部署的 Agent,不仅要能把活干完,还要在干活的同时避免不该做的事,并且能在 API 超时、服务报错的环境里稳定运行。

2026 年的 Claw-Eval 等工作把 Agent 评测从"只看答案"推进到"看行动"——让 Agent 的执行过程变成可审计证据,不仅验证结果,还追踪执行过程,从数据调用到状态变更,全面验证 Agent 的真实能力。

第二次跃迁:从"静态题库"到"活的题库"。 即便"看行动"了,还有一个问题:题库是死的,而真实世界在变。一个 2025 年的 Agent benchmark,测的是 2025 年最重要的 workflow;到了 2026 年,企业最关心的可能已是完全不同的任务。固定不变的题库,会迅速与现实需求脱节。

2026 年的 Claw-Eval-Live 提出了"活的 benchmark"概念——通过信号采集与任务筛选,确保评测内容紧跟企业实际痛点,而非固定不变的题库。这标志着 Agent benchmark 进入"下半场":不再只比较谁更会答题,而是比较谁更接近真实世界。

第三次跃迁:从"单点能力"到"长程综合"。 第三次跃迁正在发生——评测从"单步任务"走向"长程综合任务"。Agents-A1 等工作在多步搜索、科学研究、长指令遵循上评估,正是这次跃迁的体现。这次跃迁最难,因为长程任务的评测本身就是一个长程问题——评估一个 8 小时任务的成败,本身可能需要大量人工或另一个强 Agent。

7.2 主流 Benchmark 谱系

梳理 2025—2026 年的 Agent benchmark 谱系,可以清晰看到三大命题在评测层的映射。

SWE-bench 家族:软件工程任务的标准评测,要求 Agent 修改代码库以解决给定 issue。Claude 3.7 Sonnet 在此大幅领先,验证了 agentic coding 能力。Multi-SWE-bench 把它扩展到 Java、TypeScript、JavaScript、Go、Rust、C、C++ 七种语言,共 1,632 个高质量实例。这一家族对应"长程能力在编程场景的评测"。

GAIA 与 ARC 类:通用助手能力的评测,覆盖多步推理、多模态、工具调用。它们对应"长程能力在通用场景的评测"。

Claw-Eval / Claw-Eval-Live:前述"看行动"与"活题库"的代表,覆盖通用服务编排、多模态感知与生成。它们对应"自治系统在真实部署要求的评测"。

Agents-A1 基准:多步搜索、科学研究、长指令遵循。对应"长程综合能力"的评测。

值得注意的是,截至 2026 年,自我进化能力的评测仍是空白。如何衡量一个 Agent "随时间变强"的程度?如何对比"进化前的 Agent"与"进化 100 小时后的 Agent"?这需要"纵向评测"范式——同一 Agent 在不同进化阶段的能力曲线。这是评测体系的下一个前沿,也是本文判断的产业机会之一。

7.3 评测的工程化:从跑分到生产可观测

最后需要强调:生产级 Agent 的评测,不能只靠跑分。一个 Agent 在 benchmark 上拿 90 分,不等于它在你的业务里能 work——因为 benchmark 的任务分布与你的真实任务分布不同。

这要求评测从"离线跑分"走向"在线可观测"——把评测能力内嵌到自治系统的 Traces 基础设施中,持续衡量 Agent 在真实任务上的表现,而非依赖一次性 benchmark。DeepThink 的"全栈可观测性"既是运行时基础设施,也是这种"在线评测"的载体。这种"评测即运行"的范式,是后 Coding 时代评测体系的最终形态。


8. 工程实现与关键基础设施

8.1 从概念到生产:工程化的九层塔

把三大命题从概念落到生产,需要穿越一座"九层塔"般的工程化体系。这一节梳理关键工程要点。

第一层:Agent Loop 的生产化。 一个生产级 Loop 必须处理:循环终止的可靠判定(避免"永远不结束"或"提前结束")、单步与全局超时、异常捕获与降级、状态持久化。Ralph Loop 的"二选一结论"原则——要么真正修复、要么无法修复需人工介入——是终止判定的工程典范。

第二层:上下文工程的精细化。 上下文不再是"把所有东西塞进 prompt",而是一门精细工程——哪些信息进上下文、哪些不进、进的信息如何排序、何时压缩、如何检索。Kangwook Lee 把"上下文工程"列为首要技术,其地位已超越传统的 prompt engineering。

第三层:Compaction 的无损与有损平衡。 如第 3.2.1 节所述,Compaction 必须在"压缩以腾空间"与"保真以不丢证据"间平衡。Memex 的"索引式无损压缩"与 MemAgent 的"覆写式有损外推"是两条主流路线,生产中常组合使用——近期上下文用摘要压缩,远期证据用索引检索。

第四层:沙箱与权限的分层。 Agent 的行动权限必须分层——读文件、写文件、执行命令、访问网络、调用敏感 API,各自需要不同级别的沙箱与确认。DeepThink 把"破坏性命令""凭据篡改""数据外泄""持久化机制""远程代码执行"列为红线操作,正是权限分层的体现。

第五层:多 Agent 通信协议。 多 Agent 系统需要标准化的通信协议——子任务的分发格式、结果的返回格式、错误的传播格式。缺乏标准协议会导致多 Agent 系统的耦合度过高、可维护性差。

第六层:检查点与重放。 第 4.3.1 节已述。工程实现的关键是:把所有"外部副作用"(文件写入、API 调用、消息发送)记录为可重放的事件流,以便崩溃后从检查点重放恢复。

第七层:Trace 的结构化与可查询。 Trace 不能只是非结构化的日志文本,必须是结构化的、可查询的——支持按"哪一步""调了什么工具""返回什么""耗时多少"查询。这是 Traces 作为"Source of Truth"的前提。

第八层:Bug 自修复的预算控制。 Bug 修复循环必须设预算——最多尝试几次、最多消耗多少 Token、最多耗时多久——否则可能陷入"无限修复"的死循环。预算耗尽即升级人类,这是 Ralph Loop"二选一结论"的工程实现。

第九层:人机协作的异步/同步切换。 第 4.3.5 节已述。工程实现的关键是:Agent 能在运行中"暂停并请求人类输入",人类响应后"恢复运行",且暂停/恢复不影响状态一致性。

8.2 关键开源与产业实践

2026 年值得关注的工程实践与开源项目:

  • Awesome-Agent-Harness(HKUST-KnowComp):系统化的 Agent Harness 研究论文与工具集,提出四层 Harness 架构。
  • AIOS(LLM Agent Operating System):把 LLM 嵌入操作系统,优化资源分配、上下文切换、并发执行、工具服务。代表了"Agent 即 OS"的激进路线。
  • Agents-A1(上海 AI Lab):35B MoE 的"扩展视野"路径实践。
  • OpenClaw(Peter Steinberger):开源长程自治 Agent,数字替身形态。
  • Memex / MemAgent / MemRL:记忆路径的三条子路线代表。
  • Claw-Eval / Claw-Eval-Live:评测范式跃迁的代表。

这些实践共同构成了后 Coding 时代的工程基础设施。一个企业要构建自己的长程自治能力,应充分吸收这些实践的教训,而非从零造轮子。

8.3 工程化的反模式

同样重要的,是识别工程化的反模式——那些看似合理实则有害的做法。

反模式一:唯模型论。 认为"只要用上最新最强模型,Agent 就能 work"。忽视 Harness 建设,结果模型每次更新都被抹平,永远停在 demo 级。

反模式二:过度工程。 反面同样有害——为单次使用的代码构建复杂抽象、为不会发生的场景写错误处理、为不需要的可扩展性预留接口。这是 LLM 代码生成的常见病——模型训练数据中充满企业级代码,遇到"加个缓存"就生成一个带 LRU 淘汰、线程安全、metrics 钩子的完整实现,而实际只需五行。

反模式三:护栏缺失。 为追求"自治"而省略护栏,导致 Agent 越界、数据外泄、破坏性操作。这是自治系统的安全自杀。

反模式四:不可观测。 Agent 跑了一晚上,不知道它做了什么、为什么这么做。出了问题无法定位。这是放弃了自我进化的原材料。

反模式五:评测脱节。 在过时的 benchmark 上刷分,忽视真实任务分布。分数好看但生产不可用。

避免这五大反模式,是工程化的底线。

8.4 一个参考实现:DeepThink 的工程剖面

作为本文理论框架的工程投影,DeepThink 平台的实践值得作为参考实现来剖析。它把三大命题在企业级 SaaS 场景中具体化为一套可运行的工程体系。

长程能力的落地:Ralph Loop。 DeepThink 把研发流程固化为五步——PRD 生成、技术方案、编码实施、测试修复、提交合并——并要求每一步都有独立的产出物写入 docs/ 目录(prd、tech_solution、test_report 各自独立文件夹)。这种"每步产出物落盘"的设计,本质上是一种显式的状态记忆——即便上下文丢失,Agent 也能从文件系统重建任务状态。这正是第 4.3.1 节"检查点与可恢复性"的具体实现。

自治系统的落地:四原则 + 双 Agent。 DeepThink 的工作原则——Think Before Coding、Simplicity First、Surgical Changes、Goal-Driven Execution——是 Harness 层的"设计宪法"。它们针对的正是前述五大反模式:Think Before Coding 反"过度自信"、Simplicity First 反"过度工程"、Surgical Changes 反"触碰不该碰的代码"、Goal-Driven Execution 反"不可观测与评测脱节"。Ralph Loop 的监督者—执行者双 Agent 结构,则对应第 4.5 节的范式一。

自我进化的落地:可观测性 + Bug 自修复闭环。 DeepThink 的全栈可观测性对应 Traces 基础设施——每一次 Agent 执行被完整记录,构成自我进化的原材料。Bug 自修复闭环则同时是错误恢复设施与进化的训练数据源——每次修复的轨迹被记录,未来可作为技能沉淀的输入。这两者结合,启动了路径一(记忆强化)与路径二(技能沉淀)的闭环。

企业级落地的落地:多租户 + 共生。 DeepThink 的多租户隔离、权限分级、企业集成(飞书/钉钉/企微/LDAP)对应治理层安全。程序员-Agent 共生协作中枢对应第 4.3.5 节的人机协作设施——每位程序员的"个人开发项目"含多个并行会话,由 CEE 中央调度防止并发冲突。

这一剖面展示了一个关键事实:三大命题不是抽象研究,而是可以一套工程体系同时承载的具体设计。 当一个平台同时实现了长程流程固化、Harness 设计原则、可观测性、Bug 闭环、多租户与人机共生,它就已经在运行三角飞轮——只是飞轮的转速取决于各模块的成熟度。DeepThink 的实践为本文的理论提供了经验锚点,本文的理论则为 DeepThink 的实践提供了方向锚定。


9. 风险、安全与治理

9.1 长程自治的新风险面

长程自治系统引入了 Pre-Training 时代不存在的全新风险面,必须被系统识别与治理。

风险一:行动的不可逆性。 一个能执行 8 小时的 Agent,其行动后果远超一个只回答问题的模型——它可能已经提交了代码、发送了邮件、修改了数据库、调用了付费 API。这些行动部分不可逆。治理原则:对不可逆行动强制人类确认(红线操作),对可逆行动允许自主但全量审计。

风险二:目标漂移到有害方向。 第 5.4 节已述目标误设风险。在长程自治中,这种风险被放大——Agent 可能在数小时执行中,把一个原本无害的目标,优化到有害的实现路径。治理原则:护栏层的硬性禁止,不因任何"目标优化"而解除。

风险三:自我进化的失准。 第 5.4 节已述自我欺骗与目标误设。治理原则:外部验证锚点 + 护栏约束。

风险四:记忆污染与投毒。 一个依赖外部记忆的 Agent,其记忆可能被污染——恶意经验被注入、检索被操纵。治理原则:记忆的可信源验证、记忆写入的审计、关键决策不依赖单一记忆源。

风险五:多 Agent 的协调失败。 多 Agent 系统可能出现"协调失败"——两个 Agent 同时修改同一资源导致冲突、Agent 间信息传递丢失上下文导致错误决策。治理原则:CEE 式中央调度、冲突检测与串行化、Agent 间通信的完整审计。

风险六:环境依赖的脆弱性。 Agent 依赖的外部环境(API、网页、依赖)变化导致失效。治理原则:环境变化检测、适配层的自动更新、失效的优雅降级。

9.2 安全的分层防御

针对上述风险,安全必须分层防御——这与 Harness 的四层架构对应。

模型层安全:通过后训练(RLHF、Constitutional AI 等)让模型本身倾向于安全行为。这是基础但不可靠——模型可被对抗输入绕过。

Harness 层安全:沙箱隔离、权限控制、动作白名单。这是自治安全的主体——即便模型被绕过,Harness 层的确定性约束依然生效。

基础设施层安全:Trace 全量审计、预算限制、速率限制、人类监督循环。这是兜底——即便前两层都失效,审计与预算限制也能控制损害范围。

治理层安全:合规、隐私、数据主权。这是企业级落地的外部约束——多租户隔离、权限分级、企业集成(飞书/钉钉/企微/LDAP)、计费弹性。

DeepThink 把"企业级 SaaS 平台——多租户隔离、权限分级、计费弹性、企业集成"列为产品核心,正是对治理层安全的工程回应。

9.3 治理的新命题:Agent 洗绿与结果问责

2026 年产业实践中浮现两个新的治理命题。

命题一:Agent Washing(Agent 洗绿)。Gartner 注意到,很多产品把旧自动化、仪表盘、RPA 或聊天入口包装成"Agent"以蹭热度。这与"AI Washing"一脉相承。治理对策:建立"真 Agent"的判别标准——是否具备自主决策、长程执行、错误恢复、自我进化,而非只是脚本化的自动化。

命题二:结果问责。当 Agent 按"结果"交付与计费,一个新问题浮现——如果结果有瑕疵,谁负责?Agent 厂商、部署企业、还是使用 Agent 的员工?这是 Service-as-Software 模式带来的新法律问题,2026 年尚在早期讨论,但将是未来几年的治理焦点。

9.4 对齐在自我进化场景的特殊挑战

最后必须强调:自我进化让 AI 对齐问题变得更难。传统对齐是一次性的——厂商训练时对齐一次,模型部署后行为固定。但自我进化的 Agent 行为会随时间变化——它今天对齐,不代表一个月后还对齐。

这要求一种新的"持续对齐"范式——在 Agent 自我进化的同时,持续监测其行为是否仍在人类意图范围内,偏离时及时纠偏。这比传统对齐难得多,因为它要求对齐机制本身比 Agent 的进化更快、更敏锐。这是后 Coding 时代最深层的安全命题,也是值得长期投入的研究方向。


10. 产业图景与商业模式重构

10.1 从 SaaS 到 Service-as-Software

三大命题的兑现,正在重塑产业图景。最根本的变化是商业模式的迁移。

上一代 SaaS 的目标是"提升效率"——卖工具给企业员工用,按 Seat 计费。其 TAM 对应全球约 3—4 千亿美元的企业软件支出。Long-Horizon Agent 的目标是"直接交付结果"——卖劳动力而非工具,按 Outcome 计费。其 TAM 对应全球数万亿美元的服务市场。

这一迁移被红杉称为 Service-as-Software——把"服务"以"软件"的形式交付。其本质是:过去由人类完成的服务工作(研究、审计、运营、编码),现在由 Agent 完成,按结果计费。Citadel 的案例——Agent 2 小时完成硕博研究员 6—8 周的论文复现——是这一迁移的极致体现。

10.2 护城河的重构:MAD 框架

在计算革命中,护城河的逻辑也被重写。红杉提出 MAD 框架——Moats(护城河)、Acceleration(加速)、Distribution(分发)。

护城河:不能靠"抢先调用最新模型"建立。真正可沉淀的护城河有三:一是 Harness 层的工程投入(记忆、护栏、可观测性),二是长时间磨合积累的领域经验与记忆,三是自我进化飞轮跑通后的能力领先。这三者都是私有的、累积的、随使用增强的——竞争对手即便拿到同样的基础模型,也无法复制。

加速:在计算革命中,谁能更快地把模型能力转化为产品,谁就赢。这要求企业具备"快速集成新模型"的工程能力——Harness 层的解耦设计,让底层模型可替换而 Harness 不变。

分发:Agent 产品的分发逻辑与传统 SaaS 不同——它更依赖"自下而上"的渗透(开发者先用、团队再用、企业再采用),而非"自上而下"的销售。OpenClaw 的爆火路径——从开源项目到开发者社区到企业采用——是典型。

10.3 产业分工的新格局

三大命题催生的产业分工,正在形成清晰的新格局。

底层:模型提供商。OpenAI、Anthropic、xAI、上海的 MoE 实践者等。这一层竞争最激烈、差异化最难、利润率被持续压缩。红杉明确判断:创业者的机会不在于追逐底层模型。

中层:Harness 与基础设施提供商。提供 Agent Loop、记忆、沙箱、可观测性、多 Agent 调度的通用基础设施。LangChain 是这一层的代表。这一层的价值在于"可沉淀的工程",护城河较高,但天花板受限于通用性。

上层:垂直自治 Agent 提供商。在特定垂直场景(软件研发、金融研究、供应链、医疗、法律)闭环三角飞轮的厂商。DeepThink 定位在软件研发垂直场景,是这一层的代表。这一层的护城河最高——因为它内化了垂直领域的长程经验与自我进化。

外层:企业级 SaaS 与集成层。多租户、权限、合规、企业集成。这是把上层能力交付给企业的最后一公里。DeepThink 的"企业级 SaaS 平台"定位在此。

四层叠加,构成后 Coding 时代的完整产业栈。一个有意思的判断来自 Harrison Chase:"通用 Agent 可能就是一个 Coding Agent。"这意味着——软件研发作为最可验证、最适合启动三角飞轮的场景,其 Agent 可能演化成最通用的形态。这对 DeepThink 是重大利好——以 Coding 为起点,向通用扩展。

10.4 组织形态的再造

最后,三大命题不仅在重塑技术与商业,也在重塑组织。

一个被广泛讨论的判断是:"旧组织里长不出新产品。"一个线性协作、岗位边界清晰、需要层层传递信息的团队,很难做出主动型 Agent。因为 Agent 的开发本身就需要 Agent 式的工作方式——快速迭代、跨职能协作、试错驱动。

2026 年已出现"AI 原生公司"的早期形态——小团队(5—10 人)配大规模 Agent 协作,人均产出达到传统百人团队的量级。火星电波的故事——5 周内做出新 Agent 产品并完成组织改造——是这种新组织形态的缩影。这种"少数人 + 大量 Agent"的组织,正在改写"公司"的定义。

DeepThink 的"程序员-Agent 共生协作中枢"——每位程序员拥有个人"开发项目",内含多个并行会话——正是这种新组织形态在工程平台的投影。其本质是:让每个程序员都成为"Agent 团队的指挥官",而非"代码的编写者"。

10.5 行业落地的"可验证性梯度"

观察三大命题在不同行业的落地速度,可以发现一个清晰规律——落地速度与行业的"可验证性"强相关。越是结果可被客观验证的行业,Agent 落地越快;越是结果主观、难以量化的行业,落地越慢。这一"可验证性梯度"是预判 Agent 渗透顺序的关键。

第一梯队(高可验证):软件研发、数据分析、金融研究。 这些领域有强客观验证信号——编译通过、测试跑过、数据可复算、论文可复现。Agent 的成功与否一目了然,长程能力的闭环最容易启动。Coding 作为最可验证的场景率先起飞,并非偶然。

第二梯队(中可验证):运营自动化、合规审计、文档生成。 这些领域的结果可被部分验证——发票对账对错有标准答案、合规检查有规则、文档质量可人工抽检。Agent 落地需要适度的"人在环中"验收,但仍可大幅提效。2026 年物流领域的 Agent 落地——Cartage、Opereit、Freehand 等案例——都集中在订单、预约、运费审计等"有清晰触发条件、系统动作和人工升级点"的流程,正印证此梯度。

第三梯队(低可验证):创意设计、战略决策、跨文化管理。 这些领域的结果高度主观、难以量化、依赖情境。Agent 即便交付了结果,也难以客观判定好坏。这导致自我进化的"奖励信号"难以定义,飞轮难以启动。这些领域将是 Agent 落地最慢的,也是人类专家最后被替代的。

理解这一梯度,对产业实践有两层含义:其一,企业应优先在自身业务中"可验证性最高"的环节启动 Agent——那里的飞轮最容易转起来;其二,随着 Agent 能力提升与评测体系成熟,"可验证性"本身会被扩展——今天难以验证的创意工作,明天可能有更好的评测方法。这也是 Claw-Eval-Live"活题库"理念的长远价值。

10.6 中国市场的结构性机会

在产业图景之外,中国市场有几个值得专门指出的结构性机会。

机会一:企业 IM 原生的 Agent 入口。 中国企业高度依赖飞书、钉钉、企微作为工作入口。一个能"常驻"在这些 IM 中的 Agent,比独立的 Agent 应用有更低的采纳门槛——它天然嵌入工作流,无需用户切换工具。OpenClaw 在 Slack 上的爆火,预示了中国 IM Agent 的潜力。DeepThink 把飞书/钉钉/企微集成作为核心能力,正切中此机会。

机会二:政策驱动的普及窗口。 前述国务院意见提出的 2027 年 70%、2030 年 90% 普及率目标,意味着未来四年中国将出现大规模的 Agent 采购需求。这一政策窗口对提供企业级 Agent 平台的厂商是显著利好。

机会三:算力约束倒逼的工程优势。 中国算力相对受限,反而倒逼出"重 Harness 轻模型"的工程路径——这与本文论证的"难度倒置"判断高度契合。Agents-A1 的"扩展视野"路径证明,中国可以走一条不依赖万亿参数的 Agent 路线。这种"工程驱动"的能力,反而可能成为中国 Agent 产业的差异化优势。

机会四:垂直行业的深厚积累。 中国在制造业、物流、零售、金融等垂直行业有深厚的产业积累。把这些行业知识与 Agent 结合,能产生高度定制化、高护城河的垂直 Agent。这种"产业知识 + Agent 工程"的组合,是中国企业对抗纯模型层竞争的利器。

这四个机会叠加,使中国有望在后 Coding 时代的产业重构中占据独特位置——不是在底层模型上与海外正面竞争,而是在 Harness、企业级落地、垂直产业上形成差异化。


11. 未来展望:通向超级智能体的路线图

11.1 METR 曲线与时间表

基于前述分析,我们可以给出一个通向超级智能体的时间表。其基础是 METR 的核心数据:AI 能自主连续工作的时间每 7 个月翻一倍。

以 2026 年中为基准——当前顶级 Agent 已能稳定自主工作约 2—4 小时(部分场景如论文复现已达 2—3 小时)。按 7 个月翻倍外推:

  • 2026 年底:约 4—8 小时。触及"无人值守一工作日"门槛,首个"数字员工"岗位出现。
  • 2027 年中:约 8—16 小时。跨过"夜间无人值守"门槛,24 小时自主任务成为可能。
  • 2028 年:约 32—64 小时。多日长程任务可行,跨天状态管理成熟。
  • 2029 年:约 128—256 小时(5—10 天)。周级长程任务。
  • 2030—2032 年:约 1000—4000 小时(1.5—6 个月)。月级长程任务,逼近"人类专家一年工作量"。

这条曲线给出了一个清晰的产业节奏:2026—2027 是"数字员工"元年,2028—2030 是"长程专家"成熟期,2030 年代是"超级智能体"窗口。

11.2 三大命题的成熟度判断

对照时间表,我们对三大命题的成熟度做判断:

长程能力:处于"早期生产化"阶段。Coding 与金融研究等可验证场景已落地,但通用长程能力仍在突破上下文、目标漂移、信用分配等基础挑战。预计 2027—2028 年走向成熟。

自治系统:处于"工程共识形成"阶段。四层 Harness 架构与五大基础设施已被广泛接受,但生产级实现仍参差不齐。预计 2026—2027 年工程实践成熟。

自我进化:处于"早期研究"阶段。MemRL、Agents-A1 等已验证可行性,但闭环飞轮在生产中跑通的案例仍稀少,评测体系空白。预计 2028—2010 年走向成熟,是三大命题中成熟最晚、潜力最大的。

11.3 通向超级智能体的三步走

基于上述判断,通向超级智能体的路径可分三步:

第一步(2026—2027):垂直闭环。在 2—3 个高可验证垂直场景(软件研发、金融研究、运营自动化)闭环三角飞轮。验证长程能力、打磨自治系统、启动 Trace 积累。这一步的核心目标是"跑通飞轮",而非"通用智能"。

第二步(2028—2030):横向扩展与进化启动。把垂直场景验证过的飞轮,横向扩展到更多场景;同时启动自我进化路径二(技能沉淀)与路径三(模型自举),让 Agent 在跨场景迁移中保持经验。这一步的核心目标是"飞轮加速"。

第三步(2030 年代):开放式演化。自我进化路径四(种群演化)成熟,Agent 能自我繁衍——创造新 Agent、新工具、新架构。这一步对应"超级智能体"的真正到来,也是红杉所说"雇用智能体如同雇用员工"的产业常态。

11.4 中国路径的特殊性

值得专门讨论的是中国在这条路径上的特殊性。

一是算力约束下的路径选择。Agents-A1 的"扩展视野而非堆参数"路径,对算力受限的中国产业具有特殊价值——它证明了 35B 模型可逼近万亿参数的长程表现。这意味着中国在算力不占优的情况下,仍可通过 Harness 与长程视野的工程投入,在 Agent 赛道形成竞争力。

二是政策窗口。国务院《关于深入实施人工智能"行动的意见》提出:到 2027 年智能体应用普及率超 70%,到 2030 年超 90%。这一政策目标与 METR 曲线的产业节奏高度吻合,意味着中国将在 2026—2030 年迎来 Agent 落地的强政策推动。

三是企业级落地的优势。中国在飞书/钉钉/企微等企业 IM、LDAP 集成、多租户 SaaS 方面有成熟的产业基础。DeepThink 把"企业集成"作为核心能力,恰能受益于这一基础。中国企业级 Agent 的落地,可能比消费级 Agent 更快、更深。

11.5 关键不确定性

最后,必须诚实地标注这条路径的关键不确定性。

不确定性一:模型能力的非线性突破。METR 曲线假设"7 个月翻倍"是平稳的,但模型能力可能因某个突破(如新架构、新训练范式)而跃迁,也可能因预训练数据耗尽而放缓。曲线的斜率不是物理定律。

不确定性二:自我进化的 collapse 风险。模型自举可能遭遇"模型 collapse"——自我蒸馏导致能力退化而非提升。这是路径三最大的技术风险,目前尚无彻底解法。

不确定性三:对齐的失败。持续对齐若跟不上自我进化的速度,可能出现"进化但失准"的 Agent,其后果难以预测。这是最大的安全不确定性。

不确定性四:商业模式的接受度。Service-as-Software 要求企业接受"按结果向 AI 付费",这涉及采购流程、法律问责、组织变革,其接受速度可能慢于技术成熟速度。

这些不确定性意味着——通向超级智能体的路径是清晰的,但节奏是不确定的。保守与激进的判断之间,可能有两到三年的偏差。但方向性的判断是稳健的:三大命题的闭环,是不可逆的趋势。

11.6 一个需要被正视的长期问题:智能体经济学

在结束展望之前,必须正视一个被多数技术乐观主义回避的长期问题——当 Agent 能力逼近人类专家,经济结构将如何重组?

Service-as-Software 把"按结果计费的劳动力"推向市场,其直接后果是大量"可被 Agent 完成的知识工作"——初级编码、文档撰写、数据分析、流程运营、甚至部分研究复现——其价格将向 Agent 的边际成本(主要是 Token 与算力)趋近,而非人力成本。这是一个比工业革命更剧烈的重组,因为被替代的是"认知劳动"而非"体力劳动",而认知劳动恰恰是过去半个世纪经济增长的主要引擎。

这一重组有三个值得关注的次级效应:

效应一:工作定义的迁移。 当"执行"被 Agent 接管,人类工作的重心从"做事"迁移到"定义做什么"——需求定义、目标设定、结果验收、伦理判断。这是一种更高阶、也更难被替代的劳动。DeepThink 的"程序员-Agent 共生"正是对这种迁移的预判——程序员从代码编写者变成 Agent 团队的指挥官与目标定义者。

效应二:组织杠杆的重构。 一个"少数人 + 大量 Agent"的组织,其人均杠杆远超传统公司。这既可能带来更平等的财富分布(更多人能指挥 Agent 团队),也可能加剧集中化(能调度最多 Agent 的少数人获得不成比例的产出)。走向哪端,取决于 Agent 能力能否被广泛、低成本地获取。

效应三:价值评估的重定。 当 Agent 能完成大部分执行工作,"人类的独特价值"是什么?答案可能是:创造性方向选择、跨领域直觉、伦理与审美判断、以及"定义值得解决的问题"。这些能力不会被 Agent 替代,但需要被重新重视与培养。

正视这些问题,不是要制造焦虑,而是要指出——三大命题的闭环不仅是技术事件,更是社会事件。一个负责任的超级智能体平台,必须在技术推进的同时,思考它的社会后果,并在产品设计中预留"人机共生"而非"人机替代"的路径。DeepThink 把"共生协作"而非"替代"作为核心理念,正是这一责任感的体现。


12. 结论

12.1 核心论点重述

本文的核心论点是:后 Coding 时代的新命题——长程任务、自治系统、自我进化——并非三个独立问题,而是一个由"能力—载体—时间"构成的自我强化三角。

长程能力是门槛——它决定了 Agent 能触及的任务复杂度区间,是"数字员工"价值的下限。

自治系统是载体——它通过"模型 + Harness"的双层架构与五大基础设施,把模型能力稳定兑现为持续生产力。模型决定上限,Harness 决定兑现率。

自我进化是加速器——它通过四条路径(经验记忆、技能沉淀、模型自举、演化算法)作用于不同时间尺度,让 Agent 随使用而变强,构筑不可复制的护城河。

三者构成飞轮:长程能力产生轨迹,自治系统记录轨迹,自我进化从轨迹中提炼知识反哺能力。飞轮一旦启动,先发者越用越强。

12.2 范式转移的三个层级

我们已论证,这一三角闭环背后,是 AI 产业的三层范式转移:

  • 能力层:从单次生成 → 多步推理 → 长程行动。
  • 载体层:从模型 API → 推理模型 → Agent 系统(模型 + Harness)。
  • 价值层:从按 Token 计费的问答 → 按 Seat 计费的推理 → 按 Outcome 计费的劳动力。

三层转移的终点,是 Service-as-Software 带来的 TAM 跃迁——从千亿级企业软件市场,走向万亿级全球服务市场。

12.3 时间表与终局

基于 METR 曲线与三大命题的成熟度判断,我们给出的时间表是:

  • 2026—2027:数字员工元年,垂直场景闭环三角飞轮。
  • 2028—2030:长程专家成熟期,飞轮横向扩展,自我进化启动。
  • 2030 年代:超级智能体窗口,开放式演化,"雇用智能体如同雇用员工"成为常态。

终局——用 DeepThink 的愿景表达——是"让每一家企业都拥有一支永不停歇、持续进化的 AI 超级研发团队:从工具使用者,到代码创造者,最终成长为可自我繁衍的超级智能体"。

12.4 给实践者的五条建议

基于全文分析,我们给实践者五条建议:

建议一:把 80% 投入放在 Harness 与基础设施,而非追逐最新模型。 在计算革命中,模型能力以月迭代,Harness 投入才是可沉淀的护城河。

建议二:从第一天起全量记录 Trace。 Trace 是自我进化的不可回溯原材料,错过即永久损失。

建议三:在高可验证垂直场景闭环飞轮。 不要从通用智能起步。软件研发、金融研究等可验证场景,最适合启动三角飞轮。

建议四:为自我进化设外部锚点与护栏。 自我欺骗与目标误设是真实风险,外部验证信号与硬性护栏是底线。

建议五:准备"少数人 + 大量 Agent"的新组织形态。 技术与商业的转移,最终会传导到组织。提前培养"Agent 团队指挥官"式的人才,是新周期的核心竞争力。

12.5 结语

后 Coding 时代,AI 不再只是回答问题的机器,而是交付结果的劳动力。这一转变的三个新命题——长程任务能力、完全自治的智能体系统、自我进化——共同定义了通向超级智能体的路径。

这条路径清晰但不平坦。它要求我们既要做严谨的工程师——构建可靠的 Harness 与基础设施;也要做清醒的研究者——直面长程信用分配、自我进化失准、持续对齐等深层难题;更要做有远见的实践者——在垂直场景中耐心地把飞轮转起来,让 Agent 在真实世界中越用越强。

当三角飞轮真正闭环的那一天,我们迎来的将不只是一个更高效的工具,而是一个能持续成长、最终与人类共生的数字物种。那正是"超级智能体"的真正含义——不是模型参数的堆叠,而是能力、载体与时间三者乘积的质变。

从工具使用者,到代码创造者,到超级智能体。后 Coding 时代,这场旅程才刚刚开始。


参考文献

本文引用的核心资料(按主题归类,均为 2023—2026 年真实论文、产业报告与产品实践):

长程任务与 Agent 基础研究:

  1. Sequoia Capital, "AI Ascent 2026: The Computing Revolution & Long-Horizon Agents", 2026.
  2. Harrison Chase (LangChain) × Sequoia Capital (Sonya Huang, Pat Grady), "Long-Horizon Agents: 2026 元年", 2026-01.
  3. METR, "Model Evaluation & Threat Research: AI Task Length Doubling Time", 2026.
  4. 上海 AI Lab, "Agents-A1: Scaling the Horizon (35B MoE Agent)", arXiv:2606.30616, 2026-07.
  5. "2026 Long-Horizon Agent 投资地图:OpenClaw 与 Service-as-Software", 2026-02.

Agent Harness 与自治系统: 6. HKUST-KnowComp, "A Survey on AI Agent Harness", GitHub: Awesome-Agent-Harness, 2026-06.

  • Pan et al., "Natural-Language Agent Harnesses", 2026.
  • Young et al., "Effective Harnesses for Long-Running Agents", 2025.
  1. Kangwook Lee (KRAFTON/Ludo Robotics), "How to Build Truly Useful LLM Agents", UC Berkeley BLISS Seminar, 2026-03.
  2. Rutgers/Agentmemory, "AIOS: LLM Agent Operating System", GitHub: agiresearch/AIOS, 2024—2026.
  3. Peter Steinberger, "OpenClaw: Open-Source Long-Horizon Autonomous Agent", 2026.

记忆与长上下文: 10. Wang et al., "Memex(RL): Scaling Long-Horizon LLM Agents via Indexed Experience Memory", arXiv:2603.04257, 2026-03. 11. Yu et al., "MemAgent: Reshaping Long-Context LLM with Multi-Conv RL-based Memory Agent", arXiv:2507.02259, 2025-07. 12. 王嘉乾等, "MemRL: Self-Evolving Agents via Runtime Reinforcement Learning on Episodic Memory", arXiv:2601.03192, 2026-01.

推理与编码模型: 13. Wei et al., "Chain-of-Thought Prompting Elicits Reasoning in LLMs", 2022. 14. Yao et al., "Tree of Thoughts", 2023. 15. "从 R1 到 Sonnet 3.7: Reasoning Model 首轮竞赛的关键信号", 2025-03.

评测体系: 16. "Claw-Eval: 从答题到行动的 Agent 评测", arXiv:2604.06132, 2026. 17. "Claw-Eval-Live: 活的 Benchmark 概念", arXiv:2604.28139, 2026. 18. Zan et al., "Multi-SWE-bench: A Multilingual Benchmark for Issue Resolving", arXiv:2504.02605, 2025-04.

产业实践与组织变革: 19. "Citadel Ken Griffin: AI Agent 2 小时复现金融顶刊", Goldman Sachs Apex Summit / Fortune, 2026-06—07. 20. "AI 原生公司:火星电波的组织转型", 未来人类实验室, 2026-07. 21. "2026 上半年 AI Agent 在物流领域落地调查报告", 2026-07. 22. 国务院办公厅, "关于深入实施人工智能'行动的意见", 2026.

自我进化与演化算法: 23. Sakana AI, "Darwin Godel Machine: Self-Improving Agents via Evolution", 2025—2026. 24. Lilian Weng (OpenAI), "LLM Powered Autonomous Agents", 2023.


本文由 DeepThink 研究框架支撑,作为企业级超级智能体自进化平台的理论锚定。文中所有 2026 年产业数据与案例均来自公开资料,技术判断基于截至 2026 年 7 月的最新研究进展。

——"让每一家企业都拥有一支永不停歇、持续进化的 AI 超级研发团队。"


附录 A:核心术语表

为便于检索,本文核心术语统一定义如下:

  • Long Horizon Task(长程任务):需多轮决策、执行、观察、修正,前后步骤强依赖,且需长期规划的任务。工程判据为"无人值守自主执行 8 小时以上且不可简单分割"。
  • Long Horizon Agents(长程智能体):能持续工作数小时乃至数天,自主规划、从失败中恢复、坚持到任务完成的智能体。被红杉列为继 Pre-Training、Reasoning 之后的第三拐点。
  • Autonomous Agent System(自治智能体系统):能无人值守完成长程任务的智能体系统,由模型与 Harness 共同构成。
  • Harness(智能体外壳):围绕模型构建的确定性执行基础设施,包括 Agent Loop、记忆、工具接口、护栏四层。决定模型能力能否被稳定兑现。
  • Model = Stochastic + Harness = Deterministic:核心公式。模型层随机、Harness 层确定,系统可靠性由后者兜底。
  • Self-Evolving(自我进化):智能体从自身执行轨迹中提炼知识、在运行时持续改进自身的能力。四条路径:经验记忆、技能沉淀、模型自举、演化算法。
  • Agent Washing(Agent 洗绿):把传统自动化或 RPA 包装成"Agent"以蹭热度的行为。
  • Service-as-Software:把服务以软件形式交付、按结果计费的新商业模式,TAM 从千亿级软件市场跃迁到万亿级服务市场。
  • Trace(行动轨迹):智能体每一步决策与工具调用的结构化、可查询记录,是调试、审计与自我进化的"真相之源"。
  • Compaction(上下文压缩):在上下文接近窗口上限时自动压缩早期对话的机制,分无损索引式与有损覆写式两条路线。
  • Ralph Loop:DeepThink 提出的监督者—执行者双 Agent 闭环,强调客观验证、持续迭代、二选一结论。
  • MAD 框架:红杉提出的企业 Agent 落地三法则——Moats(护城河)、Acceleration(加速)、Distribution(分发)。
  • METR 曲线:AI 能自主连续工作时间每 7 个月翻一倍的追踪数据,是预判超级智能体时间表的核心依据。
  • 三角飞轮:本文提出,长程能力—自治系统—自我进化构成的相互强化闭环。
  • 难度倒置:任务从 1 小时延长到 8 小时,决定成败的因素从模型层转移到 Harness 层的现象。

附录 B:关键开放问题清单

本文结尾列出十大开放问题,作为后续研究的议程:

  1. 长时程信用分配的工程化:如何把任务级奖励高效反传到具体步骤,且不引入过多噪声?
  2. 自我进化评测体系:如何衡量"随时间变强"的程度,建立纵向评测范式?
  3. 模型自举的 collapse 防御:如何确保自我蒸馏带来能力提升而非退化?
  4. 持续对齐机制:如何让对齐速度跟上自我进化速度,防止"进化但失准"?
  5. 记忆污染的防御:如何验证记忆可信源,防止恶意经验注入?
  6. 多 Agent 协调的收敛性:对等协作范式如何保证收敛而非无限讨论?
  7. 环境非平稳性的适应:Agent 如何在环境变化时自动更新适配层?
  8. 结果问责的法律框架:Service-as-Software 模式下,Agent 结果有瑕疵谁负责?
  9. 超级智能体的"断路器":Level 5 自治下,人类应保留怎样的最终干预权?
  10. Agent 经济学的社会契约:当认知劳动被替代,新的价值评估与分配机制如何设计?

这十个问题,每一个都指向一个值得长期投入的研究方向。本文的论述只是这一议程的起点,而非终点。