AI Agent 的新疆界:从真实工作经验中自我进化

0 阅读8分钟

我是 Eric,在汽车研发一线摸了 11 年。下面这篇由 @AlloomiAI 原创,讲的是一个挺根本的问题:为什么大多数 AI Agent 干第一百遍和干第一遍没区别,以及怎么让 Agent 从真实工作里长本事。我把它译成中文,供大家参考。

原文来源:@AlloomiAI,发布于 2026-08-13,X Articles 长文(status 2087704766868750787)。以下为中文翻译。

AI Agent 的新疆界:从真实工作经验中自我进化

封面图1

AI Agent 已经走得很远了。它们从调用工具,演进到调度一群子 Agent 协作推进,再到处理越来越长的上下文。但和人大不一样,Agent 不会在经验里越做越强。今天卡住 Agent 真实落地的,模型能力、工具、记忆、上下文都不再是瓶颈,真正的瓶颈越来越变成真实世界的经验,以及从经验里学习的能力。

而大多数试图解决这个问题的思路,都没有碰到要害:

应用外壳 / Agent 框架:能把工具接起来、把工作流理清楚,但模型本身纹丝不动。能力的上限,始终是底下那个模型。

RAG / 外部知识库:能从文档、对话、数据库里捞事实。但它捞不到的是专家的思考方式,决策是怎么做的、为什么改、什么叫好,这些从没进到模型里。所以每次 AI 接手任务,都得从原材料重新来过。

微调:周期性的重训又贵又慢,永远慢业务半拍。

自反思学习:没有专家锚定,也没有可靠的自我评判办法,模型只会原地打转,甚至跑偏。

图2

工具、知识库、微调都有用,可现实摆在眼前:知识和经验停在模型外面。这些做法给 AI 更多消息,却没让 Agent 本身更强。真正能在模型内部持续累积、让 Agent 进化的,是那些写进权重里的经验。

与此同时,这类经验数据格外稀缺,因为它只能在真实工作里产生。它通常是私有的、动态的、在工作中才浮出来的,有时只存在于一个人的脑子里。

真正把一个 Agent 从初级助理养成老练搭档的,是带判断和反馈的工作经验。而这类经验,互联网上根本没有。通用大模型撞到天花板,恰恰就撞在这里。

我们的思路:全栈模型 + 应用

在 Alloomi,我们走全栈路线,把应用层和模型层合在一起。

图3

Agent 在真实工作流里跑,顺手采到公开领域没有的专业数据;从工作里学到的东西,再经训练后写回模型。落地时分成四层:

1)整体上下文:让模型看见全貌 把人、对话、文档、关系、时间线、决策、结果和反馈汇进统一上下文,再持续追踪工作的完整轨迹。

传统 RAG 假设事实躺在静态文档里。但真实工作里,事实会被修订、被推翻,对不同客户还可能有不同含义。

检索回答的是发生了什么。整体上下文回答的是发生的事怎么变成了现在这样。

2)自进化记忆模型:边干边学 真实工作里的上下文、专家判断、修订历史、交付结果、客户反馈,经过筛选和回放,用于训练后。产出的经验写进模型自己的权重,不再躺在外部数据库。

3)专家锚定:让能力只升不降 学习时,模型被锚定在专家示范和最优交付的标准上。这样它不会原地打转,也不会让错误滚雪球。

4)受控进化:让进化安全 自我进化只有安全才有意义。质量闸门、持续监控、自动回滚,让每一次模型改动都可验证、可审计、可撤销。跑偏在酿成后果之前就被抓住并撤销。

这样一来飞轮就转起来了:每完成一个任务,就赚到一份数据;每采到一次判断,就叠进下一次交付。工作让 Agent 更好,更好的 Agent 做出更好的工作。

技术底座:衡量记忆、学习、交付的九项基准

上面四层讲的是 Alloomi 怎么运作。我们在关键处测它:它看得懂全貌吗、能持续学习吗、交得出专业活吗。九项基准串起记忆、学习、交付的整个过程。

图4

1)整体理解:它记得住 真实工作横跨很多对话、很多任务、很长时间。要真正帮上忙,Agent 得记住要紧的事,理解人、事、时间怎么连起来,并且在历史越来越长时还撑得住全貌。三项基准展示 Alloomi 的上下文能力:

图5

在 BEAM 上,Alloomi 在 128K 达到 72.8% 全局任务准确率,500K 达 75.7%,1M 达 76.5%,10M 达 67.0%。即便在 10M 规模,仍守住 67.0%,高于 Hindsight 的 64.1%,说明它在极长历史里仍能维持相对稳定的全局任务表现。

在 LongMemEval-S 上,Alloomi 达到 97.6%,对比 Memo-V3 的 94.4%。这测的是跨信息抽取、知识更新、多轮会话推理的长程记忆。

在 LoCoMo-V2 上,Alloomi 拿到 97.4%,对比 Memo-V3 的 92.5%,说明它擅长跨会话问答、时间关系和多重推理,远不止捞孤立的事实。

2)持续进化:它会学 记忆只是起点。再往前,长程 Agent 还要过三道更难的关:从复杂上下文里学新规则、把经验迁移到别的任务、环境变了还能保住好不容易攒下的能力。我们在这里测了三项进化相关基准:

图6

在 CL-Bench 上,Alloomi 从某通用大模型基线的 21.5% 提升到 47.6%,涨了 26.1 个百分点。说明它能从复杂上下文学新规则,并在执行中套用。

在 CL-Bench-Life 上,表现从某通用大模型基线的 22.2% 升到 32.1%,提升 9.9 个百分点。说明模型能在长程任务里攒经验,并迁移到后面的阶段。

在 Con.L Bench 上,表现从某头部大模型基线的 22.3% 提升到 32.6%,涨 10.3 个百分点。这测的是模型能否跨任务持续学习,同时少丢已学到的能力。

合起来看,这些结果说明 Alloomi 会反复适应、持续累积经验,并把它带到不同任务上。

3)专业交付:它出活 记得住、学得到,归根结底得落到真实工作变好上。这组跳出记忆或学习的单点,去测 Alloomi 能否在高价值专业任务、复杂真实工作流、持续软件工程里交付结果。

图7

在 GDPval-AA 归一化上,Alloomi 在横跨 44 个职业的高价值任务上达到 74.2%,比某头部大模型的 67.9% 高出 6.3 个百分点。说明长程上下文和持续学习,能转化成复杂专业工作上的更强表现。

在 JobBench 上,Alloomi 拿到 57.5%,对比 Muse Spark 1.1 的 54.7%,提升 2.8 个百分点。验证了它在真实职业任务和专业交付上能做出更好的结果。

在 SWE-Bench-CL 上,Alloomi 达到 80.6%,对比 OpenCode + Kimi K3 + FAISS 的 73.3%,涨 7.3 个百分点。说明这套系统不仅能解真实的 GitHub issue,还能在一连串软件工程任务里留住并叠加以往能力。

合起来,这些基准说明记忆和学习的改进,最终能变成真实工作交付上可衡量的提升。

九项结果详细的实验设置、评估方法和报告规范,见两份公开技术报告:

我们把细节公开,方便读者核验结果,也欢迎社区讨论和指正。

从技术到产品

今天我们在做两件事:一是做 Alloomi AI,面向专业服务的数字员工;二是开源 OpenContext,驱动它的上下文层。

OpenContext(github.com/melandlabs/… Agent 上下文运行时,现已开源。它是整体上下文层的工作实现,作为上下文框架嵌入各类 Agent 应用,提供时间上下文、记忆与检索、上下文纠错、多平台连接和主动调度。项目还年轻,欢迎试、欢迎踩坑、欢迎贡献,一起把上下文框架能长成什么样摸清。

Alloomi AI(alloomi.ai/)是我们的商业产品,面… OKR 驱动、以结果为中心的自进化数字员工系统。它理解长期业务上下文,自己拆解并推进工作,把真实运营里的专家判断、执行历史、结果反馈,转化成每个客户独有的能力。我们已经在一些最专业的领域,法律、保险、金融咨询,通过早期共创验证过,并正和早期用户紧盯着他们的核心需求,同时往更多专业领域扩。

图8

我们相信,AI Agent 的下一阶段,不取决于模型有多聪明,而取决于它从每次真实工作里学到了什么。

每个前沿模型开箱即惊艳,对每个人也都一模一样。别人抄不去的,是 Agent 在你业务内部攒下的东西:它吸收的那些判断、它从修订里学到的、它一轮轮交付内化进来的标准。

智能是每个 Agent 的起点。经验,才是分野所在。这就是我们在建的未来。