上周我让 Claude Code 帮我重构一个老项目。
它吭哧吭哧改了 40 分钟,删了 3 个文件,刚要跑测试,我切出去回了个消息。
再回来,新会话里它一脸无辜地问我:"你想做什么?" 那一瞬间我血压都上来了——Agent 不是不能干,而是干到一半就把自己干丢了。
而这正是阿里高德团队刚开源的 LongHorizon-Harness 要解决的问题。
01 为什么你的 Agent 总是做到一半崩了?
Agent 现在能写代码、能操作浏览器、能改配置文件。但你只要让它干点复杂的事,基本都会遇到三个坑。
第一个坑是上下文爆炸。
Agent 把每一步的工具输出、网页截图、报错日志全塞进 prompt,几十轮之后 Token 爆表,模型开始胡言乱语。
第二个坑是状态漂移。
一旦某个步骤失败,Agent 不知道之前哪些结果是对的、哪些是错的,只能从头再来。本来快干完的活,因为一个报错直接归零。
第三个坑是没人监督。
Agent 自己执行、自己判断完成没完成,中间改坏了文件也没人知道。等用户反应过来,仓库已经面目全非。
这三个问题叠加起来,就是现在 Agent 没法干长活的真正原因。不是模型不够聪明,是缺少一个能扛住几十小时的"缰绳"。
02 LongHorizon-Harness 是什么来头?
定位:LongHorizon-Harness 是阿里高德团队开源的长程任务执行与状态管理框架,让 Agent 在桌面应用和命令行里连续工作几十小时而不丢状态。
它不是又一个 Agent 模型,也不替换你现有的 Claude Code 或 Codex。
它做的是在 Agent 下面垫一层执行基础设施:规划、执行、验证三权分立,只有被独立审计过的结果才能进入持久状态。
就算中间上下文被刷新、某一步失败、甚至整个会话断掉,它也能从已验证的进度继续。
换句话说,它给 Agent 装了一个"行车记录仪 + 进度盘 + 质检员",让复杂任务能真正跑完。
03 三权分立,是怎么把长任务稳住的?
LongHorizon-Harness 的核心设计叫 Manager / Executor / Auditor 三角色:
- Manager 管目标和进度:它手里握着原始任务、已验证的里程碑、以及下一步该做什么。上下文可以刷新,但 Manager 记住的任务状态不会丢。
- Executor 只干一件事:每轮它都拿到一个 fresh context,只聚焦当前这一小步。这样就不会被历史垃圾拖垮,也不会因为前面步骤的干扰而跑偏。
- Auditor 独立验货:它会自己检查文件、界面、日志和测试,只有通过了才把这个结果写进持久状态。Agent 自己说的"完成了"不算数,得审计员盖章才算数。
- 这种设计的妙处在于:哪怕某一步执行失败,系统也清楚之前哪些进度是可靠的,只需要重做失败那部分,而不是从头再来。
04 数据不会撒谎,效果到底有多夸张?
高德团队在几百个真实任务上跑了测试,覆盖 GUI、CLI 和混合环境,数据很硬:
- WeaveBench(GUI + CLI) :任务完成率从约 50% 提升到 80%
- OSWorld 2.0(完整桌面任务) :完成率直接翻了 3 倍
- Terminal-Bench 2.1(代码 + CLI) :成功率从 69.7% 提升到 77.2% ,同时 Token 消耗还少了 24%
- 这意味着什么?同样的模型、同样的后端,只是加了一个 harness,Agent 就能从"经常半途而废"变成"大概率能跑完"。
05 从安装到跑起来,只要 3 条命令
这个项目的上手门槛很低。如果你有 uv,一分钟就能跑起来:
- 安装:uv tool install lh-harness。它会自动把命令行工具装好。
- 准备 Agent 后端:需要你已经装好 claude、codex 或 openclaw 其中之一。Harness 本身不内置模型,它调用你现有的 Agent。
- 跑一个任务:lh-harness run --task "Inspect the current directory and summarize its files."。Harness 会启动 Manager、Executor、Auditor 的协作循环。
- 开 Dashboard 看全流程:lh-harness run --task @task.md --dashboard。每一轮的计划、执行结果、审计证据、重做原因都可视化,失败时还能人工介入。
- Dashboard 不是花架子。Agent 卡住、失败、需要输入或者完成时,它会弹出人工卡点,让你决定是继续、修改还是终止。
06 哪些场景用了它会很爽?
这个项目适合所有"需要 Agent 连续干几个小时还不能翻车"的场景:
- 复杂代码重构:跨多个文件改架构、跑测试、修报错, harness 保证每一步改动都被验证,不会因为会话中断从头再来。
- 数据报表自动化:从浏览器下载数据、用 Python 清洗、生成图表、写进 PPT,全流程跨桌面应用和 CLI,状态一直跟着走。
- 运维排障:查日志、改配置、跑命令、验证服务恢复。多步骤操作里任何一步失败都能定位,已修复的部分不会被重复执行。
- 长时间科研/办公任务:写论文、填复杂表格、做文献调研、生成演示文稿,Agent 可以分阶段推进,你随时通过 Dashboard 检查和接管。
结尾
Agent 的下一个战场不是让它变得更会聊天,而是让它能把一件复杂的事真正做完。LongHorizon-Harness 的意义在于:它不卷模型能力,而是补齐了 Agent 工程化里最缺的一块——长程状态管理。
当你的 Agent 不再做到一半就失忆、不再自己骗自己说任务完成、不再因为一次报错就推倒重来,它才真正从"玩具"变成"工具"。