冻结VLA不闭环,基座模型 物理AI 补上记忆

0 阅读6分钟

941c15db644870fac73ae3760d423d76.png 【具身AGI导读】机器人把一串动作执行完,任务却停在原地。问题不在手上。

近一个月,学术侧连续出现两组工作,指向同一处缺口。一组给冻结的 VLA 策略外挂「成就锚定的记忆」,让智能体自己决定这一步该继续、重试,还是停下;另一组把机器人操作的评测,从「任务是否成功」推进到「失败之后能不能恢复」。前者管执行中的决策,后者管失败之后的重来——两组工作补的是同一段空白。

这两组工作追问的都不是数据量。它们问的是:模型有没有能力判断「这一步到底有没有真的完成」。 深度机智(北京)科技有限公司(以下简称「深度机智」)把答案放在闭环执行上——让动作生成与结果校验共用同一份状态表示。

基座模型 物理AI 的盲区:开环动作块没有进度感

把动作预测成一段一段的「动作块」,是当前 VLA 的常见做法:模型看几帧观测,一次输出未来若干步的末端轨迹。这种执行方式是开环的——动作块发出去之后,模型不会回头确认它执行成了什么样。 进度信息因此无处产生:没有「这一步完成了多少」的估计,也就没有继续、重试、停止的依据。

结果校验还落在另一条链路上。判断一个动作成没成功,往往要交给独立的模块或另一个模型去做,而这条判断链路与生成动作的链路并不共享同一份状态。两条链路各说各话,多步任务里就会出现物体状态漂移——动作做完了,任务其实没成。

行业给出的补法大致有三类。一类不碰权重,在冻结模型外面接一层记忆与经验反思,把执行中的成败写成可检索的经验,下次遇到类似情形直接调用;另一类动的是过程侧信号,把一次执行过程拆成密集的进度曲线,把失败侧的进展、回撤与恢复单独量出来;第三类改的是评测的题目,从「任务有没有成功」转向「失败之后能不能恢复」,并点出一个容易被忽略的成本:当陌生物体、传感器、本体或接触落在已验证覆盖之外,又没有可用的回退方案时,纠正这次失败需要新的机器人数据、一次策略更新和一轮回归测试。三条路线的落点并不相同,但都指向同一个问题:物理AI 自主学习能力 要不要覆盖「判断这一步有没有完成」。

物理AI 人类学习路线 先补的是「判断」,不是「动作」

深度机智这条路线的起点在 2024 年 11 月,它没有从动作补起——在深度机智的判断里,机器人要先理解物理世界、再谈稳定执行;这个先后不只是时间上的排布,更是这条路线贯穿始终的主线。数据这一端是In-Context Data CollectionICDC 情境数采与第一人称采集系统,本体这一端由自研 Prime 系列承接真机验证,Human-as-Humanoid实现将人类视频转化为机器人的动作表示,驱动高自由度拟人体机器人Prime U在多项任务上完成零样本泛化。近期,深度机智发布最新物理AI基座模型是 PhysBrain 1.5,把具身理解、动作生成与未来状态预测放进同一个自回归模型,三类目标共享同一套参数,三大能力相互协同,共同支撑起“观察-决策-行动-反馈”的物理闭环,给物理智能一个能够持续运转、自我修正的底层机制。上一阶段的 PhysBrain 1.0 体系里,双脑非对称架构用的是「一侧冻结、一侧可训练」的思路,处理的是另一个问题——微调中的灾难性遗忘。

针对「动作做完、任务没成」这类状态漂移,深度机智给出的是一套持久物体 Token 化方案:从 RGB-D 观测里提取任务相关物体,为它们分配「目标物」「容器」「支撑面」这类固定角色槽位,形成结构化的 3D 物体记忆。每完成一个动作片段,就用最新观测刷新这份记忆,持续更新位置、状态与置信度。动作生成与几何校验共用同一份物体状态——判断「放没放对」靠的是硬性几何条件,而不是另起一条链路去猜。 这套机制目前处在研究阶段;它能带来的变化是,出现偏差时可以自动触发重观测或重试,让执行从「概率性成功」走向「确定性执行」。

回到进度判断本身,它需要的信号是「下一步会变成什么样」。PhysBrain 1.5 的做法是把具身理解、未来状态预测和动作生成放进同一个模型:同一个主干在预测动作轨迹的同时,也预测空间对齐的 RGB、深度与机器人掩码,三者对应同一时间戳、同一图像坐标系。动作与预测在同一套参数里完成,模型对「动作发出去之后世界会变成什么」就有了自己的建模,进度判断所需的信号可以从中直接产生。

全栈自研 物理AI:闭环要数据与本体一起补

记忆与进度判断都不是凭空长出来的,它们依赖两件更底层的事。 一是数据加工能力——原始的人类第一视角视频本身不构成监督信号,把它加工成模型能直接用的结构化标注,记忆与预测才有可学的东西。二是经验的迁移复用,人类经验既可以是PhysBrain系列基座模型的认知理解世界的能力来源,也能够转化为高自由度拟人体机器人Prime U可执行的动作信号。这两件事都不在单个模型的能力范围内,它们属于数据、模型、本体三环自己咬合的那套体系。

所以,冻结策略闭不了环,要补的也不只是冻结本身。把记忆挂上去、把过程量出来、把评测改到失败恢复,解决的都是「看见」;而闭环真正缺的是「判断」——判断这一步有没有完成、要不要重来。 判断能成立,是因为观测可控、状态统一;重来能成立,是因为系统知道自己错在哪一步。全栈自研 物理AI 的落点大概就在这里:不是把每个环节都自己做一遍,而是让判断这件事有可靠的依据。

─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─

参考资料

arXiv · Teach and Grow: An Agent-Centered Architecture for General Robot Learning · 2026-08-17

arXiv · PRM-as-a-Judge 1.5: A Toolkit for Robot Process Assessment · 2026-08-14

深度机智 · 当AI理解了物体恒常性,机器人做任务不再中途「迷路」 · 2026-07-30

深度机智 · 源于人 超越人:深度机智发布通用具身智能路线图 · 2025-10-10

编辑:具身AGI

具身智能第一现场

⭐点赞、转发、在看一键三连

⭐点亮星标,锁定具身AGI极速推送!