今天聊一个挺有意思的开源项目——ACE-Ego,大晓机器人和港中大MMLab联合搞的。简单说,就是让机器人通过看人类的第一人称视频(就是头戴摄像头拍的)来学操作,效果还不错,几个基准上都刷了新高。
搞过机器人训练的朋友都懂,采集真实的机器人操作数据有多费劲。
一个机械臂动一动就得有人盯着,标注、清洗、反复调试,时间和钱哗哗地流。相比之下,人类日常行为的视频——比如你戴个运动相机录自己收拾桌子、打包快递——这种数据太容易获取了,网上大把大把的。
但问题来了:人和机器人的「身体」不一样啊!
人类有手有五指,关节灵活得一匹;机器人可能是两只夹爪,也可能是三指灵巧手。人的动作空间和机器人的动作空间,基本是两个次元的东西。直接拿人类视频去训练机器人模型,等于让猫学游泳——不是不能,但需要对路。
ACE-Ego 怎么解决这个 mismatch
ACE-Ego 的思路其实挺直接,说白了就是三步走:
第一步:把人类视频「翻译」成机器人能懂的指令。
他们搞了一套视频到动作的转换管线——先用3D重建把手部动作提取出来,再映射成机器人末端执行器在相机坐标系下的动作。说白了,就是不管你用的是人手还是机器爪,只要在同一个视觉坐标系下表示,模型就能学。
这个做法有个很大的好处——保留了"观察者视角"的一致性。机器人头部摄像头看到的画面,和人类头部摄像头看到的画面,在空间关系上是可比的。
第二步:处理不同「身体结构」的差异。
ACE-Ego 用了一个叫做 morphology conditioning 的技巧——把机器人的URDF模型(就是描述机器人关节结构的文件)编码成向量,喂给动作预测模块。这样一来,同一个基座模型可以适配不同的机器人形态,换一个身体也能用。
第三步:对数据质量做加权训练。
人类视频提取的「伪动作」肯定没真实机器人数据那么准,但胜在量大管饱。ACE-Ego 的做法是——真实机器人数据做主损失,人类伪动作数据做辅助损失,并且根据质量打分动态加权。质量高的伪动作多学点,噪声大的少学点,稳得很。
效果怎么样?看图说话
直接上数据:
在 RoboCasa GR1 TableTop 基准上,ACE-Ego 平均成功率 72.8%,超越了英伟达 GR00T(47.6%)、京东 JoyAI-RA(63.2%)等一众选手。
在 RoboTwin 2.0 的高难度测试中,ACE-Ego 达到 90.62%,比最接近的 JoyAI-RA 还高出一截。
说人话:装鞋入盒、塑料袋打包这种实际零售场景里的长周期操作,它已经能稳定完成了。
这些不是简单「抓起来放下」的动作,而是需要多步协调的复杂任务——比如把鞋子塞进鞋盒还要调整位置,或者把散装的商品装进塑料袋再封口。这种程度的操作,对机器人来说其实非常难。
为什么这事儿值得关注
我个人觉得,ACE-Ego 最有价值的不是刷榜,而是它给机器人领域指了一条更务实的路:
与其花大价钱采真实的机器人数据,不如先把海量的人类行为视频用起来。
6,000多小时混合数据中,有1,480小时是来自人类第一人称视频的伪动作数据。这个量级,靠真实机器人采集是不可能完成的。
而且他们的方法很"工程友好"——开源、代码公开、论文可复现。对于做机器人应用开发的朋友来说,完全可以基于 ACE-Ego 做二次开发,在自己的机器人平台上微调部署。
技术细节速览
-
• 模型架构:基于预训练的VLM(视觉语言模型)+ 动作专家头,预测连续的动作片段(action chunk)
-
• 统一动作空间:一切都在相机坐标系下表示末端执行器的 delta 位移
-
• 数据构成:4,530小时机器人+仿真数据 + 1,480小时人类第一人称视频伪动作数据
-
• 实物部署:在双臂 ARX 机器人平台上验证,头戴单目摄像头,6个任务平均成功率78.3%
项目链接:acerobotics-vla.github.io/ACE-Ego/[1]论文:arxiv.org/abs/2606.17200[2]
你在项目里用过类似的 VLA 模型吗?或者对机器人操作训练有什么想法?评论区聊聊~
引用链接
[1] acerobotics-vla.github.io/ACE-Ego/: acerobotics-vla.github.io/ACE-Ego/*`[…