GEN-1.5:具身基础模型迈入One-Shot学习时代

18 阅读22分钟

当机器人只需看一次就能学会新技能,物理世界的通用智能迈出了关键一步人类拥有一种非凡的能力:仅凭一个或几个示例就能掌握新的物理技能。Generalist AI最新发布的机器人基础模型GEN-1.5,展现出了类似的初步能力——它可以在几秒钟内从单个示例中学习新任务,无需梯度更新或微调。该模型在从演示中进行一次性和少样本学习方面表现出广泛的能力,同时具备零样本物理泛化能力。虽然当前的任务相对简单且时间跨度较短,但这是已知的第一个在规模上展现出一次性和少样本物理技能学习能力的模型。

GEN-1.5 Banner

图1:GEN-1.5官方发布封面。该模型标志着具身基础模型从"预训练+重微调"范式向"上下文即时学习"范式的转变。

一、从语言到物理:One-Shot学习的跨域迁移

在人工智能的发展历程中,大语言模型展现出的上下文学习能力(In-Context Learning)被视为一项标志性突破。以GPT-3为代表的语言模型,在仅提供一到几个示例的情况下,无需针对特定任务进行训练,即可在广泛的语言任务上达到可观的性能表现。根据Brown等人2020年发表的研究,GPT-3在一次性提示(One-Shot)设置下,平均可达到约45%的准确率;而在少样本(Few-Shot,约100个示例)设置下,这一数字可提升至约65%。这一能力的出现,标志着基础模型从"预训练+微调"范式向"上下文即时适应"范式的根本性转变。

然而,在机器人学领域,追求从一次或几次演示中泛化任务的能力已经持续了数十年。这一追求最早可追溯至1954年Unimate专利中的"示教引导"技术,以及1970年麻省理工学院人工智能实验室的Copy Demo项目。此后,大量研究工作在不同方向上探索了上下文学习在机器人操控中的应用,但这些尝试往往局限于特定的任务变体、特定类型的物体或特定的感知模态。在广泛的物理任务范围内,从仅一次或几次演示中闭环学习物理技能,并摆脱上述种种限制,长期以来被视为难以企及的目标。

Generalist AI团队在其最新发布的GEN-1.5模型中,首次在规模上实现了这一能力。该模型是一个大型多模态模型,能够处理视频输入(具备30秒的记忆窗口,同时整合其他传感器、语言和本体感知输入),并以100Hz的频率输出动作轨迹。这一架构设计使得模型能够在连续的感知-动作循环中实时适应物理世界的动态变化。

GEN-1.5机器人演示

图2:GEN-1.5在真实环境中执行操控任务。该模型通过3至12秒的单个演示即可学习新任务,无需梯度更新或微调。来源:Generalist AI官方推文

二、GEN-1.5的核心能力全景

GEN-1.5展现出的能力体系可以从三个维度进行理解:上下文即时学习、极少量梯度适应,以及物理泛化与即兴创造。这三个维度共同构成了一个从"零训练"到"轻量微调"的连续适应谱系,为机器人与人类的交互方式开辟了全新的可能性空间。

GEN-1.5三大核心能力

  • 上下文即时学习(In-Context Learning):

    将3至12秒的单个演示插入模型的30秒上下文窗口,模型即可立即执行任务,无需任何训练步骤。在10项多样化任务上,平均成功率达到59%(±10%标准差)。

  • 少步梯度适应(Few Gradient Step Adaptation):

    在1至10个梯度步骤内,利用1至5分钟的数据(约10至50次演示)即可将模型微调至新任务。平均成功率提升至83%(±9%标准差)。

  • 物理泛化与即兴创造:

    模型能够在新的物体实例、环境配置和操作策略之间进行泛化,甚至使用训练数据中从未见过的工具完成目标任务。

值得注意的是,上述所有能力均直接从大规模物理交互数据的预训练中涌现而出。研究团队并未针对任何一项能力进行显式训练:没有为提升上下文学习能力而设计的架构改动,没有内外层元学习循环迫使模型从极少数据中快速适应,也没有鼓励即兴创造的辅助目标。这种"涌现性"(Emergence)与大型语言模型中观察到的现象高度一致,暗示着物理交互数据可能同样具备驱动复杂认知能力涌现的统计结构。

三、物理提示工程:操控任务的新交互范式

GEN-1.5的上下文学习机制被研究团队称为"物理提示"(Physical Prompting)。与传统的语言提示(Language Prompting)类似,物理提示通过在模型的上下文窗口中插入传感器-动作序列(即传感器数据加动作轨迹)来指定任务。这些物理提示可以来自人类演示(使用手持夹爪记录)或机器人自身的执行记录。一旦提示被置入上下文,模型即可立即执行目标任务。

研究团队开发了一套直观的拖拽界面,用于选择和管理要插入模型上下文窗口的演示。这一界面使得非专业用户也能够通过简单的操作,将新的物理技能"编程"到机器人中。在公开的演示视频中,研究人员展示了通过物理提示让模型连续学习两项不同任务——拉开铅笔袋拉链和从袋中取钱——的全过程。模型在接收到物理提示后,能够流畅地在两项任务之间切换执行。

GEN-1.5实验场景

图3:GEN-1.5实验环境中的机器人平台。双机械臂配置配合多视角视觉输入,为模型提供了丰富的感知信息以支持精细操控。

3.1 组合泛化:物理提示的可编程性

物理提示不仅可以单独使用,还可以进行组合。当两个不同任务的演示被同时置于上下文中时(每个演示独立记录,中间没有过渡),GEN-1.5能够将它们串联成单一的连续行为,先执行第一个任务,然后自然过渡到第二个任务。关键在于,模型能够自主生成连接两个任务的中间动作——包括重新定位、重新抓取和错误恢复——这些中间动作在两个原始演示中均未出现。

这一发现具有深远的实践意义。它意味着,未来构建复杂的长时程行为可能不再需要为每个完整任务收集冗长的演示,而可以通过组装一个短小的、可复用的物理提示库来实现。这与语言模型中通过链式思维提示(Chain-of-Thought Prompting)组合推理步骤的做法形成了有趣的类比,可以被视为物理世界中的"提示工程"(Prompt Engineering)。

3.2 零样本仿真到现实的跨越

在机器人学领域,"仿真到现实迁移"(Sim-to-Real Transfer)是一个长期存在的挑战。传统上,这指的是在仿真环境中训练策略,然后将其部署到真实世界中。GEN-1.5展现了一种全新的零样本仿真到现实迁移能力:一个在仿真环境中记录的演示(可以来自脚本策略、强化学习智能体或人类遥操作)可以直接作为物理提示用于真实机器人,即使预训练数据中完全不包含仿真数据。

研究团队特别强调,GEN-1.5的预训练数据中既不包含渲染的仿真视频,也不包含仿真的物理动力学数据。然而,模型仍然能够被仿真器中的执行轨迹有效提示。被提示的行为随后像其他物理提示行为一样泛化到不同的机械手、新的物体位置和尺寸。对于一部分任务而言,这意味着演示不再需要在物理世界中收集——它们可以在仿真器中以任意方便的方式获取。

3.3 跨具身性的人机模仿

在某些情况下,上下文学习甚至能够跨越具身性鸿沟(Embodiment Gap):人类用自己的双手在机器人摄像头视野内演示任务,机器人随后能够用自己的机械手复现该任务。这一能力要求模型不仅要理解任务的目标,还要将人类的手部动作映射到自身不同的运动学结构上,同时适应视角和尺度的变化。

四、预训练的规模化:八个月的持续进化

GEN-1.5的能力并非一蹴而就,而是建立在长达八个月的持续预训练基础之上。Generalist AI团队在过去两年中专注于构建机器人预训练引擎,从第一性原理出发迭代具身基础模型的科学。在GEN-0阶段,团队首次观察到了可预测的规模化定律(Scaling Laws);五个月后的GEN-1则展示了通过后期训练达到99%以上任务成功率的能力,并初步展现出即兴智能的迹象。

GEN-1.5的初始预训练与GEN-1并行启动,至今已持续运行超过八个月。研究团队之所以持续投入预训练,是因为每一个跟踪的指标都在持续改进:模型吸收的数据量不断增加,计算效率持续提升,每一次架构和算法的精细调整都带来了阶梯式的性能跃升。趋势始终一致:新任务的数据效率越来越高,计算效率越来越高,泛化能力越来越强。

预训练曲线

图4:GEN-1.5在超过8个月的预训练过程中,验证集上的下一步动作预测误差持续下降。曲线展示了三个训练阶段中模型性能的阶梯式提升。数据来源:Generalist AI技术博客

随着预训练的深入,研究团队开始探索适应新任务所需的最少微调步数。他们发现,模型从需要数百步梯度下降,到仅需数十步,再到最终只需1个梯度步和1分钟的数据。据研究团队所知,以如此少的梯度步数学习技能的能力此前尚未被观察到。这一发现促使团队进一步追问:该模型能否完全无需训练,仅凭上下文和零梯度步数学习新任务?答案是肯定的,这一结果改变了研究团队对这些模型使用方式、潜在影响以及构建通用物理智能之路的思考。

五、少步适应:权重的微小重构

除了上下文学习之外,GEN-1.5还展现出极少量梯度步骤下的快速适应能力。在典型的机器人模型训练中,适应新任务通常需要数万甚至更多的梯度步骤。而基础模型的一个标志性能力正是能够通过少量微调快速适应新任务。虽然这种机制可以通过显式设计来实现(例如利用二阶梯度鼓励快速适应),但GEN-1.5的预训练基础已经能够在没有任何此类机制的情况下,在极少步骤内完成适应。

MDS嵌入

图5:少步适应将预训练权重推向不同任务方向。经典MDS嵌入展示了不同任务微调后模型权重在参数空间中的分布,每个任务对应独特的适应方向。数据来源:Generalist AI技术博客

在10步适应实验中,研究团队从5分钟的数据中采样序列,使用与预训练相似的超参数进行梯度下降训练。在极端的1步适应模式下,仅使用1分钟的数据,模型在未见过的任务上即可达到66.5%的成功率,且性能随批次大小和学习率的增加而提升。研究团队表示,他们并未针对适应过程进行专门的超参数调优或搜索,这些结果在很大程度上是"开箱即用"的。

一个引人注目的发现是:10个梯度步骤对模型权重的改变幅度极小——在未见过的任务上,权重变化不到0.15%。这表明微调过程并非在构建全新的表征,而是在轻微重构模型中已经存在的知识。这种"轻触式"适应(Light-touch Adaptation)与大型语言模型中观察到的现象一致:基础模型已经编码了广泛的技能,微调只是激活和组合这些已有知识的过程。

六、实验评估:十项任务的全面测试

为了全面评估GEN-1.5的能力,研究团队在10项多样化的物理操控任务上进行了系统测试。这些任务涵盖了日常生活中常见的精细操作,包括从钱包中取钱、折叠并压平纸张、拧开玻璃罐盖子、堆叠两个小杯子、用刷子清扫垃圾、翻开书封面、将方块刷入碗中、翻转手机、拉开铅笔袋拉链以及移除真空垫等。

任务成功率对比

图6:GEN-1.5在10项多样化操作任务上的成功率对比。蓝色柱表示10步梯度下降(5分钟数据)的结果,橙色柱表示上下文学习(3-12秒演示)的结果。数据来源:Generalist AI技术博客

实验结果显示,在一次性上下文学习模式下,模型在10项任务上的平均成功率为59%(±10%标准差)。这一成绩虽然尚不完美,但考虑到模型从未针对这些特定任务进行过训练,且仅需3至12秒的演示即可执行任务,这一结果已具有里程碑意义。在少样本学习模式下,经过10个梯度步骤和约5分钟数据(约50次演示)的微调后,平均成功率提升至83%(±9%标准差)。

任务名称上下文学习成功率10步微调成功率提升幅度
从钱包中取钱60.7%83.3%+22.6%
折叠并压平纸张50.0%69.3%+19.3%
拧开玻璃罐盖子60.0%94.5%+34.5%
堆叠两个小杯子67.0%75.0%+8.0%
用刷子清扫垃圾37.3%99.0%+61.7%
翻开书封面54.7%82.7%+28.0%
将方块刷入碗中60.8%71.2%+10.4%
翻转手机78.0%81.0%+3.0%
拉开铅笔袋拉链55.5%86.0%+30.5%
移除真空垫64.0%86.0%+22.0%

从数据中可以观察到几个有趣的模式。首先,"翻转手机"任务在上下文学习模式下即已达到78%的成功率,接近微调后的81%,表明该任务的结构与模型预训练中的某些模式高度匹配。其次,"用刷子清扫垃圾"任务在上下文学习模式下表现相对较低(37.3%),但经过10步微调后跃升至99%,说明该任务需要一定程度的参数调整才能激活相关的运动技能。第三,"拧开玻璃罐盖子"任务在微调后达到94.5%的高成功率,展示了模型对精细旋转操作的掌握能力。

七、物理泛化:超越演示的即兴智能

对于上述每一项任务,经过微调的模型都展现出了远超其演示数据的泛化能力。这种泛化不仅体现在新的物体实例、环境和机械配置上,更体现在对同一目标的根本不同操作策略上:替代性的抓取方式和运动轨迹、清除障碍物的行为,以及使用微调数据中不存在的工具。

7.1 新工具的即兴使用

在一个典型案例中,研究团队演示了使用刷子将方块扫入碗中的任务,并用5分钟的人类演示数据对模型进行了微调。当模型面对训练数据中从未见过的工具时,展现出了令人惊讶的即兴创造能力。当提供一根香蕉时,模型将其当作临时刷子使用,通过滑动香蕉将方块推入碗中。当提供簸箕时,模型的策略发生了更大的转变:它通过多种方式使用簸箕将方块舀起并倒入碗中。

研究团队指出,无论是微调数据还是预训练数据(据他们所知),都不包含以这种方式使用簸箕的案例。通过最近邻语言搜索在1,891,392个场景中查找最相似的活动,也未能找到与簸箕使用方式直接相关的预训练示例。模型完全自主地组合了一套全新的接触序列来完成任务,且没有任何语言指导。这种行为水平已经超越了简单的模仿,进入了"理解目标并寻找实现路径"的认知层面。

7.2 错误恢复与障碍处理

GEN-1.5在应对意外情况时表现出的鲁棒性同样值得关注。当一块乐高积木意外卡在指尖时,模型会使用另一只手将其移除。当碗被一张纸覆盖时,模型能够移开纸张完成任务,有时还会将纸张重新盖回碗上。值得注意的是,在5分钟的微调数据中并没有碗被纸覆盖的场景,预训练数据中也没有这一特定设置下的此类任务。

研究团队观察到,这种即兴适应能力在 lightly adapted 模型中表现得更为频繁和复杂。他们推测,这是因为轻量微调的模型更接近其预训练先验,能够在情况偏离演示时调用更广泛的行为库。这一发现与认知科学中的"迁移学习"理论相呼应:过度特化的系统在面对新情境时反而表现僵化,而保持一定通用性的系统则更具适应性。

7.3 双手协调与整理倾向

模型还展现出了一些更为微妙的行为特征。在拧开玻璃罐盖子的任务中,即使训练数据仅使用单手操作,模型有时也会使用双手以根本不同的接触和运动策略来旋转盖子。在将单个方块放入单个碗中的微调任务中,模型有时会表现出更具一般性的行为,例如按颜色或类别对多个方块进行排序——这可以被视为物理常识(Physical Commonsense)的一种泛化形式。

八、能力涌现的机制探讨

为什么上下文学习能力会从纯粹的预训练中涌现?研究团队提出了几种假设。类比语言领域,一种可能性是物理观察和动作的分布同样具有"突发性"(Burstiness)和齐普夫结构(Zipfian Structure),这种统计特性已被证明与语言模型中的上下文学习能力密切相关。另一种可能是,物理工作本身包含自然的重复循环,模型可能学会了检测和延伸这些模式,正如语言模型对一般序列所做的那样。

值得注意的是,模型在预训练中从未见过物理提示引入的时间不连续性。预训练数据由随机采样的连续片段组成(记录于家庭、仓库、工厂等不同场景),而物理提示在上下文中引入了训练时从未遇到过的时间跳跃。模型能够处理这种不连续性,暗示其已经学会了将上下文中的不同片段视为独立的"示例",而非连续的时间流——这正是上下文学习的核心机制。

"过去一定阈值的预训练之后,适应的成本变得可以忽略不计。从几秒钟数据的上下文学习,或一分钟演示的一个梯度步骤,已不再是传统意义上的任务特定训练。它更接近于提醒模型一些它几乎已经知道的事情,只需要极少的计算。这一事实改变了我们对这些模型使用方式、潜在影响以及构建通用物理智能之路的思考。"—— Generalist AI 研究团队

九、技术架构与数据引擎

GEN-1.5的技术架构设计体现了对物理世界实时性的深度考量。模型以视频作为主要感知输入,配合30秒的记忆窗口,这意味着模型能够在执行任务时回顾过去约半分钟的视觉历史。除了视频之外,模型还整合了其他传感器数据、语言指令和本体感知(Proprioceptive)输入,形成了真正的多模态感知融合。

在输出端,模型以100Hz的频率生成动作轨迹。这一高频率输出对于闭环物理控制至关重要:在动态变化的物理环境中,低频率的控制信号往往无法及时响应意外情况(如物体滑动、碰撞等)。100Hz的输出频率意味着模型每10毫秒即可生成一个新的动作指令,足以支持精细的实时调整。

支撑这一模型的是Generalist AI团队历时两年构建的数据引擎。该引擎能够从家庭、仓库、工厂等多样化场景中收集高质量的物理交互数据。预训练数据涵盖了广泛的日常活动和工业操作,为模型提供了丰富的物理世界先验知识。研究团队表示,他们并未针对特定任务对预训练数据进行工程化处理,而是让模型从大量、多样化的物理经验中自主学习。

十、行业影响与未来展望

GEN-1.5的发布在具身智能领域引发了广泛关注。从技术角度看,它验证了"大规模预训练+涌现能力"这一范式在物理世界中的有效性,为机器人基础模型的进一步发展提供了重要的实证支撑。从应用角度看,它预示着一个根本性转变:与机器人的交互可能从需要数月专业编程,简化为只需几秒钟的演示。

这种转变具有双重意义。首先是时间维度上的改变:机器人从"数月才能投入使用"变为"数秒即可执行任务"。其次是参与主体维度上的改变:从"需要专业知识的工程师"扩展到"任何能够进行物理演示的人"。如果与机器人的交互简化为简单地展示该做什么,那么机器人技术的民主化将迈出实质性的一步。

当然,当前的研究仍处于早期阶段。GEN-1.5处理的任务相对简单且时间跨度较短,成功率虽然可观但仍有提升空间。上下文学习得到的行为目前比微调后的模型更为脆弱,尽管它们已经能够在一定程度上泛化到扰动、即兴创造和错误恢复。研究团队坦承,他们尚不清楚规模化曲线的渐近线在哪里——更多的预训练是否会使适应更快、更便宜、更通用?从现有趋势来看,答案是积极的,但具体的边界仍有待探索。

研究团队将GEN-1.5视为一个具有深远科学意义的里程碑,并非因为更高的成功率,而是因为它代表了一个全新的泛化前沿——一个挑战我们对这些模型行为理解的前沿,尤其是在物理交互数据的预训练规模达到前所未有水平的条件下。从GEN-0到GEN-1再到GEN-1.5,每一步都增强了团队对"更多(和更好的)预训练将使任务适应更数据高效"这一假设的信心。GEN-1.5的出现表明,这一趋势可能比我们预期的更为强劲。

结语

GEN-1.5的发布标志着具身基础模型领域的一个重要转折点。它证明了在足够规模的物理交互数据预训练下,机器人可以像大语言模型理解文本一样,通过上下文学习理解物理任务。从单个演示中学习新技能的能力,从仿真到现实的零样本迁移,以及面对新工具时的即兴创造,这些能力的组合勾勒出了一个令人期待的愿景:未来的机器人将不再是需要数月编程的专用设备,而是能够像人类一样通过观察和学习快速掌握新技能的通用智能体。

这一愿景的实现仍面临诸多挑战,包括任务复杂度的提升、长时程行为的规划、以及更广泛场景中的鲁棒性等。但GEN-1.5所展示的技术路径——持续规模化预训练、利用涌现的上下文学习能力、以及轻量级的快速适应——为应对这些挑战提供了清晰的方向。在通往通用物理智能的道路上,GEN-1.5无疑是迄今为止迈出的最坚实的一步。

参考资料

  1. Generalist Team. "GEN-1.5: Embodied Foundation Models are One-Shot Learners." Generalist AI Blog, August 2026. generalistai.com/blog/gen-1.…

具身智能&世界模型blogjinxindeep.github.io/blog/blog20…