从新能源到具身智能:跨越感知、决策与执行闭环的系统工程挑战

15 阅读25分钟

评价一个新兴产业,最容易走向两个极端:一种是把技术演示当成商业成熟,把未来空间提前折算成今天的能力;另一种是看到产品不够好、企业尚未盈利、产业需要政策支持,就把整个方向归结为“骗补”和“讲故事”。这两种判断看似相反,本质上却犯了同一个错误:没有区分技术发展的真实性、商业化的成熟度,以及具体企业经营行为的可信度。

从大牛直播SDK(SmartMediaKit)所处的音视频基础设施视角看,我们对具身智能的判断是明确的:**这是一个有真实技术进展、真实应用需求和重要长期价值的方向,不能被简单归结为骗补骗人的行业;但它也远没有成熟到可以跳过工程验证、成本核算和安全边界的程度。**理解这一点,可以参考新能源汽车走过的道路,却不能机械复制新能源汽车的成功叙事。真正值得讨论的,不是具身智能会不会成为下一个热门概念,而是它还需要跨越哪些障碍,又为什么值得认真投入。

一、新能源真正留下的启示,不是“有补贴就会成功”

回顾新能源汽车的发展,政策支持从来不是一个需要回避的事实。2013年的新能源汽车推广政策,已经把购车补助、示范应用和充电设施建设结合起来,并明确提出根据规模效应和技术进步逐步调整补助标准。这背后的产业逻辑,是帮助新技术跨过早期成本较高、配套不足、应用规模有限的阶段,而不是证明某种技术可以永远脱离真实需求存在。

同样不能回避的是,产业发展中确实出现过骗补问题。2016年公开报道和专项检查披露过虚假申报、车辆尚未生产就申领补贴等案例。承认这些问题,并不会削弱新能源汽车的技术价值;恰恰相反,只有把真实研发、正常试错与故意造假区分开,才能保护真正做产品的企业。一个产业中出现骗补者,与这个产业本身是不是有价值,是两道不同的问题。

后来支撑新能源汽车扩大应用的,也不只是政策本身。按照国际能源署《全球电动汽车展望2026》的统计口径,2025年全球电动汽车销量超过2000万辆,约占新车销量的四分之一。该机构同时指出,2025年平均电池价格继续下降,制造效率、技术和化学体系变化、市场竞争以及矿产价格等因素共同发挥了作用。这样的发展不能证明政策已经不再重要,却足以说明:产业里存在真实的产品改进、制造能力积累和市场需求,不能用“补贴驱动”四个字解释全部。

因此,新能源给具身智能最有价值的启示,不是“当年被质疑的行业后来成功了,所以今天被质疑的行业也一定成功”,而是另一套判断方法:投入是否转化成了可复用的技术能力,部署是否产生了真实使用价值,规模扩大是否带来了成本和质量的改善,客户是否愿意持续购买。补贴可以帮助建立这些条件,但不能替代这些条件。新能源的成功提供了一种产业成长机制,却不是给任何新赛道预先签发的成功保证书。

二、具身智能与新能源相似,但它面对的问题更不统一

新能源汽车的电动化,本身并不要求先解决通用驾驶智能。即使驾驶任务仍由人完成,只要电驱系统、电池、安全性、补能条件和成本达到要求,产品就可以进入市场。换句话说,电动化可以在保留人类驾驶能力的前提下,逐步替换动力系统;具身智能则需要把一部分过去由人承担的感知、判断、操作和异常处理能力,也交给机器。

这意味着,具身智能不是简单地给机械设备增加一个聊天界面,也不是把视觉模型的识别结果接到机械臂上就算完成。它要处理的是一个连续闭环:环境发生变化,系统获取观测,判断当前状态,选择动作,动作改变环境,再根据结果修正下一步行为。视觉—语言—动作模型所尝试建立的,正是从感知和指令到机器人行动的连接;但建立这种连接,与获得适用于各种环境的可靠工作能力,仍然不是一回事。

还需要明确,具身智能不等于人形机器人。轮式移动操作平台、机械臂、专用作业设备,都可能承载具身能力。人形结构是否合理,要看它能否在目标任务中降低环境改造成本、扩大工作范围,而不是看它是否更接近人类的外形。对于某些工位,固定机械臂加上简单工装可能更可靠;对于另外一些需要移动、跨工位操作的任务,移动操作平台才可能体现优势。产品形态应当服从任务,而不是让客户的任务服从产品外形。

因此,说具身智能还处于发展初期,并不是否认工业机器人、机器视觉和运动控制已经积累的成果,而是说:**把这些能力与学习系统结合,形成能够跨环境泛化、长期自主运行、处理异常并产生可复制商业回报的产品,仍然需要大量工作。**这条道路既包含算法进步,也包含机械、电气、传感、通信、软件和运维体系的共同成熟,很难由其中某一项突破单独完成。

三、看懂世界与可靠地改变世界,中间隔着物理现实

对一个视觉模型来说,识别桌上有一只杯子,可以是一项语义任务;对一个机器人来说,拿起这只杯子却是一项物理任务。杯子是否装满液体,表面是否湿滑,杯壁能承受多大夹持力,遮挡后的把手朝向如何,拿起时是否会碰到旁边的物体,都可能影响动作。识别正确,只能说明系统知道“这是什么”,并不能自动说明系统知道“应该怎样做”,更不能说明它已经具备稳定完成动作的能力。

更深一层的问题是,机器人看到的状态并不完整。摩擦、质量分布、物体内部结构等信息,未必能从单帧图像直接获得,有时需要通过接触、试探和运动反馈逐步判断。任务一旦从熟悉工位进入新家庭、新仓库或者重新布置的空间,原先有效的策略还可能失效。Physical Intelligence在π0.5研究中,就把跨环境泛化作为核心问题之一:在既定训练场景中表现良好,并不意味着换一个环境后仍然可靠。

近期的公开结果,也能同时说明进展和距离。2026年9月17日,Figure披露了Helix 2.5在30个未见过的家庭中的评测,围绕收拾客厅、叠毛巾和整理床铺三类既定行为,其对照实验中的整项任务成功率从9%提高到56%。这里的“零样本”主要针对新环境和新物体,并不意味着任务本身从未训练;数据也来自厂商自身披露,不能等同于独立的工业验收结果。即便如此,它仍然呈现了一个重要事实:跨环境能力可以取得明显进步,但这与“任意家庭任务都能稳定完成”之间,仍然存在很大距离。

而且,算法之外还有无法绕开的物理约束。更大的算力会增加功耗和散热压力,更强的负载能力可能增加重量,更高的运动速度会提高制动和安全要求,更复杂的关节结构也可能增加维护难度。软件可以改善决策,却不能取消热量、惯性、材料寿命和电池容量的约束。具身智能的成熟,不是让机械结构变得不重要,而是要求软硬件之间形成更精细的协同。

四、从演示到生产,真正的门槛是长期可靠性

判断机器人是否成熟,不能只看它最精彩的一次表现,而要看它在明确条件下,能够多长时间持续完成合格工作。一次成功演示可以证明某种能力存在,却无法直接回答它每天能完成多少任务、出现多少次异常、需要多少人工干预,以及失败之后能不能自行恢复。能力展示与生产交付之间,缺少的不是更长的视频,而是一套完整的运行统计和故障处理机制。

可以用一个简单的理论例子理解其中的困难:假设一项任务包含50个步骤,每一步成功率都是99%,并且各步骤相互独立、失败后不恢复,那么整项任务全部成功的概率约为60.5%。这不是任何机器人的实测数据,真实系统中的错误也往往存在相关性,但它说明了一件事:局部看起来很高的成功率,并不自动构成长流程的可靠性。增加恢复能力、及时重规划、减少不必要步骤,往往和提高单个动作的成功率同样重要。

因此,成熟的系统不能只有“做对”的能力,还应当具备“知道自己没有做对”的能力。物体没有抓稳时能否检测出来,工具位置变化后能否重新定位,执行结果与预期不符时能否停止扩散错误,无法继续时能否向人类请求帮助,这些都应当进入产品设计。某些任务中,一次失败并不可怕;真正危险的是系统没有识别失败,却继续以为前提成立,后续动作越做越错。

这也是为什么可靠性不能只用一个平均成功率概括。验收时还需要关注任务完成质量、连续运行时间、人工介入频率和时长、故障恢复时间,以及低概率但后果严重的异常。具身智能从实验室进入产业,核心转变不是从“不会做”变成“会做”,而是从“有时能做”变成“知道何时能做、何时不能做,并且能够持续负责地工作”。

五、从音视频角度看,最大的误区是把“画面流畅”当成“感知及时”

具身智能与音视频技术的关系,远比“给机器人装个摄像头”复杂。在普通观看场景中,人们首先关注画面是否清晰、播放是否流畅;但在机器人任务中,视频还承担着描述当前环境状态的职责。同样是一张清晰图像,它究竟来自20毫秒之前,还是来自500毫秒之前,对系统的意义完全不同。对机器而言,画面不仅有分辨率和帧率,还有一个极其重要的属性:这份观测现在还是否有效。

这里需要关注的,不只是网络传输延迟,而是从传感器采集到系统使用这份观测之间的总时间。曝光、图像处理、编码、排队、传输、解码和推理,都可能占用时间。举一个纯粹用于说明的例子:如果目标与机器人之间的相对速度为每秒0.8米,那么150毫秒对应的相对位移就是12厘米。这不是某套系统的实际定位误差,因为系统也可能进行运动预测和补偿,但它足以说明:未经识别和处理的陈旧观测,不能仅凭“画面还在正常播放”就被认为适合用于当前动作判断。

时间戳因此不是附属信息,而是系统设计的一部分。ROS的图像消息定义明确要求,消息头时间戳应当表示图像采集时间;RTP同步机制也需要把媒体时钟映射到共同参考时钟。工程上,拥有PTS、DTS或者RTP时间戳,并不意味着相机、机械臂、惯性传感器和音频设备已经处于同一时间基准。采集时刻、传输时刻、处理时刻必须被正确区分,跨设备时钟映射和误差也必须得到管理,否则“同一时刻的图像与动作”可能只是表面上的同步。

另一个常见误区,是认为换一个低延迟协议就解决了全部问题。编码器的前视分析、帧重排序和缓冲策略,本身就可能影响延迟;编码质量、码率与延迟之间也需要按任务取舍,而不是简单追求压缩率最高。NVIDIA的编码开发文档就区分了不同延迟目标下的配置与取舍。对于需要及时观测的链路,应当管理队列长度和帧龄;但“优先最新帧”也不能被理解为随意丢弃有依赖关系的压缩帧,更不能不加区分地应用于录像和需要连续时序输入的算法。正确目标是尽快获得最新的、可正确使用的观测,而不是不顾语义和解码依赖地清空数据。

还要看到,人看的图像和机器使用的图像,不一定应当采用完全相同的处理方式。面向人的增强、裁剪、缩放和降噪,应当重新评估是否影响机器任务所需的细节、坐标关系与标定信息。音频也是如此:为了让远程人员听清讲话而采用的处理策略,未必适合保留设备异响、碰撞声等环境线索。这不是说所有视觉增强和语音处理都会妨碍感知,而是说具身场景必须按任务验证。音视频质量的评价标准,需要从“人看起来舒服”,进一步扩展到“机器能否据此作出正确判断”。

六、低延迟连接很重要,但不能把安全交给网络

从系统架构上看,应当区分本地运动与安全控制、设备侧或边缘侧感知、远程观察与协作,以及云端训练和管理。它们可以相互连接,却不应该具有相同的时间要求和失效后果。Google DeepMind在本地机器人模型相关说明中,也强调了本地运行对网络依赖的降低,以及模型与底层安全关键控制器之间的配合。这说明,模型能力与可靠控制之间仍然需要明确的系统分工。

对于必须快速响应的本地视觉任务,并没有必要为了“统一上云”,强行让图像走一遍编码、公网传输和远程解码。更合理的设计可能是:本地图像直接进入感知处理,同时生成另一条压缩视频链路,供远程人员观察、协助和回放。前者关注感知输入的完整性、时效性和坐标一致性,后者关注带宽、交互体验与连接稳定性。共享采集源,不等于必须共享全部缓冲策略和处理路径。

人工介入也不应当被简单视为“技术造假”。在能力尚未覆盖所有异常情况的阶段,远程协助可以是一种合理的产品机制,也可以为后续改进留下高价值案例。真正需要警惕的是隐瞒人工操作,把有人持续接管的系统宣传成完全自主系统。只要边界清楚、介入成本可核算、接管过程可追溯,人机协作就可以成为产业化过程中的正常形态,而不是非黑即白的判断依据。

但远程协作不能只解决“看见”和“发指令”。控制权限归谁、旧指令何时失效、重复命令如何处理、执行结果如何确认、连接中断后进入什么状态,都需要由机器人控制系统和业务系统共同设计。尤其要注意,安全状态并不总是简单断电:正在承载物体的设备,可能需要受控保持或受控撤离。音视频链路可以帮助人和机器建立及时联系,却不能代替经过验证的运动控制、风险约束和安全机制。

七、具身智能的数据价值,不在于录了多少小时视频

具身智能为什么还需要较长时间积累,一个重要原因是:记录世界与学习行动,并不是同一件事。一段人类拿起杯子的视频,可以提供外观、动作顺序和空间关系等信息,却不会自动给出机器人应当采用的关节控制量、接触力、夹持余量,以及失败后的恢复策略。人类视频、仿真数据和机器人实际经验可以相互补充,但不能因为它们都包含图像,就认为它们具有完全相同的训练价值。

真正有价值的任务数据,应当能够回答:机器人当时看到了什么,处于什么状态,系统下发了什么动作,执行机构实际完成了什么,环境怎样变化,任务是否成功,为什么发生了人工介入。图像、声音、关节状态、控制指令、触觉或力反馈,需要在时间和任务语义上建立联系;模型版本、传感器标定、设备状态也需要能够追溯。否则,留下来的可能只是录像档案,而不是可以可靠用于分析和训练的经验。

更难的地方在于,理想轨迹并不足以覆盖实际部署。机器人在某一步产生一点偏差,下一步看到的环境就可能偏离训练示例;如果数据里只有“专家从头到尾都做对”的过程,系统未必学会如何从偏差中恢复。这也是为什么失败片段、接管原因和恢复动作值得特别重视。跨机器人共享数据已经有公开研究基础,例如Open X-Embodiment汇集多种机器人数据并探索跨本体学习,但这种共享并不意味着不同机构、不同传感器和不同机械结构的数据可以无条件互换。

从音视频基础设施的角度,我们更看重的是能否建立一条可验证的改进链路:真实任务产生观测和执行记录,记录帮助定位问题,问题转化为训练或工程改进,再通过固定测试与实际部署验证效果。这里最重要的不是“数据越多越好”,而是新增数据能否解释失败、覆盖新的环境变化,并真正降低下一次执行的不确定性。只有形成这样的积累机制,早期投入才可能逐步转化成长期能力,而不是反复拍摄相似的演示视频。

八、商业化不必等待万能机器人,但必须算清真实成本

具身智能的前景,并不取决于它能否在短期内进入每个家庭,完成所有家务。更值得探索的,是那些任务边界清楚、产出能够验收、失败能够控制、人工成本或环境风险较高的具体工作。商业化可以先在有限范围内成立,再逐步扩大能力覆盖。用“还不能像人一样什么都会”否定全部价值,与用“已经会做一件事”宣告全面替代人工,同样不严谨。

真实部署已经提供了一些有意义的工程材料。Figure在2025年11月披露,其机器人在宝马工厂的应用涉及钣金件上料,累计装载超过9万件零部件,运行超过1250小时,并参与了超过3万辆X3汽车的生产流程。这里的“参与生产”不能被扩写成“机器人独立制造了3万辆汽车”;这些数据也不能直接证明所有工厂场景已经实现经济可行的无人化。更值得关注的是,厂商披露了运行中暴露的前臂结构、布线与热管理问题,以及这些经验如何影响下一代设计——这才是从样机走向产品应当出现的工程积累。

商业核算的核心,也不应当停留在机器人卖多少钱。设备和集成投入需要合理摊销,维护、能耗、算力、网络、人工接管和失败损失都要进入同一核算周期,再与合格任务完成量对应。一个采购价更低的机器人,如果需要频繁维护和持续照看,未必更便宜;一个单次动作稍慢的系统,如果能够稳定工作、减少停机和返工,反而可能创造更高价值。客户最终购买的是可接受成本下的合格产出,而不是机械结构的复杂程度。

人工介入的成本尤其不能被隐藏。不能仅凭“一位操作员可以查看十台机器人”,就推导出“一人能够稳定管理十台机器人”。真正需要计算的是每台设备请求帮助的频率、每次处理时长,以及多个设备同时异常时的排队和停工损失。如果一种环境变化会同时影响一批设备,平均数据可能看起来不错,集中故障时却会出现明显瓶颈。商业化验证应当面对这些实际情况,而不是只选择最顺利的运行时段。

因此,早期落地未必需要追求最通用的外形、最复杂的动作或者最少的场景约束。调整工装、改善照明、重排流程、采用更合适的移动底盘,都可能比继续增加模型复杂度更有效。**真正的产业化,不是坚持让机器人以最像人的方式工作,而是找到可靠、经济、可维护的任务完成方式。**当客户愿意复购、扩大部署,并把系统纳入日常生产,而不是只用于展示,商业价值才获得了更扎实的验证。

九、SmartMediaKit的机会,是把音视频能力变成可靠的工程连接

站在大牛直播SDK(SmartMediaKit)的角度,我们不认为进入具身智能领域就意味着必须去做机器人“大脑”,更不应该把音视频SDK包装成运动控制系统。我们更适合发挥的价值,是帮助设备、远程人员和上层系统之间建立可靠的音视频连接,减少采集、编解码、传输、播放、录像以及跨平台适配中的重复工程。SmartMediaKit已有公开的相关SDK模块和接口,包括RTSP、RTMP、WHEP、WHIP相关能力、轻量级RTSP服务、录像,以及部分模块中的外部YUV、PCM等数据接入能力;具体支持范围仍应以各平台、各模块接口为准。

这些基础能力可以支持具身项目中的多类需求:研发阶段观察设备行为,调试阶段把画面与异常日志联系起来,运行阶段帮助远程人员了解现场,问题发生后通过录像复盘过程。对于需要连接外部视觉算法的项目,也可以围绕图像数据接口设计处理链路。但这里必须区分“已有可复用模块”与“机器人项目仍需完成的系统集成”:时间同步、机器人状态关联、任务标注、控制授权和安全策略,并不会因为接入了一个音视频SDK就自动成立。

面向具身场景,音视频产品的评价维度也应当进一步变化。不仅要知道连接是否成功,还要知道最近一帧是什么时候采集的;不仅要知道播放是否卡顿,还要区分网络中断、上游停帧、解码等待和处理排队;不仅要保存画面,还要让录像能够与任务、设备状态和故障事件建立联系。这些应当被视为项目架构和产品演进的方向,而不是未经实现与验证就提前宣布的完整能力。

这正是基础设施企业值得投入的地方:当机器人本体、模型和业务流程不断变化时,把那些不应该每次从头解决的问题沉淀下来。底层连接做得越清楚,上层团队越容易判断失败来自感知、模型、机械还是网络,也越容易进行替换、比较和持续改进。SmartMediaKit的价值,不在于宣称音视频比模型更重要,而在于让模型、设备和人的协作少一些不可解释的问题,多一些可验证、可复用的工程基础。

十、真正看好具身智能,就要同时坚持耐心与验证

回到“是不是骗补骗人的行业”这个问题,需要明确反对的是把整个产业一概否定,而不是替所有企业、所有项目作担保。一个研发项目最终没有成功,不能仅凭结果就认定它从一开始是骗局;但把远程人工操作隐瞒为完全自主,把试点包装成规模化量产,把无法核验的数量当成商业成绩,也不能因为处于新兴产业就获得豁免。技术探索可以存在不确定性,信息披露却应当尽可能清楚。

对产业支持而言,值得鼓励的应当是能够沉淀下来的能力:关键部件可靠性、有效数据与测试体系、真实环境验证、可复用的软件基础,以及经得起复测的任务表现。不能只看采购了多少台设备、举办了多少次发布会,还要看设备是否真正运行、运行结果是否有用、问题是否被发现并改善。基础研究可以暂时没有利润,早期工程也可以需要支持,但研究目标、阶段进展和应用效果应当采用与其性质相适应的方式评价。

我们之所以看好具身智能,并不是因为它与新能源一样获得关注,而是因为它试图解决一个有价值的问题:让机器不只处理数字信息,还能够在更复杂的物理环境中理解任务、完成操作,并在实践中改进能力。只要这类能力能够在越来越多的具体任务中成立,其价值就不必等待“通用机器人”这个终极目标完全实现。一个行业可以先通过有限但有用的能力创造收益,再用这些真实应用支持后续进步。

但这种前景判断,不意味着每一种技术路线都能成功,也不意味着每一家企业都能跨越工程与商业门槛。新能源可以提供关于制造、配套、应用和成本演进的经验,却不能替具身智能完成自己的验证。真正的长期主义,不是对今天的缺陷视而不见,而是能够解释缺陷在哪里、改善路径是什么,以及怎样判断改善确实发生了。

从SmartMediaKit的视角看,具身智能最值得期待的时刻,未必是机器人完成某个令人惊叹动作的那一秒,而是它在真实场景中持续工作,遇到问题能够被发现,无法处理时能够安全请求帮助,运行经验又能够推动下一轮改进的那一天。它还有很长的路要走,但“路还很长”不等于“方向是假的”。正因为相信这一方向具有长期价值,我们才更应该对今天的能力边界保持诚实,对真实进步保持耐心,对每一次交付保持严格。