WRC观察|机器人的“大脑”训练路径之争:VLA之后,世界模型会是答案吗?
2026世界机器人大会上,机器人竞争正从“会动”转向“会想”。VLA之外,世界模型成为行业热议方向,企业开始探索让机器人理解物理规律、预测环境变化。
8月19日—23日,2026世界机器人大会在北京亦庄举行,在今年的大会上,关于机器人“大脑”的讨论明显升温。
“去年大家对于模型在整个机器人里的核心地位还有讨论,今年基本没有太多讨论了,所有人都在谈大模型。”自变量机器人创始人、CEO王潜在WRC主论坛上表示。
这也是财闻在本届WRC通过采访企业家和观察企业展台发现的一个变化。
相比过去集中展示跑跳、运控和本体性能,今年不少企业开始把VLA、世界模型、物理智能摆到更核心的位置。行业争论的重点,也从“机器人需不需要大模型”,转向“什么样的模型才能真正理解物理世界”。
从“会动”到“会想”
过去两年,VLA是具身智能最受关注的技术路线之一。VLA即“视觉—语言—动作模型”,核心思路是让机器人看到环境、理解指令,再直接输出动作。相比传统机器人把感知、规划和控制拆成多个模块,VLA试图用一个模型完成从“看懂”到“行动”的过程。

星海图创始人、CEO高继扬在演讲中将具身大模型的发展概括为三个阶段:语言模型与传统控制结合、端到端VLA,以及世界模型。
他认为,VLA虽然打通了视觉、语言和动作,但当前仍高度依赖模仿学习。机器人要学一个任务,往往需要大量示范。一旦换到陌生环境、新物体或新任务,泛化能力就容易下降。
宇树科技创始人王兴兴在主论坛上也将泛化能力列为当前机器人发展的最大瓶颈。固定场景中,通过大量数据训练,一些任务已经可以做到较高成功率,但环境稍有变化,能力就可能明显下降。
从“模仿动作”到“理解世界”
世界模型因此成为本届WRC最频繁出现的技术概念之一。
如果说VLA更像是在学习“看到这种情况后应该怎么做”,世界模型试图进一步回答:“如果我这样做,接下来会发生什么?”
人拿起一个杯子时,不只是识别“这是杯子”,还会判断重量、开口方向、是否装有液体,并预判倾斜后可能发生什么。这些对于人类近乎常识的信息,却很难仅靠动作模仿获得。
王潜举了一个形象的例子:两个瓶子从视觉上看可能只有几个像素差异,但翻转之后,一个会漏水,一个不会。对真正需要操作物体的机器人来说,这会直接改变下一步动作。
在他看来,真实世界中的动作涉及三维结构、遮挡、接触、摩擦和物体内部状态,Action与Vision、Language存在明显差异,因此不能简单期待把数字世界的多模态模型迁移给机器人,就自然获得物理智能。
智澄AI创始人、CEO胡鲁辉则把问题进一步区分为“泛化”和“理解”。

在采访中他对财闻表示,增加数据同样可以带来一定泛化,但世界模型更重要的目标,是理解物理属性、动力学和因果关系。人类并没有见过世界上所有情况,却仍能处理大量陌生任务,关键就在于不是简单依赖数据覆盖。
不过,“世界模型”并不是一条已经收敛的路线。
智澄AI采用JEPA方向,希望在抽象表征中学习物理规律;星海图提出“世界动作模型”,在预测机器人动作的同时预测环境未来变化;自变量更强调建立独立于数字世界基础模型的“物理世界基础模型”。
本届WRC上,千寻智能选择“VLA+世界模型”融合路线,星尘智能发布的Lumo-2也将世界动力学预测放进隐空间,在生成动作前先预测环境变化。
从这些路线看,行业的共识并不是“世界模型取代VLA”,而是单纯依靠视觉、语言到动作的直接映射,可能不足以支撑开放环境中的通用机器人。世界模型正在成为补足物理理解和长程预测能力的重要方向,但究竟成为新的基础模型,还是与VLA融合,目前没有统一答案。
真正的答案还在真实世界
世界模型希望减少机器人对海量示范数据的依赖,但它本身仍绕不开数据。

王潜并不认同“数据是具身智能的石油”这一常见说法。在他看来,机器人数据更像一种复杂的工业品。什么任务值得采、记录哪些关节和力矩信息、失败数据如何处理,都直接影响最终模型能学到什么。高质量数据的生产复杂度,甚至可能超过模型本身。
模型越复杂,另一个工程问题也越来越突出,机器人的“大脑”最终必须运行在机器人身上。

黑芝麻智能首席市场营销官杨宇欣告诉财闻,目前机器人所需算力差异很大,从几TOPS到上千TOPS都有。依赖遥控或者简单规划的机器人算力需求不高,但如果希望机器人搭载参数规模更大的VLA,真正自主完成任务,算力要求会明显提升。未来如果部署更强的世界模型,这一趋势还可能继续。
机器人却不是云端服务器。更多算力意味着更高功耗、更大的散热压力和更快的电池消耗,而真实物理操作又对延迟极为敏感。
最终,判断哪条“大脑”路线成立,仍要回到最朴素的标准:机器人能否在真实环境中长期、稳定完成任务。
杨宇欣认为,今年行业真正需要证明的,是机器人“到底能不能真的在真实场景里工作”。展台Demo能证明一种可能性,但商业应用要求机器人面对环境变化、长时间运行和异常情况时,仍能独立完成工作。
这也是世界模型真正需要接受的检验。换一个没见过的物体,机器人还能不能完成任务?动作失败后,能不能判断发生了什么并重新规划?同一套“大脑”能否迁移到不同本体和场景?
今年WRC释放出的信号已经比较清晰,机器人大脑的竞争,正在进入“理解世界”的阶段。世界模型成为最热门的候选方向之一,但距离成为行业统一答案,还有很长的路要走。


