
作者:SY
出品:明亮公司
"具身智能或者物理世界AI Agent的关键时刻已经不再遥远,不需要再等待五年或十年。" 自变量机器人创始人兼 CEO 王潜表示,五年后回看,机器人可能已经广泛进入千行百业和千家万户,承担大量人类体力劳动。
8 月 19 日 -23 日举行的 2026 世界机器人大会(WRC)上,王潜在题为《构建物理世界基础规模》的主旨演讲中,围绕具身基础模型、数据工程、AI Infra 及商业落地,分享了其对物理世界智能发展路径的最新判断。
在王潜看来,精细操作的复杂程度不亚于语言和高级思维。机器人既要处理三维空间、遮挡和长程规划,还要面对大量难以被视觉、语言准确描述的物理接触过程。因此,具身智能不能简单依靠语言模型或多模态模型迁移获得,而需要建立一套独立于数字世界基础模型、专门服务于物理世界的基础模型。
基于这一认识,自变量机器人将技术路线概括为三个选择:从面向单项任务的后训练走向大规模预训练,从分层系统走向完全端到端模型,从专用模型走向统一的通用模型。其 WALL-B 世界统一模型将语言、视频、3D 等输入,以及动作、语言、视频和三维信息等输出纳入同一体系。
除模型外,王潜重点强调了数据和AI Infra的重要性。他认为,高质量具身数据需要经历定义、采集、筛选、处理和训练反馈等复杂环节,更接近一种工业品。随着模型架构逐渐趋同,数据将成为具身智能的主要差异、核心技术和重要壁垒。
相关技术也已开始进入真实生产环境。王潜透露,自变量机器人的模型驱动方案已在头部物流公司的真实工业产线中形成商业闭环,相关场景的投资回报率达到或超过人工水平。与此同时,公司已为数百户家庭提供机器人保洁服务,部分机器人长期驻扎在用户家中,并根据真实反馈持续迭代。
在王潜看来,基础模型路线的价值已不只是面向未来的技术判断,而是在工业和家庭场景中开始得到验证。随着模型、数据、Infra 与硬件闭环逐渐成熟,物理世界AI Agent的关键时刻已经不再遥远。
以下为「明亮公司」根据现场速记精编后的演讲内容(未经演讲人审阅):
精细操作的复杂度不亚于语言
与去年相比,今年大会最突出的变化,是行业讨论的重点从硬件和全身运动控制转向机器人大脑与大模型。这意味着,模型在机器人体系中的核心地位正在成为行业共识。但具身模型应该采用怎样的架构,在整个 AI 版图中又应处于什么位置,仍有不同观点。
人类是研究智能的重要参考对象。这并不意味着机器人必须复制人的思维方式,就像飞机不必复制鸟的飞行方式一样。但人类在进化中形成的能力,有助于我们理解智能的本质。
今天具身智能需要解决的重要问题之一,是精细操作,也就是Manipulation。从人脑结构看,与精细运动控制相关的脑区规模很大,与语言和高级思维所占据的脑区面积接近,而且属于进化过程中较晚出现的高级区域。这意味着,精细操作具有极高复杂度,其难度不亚于语言和高级思维。使用工具和使用语言是人类区别于其他动物的两个重要标志,二者也代表了两个复杂度相近的智能方向。

精细运动控制的脑区体现(来源:WRC 论坛、自变量,下同)
精细操作首先需要处理三维空间、大量遮挡和不确定性,并完成多步骤规划与推理。与此同时,机器人在实际接触中还要面对大量隐性的物理过程。这也是 Manipulation 与 Locomotion,也就是精细操作与全身运动控制的本质差异。全身运动控制更多是在重力场中维持平衡。今天的机器人已经能够跑酷、攀岩,甚至完成部分人类无法完成的动作;但即使是相对简单的通用抓取,仍然是精细操作中的难题。
复杂的物理过程与巨大的参数空间结合后,很难被人工拆解。AI 发展历史表明,对于搜索空间高度发散的问题,完全端到端模型往往具有更好的表现。同时,人类神经系统也提供了类似启发。多数脑区采用逐层控制方式,但在手部和精细操作中,最高级与最初级神经区域之间存在跨层级的直接连接。端到端因此不只是人为选择的一条技术路线,在某种意义上也是自然演化形成的结果。
物理世界需要独立的基础模型
动作模态与视觉、语言存在很大差异。视觉和语言之间可以建立一定程度的映射,但动作模态无论在维度、表征方式还是物理属性上,都具有较强特殊性。例如,两个瓶子在视觉上可能只有很小差异,但翻转以后,一个会漏水,另一个不会。视觉上的细微变化,可能对应完全不同的物理结果,背后涉及大量无法直接观察的物理状态和推理过程。
互联网视频对物理接触的描述同样有限。异构数据虽然比普通互联网数据更接近真实动作,但仍然难以充分呈现物理过程。因此,数字世界的多模态模型很难直接迁移到物理世界。
基于这些特征,我们形成了三个技术判断:第一,精细操作的复杂度不亚于语言,需要从面向单项任务的后训练走向大规模预训练。第二,复杂物理过程很难通过完全分层的系统解决,需要从分层系统走向完全端到端模型。第三,精细操作高度综合,需要从专用模型走向统一的通用模型。

由精细操作的复杂性推导出的三个方向
基于这一思路,我们将动作、视频、语言、三维重建及其他表征纳入同一个模型,让不同任务和模态共享知识,学习跨越单一任务的逻辑关系与物理规律。WALL-B 世界统一模型由此形成,它支持语言、视频、3D 等多种输入,同时输出动作、语言、视频、三维信息及其他表征。
在我们看来,服务于物理世界的基础模型,应当独立于、或者说平行于数字世界中的语言模型和多模态模型。

物理智能无法简单从虚拟世界基础模型中涌现
物理过程通常发生在更小的时间和空间尺度上,大量信息无法被压缩到语言或普通视觉表征之中。仅依靠数字世界的数据,很难获得完整的物理世界知识。
我们曾多次尝试将数字世界的多模态模型迁移到物理世界,效果并不理想。物理世界需要自己的数据,也需要专门服务于物理世界的基础模型。物理智能不能简单涌现自虚拟世界。
具身基础模型开始出现Scaling迹象
我们一直在寻找具身智能 "ChatGPT 时刻 " 的迹象,现在,这些迹象已经逐渐清晰。具身基础模型正在沿着语言模型此前走过的路径发展,不仅表现出 Scaling 效果,Few-shot 能力也开始出现。
自变量机器人开源的 VLA 模型,在不进行专项后训练的情况下,仅依靠预训练 Checkpoint,就可以直接执行部分真实机器人任务。在 17 项真实任务评测中,随着预训练规模扩大,模型整体平均任务进度由 25.5% 提升至 51.1%。部分任务的完成率已经超过 80%,语义理解、刚体操作和长程任务等能力也随训练规模增加而提升。

模型整体平均任务进度随预训练规模扩
这些结果初步验证了端到端、统一基础模型和大规模预训练路线的可扩展性,也表明现有技术方向有机会通向物理世界的通用智能。在开源方面,我们已经开放 VLA 模型 WALL-OSS,包括模型参数、训练代码、部署工具以及部分数据和基础设施。相关内容覆盖环境搭建、权重下载、数据配置、微调和推理验证等流程。
除 VLA 模型外,我们还开源了 WALL-WM 世界模型。传统世界模型通常按照固定帧数或固定时间长度进行预测,但真实物理事件的复杂程度并不均匀。一个球从起飞到落地可能持续较长时间,而物体发生接触的瞬间虽然短暂,却可能包含更复杂的变化。WALL-WM以事件为单位进行建模,根据物理过程的复杂程度动态调整预测尺度和计算资源。这种方式不仅改善了未来状态预测,也提升了机器人操作能力。
我们推动开源,不是为了通过开源弥补竞争差距,而是希望加快整个产业的发展速度。开源可以培养人才,也可以让模型、数据和基础设施在共同使用中不断完善。
数据不是石油,而是工业品
行业经常将数据称为具身智能的"石油",这个比喻并不准确。石油是相对标准化的原材料,而具身数据必须经过定义、采集、筛选、处理和训练反馈,才能转化为模型能力。因此,数据不是简单的资源,而是一种高度复杂的工业品。

数据将成为具身智能的主要差异
生产一套真正能够用于模型训练的高质量数据,可能比训练模型本身更加复杂。完整链路包括定义需要什么数据、设计采集方式、判断数据质量、清洗和处理数据,以及根据模型训练结果反向优化采集流程。忽视其中任何一环,都可能导致大量采集结果无法转化为有效训练数据。
在数据采集方面,我们通过软硬件协同提升数据映射精度。人在采集设备上完成任务后,相关数据可以映射到机器人本体,并以较高成功率回放相同任务。实验显示,使用 10% 的真机数据和 90% 的无本体数据,可以追平 100% 真机数据的训练基线。在数据总量不增加的情况下,真机数据的使用效率得到明显提升。

用 10% 真机数据追平 100% 真机基线
具身数据也不能只依靠一家企业完成。当数据规模扩大到一定程度,就需要模型企业、硬件企业、运营平台和真实场景共同参与。这也是我们选择开源的重要原因。只有充分发挥产业生态和市场分工的作用,才能持续提高数据质量与规模。
AI Infra 将成为下一个瓶颈
随着模型规模和数据量增长,AI Infra 将成为具身智能必须解决的问题。
在语言模型领域,行业已经普遍认识到基础设施的重要性。具身智能的基础设施并不比语言模型简单,甚至可能更加复杂。因为无论是预训练还是强化学习,具身模型都必须与真实硬件交互,由此产生通信、时钟同步、训练稳定性和机器人集群管理等特殊问题。
我们已经搭建了一套面向具身大规模强化学习的在线学习框架,将机器人集群、数据中心、训练集群和模型服务中心连接起来。机器人在真实环境中执行任务并产生数据;数据经过处理后进入训练系统;新生成的Checkpoint再返回机器人端继续执行,由此形成持续迭代的闭环。

面向具身的大规模强化学习在线学习框架
我们还开源了分布式 Muon 优化器 Dmuon,希望降低分布式训练的通信开销并提升收敛效率。这项工作不仅服务于具身智能,对语言模型及其他深度学习任务也具有参考价值。这些看不见的基础设施,将决定具身模型能否持续扩大规模、提高训练效率,并最终进入更多真实场景。

基础模型已经开始创造生产力
模型、数据和基础设施最终需要在真实场景中证明价值。过去,具身智能很难证明自己能够在生产力场景中创造实际价值,相关应用更多集中在提供情绪价值,或者完成上一代机器人已经能够完成的任务。
我们目前落地的一个项目,是头部物流公司的真实工业产线。机器人需要处理大量不规则、堆叠且不断变化的包裹,传统自动化方案难以覆盖,人工分拣又存在劳动强度较高等问题。基于通用基础模型,机器人可以根据实时场景完成识别、抓取和分拣。目前,相关方案的投资回报率已经达到或超过人工水平。

进入真实工业产线
这一项目也验证了通用基础模型路线的部署效率。从数据采集、模型训练到生产部署,整个项目只用了三个月。基础模型的泛化能力,使其在具体商业场景中具备比专用模型和单点工程方案更快的部署速度和更低的开发成本。
基础模型的产业价值已经不是未来时,而是现在时。除工业产线外,我们目前已经为数百户家庭提供机器人保洁服务。除了与平台合作提供钟点服务,也有部分机器人长期驻扎在用户家中。机器人长期进入家庭后,可以持续获得用户反馈,并据此迭代模型和服务能力。工业和家庭场景的快速推进,很大程度上得益于基础模型、数据、Infra 和硬件形成的完整闭环。
我们相信,具身智能或者物理世界AI Agent的关键时刻已经不再遥远,不需要再等待五年或十年。五年后回看,机器人可能已经广泛进入千行百业和千家万户,承担大量人类体力劳动。我们希望通过自己的工作,让这一天更早到来。
| 发福利!添加下方明亮公司主编微信有惊喜!
估值叙事
从寒武纪走势看摩尔线程、沐曦股份|袁记食品和老乡鸡|阿里 " 千问 " 补课|雷军的声量,小米的估值|英矽智能 AI 制药|泡泡玛特做家电|理想 L9 Livis 的 AI 豪赌|蔚来击穿估值折价|美光与 AI 瓶颈叙事|腾讯市值叙事拐点|MiniMax 和智谱的估值锚|阿里的「割裂叙事」|智谱与 Anthropic|垣信卫星的估值锚 | Momenta 的「物理 AI」叙事|MiniMax 重估的关键指标|Kimi 和 DeepSeek 的估值溢价 | 联影构建 AI 资产| Kimi 寻求独立叙事|估值不依赖 SOTA | 蓝箭航天该对标谁|靠数据重估蚂蚁阿福
资金叙事


登录后才可以发布评论哦
打开小程序可以发布评论哦