新浪财经 09-02
GPT时刻终于降临具身智能!宇树智元同脑协同,10分钟零打断,不用人管!
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

(来源:机器人全球资讯)

今天,量子位发了一条视频拆解,标题很直白:《宇树智元共用一个大脑!神秘模型 Demo 炸场,10 分钟一镜到底》。

说实话,第一眼看到 "10 分钟一镜到底 " 这几个字,我是带着挑刺心态点进去的。具身智能这行,Demo 看太多了。精修、剪辑、遥操作、固定机位、脚本化任务,几乎成了行业潜规则。但这条视频不一样。它粗糙、真实、甚至有点 " 素 "。一个 15 平米左右的出租屋,家具密集,过道狭窄,两台不同品牌的机器人——宇树和智元——在同一个空间里干活。没有剪辑,没有切镜,没有人工指令介入。更关键的是,它们用的是同一个大脑。

看完之后,我缓了很久。不夸张地说,这条视频可能不只是 " 又一个 Demo",它更像是具身智能行业的一个新时刻。

量子位对这条视频的判断,我基本认同。在今天之前,具身智能的 "GPT 时刻 " 被谈论了无数次,每次都觉得还差一口气。但这条 10 分钟的一镜到底,让我第一次觉得,那口气可能补上了。不是明年,不是五年后,就是现在,在一个逼仄的出租屋里,两个被绳子拴着的机器人,用一个我们尚不知道名字的 " 大脑 ",完成了一次对全球具身智能行业的降维打击。

一、先别急着吹,这视频到底 " 真 " 在哪?

具身智能行业有个公开的秘密:

Demo 是可以 " 做 " 出来的。

固定机位、固定光线、固定物体摆放、甚至固定机器人运动轨迹,再加上后期剪辑和倍速播放,就能让一个只能走直线的机器人看起来像在自主探索。更隐蔽的做法是遥操作——人在隔壁房间戴着 VR 设备远程控制,机器人只是执行端,视频里却宣称 " 全自主 "。

所以当我看到 "10 分钟一镜到底 " 时,第一反应是:这团队疯了吗?

一镜到底意味着什么?意味着你不能剪辑,不能重拍,不能遮掩任何失误。意味着机器人每一秒的行为都是实时发生的,没有 "NG 重来 " 的机会。意味着机器人一旦中途卡住、撞墙、摔倒,整个视频就废了。

而这条视频不仅一镜到底,还用了两台机器人,在同一个狭窄空间里并行作业。这几乎是在用最苛刻的条件,向全世界证明:我们没有作弊。

图源:量子位

更 " 狠 " 的是,视频里出现了两个完全不同的本体:宇树 G1 和智元远征 A3。这两款机器人在硬件架构、运动自由度、传感系统上完全迥异,甚至在商业上是竞品。没有哪家公司会把自己的模型同时部署到两个竞争对手的机器人上,除非它想证明一件事——我的大脑是通用的,跟硬件无关。

这种 " 黑色幽默 " 般的选择,恰恰是整条视频最核心的宣言:这不是某个硬件厂商的专属算法,而是一套真正跨本体的通用具身智能。

视频的粗糙感也增加了可信度。没有电影级的运镜,没有精心设计的灯光,甚至有些画面看起来像手机随手拍的。机器人撞了一下玻璃,冰箱门没关严,围巾戴了两次才挂上。这些 " 不完美 " 反而成了最有力的证据:剪辑出来的东西,这些瑕疵早被修掉了。

但 " 粗糙的真实 " 只是这条视频最表面的一层。量子位的逐帧拆解里提到一个细节:拍摄场地是一个 15 平米左右的出租屋,家具密集,过道狭窄,连转身都费劲。这种环境,基本没有遥操作的可能性——因为根本站不下人。也没有预设脚本的空间——因为环境太复杂,变量太多,任何预设轨迹都会在十秒内撞墙。

这意味着什么?意味着这条视频从环境设计上,就 " 怼脸 " 排除了两种最常见的作弊手段。它不是 " 选择了一个简单场景来展示能力 ",而是 " 故意选择了一个最难的场景来证明能力 "。这种操作,在具身智能行业里,我从未见过。

还有一点值得注意:视频中有一台机器人是被牵引绳拴着的。这个 " 战损版 " 的设定,看似是随手一拍的不讲究,实际上却在传递一个信号——不需要精心的硬件准备,不需要完美的实验条件,甚至不需要机器人是全新的。这种 " 随便 ",恰恰说明团队清楚这套模型到底能做什么。

二、擦玻璃:一个动作,暴露了模型的真实水平

视频里第一个让我停下来的画面,是宇树机器人擦玻璃。

它拿的是刮水器,不是抹布。用过刮水器的人都知道,这个工具对力控的要求极高:轻了擦不干净,重了会有异响,角度不对还会留水痕。机器人擦了几下,发现有一处没擦干净。然后,它做了一个让我没想到的判断:脏东西可能在窗户外面。

于是它侧身、后仰、探头、展臂,把拿着刮水器的手伸出了窗外。

这个动作拆开看,至少包含三层能力。

精确的力控,是基础。刮水器贴窗移动的力度必须控制在很窄的区间。现有的具身模型,能把力控做好已经是极限。而视频里的机器人,在精确力矩控制的基础上,还同时完成了空间感知和动力学解算,这种 " 三位一体 " 的统一表现,在行业里几乎找不到对标。

空间感知,是第二层。伸出手臂的过程没有撞到窗框,说明它清楚知道自己和窗户之间的相对位置,知道窗外空间的边界在哪里。这需要在动力学解算的基础上,融合视觉、触觉、空间感知,形成统一的感知模型。量子位的原文里用了一个很精准的表述:" 模型把视觉、触觉、动力学等融合为统一感知 "。

自主推理与决策,才是最让我后背发凉的部分。它判断 " 擦不干净 " 的原因可能在外面,然后自己决定 " 把手伸出去试试 "。这不是预设脚本能做到的。预设脚本只会让机器人重复固定轨迹,不会让它 " 怀疑脏东西在窗外 "。

量子位的原文里有一句话让我印象深刻:

" 在没有办法擦干净的情况下,它立即推理决策,将手伸出窗外擦玻璃,这是我第一次看到了模型像人一样的一次自我推理、自我进化。"

这句话一点都不夸张。我们见过机器人拧螺丝、搬箱子、倒水,但那些都是 " 执行 "。而这个动作是 " 思考 " ——它遇到了问题,分析了原因,提出了假设,并付诸行动。这是一个完整的 " 感知 - 推理 - 决策 - 执行 " 闭环,而且是在一个从未训练过的场景中自主完成的。

这就是为什么我说它可能是 "GPT 时刻 "。GPT 之所以震撼,不是因为它能写出通顺的句子,而是它展现出了某种 " 理解 " 和 " 推理 " 的能力。同样,这个机器人展现出的不是 " 背下来的动作 ",而是 " 面对新问题时的自主求解 "。

仔细看视频里擦玻璃的整个过程,会发现更惊人的一点:机器人在发现 " 擦不干净 " 之后,并没有立即把手伸出窗外。它先是继续用刮水器在室内一侧擦了几下,确认问题依然存在,然后才做出了 " 脏东西可能在外面 " 的判断。

这个过程说明,它不是在随机尝试,而是在系统地排除可能性。这种逻辑推理的能力,在人类身上再普通不过,但在机器人身上,还是头一回。

三、闹钟响了:全球第一个实现 " 断点续做 " 的模型

如果说擦玻璃是 " 单点能力 " 的体现,那接下来这个细节,直接拉高了整条视频的技术上限。

视频中段,一声闹钟响了。两个机器人同时中断手头任务,开始执行新的指令:收纳桌面和冰箱。注意,这不是简单的任务切换。关键是,在完成新任务之后,它们又回到了被打断之前的任务节点,继续干了下去。

量子位的报道把这称为 " 断点续做 ",并且强调这是全球第一个实现的断点续做。

这个能力为什么重要?

因为传统的 VLA 模型最怕的就是长序列任务。任务一长,误差会累积,动作会漂移,一旦被打断,基本就崩盘了。而这两个机器人表现出来的,是人类级别的任务优先级判断和动态调度能力。打断,切换,恢复。三步走完,动作没有变形,任务没有丢失。

这意味着模型内部有一套稳定的全局任务调度框架,而不是简单的 " 走一步看一步 "。它能够记住 " 我刚才在干什么 "" 我接下来要干什么 "" 现在有新任务,我该怎么插进去 "" 新任务完成后,我该回到哪里 "。这涉及情景记忆、工作记忆、空间注意力等多个认知能力的协同。

更关键的是,这个能力不是预设的。视频里没有人在闹钟响之前告诉机器人 " 你待会儿要切换任务 "。闹钟是一个突发的外部刺激,机器人需要在几秒钟内理解这个刺激的含义,调整自己的任务优先级,并且在完成新任务后,准确恢复到原来的任务流。

在人类看来,这很简单。但在机器人领域,这是一个巨大的跨越。它意味着模型不再是 " 单线程 " 的执行者,而是一个能够处理多任务、动态调度、记忆上下文的 " 智能体 "。

量子位的文章里还提到了一个非常专业的判断:这个模型实现了 " 情景记忆与提取功能 ",能够回忆 " 某情景下,发生过什么 ";还具备 " 工作记忆和空间注意力 ",能并行保持和处理多个时空片段。这些认知科学的概念,第一次被用来描述一个机器人的实际行为,这本身就说明了问题的严重性。

我们再来拆解一下 " 断点续做 " 背后的技术难度。当机器人被闹钟打断时,它正在执行一个长链条的收纳任务。这个任务涉及多个物品、多个目标位置、多步操作序列。被打断后,它需要:

第一、识别闹钟是一个新的任务触发器。这个看似简单的步骤,实际上涉及对外部信号的语义理解——为什么一个声音信号意味着 " 要切换任务 "?这不是数据能教会的,除非模型内部有某种 " 规则理解 " 的机制。

第二、安全地中止当前动作。机器人不能把手里拿的东西随便一扔,而是要找一个合适的临时放置点,或者把物品先放在一个不影响后续任务的位置。

第三、切换到新任务。收纳桌面和冰箱,这本身就是一个复杂的多步任务,需要拆解、规划、执行。

第四、完成新任务后,回到原来的任务流。它需要记住 " 我刚才在收纳哪个区域 "" 已经完成了哪些物品 "" 还有哪些物品没有处理 "。这需要工作记忆的持续保持和更新。

这四步中的任何一步出了问题,整个任务链就会断裂。而视频里的机器人,就像人类一样自然地完成了这个 " 切换 - 恢复 " 的过程,没有停顿,没有卡住,没有遗漏。

四、两个 " 竞品 " 机器人,自主协作

整条视频最大的高潮,出现在智元给宇树戴围巾的那一幕。

宇树机器人身上挂满了要收纳的物品,双手已经占满。智元机器人走过来,拿起桌上的一条围巾,挂在了宇树脖子上。围巾太长,智元用双手捧起,宇树弯下腰,智元把围巾绕过宇树的头,挂好。

整个过程没有任何语言指令,也没有预设分工。

量子位的判断很精准:这不是提前设定好的剧本,而是模型在跨本体的两个机器人之间,自主探索出的协作方案。

宇树和智元,是两款硬件架构、运动自由度、传感系统完全不同的机器人。在商业层面,它们是竞品。但在这个视频里,它们共享同一个大脑,并且能够理解彼此的能力边界,自主分工,互相补位。

说明这套模型已经实现了跨本体的统一建模。它不关心自己控制的是宇树还是智元,它只是在调度 " 手 " 和 " 脚 ",分配 " 角色 " 和 " 任务 "。这是具身智能行业第一次真正意义上的 " 软硬件解耦 "。

这个能力一旦被验证为可复现,整个行业的竞争逻辑都要改写。过去,机器人公司要同时研发硬件和算法,算法和硬件深度绑定,换一个型号就要重新训练。而现在,有一套通用大脑可以适配任何硬件,硬件厂商只需要做好硬件,算法厂商只需要做好大脑,行业分工将彻底重构。

更重要的是,这种跨品牌协作展现出的 " 智能 " 远远超出了单机任务的范畴。它不再是 " 一个机器人在干活 ",而是 " 一群机器人在组队干活 "。它们能理解彼此的能力边界,能判断谁更适合完成某个任务,能在没有语言沟通的情况下达成默契。这是群体智能的雏形。

视频里还有一个细节:宇树够不到高处柜子时,智元主动走过来帮忙,把围巾从宇树脖子上取下,折了三折,放进了柜子。这个动作看似简单,但包含了极致的力度控制、空间感知和对物品属性的理解。围巾是软的,折叠它需要知道它的形状和材质,放进柜子需要判断柜子内部的空间。这些都不是预设脚本能覆盖的。

量子位的原文对这一幕的描述非常传神:

" 像毕业授勋一样,宇树弯腰低头,智元缓缓地拿下了围巾,放到了架子上。"

这个比喻很好,因为它捕捉到了两个机器人之间的某种 " 默契感 "。它们之间没有语言交流,没有显式的指令传递,但每一个动作都像是商量好的。

这种 " 沉默的协作 ",比任何预先编排的 " 机器人舞蹈 " 都要震撼。因为它意味着模型内部有一套共享的意图理解和目标推理机制,让两个不同的硬件本体在同一个任务空间中自主协调。

五、学会 " 偷懒 " 和 " 用工具 ",才是真智能

视频里还有两个细节,我觉得比那些大开大合的动作更值得琢磨。

一个是智元机器人拿起一条毛巾,尝试了三次,最终把毛巾挂在了自己肩膀上。它没有把毛巾拿在手里,因为那样占用手部空间,影响后续任务。它选择了 " 挂在肩上 " 这个更省力的方案。

另一个是宇树机器人整理拖鞋时,拎的是拖鞋的挂绳,而不是鞋体本身。因为拎绳子更省劲。

这两个动作的背后,不是训练数据里的 " 标准答案 ",而是模型在与环境交互中自主探索出的最优解。它理解了 " 省力 " 这个概念,并且主动寻找更高效的执行方式。这种对物理效率的自主追求,是智能的重要标志。

量子位的原文里有一句评论非常精彩:

" 在其他机器人还在为干活而精心打扮的时候,这个模型居然不光把活干了,甚至直接学会‘偷懒’了?这真是太聪明了。"

" 偷懒 " 在这里不是一个贬义词。恰恰相反,它是人类智能的重要特征。人类之所以能成为地球上最高效的生物之一,不是因为我们能干活,而是因为我们能想办法让干活变得更轻松。用工具、找捷径、优化流程,这些 " 偷懒 " 行为,本质上是智能对物理世界的深度理解。

再来看那个让我反复看了好几遍的 " 踢箱子 " 名场面。

宇树机器人够不到第三层柜子,它没有卡住,没有放弃,而是自己找了一个箱子,企图站上去。发现自己弯不下腰搬不动箱子之后,它一脚把箱子踢到了柜子边。

用脚踢箱子,这是一个没有任何教学、没有任何预设的动作。

它是机器人在了解自己身体边界之后,做出的一个 " 创造性 " 选择。这意味着模型不仅理解了物理世界的规则——箱子可以承重,站上去能增加高度——还理解了自身的限制——弯不下腰——并且找到了绕过限制的方法——用脚踢。

量子位的原文把这一幕称为 " 神性的一幕 "。我觉得这个形容一点都不夸张。因为在这一刻,机器人展现出了某种 " 自我意识 " 的雏形。它知道自己的能力边界在哪里,知道如何在环境中寻找工具来扩展这个边界,知道如何在尝试失败后调整策略。

这个 " 自我认知 - 环境理解 - 策略调整 " 的闭环,正是通用智能的核心特征。

六、技术底层的范式变化:跳出 VLA/WAM 之争

量子位的文章里提到一个关键信息:这套模型跳出了当前主流具身模型的固有框架。

目前市面上的主流路线,一类是 VLA,本质是 " 看图猜动作 ",靠海量数据做端到端拟合,缺乏物理推理能力,长序列任务会累积误差,陌生场景泛化能力差,且高度绑定专属本体。另一类是世界模型(WAM),试图先建模世界规律再规划动作,但存在 " 知行割裂 " 问题,面对需要物理动力学推理的实操场景,依旧依赖训练数据推演。

两者的共同底层缺陷是:数据驱动的任务拟合。所有动作都是基于海量数据的 " 概率猜测 ",而不是对物理规则的深度理解。

量子位把这套模型的能力总结为四个维度:

动力学建模:轨迹满足动力学可行性,能计算补偿力矩和前馈项,外推泛化能力极佳。

自我认知能力:不像 VLA 靠条件反射,也不像 WAM 靠时序统计,它像人一样思考 " 下一步最接近目标的动作是什么 "。

自适应能力:能补足因果推理,解决长尾问题,边做边进化。

自我进化能力:在完成任务的过程中,技能自增长,策略自进化。

支撑这一切的,是三个底层技术内核:物理约束动力学学习、跨本体统一建模、长时序鲁棒闭环。

这些名词听起来很学术,但翻译成大白话就是:

它不是在 " 背动作 ",而是在 " 理解物理 "。

它不是在 " 适配硬件 ",而是在 " 调度身体 "。

它不是在 " 执行脚本 ",而是在 " 解决问题 "。

文章里另一个信息更值得深挖:这套模型 " 只用了几十个小时的视频数据训练 "。这个数据量,在传统具身模型面前几乎可以忽略不计。

过去两年,全球具身智能行业都在赌一件事:只要数据量足够大,模型就能涌现出通用智能。OpenAI 在语言模型上的成功,让所有人都相信这个逻辑可以复制到机器人领域。于是我们看到各家公司在疯狂收集数据、构建数据管道、扩充训练集。

但这条视频里的模型,确实只用了几十个小时的数据,就实现了这样的泛化能力。整个行业的数据战略,可能都需要重新审视。Scaling Law 是否还适用于具身智能?数据驱动是否真的能通向通用智能?还是说,我们需要回到物理规则本身,去寻找新的范式?

报道里还有一句很尖锐的判断:" 美股大跌预告。" 虽然是调侃,但背后的含义是严肃的:具身智能的底层范式一旦被颠覆,那些押注数据驱动路线的公司,估值逻辑都要重新评估。

这可能意味着,过去一年行业里热火朝天的 VLA 与 WAM 路线之争,在这个神秘模型面前,突然变得没有那么重要了。因为无论哪条路线,都没有跳出 " 数据拟合 " 的底层逻辑。而这个模型,似乎直接跳到了 " 物理智能 " 的层面。

几十个小时的数据,换来这样的泛化表现,整个具身智能的技术路线,可能都需要重新评估。

七、行业的新时刻,可能真的来了

具身智能行业谈了很多年 "ChatGPT 时刻 "。但说实话,之前看到的多数 Demo,距离那个时刻还有明显距离。要么是短时长精修,要么是单任务演示,要么是遥操作撑场。

这条 10 分钟一镜到底的视频,第一次让我觉得,那个时刻可能比想象中更近。

不是因为某个单一动作有多惊艳,而是因为整套系统表现出来的完整性、鲁棒性和自主性,已经超出了我对当前技术水平的认知。跨本体协作、断点续做、自主使用工具、实时决策切换任务、在陌生复杂环境中稳定运行——这些能力同时出现在一条未经剪辑的视频里,意义远大于任何单项技术的突破。

量子位的文章在结尾有一段非常精准的总结:

" 当其他团队的 Demo 还在堆砌短时长、精修、单任务时,这个神秘视频已经完成了 10 分钟无修剪、跨品牌、多协同、全流程、自进化的真实实景落地。当其他模型还在‘靠数据猜动作’时,这套模型仿佛已经实现了完全的自我决策、自我学习、自我进化。"

这段话我读了三遍。因为它道出了这条视频真正的历史意义:它不是在某个单点上超越了同行,而是在整个范式上实现了代差级的领先。

我们再来看看这条视频对行业格局的潜在影响,其实已经不只是 " 潜在 " 了。

最直接的变化会落在硬件厂商身上。通用大脑一旦真的做到跨本体适配,硬件厂商的核心竞争力就从 " 硬件 + 算法 " 的整体方案,转向纯粹的硬件能力和成本控制。宇树和智元在这条视频里的 " 同台竞技 ",本身就是对 " 硬件绑定算法 " 模式的直接颠覆。

另一个可能被改写的是软件和模型公司的位置。一套模型能够驱动任何硬件,意味着模型的所有者掌握了行业话语权。就像 Android 之于手机行业,一套开放的通用大脑,很可能成为具身智能时代的 " 操作系统 "。

更深远的影响在技术路线层面。那些重仓 VLA 或 WAM 路线的公司,一旦发现自己的底层逻辑被动摇,面对的就是痛苦的转型。而那些一直在探索 " 物理智能 " 方向的小团队,可能突然发现自己站到了正确的赛道上。

最后,也是最快能看到变化的是落地场景。机器人真能像这条视频里展示的那样,在陌生环境中自主完成长链条任务,家庭服务、工业柔性制造、物流分拣这些场景的商业化时间表,会大幅提前。

当然,现在还不知道这个神秘模型出自谁家。量子位的文章结尾也在问:" 到底是谁!!!"

但这个问题,可能已经不那么重要了。

真正重要的是,这条视频让我们看到:具身智能的竞争,正在从 " 谁能做出更好的 Demo" 转向 " 谁能做出真正通用的具身大脑 "。硬件本体的竞争,会逐渐让位于底层模型的竞争。

当模型开始学会 " 偷懒 "、学会 " 用脚踢箱子 "、学会 " 给同伴戴围巾 " 的时候,我们讨论的已经不是 " 机器人能不能干活 " 了。

我们讨论的是:当机器人开始像人一样思考,这个行业的下一个十年会变成什么样。

从家庭全屋家务,到工厂柔性产线,到快递分拣,到医疗服务,一个真正通用的具身大脑,意味着机器人不再需要为每个场景单独开发算法,不再需要为每个硬件重新训练模型。它可以像人类一样,面对新环境、新任务、新工具,快速适应并完成任务。

这就是 "GPT 时刻 " 的含义:一个模型,多种能力,通用泛化。

今天,这条视频可能只是一个开始。但它已经足够让我们相信,具身智能的新时刻,真的来了。

当其他团队还在争论 VLA 和 WAM 谁才是未来时,这支团队已经用结果给出了答案:都不是。

未来属于那些真正理解物理世界、真正实现自主推理和自我进化的模型。

量子位在文章里有一句话,我觉得可以作为今天这篇文章的结尾:

" 一个不知道是哪里来的团队,仿佛颠覆了所有的技术路径,颠覆了 Scaling Law,做出了真正的具身‘智能’,逼近了具身智能的 ChatGPT 时刻。"

而这场变革的序幕,已经在这个普通的出租屋里,悄然拉开。

我们,正在见证历史。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

机器人 一条视频 量子位 作弊 黑色幽默
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论