新浪财经 5小时前
深朴智能创始人兼CEO李晓飞:面向人类生活空间的AI原生具身智能
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

来源:睿见 Economy

2026 世界机器人博览会(WRC)于 8 月 19-23 日在北京亦创国际会展中心举行。"AI 大模型赋能机器人与具身智能产业新范式专题活动 " 在博览会同期举办。深朴智能创始人兼 CEO 李晓飞出席并演讲。

以下为演讲实录:

李晓飞:大家下午好,感谢崔老师的引见。

我刚才看了一下议程,我应该是今天下午最后一个演讲嘉宾,我觉得可以稍微轻松一些,我这边的主题非常简单,就两部分,也不是过多地介绍公司或各个方面,两部分想聊一下我们的感受。

一方面,未来具身机器人如何走进家庭,这样一个大家热烈讨论的话题。第二部分,深朴看待这个议题我们一步一步怎么做的。

大家可能很清楚,听了一下午的报告,具身智能不仅仅是模型,还有很厚的产品层、应用层的一些工作,如何基于模型之上打造一个系统化的工程,让具身智能走进家庭是非常重要的话题。这里面除了全栈的系统闭环能力、商业闭环能力之外,还要考虑人本终局的思路,这点不过多展开。

这页想重点跟大家聊一聊,为什么我们选择家庭终局难而正确的路线。

一会儿我会介绍一下我的过往背景,我是深朴智能的创始人兼 CEO,也是最早一批国内做 AI 做自动驾驶的博士,博士毕业之后一直在做自动驾驶相关的创业,包括上一代机器人。从 2016 年到 2025 年将近九年十年的时间,经历了自动驾驶跌宕起伏,从最初的初期,到走进各行各业,到走千家万户等等阶段,所以我自己会觉得未来 5 到 10 年具身机器人走进千家万户这是大概率的事件。

这个过程中走进千家万户和各行各业一定是 L3、L4 级别的高等级的具身智能。基于这种高等级的具身智能整个的达成路径到底有哪些。我们自己认为这里面大概会有三类,第一类类似于 ChatGPT 一样,在仿真的环境、虚拟环境或者在人类视频 video 的环境里获取海量的数据,在这样虚拟环境里达到非常高的智商,在各行各业快速应用和普及,这种我觉得一定会有一些团队坚持。从我们的角度来看,我们会觉得从自动驾驶的十年,或者机器人这十年来看,我们认为 ChatGPT 这种模式不一定适用物理 AI,我们认为物理 AI 需要在真实环境里去迭代,需要在真实环境里面获取海量的反馈数据,这种情况下我们坚信一定走到场景里面形成 L2 级别的应用,从 L2 逐步迭代到 L4 这条路径,渐进式的路径达到 L3、L4 级别。

基于这样的判断,我们认为可能还有两条路径,另外两条路径一定是在真实环境里迭代且具备海量数据和场景的,我们认为一种肯定是在工业领域很多人在做,很多人都在做工业领域的尝试。另一种就是家庭和类家庭的场景,工业领域我觉得一个好的事情是它的切入是比较容易的,我们基于工位、工厂做很多的 over fit,把这件事情搞定,不断迭代。这个过程中我们看到,确实我们之前也比较多的工业场景,我们看到的是在工业场景里面这种单工位的应用如何能拓展到多工位,整个数据的沿用性、多样性怎么保证,假如说没有数据的多样性我们就很难催生出具身智能的智商。这个过程中我们认为好处就是好切,坏处它未来整个增长的路线在哪里,不仅仅是商业路径,更多的是它的智商的增长需要依赖于多样性的数据。从这个角度我们认为走进家庭或者走进类家庭的赛道是非常合适的路径,就类似于当年我们做自动驾驶选择先做 L2,逐步去切,切到现在基本上接近 L3、L4 级别的自动驾驶是一样的,我们认为应该要找到这种多样性足够的场景,当然肯定也不能太够,比如家庭场景现在去切肯定很难去找到切口,我们希望找到结构化的家庭场景切到 L2 里,能让它逐步实现商业化包括数据闭环,这是我们认为走进家庭场景比较可行的路径,从类家庭到家庭场景。

举个例子,比如在酒店场景它可能干的活跟家庭差不多,整个的酒店结构化算是比较典型的结构化场景,包括物品、房型、物品的摆放。

第三点跟人的交互也简单很多,基于这种,我们认为未来在一些结构化家庭的场景,举例,比如酒店、零售、商业场景是有可能逐步走进家庭的,积累了足够多的 diversity 的数据,是一步一步走进家庭数据必备的环节,所以我们自己的观点走进家庭需要渐进式的路线,渐进式 L2 式的场景应该在类家庭,像酒店、商业的场景里去积累数据和商业化的闭环,这是我们认为一步一步走进家庭场景一个主要的点。

这个就不展开讲,刚才也简单赘述了一些。

对于深朴智能来说,希望能够在人类生活的家庭场景和商业场景里贡献我们的价值。这里就会涉及第二个大的话题,具身智能如何走进场景,一步一步走进家庭?这里我觉得有四个方面是最最关键的。第一个方面肯定是现在大家都熟知的数据方面,现在确实我们的具身机器人非常稀缺的就是数据特别是高质量的数据。第二方面就是模型,如何从 VLA 到 word ation model 到未来一些不同的架构。第三方面就是本体和场景,选择的场景一步一步怎么切入很重要,最后一部分就是一个全栈的团队去支撑各个方面的落地。我们认为大概在这四个维度,简单跟大家报告一下我们在做的事。

第一个点就是数据,我们坚信未来的数据会分成两个阶段,Stage 1 应该是一个冷启动数据,我们需要在一些场景里面采集一些数据,可能现在大家熟悉的有 ego、UMI、本体等等,对我们来说我们还是希望一开始用一些高质量的数据去训练模型基础的能力,这个过程中我们构建了一些高质量的 UMI 数据还有 ego 数据。为什么这样讲,可能在座的很多都是研究者,不知道大家有没有听说现在真正在做模型的公司,模型的算力消耗跟数据的消耗成本大概在 5:1 的样子,假设每个月花 100 万在数据上,可能需要花 500 万在算力上,这种情况下钱再多,100 万小时甚至 1000 万小时,最关键的是它的质量以及高因果密度数据的含量。这个过程中我们更加重视的是如何让这个数据的质量更高,所以我们自己基于模型训练的要求,构建了一套完整的整个数据链路,我们也在前两周发了一个 2000 小时的公开数据集,也发了几十页 tech report 去介绍整个高质量数据是如何练成的,以及如何让它去训练 VLA 和 word action model,以及在这个过程中我们看到了像 pre-train 和 post-training 里面哪些 scaling law 和它的哪些规律。所以这个数据集当天就登上了 Hugging Face 下载榜第一,过了一两周之后在整个总榜排第 8,100 万的数据集里排第 8,整个下载量现在已经超 15 万次,业界做具身的应该都知道 HiFi-UMI。

这里面我觉得最主要的观点在我们认为高质量的 UMI 数据不仅仅是这种 in the house 的采集,可能还包括在野外的采集,这种数据我们是可以去做大规模的 pretrain 的,我们发现了非常完美的 Scaling law 曲线,当然我们可能用的数据是小几万个小时的数据。第二点我们完全可以取代真机数据做 post-training,这点业界还挺震惊的,大家可以观察一下,我们这次的展位在 C313,所有的都是模型来跑,包括非常高难度的那个垒杯,这个环节里我们没有用任何一条真机数据,这一点大家可以关注关注。除此之外,为什么我们能做到这一步,一方面我们可以做到微秒级别的同步、毫秒级别的定位精度,高精度的数据非常稀缺,这是第一步。第二步还是有很多训练数据的 knowhow。所以真真正正能够推出非常优质的数据一定是模型公司干的,因为这里面需要迭代的太多了。

这里 PPT 里没有,其实我更重视的一块是,除了冷启动数采,还有一块 stage 2 的数据一定是在真实环境里面,能让机器人作业,作业的过程中能获取失败的案例,失败的案例里面有一些我们可以去修复的采集回来,还有一部分我们可以真的完全失败,如何用真机的 counter case 去训练我们的真机闭环这套体系。这套体系我们也完完整整在我们的内部搭建起来,它的重要性可能现在业界还没有看到,未来一定会越来越重要。这是第二部分我们在数据板块的想法。

除了数据之外第二块就是模型,PPT 里面没有给大家展示太多,我大概说一下我的想法。第一个我们认为整个模型不仅仅完全是由 VLA 或者 World Action Model 来解决的,我认为 VLA 和 World Action Model 的差异性或区别没有那么大,我们认为未来具身机器人能走进居家环境、家庭环境里面很重要的点是它真的具备一个足够智商的大脑。

在去年 9 月份、10 月份我们就提出了 agentic AI framework 去构建快慢系统,这个过程中其实我们也迭代了很多轮,这张 PPT 去年 9 月份 10 月份就有了,这里我们提的观点是未来跟人交互的机器人一定是个全双工的系统,基于全双工的系统,这是交互,大小脑之间应该也是全双工的系统,在这里我们如何去把每一个模块的能力构建出来,给它边界划好,这里面有非常多的工作要研究,做学术研究非常有意思。这是我们在做整体具身架构层面我们构建的。。

大家最关注的可能是操作模型这块,操作模型这块我们也迭代了很多轮,从去年的像 VLA 到今年一季度的 World Action Model,到二季度我们就开始搭 MOT 的架构去做整个 Simple World 模型,到三季度我们现在做的可能不仅仅是这里,我们要把整个历史帧以及未来帧的 context,除此之外还包括更多的一些因果关系都要建模进去。所以这里面有非常多的一些 knowhow 或者工程化或者研究化的点在里面。我们现在可以做到 10 几 B 的操作模型,可以比现在的像 World Action Model 或者 VLA 效果提升非常大的幅度,大家可以从我们的 Tech report 里面去看这些内容。

这些就不讲了,这是去年的,今年还没有打榜单,更多是内部的研究。这是我们在做一个家庭任务,去年李飞飞老师搭的 Behavior 1K 里面我们构建的全程系统性的任务,成绩仅次于英伟达,比华为的模型稍微好一点。

这是模型这个阶段,我们想讲的第一个,除了在操作模型之外,我们应该构建一个更全栈更全面的一套具身大模型,不仅仅是一个操作模型,但是操作模型已经足够难了,整体那个大脑也非常关键。

第三个板块就是我们本体这块,不展开讲,大家可以直接到我们的展会上看一下我们现在能完成的一些工作。这是在我们年初的时候能够实现的一些功能,可以简单看一段。大家可以到现场去看,我们想体现的是它不仅仅能精确操作你的任务,更重要的是理解你的任务和环境,这套体系是完全自主实现。这个就不看了,大家感兴趣可以到现场看一看。

我们整个公司运营一年左右的时间,现在已经把我们的机器人在酒店场景、零售场景做一些 POC 的工作,酒店场景国内像中旅集团,家政场景,我们跟好慷在家,海外的场景,我们跟海外的一些零售巨头都签订了合作,逐步推进我们产业化的过程。这是场景落地这块。

除了这个方面,我们认为如何完成我们刚才上面讲的一步一步走进家,更重要的一点是要构建一个完备的团队实现。我本人,刚才也简单介绍过,从最开始的自动驾驶创业做技术产品和业务等等一步一步,现在做这个领域,我们会觉得似曾相识或者非常熟悉,我认为未来具身机器人能够走进家庭,至少要有三类人才才有可能做到。第一类我觉得应该是交叉 AI native 人才,第二类应该是做过自动驾驶大数据闭环的人才,第三类是完整做过机器人全栈链路的人才,今天不展开太多,比如 AI native 人才我们认为应该是做过多模态大语言模型、视频生成膜型、自动驾驶大模型、交互大模型等等,这些人才交叉在一起才有可能解决具身智能这一世界级的难题。基于这个锚点构建了我们的全栈团队。

最后一点想跟大家分享一下,深朴也拿到很多投资机构的钱,我们现在已经完成五轮,在开第六轮,股东包括崔轲迪的百度 BV。

最后我想跟大家分享一下,我对于整个具身智能,很多人聊过这个问题,说具身机器人很多,未来具身机器人公司的壁垒到底在哪里这个话题,现在大家回答少不了的是不是模型算法是核心壁垒,这点我非常认同,也是我们现在公司很多的资源都投在模型、数据这个板块,所以要构建初期我们单点的核心竞争力,实际上我们真的要把具身机器人走进家庭或者走进各行各业,单点模型的壁垒是非常昙花一现的,从深朴的角度,我们认为系统级别的闭环能力在整个业界是非常稀缺的,从模型到数据到本体到场景,如何构建系统级别的闭环能力,才是未来具身机器人能否从实验室走到场景,从场景变成产品最最关键的一环。所以第二层我们认为更高级别的壁垒应该是系统级别的闭环能力。第三层,我们认为具身机器人走进家庭之后或者走进各行各业之后,能否回传海量的 counter case 的数据,是未来具身机器人能够不断地从一个比如 POC 变成一个产品,变成一个海量的商品最最关键的一环。所以未来我们认为第三层核心的壁垒可能是真实场景中数据资产的壁垒。第四层可能就是生态包括商业化这块,我觉得对于大部分的具身机器人公司来说应该抓好至少前两点,模型的能力以及模型变成价值闭环的能力,大概这两块。跟大家分享一下。

深朴智能的展位在 C 馆 313,跟宇数正好对面,感兴趣的同学可以到我们展馆体验一下有意思的一些事情。

感谢大家。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 机器人 李晓 创始人 ceo
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论