
经典的 " 吉列刀架与刀片 " 模式,正在具身智能领域上演?
编辑丨岑峰
过去两年,具身智能行业掀起了一场激烈的 " 硬件军备竞赛 ":能后空翻的人形机器人、刷新奔跑速度纪录的机械腿,以及在精密设定下倒水、叠衣服的机械臂层出不穷。
但在这些炫酷的展示背后,一个极其现实的问题摆在了所有从业者面前:具身智能到底该怎么赚钱?
目前,行业的主流玩法依然是 " 卖机器 ":将昂贵的硬件本体搭配针对特定场景写死的工作流软件卖给 B 端客户。但硬件制造天然受制于供应链和规模效应,毛利率在残酷的价格战下不可避免地会走向极度微薄。
如果具身智能真的是继智能手机之后的下一代计算平台,它的商业终局,绝不可能仅仅是一家 " 硬件设备制造商 "。
在正在进行的 2026 世界机器人大会(WRC)上,星海图联合创始人高继扬,指出,具身智能的商业模式最终将彻底颠覆,走向以 " 物理世界 Token" 的销售为主体。
高继扬认为,在未来的终局里,机器人硬件(整机)甚至可能沦为 " 负毛利 " 的载体,其唯一目的就是把更多的终端铺到真实世界中去。而产业真正的价值核心,将 100% 向 " 具身大脑 " 迁移。
就像今天的 OpenAI 按大语言模型吐出的 " 文本 Token" 向开发者收费一样,未来的具身智能巨头,将按照机器人在物理世界中执行的每一个有效动作、完成的每一次任务,即 " 物理世界 Token",来攫取难以估量的商业红利。
当然,要支撑起如此庞大的 "Token 经济 ",底层大脑必须跨越一道天堑。作为一家坚定的 " 具身大脑 " 公司,星海图在底层模型上给出了自己的解法:用统一自回归架构打通零样本泛化、通用抓取和长程任务。
在演讲中,高继扬不仅分享了上述领域的底层突破,还对 " 泛化性 " 这一学术词汇给出了极其精准、通俗易懂的商业化转译:" 泛化性本质上就是培训成本 "。这种从实验室走向商业逻辑的独特认知,正是我们强力推荐这篇演讲的原因。
以下是高继扬在 WRC 2026 上的演讲实录,雷峰网在不改变原意的前提下进行了精编与整理:

01
商业模式的演进:从卖整机,到卖 " 物理世界 Token"
随着机器人的智能通用性不断取得进展——从单一场景有用,跨越到多场景跨任务有用,具身智能产业的核心商业模式将会发生一次根本性的变化:最终将演变为以 " 物理世界 Token 销售 " 为主体的模式。
在这个整体进程中,我们看到具身智能包含两方面:一方面是整机(硬件),另一方面是智能(大脑)。整体的价值量会从整机逐渐向智能迁移。
去年和今年,我们看到行业里(包括我们自己)销售整机产品,毛利率大概在 40% 到 60%。我们相信,到了第二阶段,也就是 " 方案订阅 " 阶段,整机的毛利率可能会降到 20% 左右。
而到了真正 "Token 销售 " 的第三阶段,整机甚至有可能变成一个负毛利的状态。因为那个时候,我们要的是让更多的终端出现在物理世界当中,去消耗更多具身智能基础模型的 Token。这是一个完全由模型能力牵引的具身智能产业化过程。
正是带着这样的认知,星海图将自己的核心定位明确为一家 " 具身大脑公司 "。过去几年,我们的基础模型在不断迭代,不仅发布了 G0.5 模型,还推出了 fast-wam 最新的模型架构,持续在底层能力上寻求突破。

02
基础模型的三大核心能力:零样本泛化、通用抓取与长程任务
如何去描述我们当前的具身大模型能力?我们可以用一句话概括:创新地采用了统一自回归架构,用单一模型贯通了零样本泛化、通用抓取和长程任务的能力。
第一个关键词是 " 零样本泛化 "。 通俗一点说就是 " 言出法随 "。我给模型下达一句指令,它就能跟随完成。比如,对它说 " 把面包从盘子里拿起来放到面包机里 ",或者 " 把碗里的食材倒进锅里 "。在这些场景中,模型其实是第一次看到这些物品和环境,但依然能完成任务,这就是零样本泛化能力。
第二个关键词是 " 通用抓取 "。 抓取是具身智能非常基础且重要的能力。所谓的 " 通用 ",就是不经过任何的后训练(Post-training)和再编程,机器人就能够把大的、小的、胖的、瘦的、不同材质的物体,从任意地方放置到另一个地方。
第三个是 " 长程任务能力 "。 为什么长程任务如此重要?因为在真实的物理世界中,几乎没有一个工作流(Workflow)是靠单一或少数几个动作就能完成的。它们基本上都是由几十个、甚至上百个动作串联而成。如何让模型连续完成上百个动作?我们通过叠纸盒等复杂精细操作验证了这种能力。这是基础模型走向真实商业价值的核心所在。
当然,仅靠强大的基础模型预训练还不够,我们还需要后训练。在后训练中,除了基于模仿学习的 SFT(监督微调)外,还有一个非常重要的技术就是强化学习(RL)。
目前,我们已经完成了几十台机器分布式的编队强化学习规模化训练。这带来的效果是突破性的:我们可以把通过预训练完成的 " 厘米级 " 操作,进化到 " 毫米级甚至亚毫米级 ",同时将任务的成功率大幅提升至 99.9%。 这一切都源于真机强化学习的能力闭环(如包含人机协同的 DAgger 机制)。
03
衡量机器人的 " 泛化性 ",本质是衡量 " 培训成本 "
基础模型底层能力的持续突破,是带领具身智能走向 " 生产力时刻 " 的核心变量。当我们真正进入生产力场景时,会发现衡量基础模型有三个非常关键的指标:速度、精度、泛化性。

速度,核心描述的是作业效率。坦率来讲,今天机器人的执行效率还不如人类快,大概是人类的 70% 到 80%。精度,目前依靠预训练可以稳定完成厘米级精度,但毫米级精度必须依靠强化学习,我们目前正在推进这一进程。
最关键的是泛化性。很多人问,泛化性到底是什么?我们觉得一个最通俗的解释就是:泛化性 = 培训成本。
就像我们雇佣一个人类员工,上岗前需要培训;未来雇佣机器人,同样需要培训。这个培训成本的高低,直接反映了泛化性的强弱。 培训成本高,说明泛化性低;如果培训成本趋向于无穷大(即一直教不会),那就说明泛化性极差。
目前,星海图完成一个新长程任务的后训练大约需要 10 个小时。我们希望到明年,能把这个 " 培训时间 " 压缩到一个小时,甚至只需要提供几条数据,就能完成长程任务的后训练。
04
走向真实生产力:1+3+N 的战略生态
基于这些模型能力,我们正在围绕电商零售、工业制造、快递物流和商业服务四大场景展开解决方案落地。
在真实的商业落地中,我们非常注重全自主与模型驱动。比如在与京东合作的全自主机器人前仓中,从货物的拣选、抓取、放置,到最难的柔性打包(打开袋子、放入物品、系上封口),全流程没有任何人工干预,且能支持数千到上万级的 SKU。在海外市场,比如洛杉矶的 3PL 仓储,因为用工难度和培训成本更高,具身智能落地的迫切性和速度可能会比国内更快。
对于整个产业的未来,我们确立了 "1 + 3 + N" 的品牌战略:
"1" 代表不变的战略:整机 + 智能。 具身智能绝不是纯软件的人工智能,一定是软硬结合的完整解决方案。
"3" 代表三大产品序列。 我们围绕生产力场景打造了轮臂旗舰产品(主打 0.1 毫米位控精度的 " 刚柔并济 ");围绕非结构化场景(如能源电力)推出了双足产品;同时围绕创客和开发者群体推出了高性价比的硬件与开源工具,降低具身智能的开发门槛。
"N" 代表产业生态伙伴。 独木不成林,我们希望与更多上下游的硬件、算法、场景伙伴一起做大做强,将具身智能真正转化为物理世界的生产力。
上车,带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲 PPT
大会报告全文
热门论文解读
学术新星访谈
扫描上方二维码
或点击「阅读原文」关注专区。


登录后才可以发布评论哦
打开小程序可以发布评论哦