小饭桌 08-31
物理AI爆发前夜,这家公司要为机器人重做一套视觉系统
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

谁提供了这层感知,谁就握住了智能进入物理世界的入口。

              

作者丨苏迪

编辑丨张丽娟

过去两年,具身智能的故事大多发生在大脑上。VLA、世界模型、端到端控制,轮番刷新着能力边界。

但热闹归热闹,当机器人真被放进工厂和家庭,最先露怯的往往是 " 眼睛 "。

今天的视觉大模型,大多数还停留在问一句答一句的阶段。给它一段视频,通过抽帧完成识别、描述和问答。但真实的物理世界,有价值的信息往往只在一瞬间,还与此前数秒、数分钟甚至更长时间的状态有关。

而这个问题,不全在模型身上。视觉智能这件事,难在它不是一个单点技术,而是从镜头到模型,哪一环都不能少。

这正是双深科技要解决的问题。这家上海公司四十多人,几乎全是研发,五年一直在重做机器视觉的底层链路:从成像、压缩和传输,到端侧推理、空间理解和时序记忆。

而它的定位也和一般视觉公司不一样。不做单点算法,不做再一个通用   VLM,它要做的是一套持续在线的视觉系统,让机器人的眼睛从采集画面的设备,变成智能进入物理世界的入口。

把整条视觉链路重做一遍

怎么让机器的眼睛一直在线、一直看懂?靠给模型喂更多图片,是解不了的。

在双深科技看来,视觉智能得换一套玩法:连续地感知,实时地反应,不再是把画面翻译成文字,而是让机器心里装着一个不断更新的世界。双深科技将这个方向叫做 Always-on VLM。

这个名字容易让人误解。Always-on   不是让一个大模型二十四小时满负荷运转。

恰恰相反,它学的是人的视觉那套分层处理的办法:底层的感知一直开着,快速捕捉光照、运动、深度和目标的变化;只有当环境里真正发生了什么,更耗算力的推理才会被叫醒;关键的事情则被存成可以回头翻找的时序记忆,留给后面的决策用。

" 机器人需要的不是一只不断上传视频的摄像头 ",双深科技创始人曹磊说," 而是一套能在本地持续感知、按事件计算、把关键状态交给大脑的视觉神经系统。"

要做到这一点,门槛比想象中高得多。双深科技列了四个硬条件:极端光照下仍能稳定获得信息;视频和中间特征能够低成本传输和存储;模型可以在端侧的功耗预算内连续运行;理解的结果能留住空间关系、事件变化和长期上下文。

四道门槛,缺任何一道,持续在线都会退化成高成本的持续录像。更麻烦的是,问题不出在某一个环节,而出在整条管线的设计上。

传统机器视觉是一条由多个独立模块拼起来的流水线:传感器生成画面,ISP   为人眼调图,编码器压缩像素,网络传输视频,应用再解码、抽帧,最后才轮到模型。

每一层都在处理上一层留下的数据,却没有一层是围绕机器理解设计的。结果是双重的浪费:大量信息在前端就被抹平,大量冗余像素又在后端被重复搬运。

指望在这条流水线上修修补补跑通 Always-on,是不可能的。双深科技的选择是把整条视觉链路重做一遍。

第一关,是在源头把信息保住。夜间、逆光、强反射、高速运动,这些不是画质问题,它们会直接摧毁后续模型需要的纹理、边缘和运动线索。画面糊了,人还能凑合看,模型不行。

双深科技用端到端 AI ISP   重做传统成像流程,把去噪、曝光、色彩恢复和下游任务放在一起调;面向低照度场景的黑光全彩方案,目标不是把画面调得更好看,而是在极端环境里保住检测和理解的稳定性。

信息保住了,第二关来了:传的要划算,还得是 " 信息 "。传统编码围着人眼能接受的失真设计,神经编解码则可以在潜空间里学习任务相关的表征。

双深科技把视频压缩和机器理解绑在一起做:同一路视频,既输出供人观看的码流,也输出供模型消费的特征流;语义没有变化时就降低传输和计算,关键事件出现时则保留更多细节。

对带宽和存储极其敏感的工业、航天和机器人场景,这一层决定了视觉能不能真正长期在线,毕竟摄像头买得起,常年传输和存储的账单未必付得起。

传得起之后,第三关是算得动。原始视频持续上云,带宽、时延、隐私、可靠性,每一关都过不去;让大模型全程在端侧跑,功耗和算力又撑不住。两头都走不通,答案只能在中间:轻量网络在端侧持续工作,完成图像增强、变化检测、目标与深度等基础任务;复杂推理由事件触发,在端、边、云之间动态分配。

与富瀚微的芯片合作,让这套分层模型可以从算子、内存访问和模型结构的层面一起优化,而不是在通用芯片上事后适配。

还差最后一关:看得懂、记得住。面向机器人,双深科技正在推进瞬析 3D VLM,把   RGB、深度、运动和语义装进同一个连续的空间表征里。它关心的不只是画面里有什么,还有物体在哪里、怎么动、彼此是什么关系,以及刚刚发生了什么变化。

更长远的目标,是把冗长的视频压成事件级的记忆——上层的 VLA   或世界模型不必反复回看全部像素,也能拿到行动所需的上下文。

四层拼起来看,更像一套完整的机器视觉操作系统:向下连接传感器和芯片,向上给不同的大模型提供标准化的视觉输入;既能做现有 VLM/VLA   的前端,也能和客户自研的机器人大脑组合。

模型的领先会被下一代模型抹平,但整条链路的积累不会。

五年,只干一件事

这条链路的起点,比公司成立还早四年。

2016   年,曹磊和武祥吉搭档给某地做线上视频调解系统,视频传输效果极差,翻遍市面找不到好的压缩方案。" 又贵又低效 ",曹磊说," 当时我们就觉得,这事一定有机会。"

这颗种子埋了四年。2020   年,两人决定创业,跟着出来的还有原先编码团队的七八个人。曹磊出身华为,偏工程;武祥吉拿过 CVPR   冠军,偏算法。工程、算法、编码,各就各位。

一家公司的技术基因,在第一天就是成建制的。方向也很清晰:不做人脸识别,不追大模型,扎进 AI   视觉最底层,从采集、压缩、传输到理解,用 AI   重做一遍。

" 这块底层技术很难,门槛很高,所以我们觉得值得做。" 曹磊说。

难,意味着慢。做编解码轻量化,网络参数量巨大,一项技术从研发到产品化要以年计,很长时间里都看不到产品化的影子。这种活,最怕的不是难,是团队熬不住、方向被风吹走。

双深科技的应对方式,是把自己变成一个不太 " 性感 " 的公司:五年里,团队从八九个人长到四十多人,几乎全是研发;技术主线从编解码轻量化延伸到今天的 Always-on VLM,没有换过;不追热点,也很少对外发声,市场上几乎找不到这家公司的消息。

在一个风口三个月一换的行业里,不变本身成了稀缺品。

比方向不变更难得的,是想得清楚。曹磊和团队很早就想明白了一件事:要做端侧视觉系统,核心瓶颈不只发生在模型精度上。模型能否量产,还取决于芯片算力、带宽、内存、功耗、工具链和客户验证周期。算法必须跟着芯片走,才有可能上量、进场景、拿真实反馈,形成单点算法公司难以复制的闭环。

这个判断在 2022 年变成了一道真实的选择题。桌上摆着两份投资意向:一个来自财务机构,一个来自产业资本。前者估值更高,后者背后则是端侧视觉芯片公司富瀚微。

团队最终选择了后者。" 我们想换取算法进入芯片与客户体系的机会。" 曹磊说。

后来的事验证了这个选择:瀚联产业基金与富瀚微先后投资双深,双方逐步从资本关系走向软硬件协同。双深科技如今大部分收入来自基于富瀚微芯片的模型授权,与机器人厂商的合作,走的也是 " 富瀚微定制芯片、双深科技出算法 " 的路。算法、芯片、客户场景,严丝合缝地咬合在了一起。

回头看这五年,这支团队在技术上,五年只走一条主线,把每一层都握到自己手里;产业上,在关键路口选了匹配,而不是划算。

抢下入口

五年的积累,双深科技押注的不是某个技术模块的领先,而是一个更大的判断:在大模型真正走进物理世界之前,视觉必须先能从 " 调用 " 变成 " 在线 "。

GPT 证明了文本接口的通用性,但物理世界没有现成的文字说明。它由光线的明暗、物体的运动、遮挡与深度的变化和时间的流逝构成,连续发生,不会暂停。

当视觉从 " 调用式 "(你问我答)变成 " 在线式 "(一直在看),AI   与物理世界的交互方式会被改写。

双深科技对未来的判断是:下一代视觉系统将以小模型持续感知,以事件驱动大模型,以结构化状态连接行动,原始像素、潜空间特征和语义记忆会在同一条链路中协同流动。

到那时候,VLM   不再只是一个理解图片的模型,而会成为始终在线的感知进程。

谁提供了这层感知,谁就握住了智能进入物理世界的入口。在计算产业的历史上,入口层的价值往往更有想象空间:ARM   定义了移动芯片的架构,CUDA   定义了 AI  

计算的接口,它们不直接做应用,但没有它们,应用无从谈起。

如果 Always-on VLM   这条路跑通,双深科技有机会成为物理世界里与之对应的那一个接口。

而这个入口的价值,最终取决于它通向多大的世界。

双深科技过去五年进入的每一个场景,都不是独立存在的。安防提供的是规模化芯片载体。随富瀚微年出货过亿颗的芯片进入真实设备,端侧算法开始大规模部署、反馈和迭代。

工业质检考验的是超大规模图像的长期留存与可追溯,神经压缩能够直接对应客户的存储成本。商业航天则把低带宽、低功耗和高可靠性推向极限,迫使系统在资源稀缺的条件下保留最有价值的信息。

这些场景共同指向了机器人。这个场景的要求更为严苛:极端环境下的稳定成像、有限算力下的实时推理、对连续空间的深度理解,三者缺一不可。

双深科技正在以 " 芯片 + 算法 + 模组 " 的方案推进与头部机器人厂商的验证,短期为

VLM、VLA   提供清晰、低延迟且带空间信息的输入,长期形成从采集到交互的完整视觉系统。

在这条路上,双深科技已经抢到了先手。但窗口期不会永远敞开。共识一旦形成,资金雄厚的玩家会带着场景进场。不过,视觉链路不是资本可以速成的生意:成像、压缩、芯片、理解,每一环都要以年计地打磨,双深科技过去五年做的,正是这件事。

曹磊说,视觉的拐点不会只由一个更大的模型触发。它需要成像、编码、芯片和模型同时成熟,让高性能、实时在线和可承受的成本第一次同时成立。

而双深科技想成为的,正是让这种 " 同时 " 得以成立的那一环。

成立刚一年,这家具身公司靠 " 鸿蒙式 " 打法拿下超万台订单 | 元桌派 A 一下

一年半换 15 个 " 剧本 ",具身智能把投资人都整 PTSD 了

跳过 VC," 有钱人 " 直接打钱给创始人

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

物理 机器人 上海
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论