
世界模型牌桌上,昆仑万维已连出五张牌,一张比一张大。
作者丨幸丽娟
编辑丨齐铖湧
世界模型的热度,终究还是烧到了今年的 WAIC。
整场大会,论坛、展台、发布会,世界模型几乎成了 " 灵魂 " 一般的存在。
因为具身落地元年——AI 要迈向现实世界,世界模型必不可少。
不同于资本场中,创业公司频频用零产品、零营收撬动百亿估值,大家在 WAIC 上追问的是更朴素也更直白的技术问题:世界模型如何真正理解物理世界?如何走向真实世界?
7 月 19 日,昆仑万维举办的 "世界模型与多模态范式革命 " 专场论坛,用硬核的技术细节,回应了这些问题。
昆仑万维董事长兼 CEO 方汉在论坛上进一步宣布:"2026 年为世界模型元年。"

昆仑万维董事长兼 CEO 方汉
而 Matrix-Game 3.5,便是昆仑万维在这个 " 元年 " 里,打出的一张王牌。
01
" 物体恒存 " 这道基础题,到底怎么解?
查看 Matrix-Game 3.5 发布的技术突破细节,会发现 " 物理恒存 " 是被单独拎出来重点攻克的问题。
为什么?
因为这道物理世界最基础的题,曾让世界模型集体翻了车。
翻车这事,要从一个评测基准说起。
哈佛、MIT、IBM、谷歌联合发布的一个评测基准,叫做 MemoBench,考的是 " 物体恒存 " ——东西离开视野再回来,还在不在?长什么样?位置变没变?
三岁孩童都能拿满分, 十个主流世界模型集体不及格——满分 1 分,最高分 0.58 分。
原因藏在 Matrix-Game 团队曾对世界模型给出的定义框架中——理解当下状态、预测下一个状态、将预测结果渲染呈现。
而大多数模型只做到了第三层。" 物体恒存 " 测试不及格,便是它们跳过了前两层,直接 " 渲染 " 所付出的代价。
MemoBench 给的 " 评语 " 也很直白:现有模型即使能生成视觉上完全连贯的画面,也几乎无法在物体重新出现时,正确恢复它在消失期间本该经历的状态变化。
" 物体恒存 " 问题,可以拆成三道更具体的题:
记不住:无法维持对物体身份的持续表征。
认不出:无法在物体重现时准确识别其身份。
变不对:无法正确推演并还原物体在消失期间发生的状态变化。
Matrix-Game 3.5 一道一道,给解了出来。
▎ " 记不住 "?Matrix-Game 3.5 :把 " 时间相册 " 升级为 " 三维地图 "。
模型为什么会 " 记不住 "?
这源自于 Transformer 的结构性缺陷:注意力窗口越大,早期信息被稀释得越严重。记住了新的,旧的就被挤出。
即便行业标杆谷歌 Genie 3,也只能保持约一分钟的一致性,之后场景逐渐崩坏。
问题出在记忆方式上。模型记的是 " 第 5 帧左上角有个方块 " ——时间索引。人类记的是 " 沙发在客厅角落 " ——空间索引。
时间索引随序列线性增长,记忆容量爆炸。空间索引只随场景复杂度增长,与时长无关。
Matrix-Game 3.5 实现业内首个几何对齐的 Patch 级长期记忆,把记忆从时间索引切换为空间索引,将历史观察提升至三维 Patch Memory。

记忆单元从 " 整帧 " 降到 " 局部图像 patch" ——每个 Patch 独立存储、独立检索,通过几何对齐按需调取和复用历史内容。
模型记住的是" 坐标 ( x,y,z ) 处有个物体 ",不是 " 第 5 帧左上角 "。

无论你离开多久、从哪个方向回来,地图都在。
▎ " 认不出 "?Matrix-Game 3.5 :从 " 认像素 " 升级到 " 认空间 "。
认不出,两个原因。
第一个:视角变了。同一个物体,正面看和侧面看像素完全不同。
传统模型用的是 3D RoPE 位置编码,编的是时间 t 和二维坐标 ( x,y ) 。模型知道 " 像素在画面上的位置 ",却不知道 " 这个位置为什么在这里 " ——不知道相机转了 30 度后像素该位移多少,也不知道这个像素对应真实世界的哪个点。

Matrix-Game 3.5 引入 PRoPE,把相机投影矩阵直接编码进时空位置。模型学的不再是 " 这个像素在 ( x,y ) ",而是 " 这个像素来自哪个视角、对应空间哪个点 "。
再加上 Warped RoPE,记忆 Patch 的位置从 " 来自第 5 帧左上角 " 升级为 " 在当前视角下应出现在三维空间的哪个坐标 "。
第二个:背景乱了。镜头在动、物体在移、光影在变,如果动态变化和静态背景混在一起处理,背景表征被污染,模型连位置都搞不清,更别说认出物体。
Matrix-Game 3.5 的做法是动静解耦记忆:Patch Memory 负责记住稳定的静态场景结构,主体参考 Token 负责维持动态主体的身份和外观一致性。动态物体在写入记忆前被过滤掉,避免 " 一个移动的人 " 被误认为 " 多个不同的人 ",减少重影与时序混淆。

背景是坐标锚点,动态内容是前景事件。物体重现时,先定位空间位置,再对齐视角,让模型认得准。
▎ " 变不对 "?Matrix-Game 3.5 :把因果推理写进训练目标。
物体消失期间状态在变。模型既要感知 " 变了 ",还要推演出 " 变成什么样 "。
传统做法两步走:先理解状态,再生成动作。分开训练。
Matrix-Game 3.5 则打破传统,提出了新的因果推理范式——状态与动作联合生成。
状态预测与动作生成联合训练,放在同一个损失函数下共同优化。模型学的不只是 " 下一帧长什么样 ",而是 " 如果我做这个动作,世界会怎样改变 "。
Matrix-Game 3.5 进一步通过实验证明:联合训练后,状态理解和动作预测能力双双显著提升。
这种技术范式下,因果推理不是从数据里涌现的,它被直接写进训练目标,实现内生的因果推理能力。
三道题,三个对应解法,本质上是在做同一件事:让模型从 " 复现像素 " 到 " 理解因果 ",从 " 感知表象 " 到 " 洞悉物理规律 "。
02
从游戏走向真实世界,三关怎么过?
攻克 " 物体恒存 " 难题,只是起点。
但昆仑万维在世界模型牌的野心不止于此,而是 " 推动世界模型跨越游戏边界,迈向机器人控制与物理世界交互。"
从游戏沙盒到通用物理世界,中间隔着三大难关。每一关,都决定了世界模型能不能真正走到真实场景里。
▎第一关:数据——给视频数据装上 " 物理标尺 "
游戏是可控的物理世界,真实世界是失控的。
互联网视频没有深度标注,无法体现相机视角、运动轨迹。用这些数据训练,模型学到的永远是相对几何关系,画面在动,但不知道动了多少米、朝哪个方向。
真实数据稀缺,成为世界模型最大的瓶颈之一。
昆仑万维采用的解法很重,但绕不过去:给视频数据自动重建物理尺度。
他们搭建了三套自动化管线——
系统通过多 Agent 自动调研数千款游戏,筛选高价值数据源;
自动化离线标注管线估计每条视频的相机位姿、米制深度、相机内参;
Scene-Quality 自动评估系统从几何可重建性和生成训练价值两个维度评估数据质量。

三条自动化数据管线,产出 500 万以上高质量视频切片、1 万以上有效训练小时数,覆盖 1200 多个游戏场景和真实物理场景。
别人喂模型的是 " 视频 "。昆仑喂模型的是带物理尺度的世界观测。
有了物理尺度,模型第一次能够理解空间中的 " 距离 " 和 " 速度 ",而不是仅仅识别像素的排列方式。
这是世界模型从 " 看像素世界 " 到 " 懂真实世界 " 的第一步。
▎第二关:交互——速度逼平实时,输出直译指令
数据问题解决了,下一个难题是:延迟。
机器人控制场景里,延迟不是性能指标,是安全红线。卡一下,机械臂可能直接摔了碗,碰了人。不是 " 体验不好 ",是 " 会出事故 "。
生成速度必须逼近实时。
Matrix-Game 3.5 用三件事把推理推到极限。
先是 3 步采样蒸馏。传统扩散模型生成一帧要几十步去噪,Matrix-Game 3.5 把它压缩到 3 步,画质不打折。

然后是 DiT 推理优化。做 FFN INT8 量化来压缩权重,用 KV Cache 缓存已生成的键值对,避免重复计算。
最后是 MG-LightVAE 剪枝。对视频编码器做约 75% 的结构化剪枝,轻量化编解码。
三管齐下,5B 参数模型在单张 GPU 上跑出了 720P 分辨率、约 20FPS 的实时生成。
交互关打通之后,世界模型从 " 观察世界 " 进化到了 " 精准、实时干预世界 "。
世界模型从虚拟世界走向真实场景,又迈进了一步。
▎第三关:算力——用架构设计替代堆参数
速度上去了,算力也要可持续。
即便是处理离散的 token 序列的大语言模型,也深陷算力黑洞。
世界模型处理的是连续视频流,每一帧都要做完整的扩散生成,几十步去噪,每步都要过 Transformer。计算量跟大语言模型,完全不是一个量级。
最直接的路是堆算力:更大的集群,更多的 GPU。但这不是可持续的路。
Matrix-Game3.5 做了一个根本性突破:除角色 Reference Adapter 外,核心功能几乎不需要新增参数,即可实现交互世界建模,并可快速适配不同视频基础模型。
所有交互能力都靠架构设计本身实现,不靠堆参数硬撑。
这意味着什么?在引入交互、长时记忆和相机控制能力的同时,模型能够最大程度保留基础视频模型原生的生成能力,无需牺牲开放内容生成质量。
这套交互框架可以快速嫁接到不同的视频基础模型上。不用重写底层,不用为了加交互而牺牲画质。开放内容生成、多风格切换、复杂场景建模——这些能力不会因为交互的加入而打折。
这种轻量化的交互框架设计,让世界模型 " 真正可迁移、可落地 ",从理想变成现实。
数据关,昆仑万维给视频装上了 " 尺子 ";交互关,把生成速度推过实时红线,把输出从 " 画面 " 变成 " 指令 ";算力关,用架构设计替代了参数堆叠。
昆仑万维系统地打通了数据、交互、算力三个瓶颈,让世界模型第一次具备了走进真实物理场景的完整条件。
这不是某个单点的工程优化和升级,是世界模型整个底层能力的系统化跃迁。
03
为什么是昆仑万维?
世界模型的牌桌,英伟达、谷歌等全球巨头抢先落座,Yann LeCun、李飞飞等学术大牛亲自下场,创业公司扎堆涌入。
玩家众多,座次未定。
而昆仑万维已经连出五张牌—— Matrix-Zero、1.0、2.0、3.0、3.5,一张比一张大。
凭什么?
▎第一,它起步最早,技术路线最清晰。
2022 年,宣布 "All in AGI 与 AIGC";2024 年, Matrix-Zero 开启空间智能的体系化探索;2025 年,Matrix-Game 1.0、2.0 接连发布;2026 年,Matrix-Game 3.0、3.5 相继炸场。
当同行还在摸索技术路径,昆仑万维已经用一次次技术迭代,验证了一条清晰、完整的开发路线:双向 DiT 预训练→ Self-Forcing/Causal Forcing 蒸馏为因果模型→ KVCache 流式推理 + 记忆注入→ 25FPS 的实时交互水平。
当行业还在争论 " 世界模型到底是什么 ",Matrix-Game 团队已经给出了清晰的定义框架:理解当下状态、预测下一个状态、将预测结果渲染呈现。
当创业公司还在拿零产品、零营收讲百亿估值的故事,昆仑万维已经发布了 " 一箩筐 " 的世界模型产品,而最新发布的 Matrix-Game 3.5,则率先完成 " 具备因果推理与行动能力的底层引擎 " 的转身。
▎第二,它开源最坚决,拿下标准定义权。
昆仑万维 Matrix-Game 系列模型 " 一次发布一次开源 " 的节奏,足以证明它对开源的态度和决心。
2025 年 5 月,Matrix-Game 作为工业界首个 10B+ 空间智能大模型正式开源。
三个月后,SkyWork AI 技术发布周,五天连发五款模型,其中 Matrix-Game 2.0 成为业内首个在通用场景上实现实时长序列交互式生成的开源方案。

论文地址:https://arxiv.org/abs/2508.13009
项目主页:https://matrix-game-v2.github.io
更重要的是,它是国内唯一能够对标谷歌 Genie 的开源方案。开源硬刚闭源,实力几何,不言自明。
2026 年 3 月,Matrix-Game 3.0,首次系统性地将记忆问题纳入开源方案。
每一次进化,都在向 AI 社区敞开代码、架构和思路。
这种坚持的价值,很快在社区中得到验证。
学术圈先动了。DiT 作者、纽约大学助理教授谢赛宁,这位与 Yann LeCun 共同擎起 JEPA 世界模型大旗的学术大牛,基于 Matrix-Game 2.0 的开源底座,发布了全球首个多人视频世界模型 Solaris。
一位站在全球世界模型舞台的核心代表人物,启用一家中国企业的开源模型做底层研发,足以证明 Matrix-Game 2.0 的技术底座已具备国际竞争力。
产业界紧随其后。NVIDIA 和浙大基于 Matrix-Game 3.0 模型进行研发,联合发布了世界模型相关工作 Light Interaction。
学术大牛、产业巨头——两个最严苛的验证方,都用行动给 Matrix-Game 系列模型,投了票。
与此同时,Matrix-Game 相关模型凭借扎实的技术底座和开源生态,逐渐成为同行玩家的共同参照系。NVIDIA 的 SANA-WM、Adobe 的 RELIC 等国际头部大厂的世界模型工作,均将 Matrix-Game 相关模型作为对比基准。
先开源者拿定义权,后来者只能兼容。当足够多的团队基于你的底座做研发、拿你的模型做对标,事实标准就开始形成。这不是谁指定的,是被用出来的。
开源换反馈,反馈换迭代,迭代换领先。这套逻辑,昆仑万维又先一步,跑通了。
▎第三,它的生态最系统,壁垒越跑越厚。
2026 年 3 月,昆仑万维发布 "4+3"AGI 战略。

四大模型底座:视频模型、音乐音频模型、世界模型、基座文本与多模态模型。三大平台经济体:AI 短剧、AI 音乐、AI 游戏。
世界模型在这里不是孤立的技术模块,是整个生态的底层引擎。
这套布局的精妙之处在于:游戏平台跑出交互数据,视频平台产出训练素材,音乐平台丰富感知维度。数据从平台流向模型,模型能力反哺平台体验,体验吸引更多用户,产生更多数据——四轮三轴,循环转动,越转越快。
视频模型生产训练数据,世界模型提升生成质量,游戏平台验证能力上限。每个模块都在为其他模块创造价值。
昆仑万维用 " 模型 - 平台 - 数据 " 三端闭环的系统,建立起一整个生态 " 护城河 "。后来者,追的不仅仅是一个单一世界模型,而是一整个生态。
生态的壁垒越跑越厚,对手越来越 " 望尘莫及 "。
▎第四,技术范式上限最高,因果推理能力 " 内生 "。
最后要回归到技术范式本身来谈。
现在很多世界模型都说要学因果,但学的不是一种因果。
再次以谷歌 Genie 3 为例。
它的因果理解,是在海量视频中隐式学习的统计关联,其自回归架构能逐帧生成连贯画面,但受限于约一分钟的记忆窗口,误差会快速累积。一分钟后,场景迅速崩坏。
它的目标是生成物理合理的视频内容,要回答的问题是:" 给定当前画面和用户操作,下一帧该长什么样?"
而 Matrix-Game 3.5 的目标是输出可执行的物理控制指令。它要回答的问题是:" 给定当前状态和预期结果,我该做什么动作?" 成功标准是 " 指令执行后物理结果正确 "。
因此,它将因果推理作为架构的第一性,采用状态与动作联合生成范式,状态和动作在同一个损失函数下共同优化,模型被训练去预测 " 动作→世界改变 " 的因果链条。
这种因果是 " 长 " 出来的,不是从数据里 " 看 " 出来的。
一个服务于 " 视觉模拟 ",一个服务于 " 物理干预 "。目标决定了技术范式,而技术范式决定了模型的能力上限。
04
结语:国产世界模型,正在定义牌桌规则
Matrix-Game 3.5 不是终点。它是一个支点。
机器人训练,不再需要真实世界的百万次试错。在世界引擎里,机器人摔一万个碗,成本是 Token" 电费 "。
自动驾驶仿真,不再需要封闭测试场的昂贵场景。在世界引擎里,暴雨、黑夜、突发横穿,一键生成,完全不需要用安全事故做代价。
这些场景需要的不仅仅是 " 看起来像真的 ",更要求 " 行为上真的 "——杯子会碎、墙不能穿、左转后视角真的变了、十分钟后回来杯子还在。
传统游戏引擎的代码逻辑死了。Matrix-Game 3.5 用几何理解、空间记忆和因果推理,让世界第一次在模型里 " 活 " 了过来。
2026 年 7 月 19 日,世界模型走向真实物理世界,由 Matrix-Game 3.5 开始。
率先出牌的昆仑万维,正在定义世界模型整张牌桌的规则——国产世界模型,第一次跑出了 " 全球技术引领者 " 的姿态。 ( 公众号:雷峰网▪ AI 科技评论 )


登录后才可以发布评论哦
打开小程序可以发布评论哦