互联网怪盗团 昨天
GPT-6 Astra宣告了3D模型的末日?我觉得恰好相反
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

GPT-6 Astra 发布至今短短七天,已经掀起了一阵又一阵的海啸;在我的印象中,上次 AI 界出现如此盛况,还要追溯到 2024 年 GPT-4o 的发布。在 Astra 发布当天,OpenAI 总裁 Greg Brokman 的介绍语是:"Welcome to the AGI era." 英伟达的老黄则简洁地表示:"AGI has arrived." 仅仅几个月前,全球领先 AI Lab 融资时,还只敢提出 " 我们的长期愿景是实现 AGI",现在 AGI 仿佛已经唾手可得,简直是恍若隔世。

Astra 究竟有没有实现 AGI, 还是得留给学术界下结论。不管怎么说,用户口碑是藏不住的。在我的微信朋友圈,已经有十几位朋友亲身尝试过,并发表了感想。一位朋友表示:"Astra 解决了长期困扰我的视频剪辑问题——只花十几分钟时间就可以总结超长视频素材并进行剪辑包装,让我再次感受到了半年前 OpenClaw 带来的震撼!" 还有两位朋友,以前一行代码都没敲过,更没在游戏行业工作过,却都用 Astra 做出了以自己工作环境为背景的小游戏,并在微信群进行了小范围传播,我还津津有味地玩通关了。

大家讨论最热烈的,还是 Astra 的 3D 能力,有的朋友已经用它为自己的新房子做出了精美的 3D 装修效果图;用 Astra 做出来的游戏,大多包含 3D 数字资产(水平往往相当不错)。我的一位创业者朋友有些夸张地表示:"3D 体验必将泛化,后 Astra 时代的互联网世界,将被 3D 内容淹没!"

恰恰就在 Astra 发布的前几天,今年 9 月初,长期在全球第三方评测中排名第一的 3D 大模型 Tripo 的开发商—— VAST, 完成了由经纬创投领投的总额 30 亿元的 B 轮和 B+ 轮融资。最近半年内,VAST 的融资总额达到 50 亿,刷新了全球 3D AI 领域的纪录。随着 Astra 的迅速走红,很多人提出了一个疑问:通用大模型的 3D 能力已经如此强大,今后还需要专业的原生 3D 模型吗?现在会不会是原生 3D 模型的 " 落日余晖时刻 "?

放在半年前,我恐怕没有资格回答这么专业的技术问题。不过,最近半年我大部分时间都在忙 AI 漫剧的策划和制作,对于包括图片、视频和 3D 在内的多模态模型,有了相当程度的涉猎。前天深夜,我还在跟 AI 漫剧承制公司的朋友深入讨论 " 有了 Astra 还需不需要 Tripo" 的问题。所以,我觉得自己对这个问题还是有发言权的,我的回答很明确:现在不仅不是 3D 模型的末日,反而是一个充满机遇的新时代的开始!

首先我们要搞清一个技术问题:GPT-6 Astra 没有原生 3D 生成能力,至少现在没有;它是一个有能力操作第三方软件完成 3D 内容创作的多模态大模型。所谓原生 3D 模型,可以基于用户提供的文本、图片等 Prompt, 直接生成 3D 数字资产;Astra 则是通过编写代码等方式,操作 Blender, CAD 等专业图形软件,生成 3D 数字资产。严格地说,Astra 更像一个 "3D 艺术家 ",而不是 "3D 资产生成器 " ——这个定义,是 Astra 自己在对话框里告诉我的。

在 Astra 生成 3D 内容的过程中,当然可以包括 Tripo 这样的原生 3D 模型,而且经常包括!Astra 刚刚发布之后,X ( Twitter ) 上最早火起来的那一批 3D 视频,其制作过程往往都是:用 Tripo 生成模型,然后把设置交给 Astra 负责,然后导入到 Blender 里用 Astra 接管后续流程。有人形象地将其形容为:"Tripo 建模,Astra 上发条。" 接下来,如果你要做的是游戏,还可以接入 Unity 乃至 Unreal 3D 引擎;要做设计图,则可以接入 AutoCAD 或者 CAXA;要进一步加强 3D 视频效果,则可以接入 After Effects …… Astra 是一个指挥官,帮助用户最高效地发挥各类专业软件的能力,而不是去替代这些软件。

(Tripo 生成的二次元角色,由 Astra 添加了动态表情,在 X 获得 1300+ 点赞;这只是众多案例之一)

当然,在上面的工作流当中,你也可以不用任何原生 3D 模型,直接让 Astra 操作 Blender 完成全部流程,对于业余创作或许也够用了。但是重视生成质量的专业人士或发烧友,肯定不会止步于此。尤其是在复杂角色、道具、批量物件和多轮迭代当中,能快速生成高质量 3D 资产的专业模型,几乎是决定性的、必不可少的!

举一个例子:你想给自家房子的客厅做软装效果图,包括沙发、桌子、椅子等大量家具。Astra 通过程序代码控制这些家具的尺寸和框架,Tripo 则负责还原特定的细节造型,二者接合才是一个优秀的效果图。我的茶几造型是 " 戴珍珠耳环的猫咪 ",沙发是白色布艺,在沙发和茶几之间还有两个铁艺火烈鸟摆件——如果不使用原生 3D 模型,这些细节是很难还原的。如果你的需求更加专业,比如要设计一家咖啡馆、餐馆之类的经营场所,或者五星级酒店的大堂,那么原生 3D 模型扮演的角色还会更重要。

我想起了十多年前,随着智能手机的普及、短视频平台以及手机剪辑工具的崛起,我们进入了一个 " 视频内容泛化 " 的时代。人人都会拍视频、剪视频、发布视频,这曾经是难以想象的,现在却已司空见惯。这一幕完全有可能在 3D 内容领域复刻:再过几年,或许用不了那么久,人人会做 3D 数字资产也不是什么不可思议的事情。金字塔的基座扩大了,每一层的市场规模都会相应扩大。不管今后大家操作的是 Astra 还是其他 Agent,原生 3D 模型的地位,绝不会削弱,只会更重要。

不久前发布的 Tripo P2.0, 其实已经在为这个 "3D 体验泛化 " 的时代做准备了:

秒级生成能力,让 Agent 可以在 " 生成 - 运行 - 检查 - 修改 " 的循环中快速获得 3D 对象,多轮迭代;

按目标面数范围生成,让 Agent 可以根据性能预算选择几何复杂度,减少后续工作量;

忠实还原创作意图的能力,提高了 Agent 连续执行任务的稳定性,减少重复生成和人工修正;

天然语义分析,让 3D 模型成为可识别和操控的部件,为 Agent 编写部件级交互创造了条件。

具备以上特性的 Tripo P2.0,补上了从 "Agent 会写代码 " 到 "Agent 创作和驱动 3D 对象 " 之间的重要环节。而且,早在 Astra 上线之前,Tripo 就完成了全链路开发者技术基建,例如 Tripo 的 Codex 插件在 9 月 2 日上线,直接承接了 Codex 内部的流量——自从 Astra 上线以来,Tripo 的 API 调用量其实是快速增长的!在此之前,在 DeepSeek, GPT-4o 等大模型的 3D 工作流当中,Tripo 就发挥着举足轻重的作用;现在,在 GPT-6 Astra 的时代,它的地位更加稳固了。

我们不妨分析地更细致一些。在 3D 生成领域,由通用大模型主导的 "" 生成 - 运行 - 检查 - 修改 " 循环能否成立,很大程度上取决于两个技术特征:能否做到秒级生成,成本是否可控。没有前者,就无法实现快速多轮迭代;没有后者,这种迭代的成本将膨胀到用户无法承担。3D 模型可以用更少的尝试、更低的成本,完成反复出现的构造和修改,这就是无论哪家的 Agent 都要反复选择专业 3D 模型承担生成任务的核心原因!Astra 推进的项目越复杂,3D 模型的能力就越是清晰地显现出来。在复杂角色 + 有机资产场景当中,Tripo 目前是 Astra 工作流当中的高频选择,这一点毫不令人奇怪

我还想从一个创作者的角度,谈一谈 "3D 体验泛化 " 之后的需求端变化。Agent+3D 模型可以在游戏行业、设计领域的数字资产生成当中发挥重大作用,这一点大部分人都赞成。我已经看到了业余爱好者用 Astra + Tripo + Godot 三位一体手搓的 " 三国志 " 风格战略游戏,颇具可玩性,把专业游戏开发的门槛降低到了前所未有的水平。我想增加一个 " 暴论 ":在长期,或许 3D state(三维状态)+ 生成画面的结合,才是 AI 视频的正确打开方式,至少是正确打开方式之一。

(Astra + Tripo + Godot 制作的游戏《山河志》,颇有光荣《三国志》的神韵)

大约一年前,我初次跟一家互联网大厂的朋友,一边喝着咖啡一边讨论:" 何时才能出现 AI 原生的影视工业级作品?" 当时我的观点是,今后还是要依靠 3D 模型,把场景美术搭建好、把角色模型做好,让主要角色在场景里面 " 走戏 ",就像真人影视剧拍摄中导演指挥演员和剧组一样。由于技术条件限制,这一幕实现可能还要很久,当时我还是十分保守的。

万万没想到,Seedance 2.0、可灵 3.0 等模型的推出,大幅提升了原生视频模型的上限,使得 AI 影视的时代提前到来了。然而,当前主流视频模型的生成方式都是 " 抽卡 " ——无论你的 Prompt 多么详细,乃至加入手绘原画,生成结果仍然是不确定的,要通过多次试错接近自己想要的结果。这种建立在抽卡基础上的创作模式,与传统的影视创作模式大相径庭。在 AI 短剧大行其道的今天,传统影视剧的 AI 改造尚未取得突破性成果,不是影视行业不想拥抱 AI,很大程度上是创作方法的区别导致的。

其实,画面由谁生成可以放在一条轴上:一端是完整 3D 场景决定画面,一端是视频模型根据少量输入自由补全;中间的方法,可以按对象、区域和动作,决定哪些内容必须遵守 3D,哪些允许模型发挥。而且结构化 3D 资产与状态维护,是纯抽卡式生成给不了的。在这种 3D state+ 生成画面的结合模式中,导演可以精细地操控角色和环境,完整地、不打折扣地实现自己想要的结果。对于精品化的中长剧和大电影来说,这简直是雪中送炭,实用价值怎么估计都不过分!

此时此刻,Astra + Tripo + Blender, 已经具备了从剧本到 3D 视频的能力雏形。照这个势头发展下去, " 用 AI 复刻传统影视创作模式 " 的愿景,或许再过几年乃至几个季度就能实现了。当然,现有的视频模型有其独特的优势,未来不是谁替代谁的关系,应该是齐头并进的关系。在短剧、漫剧等互联网信息流内容当中,完全基于 Prompt 的 AI 原生视频可能会在很长一段时间里占据主流;而在大银幕上,以及精品化的网生内容当中,3D 模型的意义会率先体现出来。

总而言之,Agent + 3D 模型的市场空间,可能比任何人想象的还大。一切才刚刚开始,让我们深呼吸,等待更多的奇迹到来吧。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

英伟达 朋友圈 ai the 融资
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论