

作者|周末
原创首发|蓝字计划
" 国产模型一哥 ",又杀回战场了。
两个月前,唐杰还在马斯克面前放话:国产模型超越 Claude Fable 5,不会太久。现在两个月过去,智谱立马就把对标把 Fable 5 的 GLM-5.3 端了上来。

图源:智谱官方账号
来得虽快,GLM-5.3 出手却一点都不含糊。
根据智谱自建的 Z.ai Code Bench,GLM-5.3 编程能力较 GLM-5.2 提升了 50%,官方也将其称为目前最强的开源权重编程模型。
在漏洞挖掘上,GLM-5.3 同样不弱。据智谱披露,它一口气找出 2436 个漏洞,其中 1097 个属于中高危漏洞,白盒代码审查和漏洞发现能力已经可以对标 Mythos 5。
智谱把这轮能力提升的主要功劳,归给了后训练。
一般来说,大模型想变得更强,最直接的办法是扩大参数、增加数据,再做一轮大规模预训练,要付出的代价是更多的 GPU、更长训练周期,以及大笔算力、电力和资金支出。
但后训练显然不是这么一回事。简单来说,后训练就是模型完成基础训练后,再通过强化学习不断 " 特训 ",针对具体任务进行优化。
也就是说,别人争着给模型补脑,智谱却靠后天补课,把它练成了神童。
后训练真有这么神?

大模型,也成了做题家
要理解 GLM-5.3 的能力,还得先回到 GLM-5.2。
作为智谱上一代旗舰模型,GLM-5.2 已经站到了开源模型第一梯队。
今年 6 月,智谱开源的 GLM-5.2 采用了混合专家(MoE)架构,总参数规模约 7530 亿,上下文窗口达到 100 万 Token。在 Artificial Analysis 综合能力评测中,GLM-5.2 拿下 51 分,成为当时开源模型中的头部选手。

图源:智谱官网(GLM-5.2 跑分数据)
而两个月后的 GLM-5.3,没有更换底座,也没有继续扩大参数规模。智谱把主要精力放在了后训练上:长程任务环境规模扩大数十倍,任务场景变得更加丰富,后训练的迭代时间也被明显拉长。

图源:智谱官网
这一变化背后,是唐杰对大模型竞争方向的一次判断:Scaling,不只有参数量这一条路子可以走。

图源:智谱 AI 创始人,唐杰社交账号
过去,模型升级最直观的方式是扩大参数规模。但随着模型能力逐渐接近瓶颈,单纯 " 堆参数 " 带来的收益正在下降。
训练过程本身,同样会决定模型的最终能力,这也成了 GLM-5.3 的重点。
GLM-5.3 开始让模型进入更接近真实工作的任务环境。
在一些高难度任务中,GLM-5.3 需要面对完整的工程体系,自己分析性能瓶颈、修改方案、运行测试,并根据反馈不断迭代。而这类任务的复杂程度,已经接近一名经验丰富的工程师连续数天的工作量。
这类训练的核心,是让模型不断强化、学习,并学会如何完成一个目标。
为了扩大这种训练规模,GLM-5.3 还尝试自动生成更多长周期任务环境,并通过评估系统验证任务是否有效,让模型能够接触更丰富的工作场景。
有没有效果?直接上跑分数据。
在考验真实终端环境复杂操作的 Terminal-Bench 3.0 里,GLM-5.3 的分数提高了一大截,成绩从 GLM-5.2 的 4.6 分提升到 28.3 分,已经逼近 Fable 5 的 33.7。
而在更考验 " 长期软件代码能力 " 的 DeepSWE v1.1 中,GLM-5.3 也从 46.2 分提升到 66.9 分,距离 Fable 5 只差不到 3 分。

图源:智谱官网 GLM-5.3 跑分数据
更有意思的是,不同类型任务之间出现了反差。
越接近真实工作流、越需要模型长期执行的任务,GLM-5.3 提升越明显。比如在 Terminal-Bench 3.0 中,它的成绩增长了接近 6 倍。
相比之下,在更偏综合能力和多工具协作的 Agents' Last Exam 中,GLM-5.3 提升幅度相对有限,只涨了 4.7 分。
这样的成绩变化,其实就可以反映了 GLM-5.3 这轮训练的重点:让模型学会完成一件复杂的事情:理解目标、拆解任务、调用工具、不断验证,直到交付结果。
而这类任务,正是长周期训练环境最能发挥作用的地方。
不过,跑分终归只是跑分。要看这种训练有没有让模型更会干活,还得给它一项足够复杂的任务。
比如,从零复刻一个能真正开车到处逛的陆家嘴。

疯狂补课,确实有用
在基座参数没变的前提下,GLM-5.3 编程能力体感暴涨了 50%。那我们就看看,GLM-5.3 用代码能写出什么好看好玩有意思的画面。
我们交给 GLM-5.3 和 GLM-5.2 的任务是:开发一个上海市陆家嘴和外滩区域的 3D 驾驶小游戏,需求大致涵盖地理复刻、昼夜灯光、车辆物理、导航存档等等。
在实测中,GLM-5.3 和 GLM-5.2 交付出的成品明显不同。
GLM-5.2 更倾向于快速完成一个完整 Demo。在接收到需求后,它直接围绕功能展开,将场景、车辆、灯光、交互等模块逐步实现。最终生成的代码规模较大,覆盖了大量功能需求。

GLM-5.2 实测
实际上,GLM-5.2 这种面对复杂任务时能快速过一遍设计方案,然后迅速进入执行阶段的能力,对于快速开发非常重要。例如,在要求加入动态灯光系统时,GLM-5.2 能够理解昼夜变化需求,并尝试通过时间系统控制灯光状态;在车辆驾驶部分,也加入了相关控制逻辑。
只是这种追求速度的打法,也带来了明显的问题:模型更关注需求清单里的每个功能有没有跑通,轻视了不同模块之间是否协调,以及项目以后要怎么扩展。
于是,在 GLM-5.2 交付的这个成品里,城市细节可以说是几乎没有的。所有的建筑、地面和车辆,都是同一套色块,灯光也比较线性。
相比之下,GLM-5.3 的表现就有明显进步。
在生成结果中,GLM-5.3 采用了更接近真实工程项目的分层方式:配置层、核心层、数据层、世界构建层、系统层、装配层,而很少围绕具体功能。

GLM-5.3
这正是长周期后训练想要强化的能力:先规划整体结构,再分步骤实现,并在更长的任务链中处理好前后的依赖关系。
以后想加入更多城市区域、NPC 车辆、天气系统或者 AI 驾驶,只需要在现有架构上继续增加模块,不用把已有代码推倒重来。
而且干活更细致之后,GLM-5.3 确实也能带来更好的效果。
当我们在游戏中驾驶着小车车畅游陆家嘴的时候,随车辆移动所产生的影子变化、写字楼的格子间灯光、色彩较多的城市界面、不同的车辆驾驶视角,GLM-5.3 都有在还原。

甚至是,车辆刹车时的车尾灯开启、车辆惯性、非路面行驶会限速都有体现;物理反馈、摄像机跟随、状态管理,GLM-5.3 都有考虑在内。

这可不是单纯多放了几个视觉元素。刹车灯需要车辆状态联动灯光系统,非路面限速也需要地形判断与物理系统配合。能把这些细节串起来,说明 GLM-5.3 对跨模块关系处理的效果不错。

可以说,更细的任务拆解和更完整的工程规划,让 GLM-5.3 交出的成品更完整,也更接近一个可以继续开发的项目。
不过,GLM-5.3 也还是有点愚蠢的地方。除了标志性建筑外,其他建筑几乎一个样。并且,许多建筑直接是在路面上生成,所以能看到很多路面是没法通行的。
这些问题也说明,GLM-5.3 虽然能够搭起复杂工程,却还没有把整张地图的空间关系检查好。
总的来说,有这样的提升,其实已经能说明后训练这套的确有两把刷子。但这也留下了一个终极问题:既然后训练效果那么好,为什么其他家不来抄抄?

国模一哥,也有保质期
其实,大家早就在干了。
从 OpenAI o1 到 DeepSeek-R1,强化学习早已被用来提升模型的推理和编程能力。智谱这次的不同,是把长周期任务环境扩大数十倍,专门训练 GLM-5.3 处理复杂工程。

图源:海外用户发文
这办法听起来一点都不神秘,只是门槛也一点不低。
最先,最容易卡住厂商的就是出题。
一道普通的代码题,提前准备好测试用例就能判断对错。长周期编程任务却要把模型放进真实工程,前面改错一个地方,后面整个项目都有可能出问题。
想大规模生成这类任务,还要保证每道题都能正常运行、反复训练,难度远高于收集一批代码。
光有题还不够,评分也得靠谱。
一旦评分标准存在漏洞,模型就可能学会钻空子。表面上分数越来越高,实际任务却没有完成。这就是强化学习中经常出现的 " 奖励作弊 "。
再加上,后训练其实也没有比预训练便宜多少。
一次长周期任务可能要跑上许多轮。模型不断尝试,失败的过程同样消耗 Token 和算力。后训练顶多是省下了重做模型基座的钱,但要是真到了算账的时候,能省下多少可能真不好说。

更别说它还有一个更明显的边界:练什么,就只学什么。
GLM-5.3 在 Terminal-Bench 3.0 中的成绩从 4.6 分涨到 28.3 分,接近翻了六倍;在考察综合能力和多工具协作的 Agents' Last Exam 中,却只提高了 4.7 分,就是最好的案例。
因此,所谓 50% 的编程能力提升,主要集中在长周期编程和复杂工程任务上,绝对不能和整个模型的能力提升了 50% 划等号。
正因如此,后训练更适合把底座已经具备的能力继续补强,要是底座里本来就没有的知识和能力,就没法通过后训练长出来了。
那为什么后训练依然如此受欢迎呢?因为确实高效率啊。
过去,厂商往往要等到下一代基座训练完成,才能迎来一次大升级。现在,同一套基座换一批任务环境、重新训练几个月,也可能推出一个能力明显更强的新版本。
一个模型刚在榜单上冲到前面,对手很快就能用新的训练方法追上来。今天领先的能力,过几个月可能就成了其他模型的基础配置。
智谱在 Blog 最前面写下 " 单弦不成音,独木不成林 "。这句话听起来很从容,也正好说中了现在的局面:模型厂商各有路线,第一梯队的位置也会反复换人。
只是智谱能一直从容吗?这或许是整个大模型行业,都需要自我拷问的问题。
参考资料:
[ 1 ] 数字生命卡兹克:聊聊唐杰老师对 GLM-5.3 和 Scaling Law 的思考
[ 2 ] 量子位:刚刚,GLM-5.3 发布:Coding 更接近 Fable 5!潜伏 40 年的 bug 都被揪出来了
[ 3 ] APPSO:实测 GLM-5.3: 在神仙打架的一周杀回国模顶流,还按下了重置键
[ 4 ] 钛媒体:GLM-5.3 发布,基座没变,能力却涨了
[ 5 ] AI 科技评论:GLM-5.3 来了:底座没换,编程暴涨 50%,还顺手揪出潜伏 40 年的世界级漏洞
主编 : 袁明武 责编 : 海沃德
版式 :伊妍
历史文章
Review





登录后才可以发布评论哦
打开小程序可以发布评论哦