驱动之家 08-14
智谱GLM-5.3大模型发布:开源中最强、编程/智能体性能接近Fable 5
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

快科技 8 月 14 日消息,智谱创始人几个小时前才说 GLM-5.3 很快发布,没想到中午就发了,相比当前的 GLM-5.2 提升 50%,是开源最强的,编程与智能体性能接近 Fable 5。

与之前传闻的不同,GLM-5.3 跟 GLM-5.2 基座模型还是一样的 7400 多亿参数量,升级到万亿参数是没有的,有可能是留给 GLM-5.5 了,但这也没有妨碍 GLM-5.3 通过后训练来提升性能水平。

根据智谱说法,在多项主流基准测试中 GLM-5.3 是当前排名最高的开源模型,编程与智能体能力接近 Claude Fable 5,编程体感超过其他国产模型。

在衡量模型于真实终端环境中完成复杂任务的 Terminal-Bench 3.0 上,GLM-5.3 得分从 4.6 提升至 28.3;在聚焦长程软件工程与持续代码修改能力的 DeepSWE v1.1 上,得分从 46.2 提升至 66.9;

在覆盖多类真实专业场景、强调跨工具协作与长程任务的 Agents' Last Exam 上,得分从 23.8 提升至 28.5。

在覆盖 44 种职业、考察真实高价值知识工作的 GDPval-AA v2 中得分 1769,展现基于编程能力涌现的专业任务执行能力。

整体来看,GLM-5.3 在复杂软件工程、终端操作和更广泛的真实世界 Agent 任务上均取得非常显著的进步。

自研的 Z.ai Code Bench 评估模型在真实编程场景中的综合体感。模型会被置于复杂的本地开发环境,并在不同思考档位下执行端到端任务,更接近开发者实际使用 Coding Agent 时的体验。

测试结果显示,GLM-5.3 在效果和 Token 利用率之间取得了更好的平衡。

在 High 档位下,GLM-5.3 达到 31.4% 的准确率,超过 Claude Opus 4.8 最高档位的 29.5%,每项任务平均输出约 5 万 tokens,而 Opus 4.8 需要约 12 万 tokens,意味着 GLM-5.3 可以用更短的执行路径完成任务。

GLM-5.3 即日起上线智谱官方编程工具 ZCode、效率工具 AutoClaw,上线 GLM Coding Plan 全量用户及开放订阅。

TraeWork/TraeCode/ 扣子、WorkBuddy/CodeBuddy、Qoder/QwenWork、CatPaw、JoyCode、OpenCode 等编码平台开放抢先体验。

API 很快上线,完整模型权重将在两周内开源,此前需完成必要的安全加固,尽可能限制其潜在攻击能力,保留其防御价值。

今天 13:00,GLM Coding Plan 全员额度重置,所有用户后台「用量统计」可见使用额度回满。

更详细的情况可以参考官方的发布通稿。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

编程 开源 创始人 效果
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论