最新消息:关注人工智能 AI赋能新媒体运营

智谱GLM-5.3发布:参数维持7400亿,后训练优化提升50%性能,编程能力接近Fable 5

科技资讯 admin 浏览

智谱发布 GLM-5.3:后训练驱动性能提升 50%,开源模型排名登顶

8月14日,智谱正式发布大模型 GLM-5.3。该模型基座参数量维持7400亿不变,与 GLM-5.2 同一套底子,此前传闻的万亿参数升级并未出现。智谱通过后训练优化,使 GLM-5.3 性能较上一代提升 50%,在多项主流基准测试中位居开源模型前列,编程与智能体能力接近 Claude Fable5,编程体验超过其他国产模型。

多项关键基准成绩提升显著。在衡量模型于真实终端环境中完成复杂任务的 Terminal-Bench 3.0 上,得分从 4.6 提升至 28.3;聚焦长程软件工程与持续代码修改能力的 DeepSWE v1.1,从 46.2 提升至 66.9;覆盖多类真实专业场景、强调跨工具协作与长程任务的 Agents' Last Exam,从 23.8 提升至 28.5。在覆盖 44 种职业、考察真实高价值知识工作的 GDPval-AA v2 中,GLM-5.3 获得 1769 分,展现出基于编程能力涌现出的专业任务执行力。整体来看,该模型在复杂软件工程、终端操作和更广泛的真实世界 Agent 任务上均有明显进步。

GLM-5.3 基准测试成绩对比

智谱自研的 Z.ai Code Bench 评估更能说明问题。该评估将模型置于真实本地开发环境中,在不同思考档位下执行端到端任务,尽可能还原开发者实际使用 Coding Agent 的体验。测试结果显示,GLM-5.3 在效果与 Token 利用率之间取得更好平衡:High 档位下准确率达 31.4%,超过 Claude Opus4.8 最高档位的 29.5%,而每项任务平均输出约 5 万 tokens,Opus4.8 则需约 12 万 tokens——意味着 GLM-5.3 能以更短的执行路径完成同等任务。

Z.ai Code Bench 测试结果对比

产品落地方面,GLM-5.3 即日起上线智谱官方编程工具 ZCode 和效率工具 AutoClaw,同步开放给 GLM Coding Plan 全量用户及订阅用户。TraeWork、TraeCode、扣子、WorkBuddy、CodeBuddy、Qoder、QwenWork、CatPaw、JoyCode、OpenCode 等第三方编码平台也已开放抢先体验。API 即将上线,完整模型权重将在两周内完成安全加固后开源。智谱表示,其策略是在尽可能限制模型潜在攻击能力的同时,保留其防御价值。8月14日13:00,GLM Coding Plan 全员额度已重置,所有用户后台用量统计均可看到额度回满。