智谱今天悄悄放出了新模型GLM-5.3,编程这块儿又往前蹿了一截,评测里跟Fable 5、GPT-5.6 Sol基本打平。参数规模还是7000亿左右,跟上一代GLM-5.2差不多,但这次提升主要靠后训练阶段的扩展,不是硬堆参数。官方顺手把后训练框架Slime也开源了,GLM、Qwen、DeepSeek和Llama 3的部分模型都能用。API下周二开放,完整权重两周内放出。
GLM-5.3的编程能力到底有多能打?
这次GLM-5.3在好几个基准测试里都挺亮眼。OpenAI搞的GDPVal评估里直接排第一,AutomationBench和Agents' Last Exam这类考验智能体执行力的测试里也排在前头。换句话说,它不只是会写代码,更擅长理解复杂任务、自己规划步骤去搞定。
- 编程表现对标Fable 5和GPT-5.6 Sol,属于第一梯队。
- 在GDPVal、AutomationBench、Agents' Last Exam等测试里都位居前列。
- 后训练扩展是主要提升来源,参数规模保持在7000亿级别。
网络安全:不只是写代码,还能挖老漏洞
GLM-5.3在网络安全任务里跟Claude Mythos 5表现持平。在ExploitGym测试里,它6小时完成了130道题,这个速度确实有点吓人。智谱还公开了一个网络安全披露账本,记录模型发现的历史漏洞,里头甚至还有约40年前的漏洞。说明它不只是从现有数据里学,而是真能挖出老古董级别的安全问题。
开源后训练框架Slime
智谱把后训练框架Slime开源了,支持GLM、Qwen、DeepSeek系列部分模型以及Llama 3。后训练一直是模型落地的关键环节,Slime相当于把智谱自己调模型的家底亮了出来。开发者可以直接拿来微调自己的模型,不用从零折腾训练流程。
实际体验:有惊喜也有糙的地方
上手试了试GLM-5.3,3D网页生成和交互仿真这类任务上,效果有点参差不齐。有些生成结果比较粗糙,但在复杂场景比如行星碰撞模拟里,效果反而很好,细节和物理反馈都像那么回事。在Claude Code里用的时候,命令安全判断存在适配问题,有时候会误判。不过ZCode能持续迭代优化,这个短板应该会慢慢补上。
上线渠道和开放节奏
GLM-5.3已经上线智谱官方应用Zcode和AutoClaw,Coding Plan用户可以直接订阅。第三方平台WorkBuddy、QwenWork、TraeWork也开放了体验入口。API调用预计下周二开放,模型完整权重会在两周内开源。想尝鲜的可以先去第三方平台试试手感,等API开放再接入自己的工具链。
FAQ
Q: GLM-5.3和GLM-5.2相比,主要变化是什么?
A: 参数量差不多,都在7000亿左右,但GLM-5.3通过扩展后训练阶段,把编程和智能体任务的能力拉高了一大截,评测中已经能跟Fable 5和GPT-5.6 Sol掰手腕。
Q: Slime框架能用来做什么?
A: Slime是智谱开源的模型后训练框架,支持GLM、Qwen、DeepSeek部分模型以及Llama 3。你可以用它来对模型做后训练微调,省去不少底层搭建的功夫。
Q: GLM-5.3在网络安全方面有什么特别之处?
A: 它在ExploitGym测试中6小时完成130道题,和Claude Mythos 5表现持平。智谱还公布了网络安全披露账本,里面包含模型发现的约40年前的漏洞,说明它具备挖掘历史遗留安全问题的能力。
Q: 什么时候能用上GLM-5.3的API和完整权重?
A: API预计下周二开放,模型完整权重会在两周内开源。现在可以通过Zcode、AutoClaw或第三方平台WorkBuddy、QwenWork、TraeWork先体验。
来源:爱范儿