分享文章
智谱推出GLM-5.3 重点提升编程开发和网络安全能力

中国人工智能公司智谱日前推出 GLM-5.3 模型,该模型没有更换基础模型,而是继续使用 GLM-5.2 底座,主要通过扩大后训练规模来提升长时程编程、智能体任务和网络安全能力。
智谱在博客中表示,目前团队还在继续进行安全评估和加固,所以当前没有开放模型权重,后续完成安全评估和加固后将继续以开放形式发布,GLM-5.3 预计在两周后开放权重文件下载。

GLM-5.3 的主要工作就是扩大后训练规模,开发团队在近期投入更多、更复杂且持续时间更长的任务环境。与传统的代码训练题不同,这些任务要求模型在完整的工作环境中读取代码、调用工具、运行测试、定位问题并完成最终交付。
为此智谱继续使用 IndexShare、SAO 和 slime 等工具,其中 IndexShare 用于提升长上下文处理效率,SAO 用于训练长时程强化学习任务,slime 则是智谱开源的后训练框架,负责连接模型训练、推理和任务环境。
智谱搭建自动生成和验证任务环境的流水线,由研究智能体从真实工作中提取任务模式,再生成可以运行的长期任务。其他智能体负责验证任务是否可完成,检查模型是否通过投机方式获得奖励,排除没有明确结果或无法验证的任务等。
这意味着模型训练重点正在从准备更多问答数据转向构建更多可执行、验证和反复运行的工作环境。对编程智能体来说,模型能否持续完成数十个步骤,往往比单次生成代码的质量更加重要。
智谱公布的测试数据显示,GLM-5.3 在多种模型基准测试中的表现都有所提升,在更多侧重于接近真实编程工作、需要模型操作终端、修改项目文件、运行测试并处理连续错误的基准测试中,GLM-5.3 的表现要比 GLM-5.2 好很多。
值得注意的是,智谱内部测试还表明,GLM-5.3 可以使用更少的 Token 完成任务,例如在某些任务中,GLM-5.2 需要 95K 才能完成任务,而 GLM-5.3 只需要 78K 左右就可以完成任务,因此在复杂任务中 GLM-5.3 可以节省更多资源用量。
不过这些数据主要来自智谱公布的测试结果,不能简单地理解为 GLM-5.3 已经全面超越所有闭源模型。在部分公开测试中,GPT-5.6 Sol 和其他前沿闭源模型仍然领先,GLM-5.3 的主要变化是大幅度缩小差距,并在开放模型中达到较高水平。
网络安全能力是 GLM-5.3 此次升级中最受关注的部分,智谱原本只是希望增加漏洞发现数据和相关环境,让模型更擅长寻找安全问题,但在扩大后训练规模后,模型的能力提升速度超过预期。
GLM-5.3 已经不只是发现简单漏洞,还可以将多个步骤串联起来从而形成完整的漏洞利用计划。智谱称研究团队目前已经将 GLM-5.3 用于 269 个真实项目,经过专家复核、筛选和去重后,合计发现 2436 个有效漏洞,其中 1097 个属于中高危漏洞,目前已经有 53 个漏洞公开披露,其他漏洞仍然处于延期披露状态。
智谱计划在完成安全测试和模型加固后公开 GLM-5.3 权重,到时候安全研究团体也可以使用 GLM-5.3 模型提高漏洞发掘效率,提升网络安全。
消息源:智谱官方博客

[超站]友情链接:
四季很好,只要有你,文娱排行榜:https://www.yaopaiming.com/
关注数据与安全,洞悉企业级服务市场:https://www.ijiandao.com/








冉冉学姐
关注网络尖刀微信公众号
