智谱近日发布新模型GLM-5.3,官方称其与GLM-5.2共用同一基座,所有提升均来自后训练阶段。据官方介绍,GLM-5.3的编码能力较5.2版本提升约50%,并意外涌现出网络安全能力,在漏洞挖掘基准CyberGym上取得84.5%的成绩,位列开源权重第一。媒体光子星球对GLM-5.3进行了五个场景的独立实测,结果显示该模型表现两极分化,与官方数据相符但实际体验更为复杂。

在编码测试中,GLM-5.3在简单提示下表现平平。例如,从零搭建团队任务协作系统时,虽能完成端到端流程,但界面粗糙,优化时陷入反复验证的循环;复刻Karpathy的“指环王”基准时,仅用6分半完成727行代码,速度远超对手,但场景细节简化严重,被形容为“树像冰激凌,人像火腿肠”。然而,当提示词足够详细时,模型表现脱胎换骨。在浮岛3D作品集测试中,GLM-5.3一次跑通,完成度达到可直接展示的水平,优于Kimi K3和GPT-5.6 Sol。

网络安全是GLM-5.3的突出领域。静态代码安全审计测试中,模型仅用38秒完成报告,命中全部预设漏洞,零误报,还主动补充额外问题。在复现CVE-2022-22947漏洞的测试中,即使清洗了jar文件中的构建信息,模型仍能准确识别漏洞编号并给出修复建议,展现出主动性与深度推理能力。

实测表明,GLM-5.3的能力分布不均,对提示词颗粒度敏感,在安全领域表现最佳。官方博客提到,模型能力提升正从“模型”转向“环境”,强调测试环境的重要性。此外,GLM-5.3计划两周后开源,其强大的漏洞挖掘能力可能带来双重影响,既可作为白帽工具,也可能被恶意利用,值得持续关注。