智譜近日釋出新模型GLM-5.3,官方稱其與GLM-5.2共用同一基座,所有提升均來自後訓練階段。據官方介紹,GLM-5.3的編碼能力較5.2版本提升約50%,並意外湧現出網路安全能力,在漏洞挖掘基準CyberGym上取得84.5%的成績,位列開源權重第一。媒體光子星球對GLM-5.3進行了五個場景的獨立實測,結果顯示該模型表現兩極分化,與官方資料相符但實際體驗更為複雜。

在編碼測試中,GLM-5.3在簡單提示下表現平平。例如,從零搭建團隊任務協作系統時,雖能完成端到端流程,但介面粗糙,最佳化時陷入反覆驗證的迴圈;復刻Karpathy的“指環王”基準時,僅用6分半完成727行程式碼,速度遠超對手,但場景細節簡化嚴重,被形容為“樹像冰激凌,人像火腿腸”。然而,當提示詞足夠詳細時,模型表現脫胎換骨。在浮島3D作品集測試中,GLM-5.3一次跑通,完成度達到可直接展示的水平,優於Kimi K3和GPT-5.6 Sol。

網路安全是GLM-5.3的突出領域。靜態程式碼安全審計測試中,模型僅用38秒完成報告,命中全部預設漏洞,零誤報,還主動補充額外問題。在復現CVE-2022-22947漏洞的測試中,即使清洗了jar檔案中的構建資訊,模型仍能準確識別漏洞編號並給出修復建議,展現出主動性與深度推理能力。

實測表明,GLM-5.3的能力分佈不均,對提示詞顆粒度敏感,在安全領域表現最佳。官方部落格提到,模型能力提升正從“模型”轉向“環境”,強調測試環境的重要性。此外,GLM-5.3計劃兩週後開源,其強大的漏洞挖掘能力可能帶來雙重影響,既可作為白帽工具,也可能被惡意利用,值得持續關注。