
中国AI实验室Zhipu开发的GLM-5.3在编码和安全基准测试中表现惊艳,与Anthropic的《Fable 5》不相上下,并意外发现了一个40多年前的安全漏洞。
GLM-5.3专注于编码和安全领域,在相关基准测试中取得了显著进步。例如,在DeepSWE上性能提升了约1.5倍,在Terminal Bench 3.0上提升了6倍,并在CyberGym上占据领先地位。
GLM-5.3延续了前代743亿参数的规模,所有编码和网络安全方面的提升均得益于Zhipu的后训练协议。
在DeepSWE测试中,GLM-5.3得分66.9,GLM 5.2得分46.2,而《Fable 5》得分69.7。
在Terminal Bench 3.0测试中,GLM-5.3得分28.3,GLM-5.2得分4.6,而《Fable 5》得分33.7。
在CyberGym测试中,GLM-5.3以84.5分的成绩领先,《Fable 5》得分83.8,GPT-5.6 Sol得分83.6。
Zhipu还发布了一份报告,披露了269个开源项目中的2436个安全问题,其中1097个属于严重或高风险。最古老的漏洞可追溯至1981年,这些安全问题平均潜伏了26.6年。
Zhipu的下一代模型将采用新架构,参数数量是当前的两倍,显示出该AI实验室挑战《Fable 5》地位的决心。公司计划在几天后发布GLM-5.3的模型权重。


中国AI实验室Zhipu的GLM-5.3在编码和安全基准测试中表现出色,与Anthropic的《Fable 5》相匹敌,并发现了一个40多年前的安全漏洞。
关键词:AI、安全漏洞、编码能力、发布会、Gamescom
来源:Wccftech
发布时间:2026-08-14T22:50:51+08:00
0
0