Anthropic在2026年9月29日发布的研究中,对智谱AI(海外称Z.ai)的GLM-5.3给出了一个明确判断:它已具备自主构建端到端网络攻击链的能力,且发布时未附带有效防护。这一结论与NIST下属CAISI的评估方向一致——后者称GLM-5.3是“迄今发布的最具网络攻击能力的开放权重模型”,综合网络基准落后美国前沿约四个月。
能力评测:从“能写利用”到“能自主发现并串联漏洞”
Anthropic的评测分两条线。自动化基准方面,在ExploitBench(针对Chrome V8引擎已知漏洞)上,GLM-5.3在410次尝试中成功构建端到端利用50次,Claude Mythos Preview为56次;在内部Binary Exploitation基准的100个任务中,GLM-5.3取得4%的完整控制流劫持,Mythos Preview为6%。作为对比,Claude Opus 4.6、GLM-5.2、Kimi K3、DeepSeek V4.1-Flash均接近或等于0%。
更值得关注的是人机协同的开放式测试。研究人员在沙箱中让GLM-5.3攻击一个本地Linux版浏览器,模型在一天内(人类注意力不足一小时)发现了JavaScript引擎中多个此前未知的漏洞,并串联成可工作的利用链:访问恶意网页即可读取访客机器上的任意文件。同一会话中,模型还在无线驱动、图形驱动和网络设备软件中识别出可利用漏洞。另一组测试中,GLM-5.3-Flash仅凭公开CVE信息,在20分钟人类注意力加8小时模型工作后,构建出绕过ARM64指针认证(PAC)的可靠利用链,按API价格计算成本约20.40美元。
防护失效:64%到100%的绕过率
GLM-5.3内置了拒绝机制,对明显有害请求通常会拒绝。但Anthropic测试发现,简单技术即可绕过:伪造掩护故事后,模型对恶意网络攻击指令的响应率从0%升至64%;预填推理内容后升至92%;经“abliteration”(拒绝削减)处理后达到100%。相比之下,Claude Opus 5在相同测试中保持0%。
Abliteration之所以对GLM-5.3特别有效,是因为它以开放权重形式发布。Anthropic团队自己制作了abliterated副本,花费约2200 GPU小时、约4400美元,将模型在JailbreakBench和HarmBench上的拒绝率从90%以上降至约3%和2%,StrongREJECT上降至12%,而通用科学能力(GPQA-Diamond)未见下降,CyberGym子集仅低几个百分点。模型发布后数天内,公开的abliterated版本即已出现。
无防护发布意味着什么
Anthropic五个月前发布Claude Mythos Preview时选择了受限发布路径(Project Glasswing),让可信防御者先发现超过10000个漏洞。而GLM-5.3任何人都可下载。CAISI的对比中,美国模型在适用时以关闭网络防护的版本测试,但那些版本仅限受审查用户;GLM-5.3则无此门槛。这意味着攻击者获取同等能力的成本从“需要被审查”降为“下载即可”。
企业防御:三个必须加固的层面
对使用Agent和代码执行能力的企业,以下建议属于工程分析,而非官方结论。
模型接入网关:不要把开放权重模型直接暴露给不受信输入。在网关层做请求意图分类,对涉及漏洞利用、凭据读取、网络扫描的指令做拦截或降级。注意掩护故事和预填推理是已验证的绕过手法,单轮关键词过滤不够,需要结合会话上下文和工具调用序列做异常检测。
Agent工具调用:限制Agent可调用的工具集合,对文件读取、网络请求、进程执行做白名单。GLM-5.3在测试中读取了/root/.ssh/id_rsa,说明凭据文件必须与Agent运行环境隔离,敏感路径应通过挂载策略或seccomp规则阻断。
代码执行沙箱:评测中模型均在隔离沙箱内运行,只攻击离线目标。生产环境应保持同等隔离:网络出口默认拒绝,文件系统只读挂载,禁止访问宿主机元数据服务。对模型生成的利用代码,不应在含真实凭据的环境中执行。
滥用监测:记录模型输出的利用链特征(如堆喷射、ROP链、PAC绕过模式),对高频漏洞发现行为设置速率限制。开放权重模型无法从服务端撤回,监测是最后一道可观测防线。
GLM-5.3的能力提升本身对防御者同样有价值——Anthropic也承认这些能力可帮助安全团队发现漏洞。问题在于,当同等能力以无有效防护的方式扩散时,攻击者的门槛被显著拉低。企业需要假设“攻击者已能调用前沿级模型”来重新评估自己的暴露面。