在Anthropic发布的一份AI安全评估报告中,一组针对模型漏洞挖掘能力的测试数据,让GLM-5.3进入行业视野。这份报告本身以风险警示为核心,但附带的评测结果,客观展现了GLM-5.3在端到端漏洞利用场景下的性能,甚至在指定测试任务中,表现和Anthropic自家Claude Mythos Preview模型处于相近区间。
很多人看到这个结论,会直接解读为国产大模型已经全面追平海外头部模型,但单组测试数据无法支撑这个宏大论断。同时我们也不能因为报告的主题聚焦AI安全风险,就忽略测试本身传递出的技术信号:GLM-5.3已经不再是仅能在演示场景交出亮眼答卷的模型,在真实复杂安全任务上,它具备落地执行的潜力。值得一提的是,该评测结论并非GLM团队主动宣传产出,而是由竞争对手在风险研究中得出,这也让这份数据拥有特殊的参考价值。
评判模型能力:不在于“懂漏洞”,而在于完成端到端利用
开发者在日常使用大模型时,经常遇到一类现象:模型可以把漏洞原理、代码缺陷讲解得条理清晰,但一旦要求它动手修改漏洞代码、构造完整利用链,多轮操作之后反而会引入更多新问题。由此可以得出一个核心评判标准:评估大模型的能力,不能只看模型输出内容是否像行业专家,更要考察模型能否输出可落地、可执行的完整结果。而Anthropic本次研究,正是将评估重心放在后者。
本次测试依托ExploitBench基准集,测试目标围绕Chrome浏览器V8引擎的已知安全漏洞,重点检验模型能否独立完成端到端漏洞利用全流程。
测试设置总尝试次数为410次,最终结果如下:
- GLM-5.3:成功完成漏洞利用50次,成功率12.2%
- Claude Mythos Preview:成功完成漏洞利用56次,成功率13.7%
这里需要澄清一个容易出现的理解误区:410次代表的是测试尝试总次数,并非410套相互独立的目标系统。两组模型数据接近,并不等同于二者在统计学意义上性能完全等价,只能说明在该套ExploitBench测试集下,二者完成漏洞利用任务的水平差距很小。
除ExploitBench之外,Anthropic还搭建了另一组内部二进制漏洞利用测试。研究人员从基准库随机抽取100项任务,测试模型实现完整控制流劫持的能力。
- GLM-5.3:达成完整控制流劫持占比4%
- Claude Mythos Preview:达成完整控制流劫持占比6%
- Claude Opus 4.6、GLM-5.2:在本组测试任务中,没有成功案例
4%的成功率从绝对数值上看并不高,但需要区分两个完全不同的技术状态:“绝大多数任务无法完成”,和“过去完全无法完成,现在已经可以稳定实现部分任务”。对于漏洞挖掘这类需要反复试错、多步骤串联的复杂任务,这种从0到1的突破,比小幅提升成功率更值得行业关注。
报告中还记录了一项隔离环境下的重要发现:研究人员使用GLM-5.3,成功发现了一处此前未被披露的浏览器组件漏洞,并且把多个漏洞串联,构建出一套可运行的漏洞利用链。相关漏洞信息已经提交给组件维护方进行修复。
> 需要重点说明:该结果仅诞生于受控的学术研究环境,并不是已经发生、影响普通用户的真实网络攻击事件。
这份报告真正认可的,不是GLM-5.3单纯掌握安全领域理论知识,而是模型已经具备串联多步操作、落地执行复杂安全任务的工程能力。模型不再局限于文本层面解释漏洞,能够完成从信息收集、漏洞定位到构造利用载荷的完整链路。
理性解读“接近前沿”:划定边界,避免片面营销
这句话是最容易被截取、用于营销传播的表述,我们需要完整厘清它的适用边界。
GLM-5.3所接近的,仅为Claude Mythos Preview在部分漏洞利用专项测试中的表现,不等于GLM-5.3追上全部Claude系列模型的综合能力,更不等于达到当前整个大模型行业的最高技术水平。
Anthropic在报告中明确标注,Mythos Preview本身是面向受信防御者提供的特定版本,Anthropic后续已经推出能力更强的新一代Mythos系列模型。因此,不能直接把本次对照组的Mythos Preview,等同于Anthropic同期性能最强的Claude模型。
NIST下属CAISI的评估,可以为我们提供另一维度的参考。CAISI评估认为,GLM-5.3是截止评估时间,网络安全方向能力最强的开放权重模型。但综合网络安全全指标衡量,该模型和美国前沿模型之间,依然存在明显差距,估算能力差距大约为4个月。
该评估的适用范围存在限制:评估对象仅限开放给授信用户的模型,测试环境会关闭模型自带的网络安全防护机制。
两组评估结论并不矛盾,可以合并总结为两点:
- 在漏洞利用这类特定专项任务中,GLM-5.3的表现,能够接近一款早期前沿模型;
- 在覆盖面更广、任务类型更多元的综合安全评测中,它和最新一代前沿模型,仍然存在能力差距。
只保留前半句,会低估海外前沿模型的综合实力;只保留后半句,会忽略国产模型在专项场景取得的技术突破。而这份报告,没有任何证据可以证明GLM-5.3达到AGI级别,相关说法属于脱离原文的过度推演。
能力获得认可后,核心争论转向模型访问权限管控
当模型具备执行漏洞挖掘这类高危任务的能力之后,讨论重心不再只局限于模型本身性能,而转向一个更关键的问题:谁有权限获取、使用这一套能力?
这也是Anthropic这份安全报告核心担忧。Mythos Preview采用受限分发模式,仅向经过审核的安全防御人员开放;而GLM-5.3属于开放权重模型,权重文件可以直接下载、本地修改与部署。基于这个差异,报告提出风险警示:恶意使用者获取并利用GLM-5.3高危能力的门槛更低。
这个风险逻辑不难理解。模型权重一旦公开分发,平台很难保证全部使用者都会严格遵守服务协议。就算封禁一个用户账号,已经扩散出去的权重副本,无法被一次性全部收回。
但是,识别风险不等于讨论就此终止。风险暴露之后,一系列更复杂的治理问题浮出水面:
由谁判定一名开发者属于“合格防御者”?
大型企业拥有独立安全团队、法务与完整采购审批流程;小型团队可能只有一名兼职工程师维护基础设施。二者是否拥有平等的申请获取前沿模型的机会?
审核判定标准是否对外公开透明?当申请被拒绝时,申请者能否拿到对应的解释说明,以及有效的申诉渠道?
这些疑问,并不是反对安全管控机制,而是追问安全治理方案,能否兼顾资源充足的大企业,和缺少资质证明的小型安全从业者。
客观来看,Anthropic报告本身也提出立场:应当扩大防御者群体对前沿模型的访问权限,防御方所使用的工具能力,至少不能弱于攻击者可获取的工具能力。这个观点不能被歪曲理解为“只允许我方使用,禁止他人获取同类能力”。行业真正值得讨论的,是这套“防御者优先”的原则,该如何设计机制落地,而不是停留在口号层面的争辩。
区分模型能力与访问管控能力:闭源不等于模型本身更强
本次报告中另外一组被广泛传播的数字:64%、92%、100%,来自不同测试条件下的防护绕过实验。我们需要分清指标含义:该指标衡量的是,当模型收到恶意指令之后,是否会尝试建立连接、访问目标系统,指标本身不直接代表模型挖掘漏洞的原生能力。
闭源模型可以通过账号准入、调用鉴权、流量审计等方式限制访问。但这类管控手段,属于产品侧的访问控制,并不是模型推理本身的能力优势。开放权重模型虽然难以限制本地部署后的行为,但在API调用场景下,开发者可以借助API网关,统一做请求鉴权、流量限流、输入内容审计,降低高危调用带来的风险。Treerouter作为API网关,可集中管理多模型接入请求,统一完成安全校验,帮助企业在使用开放权重模型的同时,构建一层访问管控屏障。
行业启示:开放权重模型的安全治理是双向命题
GLM-5.3在漏洞挖掘任务上取得的测试结果,给整个大模型安全领域带来全新的思考维度。过去很长一段时间,高危安全能力几乎集中在闭源头部模型手里,开放权重模型更多偏向通用对话、代码辅助等低风险场景。而GLM-5.3的测试结果,标志着开放权重模型,也已经具备执行高风险安全任务的实力。
这种变化带来双重影响。从正面视角,全球网络防御社区可以借助开放权重模型,自动化挖掘组件漏洞,提前发现系统缺陷,提升基础设施的防御能力。中小企业安全团队不再需要高额预算,就可以借助本地部署的模型搭建自动化漏洞扫描工具,缩小和大型厂商在安全工具层面的差距。
风险侧的挑战同样明确。开放权重模型本地部署没有云端平台的统一审计,攻击者可以修改模型权重、移除内置安全对齐,利用模型批量生成漏洞利用载荷,自动化发起渗透测试。安全防护体系,需要从单纯依赖模型内置对齐,转向多层防御体系:输入内容过滤、调用权限控制、行为日志审计、高危动作拦截,多层叠加实现风险管控。
我们不能简单对开放权重模型做出非黑即白的评判。开放权重不是天然的安全威胁,闭源分发也不等于绝对安全。二者只是两种不同的技术分发模式,各自配套一套差异化的安全治理方案。
闭源厂商依靠账号审核、调用配额、远程关停的方式管控风险;开放权重模型的安全,则更多依赖使用者、社区、第三方平台共同建立防护机制。对于企业开发者而言,在接入开放模型API时,配套流量审计、权限隔离的网关服务,能够有效降低业务侧的安全暴露面。
本次Anthropic的评测,最大价值不是一场模型胜负对比,而是给行业敲响警钟:模型高危能力正在快速下沉,开放权重模型正在缩小和前沿闭源模型的专项能力差距。未来的安全博弈,不再仅仅比拼模型推理性能,同时比拼访问管控、使用审计、应急响应整套配套体系。
在看待国产大模型的技术进展时,需要保持客观。GLM-5.3在漏洞利用专项任务取得亮眼成绩,是值得肯定的技术突破,但不能以此直接判定已经全面追平海外头部模型。模型能力是分场景、分维度的,单一基准测试,无法覆盖通用推理、多模态、长文本、代码生成等全部能力维度。
同样,面对模型带来的安全风险,也不能走向一刀切禁止。网络安全的底层逻辑是攻防对等,防御方需要拥有和攻击者对等的工具能力,才能提前发现、修复漏洞。治理的核心目标,是建立机制,让这类强大模型更多被防御者使用,同时降低恶意滥用的可能性。
随着大模型能力持续迭代,AI安全治理会持续成为行业核心议题。模型能力、分发模式、访问管控、合规审计,每一环都需要技术人员、安全从业者、政策制定者持续协同探索。






