开源大模型追上闭源了,安全这道坎还没过

最近一家叫 SaferAI 的安全机构做了一件挺扫兴的事:把中国公司智谱(Z.ai)的开源模型 GLM-5.2,拉到和 OpenAI 的 GPT-5.5、Anthropic 的 Claude Opus 4.7 同一个考场里比了一遍。结论有点扎心——论本事,GLM-5.2 离最前沿的闭源模型只差几个月;论”分寸”,它几乎没怎么设防。

能力追上了,拒绝率却是零

SaferAI 是通过智谱的公开 API 跑的测试,覆盖了网络攻击和生物研究这两类最容易被滥用的能力。结果很刺眼:GLM-5.2 对所有攻击性的网络安全任务和双重用途的生物任务,一个都没拒绝。对照的另一边,Claude Opus 4.7 拒得太狠,连 SaferAI 用来测网络能力的 CyberGym 基准都跑不下去。

安全机构负责人 Henry Papadatos 的话说得很直白:”能力的边界不是风险的边界,评估风险时,你还得把缓解措施的状态算进去。”

这不是说 GLM-5.2 有多特别,而是把整个开源阵营的尴尬摆到了台面上:当模型的脑子能下载到本地,能力就已经出了厂门。

开源真正的麻烦,是”出了门就管不着”

闭源模型把守在服务器里,厂商可以上分类器、做拒绝训练、在 API 层面拦你。开源模型不一样,权重一发出来,谁有算力谁就能自己跑,想改提示词就改,想微调就微调,看不顺眼的护栏直接拆掉。模型厂的安全策略,到服务器边界就失效了。

AI模型安全与开放权重示意图
开源大模型能力逼近前沿,但安全治理却明显滞后(配图由AI生成)

闭源也不是铁桶,但至少还能拦一下

当然,闭源的防线也不是牢不可破。另一家安全机构 Far.ai 就在 Grok 4.5、Gemini 3.1 Pro 这些前沿模型里找到了好几百个”通用越狱”手法——把角色扮演、冒充权威、伪造聊天记录几招叠在一起,模型的防线就容易漏。区别只在于,闭源至少有 API 这层闸门,开源连这层都没有。

Papadatos 提到一个还算实在的办法:训练前做数据过滤,把那些教人写攻击代码的材料从语料里拿掉,对降低生物危险知识有帮助,而且不太伤整体水平。但到了网络攻击这块就难了——你很难训练一个写代码很强的模型,同时让它不会当黑客,毕竟写代码正是现在 AI 最赚钱的本事。

争论的焦点,已经从”行不行”变成”怎么管”

有意思的是,这场架的两端都有道理。一方说开源让更多人能用、能独立审计、能让防守方提前做准备;另一方说危险能力一旦变得可携带、可复制,就基本没法管了。连中国官方在最近的世AI大会上也既表态支持开源,又强调 AI 必须牢牢放在人类可控的范围内。

  • GLM-5.2 在网络与生物能力上落后 GPT-5.5 约 2 到 4 个月,但安全机制差距要大得多
  • 开源模型权重一旦下载,原厂无法再强制更新、召回或监督用途
  • 智谱至今未公开 GLM-5.2 的安全框架、上线前测试承诺或风险评估

📎 原文来源:Open-weight AI models are catching up to the frontier. The safety gap remains. (TechCrunch)

评论

2 条对“开源大模型追上闭源了,安全这道坎还没过”的回复

  1. MWTAH51627 的头像
    MWTAH51627

    开源这事儿最怕的就是“能力先发、治理后补”。GLM-5.2 这测试一看,权重一开源,原厂基本就失去控制权了,真不能只靠厂商自觉。

  2. PRFKY42165 的头像
    PRFKY42165

    我更担心训练前过滤那块,生物还能洗数据,写代码的能力你总不能阉了,不然模型就不会干活了。这个矛盾短期看不到解。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注