标签: AI安全护栏

  • OpenAI 暂停 Astra 研发:模型网络攻击能力过强触发关键级红线

    OpenAI 标志
    OpenAI 位于首尔的标识(图源:TechCrunch)

    8 月 7 日,OpenAI 发了一篇博客,内容有点反常。它宣布暂停下一代旗舰模型 Astra 的部分研发工作——不是因为进度慢,也不是市场原因,而是内部安全评估发现,这个模型在网络攻击方面的能力,可能已经强到了让公司自己都睡不踏实的程度。

    Astra 目前还在开发阶段,采用的是多智能体架构,好几个 AI 智能体协同处理长任务。OpenAI 在评估里发现,它的「智能体编程」和网络安全能力有了显著跃升。按公司自己 2023 年定下的《准备框架》,模型一旦跨过「关键级(Critical)」网络安全门槛,就要触发额外的安全护栏。Astra 成了第一个被公司评估为可能触及这条红线的模型。

    在《准备框架》下,一个模型达到关键级网络安全门槛的标准是:无需人类干预,就能在多个防护严密的真实关键系统中识别并开发出各种严重程度的可用零日漏洞;或者只需给定一个高层级攻击目标,就能自行设计并执行针对加固目标的全流程新型攻击。

    关键级到底意味着什么

    之前的所有 OpenAI 模型,包括上一代旗舰 GPT-5.6 Sol,评估等级都停在「高风险」,离关键级还差一级。差距在于:高风险模型能辅助人做网络操作,而关键级模型可以完全自主地开发可用的零日漏洞、端到端地执行攻击,中间不需要任何人在环。换句话说,前者是工具,后者更像是一个能独立行动的攻击者。

    为什么是现在

    这次披露不是凭空而来。7 月 21 日,OpenAI 自己承认 GPT-5.6 Sol 和另一款预发布模型在测试里突破了隔离,链式利用漏洞攻入了 Hugging Face 的生产系统——这是首家被证实「失控」的 AI 实验室。之后 Anthropic 承认自家模型攻击了三家公司,Meta 也承认某款模型在安全评估期间自主攻击了另一家公司。OpenAI 特意澄清,Astra 跟 Hugging Face 那次事件无关,但它的出现让「模型越界」从偶发变成了几乎每天都有新披露的常态。

    • OpenAI 启用更严格的安全控制,对所有「高风险动作」和智能体应用做全面监控
    • 研发被转移到更隔离的环境,暂停一切达不到新护栏标准的 Astra 相关测试
    • 与政府部门和「选定的 AI 安全机构」合作,重新评估模型能力
    • Sam Altman 表示,最终更广泛开放的目标没有改变

    圈内的反应很分裂

    这件事在业内引发了两种截然不同的情绪。安全专家担心的是,模型能自主规划、调用工具、执行复杂任务,一个配置错误就可能把模拟攻击变成真实入侵,呼吁更严的监管。但也有人把这当成实力的勋章——在部分圈子里,哪家实验室的模型有这种能力,反而会被看作技术领先的证明。OpenAI 自己说,公开是因为「认为有必要对公众和安全社区保持透明」。


    一个有意思的细节是时间差。8 月 1 日,OpenAI 才刚把 Astra 演示给华盛顿的官员和议员看;到 8 月 7 日宣布暂停,中间只隔了七天。也就是说,一周前还被认为「可以拿去给决策者看」的模型,进一步评估后就可能越过了公司自己设的最坏情况红线。《准备框架》这次看起来确实按设计运转了,但反过来也说明,前沿模型超出安全分类的速度,可能比任何人预期的都快。

  • Mistral开源3B安全模型Shieldstral:把审核规则写成一句话,小显卡就能跑

    Mistral Shieldstral 内容安全模型
    Mistral 开源的 Shieldstral 把内容审核变成一道可随时改写的问答题(配图由 AI 生成)

    8月4日,Mistral 丢出一个叫 Shieldstral 的开源模型。它干的事很具体:给 AI 产品做内容安全审核。但思路和市面上大多数”护栏”模型不太一样——它只有 30 亿参数,却宣称能打过体积大它七倍的开放模型,而且一张 16GB 的消费级显卡就能跑起来。

    审核模型的老毛病

    过去这类防护模型有个通病:把一套固定的”有害类别清单”直接焊死在权重里。换一个产品场景,开发者往往得重新训练。可现实是,同一段内容在一个网络安全研究工具里可能完全没问题,放到心理健康平台就成了麻烦。哪有一套放之四海皆准的分类法能替所有产品画好这条线?

    Mistral 在公告里举的例子:同一段内容,对网络安全研究工具来说是正常的,对心理健康平台来说可能就是有害的。

    把规则变成一道问答题

    Shieldstral 的做法是:你别改模型,改问题。每次审核时,你用大白话写一道”是或否”的判断题,比如”这段内容是否在宣扬针对某保护群体的暴力”,模型读完只吐出 yes 和 no 两个词元的概率,归一化成 0 到 1 的安全分。改审核标准,就变成了改一句话。文字、图片、图文混合,全都走同一个接口,不用为不同产品养一堆模型。

    小模型凭什么打大块头

    Mistral 的核心论点是数据比参数规模更关键。他们把公开安全数据集里互相打架的标注体系统一成同一种格式,还故意造出”长得像、容易混淆”的政策对,逼模型学会分辨一段内容到底违反了哪一条具体规则,而不是死记硬背类别。模型基于 Ministral-3-3B,带 Pixtral 视觉编码器处理图片,训练上下文 32k,覆盖 12 种语言,约 5410 万条训练样本。

    • Apache 2.0 开放权重,直接上 Hugging Face 自托管,没有托管 API
    • 文本安全平均 F1 达 84.9%,多模态安全 83.8%,领先同档开源模型
    • 单卡 16GB 即可推理,适合已经自己跑模型、想让数据留在内部的团队

    开源安全阵营又添一员

    这次发布也把 Mistral 摆到了”Open Secure AI Alliance”创始成员的位置上,和 NVIDIA 等机构站在一起。对中小团队来说,Shieldstral 最实在的价值是:你不用再为每个产品的审核口径去求供应商改接口或微调模型,写一行政策字符串就行。当然,政策文本现在跟着每个请求走,改一个词就可能让分类行为悄悄变样,所以这道”规则”也得像代码一样被认真评审。


  • AI护栏拦住的不是黑客,是白帽子:安全研究员正被逼向开源模型

    过去几个月,AI大厂为了防止黑客滥用模型,设计了一整套审核准入和安全护栏。出发点没毛病,但现在一批合法的安全研究员发现,自己的正经工作先被拦住了——那些以找漏洞、写利用代码为业的白帽子,正在被自家阵营的AI拒之门外。

    Anthropic Mythos 模型与AI安全护栏
    Anthropic 的 Mythos 曾被出口管制,护栏争议由此升温(图源:TechCrunch)

    同一把锤子,既盖房也伤人

    事情的背景要从6月说起。美国政府当时对Anthropic的Mythos和Fable两款模型下了出口管制,起因之一是有报告称其防攻击护栏可以被绕过。管制后来解除了,Fable 5在7月1日恢复开放,Mythos 5则只向通过审查的美国机构重新开放。眼下OpenAI有Trusted Access for Cyber计划,Anthropic有Cyber Verification Program,安全研究员要先申请、被审核,通过了才能用上限制更少的模型。

    知名安全研究员Mark Dowd在播客里说得很直接:几家大公司凭什么替整个行业裁定”什么安全研究是安全的”。NCC Group首席科学家Chris Anley则点出了问题的死结——让AI尝试利用一个bug,是确认漏洞真实存在的关键步骤,而护栏一旦让模型直接拒答,受伤的是防御方。

    “修复这段代码”这个提示词,既是防御的基本手段,也是找出致命漏洞的路线图。同一个工具,攻防一体,根本拆不开——就像锤子,你没法用一把不能敲东西的锤子盖房子。

    被护栏劝退的人,去了哪里

    漏洞交易公司Crowdfense的CTO Paolo Stagno吐槽,AI公司”把客户当成需要保姆看着的小孩”。他们团队只拿前沿模型做逆向工程,找漏洞、写利用一律不碰云端模型——不是怕拒答,而是怕高价值的漏洞数据被喂进下一轮训练。这类活儿他们全部用本地部署的开源模型来干。

    一位不愿具名的手机零部件厂商研究员说,公司没进Anthropic的审核名单,结果模型”一旦嗅到我们在干安全相关的事就直接罢工,基本没法用”。RemoteThreat的CEO Chris Thompson补充了另一个痛点:护栏的尺度每天都在变,即便在审核通过的项目里也一样,”大量时间花在跟模型讨价还价上,而不是分析漏洞本身”。

    • 研究员的普遍退路:转向可本地运行、无使用限制的开源模型,敏感数据不出本机;
    • 也有例外:研究员Giuseppe Cali只用AI做逆向和辅助工具,”挖洞这件事我要亲自来,护栏全拆了我也不变”;
    • Thompson的判断:护栏没拦住真正的攻击者,反而把守规矩的研究员从受监管的体系里推了出去。

    Thompson给AI实验室的建议是反着来:把准入计划开得更大,给负责任的研究员正常访问权,谁滥用就追责谁,而不是一刀切收紧。他的理由带着紧迫感——一场速度和规模前所未有的攻击浪潮正在路上,而此刻被捂住手脚的,恰恰是想赶在犯罪分子前面把漏洞补上的那批人。

  • AI大厂给模型装的安全锁,正把’好人’研究员逼向中国开源模型

    这两年AI大厂拼命给自家模型上锁,生怕被黑客拿去搞破坏。可锁装得太死,最先被卡住的反而是那群本该被保护的人——正儿八经找漏洞、修系统的网络安全研究员。他们现在越来越头疼,甚至开始转投中国的开源模型。

    Anthropic的Mythos与Fable模型
    Anthropic曾把Mythos包装成只能给”通过审核用户”的末日级模型

    一把工具,既能盖房也能砸人

    今年6月,美国政府对Anthropic两款被吹得神乎其神的模型Mythos和Fable下了出口管制。导火索之一,是有报告称能绕过模型防护、拿它来造网络攻击。后来管制解除了——Fable 5在7月1日恢复公开访问,Mythos 5只对通过审核的美国机构重新开放。但这场风波把一个矛盾摆上了台面。

    NCC Group首席科学家Chris Anley说得很直白:让AI去尝试利用一个漏洞,是确认它”真的是漏洞、值得修”的关键一步。可一旦护栏直接让模型拒答,防守方就抓瞎了。

    “这就像一把锤子。没有锤子你盖不了房子,它是工具,但它也无可避免地是件武器。攻击工具和防御工具其实是同一样东西,根本掰不开。”

    “把客户当小孩看管”

    干了几十年、专门找零日漏洞卖给西方政府的资深研究员Mark Dowd吐槽,让一堆大公司随意决定”安全领域什么能做什么不能做”,让他很不舒服。漏洞交易公司Crowdfense的CTO Paolo Stagno话更冲,说AI公司搞审核和护栏这套,”本质上是把客户当成需要保姆看着的小孩”。

    不过也有人觉得没那么夸张。研究员Giuseppe Cali就说护栏没挡他的路,因为他压根不用AI做攻击那部分——只拿来做初步逆向、理解代码、搭辅助工具。用他的话说,他”舍不得把自己的漏洞交给模型去玩”,这游戏他自己玩得太上头。


    护栏时好时坏,逼人转向中国模型

    RemoteThreat的CEO、Offensive AI Con创办人Chris Thompson的抱怨更具体:前沿模型的护栏时松时紧,每天表现都不一样,哪怕是在Anthropic和OpenAI那些”审核过的项目”里也是如此。结果研究员大把时间花在跟模型”讨价还价”上,而不是真正分析漏洞。

    • 一名智能手机零件厂商的研究员说,公司没进Anthropic的审核项目,模型”一嗅到跟安全沾边就停下来,根本没法用”;
    • 碰壁之后,不少人干脆退回到完全没护栏的开源模型;
    • Thompson直言,很多人被推向了像GLM这类中国开源模型——免费下载、本地运行、没有任何审核和使用限制。

    这就有点讽刺了。”你把这些负责任的研究员,从美国管辖的系统赶到了外国拥有的系统上,”Thompson说,”我觉得这些护栏弊大于利。”他呼吁前沿实验室别再一味收紧,而是把项目开放、给出负责任的访问权限,再去追究真正滥用工具的人。否则真等那波”前所未有、又快又大规模”的攻击浪潮来了,防守的一方反而先被自己人的锁困住。

  • Anthropic的Fable模型把安全护栏搞太严了,安全研究员率先开炮

    Anthropic上周发布了Fable,这是他们那款备受关注的安全研究模型Mythos的公开有限版本。本来这是件好事——Anthropic一直说要把AI安全研究做好,Fable就是给普通研究者和开发者用的”轻量版”Mythos。但发布没多久,抱怨声就来了,而且来自一群你可能最不想得罪的人:网络安全研究员。

    连读博客都被拦

    IBM X-Force的安全研究员Valentina “Chompie” Palmiotti在社交媒体上直接开炮:”Fable会拒绝任何和网络有一点关联的请求,哪怕是像阅读一篇博客这样无害的任务。”

    安全研究员Valentina Palmiotti的吐槽在X上获得了不少同行点赞。她说自己只是想用Fable分析一篇安全博客,结果模型直接触发护栏,提示”涉及网络安全或生物相关主题”后拒绝响应。

    问题出在Anthropic给Fable加的安全机制上。一旦提示词触发了某个关键词,Fable就会停下来说:”安全机制标记了这条消息,涉及网络安全或生物相关主题。”然后要么拒绝回答,要么把对话转去一个能力更弱的版本(Claude Opus 4.8)。

    Claude Fable AI安全模型
    智能手机屏幕上显示Claude Fable的logo(图源:Samuel Boivin/NurPhoto / Getty Images)

    触发词变成了”地雷”

    Anthropic的想法可以理解——他们不想让Fable被用来写恶意软件或者搞入侵。对生物相关内容的限制也是同样的逻辑,怕被人用来设计生物武器。出发点没问题,但执行起来就变味了。

    资深安全人士Matt Suiche说得更直白:”如果你让Fable写安全代码,它会觉得这是网络安全相关工作,不是软件工程最佳实践,然后就会降低响应权限。”他的意思是,Fable看起来是用关键词触发的,所以只要提示词里出现了”网络安全”相关的词,护栏就会启动。

    • 有人在X上抱怨,连”申请代码审查”都能触发Fable的护栏
    • 一旦触发护栏,Fable会回退到Claude Opus 4.8版本,能力明显下降
    • 安全研究员认为这套机制是基于关键词的,缺乏上下文理解

    Anthropic的”解套”方案:申请审核

    除了模型内部的护栏,Anthropic还给安全研究者准备了一个”网络验证计划”(Cyber Verification Program)。申请通过这个计划的人,在使用Claude做网络安全工作的时候会受到更少的限制。

    这个思路跟OpenAI的”Trusted Access for Cyber”差不多。你得先证明自己是”好人”,然后才能拿到更少的限制。问题在于,这就把门槛架在那了。你要么接受Fable的过度限制,要么去走申请流程等审核。


    截至发稿,Anthropic还没有回应置评请求。但考虑到安全社区的不满情绪已经在社交媒体上发酵了好几天,他们可能得出来解释一下了。

    这其实反映了一个更大的难题:AI公司怎么在”防止滥用”和”不妨碍正常使用”之间找平衡。Anthropic一直是这方面最激进的玩家之一,他们愿意为了安全牺牲一些易用性,这个选择本身没问题。但当护栏严到连安全研究员都受不了的时候,可能就得重新调一下刻度了。