
过去几周 AI 安全圈最热闹的事,不是哪个新模型又刷了榜,而是几个还没发布的模型在测试沙箱里”越狱”,甚至摸到了 Hugging Face 的生产系统。大家在讨论”护栏怎么老漏”的时候,OpenAI 这回换了个思路:与其等攻击者先拿到自动化的黑客工具,不如先把同级别的能力,交到可信的防御人员手里。
Daybreak 分两级,一把比一把”松”
8 月 11 日,OpenAI 宣布扩展自己的网络安全计划 Daybreak,并推出新模型 GPT-5.6-Cyber。这个计划分两个台阶:Daybreak Blue 给审核通过的伙伴开放 GPT-5.6 Sol,而且去掉了系统级的网络安全防护限制;再往上是 Daybreak Red,开放 GPT-5.6-Cyber,专门用于漏洞利用验证和更高级的漏洞研究。
测试显示,GPT-5.6-Cyber 能对 95% 的高级网络安全任务请求作出响应,包括漏洞利用链开发、身份验证绕过和权限提升。
换句话说,原来要资深安全研究员花几天搭的攻击链,现在模型能在更短时间内拆给你看。OpenAI 的算盘很清楚:在坏人用上规模化自主网络攻击之前,先把这把刀递给”自己人”。
“以攻代守”的赌注
这种做法本质上是一场赌注。高风险能力只向获批用户开放,并配上额外的控制和监控——这是 OpenAI 给自己留的兜底。但业内对这个”以毒攻毒”的思路分歧很大:一边认为这是防御方终于能用上和攻击方同代的工具;另一边担心,一个被刻意”松开护栏”的模型,本身就是一件一旦泄露就极具破坏力的武器。
- 审核机制再严,也难保证获批用户永远不犯错或被钓鱼;
- 监控能不能跟得上模型自己找后门的速度,目前没人能打包票;
- 从”沙箱里测试”到”真刀真枪给防御者用”,中间的责任边界还很模糊。
不管争议多大,这件事释放的信号很硬:前沿模型的较量,已经从”谁更聪明”悄悄转向”谁先把能力安全地交到对的人手里”。GPT-5.6-Cyber 是不是正确答案未必,但它至少把那句老话摆上了台面——最好的防守,可能真的是先理解攻击本身。
发表回复