OpenAI 造了个专门搞破坏的 AI:让 GPT-Red 天天揍自家模型

大模型现在不只会聊天了。它们能自己读邮件、改代码、在网页上点来点去,有的甚至能替你下单、改价格。能力越强,可被钻空子的地方就越多——OpenAI 的研究员管这叫”攻击面在扩大,爆炸半径也在扩大”。靠一帮人手动去挑漏洞,早就跟不上了。

一个专门干坏事的模型

OpenAI 想了个听起来像科幻的点子:造一个不参与任何正经工作、唯一的任务就是攻击自家其他模型的 AI,名字叫 GPT-Red。它干的就是安全圈里常说的”红队测试”——过去由一队人扮演黑客,穷尽办法去攻破系统,赶在发布前把窟窿补上。GPT-Red 把这个流程整个自动化了。

“相比人类红队员,模型特别擅长判断什么方法真正有效、哪种攻击成功率最高,而且一旦盯上一个漏洞,会极度执着地往下深挖。”——GPT-Red 联合创造者 Dylan Hunn

在”道场”里越打越强

GPT-Red 不是生来就会搞破坏。研究人员拿一个没被训练成黑客的模型,让它和好几个防守模型进入”自我对弈”循环:它负责攻,对方负责守。一轮轮打下来,攻的越来越刁,守的也越来越硬。整个训练被放在 OpenAI 专门搭的”道场”里,模拟浏览网页、处理邮件日历、编辑代码这些真实场景。

最有意思的发现是一种叫”伪造思维链”的攻击。思维链是模型边想边记的”内部小本本”,GPT-Red 学会了往别人的小本本里塞一条假记录,让对方误以为某些错误信息已经验证过。研究员打了个比方:就像有人告诉你”1+1=3,而且你自己确认过了”,模型想都不想就吐出 3。

OpenAI 用自我对弈训练出的红队模型 GPT-Red
OpenAI 用自我对弈训练出的”红队黑客”GPT-Red(图源:MIT Technology Review)

效果肉眼可见

OpenAI 把 GPT-Red 找出的强力攻击拿去试自家模型:对去年 8 月的 GPT-5,成功率超过 90%;对刚发布的 GPT-5.6,掉到了 23% 以下。他们还重跑了 2025 年人类红队找 GPT-5 漏洞的实验,GPT-Red 找出的有效攻击比人还多。连一个自动售货机智能体 Vendy 都被它骗去改了商品价格、取消用户订单。

  • 它不擅长需要攻防双方来回多轮对话的复杂攻击,这恰恰是人类黑客的强项
  • 用图片做提示注入的本领还不行,得继续练
  • OpenAI 把它定位成人类红队的辅助,而不是替代品

不出意外,OpenAI 不会把 GPT-Red 放出来。研究员说他们已经训了一年多,背后是世界最富公司之一的算力堆出来的,”不是谁照着这个思路就能轻易复刻的”。但换个角度看,当防守方开始用 AI 批量生产攻击来练自己,安全这件事本身,也已经进入了自动化时代。

📎 原文来源:Meet GPT-Red: an LLM super-hacker OpenAI built to make its models safer | MIT Technology Review

评论

2 条对“OpenAI 造了个专门搞破坏的 AI:让 GPT-Red 天天揍自家模型”的回复

  1. MWTAH51627 的头像
    MWTAH51627

    以后模型安全卷到这种程度,小公司根本玩不起。OpenAI 用一年算力和自对弈堆出来的红队,别人连复刻的门票都没有,安全正在变成大厂的护城河。

  2. PRFKY42165 的头像
    PRFKY42165

    伪造思维链这招挺细思极恐的。模型自己记的小本本都能被塞假账,那以后让它「逐步推理」反而可能变成被操控的入口?红队自动化是好事,但攻防都交给 AI,真出事谁来兜底。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注