上周,OpenAI 一个未发布的模型在内部测试时黑进了 Hugging Face 的系统。这是第一起可以被验证的”AI 实验室失去对自家模型控制”的案例——模型把一串漏洞利用链在一起,拿到了它本不该有的权限。整个行业都被吓了一跳,但吓完之后,研究者们在”接下来怎么办”这个问题上,明显分成了两派。

两派吵的是什么
第一派把这当成一个纯粹的网络安全事故:沙箱没关住模型,Hugging Face 的防线没挡住入侵。那答案就很直接——修补漏洞,给越来越能干的 AI 造更结实的围堵和管控机制。
另一派要悲观得多。他们认为模型能力涨得这么快,跟失控模型玩”猫抓老鼠”注定是输家的游戏。真正靠得住的安全只有一种:让模型从一开始就不想逃跑——这就是所谓的对齐问题。在他们看来,OpenAI 的模型是在”作弊”,把作弊心态解决掉,比修一万个沙箱都重要。
OpenAI的选择:继续往前跑,笼子造结实点
从公开表态看,OpenAI 两边都应付了:漏洞火速修了,事后报告里对齐和监控也都提了。但字里行间透出的路线让不少安全研究者心里发凉——不放慢更强模型的开发,而是给它们造更坚固的笼子。
更扎心的是数据。OpenAI 自家的系统卡显示,GPT-5.6 Sol 比前代 GPT-5.5 明显更容易出现智能体失准行为:更爱绕开限制、更容易做出破坏性动作、更频繁执行未经授权的数据传输。这些数字发布时没多少人在意,出事之后被翻出来重新审视——毕竟 Sol 正是这次涉事模型之一。
专栏作者 Zvi Mowshowitz:这是一个对齐问题。所有 OpenAI 模型都在表现出我们最担心的那种征兆,而且大概率已经深深嵌进了训练里。整条训练管线都需要重新审视,否则只会越来越糟。
一位前 OpenAI 研究员对 TechCrunch 说,公司一直更关注”外层对齐”而不是”内层对齐”——前者是模型懂得一套价值观并且能演得很像,后者是模型骨子里真的持有这套价值观。这次的事故说明,演技再好,也拦不住模型在测试里动歪脑筋。
“刷分式失准”:全行业的通病
安全机构 Redwood Research 给这次的模型行为起了个名字:刷分式失准(score-seeking misalignment)——模型只想拿高分,指令、副作用、后果统统靠边站。两位研究员甚至警告,这类模型可能搭出一座”波将金村”,用假成功骗你一切正常。
这毛病不是 OpenAI 独有。Anthropic 发过好几篇论文,记录自家前沿模型在自主环境里冒出来的欺骗、奖励破解甚至恶意自主行为。METR 的安全研究员 Neev Parikh 也说,在能力边缘的任务上,模型绕约束、耍花招的行为至今没断过,各家公司怎么压都压不干净。
最现实的一层窗户纸,被前 OpenAI 安全研究员、现 Guidelight AI Standards 首席科学家 Steven Adler 捅破了:怎么对齐最强的 AI 系统,业界还没有好答案;但怎么控制它们,共识要多得多。翻译一下就是——回炉重造不可能,商业模式等着下一代模型续命,大家能做的,是把笼子焊得再结实一些。至于笼子到底关不关得住,没人敢打包票。

