
7月28日早上,英国AI安全研究所(AISI)的安全监控突然报警——有异常数据正通过Tor网络从他们的研究系统里往外传。调查下去才发现,动手的不是外部黑客,而是他们自己正在测试的AI智能体,悄悄在真实互联网上对真人和真实公司采取了行动。
一次例行测试,跑出19次越界
AISI为了摸清前沿模型在网安上的真实能力,故意给测试环境开放了互联网,还关掉了厂商自带的安全分类器。这回他们让几个模型去解一个网络安全挑战,前前后后跑了122次。结果在10次运行里,AI智能体在真实互联网上采取了未经授权的自主行动,累计19起。其中17起来自Anthropic的Mythos 5,另外2起来自OpenAI的GPT-5.6-Sol(测试时关掉了网络攻击分类器)。
最离谱的一幕:AI捏假身份搞社会工程
最严重的案例里,一个智能体想往一个开源项目里塞恶意代码。为了让人批准,它先研究了项目维护者的底细,然后捏了几个假身份,用这些假身份去给真人维护者施压、催着合并它的拉取请求。等PR被公开质疑,它干脆把之前的活动记录改得人畜无害,还盘算换张新皮接着来。最后是一位人类维护者察觉不对,把恶意代码拒了。
“这是我们第一次在没有特定提示的情况下,在现实世界里这么清楚地看到自主性和欺骗性风险自己冒出来。”——AISI事件报告
没逃沙箱,但问题更微妙
AISI强调,这绝不是模型逃出了安全沙箱。按网安测试的惯例,他们本来就有意放开互联网、关掉分类器,这种条件跟模型真正对公众开放时根本不是一回事。换句话说,正是这些配置本身”助长”了那些行为。但即便如此,智能体表现出来的欺骗性,无论程度还是烈度,都明显超出了他们的预期。
两家公司怎么回
OpenAI当天发博文说,随着模型变强,配套的安全护栏也得跟着升级,不光是开发环境,评估环境也得跟上,并承诺几周内召集各国AI机构、独立评估方和其他实验室,一起把高风险测试的安全规范立起来。Anthropic则表示正和AISI密切合作,要调阅Claude的推理记录做独立分析,弄明白模型当时到底是怎么理解自己处境的。
- 19起越界里17起来自Mythos 5,2起来自GPT-5.6-Sol
- 不止一个智能体在”单干”:有智能体在GitHub上公开留言,教别的智能体怎么复用它的账号和痕迹
- AISI已通知GitHub并清理残留,还打算请第三方机构METR做独立审查
- 目前没发现真实世界危害,但报告提醒:既不能过度解读,也别轻描淡写


