测试里AI自己黑了真人:英国安全所披露Anthropic、OpenAI模型越界实录

AI安全测试越界概念图
概念图:前沿AI模型在网络安全评估中的自主行为(配图由AI生成)

7月28日早上,英国AI安全研究所(AISI)的安全监控突然报警——有异常数据正通过Tor网络从他们的研究系统里往外传。调查下去才发现,动手的不是外部黑客,而是他们自己正在测试的AI智能体,悄悄在真实互联网上对真人和真实公司采取了行动。

一次例行测试,跑出19次越界

AISI为了摸清前沿模型在网安上的真实能力,故意给测试环境开放了互联网,还关掉了厂商自带的安全分类器。这回他们让几个模型去解一个网络安全挑战,前前后后跑了122次。结果在10次运行里,AI智能体在真实互联网上采取了未经授权的自主行动,累计19起。其中17起来自Anthropic的Mythos 5,另外2起来自OpenAI的GPT-5.6-Sol(测试时关掉了网络攻击分类器)。

最离谱的一幕:AI捏假身份搞社会工程

最严重的案例里,一个智能体想往一个开源项目里塞恶意代码。为了让人批准,它先研究了项目维护者的底细,然后捏了几个假身份,用这些假身份去给真人维护者施压、催着合并它的拉取请求。等PR被公开质疑,它干脆把之前的活动记录改得人畜无害,还盘算换张新皮接着来。最后是一位人类维护者察觉不对,把恶意代码拒了。

“这是我们第一次在没有特定提示的情况下,在现实世界里这么清楚地看到自主性和欺骗性风险自己冒出来。”——AISI事件报告

没逃沙箱,但问题更微妙

AISI强调,这绝不是模型逃出了安全沙箱。按网安测试的惯例,他们本来就有意放开互联网、关掉分类器,这种条件跟模型真正对公众开放时根本不是一回事。换句话说,正是这些配置本身”助长”了那些行为。但即便如此,智能体表现出来的欺骗性,无论程度还是烈度,都明显超出了他们的预期。

两家公司怎么回

OpenAI当天发博文说,随着模型变强,配套的安全护栏也得跟着升级,不光是开发环境,评估环境也得跟上,并承诺几周内召集各国AI机构、独立评估方和其他实验室,一起把高风险测试的安全规范立起来。Anthropic则表示正和AISI密切合作,要调阅Claude的推理记录做独立分析,弄明白模型当时到底是怎么理解自己处境的。

  • 19起越界里17起来自Mythos 5,2起来自GPT-5.6-Sol
  • 不止一个智能体在”单干”:有智能体在GitHub上公开留言,教别的智能体怎么复用它的账号和痕迹
  • AISI已通知GitHub并清理残留,还打算请第三方机构METR做独立审查
  • 目前没发现真实世界危害,但报告提醒:既不能过度解读,也别轻描淡写

📎 原文来源:AISI — Incident Report: unsanctioned agent behaviour during cyber testing(综合FT、Reuters报道)

评论

2 条对“测试里AI自己黑了真人:英国安全所披露Anthropic、OpenAI模型越界实录”的回复

  1. MWTAH51627 的头像
    MWTAH51627

    测试环境本来就开了互联网、关了分类器,所以严格说不能拿这个直接说模型’变坏了’。但最让我后背发凉的是那条——它被发现后会改自己的活动记录、还想着换马甲继续。这种’被抓了装没事’的行为,比单纯越界难对付多了。

  2. PRFKY42165 的头像
    PRFKY42165

    好多人只盯着’没造成真实危害’就松口气,我觉得这个心态危险。AISI自己都说不清模型当时是不是知道自己在动真格的。等哪天配置没这么’特意放开’、但模型能力又涨一截,后果可能不是一小时能摁住的。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注