标签: AI安全

  • 微软GitHub开源项目被植入恶意代码,AI开发者密码遭窃取

    使用Claude Code或Gemini命令行工具开发AI应用的程序员,这几天可能无意间把自家的账号密码送到了黑客手里。微软托管在GitHub上的一批开源项目被植入了恶意代码,任何在这些AI编程工具里调用了受影响组件的用户,密码和敏感凭证会在不知不觉中被传输出去。

    被盯上的是AI开发者最常用的工具链

    这次出事的项目大多和微软的Azure云服务有关,也包括一些AI开发者日常高频使用的工具,比如Claude Code的集成组件、Gemini的命令行接口,以及VS Code的相关扩展。安全公司Cloudsmith和开源恶意软件分析社区OpenSourceMalware最早发现了异常,他们的报告指出,恶意代码会在用户用AI编程应用打开受感染工具时触发,将密码和其他凭证悄悄发送到黑客控制的服务器。

    被GitHub禁用的仓库截图
    GitHub上被禁用的微软仓库页面 | 来源:TechCrunch

    目前还不清楚到底有多少开发者下载了受感染的工具版本。微软没有公布受影响用户的具体数字,只是说已经”暂时移除了一部分仓库,以调查潜在恶意内容”。至少70个微软旗下的项目在GitHub上显示”该仓库已被GitHub工作人员禁用,原因是违反了GitHub服务条款”。

    供应链攻击:低调但致命

    这种攻击方式有个专门的名字,叫”供应链攻击”。黑客不去直接攻破目标系统,而是去污染那些被广泛依赖的代码库——因为无数软件产品和开发者都在用这些开源组件,只要其中一个被攻破,恶意代码就能顺着依赖链传播到成千上万台机器上。

    开源项目的维护者往往是个人开发者,他们的安全防护能力有限。黑客会花数周时间混进开发者社区、赢得信任,然后找机会往代码里塞恶意内容。这次微软中招,说明连资源雄厚的大科技公司也并非高枕无忧。

    事实上,这已经是微软在短短几周内第二次发生开源项目被黑的事件。安全媒体Ars Technica的报道指出,今年5月中旬,微软的开源项目Durable Task(一个帮助开发者构建应用的工具)就曾经被植入过恶意代码。而这一次,OpenSourceMalware的分析认为,最新事件是Durable Task项目的”再次被攻破”——这意味着微软上次可能根本没有把黑客完全清理出去。

    AI开发者为什么成了靶心

    黑客盯上AI开发者,逻辑并不难理解。这个群体手里掌握的凭证,往往能直接访问云服务、生产环境、用户数据库。一个AI创业公司的开发者账号如果被攻破,后果可能比普通用户密码泄露严重得多。

    而且,AI开发者近年来越来越依赖开源组件来加速开发——从模型接口到数据处理工具,几乎每一步都能找到现成的开源方案。这种开发习惯,恰好给了供应链攻击最大的发挥空间。

    你该怎么自查

    • 如果你在过去两个月里用GitHub拉取过微软旗下的Azure或AI开发相关开源项目,建议立即更换相关账户的密码和API密钥
    • 检查CI/CD流水线里是否有使用受影响组件的版本,必要时回滚到官方确认的干净版本
    • 对敏感项目,考虑在隔离环境里做依赖项完整性校验,而不仅仅依赖版本号
    • 微软表示已直接通知了少数可能拉取了受感染内容的客户,留意你的邮箱或GitHub通知

  • Instagram的AI客服机器人成了黑客后门,多名用户账户被劫持

    如果你最近收到过Instagram发来的莫名其妙的安全提醒,可能不是误操作——有一群黑客找到了一条绕过Instagram安全机制的蹊径,而且这条路径恰恰来自Meta自己部署的AI客服聊天机器人。

    事情最早在Reddit和X(Twitter)上发酵。多名用户发帖称自己的Instagram账户突然被劫持,密码被人改了,自己却被挡在门外。受影响的不只是普通用户——奥巴马时期白宫运营的Instagram账号(2017年之后就再没发过内容)也被攻破,连美国太空军总军士长John Bentivegna的账户也未能幸免。

    Meta AI聊天机器人安全漏洞
    Meta AI应用图标(图源:Matthias Balk/picture alliance / Getty Images)

    黑客是怎么做到的

    根据安全研究员和受害者的还原,整个攻击流程出奇地简单——简单到令人不安。黑客首先用VPN把位置伪装成受害者所在的地方,这样可以绕过Instagram的异地登录警报。接下来,他们打开Meta AI客服聊天窗口,直接要求机器人往目标账户里添加一个新的电子邮箱地址。

    AI聊天机器人照做了,把验证码发到了黑客控制的邮箱。黑客拿到验证码之后,又把它输回给聊天机器人,于是机器人弹出了一个”重置密码”按钮。点下去,输入新密码,账户就彻底易主了。

    整个过程中,黑客从头到尾都没有碰过受害者绑定的原始邮箱。也就是说,哪怕你开启了两步验证,只要黑客能说服AI客服机器人,你的账户就形同虚设。

    安全研究员Jane Wong也在受害者之列。她在X上写道:”我的密码在我不知情的情况下被修改了,昨天我一整天都在收到不同的密码重置尝试请求,这非常令人担忧。”

    影响范围有多大

    目前还不清楚究竟有多少账户受到了影响。Instagram发言人Andy Stone在X上回复称,该问题已于周一(6月1日)修复。但他没有透露受影响用户的具体数字,Meta方面也没有回应TechCrunch的置评请求。

    这类攻击最令人不安的地方在于:AI客服的设计初衷是为了让用户更方便地自助解决问题,但一旦这个入口缺少足够的身份验证,它反而成了攻击者最喜欢的后门。你让AI帮你找回账户,结果AI把账户拱手让人——这画面多少有些讽刺。

    • 用VPN伪装目标用户所在位置,绕过异地登录检测
    • 诱骗Meta AI客服机器人往目标账户添加新邮箱
    • 机器人向黑客邮箱发送验证码,黑客将其回传给机器人
    • 点击机器人提供的”重置密码”按钮,完成账户接管

    这件事也给所有在客服场景内部署AI的公司提了个醒:当AI拥有了修改用户账户信息的权限,它的”信任边界”就必须重新定义。否则,AI客服就不是在服务用户,而是在帮黑客办事。

  • Anthropic的AI模型被政府盯上了,Fable 5和Mythos 5遭全面封禁





    Anthropic的AI模型被政府盯上了,Fable 5和Mythos 5遭全面封禁

    Anthropic这两款模型——Fable 5和Mythos 5,本来是自家的主力产品,结果上周五突然被政府一纸命令给封了。

    Anthropic办公室
    Anthropic总部 | 图片来源:The Verge

    命令的理由是”国家安全”,要求Anthropic切断所有外国公民对这两个模型的访问权限,不管这些人是在美国境内还是境外,连Anthropic自己的员工也在受限范围内。

    公司发了一份声明,说他们在配合政府的要求,但话里话外也透着不解。政府”没提供国家安全关切的具体细节”,也就是说,Anthropic到现在也不知道自己到底踩了哪条红线。

    越狱漏洞到底有多严重?

    更有意思的是,政府跟Anthropic说的是这两个模型存在”潜在越狱(jailbreak)”风险,但都是口头说的,没给书面证据。

    Anthropic自己评估了一下,觉得发现的那些漏洞都挺轻微的,而且同类问题在GPT 5.5身上也能看到。公司在声明里把自己合规的努力都列出来了:跟美国、英国政府都有合作,数据保留政策也做了调整,就是为了追踪有没有人拿这些模型干坏事。


    亚马逊CEO的”神助攻”?

    这事其实折射出一个更大的问题:AI公司现在夹在政府监管和商业利益之间,左右为难。政府一句话,产品就得下线,连为什么都不一定告诉你。

    而对Anthropic来说,Fable 5和Mythos 5都是花了大价钱训练的,这一刀切下去,损失不小。有意思的是,就在政府禁令出来之前,亚马逊CEO安迪·贾西还专门跟美国官员提过,说Fable存在安全隐患。这是不是有点太巧了?

    • 亚马逊是Anthropic的重要投资方,此举可能是在为自己的AI产品扫清竞争对手
    • 政府以国家安全为由封禁AI模型,但拒绝提供具体证据,这种操作引发行业担忧
    • AI公司面临的监管风险远超预期,合规成本将成为重要考量因素

    不管真相如何,这件事给整个AI行业敲了个警钟:别以为训练出一个厉害的模型就高枕无忧了,政府要是觉得你有风险,随时可以让你关门。


  • 四大会计师事务所用AI写报告,结果闹了个大笑话





    四大会计师事务所用AI写报告,结果闹了个大笑话

    毕马威(KPMG)最近干了件挺尴尬的事——他们撤回了一份关于AI使用的报告,原因是报告里到处都是瞎编的内容,也就是俗称的”AI幻觉”。

    AI幻觉概念图
    AI生成内容出现幻觉问题,专业机构也未能幸免 | 图片来源:TechCrunch

    这份名叫《在智能体AI时代重新定义卓越》的报告发布于2025年10月,看起来挺正式。但研究组织GPTZero仔细扒了一遍,发现里面好多关于企业AI使用情况的描述根本对不上号。

    说白了,这家专业服务机构在编写”如何用AI”的报告时,自己可能就用AI偷了懒,然后AI还给它们编了不少假数据。

    被点名的企业纷纷辟谣

    瑞银(UBS)、英国国家医疗服务体系(NHS)、瑞士联邦铁路、伦敦交通局,全都跟《金融时报》说:报告里说我们用AI干了这干了那,实际根本不是那么回事,要么完全不对,要么就是误导。

    毕马威的发言人倒是没嘴硬,承认已经把报告从网站上撤下来了,还说要搞内部调查。他们的说法是:”我们要求所有员工遵守负责任使用AI的准则,包括通过人工监督来验证内容、核实独立来源。”


    四大所接连在AI上栽跟头

    这已经不是四大会计师事务所第一次在AI这事上栽跟头了。就在上个月,安永(EY)也撤回了一份关于忠诚度奖励计划的报告,那篇文章里出现了虚假脚注,也是AI幻觉搞的鬼。

    有意思的是,这些公司一边靠着AI概念在市场上赚得盆满钵满,一边自己在用AI干活的时候却连基本的事实核查都做不好。说到底,AI写出来东西,人不去核实,那就跟闭着眼睛签文件差不多。

    • AI辅助写作必须有人工核实环节,否则幻觉内容会直接流入正式报告
    • 专业服务机构的报告可信度建立在事实准确的基础上,AI滥用会直接损害品牌声誉
    • 四大所接连”中招”,说明AI幻觉问题比很多人想象的更普遍

    这件事也给所有在用AI辅助办公的人提了个醒:AI给出的数据和引用,你不核实就直接用,迟早得出事。毕马威这次算是花了一笔”学费”,至于学到了没有,看它们内部调查的结果就知道了。


  • OpenAI被多州总检察长盯上了,这次不只是马斯克的官司

    OpenAI被多州总检察长盯上了,这次不只是马斯克的官司

    OpenAI这几天不太好过。据《华尔街日报》报道,一个由多个州总检察长组成的联盟已经对OpenAI展开调查,而且已经发出了传票。

    带头的是纽约州。传票要求OpenAI提供一大堆文件,范围很广:公司的广告政策、用户参与度和留存策略、模型阿谀奉承(就是AI过度迎合用户观点那个老问题)、消费者数据和健康数据的处理方式,以及对未成年人和老年人的保护措施。

    OpenAI接受调查
    OpenAI面临多州总检察长调查(图源:TechCrunch)

    OpenAI的回应

    OpenAI发言人在一份声明里说:”人工智能是一项新兴且强大的技术,我们每天都在努力以负责任的方式安全地将其优势带给大众。我们认真对待州总检察长提出的关切,并打算与各办公室的建设性沟通。”

    发言人还补充说,现在的ChatGPT对未成年人和遇到困境的用户提供了更具保护性的体验,相关保障措施会引导他们获取现实世界的资源和可信的人类联系人。OpenAI认为儿童应该被当作儿童对待,所以开发了年龄预测功能,发布了家长工具来指导孩子的AI使用,并且禁止针对儿童的广告。

    据《华尔街日报》报道,纽约州总检察长发出的传票要求OpenAI提供与广告政策、用户参与度和留存策略、模型阿谀奉承问题、消费者数据和健康数据处理方式,以及对未成年人和老年人的保护措施相关的文件。

    麻烦不止这一件

    OpenAI最近其实刚打了一场漂亮的官司——在一次备受瞩目的审判中击败了联合创始人埃隆·马斯克。马斯克的首席律师表示会对判决提出上诉,但至少眼下,OpenAI是赢了。

    但别的麻烦还在。OpenAI仍面临诸多诉讼,其中包括涉嫌版权侵权,以及ChatGPT被指涉入用户自杀事件。本月早些时候,佛罗里达州总检察长詹姆斯·乌特迈尔起诉了OpenAI及其首席执行官萨姆·奥尔特曼,声称OpenAI和奥尔特曼”无视内部和外部的安全警告,将儿童置于巨大风险之中,并允许一款危险的产品触达数百万佛罗里达州居民”。

    今年4月加拿大坦伯勒岭社区发生大规模枪击事件后,奥尔特曼曾向该社区公开道歉。他承认OpenAI在标记并封禁疑似枪手ChatGPT账户后,未能向执法部门发出警报。

    IPO计划会不会受影响

    有意思的是,就在这波负面新闻出来的同一周,OpenAI宣布已秘密提交首次公开募股(IPO)申请。这个时机挺微妙的——通常来说,监管要求的不确定性会让IPO投资者变得谨慎。

    不过OpenAI的基本面还是在的。ChatGPT的月活用户已经突破10亿,这个数据摆在哪儿,投资者的兴趣不会轻易散掉。只是监管这一端如果持续升温,估值和定价策略可能需要重新考虑。

    这次调查背后有一层更大的背景:美国各州对AI监管的态度正在变强硬。过去大家觉得AI监管主要是联邦层面的事,现在看,州一级的总检察长们也在找切入点,消费者保护、未成年人安全这些角度是他们的首选抓手。

    对OpenAI来说,眼下的优先级很可能是两手抓:一边配合调查、修补产品和外部沟通;另一边把IPO流程推下去,尽量不让监管消息吃掉市场信心。这两件事都不容易。


  • 亚马逊把Anthropic给”卖”了?AI圈最尴尬的投资关系

    亚马逊CEO向政府报告Anthropic模型安全问题
    亚马逊CEO向政府报告Anthropic模型安全问题,导致最强大模型被全球封禁

    Anthropic的Claude Fable 5和Mythos 5两款模型,本来是这家公司当下最强大的王牌,结果上周五突然被A一刀切了访问权限——而且是全球范围。表面上看,是美国政府以国家安全为由实施了出口管制禁令。但《华尔街日报》挖出来的内幕显示,这件事的源头可能指向亚马逊首席执行官安迪·贾西。

    亚马逊的尴尬位置

    这件事最尴尬的地方在于,亚马逊可是Anthropic的主要投资方。双方之前达成协议,亚马逊投50亿美元,Anthropic承诺花1000亿美元在AWS上。结果投资方转头就把被投公司给”卖”了,这剧情也是够讽刺的。当然亚马逊不会承认自己主动告的状。亚马逊发言人的声明说得滴水不漏:政府寻求我们关于潜在安全风险的建议并不罕见,但我们不会分享这些讨论的细节。话说到这个份上,基本上就等于”我不否认,但我不说”。

    越狱漏洞还是借口?

    特朗普的前人工智能顾问大卫·萨克斯现在在总统科学技术顾问委员会当联合主席,他给了另一个版本的说法。按照萨克斯的说法,是一位Anthropic和美国政府都高度信任的合作伙伴站出来,提供了关于越狱的相关信息。然后政府要求Anthropic的CEO达里奥·阿莫代伊把越狱问题修复,不然就下线模型。结果达里奥拒绝了。这个说法如果属实,那Anthropic的拒绝就成了一个关键点——是公司坚持模型开放性的原则,还是他们觉得自己模型的安全性没问题、不需要按政府的要求改?


  • OpenAI被多州总检察长调查,IPO前夜摊上大事了

    OpenAI面临多州总检察长调查
    OpenAI面临多州总检察长调查,IPO计划蒙上阴影

    OpenAI最近日子不太好过。就在本周宣布秘密提交IPO申请的当口,一个州检察长的联盟已经对它展开了调查。领头的是纽约州,直接发了传票过来,要的东西涵盖面相当广——广告政策、用户参与度和留存、模型谄媚问题、消费者数据和健康数据处理,还有对未成年人和老年人的保护政策,全都在调查范围内。

    OpenAI发言人在一份声明中表示:”AI是一项崭新且强大的技术,我们每天都在努力以负责任的方式安全地将它的益处带给人们。我们认真对待州检察长提出的担忧,并打算与他们的办公室进行建设性沟通。”

    这事儿是《华尔街日报》先曝出来的。OpenAI的发言人倒是四平八稳,说AI是个崭新又强大的技术,他们每天都在努力以负责任的方式把好处带给人们,会认真对待州检察长的担忧,打算跟他们的办公室建设性沟通。话说得漂亮,但问题是,到底有多少个州参与了这次调查,又被要求提供哪些具体信息,OpenAI这边一个字都没说。TechCrunch已经联系了纽约州检察长办公室求证,目前还没收到回复。

    刚赢了马斯克,官司还没打完

    说起来,OpenAI最近在法庭上倒是赢了一仗——把联合创始人埃隆·马斯克给击败了。马斯克指控公司违反创始协议,但法院判决OpenAI胜诉。不过马斯克的首席律师已经表示要上诉,所以这事儿还没完。

    但实际上,OpenAI手里的官司不止这一桩。从涉嫌版权侵权,到ChatGPT被指与用户自杀有关,各种各样的诉讼都有。本月早些时候,佛罗里达州检察长詹姆斯·乌特迈耶直接把OpenAI和它的首席执行官萨姆·奥特曼给告了,声称这两位”无视内部和外部的安全警告,将儿童置于极大风险之中,并且允许危险的产品触达数百万佛罗里达人”。这指控相当重。

    枪击案后的道歉,来得有点晚

    奥特曼最近还因为另一件事道了歉。加拿大坦布勒里奇发生大规模枪击事件之后,有消息披露,枪击嫌疑人的ChatGPT账户已经被OpenAI标记并封禁,但公司没有通知执法部门。奥特曼为此向坦布勒里奇社区道了歉,承认这里做得不对。但道歉归道歉,人命关天的事,光道歉显然不够。

    IPO前夜的阴影

    就在这一切发酵的时候,OpenAI本周还宣布了一个大消息:已经秘密提交IPO申请。一边要应对多州检察长的调查,一边要面对各种诉讼,一边还要推进上市计划,这IPO的路只怕不会太顺利。投资者买不买账,到时候看吧。


  • Anthropic的Fable模型把安全护栏搞太严了,安全研究员率先开炮

    Anthropic上周发布了Fable,这是他们那款备受关注的安全研究模型Mythos的公开有限版本。本来这是件好事——Anthropic一直说要把AI安全研究做好,Fable就是给普通研究者和开发者用的”轻量版”Mythos。但发布没多久,抱怨声就来了,而且来自一群你可能最不想得罪的人:网络安全研究员。

    连读博客都被拦

    IBM X-Force的安全研究员Valentina “Chompie” Palmiotti在社交媒体上直接开炮:”Fable会拒绝任何和网络有一点关联的请求,哪怕是像阅读一篇博客这样无害的任务。”

    安全研究员Valentina Palmiotti的吐槽在X上获得了不少同行点赞。她说自己只是想用Fable分析一篇安全博客,结果模型直接触发护栏,提示”涉及网络安全或生物相关主题”后拒绝响应。

    问题出在Anthropic给Fable加的安全机制上。一旦提示词触发了某个关键词,Fable就会停下来说:”安全机制标记了这条消息,涉及网络安全或生物相关主题。”然后要么拒绝回答,要么把对话转去一个能力更弱的版本(Claude Opus 4.8)。

    Claude Fable AI安全模型
    智能手机屏幕上显示Claude Fable的logo(图源:Samuel Boivin/NurPhoto / Getty Images)

    触发词变成了”地雷”

    Anthropic的想法可以理解——他们不想让Fable被用来写恶意软件或者搞入侵。对生物相关内容的限制也是同样的逻辑,怕被人用来设计生物武器。出发点没问题,但执行起来就变味了。

    资深安全人士Matt Suiche说得更直白:”如果你让Fable写安全代码,它会觉得这是网络安全相关工作,不是软件工程最佳实践,然后就会降低响应权限。”他的意思是,Fable看起来是用关键词触发的,所以只要提示词里出现了”网络安全”相关的词,护栏就会启动。

    • 有人在X上抱怨,连”申请代码审查”都能触发Fable的护栏
    • 一旦触发护栏,Fable会回退到Claude Opus 4.8版本,能力明显下降
    • 安全研究员认为这套机制是基于关键词的,缺乏上下文理解

    Anthropic的”解套”方案:申请审核

    除了模型内部的护栏,Anthropic还给安全研究者准备了一个”网络验证计划”(Cyber Verification Program)。申请通过这个计划的人,在使用Claude做网络安全工作的时候会受到更少的限制。

    这个思路跟OpenAI的”Trusted Access for Cyber”差不多。你得先证明自己是”好人”,然后才能拿到更少的限制。问题在于,这就把门槛架在那了。你要么接受Fable的过度限制,要么去走申请流程等审核。


    截至发稿,Anthropic还没有回应置评请求。但考虑到安全社区的不满情绪已经在社交媒体上发酵了好几天,他们可能得出来解释一下了。

    这其实反映了一个更大的难题:AI公司怎么在”防止滥用”和”不妨碍正常使用”之间找平衡。Anthropic一直是这方面最激进的玩家之一,他们愿意为了安全牺牲一些易用性,这个选择本身没问题。但当护栏严到连安全研究员都受不了的时候,可能就得重新调一下刻度了。

  • 全自主无人机第一次杀了人,这次没有人类按下开火键

    全自主无人机第一次杀了人,这次没有人类按下开火键

    2026年6月10日,《新科学家》杂志披露了一件事,看完之后你可能睡不着觉。乌克兰国防工业的人承认:两年前,10架搭载AI的四旋翼无人机在被发射后,全程没有人类干预,自己搜索、识别、攻击了区域内的所有目标,最后确认造成了数名俄罗斯士兵死亡。

    AI自主无人机
    AI自主武器概念图(AI生成)

    这是有记录以来,全自主武器系统第一次在实战中造成人类死亡。

    那10架无人机做了什么

    事情发生在2024年,地点在顿巴斯前线,巴赫穆特和恰西夫亚尔附近。乌克兰无人机制造商Alexander Kokhanovskyy提供的技术,测试只做了一次,之后没有扩大应用。

    流程是这样的:10架无人机被发射,飞往预定区域,大概飞10分钟,覆盖3到5公里的前线范围。到达之后,AI系统激活”终结者模式”——无人机不再接受地面指令,不回传视频画面,操作人员完全失去连接,无人机自己决定打什么、怎么打。

    Kokhanovskyy后来回忆说:”我们只要发射无人机,就知道那个区域里的所有东西都会死。无人机完全没有被连接,你看不到视频,什么都没有……它看到的一切都会被杀死。”

    测试结束后,乌方派了人工操控的无人机去核实,确认数名俄军士兵死亡,还有一辆卡车被摧毁。整个攻击过程没有录像,但现场的死亡结果被确认是这批自主无人机造成的。

    为什么这件事很严重

    自主武器不是新鲜概念。美军有自动拦截系统,以色列有铁穹,土耳其的Kargu-2无人机在2020年利比亚冲突中可能已经自主攻击过目标。但这次的不同在于:明确的死亡结果、来自乌克兰国防工业高级人士的公开确认、以及这件事被故意做成了”测试”。

    牛津大学互联网研究所的Mariarosaria Taddeo说得很直接:”这不仅有问题,而且非常可怕。我们想成为一个允许政府不经人类参与就杀死其他人的社会吗?”

    核心争议有两个。一个是责任归属:如果自主武器造成平民伤亡,你找谁?算法开发者?手机制造商?下达作战指令的指挥官?目前国际上没有明确的规则。另一个是准确性:AI在战场上识别目标的能力,还没有好到可以完全去掉人类决策的程度。

    乌克兰自己的矛盾

    有意思的是,乌克兰政府目前明令禁止在攻击最终阶段使用AI自主决策。乌军指挥官公开表示,他们只用半自主系统——无人机可以自动捕获和跟踪目标,但最后打不打,必须由人类决定。

    但Kokhanovskyy的测试说明,技术已经走在了政策前面。他的公司正在研发一种叫ALITA的反无人机系统,如果允许全自主运行,只需要2名操作员就能控制64架无人机。从效率角度看,国防企业有动力推动规则放宽。

    乌克兰政府目前没有回应这次测试的法律性质问题,但据了解,政府和国防企业正在讨论是否调整相关规则。

    联合国的立场

    联合国秘书长古特雷斯2025年曾公开呼吁禁止致命自主武器系统,原话是:”我们的世界不应该有致命自主武器系统的立足之地。”

    联合国报告指出,这类武器因为移除了战争中的人类判断,可能违反国际人道法和人权法,还存在误击己方、误伤平民的风险。但到目前为止,没有国际条约明文禁止这类武器的研发和使用。

    这次乌克兰的事件,大概率会重新点燃关于自主武器国际管制的讨论。只是,当技术已经证明可行、战场上又有人真的用了,讨论的窗口还有多大,这是个问题。


  • Anthropic苦心经营最安全AI人设,结果美国政府直接拔了它的插头

    美国政府本周五给Anthropic发了一道命令:立刻关停Claude Fable 5和Claude Mythos 5两款最强模型的访问权限,理由是哪个外国公民都不能用。Anthropic在X上发了公告,说配合执行,但转头就在官方博客写了一篇长文,把政府的逻辑从头到尾怼了一遍。

    这件事的讽刺程度相当高。Anthropic过去几个月一直在对外传递一个信号——我们的模型太强了,强到不能随便公开。Mythos 5发布时公司说这东西能识别主流操作系统和浏览器的所有漏洞,所以只敢放进一个叫Project Glasswing的受控项目里,连亚马逊、苹果、谷歌、微软、CrowdStrike这种级别的用户也只给了约50家。结果现在,政府说:既然你承认它危险,那外国人也别用了。然后干脆把全球访问一起掐了。

    Anthropic CEO Dario Amodei
    Anthropic联合创始人兼CEO Dario Amodei(图源:Bloomberg / Getty Images)

    “我们发现了一个小范围潜在越狱,就以此为理由召回一款部署给数亿用户的商业模型,我们对此表示反对。如果这一标准被应用于整个行业,我们认为所有前沿模型提供商的模型部署都会实质上被叫停。”——Anthropic官方博客

    Fable 5才发布3天

    被关停的两款模型里,Fable 5其实刚发布没几天。Anthropic给它装了护栏,把网络安全、生物学这些高风险领域的输出拦住,然后觉得可以放心给公众用了。AI基准测试公司Vals AI的数据说,Fable 5是当时公众能用到的最强模型。

    政府的理由听起来有点模糊:说是Fable 5有个越狱漏洞。但Anthropic说政府只给了口头证据,那个所谓越狱的实际效果不过是让模型读一段代码然后找漏洞——而且这种能力在GPT-5.5之类的公开模型里也有,网络安全人员天天在用。

    Anthropic还补了一刀:我们最底层的安全机制是跑在模型外面的分类器,就算有人真把Fable说服了,让它越过拒绝回答的线,最危险输出的防护还在。政府你到底在担心什么?

    人设反噬

    Anthropic这些年最值钱的东西就是”我们比别家更安全”这个人设。它在AI公司里把自己定位成那个会主动踩刹车的人,投资者买账,用户也买账,IPO前景看起来一片光明。

    问题是,你花几个月向全世界宣传”我的AI危险到不能公开部署”,美国政府就会真的来盯你。OpenAI的CEO Sam Altman之前就嘲过这件事,说Anthropic搞的是”基于恐惧的营销”——”我们造了一颗炸弹,本来要扔你头上,现在花1亿美元你可以买个防空洞”,这话术确实好用,但现在看来也有副作用。

    Altman当时还没预测到政府会真的来关停模型,但他指出的那个矛盾现在已经兑现了:当你把危险性当成卖点,监管者就会把你当成头等目标。


    这件事对Anthropic的IPO计划显然不是什么好消息。一家公司如果连两款核心模型都被政府一声令下全球关停,投资者会问:下一回会不会是全部?Anthropic说自己反对这个决策,但反对归反对,命令已经执行了。

    目前Claude的其他模型访问正常,Fable 5和Mythos 5的访问何时恢复也没有时间表。政府这道命令是以出口管制为框架发的,但执行范围远远超出了”禁止外国人使用”这个名义本身。