
上周末,AI 圈里最常被开发者当成「家」的平台之一,被人钻了空子。Hugging Face 在周五承认,他们内部的一部分数据集和服务凭证在一次入侵里失了守。这家托管着海量开源模型和训练数据的平台,到现在还没完全确认有没有客户或合作方的数据被顺走。
一次从数据流水线发起的入侵
攻击的起点很不起眼,就藏在 Hugging Face 自己的数据处理管线里。一份被上传的恶意数据集,滥用了两个代码执行路径——一个能远程跑代码的加载器,一个藏在数据集配置里的模板注入——在处理节点上执行了恶意代码。接下来就是教科书式的横向移动:提权到节点级、收割云和集群的凭证、趁着周末悄悄摸进好几个内部集群。
整场行动不是人敲键盘敲出来的。Hugging Face 把锅甩给了一个「外部 AI 代理」:它在一大堆活不过几分钟的沙盒里跑了几千次独立操作,命令与控制节点还自己迁移到了公共服务上。公司说这正吻合业界预测已久的「代理型攻击者」场景,不过当 TechCrunch 追问证据时,对方没马上拿出来。
「这正吻合业界此前预测的『代理型攻击者』(agentic attacker)场景。自主、由 AI 驱动的攻击工具不再是理论。」
讽刺的一幕:防御者被自家模型拦下了
这次事件最耐人寻味的,是 Hugging Face 怎么把攻击查明白的。它自己的异常检测先发现了动静,然后调了一个 AI 模型去分析记录了整场攻击的服务器日志。有意思的是,它一开始用的是某家商业公司的「前沿模型」,结果分析请求被对方的安全护栏挡了回来——因为要提交大量真实的攻击命令和漏洞载荷,而托管模型的护栏分不清你是防御者还是攻击者。
最后 Hugging Face 改用自己部署在本地的大模型做取证。这反而带来一个额外好处:敏感的攻击日志和里面提到的凭证,都不用再传到别人的服务器上。换句话说,攻击者被护栏彻底放开手脚,而防御者却被托管模型的护栏卡住了脖子。
对用户意味着什么
- 公开、面向用户的模型、数据集和 Spaces 暂未发现被篡改,软件供应链也已验证干净,算不幸中的万幸。
- Hugging Face 已关闭入口漏洞、重建被感染的节点、轮换了受影响的密钥,并加严了集群准入控制。
- 平台建议所有用户立刻轮换存在这里的访问令牌,并盯着账户里有没有可疑活动。
发表回复