标签: AI IP争议

  • Suno源代码泄露:AI音乐训练数据来自YouTube和Deezer抓取

    AI音乐生成与版权概念图
    AI 音乐生成的繁荣背后,训练数据来源正成为最敏感的命门

    AI 音乐生成平台 Suno 最近被掀了底。据 404 Media 报道、并经多家媒体确认,Suno 此前遭到黑客入侵,泄露出来的源代码把它的训练数据来源摊在了阳光下——那些被唱片公司告了又告的”未经授权抓取”,在代码里写得明明白白。

    黑客用的化名是 ellie.191,早在 2025 年 11 月就通过一次供应链攻击拿到了 Suno 员工的凭证,进而翻出了内部代码。泄露文件里有一组数字格外刺眼:一个叫 youtube_music 的文件夹里塞着超过 200 万段视频片段;从歌词网站 Genius 抓了超过 1.7 万小时歌词;从音乐流媒体 Deezer 抓了超过 1.2 万小时歌曲;就连 Shutterstock 旗下的素材库 Pond5,也被搬走了超过 6.2 万小时音频。

    更讽刺的是,Suno 的爬虫还带了一套筛选机制,专门把非音乐文件过滤掉,好让训练数据”更干净”。一边讲究数据质量,一边用着没授权的歌。

    用户的隐私,也没被漏掉

    泄露的不止是训练数据。黑客还碰到了部分用户资料:邮箱、电话号码,以及通过支付服务商 Stripe 处理的信用卡元数据。Suno 后来回应称,这起事件”主要涉及已不再使用的过时代码”,没有完整卡号泄露,按现行隐私法不需要逐个通知用户——但它 2025 年 11 月出事时,确实没有主动告知用户。

    这下,版权方手里的牌更硬了

    环球、索尼、华纳这几家唱片巨头早就以 RIAA 名义把 Suno 告上了法庭,指控它未经授权用受版权保护的音乐训练模型。Suno 一直用”合理使用”当挡箭牌,说公开网络上能拿到的音乐文件就能拿来训练。今年 5 月,唱片公司把诉讼里认定的侵权歌曲从最初宣称的 560 首,扩到了 6.1 万多首,法院也批了。这次泄露的抓取代码,等于给版权方递上了新证据。

    站在创作者一边的人声音更响。SZA 就说过,她怀疑自己一些还没发布的歌也被拿去用了;作曲人 Kenneth Blume 直接抨击,这是赤裸裸侵犯创作者的权利。有意思的是,Anthropic 和 Meta 去年夏天在一批作者提起的类似诉讼里赢了——同样的”合理使用”辩护,结果并不完全一样。

    • 对 Suno:诉讼阴影没散,反被添了实锤,后续授权谈判和合作关系都会更被动。
    • 对整个 AI 音乐行业:训练数据来源不透明,迟早会被扒出来,监管已在呼吁明确规则。
    • 对普通用户:你喂给 AI 平台的资料,平台自己都未必守得住。

    Suno 自己其实还在扩张,前不久刚完成 4 亿美元 D 轮、估值冲到 54 亿美元。但这次泄露说明,靠”公开网络就能随便抓”撑起来的增长,迟早要面对账单。AI 音乐能不能走得远,先把”歌是从哪来的”说清楚,大概是最基本的一课。

    📎 原文来源:Source Code Hack Reveals Suno’s AI Was Trained on Millions of YouTube Songs(CNET,综合 404 Media / TechCrunch 报道,2026-07-16)
  • Anthropic指控阿里发动史上最大「模型蒸馏」攻击——2.5万个账号、2880万次交互背后的AI冷战

    2026年6月10日,Anthropic向美国参议院银行委员会递了一封信,把这几个月中美AI博弈的暗线,直接搬到了台面上。

    信里披露了一串让人咋舌的数字:从4月22日到6月5日,整整45天,跟阿里有关联的运营者动用了2.5万个账号,对Claude发起了2880万次交互。Anthropic把这定性为「迄今为止,中国公司试图搭美国顶尖实验室便车的最大规模尝试」。

    Anthropic指控阿里巴巴模型蒸馏攻击概念图
    Anthropic vs 阿里巴巴:AI模型蒸馏争议概念图 | 图源:AI生成

    四个月,四家中国AI公司被点名

    把时间线拉回去,Anthropic的这波反击其实早有铺垫。

    2026年2月23日,Anthropic发了一篇博客文章《检测和防止蒸馏攻击》,公开点名三家中国AI实验室:DeepSeek、月之暗面(Kimi)、MiniMax(稀宇科技)。那一轮的数据是:约2.4万个中国相关账号对Claude发起了超过1600万次交互。

    从1600万到2880万,规模翻了快一倍。Anthropic的应对策略,也从2月份的「技术曝光」,升级到了6月份的「政治施压」。

    这一次的收信人很有讲究:银行委员会主席Tim Scott和首席成员Elizabeth Warren,一个是负责对外经济制裁的,一个是负责对内金融监管的。用圈内人的话说,这俩都是「狠角色」。

    据彭博社报道,信件递交后,美国参议员Bill Hagerty和Andy Kim迅速跟进,计划推动一项修正案并纳入《国防法案》:对任何「不当获取美国AI模型输出以训练竞争系统」的中国公司,实施严厉制裁或直接列入黑名单。

    2880万次交互,到底能干什么

    放一个行业参照:目前主流的高质量SFT(监督微调)数据集,规模通常在数十万到几百万条之间。2880万次针对核心能力的定向交互,足以在特定任务域内,「提纯」出一个极具竞争力的专用模型。

    而且这套操作的省钱程度,说出来有点吓人。按Claude的公开API定价粗算,2880万次交互的费用,哪怕按企业折扣计,也要几百万美元。但与从零开始训练一个具备同等软件工程能力的大模型相比,这笔数字可能只是预算单上的零头。

    Anthropic在信中特意强调了一个让它真正担心的问题:安全对齐没有被蒸馏过去

    AI模型的核心能力分两种,训练方式截然不同。一种是「干活能力」——写代码、做数学题、写文案——只要给足标准答案,模型就能快速学会,这部分能力是可以被「蒸馏」的。另一种是「安全对齐」——知道不该泄露用户隐私、不该协助犯罪、不该输出危险内容——这些规则不是靠反复刷题学来的,而是通过极其精细的「行为矫正」训练建立起来的。

    但蒸馏的过程,只复制成功,不复制拒绝。那些被系统拦截、拒绝回答的高危问题,全被过滤掉了。结果就是,学生模型只学会了顶级的能力,却没学到「什么不该说」。


    Reddit上的群嘲:贼喊抓贼

    跟以往类似的技术争议不同,这一次在Reddit等开发者论坛上,技术圈的反应相当刻薄。

    最经典的指控是「贼喊抓贼」。有网友指出,Anthropic自己就是靠「偷数据」起家的。早期训练模型时,它因抄袭并非法下载数百万册受保护的书籍,曾陷入美国历史上规模最大的AI侵权盗版案,最终被迫吞下15亿美元的天价和解金。

    马斯克今年2月也公开骂过Anthropic,说它才是北美最大的「偷子」,伪善又虚伪。还有网友翻出了业内著名的回旋镖:此前Anthropic发布的Claude 4.8模型在回答中,透露自己其实是「由阿里巴巴开发的Qwen模型」。

    「业内互相洗数据、抄来抄去早已是常态,你身上流着通义千问的血,回过头来告阿里抄袭?」这条评论获得了大量的点赞。

    这场指控的真正野心

    如果只看商业层面,这不过是又一起AI公司的知识产权纠纷。但Anthropic的这封信,真正想拿到的,远不止一家公司的商业维权。

    它在美国政界与产业界想确立一条新的绝对红线:用API输出训练竞争模型,就是越界违法。而这背后,是整个硅谷正在结成的防御同盟——Anthropic、OpenAI和谷歌已经暗中联手,开始共享关于违规数据抓取的情报。

    美国官员曾估计,这种未经授权的「工业级」蒸馏活动,每年给硅谷实验室造成的损失高达数十亿美元。这笔钱直接威胁着Anthropic即将到来的天价IPO。

    但如果制裁清单落地,游戏规则就彻底变了。到那时,「谁的模型训练数据来自哪里」,将直接成为极其严苛的监管审查对象。对所有在LLM工程链条上工作的人来说,这才是最值得关注的后续。