标签: AI内容版权

  • 索尼再告 Udio:3 万首歌揭开的 AI 音乐版权战

    索尼音乐娱乐这周一在纽约法院又递了一纸诉状,被告是 AI 音乐生成器 Udio。和两年前三大唱片公司联手起诉 Udio、Suno 那场官司不同,这一回索尼把火力对准了一个很具体的数字:超过 3 万首歌。

    AI 音乐版权争议概念图
    AI 音乐生成器的训练数据版权问题持续升温

    从猫王的《Hound Dog》到碧昂丝的《Say My Name》,再到哈里·斯泰尔斯的《As It Was》,索尼列出的清单里既有上个世纪的经典,也有近年的热单。索尼在诉状里直言,这 3 万多首「只是 Udio 侵权作品中的一小部分」。

    索尼称,这份 3 万多首的清单「只是 Udio 所侵权作品中的一小部分」,背后还有更多未被点名的歌曲。

    这些歌是怎么被发现的

    有意思的是,这 3 万首并不是索尼一开始就掌握的。2024 年那场诉讼里,索尼和环球、华纳一起把 Udio 与 Suno 告上法庭。借着证据开示(discovery)的程序,索尼拿到了 Udio 的训练数据,再用一套「音频指纹」技术逐一比对,才揪出这批此前没被点名的歌曲。

    索尼原本想把 3 万多首直接加进原本的案子,但法官驳回了这个请求,原始诉讼的范围因此停留在 333 首。于是索尼换了个打法——单独再提一桩新诉讼。

    对 AI 音乐意味着什么

    这场拉锯把一个老问题又摆到台面:AI 音乐模型到底拿了多少版权音乐当养料。Udio、Suno 这类工具能照着风格生成听起来很「像」的歌,但训练数据是否合规,厂商一直说不清。

    • 2024 年索尼、环球、华纳联手起诉 Udio 与 Suno
    • 证据开示让索尼拿到 Udio 训练数据,音频指纹比对出 3 万首
    • 法官驳回追加请求,索尼改提独立新诉
    • 核心争议仍是 AI 音乐模型的训练数据授权

  • Anthropic 15亿美元版权和解获批:AI训练「合理使用」第一案落槌

    Anthropic 的 Claude 形象
    Anthropic 这场版权和解,给整个行业留下了「训练算合理使用」的定性(图源:TechCrunch)

    上周末,一桩拖了快两年的官司终于画上句号。联邦法官批准了 Anthropic 拿出 15 亿美元,摆平那场由一群作家和图书出版商发起的集体版权诉讼。钱要开始发了,但这件事真正的看点不在钱,而在法官留下的那个判断。

    15 亿到底怎么分

    按照和解方案,大约 50 万部作品每部能拿到 3000 美元,在握有版权的作者和出版商之间分摊。这个数额被认为是美国版权史上最大的一笔和解金。不过,很多写作者并不觉得这是一场胜利,原因得看法院到底是怎么裁的。

    主审法官 Alsup 站在了 Anthropic 这一边:用受版权保护的文本去训练 AI 模型,算「合理使用」。这个判断被不少人视为整个 AI 行业的一个转折点。

    真正踩线的是「怎么拿的书」

    Alsup 虽然点了头,但他没把获取方式也一并放过。Anthropic 的训练书库有两个来源:一部分是买来纸质书自己扫描,这部分没问题;另一部分是直接从 Library Genesis、Pirate Library Mirror 这类盗版站下载,这部分被 Alsup 认定为非法。换句话说,训练本身合法,偷书不合法。

    正因为盗版下载这条单独成立,案子本来可能要上陪审团、赔多少由陪审团定。Anthropic 选择和解,把不确定的风险先掐灭。

    • 和解金约 15 亿美元,按每部作品 3000 美元、覆盖约 50 万部作品分摊。
    • 训练模型被认定为「合理使用」,但盗版下载被单独判定非法。
    • 判决仅为地区法院层级,不构成全国性先例,同类诉讼仍在多州推进。

    为什么作家们高兴不起来

    核心争议是以对 AI 公司有利的方式收尾的。法官认定训练属于合理使用,等于给整个行业发了张准生证。可对于辛苦写书的人而言,自己的作品被拿来喂模型、还只拿到每部 3000 美元,怎么看都不像赢。

    更重要的是,这个判决只是加州北区一个地区法院的决定。Anthropic 一和解,案子就不会上上诉法院,也就没法变成有约束力的先例。别的法官完全可以对别的事实给出别的结论——事实也正在发生。Google、Meta、Midjourney、OpenAI 眼下都还背着各自的版权官司。就在上周,Hachette、Cengage、Elsevier 等出版商加上作家 Scott Turow,又把 Google 告了,理由是 Gemini 拿他们的书训练。


  • Patreon 不再求情,直接拦截 AI 爬虫:创作者的内容不是训练素材

    从”请勿抓取”到直接拉黑

    Patreon 这次是真的忍不了了。7月17日,这家靠创作者订阅活着的平台宣布,它和 Cloudflare 联手,开始直接拦截那些专门为训练 AI 模型而来、又没拿到授权的爬虫。

    以前 Patreon 也设过防线,但主要靠 robots.txt 文件——说白了就是放一张”请勿抓取”的告示牌,靠爬虫自觉。现在它换成了主动封堵:Cloudflare 的 AI Crawl Control 技术会直接把训练型爬虫挡在门外。

    Patreon 标志
    Patreon 与 Cloudflare 合作,主动拦截训练型 AI 爬虫(图源:TechCrunch)

    “同意与否,不该取决于抓取方愿不愿意守规矩。”Patreon 在官方博客里写了这么一句,把话挑明了。

    为什么突然动真格?Patreon 的说法很直白:AI 抓取这两年变精明了,而平台为了推新的发现功能(比如改版过的主页流、类似推文的 Quips),反而把更多内容暴露在了爬虫面前。更关键的是,测试期间那些训练爬虫的周访问量,从”几千次”直接掉到了零——人家压根没理过那块告示牌,该抓还是抓。

    索引放行,训练拦截

    平台也留了口子:单纯做索引、把用户导回 Patreon 的搜索引擎类爬虫,它还是放行的。区分标准很清楚——你帮创作者涨粉,可以;你拿创作者的内容去喂自己的模型,不行。

    这背后是整个内容行业的转向。Cloudflare 早就提供了限制 AI 爬虫的工具,甚至搞了个”Pay Per Crawl”市场,让网站能向爬虫收费。月初它又改了政策,凡是又索引又训练的混合爬虫,在有广告的页面上默认拦截。Patreon 的产品负责人 Drew Rowny 说得挺实在:互联网上大多数创作者为了涨粉,不得不默认接受自己的作品被拿去训练;Patreon 想走另一条路——既能涨粉,也能决定自己的东西怎么被用。

    对靠写文章、做播客、画图吃饭的创作者来说,这事儿的意义不只是少被薅几次羊毛。它把”我的内容归谁管”这个老问题,第一次摆到了台面上:当 AI 公司需要海量语料,创作者的同意,到底值不值钱?


    一句话看清这次变化

    • Patreon 联合 Cloudflare,从”请求别抓”升级为”直接拦截”训练型 AI 爬虫
    • 测试期间相关爬虫周访问量从数千次降至零,说明此前的 robots.txt 形同虚设
    • 保留索引类爬虫,只封训练类;Cloudflare 的 Pay Per Crawl 让网站可向爬虫收费
    📎 原文来源:Patreon stops asking AI bots not to scrape — and starts blocking them(TechCrunch / Sarah Perez,2026-07-17)
  • Suno源代码泄露:AI音乐训练数据来自YouTube和Deezer抓取

    AI音乐生成与版权概念图
    AI 音乐生成的繁荣背后,训练数据来源正成为最敏感的命门

    AI 音乐生成平台 Suno 最近被掀了底。据 404 Media 报道、并经多家媒体确认,Suno 此前遭到黑客入侵,泄露出来的源代码把它的训练数据来源摊在了阳光下——那些被唱片公司告了又告的”未经授权抓取”,在代码里写得明明白白。

    黑客用的化名是 ellie.191,早在 2025 年 11 月就通过一次供应链攻击拿到了 Suno 员工的凭证,进而翻出了内部代码。泄露文件里有一组数字格外刺眼:一个叫 youtube_music 的文件夹里塞着超过 200 万段视频片段;从歌词网站 Genius 抓了超过 1.7 万小时歌词;从音乐流媒体 Deezer 抓了超过 1.2 万小时歌曲;就连 Shutterstock 旗下的素材库 Pond5,也被搬走了超过 6.2 万小时音频。

    更讽刺的是,Suno 的爬虫还带了一套筛选机制,专门把非音乐文件过滤掉,好让训练数据”更干净”。一边讲究数据质量,一边用着没授权的歌。

    用户的隐私,也没被漏掉

    泄露的不止是训练数据。黑客还碰到了部分用户资料:邮箱、电话号码,以及通过支付服务商 Stripe 处理的信用卡元数据。Suno 后来回应称,这起事件”主要涉及已不再使用的过时代码”,没有完整卡号泄露,按现行隐私法不需要逐个通知用户——但它 2025 年 11 月出事时,确实没有主动告知用户。

    这下,版权方手里的牌更硬了

    环球、索尼、华纳这几家唱片巨头早就以 RIAA 名义把 Suno 告上了法庭,指控它未经授权用受版权保护的音乐训练模型。Suno 一直用”合理使用”当挡箭牌,说公开网络上能拿到的音乐文件就能拿来训练。今年 5 月,唱片公司把诉讼里认定的侵权歌曲从最初宣称的 560 首,扩到了 6.1 万多首,法院也批了。这次泄露的抓取代码,等于给版权方递上了新证据。

    站在创作者一边的人声音更响。SZA 就说过,她怀疑自己一些还没发布的歌也被拿去用了;作曲人 Kenneth Blume 直接抨击,这是赤裸裸侵犯创作者的权利。有意思的是,Anthropic 和 Meta 去年夏天在一批作者提起的类似诉讼里赢了——同样的”合理使用”辩护,结果并不完全一样。

    • 对 Suno:诉讼阴影没散,反被添了实锤,后续授权谈判和合作关系都会更被动。
    • 对整个 AI 音乐行业:训练数据来源不透明,迟早会被扒出来,监管已在呼吁明确规则。
    • 对普通用户:你喂给 AI 平台的资料,平台自己都未必守得住。

    Suno 自己其实还在扩张,前不久刚完成 4 亿美元 D 轮、估值冲到 54 亿美元。但这次泄露说明,靠”公开网络就能随便抓”撑起来的增长,迟早要面对账单。AI 音乐能不能走得远,先把”歌是从哪来的”说清楚,大概是最基本的一课。

    📎 原文来源:Source Code Hack Reveals Suno’s AI Was Trained on Millions of YouTube Songs(CNET,综合 404 Media / TechCrunch 报道,2026-07-16)
  • 谷歌摊上官司了:出版商们说它用我们的书,偷偷喂给了Gemini

    一群出版商和作家这周把谷歌告上了法庭。原告名单挺唬人——Hachette、Cengage、Elsevier 这几家老牌出版集团都在,还有《芝加哥律政风云》的作者 Scott Turow,以及一家叫 S.C.R.I.B.E. 的机构。他们的核心指控就一句话:谷歌拿受版权保护的书,去训练了自己的 AI 平台 Gemini,而且没打招呼。

    谷歌 Gemini 应用界面
    谷歌 Gemini 被指用出版商授权给 Google Books 的书籍训练(图源:TechCrunch / Getty Images)

    不只是用了,还被指改了版权标记

    诉状里还有个更刺耳的说法。出版商们指控谷歌”故意删除或篡改”这些作品的版权信息,目的就是为了”掩盖 Gemini 模型是用偷来的材料训练出来的”事实。换句话说,不只是用了,还被指试图抹掉用过的痕迹。这事儿有意思的地方在于,出版商和谷歌本来不是陌生人——早年间,出版商们是把书交给 Google Books 做检索的,你搜一本书,出来的只是几行片段和书目信息,整本书根本看不了。现在原告说,谷歌转头就拿这些书的副本,加上 Google Play 商店里上架的书,统统喂给了 Gemini。

    “Google illegally copied works from all these scope-limited programs for AI training, knowing it lacked authorization to do so.”(诉状原文)

    内部文件自己写:可能罚到上千亿

    诉状还引用了一份据称是谷歌内部的文件,里面白纸黑字写着:用受版权书训练 AI”可能给谷歌带来严重问题”,潜在罚款”从 100 亿到 1000 亿美元不等”。谷歌方面没有立刻回应。当然,谷歌不是第一个被告的。Meta、OpenAI、Anthropic 都背着类似的官司,只是到目前为止,加州有两起早期判决站在了 AI 公司这边——法官认为,用受版权作品训练模型,属于美国版权法里的”合理使用”。不过那两条判例也留了活口,没说后来的案子也得这么判。

    最有参考价值的是 Anthropic 那桩。它因为训练时盗用了版权作品,被罚了 15 亿美元,是美国版权法史上的最高赔偿,差不多 50 万名作者有资格每人至少拿 3000 美元,但不少人选择退出,自己接着告。这回告谷歌的案子落在了纽约南区联邦法院,等于换了个法官重新审,前面的加州判决对别的法院怎么看”合理使用”未必有决定性影响。


    说到底,这桩官司真正在问的是一件事:当一家公司把别人的书悄悄拿去喂模型,还顺手改了版权标记,它到底是在创新,还是在蹭。答案可能要等法庭慢慢给了。

  • Cloudflare 要给 AI 爬虫立规矩:9 月 15 日起,混着用的默认挡掉

    Cloudflare CEO Matthew Prince
    Cloudflare 联合创始人兼 CEO Matthew Prince(图源:TechCrunch)

    互联网上跑的流量,第一次有一半以上不是人。Cloudflare CEO Matthew Prince 抛出这句话时,顺手给整个 AI 行业下了道最后通牒:从 2026 年 9 月 15 日起,凡是把「搜索、智能体、训练」搅在一起抓取的爬虫,在挂了广告的页面上默认挡掉,除非站长自己改设置。

    简单说,以前一个 Googlebot 既帮你做搜索收录,又顺手把内容喂给 Gemini 训练,以后这招在 Cloudflare 保护的站点上行不通了。新规矩覆盖新客户、老客户新建的站点,以及所有免费用户——Cloudflare 手里管着全球约五分之一的网站流量,这一刀切下去,影响面不小。

    爬虫比人还多,旧契约破了

    Prince 口中的「旧契约」很朴素:我让你爬内容,你给我带流量。可生成式 AI 把这笔账搅黄了。模型厂商派代理替用户实时取网页,站长既没拿到广告曝光,也没收到订阅费,内容倒先被拿去训练了。Cloudflare 自己的数据更扎心:AI 爬虫的抓取流量里,超过一半是在反复拉取没变化的老页面。

    「既然互联网上多数流量已经不是人类产生的,我们就得走得更快、更远,好让一个可持续的生态长出来。」—— Cloudflare CEO Matthew Prince

    不只要挡,还要按次收费

    光挡不够解气,Cloudflare 把 2025 年推出的 Pay Per Crawl 市场升级成了「Pay Per Use」:站长不再只是「被爬时收钱」,而是当自己的内容真的在 AI 回答里产生价值时才收费。首发搭档是 Ceramic.ai 和 You.com——前者在 AI 搜索结果里露出内容就付费,后者碰到付费墙内容才结账。

    • 对出版商:终于能把「我的内容值多少钱」摆上谈判桌,Cloudflare 还配套了 Attribution Business Insights 面板,直接告诉你每个爬虫带回多少引流和商业意图。
    • 对 AI 公司:想白嫖,门儿都没有;老老实实把搜索、代理、训练拆成不同的 bot,反而能拿到更透明的抓取许可。

    被架在中间的 Google

    这纸新规,明里暗里都在戳 Google 的痛处。Cloudflare 点名说,那家「全球最大的搜索引擎」因为把搜索和 AI 绑在一起,掌握的信息量比头部 AI 公司多出约一倍,小站长想被搜到就不得不把内容也交出去训练。Google 当然不服,搬出 Google-Extended 这个可单独 opt-out 的训练爬虫说事,但现实是:就算你挡了 Extended,内容照样会出现在 AI Overviews 里,因为它吃的是 Googlebot 为搜索抓的料。

    Cloudflare 的算盘很清晰:它要的是结构性的分离——每个爬虫干嘛来的,站长心里得有数,再决定放不放行。公司放话要在 2027 年中把「混合用途爬虫」的流量占比从如今的三分之一压到零。对靠语料吃饭的模型厂商来说,这不只是一次设置调整,而是一场关于「内容到底归谁」的重新谈判。

  • Cloudflare动手了:9月15日起封杀「一爬两用」的AI爬虫

    Cloudflare动手了:9月15日起封杀「一爬两用」的AI爬虫

    你有没有想过,那些AI公司训练大模型时用的数据都是从哪儿来的?答案很简单——基本上就是从全网抓。但抓归抓,一直有个争议点:同一个爬虫,既帮搜索引擎建索引,又顺手把内容捞走喂给AI训练,publishers(内容发布商)连说”不”的机会都没有。

    Cloudflare阻止AI爬虫示意图
    Cloudflare开始对”多用途”爬虫动刀了

    Cloudflare在7月2日宣布了一条新政策,从9月15日起,凡是同时干两件事——既给搜索引擎建索引去抓内容、又给AI训练去抓内容的”多用途”爬虫,一律拦截。这个决定听起来技术味很浓,实际上触动的是整个AI产业链的根基。

    爬虫的”一石二鸟”的好日子要到头了

    事情是这样的。现在市面上不少AI公司的爬虫,名义上是来做搜索索引的,但实际上把抓到的内容同时用于AI模型训练。对内容发布商来说,这等于被人”合法”搬走了家底,还没有任何补偿。

    Cloudflare这次的逻辑很清楚:你要想抓我的内容去训练AI,那就老老实实分开来,别拿搜索索引当幌子。publishers也能更精细地控制——搜索索引的爬虫我可以放,AI训练的爬虫我可以说不。

    Cloudflare在官方博客里说得很直白:publishers应该有权决定自己的内容被怎么用,而不是被”多用途”爬虫一刀切地拿走。

    AI公司要开始掏钱了?

    这条政策背后有个更深的意图。Cloudflare显然在押注:把爬虫分开管理之后,AI公司要想继续拿到高质量训练数据,就得跟publishers坐下来谈条件——也就是掏钱。

    TechCrunch的报道也点出了这个趋势。过去两年里,多家新闻机构已经跟AI公司签了内容授权协议——包括美联社、路透社、纽约时报等。Cloudflare这次相当于给这个趋势添了一把火,用技术手段逼着AI公司走到谈判桌前。

    当然,9月15日这个截止日期还有点远,AI公司们还有两个多月的时间来调整自己的爬虫策略。但可以预见的是,那些一直”灰色操作”的公司,接下来要么合规分开爬虫,要么就准备失去一大批网站的内容访问权。

    小网站能受益吗?

    有个问题值得想想。Cloudflare这个动作,对大出版社来说当然是好事——他们本来就有谈判筹码。但那些没用Cloudflare的小网站呢?他们的内容是不是照样被随便抓走?

    Cloudflare的回答是:这项功能会对所有用户开放,包括免费用户。也就是说,哪怕你是个个人博客,只要用了Cloudflare的CDN,就能设置自己的爬虫规则。这个设计还算厚道。


    说到底,这件事反映的是AI产业的一个根本矛盾:模型需要数据,但数据的生产者希望得到回报。Cloudflare作为互联网基础设施的重要一环,选择在这个时候出手,时机选得相当准。接下来就看AI公司怎么接招了。

  • Cloudflare打响第一枪:AI公司爬内容,得先付钱

    Cloudflare打响第一枪:AI公司爬内容,得先付钱

    Cloudflare AI内容保护
    Cloudflare推出新政策,要求AI公司为其爬虫访问出版商内容付费(图:Cloudflare)

    互联网上超过一半的流量现在已经不是人在访问,而是机器人在跑。这个里程碑刚被跨过,Cloudflare就坐不住了。

    2026年9月15日起,Cloudflare要把”混合用途”爬虫挡在门外——至少那些带广告的页面默认不再让这些爬虫进来了。啥叫”混合用途”爬虫?就是那些既用来做搜索索引、又用来训练AI模型的爬虫。Cloudflare说得挺直接:你得把搜索和AI训练用的爬虫分开,别想着一次爬取、多处复用。

    Cloudflare联合创始人兼CEO Matthew Prince说得很明白:”现在互联网上大部分流量已经不是人类产生的了,我们必须更快行动,才能让这个生态活得下去。”

    谷歌被点名了

    Cloudflare在公告里没点名,但大家都看得出来——”全球最大的搜索引擎”指的就是谷歌。Cloudflare说这家搜索巨头能访问的内容量,比其他AI公司多了约两倍,原因很简单:谷歌让网站主很难在”被搜索到”和”不被AI用来训练”之间做选择。

    谷歌当然不认这个账。他们说自己提供了Google Extended这个爬虫标识,网站主可以用它来选择退出AI训练。但问题是,谷歌的主力爬虫Googlebot是给搜索用的,而搜索里现在也塞进了AI Overview和AI Mode——你就算挡了Google Extended,Googlebot该爬的还是照爬,而你的内容就可能被拿去喂AI了。

    这才是Cloudflare要动真格的原因。网站主想要被搜索到,但也不想自己的内容被免费拿去训练AI模型。这两个需求之间,谷歌没有给出一个干净的解决方案。

    从”按次收费”到”按价值收费”

    Cloudflare之前就搞过一个叫Pay Per Crawl的东西,让网站主可以向AI爬虫收费。现在这个机制进化成了”Pay Per Use”——不只是爬取的时候收钱,而是当你的内容真的给AI公司创造了价值,才来收费。

    目前已经有两个合作伙伴接入了这个体系:Ceramic.ai和You.com。出版商可以选择加入,然后当他们的内容出现在Ceramic的AI搜索结果里,或者被You.com访问到的时候,就能拿到分成。


    还有一个挺有意思的数据:Cloudflare发现,AI爬虫的流量里,有超过50%是在重新抓取没有变化的页面。这对出版商来说等于白白消耗带宽和计算资源,而Cloudflare的新政策至少能让这部分浪费少一点。

    9月15日这个deadline距离现在还有两个多月。AI公司要是还想继续爬那些带广告的页面,要么把爬虫分开,要么就得准备好付钱了。

  • Cloudflare给AI公司下了最后通牒:9月15日起,爬内容要付费

    Cloudflare给AI公司下了最后通牒:9月15日起,爬内容要付费

    Cloudflare新政策逼迫AI公司为内容付费
    Cloudflare新政策将阻止AI爬虫免费抓取网页内容

    Cloudflare本周扔了一颗炸弹:从2026年9月15日起,Cloudflare的默认设置将阻止”混合用途”爬虫访问任何带有广告的页面。

    这话有点绕,翻译一下就是:那些既用来做搜索索引、又用来训练AI模型、还用来驱动AI代理的爬虫,以后默认进不了用了Cloudflare服务的网站——除非网站主主动改设置。

    这个新政策会影响所有新注册Cloudflare的客户、现有客户新建的站点,以及所有免费版用户。

    机器人流量已经超过人类

    Cloudflare的CEO马修·普林斯说得很直白:”现在互联网上大部分流量已经不是人类产生的了,我们必须采取行动,让一个可持续的生态系统能够出现。”他提到的那个里程碑——机器人流量首次超过人类流量——其实刚发生没多久。

    网站主们的处境确实挺尴尬的。他们希望内容能被搜索引擎搜到,也希望能被AI服务引用,但不希望自己的知识产权被白白拿走。Cloudflare这个点打得挺准的。

    最有意思的是Cloudflare对”世界上最大的搜索引擎”的暗讽——明显是在说谷歌。Cloudflare指出,谷歌能访问到的信息量大约是其他AI公司的2倍,原因是谷歌让用户很难在”不被用于AI”的前提下保持”可被搜索到”。

    谷歌当然不认这个账,说自己提供了”Google Extended”爬虫,网站主可以用它来选择退出内容被用于训练Gemini等AI产品,而且不影响在谷歌搜索里被收录。但问题是,谷歌的旗舰爬虫Googlebot是同时为搜索和AI功能(比如AI Overviews)服务的,这两者并没有完全分开。


    从”按次收费”到”按价值收费”

    Cloudflare这次不只是封爬虫那么简单。他们还在推一个叫”Pay Per Use”的收费机制,是之前”Pay Per Crawl”市场的升级版。意思是:出版商不只是能在AI爬虫来抓内容的时候收费,还能在内容产生价值的时候收费。

    初期合作伙伴有两家:Ceramic.ai和You.com。出版商加入之后,当他们的内容出现在Ceramic的AI搜索结果里,或者被You.com访问到,就能拿到钱。

    这个模式如果真的推开,对AI行业的训练数据成本影响会非常大。现在各家大模型公司训练数据的一个重要来源就是公开网页,如果越来越多的网站通过Cloudflare的默认设置阻止混合爬虫,那AI公司要么掏钱,要么就只能用到期的训练数据了。

    9月15日这个时间节点,可能会成为一个分水岭。

    Cloudflare之前也推出过对抗AI爬虫的工具,包括一个让网站可以向AI爬虫收费的市场”Pay Per Crawl”。现在这个升级版”Pay Per Use”,把收费的触发点从”抓取”变成了”产生价值”,对出版商来说更有利。

    数据也支持Cloudflare的做法。他们发现,AI爬虫的抓取流量里,超过50%都是在重新抓取没有变化的页面。这对出版商来说是纯粹的带宽浪费。

    当然,这个政策能不能真正落地,还得看有多少网站主愿意启用它。Cloudflare在CDN市场的份额很大,如果默认设置真的改为阻止混合爬虫,影响面会很广。

    对AI公司来说,这可能是个不小的麻烦。训练数据本来就越来越难获取,如果连网页抓取都要开始付费,那成本只会越来越高。

  • Cloudflare 给 AI 公司下了最后通牒:9月15日之前,要么分开爬虫,要么被挡在门外

    Cloudflare 在 7 月 1 日甩出了一颗炸弹:从今年 9 月 15 日起,所有”混合用途”爬虫——那些既做搜索索引、又跑 AI 训练、还顺带干 Agent 活的爬虫——默认将被挡在绝大多数网站门外。除非网站主主动改设置,否则这些爬虫连页面都摸不到。

    “混合爬虫”为啥成了众矢之的

    Cloudflare 口中的”混合用途爬虫”,说白了就是那些既能帮你做搜索、又在偷偷扒数据去训练模型的爬虫。最典型的例子就是 Googlebot——它一边给 Google Search 抓页面,一边顺带把数据喂给 AI Overviews 和 AI Mode。网站主如果想在搜索里露脸,就不得不放 Googlebot 进来,但这也等于免费把内容送给 Google 的 AI 产品用。

    Cloudflare CEO Matthew Prince 在声明里说得很直白:”现在互联网上大部分流量已经不是人类产生的了,我们必须动作更快,才能让一个可持续的生态系统跑起来。”

    他提到的那个”里程碑”,是指今年 6 月 bots 流量首次超过人类流量——这件事比专家预期的早了一年。

    9 月 15 日大限之后会发生什么

    新默认规则生效后,所有新注册的 Cloudflare 客户、现有客户新建的站点,以及所有免费用户,都会自动启用这个拦截策略。也就是说,AI 公司要么把搜索爬虫和训练/ Agent 爬虫分开,用不同的 User-Agent 和爬虫策略;要么就去跟网站主谈条件,别想着白嫖。

    Cloudflare 也不是突然翻脸。过去两年它一直在推相关工具:2024 年推出 AI 爬虫屏蔽工具,2025 年上线了”Pay Per Crawl”市场,让网站主可以给 AI 爬虫开价。现在这个机制升级成了”Pay Per Use”——不光是抓数据要收费,AI 公司用网站内容产生价值的时候,也得分成。


    Ceramic.ai 和 You.com 先试水

    Cloudflare 已经拉了两个合作伙伴进来趟路:Ceramic.ai 和 You.com。如果出版方选择加入,当他们的内容出现在 Ceramic 的 AI 搜索结果里,或者被 You.com 调用了付费内容,就能拿到钱。

    这对出版商来说是个好消息。过去两年,AI 摘要把搜索流量的命给革了——用户直接在搜索结果页看到答案,懒得点进原文。现在至少有了讨价还价的筹码。

    不过 AI 公司那边肯定不乐意。Cloudflare 的数据显示,AI 爬虫有超过一半的流量花在重复抓取没有变化的页面上——这纯属浪费带宽和计算资源。如果以后每爬一次都要花钱,AI 公司的数据获取成本怕是要涨不少。

    Google 怎么回应

    Cloudflare 在声明里点了”全球最大搜索引擎”的名——这显然是说 Google。Cloudflare 称 Google 比其他 AI 公司多拿到约 2 倍的信息量,因为搜索巨头让客户很难在”被搜索索引”和”被用于 AI”之间二选一。

    Google 当然不认这个账。它说自己有专门的”Google Extended”爬虫,网站主可以用它来选择退出训练用途,且不影响搜索收录。但问题是,Googlebot 本身也在为 AI Overviews 和 AI Mode 抓数据——这两者之间的界限,普通网站主根本搞不清楚。