标签: AI爬虫

  • Patreon 不再求情,直接拦截 AI 爬虫:创作者的内容不是训练素材

    从”请勿抓取”到直接拉黑

    Patreon 这次是真的忍不了了。7月17日,这家靠创作者订阅活着的平台宣布,它和 Cloudflare 联手,开始直接拦截那些专门为训练 AI 模型而来、又没拿到授权的爬虫。

    以前 Patreon 也设过防线,但主要靠 robots.txt 文件——说白了就是放一张”请勿抓取”的告示牌,靠爬虫自觉。现在它换成了主动封堵:Cloudflare 的 AI Crawl Control 技术会直接把训练型爬虫挡在门外。

    Patreon 标志
    Patreon 与 Cloudflare 合作,主动拦截训练型 AI 爬虫(图源:TechCrunch)

    “同意与否,不该取决于抓取方愿不愿意守规矩。”Patreon 在官方博客里写了这么一句,把话挑明了。

    为什么突然动真格?Patreon 的说法很直白:AI 抓取这两年变精明了,而平台为了推新的发现功能(比如改版过的主页流、类似推文的 Quips),反而把更多内容暴露在了爬虫面前。更关键的是,测试期间那些训练爬虫的周访问量,从”几千次”直接掉到了零——人家压根没理过那块告示牌,该抓还是抓。

    索引放行,训练拦截

    平台也留了口子:单纯做索引、把用户导回 Patreon 的搜索引擎类爬虫,它还是放行的。区分标准很清楚——你帮创作者涨粉,可以;你拿创作者的内容去喂自己的模型,不行。

    这背后是整个内容行业的转向。Cloudflare 早就提供了限制 AI 爬虫的工具,甚至搞了个”Pay Per Crawl”市场,让网站能向爬虫收费。月初它又改了政策,凡是又索引又训练的混合爬虫,在有广告的页面上默认拦截。Patreon 的产品负责人 Drew Rowny 说得挺实在:互联网上大多数创作者为了涨粉,不得不默认接受自己的作品被拿去训练;Patreon 想走另一条路——既能涨粉,也能决定自己的东西怎么被用。

    对靠写文章、做播客、画图吃饭的创作者来说,这事儿的意义不只是少被薅几次羊毛。它把”我的内容归谁管”这个老问题,第一次摆到了台面上:当 AI 公司需要海量语料,创作者的同意,到底值不值钱?


    一句话看清这次变化

    • Patreon 联合 Cloudflare,从”请求别抓”升级为”直接拦截”训练型 AI 爬虫
    • 测试期间相关爬虫周访问量从数千次降至零,说明此前的 robots.txt 形同虚设
    • 保留索引类爬虫,只封训练类;Cloudflare 的 Pay Per Crawl 让网站可向爬虫收费
    📎 原文来源:Patreon stops asking AI bots not to scrape — and starts blocking them(TechCrunch / Sarah Perez,2026-07-17)
  • Cloudflare 要给 AI 爬虫立规矩:9 月 15 日起,混着用的默认挡掉

    Cloudflare CEO Matthew Prince
    Cloudflare 联合创始人兼 CEO Matthew Prince(图源:TechCrunch)

    互联网上跑的流量,第一次有一半以上不是人。Cloudflare CEO Matthew Prince 抛出这句话时,顺手给整个 AI 行业下了道最后通牒:从 2026 年 9 月 15 日起,凡是把「搜索、智能体、训练」搅在一起抓取的爬虫,在挂了广告的页面上默认挡掉,除非站长自己改设置。

    简单说,以前一个 Googlebot 既帮你做搜索收录,又顺手把内容喂给 Gemini 训练,以后这招在 Cloudflare 保护的站点上行不通了。新规矩覆盖新客户、老客户新建的站点,以及所有免费用户——Cloudflare 手里管着全球约五分之一的网站流量,这一刀切下去,影响面不小。

    爬虫比人还多,旧契约破了

    Prince 口中的「旧契约」很朴素:我让你爬内容,你给我带流量。可生成式 AI 把这笔账搅黄了。模型厂商派代理替用户实时取网页,站长既没拿到广告曝光,也没收到订阅费,内容倒先被拿去训练了。Cloudflare 自己的数据更扎心:AI 爬虫的抓取流量里,超过一半是在反复拉取没变化的老页面。

    「既然互联网上多数流量已经不是人类产生的,我们就得走得更快、更远,好让一个可持续的生态长出来。」—— Cloudflare CEO Matthew Prince

    不只要挡,还要按次收费

    光挡不够解气,Cloudflare 把 2025 年推出的 Pay Per Crawl 市场升级成了「Pay Per Use」:站长不再只是「被爬时收钱」,而是当自己的内容真的在 AI 回答里产生价值时才收费。首发搭档是 Ceramic.ai 和 You.com——前者在 AI 搜索结果里露出内容就付费,后者碰到付费墙内容才结账。

    • 对出版商:终于能把「我的内容值多少钱」摆上谈判桌,Cloudflare 还配套了 Attribution Business Insights 面板,直接告诉你每个爬虫带回多少引流和商业意图。
    • 对 AI 公司:想白嫖,门儿都没有;老老实实把搜索、代理、训练拆成不同的 bot,反而能拿到更透明的抓取许可。

    被架在中间的 Google

    这纸新规,明里暗里都在戳 Google 的痛处。Cloudflare 点名说,那家「全球最大的搜索引擎」因为把搜索和 AI 绑在一起,掌握的信息量比头部 AI 公司多出约一倍,小站长想被搜到就不得不把内容也交出去训练。Google 当然不服,搬出 Google-Extended 这个可单独 opt-out 的训练爬虫说事,但现实是:就算你挡了 Extended,内容照样会出现在 AI Overviews 里,因为它吃的是 Googlebot 为搜索抓的料。

    Cloudflare 的算盘很清晰:它要的是结构性的分离——每个爬虫干嘛来的,站长心里得有数,再决定放不放行。公司放话要在 2027 年中把「混合用途爬虫」的流量占比从如今的三分之一压到零。对靠语料吃饭的模型厂商来说,这不只是一次设置调整,而是一场关于「内容到底归谁」的重新谈判。

  • Cloudflare打响第一枪:AI公司爬内容,得先付钱

    Cloudflare打响第一枪:AI公司爬内容,得先付钱

    Cloudflare AI内容保护
    Cloudflare推出新政策,要求AI公司为其爬虫访问出版商内容付费(图:Cloudflare)

    互联网上超过一半的流量现在已经不是人在访问,而是机器人在跑。这个里程碑刚被跨过,Cloudflare就坐不住了。

    2026年9月15日起,Cloudflare要把”混合用途”爬虫挡在门外——至少那些带广告的页面默认不再让这些爬虫进来了。啥叫”混合用途”爬虫?就是那些既用来做搜索索引、又用来训练AI模型的爬虫。Cloudflare说得挺直接:你得把搜索和AI训练用的爬虫分开,别想着一次爬取、多处复用。

    Cloudflare联合创始人兼CEO Matthew Prince说得很明白:”现在互联网上大部分流量已经不是人类产生的了,我们必须更快行动,才能让这个生态活得下去。”

    谷歌被点名了

    Cloudflare在公告里没点名,但大家都看得出来——”全球最大的搜索引擎”指的就是谷歌。Cloudflare说这家搜索巨头能访问的内容量,比其他AI公司多了约两倍,原因很简单:谷歌让网站主很难在”被搜索到”和”不被AI用来训练”之间做选择。

    谷歌当然不认这个账。他们说自己提供了Google Extended这个爬虫标识,网站主可以用它来选择退出AI训练。但问题是,谷歌的主力爬虫Googlebot是给搜索用的,而搜索里现在也塞进了AI Overview和AI Mode——你就算挡了Google Extended,Googlebot该爬的还是照爬,而你的内容就可能被拿去喂AI了。

    这才是Cloudflare要动真格的原因。网站主想要被搜索到,但也不想自己的内容被免费拿去训练AI模型。这两个需求之间,谷歌没有给出一个干净的解决方案。

    从”按次收费”到”按价值收费”

    Cloudflare之前就搞过一个叫Pay Per Crawl的东西,让网站主可以向AI爬虫收费。现在这个机制进化成了”Pay Per Use”——不只是爬取的时候收钱,而是当你的内容真的给AI公司创造了价值,才来收费。

    目前已经有两个合作伙伴接入了这个体系:Ceramic.ai和You.com。出版商可以选择加入,然后当他们的内容出现在Ceramic的AI搜索结果里,或者被You.com访问到的时候,就能拿到分成。


    还有一个挺有意思的数据:Cloudflare发现,AI爬虫的流量里,有超过50%是在重新抓取没有变化的页面。这对出版商来说等于白白消耗带宽和计算资源,而Cloudflare的新政策至少能让这部分浪费少一点。

    9月15日这个deadline距离现在还有两个多月。AI公司要是还想继续爬那些带广告的页面,要么把爬虫分开,要么就得准备好付钱了。

  • Cloudflare出手了:9月15日起,AI公司要为爬取的内容买单

    Cloudflare出手了:9月15日起,AI公司要为爬取的内容买单

    7月1日,Cloudflare联合创始人兼CEO Matthew Prince在官方博客扔下一枚重磅炸弹:从2026年9月15日起,Cloudflare的默认设置将自动屏蔽”混合用途”网络爬虫访问任何带有广告的页面。换句话说,AI公司要是想继续用网络内容训练模型、驱动智能体,要么把搜索爬虫和AI爬虫分开,要么就得谈付费的事了。

    Cloudflare CEO Matthew Prince
    Cloudflare CEO Matthew Prince宣布新政策(图源:TechCrunch)

    为什么要现在动手?

    Matthew Prince在声明里说了一句话,值得所有人注意:”现在互联网上大部分流量已经不是人类产生的了。”他指的是最近的一个里程碑——网络爬虫流量首次超过了人类用户流量,而且这个拐点比预期来得更早,原本预测要到明年才发生。

    “现在互联网上大部分流量已经是非人类产生的,我们必须更进一步、行动更快,才能让一个可持续的生态系统出现。”

    —— Cloudflare CEO Matthew Prince

    这个变化影响面有多大?Cloudflare在全球拥有大量网站客户,新政策将适用于:所有新注册客户、现有客户新建的站点、以及所有现有免费客户。只有手动调整设置的站长才能允许混合爬虫继续抓取。

    点名Google:你拿了两倍的数据

    Cloudflare在声明里不点名地批评了”全球最大的搜索引擎”——显然指的是Google。说法很直接:Google让网站主陷入一个两难境地,想要被搜索到,就得同意内容被拿去训练AI,结果就是Google比其他AI公司多拿了大约两倍的信息量。

    Google当然不服气。他们过去就反驳过,说自己提供了”Google Extended”爬虫,网站主可以单独选择退出AI训练,不影响搜索收录。问题是,Google的旗舰爬虫Googlebot是”混合用途”的——它既管搜索,也管AI概览(AI Overviews)和AI模式这些功能。Cloudflare的意思很明确:你们得拆开,别混在一起。

    从”按次收费”到”按价值收费”

    这件事的背景是,Cloudflare去年就推出了一个叫”Pay Per Crawl”的市场,让网站主可以向AI爬虫收费。现在这个机制升级了,叫”Pay Per Use”——不只是抓取代价,而是当你的内容真的产生了价值(比如出现在AI搜索结果里),你才能拿到钱。

    起步阶段,Cloudflare找了两个合作伙伴:Ceramic.ai和You.com。如果网站主选择加入,当他们的内容出现在Ceramic的AI搜索结果里,或者被You.com访问到 premium 内容时,就能收到钱。

    • AI爬虫有超过50%的流量是在重复抓取没有变化的页面——纯浪费带宽
    • 出版商的内容被免费用于商业AI产品,但没有任何补偿
    • Cloudflare希望9月15日的deadline能逼AI公司把爬虫”分家”

    这对AI行业意味着什么

    这个政策一旦落地,影响是连锁性的。首先,那些依赖免费网络爬取来训练模型的AI公司,成本会显著上升。OpenAI、Anthropic、Google这些巨头或许扛得住,但中小AI创业公司就不一定了。

    其次,这可能会加速AI公司自己去买内容授权——就像Apple Music买音乐版权、Netflix买影视版权一样。其实这个趋势已经开始了,OpenAI跟News Corp、Axel Springer都有内容授权协议。Cloudflare这招,等于把”授权”变成了”强制”。

    当然,9月15日还有两个多月,AI公司有足够时间去调整爬虫策略。最可能的结局是:Google被迫把Googlebot拆成两个,其他AI公司也跟着学。Cloudflare这套打法,本质上是用自己在全球CDN市场的统治地位,强行给AI行业立了个规矩。