标签: 出版商

  • Anthropic 15亿美元版权和解获批:AI训练「合理使用」第一案落槌

    Anthropic 的 Claude 形象
    Anthropic 这场版权和解,给整个行业留下了「训练算合理使用」的定性(图源:TechCrunch)

    上周末,一桩拖了快两年的官司终于画上句号。联邦法官批准了 Anthropic 拿出 15 亿美元,摆平那场由一群作家和图书出版商发起的集体版权诉讼。钱要开始发了,但这件事真正的看点不在钱,而在法官留下的那个判断。

    15 亿到底怎么分

    按照和解方案,大约 50 万部作品每部能拿到 3000 美元,在握有版权的作者和出版商之间分摊。这个数额被认为是美国版权史上最大的一笔和解金。不过,很多写作者并不觉得这是一场胜利,原因得看法院到底是怎么裁的。

    主审法官 Alsup 站在了 Anthropic 这一边:用受版权保护的文本去训练 AI 模型,算「合理使用」。这个判断被不少人视为整个 AI 行业的一个转折点。

    真正踩线的是「怎么拿的书」

    Alsup 虽然点了头,但他没把获取方式也一并放过。Anthropic 的训练书库有两个来源:一部分是买来纸质书自己扫描,这部分没问题;另一部分是直接从 Library Genesis、Pirate Library Mirror 这类盗版站下载,这部分被 Alsup 认定为非法。换句话说,训练本身合法,偷书不合法。

    正因为盗版下载这条单独成立,案子本来可能要上陪审团、赔多少由陪审团定。Anthropic 选择和解,把不确定的风险先掐灭。

    • 和解金约 15 亿美元,按每部作品 3000 美元、覆盖约 50 万部作品分摊。
    • 训练模型被认定为「合理使用」,但盗版下载被单独判定非法。
    • 判决仅为地区法院层级,不构成全国性先例,同类诉讼仍在多州推进。

    为什么作家们高兴不起来

    核心争议是以对 AI 公司有利的方式收尾的。法官认定训练属于合理使用,等于给整个行业发了张准生证。可对于辛苦写书的人而言,自己的作品被拿来喂模型、还只拿到每部 3000 美元,怎么看都不像赢。

    更重要的是,这个判决只是加州北区一个地区法院的决定。Anthropic 一和解,案子就不会上上诉法院,也就没法变成有约束力的先例。别的法官完全可以对别的事实给出别的结论——事实也正在发生。Google、Meta、Midjourney、OpenAI 眼下都还背着各自的版权官司。就在上周,Hachette、Cengage、Elsevier 等出版商加上作家 Scott Turow,又把 Google 告了,理由是 Gemini 拿他们的书训练。


  • 谷歌摊上官司了:出版商们说它用我们的书,偷偷喂给了Gemini

    一群出版商和作家这周把谷歌告上了法庭。原告名单挺唬人——Hachette、Cengage、Elsevier 这几家老牌出版集团都在,还有《芝加哥律政风云》的作者 Scott Turow,以及一家叫 S.C.R.I.B.E. 的机构。他们的核心指控就一句话:谷歌拿受版权保护的书,去训练了自己的 AI 平台 Gemini,而且没打招呼。

    谷歌 Gemini 应用界面
    谷歌 Gemini 被指用出版商授权给 Google Books 的书籍训练(图源:TechCrunch / Getty Images)

    不只是用了,还被指改了版权标记

    诉状里还有个更刺耳的说法。出版商们指控谷歌”故意删除或篡改”这些作品的版权信息,目的就是为了”掩盖 Gemini 模型是用偷来的材料训练出来的”事实。换句话说,不只是用了,还被指试图抹掉用过的痕迹。这事儿有意思的地方在于,出版商和谷歌本来不是陌生人——早年间,出版商们是把书交给 Google Books 做检索的,你搜一本书,出来的只是几行片段和书目信息,整本书根本看不了。现在原告说,谷歌转头就拿这些书的副本,加上 Google Play 商店里上架的书,统统喂给了 Gemini。

    “Google illegally copied works from all these scope-limited programs for AI training, knowing it lacked authorization to do so.”(诉状原文)

    内部文件自己写:可能罚到上千亿

    诉状还引用了一份据称是谷歌内部的文件,里面白纸黑字写着:用受版权书训练 AI”可能给谷歌带来严重问题”,潜在罚款”从 100 亿到 1000 亿美元不等”。谷歌方面没有立刻回应。当然,谷歌不是第一个被告的。Meta、OpenAI、Anthropic 都背着类似的官司,只是到目前为止,加州有两起早期判决站在了 AI 公司这边——法官认为,用受版权作品训练模型,属于美国版权法里的”合理使用”。不过那两条判例也留了活口,没说后来的案子也得这么判。

    最有参考价值的是 Anthropic 那桩。它因为训练时盗用了版权作品,被罚了 15 亿美元,是美国版权法史上的最高赔偿,差不多 50 万名作者有资格每人至少拿 3000 美元,但不少人选择退出,自己接着告。这回告谷歌的案子落在了纽约南区联邦法院,等于换了个法官重新审,前面的加州判决对别的法院怎么看”合理使用”未必有决定性影响。


    说到底,这桩官司真正在问的是一件事:当一家公司把别人的书悄悄拿去喂模型,还顺手改了版权标记,它到底是在创新,还是在蹭。答案可能要等法庭慢慢给了。

  • Cloudflare出手了:9月15日起,AI公司要为爬取的内容买单

    Cloudflare出手了:9月15日起,AI公司要为爬取的内容买单

    7月1日,Cloudflare联合创始人兼CEO Matthew Prince在官方博客扔下一枚重磅炸弹:从2026年9月15日起,Cloudflare的默认设置将自动屏蔽”混合用途”网络爬虫访问任何带有广告的页面。换句话说,AI公司要是想继续用网络内容训练模型、驱动智能体,要么把搜索爬虫和AI爬虫分开,要么就得谈付费的事了。

    Cloudflare CEO Matthew Prince
    Cloudflare CEO Matthew Prince宣布新政策(图源:TechCrunch)

    为什么要现在动手?

    Matthew Prince在声明里说了一句话,值得所有人注意:”现在互联网上大部分流量已经不是人类产生的了。”他指的是最近的一个里程碑——网络爬虫流量首次超过了人类用户流量,而且这个拐点比预期来得更早,原本预测要到明年才发生。

    “现在互联网上大部分流量已经是非人类产生的,我们必须更进一步、行动更快,才能让一个可持续的生态系统出现。”

    —— Cloudflare CEO Matthew Prince

    这个变化影响面有多大?Cloudflare在全球拥有大量网站客户,新政策将适用于:所有新注册客户、现有客户新建的站点、以及所有现有免费客户。只有手动调整设置的站长才能允许混合爬虫继续抓取。

    点名Google:你拿了两倍的数据

    Cloudflare在声明里不点名地批评了”全球最大的搜索引擎”——显然指的是Google。说法很直接:Google让网站主陷入一个两难境地,想要被搜索到,就得同意内容被拿去训练AI,结果就是Google比其他AI公司多拿了大约两倍的信息量。

    Google当然不服气。他们过去就反驳过,说自己提供了”Google Extended”爬虫,网站主可以单独选择退出AI训练,不影响搜索收录。问题是,Google的旗舰爬虫Googlebot是”混合用途”的——它既管搜索,也管AI概览(AI Overviews)和AI模式这些功能。Cloudflare的意思很明确:你们得拆开,别混在一起。

    从”按次收费”到”按价值收费”

    这件事的背景是,Cloudflare去年就推出了一个叫”Pay Per Crawl”的市场,让网站主可以向AI爬虫收费。现在这个机制升级了,叫”Pay Per Use”——不只是抓取代价,而是当你的内容真的产生了价值(比如出现在AI搜索结果里),你才能拿到钱。

    起步阶段,Cloudflare找了两个合作伙伴:Ceramic.ai和You.com。如果网站主选择加入,当他们的内容出现在Ceramic的AI搜索结果里,或者被You.com访问到 premium 内容时,就能收到钱。

    • AI爬虫有超过50%的流量是在重复抓取没有变化的页面——纯浪费带宽
    • 出版商的内容被免费用于商业AI产品,但没有任何补偿
    • Cloudflare希望9月15日的deadline能逼AI公司把爬虫”分家”

    这对AI行业意味着什么

    这个政策一旦落地,影响是连锁性的。首先,那些依赖免费网络爬取来训练模型的AI公司,成本会显著上升。OpenAI、Anthropic、Google这些巨头或许扛得住,但中小AI创业公司就不一定了。

    其次,这可能会加速AI公司自己去买内容授权——就像Apple Music买音乐版权、Netflix买影视版权一样。其实这个趋势已经开始了,OpenAI跟News Corp、Axel Springer都有内容授权协议。Cloudflare这招,等于把”授权”变成了”强制”。

    当然,9月15日还有两个多月,AI公司有足够时间去调整爬虫策略。最可能的结局是:Google被迫把Googlebot拆成两个,其他AI公司也跟着学。Cloudflare这套打法,本质上是用自己在全球CDN市场的统治地位,强行给AI行业立了个规矩。