标签: AI版权

  • ChatGPT开始拒绝模仿斯蒂芬·金们的文风,这背后是一堆版权官司

    最近有用户发现,让ChatGPT「用斯蒂芬·金的风格写个开头」这种老玩法,突然不灵了。它会礼貌地拒绝你,然后换个说法:我可以写出氛围感拉满的小镇惊悚,但不能贴着金老爷子的独特文风来。

    ChatGPT拒绝模仿知名作家文风
    ChatGPT开始对「模仿作家文风」类请求踩刹车(AI示意图)

    从活着的作家,管到了去世的作家

    Ars Technica记者实测了一把,要求ChatGPT用斯蒂芬·金的风格写小说开头,得到的回复是这样的:

    「我完全可以写出具有氛围惊悚、角色驱动、小镇恐惧这些标志性特征的文字,但我不能用斯蒂芬·金的确切风格写作,也不能贴近模仿他独特的声音。下面是一段原创开头,它捕捉了类似的感觉,但保持自己的声音……」

    测试范围不止金一个人。J.K.罗琳、谭恩美这些在世作家被拒,狄更斯、海明威这些已故作家同样被拒。有意思的是,研究机构No Latency本月早些时候的分析显示,当时ChatGPT只拒绝在世作家,对已故作家还照单全收——也就是说,这道闸门最近又拧紧了一圈。

    「捕捉感觉」和「复制风格」,一词之差值几个亿

    乍一看这像是文字游戏:不模仿「确切风格」,但可以体现「宽泛特质」,输出的东西可能差不了太多。但在法庭上,这个措辞的差别可能非常值钱。OpenAI手上还压着一堆作家发起的版权诉讼,其中一份诉状专门点名ChatGPT「生成与受版权保护文本高度相似内容的诡异能力」。现在模型自己先声明「我不复制风格」,等于提前给辩护律师递了弹药。

    美国版权法的基本逻辑是保护「具体表达」而不保护「风格」本身,但如果AI的仿作跟原作达到「实质性相似」,照样可能构成侵权。乔治·华盛顿大学法学院教授Robert Brauneis说得很直白:历史上从来没有过这样的局面——个人创作者的风格可以被模仿得这么像、成本还这么低。


    各家AI的态度并不一致

    No Latency的对比研究给各家大模型画了一张站队图:

    • 谷歌Gemini:基本有求必应,直接照着作家风格写;
    • Perplexity:一律拒绝,然后引导你换个写法;
    • Anthropic的Claude和微软Copilot:写是写了,但会加一段免责式的说明,表示自己知道模仿这事有争议;
    • ChatGPT:现在站到了最严的一档。

    写作圈对文风模仿的敏感是有前科的。去年作家Lena McDonald的出版小说里,赫然留着一句没删干净的AI回复——「我已按J. Bree的风格重写了这段」,当场社死。美国作家协会也在行业规范里明确劝告:别用生成式AI刻意复制同行的独特声音,除了道德问题,还可能吃上不正当竞争或版权侵权的官司。

    当然,靠这个功能吃饭的老用户已经在Reddit上叫苦了:「我的提示词调得那么精确,出来的就是我想要的东西,现在全废了。」版权风险降下去了,一部分人的生产力也跟着降了——这大概就是AI写作工具绕不开的取舍。

  • Anthropic 15亿美元版权和解获批:作家拿到钱,AI公司却赢麻了

    一笔刷新版权史的天价赔偿

    上周一,美国一名联邦法官正式批准了 Anthropic 与一群作者、出版商达成的 15 亿美元(约 108 亿元人民币)和解协议。这是美国版权史上金额最大的一笔和解,覆盖大约 50 万部作品,平均每一部书赔 3000 美元。表面看,写书的人终于从 AI 公司手里讨到了一笔钱。

    但把这个案子拆开看,真正笑到最后的可能不是作家。这场官司的核心争议其实只有一句话:用受版权保护的书籍去训练 AI 模型,到底合不合法。

    主审的 Alsup 法官给出的回答是:训练本身属于「合理使用」(fair use),只有「偷书」这件事违法。

    也就是说,法院把「训练 AI」和「获取数据的方式」切成了两件事。Anthropic 建训练库时有两条路:一条是花钱买书自己扫描,这条路没问题;另一条是从 Library Genesis、Pirate Library Mirror 这类盗版站点直接下载,这条路被法官认定违法。Anthropic 愿意认栽赔钱,是为了避免盗版那部分真的上法庭——万一陪审团开出天文数字的赔偿,可比这 15 亿疼多了。

    作家为什么高兴不起来

    很多作者和创作者并不觉得这是一场胜利。原因很直接:判决确认了「用版权书训练 AI 算合理使用」这一点,等于给整个行业发了一张通行证。以后 Google、Meta、OpenAI、Midjourney 再被起诉,都可以拿这个判例当挡箭牌。

    更要命的是,Anthropic 选择和解而非上诉,意味着这个案子永远走不到上诉法院,也就没法变成一个有约束力的先例。其他法官在别的事实下,照样可以给出完全不同的结论——事实上,类似的官司正在四处开花。

    • 就在一周前,Hachette、Cengage、Elsevier 等出版商连同作家 Scott Turow,又把 Google 告上了法庭,指控后者用他们的版权作品训练 Gemini。
    • Meta、OpenAI、Midjourney 也各自背着一堆版权诉讼,案子一件没少。
    • 部分作者和出版商还选择退出了这次和解、单独起诉 Anthropic,认为每本书 3000 美元根本不够。

    AI 公司为什么不慌

    对 Anthropic 来说,15 亿美元看着吓人,但公司前不久刚又融了 130 亿美元。比起可能高达数百亿甚至上万亿的盗版侵权赔偿风险,这笔钱更像买个安稳。Anthropic 的总法律顾问也直言,这次和解恰恰证明了「用书籍训练 AI 属于合理使用」这一立场站得住脚。

    站在这个节点回看,这场和解更像是 AI 公司与内容创作者之间力量对比的一次公开亮相:模型需要数据,而数据快被扒光了,公司宁愿花钱摆平「怎么拿的数据」,也不愿让「能不能拿」成为问题。写作者拿到的是补偿,失去的却是对自己作品的控制权。

    Anthropic 的 Claude 形象
    图片来源:TechCrunch / Westend61 via Getty Images

  • Anthropic 15亿美元版权和解获批:AI训练「合理使用」第一案落槌

    Anthropic 的 Claude 形象
    Anthropic 这场版权和解,给整个行业留下了「训练算合理使用」的定性(图源:TechCrunch)

    上周末,一桩拖了快两年的官司终于画上句号。联邦法官批准了 Anthropic 拿出 15 亿美元,摆平那场由一群作家和图书出版商发起的集体版权诉讼。钱要开始发了,但这件事真正的看点不在钱,而在法官留下的那个判断。

    15 亿到底怎么分

    按照和解方案,大约 50 万部作品每部能拿到 3000 美元,在握有版权的作者和出版商之间分摊。这个数额被认为是美国版权史上最大的一笔和解金。不过,很多写作者并不觉得这是一场胜利,原因得看法院到底是怎么裁的。

    主审法官 Alsup 站在了 Anthropic 这一边:用受版权保护的文本去训练 AI 模型,算「合理使用」。这个判断被不少人视为整个 AI 行业的一个转折点。

    真正踩线的是「怎么拿的书」

    Alsup 虽然点了头,但他没把获取方式也一并放过。Anthropic 的训练书库有两个来源:一部分是买来纸质书自己扫描,这部分没问题;另一部分是直接从 Library Genesis、Pirate Library Mirror 这类盗版站下载,这部分被 Alsup 认定为非法。换句话说,训练本身合法,偷书不合法。

    正因为盗版下载这条单独成立,案子本来可能要上陪审团、赔多少由陪审团定。Anthropic 选择和解,把不确定的风险先掐灭。

    • 和解金约 15 亿美元,按每部作品 3000 美元、覆盖约 50 万部作品分摊。
    • 训练模型被认定为「合理使用」,但盗版下载被单独判定非法。
    • 判决仅为地区法院层级,不构成全国性先例,同类诉讼仍在多州推进。

    为什么作家们高兴不起来

    核心争议是以对 AI 公司有利的方式收尾的。法官认定训练属于合理使用,等于给整个行业发了张准生证。可对于辛苦写书的人而言,自己的作品被拿来喂模型、还只拿到每部 3000 美元,怎么看都不像赢。

    更重要的是,这个判决只是加州北区一个地区法院的决定。Anthropic 一和解,案子就不会上上诉法院,也就没法变成有约束力的先例。别的法官完全可以对别的事实给出别的结论——事实也正在发生。Google、Meta、Midjourney、OpenAI 眼下都还背着各自的版权官司。就在上周,Hachette、Cengage、Elsevier 等出版商加上作家 Scott Turow,又把 Google 告了,理由是 Gemini 拿他们的书训练。


  • Suno源代码泄露:AI音乐训练数据来自YouTube和Deezer抓取

    AI音乐生成与版权概念图
    AI 音乐生成的繁荣背后,训练数据来源正成为最敏感的命门

    AI 音乐生成平台 Suno 最近被掀了底。据 404 Media 报道、并经多家媒体确认,Suno 此前遭到黑客入侵,泄露出来的源代码把它的训练数据来源摊在了阳光下——那些被唱片公司告了又告的”未经授权抓取”,在代码里写得明明白白。

    黑客用的化名是 ellie.191,早在 2025 年 11 月就通过一次供应链攻击拿到了 Suno 员工的凭证,进而翻出了内部代码。泄露文件里有一组数字格外刺眼:一个叫 youtube_music 的文件夹里塞着超过 200 万段视频片段;从歌词网站 Genius 抓了超过 1.7 万小时歌词;从音乐流媒体 Deezer 抓了超过 1.2 万小时歌曲;就连 Shutterstock 旗下的素材库 Pond5,也被搬走了超过 6.2 万小时音频。

    更讽刺的是,Suno 的爬虫还带了一套筛选机制,专门把非音乐文件过滤掉,好让训练数据”更干净”。一边讲究数据质量,一边用着没授权的歌。

    用户的隐私,也没被漏掉

    泄露的不止是训练数据。黑客还碰到了部分用户资料:邮箱、电话号码,以及通过支付服务商 Stripe 处理的信用卡元数据。Suno 后来回应称,这起事件”主要涉及已不再使用的过时代码”,没有完整卡号泄露,按现行隐私法不需要逐个通知用户——但它 2025 年 11 月出事时,确实没有主动告知用户。

    这下,版权方手里的牌更硬了

    环球、索尼、华纳这几家唱片巨头早就以 RIAA 名义把 Suno 告上了法庭,指控它未经授权用受版权保护的音乐训练模型。Suno 一直用”合理使用”当挡箭牌,说公开网络上能拿到的音乐文件就能拿来训练。今年 5 月,唱片公司把诉讼里认定的侵权歌曲从最初宣称的 560 首,扩到了 6.1 万多首,法院也批了。这次泄露的抓取代码,等于给版权方递上了新证据。

    站在创作者一边的人声音更响。SZA 就说过,她怀疑自己一些还没发布的歌也被拿去用了;作曲人 Kenneth Blume 直接抨击,这是赤裸裸侵犯创作者的权利。有意思的是,Anthropic 和 Meta 去年夏天在一批作者提起的类似诉讼里赢了——同样的”合理使用”辩护,结果并不完全一样。

    • 对 Suno:诉讼阴影没散,反被添了实锤,后续授权谈判和合作关系都会更被动。
    • 对整个 AI 音乐行业:训练数据来源不透明,迟早会被扒出来,监管已在呼吁明确规则。
    • 对普通用户:你喂给 AI 平台的资料,平台自己都未必守得住。

    Suno 自己其实还在扩张,前不久刚完成 4 亿美元 D 轮、估值冲到 54 亿美元。但这次泄露说明,靠”公开网络就能随便抓”撑起来的增长,迟早要面对账单。AI 音乐能不能走得远,先把”歌是从哪来的”说清楚,大概是最基本的一课。

    📎 原文来源:Source Code Hack Reveals Suno’s AI Was Trained on Millions of YouTube Songs(CNET,综合 404 Media / TechCrunch 报道,2026-07-16)
  • 纽约时报等出版商要求制裁OpenAI:指控其隐瞒训练证据

    纽约时报与 OpenAI 版权诉讼概念图
    新闻业与 AI 公司的版权博弈(配图由 AI 生成)

    这起打了快三年的版权官司,这两天又升级了。纽约时报、每日新闻等多家媒体在 7 月 9 日向曼哈顿联邦法院提交了一份动议,要求法官对 OpenAI 处以制裁。理由很重:它们指控 OpenAI 在诉讼过程中隐瞒、甚至销毁了能说明 ChatGPT 怎么用新闻内容训练的证据。

    这份 52 页的文件写得很直白。出版商们说,OpenAI「选择了阻挠」——明明手里有训练数据集和 ChatGPT 的输出日志,却迟迟不交出来,而这些材料恰恰能显示 AI 系统到底怎么用了受版权保护的新闻内容。原告方要求法官就「证据开示不当」惩罚这家公司,理由是这种行为可能扭曲了整起案件的关键证据。

    「这份动议是请法院惩罚 OpenAI 隐藏并销毁证据,证明 ChatGPT 是怎么用偷来的新闻业内容训练出来的。」——每日新闻代理律师 Steven Lieberman

    「两年都在做不实陈述」

    出版商这边的核心指控是:OpenAI 两年来一直「做不实陈述」,说自己没法在训练数据集和日志里检索受版权保护的内容。这个说辞是直到今年 2 月,OpenAI 隐私工程负责人 Vinnie Monaco 第二次作证时才被戳破的——证词显示,OpenAI 其实早就已经检索过训练数据集和输出数据,和公司最初的表态完全矛盾。原告还指控 OpenAI 删除了部分日志,这违反了法院的证据保全命令。

    纽约时报的主辩律师、Susman Godfrey 律师事务所的 Crosby 说得更不客气:「OpenAI 对纽约时报、每日新闻的原告方、公众和法庭都撒了谎。它声称检索 ChatGPT 输出里有没有我们的内容,是做不到、太麻烦、又侵犯用户隐私的——可同时它又藏着不说,自己早就这么干过了。」

    OpenAI 的回击:我们在保护用户隐私

    OpenAI 没有认下这些指控。公司发言人 Drew Pusateri 把这形容为原告在案件走弱之后的纠缠:「随着时报的案子变弱、还被迫撤回了对我们的部分索赔,他们仍在坚持侵犯与本案无关的人的隐私,包括用这些明显虚假的指控。」他强调,OpenAI 会继续捍卫用户隐私,以及「合理使用」(fair use)这条早就立住的法律原则。

    这里头的张力很清楚:出版商想要看训练数据,OpenAI 说那会泄露用户隐私。而「合理使用」正是整场官司的命门——OpenAI 和一大批科技公司都主张,拿网上的书、文章去训练 AI 受版权法里的「合理使用」保护,这个理论正在几十起诉讼里被反复检验,结果好坏参半。


    这场拉锯的代价不低。纽约时报光是在和 AI 公司打官司上就已经花了超过 2800 万美元,光今年第一季度就烧了 420 万。有意思的是,一边在法庭上互撕,一边又有越来越多媒体跟 OpenAI、谷歌、Meta 签了授权协议——通常是收一笔钱,换对方用自己的新闻库训练 AI。新闻业正卡在一个尴尬的位置:既想守住自己的内容,又舍不得 AI 带来的那张支票。这场制裁之争不管怎么判,都很可能给整个行业的未来定调。

  • Midjourney跟好莱坞撕破脸了:你们自己用AI的事,凭什么不公开?

    Midjourney这回在法庭上摆明了态度——它要求迪士尼、环球、华纳兄弟这三家起诉自己的好莱坞片商,把自家是怎么用AI的统统交代出来。

    Midjourney与好莱坞AI版权诉讼
    Midjourney与好莱坞片商之间的AI版权诉讼持续升温

    诉讼打到证据开示阶段

    这事还得从去年说起。迪士尼和环球率先把Midjourney告了,理由是这家AI公司的图像生成模型能画出巴特·辛普森和达斯·维达这些角色,而它们偏偏是片商的版权财产。几个月后,华纳兄弟也加入了原告阵容。

    Midjourney的立场很明确:用包含版权角色的图片训练AI模型,这属于合理使用。

    现在的争议焦点在于”证据开示”(discovery)阶段片商要交出哪些材料。法官之前裁定,片商只需提供那些产出了”面向消费者”的视频和图像的AI使用信息。Midjourney觉得这不够,在最新的法庭文件中要求推翻这个限制。

    他们的理由是:这等于让片商”不公平地”只挑选那些支持自己”市场损害”主张的文件,而Midjourney却拿不到能支撑自己抗辩的证据。

    双重标准的指控

    Midjourney的律师写得相当直白——片商扣下的那些文件,恰恰可能揭示它们私下里正在做跟Midjourney被起诉的一模一样的事。

    举个例子,如果片商自己在开发用于故事板制作或影视内容构思的图像生成AI模型,”这类证据同样能证明,即便是片商自己,也把下载未经授权的版权内容并用于AI训练当作行业惯例。”

    Midjourney还提出,片商应该把它们在Midjourney中输入过的所有提示词以及生成的输出都交出来,而不只是那些据说侵权的提示词和输出。

    片商方面的代理律师David Singer此前把Midjourney的这个要求称作”钓鱼执法”(fishing expedition)。他还说过,片商”不是要阻止AI技术,更不是要搞垮Midjourney的生意”,只是想让Midjourney别再抄他们的电影和电视剧,别再在未经授权的情况下分发、公开展示、公开表演和制作包含它们知名角色的商品。


    这场官司的意义

    这场官司的走向,很大程度上会影响AI生成内容与版权法之间的边界怎么划。如果Midjourney赢了,好莱坞片商的AI使用情况将被公之于众,这可能会成为一场非常大的丑闻。如果片商赢了,Midjourney面临的版权赔偿可能高达数十亿美元。

    不管结果如何,这件事已经把AI行业和创意产业之间的紧张关系摆到了台面上。类似的诉讼在美国还在不断增加,AI公司们都在盯着这个案子的进展。

  • 出版商想拦AI爬虫却不敢拦Google:这场猫鼠游戏越来越难玩了

    出版商想拦AI爬虫却不敢拦Google:这场猫鼠游戏越来越难玩了

    内容出版商和AI公司之间的张力,最近在法国戛纳的一个舞台上爆发了。People Inc.(前身Dotdash Meredith)的CEO Neil Vogel在Cannes Lions创意节上公开指责Google”滥用市场力量”——理由很简单,也很棘手:Google用同一个爬虫程序同时做搜索索引和AI训练数据采集,出版商根本没法单独屏蔽AI训练而不失去搜索流量。

    这不是一个小问题。People Inc.是美国最大的出版商之一,旗下有《People》、《InStyle》等知名刊物。Vogel在Axios的访谈中说得很直白:”我们实际上没法屏蔽Google,因为Google用同一个爬虫做搜索和AI,这是对市场力量的极度滥用。”

    “我们很想跟他们达成建设性的合作,但大概率会走向对抗,而不是合作。”—— Neil Vogel, People Inc. CEO

    搜索流量 vs AI训练:出版商的两难

    这件事的核心矛盾在于:搜索流量对出版商来说是流量变现的核心渠道,而AI训练需要抓取同样的内容。如果出版商想保护自己的内容不被用于AI训练,技术上可以屏蔽AI爬虫,但一旦屏蔽Google的爬虫,搜索排名就会受影响。

    出版商与Google AI爬虫
    内容出版商正在与Google就AI爬虫问题展开博弈

    其他AI公司就没这个问题。Vogel透露,People Inc.已经跟Meta、OpenAI和微软签署了AI内容授权协议。这些公司的爬虫是可以单独屏蔽或授权的。但Google不行——它的爬虫是”一鱼两吃”。

    Google的回应:你可以选择退出

    Google对Vogel的指责给出了回应:出版商可以通过”Google-Extended”来控制自己的内容是否被用于训练Gemini模型,而这不会影响搜索索引。

    但这个回应没解决根本问题。Vogel的抱怨是:出版商”不得不”让Google爬虫访问,因为搜索流量太重要了。

    Cloudflare的”许可模式”

    People Inc.是第一批加入Cloudflare”AI爬虫许可模式”的出版商之一。这个模式的思路是:默认屏蔽所有AI爬虫,只有付费授权的公司才能访问。Vogel说,这个模式上线后,”所有人立刻都急了”。

    Vogel说:”AI需要三样东西:模型、算力、输入——而出版商掌握着输入。稀缺性是关键。”


    📎 原文来源:The Verge | Axios
  • 出版巨头People Inc.放话要和Google打一架,导火索是AI爬虫

    AI爬虫这件事,终于有人准备跟Google正面刚了。出版集团People Inc.(就是原来那个Dotdash Meredith)的CEO Neil Vogel这周在Axios的采访里说的挺直白:”我们很愿意跟他们一起做点有建设性的事,但大概率最后还是要走向对抗,而不是合作。”

    People Inc.与Google AI爬虫对抗概念图
    出版巨头People Inc.准备与Google就AI爬虫问题正面对抗

    有 licensed 的,也有野生爬虫

    Vogel在采访里把话挑明了说。People Inc.已经跟Meta、OpenAI和微软签了AI内容授权协议——这些公司要用来训练模型的内容,是付了钱的。但对于其他那些没有授权、直接上来爬的AI爬虫,People Inc.的做法是:封。

    问题出在Google身上。Google的AI爬虫用的跟Google搜索爬虫是同一个身份,这意味着如果你封了Google的爬虫,你的网站在Google搜索里也就消失了。对于一家靠搜索流量吃饭的媒体集团来说,这等于是被拿捏住了命门。

    “我们很愿意跟他们一起做点有建设性的事,但大概率最后还是要走向对抗,而不是合作。”——Neil Vogel,People Inc. CEO

    Google的垄断地位成了挡箭牌

    这件事的本质,是Google在搜索市场的垄断地位给了它一种别人没有的特权:其他AI公司要爬你的内容,你可以说”不”;但Google要爬,你很难说”不”,因为代价是失去搜索流量。

    Vogel没有细说具体准备怎么跟Google对抗,但业界普遍猜测可能的路径包括:推动立法要求AI爬虫必须获得明确授权、联合其他出版商发起行业抗议、或者在欧盟走反垄断投诉路线(欧盟对Google的 antitrust 案底可比美国厚多了)。

    这事儿不止关乎一家公司

    People Inc.的这个表态,其实是整个出版行业跟AI公司博弈的一个缩影。过去两年,已经有将近400家地方报纸联合起诉了OpenAI和微软,指控它们未经许可爬取内容训练模型。纽约时报的案子到现在还没打完。现在Vogel放话要跟Google对抗,等于是把战场从”训练时的版权问题”扩展到了”实时爬虫的授权问题”。

    有意思的是,Google并不是唯一一个让出版商头疼的。Anthropic的Claude也被发现爬取了大量网站内容,只是它不像Google那样掌握着搜索入口,所以出版商还有谈判的筹码。

    这场对抗最后怎么收场,现在还不好说。但Vogel愿意公开把话挑明,至少说明出版商这边已经不想再忍了。接下来几个月,估计会有更多媒体集团跟进表态——毕竟,如果内容创作者的利益一直被无视,这场AI狂欢的代价,最后还是整个社会来付。


  • Cate Blanchett联手好莱坞巨星,建了个对抗AI深伪的人类登记处

    AI换脸、AI配音这几年越来越猖獗,普通人防不胜防。今天,一个由Cate Blanchett联合创立的非营利组织RSL Media正式上线了一个新工具——”人类同意登记处”(Human Consent Registry),让每个人可以自己设定:AI能不能用我的脸、我的声音、我的作品。

    人类同意登记处概念图
    “人类同意登记处”上线,对抗AI未经授权使用个人肖像(图源:RSL Media)

    好莱坞集体出手了

    这个登记处的背景很硬。除了Cate Blanchett,支持者还包括George Clooney、Tom Hanks、Meryl Streep、Viola Davis、Kristen Stewart、Steven Soderbergh等一众好莱坞重量级人物。创意艺术家 agency(CAA)和音乐艺术家联盟也都在背后支持。

    它的运作逻辑其实不复杂:每个人可以在登记处注册自己的身份信息,设定AI使用自己肖像、声音、姓名等属性的条款——可以允许、可以有条件允许(比如要求付费授权)、也可以直接禁止。AI公司在抓取和使用这些数据之前,先查登记处,就知道能不能用了。

    RSL Media联合创始人Eckart Walther说,AI系统可以通过网站的robots.txt页面发现这个登记处,就像现在网站告诉搜索引擎能不能抓取内容一样。但这个标准不是针对某个URL的内容,而是针对”作品、身份、角色或标识本身”,无论它出现在哪里。

    技术上怎么落地

    这个想法其实去年就已经有雏形了。当时推出的是”Really Simple Licensing(RSL)标准”,主要面向网站内容,告诉AI爬虫能不能抓取。这次的”人类同意标准”(Human Consent Standard)是把类似逻辑扩展到了个人身份和创作作品层面。

    技术实现上,AI系统需要主动去查询登记处的数据。这依赖的是行业的自愿遵守——就像robots.txt依赖搜索引擎的自愿遵守一样。如果AI公司选择无视,这个登记处也没有法律强制力。

    但好莱坞的背书让这件事有了不一样的分量。当George Clooney和Tom Hanks这样的明星公开支持,AI公司要无视这个标准,面临的舆论压力会相当大。

    普通人能用吗

    登记处今天正式上线,理论上任何人都可以去注册。设定自己肖像和作品的使用条款,不需要是好莱坞明星。这对普通人来说,至少是多了一层保护——哪怕没有法律强制力,但有了明确的”我不同意”的记录。

    当然,这个工具能不能真正起作用,关键还是看AI公司买不买账。目前还没有看到主要的AI公司(OpenAI、Google、Meta等)公开表态支持这个标准。但好莱坞的集体行动,至少让这件事进入了公众视野。


  • OpenAI给ChatGPT买了一张”合法身份证”:和Getty Images的合作,不止是几张图片的事

    一张照片的授权费,OpenAI替AI行业交了

    上周OpenAI和Getty Images悄无声息地签了一纸协议,内容是:ChatGPT以后在回答问题和搜索结果里,可以直接展示Getty Images的授权图片。这不是一句公关废话,背后是AI公司和版权方长达三年的对峙终于换了一种玩法。

    Getty Images不是小角色。它手里握着近6亿张图片的版权,是全球最大的专业图库之一。2023年,Getty以”未经授权使用版权图片训练模型”为由,把Stability AI告上了法庭,索赔金额高达1.8万亿美元。那场官司到现在还没打完,但整个AI行业都看清了一件事:训练数据从哪儿来,以后会越来越是个问题。

    ChatGPT与Getty Images合作
    OpenAI与Getty Images达成多年授权合作,ChatGPT将展示正版图片|插图

    Perplexity先走了一步,OpenAI跟上了

    其实在这之前,Getty Images已经和另一家AI公司做过类似的事。今年早些时候,Perplexity宣布在搜索结果里嵌入Getty Images的授权图片,用户搜到的每一张图都是”干净”的,有授权、有来源。当时不少人觉得Perplexity是在借Getty的品牌背书,让自己和那些”随便抓图训练”的AI公司区别开来。

    现在OpenAI也跟进了。ChatGPT的搜索功能每天都在和Google、Perplexity抢用户,如果搜出来的图片一半是侵权风险、一半是来历不明,用户迟早会用脚投票。与其等法院判,不如先自己把路铺好。

    这次合作的核心逻辑很简单:AI公司付钱买授权,版权方拿到一笔稳定的”AI时代版税”,用户用到的图片有来源可查。三方各退一步,换一个都能接受的局面。

    AI训练数据的”原罪”,正在被悄悄洗掉

    过去两年,AI公司和版权方的关系基本是”你告我、我继续用”。Stable Diffusion、Midjourney、ChatGPT的图像生成能力,很大程度上建立在”互联网上所有图片我都能用”的假设上。这个假设现在越来越站不住脚了。

    欧盟的《AI法案》已经要求AI公司披露训练数据来源。美国法院的判决也在往版权方倾斜。上个月,一名联邦法官裁定AI公司使用版权内容进行训练不一定属于”合理使用”(fair use),这个判决对整个行业都是一记警钟。

    OpenAI选择和Getty Images合作,某种程度上是在给整个行业探路。如果这条路走得通,其他AI公司大概率也会跟进——毕竟,没人想成为那个”坚持不付钱然后被告到破产”的典型。

    用户感知不强,但影响深远

    对普通ChatGPT用户来说,这个变化可能不太明显。以前搜”埃菲尔铁塔”出来的图片是哪儿来的,大多数人不会去点开看。以后这些图片会带上Getty Images的水印或来源标注,仅此而已。

    但往大了说,这是AI行业从”野蛮生长”向”合规化”转型的一个缩影。训练数据、生成内容、版权归属——这些问题在过去是可以”先做了再说”的灰色地带,现在正在一个个被摆到台面上来解决。

    Getty Images首席执行官Craig Peters在公告里说了一句话,挺值得玩味的:”我们要确保AI的发展不会以牺牲创作者的权益为代价。”这话听起来像公关辞令,但仔细想想,如果创作者真的从AI的每一张生成图片里都拿不到一分钱,谁还愿意往互联网上传原创内容?那样的话,AI训练数据枯竭也不是不可能。


    OpenAI和Getty Images的这笔交易,金额没披露,期限说是”多年”。可以预见的是,接下来会有更多类似的授权协议冒出来。AI公司掏钱买安心,版权方拿到新的收入来源,这大概是眼下能想到的、最不坏的一种结局。