标签: 内容审核

  • Reddit 给版主配了 AI 助手:关键词过滤时代要翻篇

    Reddit 最近给版主们发了个新工具,名字叫 Rules Hub。说白了,就是让大语言模型替人工版主去判断一条帖子或评论是不是踩了版规——不是死板地看有没有某个词,而是去理解这句话的“意思”到底违不违规。

    这事放在 Reddit 十几年的历史上挺关键。过去版主靠的是 Automoderator(大家都叫它 Automod),那套东西本质上是关键词和正则匹配:你写一条规则“标题里出现某某词就删”,它才动。规则一多,配置文件就成了只有两三个人看得懂的天书,换人就断档。

    从“匹配词”到“理解意图”

    Rules Hub 的逻辑不一样。Reddit 在博客里写,它用 LLM 去评估“一条内容是否符合某条规则的本意”,这样就能处理那些模棱两可、带口语、踩在边缘的情况,同时把最终决定权留在版主手里。版主可以自己设哪些规则自动执行、触发后怎么办,AI 只做“判断”这一环。

    “It’s also hard to learn, hard to maintain, and heavily dependent on brittle keyword matching, regex, and inherited configurations that only a few people on a mod team, if any, understand. We can do better.” —— Steve Huffman,Reddit CEO

    这个新工具已经悄悄测了几个月,拉了 700 多个社区的新老版主进来试,包括 Reddit 版主委员会的人。现在它开始向“所有新建社区”放开,预计到 2026 年晚些时候全面铺开。对新社区来说是可选的,但 Reddit 话里话外的意思很清楚:Automod 那套执行功能,迟早要被 Rules Hub 以及配套的“发帖评论引导”“安全过滤器”替掉。


    同一天 Reddit 还甩出了更大的一揽子变动,矛头指向第三方开发者和老 Reddit。以后新的第三方 App 不能再走公开 API,得搬到 Reddit 自家的开发者平台上跑。Huffman 的理由很直接:公开 API 当初不是为今天的规模、自动化滥用和商用抓取设计的,他们想要好用的机器人,但不想要有人把整个论坛 indiscriminately 扒走、转卖、不负责任地用。

    老 Reddit 也要动刀

    为了堵住内容被乱抓,Reddit 对老版界面(old Reddit)也要下手了。这之前他们已经干过不少事:屏蔽不付钱的搜索引擎、起诉 Anthropic 和 Perplexity、封掉互联网档案馆的抓取。六月起用老 Reddit 还得先登录。具体怎么改 Huffman 没明说,只说在“探索不同选项”,短期会先限制登录用户访问、把关键机器人和版主流程迁走。

    • Rules Hub 用 LLM 判违规意图,取代 Automod 的关键词硬匹配
    • 已测 700+ 社区,新社区先可选,2026 年内全面开放
    • 第三方 App 将强制迁到 Reddit 开发者平台,老 Reddit 限制登录

    Huffman 也知道用户对这类改动有心理阴影——2023 年那轮 API 收费闹出过大规模抗议,一堆熟面孔 App 因此关张。所以他这次特意说了“信任我们不够,得在实践里真的更好用才行”,承诺不会在靠谱替代出来之前就砍掉主要功能。话是这么讲,Reddit 想把治理和抓取都收进自家院子的方向,已经没有回头路了。

    Reddit 引入 AI 版主工具 Rules Hub(图源:The Verge)
    Reddit 引入 AI 版主工具 Rules Hub(图源:The Verge)
  • Reddit成AI SEO新战场,版主开始围剿软广机器人

    Reddit 上的品牌软广正被 AI 批量制造
    Reddit 上的品牌软广,正被 AI 批量制造(图源:The Verge)

    一个护肤版块的”真人推荐”翻车了

    今年早些时候,一个护肤爱好者论坛里有人问大家试没试过某款次氯酸喷雾。底下几十条回复里,有个叫 Primary-Taro4254 的账号说得挺实在:自己没试过那个牌子,但一直在用 Honeydew Labs 的类似喷雾,感觉不错,还顺手补了一句这个牌子浓度 0.02%、拿到了湿疹协会的认可。乍一看,就是个热心网友。

    可有人较真去翻了翻他的主页,发现这位”热心网友”对 Honeydew Labs 的爱有点过头——他不只在一条帖子里夸,在好几个毫不相关的产品讨论里都冒出来安利同一款喷雾,还跨了好几个护肤子版块。在一个有着上百万周活用户的版块里,很快有网友发帖提醒大家:当心,这大概率是营销机器人。

    “提醒一下大家,注意 Honeydew Labs 的次氯酸产品,那大概率是营销机器人。”——被网友识破后,r/SkincareAddiction 里的警示帖

    品牌为什么盯上了 Reddit 的评论区

    这件事小的方面是个别品牌的骚操作,大的方面却和 AI 搜索有关。过去一年,Google 的 AI Overview、ChatGPT 这类工具在回答问题时,大量直接引用 Reddit 里的讨论。Reddit 的群众智慧和真实语气,恰恰是 AI 答案最爱抓的内容。

    这就导致一个变化:在 Reddit 上被提及,不再只是社区荣誉,而是能左右 AI 搜索结果的新资产。品牌方很快发现,只要让”真实用户”在相关版块铺一些体验帖,就有机会被 AI 搜索引擎当成答案喂给用户——等于用接近零的成本,做了一轮精准广告。

    版主靠什么揪出机器人

    Reddit 的版主大多是志愿者,他们没有算法黑盒,靠的是最朴素的人肉模式识别。

    • 同一个账号跨版块、跨话题只推一个产品,话术还出奇一致;
    • 推荐的”专业细节”过于工整,像提前写好的卖点而非随口分享;
    • 在不同产品的帖子里插入同一段体验,语境对不上。

    这次 Honeydew Labs 的账号就是栽在”太专一”上——真人很少会对一款喷雾爱到逢帖必提。


    这股风气不会只停在一个版块

    真正值得警惕的,是 AI 把”水军”的成本压到了地板。过去养一批人写软文要花钱,现在用模型批量生成看似真人的评论,边际成本几乎为零。一种叫 GEO(生成式引擎优化)的新行当正在冒头:品牌不再只优化搜索引擎的排名,而是想办法让自己想推的内容,出现在 AI 给用户的答案里。论坛、问答区、商品评论,全成了新的投放位。

    Reddit 眼下还能靠社区自治勉强挡一挡,可一旦规模上来,靠志愿者肉眼识别注定跟不上。更深的难题是:当内容既能由 AI 生成、又能被 AI 搜索引用,”这条评论到底是不是人写的”这个问题,平台、品牌和用户三方都很难自证。信任的锚点,正在从”谁说的”滑向”能不能溯源”。

  • 领英上线“这看着像AI垃圾”按钮,让用户亲手举报满屏水文

    刷领英的人这两年应该都有同感:动态里的帖子越来越像一个人写的。开头必是一句反问,中间三段排比,结尾再来一句”你怎么看?”——那股塑料味的职场感悟,八成不是人敲出来的。现在领英终于承认这事儿了,而且给了用户一个出气口:看到疑似AI灌水的帖子,直接点一个”这看着像AI垃圾”的按钮。

    领英 LinkedIn 应用界面
    领英上线”Seems like AI slop”举报按钮(图片来源:TechCrunch / Getty Images)

    把判断权交回给刷动态的人

    这个功能是周四官宣的。逻辑很朴素:机器分不清的东西,人一眼就能看出来。你读到一篇八股味浓得化不开的”深度思考”,点一下按钮,这条信号就进了领英的模型训练池。

    领英首席产品官 Hari Srinivasan 自己在领英上发帖说这事,措辞相当直白,没有那种打太极的公关腔。

    “AI 垃圾内容是我们所有人的头号优先事项,我们是真的在意这件事。人们来领英,是想跟真实的人建立连接、分享真实的观点、想法和专业经验。”

    不只是多了个按钮

    举报键只是摆在明面上的那一层。Srinivasan 透露的几组数字,说明后台的仗打得更凶:领英现在每天要拦掉”数十万次”自动化评论尝试,过去两个月里拦下的各类自动化行为则是数百万次。

    配套动作还有几项:

    • 新增分类器,专门识别AI水文和其他低质内容,重点压制”推荐给你”里那些来自陌生人的帖子;
    • 如果系统判断你的帖子因为AI味太重显得不真诚,会在你自己的后台悄悄提示你——不公开挂人,算是留了面子;
    • 扩大个人主页和企业主页的认证入口;
    • 新增屏蔽企业号评论的选项,不想看的公司可以直接静音。

    那条私下提示的设计其实挺聪明。领英区分了两种人:一种是拿AI润色自己想法的,另一种是整篇甩给模型生成的。前者只是需要提醒收一收腔调,后者才是要治的病。

    连自己的AI写作功能都撤了

    最值得玩味的一步在这里:领英把自家那个”优化你的帖子”功能下线了。这个功能当初就是用AI帮你改写文案的,现在换成了一个只做校对的工具——改错别字和语法,但不动你说话的调调。

    平台一边推AI写作助手,一边抱怨满屏都是AI味,这个循环本来就闭不上。领英至少认了这笔账。


    整个互联网都在跟水文较劲

    领英不是孤例。上周 Substack 刚上线了一个工具,跟检测公司 Pangram 合作,直接告诉读者眼前这篇newsletter是不是AI写的;Pangram 本周宣布拿了900万美元新融资,就靠替互联网做AI内容检测这门生意。更惨的是 Digg——今年3月它那个对标 Reddit 的产品直接关停,官方说法是机器人多到管不过来。

    Cloudflare 给出的判断更狠:网络上的机器人流量已经超过了人类发出的请求,而且这个临界点来得比他们自己预测的还早。

    所以领英这个按钮,与其说是个产品功能,不如说是一次公开表态:内容平台开始意识到,真人写的东西正在变成稀缺品。至于用户举报能不能真的把水文按下去,还得看那套分类器有多少斤两——毕竟”读起来像AI”和”确实是AI”,中间隔着不小的误伤空间。

  • 领英上线“这看着像AI水文”按钮,顺手把自家的AI润色功能砍了

    刷领英的时候有没有那种感觉:一条帖子读下来结构工整、金句频出、每段都以一个反问收尾,但你合上手机之后完全想不起来它说了啥。领英自己也受不了了。周四它宣布上线一个新按钮,看到疑似 AI 生成的帖子,你可以点一下”看着像 AI 水文”。

    LinkedIn 领英应用界面
    领英正试图清理信息流里泛滥的 AI 生成内容|图:Nikolas Kokovlis / NurPhoto / Getty Images

    平台终于承认信息流被灌满了

    领英首席产品官 Hari Srinivasan 把话说得很直接:AI 水文是我们所有人的头号优先事项,我们真的很在意这件事。人们来领英是为了跟真实的人建立联系,分享真实的观点、想法和专业经验。

    人们来领英是为了跟真实的人建立联系,而不是读一堆机器批量生产的正确废话。——领英首席产品官 Hari Srinivasan

    这话从一家微软旗下的社交网络嘴里说出来,多少有点自我拆台的味道,毕竟微软是全球最积极推销 AI 写作工具的公司之一。但产品经理们显然算清了一笔账:如果信息流里全是机器写的东西,真人就没有留下来的理由。

    那个按钮不只是让你出气

    点击”看着像 AI 水文”并不是简单地把帖子举报掉。领英同时上了几套组合拳。它在训练新的分类器,专门识别 AI 水文和其他低质内容,被判定为水文的帖子会在”你可能感兴趣”这类站外推荐里被降权。用户点的那个按钮,正好给分类器提供人工标注信号,用来持续调模型。

    自动化防御那边的数字也放出来了:领英现在每天拦截数十万次自动化评论尝试,过去两个月还拦下了数百万次其他自动化操作。也就是说,问题的规模远比普通用户在信息流里看到的严重。

    写手会收到一条私下的提醒

    比较有意思的是另一项设计:领英会在用户自己的后台里私下提示——别人觉得你的内容因为 AI 味太重而显得不真诚。注意是私下,不是公开打标。领英的判断是,很多人只是用 AI 帮忙润色自己的想法,并非批量生产垃圾,给个提醒能让他们把文字改回人话,而不是直接把人赶走。

    更狠的一刀砍在自己身上。领英把此前那个用 AI 帮你写帖子的”增强你的帖子”功能下线了,换成一个只做校对、不改变语气的功能。一家平台主动关掉自己的 AI 写作入口,这个信号比任何按钮都清楚。

    整个互联网都在做同一件事

    领英不是孤例。上周 Newsletter 平台 Substack 上线了标识 AI 写作的工具,背后合作方是 Pangram;这家做 AI 内容检测的公司本周刚拿到 900 万美元新融资。再往前,Digg 在三月直接关停了它对标 Reddit 的应用,理由是搞不定涌进来的机器人。

    Cloudflare 给出的数据更能说明趋势:网络上的机器人流量已经超过了真人产生的请求,而且这个临界点比它此前的预测来得更早。

    本次更新的要点

    • 新增”看着像 AI 水文”按钮,用户反馈将用于训练识别模型
    • 新分类器降低低质 AI 内容在站外推荐中的曝光
    • 每日拦截数十万次自动化评论尝试
    • 在个人后台私下提示”内容显得不够真实”,引导作者改进
    • 下线 AI 代写功能,改为只做校对不改语气
    • 扩大主页与公司页认证范围,可屏蔽指定公司页的评论

    说到底,这套动作的核心不是反对 AI,而是重新给”真实”定价。当生成一千字的成本趋近于零,稀缺的就变成了有人味、有具体经验、有立场的表达。领英把 AI 代写按钮换成校对按钮,其实是在提醒所有用户一件事:内容值钱的部分,从来不是文字本身。

  • Discord 的 AI 审核翻车:8000 多人因为一张棋盘图被封号

    Discord 应用图标
    Discord 的自动安全系统误判无害图片,导致超 8000 个账号被封(图源:TechCrunch)

    你只是往 Discord 上传了一张棋盘截图,或者游戏贴图,甚至是一张带方格的透明背景图,账号就突然没了。过去两个月,超过 8000 名用户经历了这种事——而锅不在他们,在 Discord 的 AI 审核系统出了 bug。

    一张棋盘图引发的误封

    Discord 已经承认,从今年 5 月起,它的自动安全系统把一批完全无害的图片误判成了有害内容:电子表格、棋盘、游戏纹理,还有白底和灰底的透明背景,统统中招。光是上周末,又有 200 个账号被误封。公司说问题已经修好,受影响账号正在陆续恢复。

    “我们的系统会把内容与已知有害材料做匹配,这种相似匹配可能产生误报,所以按设计,理应有信任与安全团队的人工复核再采取行动。”——Discord 官方说明

    Discord 在 X 上解释过这套机制:系统会把用户上传的内容,跟已知有害材料的数据库做相似度匹配,初衷是抓非法内容。问题出在流程的最后一环——一个 bug 让系统跳过了人工复核,直接把账号给封了。换句话说,本该”先审核、后处罚”的设计,被这个漏洞绕了过去。

    用户为什么这么愤怒

    不少人在 X 和 Reddit 上吐槽,自己只是传了张带方格图案的图就被永久封禁。有人怀疑,Discord 的审核模型对方格图案特别敏感,因为这些图案以前常被人拿来遮挡、伪装违规内容,系统学”歪”了。对把 Discord 当工作沟通、游戏社群或远距离社交主阵地的用户来说,这种无差别封号代价不小。

    • 一个游戏制作人说,自己靠它联系所有合作方,账号没了等于断了线;
    • 误判发生时,用户先被扣上最严重的安全帽子、先被踢出门,事后才轮到申诉;
    • 自动化审核一旦出错,替你背锅的是成千上万个真实的人。

    Discord 不是孤例。去年 Instagram、Facebook 群组就出现过大规模莫名封号,很多人怀疑是 AI 审核的锅,但 Meta 从没公开认过。Tumblr 也挨过类似骂。现在 Meta 的监督委员会正在逼平台提高透明度。


    最扎心的不是 bug,是代价结构

    这件事最让人不舒服的地方,在于它的代价分配:误判发生时,用户先被定罪、先被踢出,申诉是后面的事。在信任与安全这件事上,流程往往和算法一样重要。AI 初审加人工复核的混合模式喊了很久,但 Discord 这跤说明,只要中间任何一环断了,受伤的就是普通用户。把误报率当成硬指标公开,可能比事后修 bug 更有意义。

  • Discord 的 AI 审核翻车了:你发张棋盘图,账号可能就没了

    Discord AI 审核误封概念图
    Discord AI 审核误封用户事件(配图由 AI 生成)

    Discord 最近承认了一件事:它家 AI 审核系统出了 bug,过去两个月里误封了超过 8000 个用户。原因听着有点离谱——有人只是上传了电子表格、棋盘、游戏贴图,或者白底灰底的透明背景图,就被系统当成有害内容给判了「死刑」。

    这个 bug 从今年 5 月就开始影响账号了,上周末又额外误封了 200 人,直到 Discord 的团队发现并修好。现在所有受影响账号正在陆续恢复。

    它到底怎么判的

    Discord 在 X 上发长文解释,说它的自动安全系统会把用户上传的内容,跟一批已知的「有害材料」数据库做比对。设计初衷是抓非法内容,但系统偶尔会「误报」。本来按流程还有人工复核这一关,可这个 bug 让系统跳过了人审、直接把账号封了。Discord 自己也说,正在做更好的防护,保证这类事不再发生。

    方格图案成了「原罪」

    在 X 和 Reddit 上,不少用户吐槽自己只是传了张带方格网格的图就被永久封号。有人推测,Discord 的 AI 审核对网格状图案特别敏感——因为过去确实有人用网格来遮挡、伪装不良内容,好躲过自动检测。结果这套「宁可错杀」的逻辑,把一堆无辜的棋盘和表格一起误伤了。

    「因为一个这么不公平的理由丢掉 Discord 账号,可能极其毁灭性,每天都有上百万用户被 AI 误封,这必须停下来。」一位用户在 X 上写道。

    对很多用户来说,Discord 不是随便玩玩的聊天室,而是工作协作、游戏社群、远距离社交的据点。账号一封,连带着的社群关系全断。靠自动判定就永久封号,代价远比想象中大。

    翻车的又不止它一个

    Discord 不是第一个栽在自动审核上的。去年 Instagram、Facebook 群组都出现过大规模、原因不明的账号封禁,很多人怀疑是 AI 审核的锅,只是 Meta 从没公开认过账;Tumblr 也发生过类似的内容过滤误伤。如今 Meta 的监督委员会还在呼吁提高封号透明度。AI 帮平台扛起了海量内容审核的担子,可一旦误报,挨打的永远是真实用户。


  • Meta监督委员会发话了:AI生成的色情化视频,不能说不自愿就不删





    Meta监督委员会发话了:AI生成的色情化视频,不能说不自愿就不删

    Meta监督委员会发话了:AI生成的色情化视频,不能说不自愿就不删

    来源:The Verge · 2026年6月23日

    Meta监督委员会与AI内容审核
    AI生成内容的内容审核,正成为社交平台最棘手的问题之一|示意图

    6月23日,Meta的监督委员会(Oversight Board)公开要求Meta下架一段在Instagram上流传的”AI生成色情化视频”——视频中的女性并非公众人物,但她的形象被AI篡改成了性化内容。

    这本来不是什么新鲜事。Deepfake色情内容在互联网上已经泛滥了多年。但这次值得关注的是Meta的第一次回应——以及监督委员会为什么忍不了。

    Meta第一次说”不违规”

    事情发生后,有人向Meta举报这段视频,认为它违反了平台关于非自愿性化内容(NCII)的规定。Meta的审核系统看了一眼,得出的结论是:没有迹象表明这段内容是”非自愿的”,所以不用删。

    这个判断听起来很荒谬——视频本身就是AI生成的,对象是一个普通女性,她根本没有”自愿”参与拍摄的可能性。但Meta的审核逻辑是:除非有明确证据表明确实是非自愿的,否则不认定为违规。

    监督委员会直接否定了这个逻辑。他们在声明中写道:AI生成的对他人的冒名内容,应当”默认被视为非自愿”。换句话说,平台不能要求受害者来证明自己”没有同意”——因为AI生成的内容,本质上就不存在”同意”这个前提。

    “AI生成的冒名内容应当被默认判定为非自愿内容。”——Meta监督委员会

    非公众人物的”保护真空”

    这次事件的受害者不是名人。她没有庞大的粉丝群体帮她发声,也没有公关团队帮她向平台施压。她只是一个普通用户,突然发现自己的脸出现在了一段她从未参与过的性化视频里。

    监督委员会特别指出了这个问题:现有的内容审核机制,对公众人物和非公众人物的保护是不对等的。名人发的深伪色情内容确实也会被处理,但往往是因为涉及”露骨内容”或”骚扰”,而不是因为”未经同意”。而对于普通人来说,这种内容造成的伤害可能更大——她们没有应对机制,也没有话语权。

    委员会的建议很明确:Meta应该修改其内容审核标准,将”AI生成的冒名内容”单独列为一个类别,并默认视为非自愿内容处理,不需要举报人提供额外证明。

    审核跟不上生成速度

    这件事背后更大的问题是:AI生成内容的爆发速度,已经远远超过了平台内容审核的跟进速度。以前要制作一段色情化视频,需要真实的拍摄和后期;现在只需要一张照片和一段开源的Deepfake代码,几分钟就能生成一段以假乱真的视频。

    Meta每年在内容审核上花费超过50亿美元,雇用了上万名审核员,还部署了AI审核系统。但面对AI生成的NCII,这套体系仍然显得力不从心——审核员需要判断”这是真的还是AI生成的”、”当事人是否自愿”,而这些判断在越来越多的案例中变得极其困难。

    监督委员会的这次介入,某种程度上是在替Meta”补课”。委员会本身是一个独立机构,由Meta资助但独立运作,专门审查Meta的内容审核决策是否得当。这次它站在了受害者一边,也等于给整个行业提了个醒。

    其他平台在做什么

    Meta不是唯一面临这个问题的平台。TikTok、X(推特)、Pornhub都曾被指责对Deepfake色情内容处理不力。2024年,X甚至因为大量Deepfake色情内容被安全组织点名,被迫更新了相关审核政策。

    有一些平台开始尝试用技术手段主动检测AI生成内容——比如在上传时自动识别是否由已知Deepfake工具生成。但这类技术的准确率仍然有限,而且新的生成工具每天都在出现,检测永远慢一步。

    更根本的解决方案可能是立法。美国多个州已经在推动相关法案,要求平台在收到举报后必须在规定时间内删除Deepfake色情内容,否则将面临罚款。但联邦层面的立法进展缓慢,而互联网本身又是跨地域的,单一国家的法律能起多大作用,还是个问号。


    监督委员会这次的表态,至少让”AI生成冒名内容应默认视为非自愿”这个原则被摆上了台面。接下来要看Meta会不会真的修改审核标准,以及其他平台会不会跟上。对于无数可能成为下一个受害者的普通用户来说,这一天来得已经够晚了。