标签: AI内容过滤

  • Mistral开源3B安全模型Shieldstral:把审核规则写成一句话,小显卡就能跑

    Mistral Shieldstral 内容安全模型
    Mistral 开源的 Shieldstral 把内容审核变成一道可随时改写的问答题(配图由 AI 生成)

    8月4日,Mistral 丢出一个叫 Shieldstral 的开源模型。它干的事很具体:给 AI 产品做内容安全审核。但思路和市面上大多数”护栏”模型不太一样——它只有 30 亿参数,却宣称能打过体积大它七倍的开放模型,而且一张 16GB 的消费级显卡就能跑起来。

    审核模型的老毛病

    过去这类防护模型有个通病:把一套固定的”有害类别清单”直接焊死在权重里。换一个产品场景,开发者往往得重新训练。可现实是,同一段内容在一个网络安全研究工具里可能完全没问题,放到心理健康平台就成了麻烦。哪有一套放之四海皆准的分类法能替所有产品画好这条线?

    Mistral 在公告里举的例子:同一段内容,对网络安全研究工具来说是正常的,对心理健康平台来说可能就是有害的。

    把规则变成一道问答题

    Shieldstral 的做法是:你别改模型,改问题。每次审核时,你用大白话写一道”是或否”的判断题,比如”这段内容是否在宣扬针对某保护群体的暴力”,模型读完只吐出 yes 和 no 两个词元的概率,归一化成 0 到 1 的安全分。改审核标准,就变成了改一句话。文字、图片、图文混合,全都走同一个接口,不用为不同产品养一堆模型。

    小模型凭什么打大块头

    Mistral 的核心论点是数据比参数规模更关键。他们把公开安全数据集里互相打架的标注体系统一成同一种格式,还故意造出”长得像、容易混淆”的政策对,逼模型学会分辨一段内容到底违反了哪一条具体规则,而不是死记硬背类别。模型基于 Ministral-3-3B,带 Pixtral 视觉编码器处理图片,训练上下文 32k,覆盖 12 种语言,约 5410 万条训练样本。

    • Apache 2.0 开放权重,直接上 Hugging Face 自托管,没有托管 API
    • 文本安全平均 F1 达 84.9%,多模态安全 83.8%,领先同档开源模型
    • 单卡 16GB 即可推理,适合已经自己跑模型、想让数据留在内部的团队

    开源安全阵营又添一员

    这次发布也把 Mistral 摆到了”Open Secure AI Alliance”创始成员的位置上,和 NVIDIA 等机构站在一起。对中小团队来说,Shieldstral 最实在的价值是:你不用再为每个产品的审核口径去求供应商改接口或微调模型,写一行政策字符串就行。当然,政策文本现在跟着每个请求走,改一个词就可能让分类行为悄悄变样,所以这道”规则”也得像代码一样被认真评审。


  • Reddit 用 AI 反 AI 垃圾:每天拦 2300 万次,背后是门 GEO 生意

    Reddit 用 AI 反 AI 垃圾:每天拦 2300 万次,背后是门 GEO 生意

    AI 盾牌机器人正在过滤社交平台上的垃圾与机器人内容
    Reddit 用 AI 检测系统对抗 AI 生成的垃圾内容。配图由 AI 生成

    如果有人说“用 AI 来治理 AI 制造的垃圾”,你可能会觉得这是句绕口令。但 Reddit 现在真在这么干。这家公司最近公布了一组数字:靠一套升级过的 AI 垃圾检测系统,他们每天在内容被真人看到之前,就拦掉 2300 万次垃圾浏览;每天新抓到大约 2.5 万条“像垃圾的帖子和评论”;顺手废掉将近 200 万个水军刷出来的假赞。

    Reddit 这波操作,表面是清理社区,底下其实藏着一股更具体的焦虑:有人正在用 AI 批量生产内容,往 Reddit 里灌,目的不是跟你聊天,而是去影响 ChatGPT、谷歌 AI 搜索会给出什么答案。

    新型“搜索引擎优化”:驯化聊天机器人

    这事儿有个新名字,叫 GEO(生成式引擎优化),也有人叫它 AEO。逻辑不复杂:现在 AI 聊天机器人在回答问题时,特别爱引用 Reddit 的帖子。于是品牌方发现,只要在 Reddit 高流量版块里悄悄埋几句产品好评,成本极低,却能左右那些机器人推荐什么。The Verge 就点名了一家叫 RedRover 的公司,公然揽活,派 AI 智能体到 Reddit 和博客上铺量内容,既冲谷歌排名,也冲 ChatGPT 的答案。

    “我们最管用的工作,发生在帖子被任何人类看到之前。”Reddit 在自己的公告里写道。他们不再等违规内容流到社区里才判断好坏,而是从源头就掐断。

    具体怎么拦?Reddit 说,账号一创建,系统就开始盯信号,把可疑角色挡在发帖之前。对那些真的进来的,他们用大模型去识别那种特别隐蔽、有组织的“假互动”和“人造热度”——这类套路老系统经常看走眼。最近他们还加了一道:凡是看着像机器人的可疑账号,都会被要求证明自己是真人。过去三个月,每天作废的假赞接近 200 万个。

    从“删帖慢”到“五秒内”

    不只是垃圾内容。在治理仇恨、暴力这类有害信息上,自动化也把效率拉满了:从发现到处理的平均时间,压到了 5 秒以内,用户接触到有害内容的概率降了四成多。对一个有 21 年抗机器人历史的老社区来说,这算一次明显的升级。


    说到底,Reddit 这套打法等于亲口承认了一件事:光靠人工审核,已经追不上 AI 辅助的操纵了。当“投喂聊天机器人”变成一门生意,平台能拿出来的、唯一现实的反制,就是同样用 AI、在更大规模上做检测。至于这场猫鼠游戏谁先累,现在还看不出来。

  • 平台明明能让你屏蔽AI垃圾内容,但它们就是不肯

    现在上网,AI生成的内容已经到了躲都没处躲的地步。但这件事本不必如此。

    过去一年,YouTube、Instagram、TikTok都在大力推内容认证,不少平台已经会自动给AI生成的图片、视频、音乐打标签,跟真人创作的内容做区分。问题是——这些标签只能让你刷到的时候心里有数,却没法让你直接把这类内容过滤掉。

    一个简单的过滤器就能解决这个问题,我们只需要一个”AI”勾选框来切换就行。我联系了Meta、谷歌、TikTok和Spotify,询问他们是否计划让用户过滤AI标签系统认证过的各类内容。结果没有一个给出肯定答复。

    现有的标签体系根本没用

    TikTok或YouTube的信息流里,你可能会注意到有些视频描述里有AI披露标识,或者视频画面上叠了个信息标签。Meta也是类似操作,给Facebook和Instagram上携带AI识别元数据、或者创作者主动披露的内容打上”AI信息”标签。

    但如果你想主动避开所有带这类标签的内容——这完全合情合理,毕竟AI生成内容除了伦理和环境问题,本身质量也堪忧——实际操作起来非常困难。

    少数有过滤功能的平台,做得也很敷衍

    目前见过有AI内容过滤功能的平台里,DeviantArt算一个,但它的设置藏得极深——你得先注册账号,然后把鼠标悬停在页面右上角的用户图标上,才能找到”AI内容设置”菜单。两个选项:默认”显示AI内容”,或者”抑制AI内容”。我试了,没看出明显区别。

    Pinterest也有类似系统,藏在设置里的”优化你的推荐”下面,可以切换特定类别的AI内容显示。据我的经验,效果远称不上完美,就算把过滤器开到最大,还是能看到大量有可疑AI痕迹的图片。


    平台为什么不乐意

    原因其实不复杂。平台本身也在制造用来生成这些内容的工具。Meta、Spotify、谷歌不光托管AI生成的图片、广告和音乐,他们还在推销创造这些内容的工具。如果允许用户一键过滤所有AI内容,等于直接打击他们从AI产业获利的所有努力。

    还有一个更尴尬的原因:他们知道现有的标签系统有多不靠谱。C2PA和SynthID这类基于溯源的系统,在内容创作时嵌入元数据或隐形水印,但很多开源AI模型根本不会这么做,而且元数据太容易被剥离。基于检测的方法分析数字内容模式来评估AI生成的可能性,但误报率很高,目前这些方案都无法在大规模场景下有效工作。

    平台推出标签功能,很大程度上是为了应付监管机构和批评者,至于实际能不能帮用户区分真假内容,那是另一回事。

    一个更实际的替代方案

    与其费力给所有AI内容打标签,不如反过来——给经过验证的真人创作者打标签。这不一定能识别这些创作者发布的合成内容,但至少能帮你少看到那些炮制低质量垃圾内容的未验证内容农场。

    Instagram的负责人Adam Mosseri曾经提过这个方向,Spotify也已经在做”已验证艺人”功能。如果YouTube和Instagram愿意推,这比现在这套形同虚设的AI标签体系要实用得多。

    AI垃圾内容过滤示意图
    平台有能力做AI内容过滤,但它们选择不做