标签: 模型蒸馏

  • 纳德拉给用AI的公司提了个醒:你正把家底一点点喂给对手

    硅谷这阵子最让 AI 拥护者睡不着的,不是模型会不会取代人,而是另一件更微妙的事:企业天天把机密数据喂给 OpenAI、Anthropic 这些大厂的模型,会不会等于亲手养大了自己未来的对手。这话以前多是投资人和 Palantir 的老板 Alex Karp 在说,现在,微软 CEO 纳德拉也加入了这个阵营。

    让人意外的是提醒的人是他。要知道微软在 OpenAI 和 Anthropic 身上都下了重注,自家 CEO 却公开叫客户小心模型厂商,这份分量就不一样了。他把这套逻辑写进一篇叫《逆向信息悖论》的博客里,核心就一句话:你用 AI,其实付了两遍钱。

    “你实际上为智能付了两次费,一次用钱,另一次用更宝贵的东西:为了让它真正好用,你不得不交出去的专有知识。你越想让模型表现好,就得喂给它越多这样的知识。” —— 萨提亚·纳德拉

    微软CEO纳德拉警告企业使用AI的隐性成本
    纳德拉的这篇博客被看作对前沿实验室数据“双标”的一次开炮 · 图片来源:TechCrunch

    真正贵的不是 token,是你交出去的经验

    纳德拉说,token 的钱是明码标价的,你知道自己在花;可另一笔支出你根本没察觉。企业为了让模型更懂自己的业务,会一点点把经营诀窍教给它。模型从”使用痕迹”里学习——你写的提示词、智能体调用的工具,尤其是模型犯错时你给的纠正。每一次纠正,都会沉淀成一份企业级的经验。

    而这种经验,恰恰是竞争对手花再多钱也买不来的。问题就在这儿:你在用模型的过程中,主动把它送了出去。时间一长,卖方越来越懂你,你却对它一无所知,信息差只会越拉越大。这就是他说的”逆向信息悖论”——传统市场里是卖方担心白送知识,AI 时代反过来了,轮到买方在白送。

    凭什么你能爬全网,我却不能”蒸馏”你

    纳德拉还顺手点了 AI 公司的双标。这些公司一边主张自己能”合理使用”全网的公开内容来训练模型,一边又在条款里禁止别人”蒸馏”它们的模型——所谓蒸馏,就是分析一个模型的输出,摸清它怎么工作,再据此训练一个通常更便宜的新模型。他觉得很讽刺:既然你能拿全世界的数据训练,那企业反过来研究你的模型,也该是公平的。

    他最警惕的,是模型厂商在服务条款里”保留从客户使用和交互数据中学习的权利”这一条。今年 2 月 Anthropic 还指控过中国的开源模型给 Claude 发了数百万条提示词来改进自己,转头呼吁政府收紧出口管制。纳德拉的意思很直白:这事不能只许一方做。


    他开的药方,顺便也是微软的生意

    当然,作为一家云巨头的老板,纳德拉给的解法也很”云巨头”。他建议企业把数据的所有权攥在自己手里——提示词、反馈这些都算,然后在云上搭一个”专属学习环境”(数据反正大概率已经存在云上,顺理成章可以是微软的 Azure)。他还主张加一层”编排层”,让企业能在不同厂商的模型之间随时切换,别被一家锁死。

    这套话里没直接说”开源”,但潜台词很明显。很多大公司已经在把开源模型部署到自己机房里跑。做 AI 网络与安全的 Solo.io 创始人 Idit Levine 就说,她的客户试完专有模型后,开始琢磨一个问题:能不能用开源模型在本地跑,做到前沿模型近九成的活,成本还低得多。数据也在佐证这股风——上个月经 Vercel 的 AI 网关传输的流量里,已经有 29% 流向了开源模型。这早就不是小圈子的实验,而是一条正在成形的采购趋势。

    • 诊断值得每个 CTO 认真对待:先盘一下哪些系统在把原始客户数据、定价逻辑、运营手册喂给第三方模型;
    • 在生产环境的 AI 前面加一层网关,保证随时能换供应商;
    • 别再把”我们用了 Claude/GPT”当成战略,它更像一件带着数据泄露面的租来的商品。

    纳德拉的诊断和药方,一个偏公心,一个偏私利——Azure 依然是把数据留在云上、只换模型这套逻辑的赢家。但诊断本身没毛病,值得任何一家正在大规模用 AI 的公司拿去对照一遍。

  • Anthropic悄悄给Claude Fable加了隐形护栏,被发现后道歉了

    Anthropic上周把Claude Fable 5推上线的时候,顺便给它加了一道用户看不到的”暗门”——一旦系统判断你在使用Claude的输出训练竞争模型(也就是所谓的”模型蒸馏”),它会悄悄降低回答质量,而且不会告诉你原因。

    这件事最先在AI研究社区里炸了锅。有人发现,用自己的数据去”探测”Fable的时候,回答突然变得很奇怪,像是被人为削弱了,但查系统日志又找不到任何拦截记录。大家这才意识到,Anthropic在系统卡(system card)里写了这件事,但写的方式非常不显眼——他们说对于”判定为蒸馏尝试”的查询,Fable会”修改回答质量”,而且用户不会收到通知。

    系统卡里的原话是:”对于它判定为蒸馏尝试的查询,它会直接修改、降低模型回答的质量。用户不会收到任何通知,不知道自己触发了安全措施,也不会被告知回答被修改了。”

    “不可见护栏”背后的逻辑

    Anthropic在声明里解释过为什么要这么做。他们说,可见的安全机制容易被”探测”——如果你明确告诉用户”这条查询被拦截了”,别人就能反过来摸索出你的安全边界在哪里。而不可见的机制可以更精准,误判率低,还能让模型快速上线。

    这个理由听起来有一定道理,但问题在于:当用户花了钱调用API,却得到被偷偷”降级”的输出,而且完全不知情——这无论怎么看都不太对。更麻烦的是,这种暗地里的限制也会影响第三方对模型能力的正常评估,因为你根本不知道拿到的结果是真实的模型输出,还是被”动过手脚”的版本。

    Anthropic Claude Fable 5
    Anthropic为Claude Fable设置的隐形护栏引发了社区强烈反弹丨图片来源:The Verge

    道歉,然后改掉它

    压力之下,Anthropic在X上发了一条声明,宣布改变做法。从现在起,涉及蒸馏的查询不再被暗中降级,而是直接”回退”到上一代模型Claude Opus 4.8来处理,并且——这一点很重要——系统会明确告诉用户:”你触发了蒸馏保护,这次回答由Opus 4.8生成。”

    这个处理方式其实和Fable在其他高风险领域的做法是一致的。比如你问它生物学或化学的问题,如果触发了安全规则,它也会把查询转给Opus 4.8,除非问题涉及毒品、武器等明确禁止的内容,才会直接拦截。

    Anthropic在道歉声明里说了一句挺坦诚的话:”可见的安全机制可能被探测,因此必须足够稳健,这需要时间打磨。我们之前选择不可见的防护措施就是出于这个原因——但这是一个错误的权衡。你有权了解我们部署的安全措施以及背后的原因,很抱歉我们没有把握好平衡。”

    这件事还没完

    有意思的是,这已经不是Fable第一次因为”过度保守”而出问题了。就在几天前,有用户发现Fable连”线粒体是什么”这种高中生物问题都拒绝回答,后来Anthropic也承认是安全校准范围太宽,正在修复。

    两件事放在一起看,一个矛盾就浮现出来了:Anthropic一直对外强调自己把”安全”放在第一位,但接连两次”安全机制”的设计都引发了用户的强烈反弹。如果一家以安全著称的AI公司,连”如何把安全措施告诉用户”这件事都做不好,那它口中的”负责任AI”到底意味着什么,恐怕要打一个问号了。

    再说回蒸馏这件事。Anthropic之前多次公开点名DeepSeek等中国AI公司,指责它们以”工业化”规模蒸馏Claude的输出。从这个角度看,Fable的隐形护栏更像是Anthropic的一次”技术报复”——既然我没法阻止你偷我模型,那我就在模型里埋个暗门,让你偷到的东西是”残血版”的。想法可以理解,但这么做的同时,也把自己的信誉搭进去了。