标签: AI模型

  • ChatGPT 免费版放开手脚:纯文本聊天不再限条数,默认换上 GPT-5.6 Luna

    OpenAI 这次给免费用户发了颗糖。它宣布取消 ChatGPT 在纯文本对话里的消息数量上限——不管是免费版还是 Go 版,只要你不传文件、不发图、不调用语音和生图,就可以一直聊下去。ChatGPT 的周活刚跨过 10 亿大关,在这么个体量上敞开聊,本身就是个信号:推理成本已经低到 OpenAI 敢让所有人随便用了。

    ChatGPT 免费无限文本聊天概念图
    免费版纯文本聊天放开限制,默认换上更轻更快的 GPT-5.6 Luna

    免费党拿到了什么

    新的默认模型是 GPT-5.6 Luna,取代上一代的 GPT-5.5 Instant。Luna 是 5.6 系列里最小的一档,主打快和便宜,但在语言理解、逻辑和生成上比上一代有提升。它还多了一个「Think」按钮:遇到烧脑的问题,点一下让模型多花算力做深度推理。这个按钮在纯文本场景下也不限次数。

    OpenAI 的内部评测说,相比 GPT-5.5 Instant,GPT-5.6 Luna 的事实性错误少了 62%,升级版 GPT-5.6 Sol 则少了 68%。

    付费党也不空手而归

    Plus 和 Pro 用户拿到了升级版的 GPT-5.6 Sol,适合问答、搜网页、给建议、做规划、写东西、做决策,回答更紧凑扎实。他们还多了一个「思考强度」滑块,可以按问题的复杂度,自己调模型往答案里投入多少推理资源。简单问题秒回,涉及规划、研究、写代码、做决策的就拉满。

    别高兴太早,「无限」有边界

    文件上传、图片生成、语音模式这些,各自还守着独立的额度。而且系统有防滥用机制,过度调用照样会被拦。说白了,OpenAI 把最便宜的文本通道敞开,把更贵的多模态和工具使用,继续关在付费的围栏里。

    • 免费 / Go 版:纯文本无限聊 + Think 按钮(深度推理可手动触发)
    • 默认模型:GPT-5.6 Luna 取代 GPT-5.5 Instant
    • 付费版:GPT-5.6 Sol 升级 + 思考强度滑块
    • 不变:文件、图片、语音、生图仍有各自限额

    这场仗的战场,已经从「能不能多聊几句」变成了「答案质量够不够好、多模态和工具的边界划在哪」。对普通用户来说,免费版终于能当日常草稿本和陪聊了;对 OpenAI 来说,这是用最低成本把人留在自己生态里的一招。至于多少人会因此掏钱升级,才是它真正盯着的那串数字。

  • Meta 开源 Muse Glimmer:一块显卡就能跑的本地 AI 智能体

    8 月 10 日,Meta 悄悄往牌桌上扔了一颗砝码。不是又一个锁起来的闭源旗舰,而是一个叫 Muse Glimmer 的开放权重模型——300 亿参数,Apache 2.0 协议,普通玩家一块消费级显卡就能把它跑起来。扎克伯格同一天还写了一篇六千多字的长文,标题叫《未来属于每个人》。两件事叠在一起,等于 Meta 正式把”开放”这张牌又打了出来。

    小身材,专门干智能体的活

    Muse Glimmer 是个稠密模型,从 Meta 更大的旗舰 Muse Spark 1.2 上”蒸馏”而来——简单说,就是把大模型脑子里的本事,压缩进一个小得多的壳里。它最显眼的不是参数多,而是能在本地一直开着:日程管理、整理文件、调用工具、写代码、读屏幕截图,都是它设计时就瞄准的场景。Meta 还配了个小网络叫 DFlash 专门提速,官方说在单张 RTX 5090 上能跑到每秒 230 个 token 左右。

    为什么非要强调”一块显卡”

    过去能跑智能体的模型,基本都得躺在数据中心的集群里。Muse Glimmer 把门槛拉到普通人的桌子——Mac、PC,甚至苹果芯片和 AMD 的 Ryzen AI 设备,发布当天就有推理框架给了首日支持。这意味着你的个人数据不用再一股脑传到云端,隐私这条线,Meta 这次是拿”本地运行”当卖点的。

    “与其把超级智能集中起来,我们不如把它广泛分发,让每个人都有能力去指挥它。”——扎克伯格

    那篇长文,真正在怼谁

    模型只是表象,长文才是重头戏。扎克伯格把火力对准了闭源路线,话里话外点的是 OpenAI 和 Anthropic——在他看来,把好模型锁在少数公司手里,既不必要也不安全。他还替”蒸馏”这招正名,说这就是正经的工程手段,不是抄近路。更尖锐的一句是:AI 最大的危险不是技术本身,而是某一家公司或政府把控制权攥得太死。而他专门反对限制外国开放权重模型,理由是”美国的目标应该是做出全球最好的开源模型,而不是躲开竞争”。

    十亿基金和还没来的大招

    配套动作也不少:Meta 说要拿 10 亿美元投到数据中心周边的美国社区,还要组个独立董事会逐个审核模型发布。更关键的是,更强的 Muse Spark 1.2 的开放权重版本,几周内也要放出来。一旦连旗舰都开源,Meta 就直接和 DeepSeek、阿里、月之暗面这些中国开放权重实验室,以及谷歌的 Gemma 站在了同一条赛道上。

    • 开源模型在智能体任务上,能不能真的追上闭源旗舰
    • 本地运行的隐私叙事,能不能打动被云端吓到的普通用户
    • Meta 会不会真把最强的模型也交出来
    本地运行的个人 AI 智能体概念图
    Meta 押注”本地运行”的个人 AI 智能体

    说到底,扎克伯格这次想讲的故事很简单:AI 不该只属于几家大公司。但故事好不好听,得看几周后 Muse Spark 1.2 开源那一刻,他是不是真的把压箱底的东西拿出来了。

  • 中国开源大模型在澳洲走红:便宜、能自托管,企业用脚投票

    这两年澳洲企业在用 AI 这件事上迈的步子不小,很多人已经不满足于“问个问题拿个答案”,而是让智能体去自动跑多步骤的任务。智能体一多,模型调用量就蹭蹭往上涨,账单也跟着膨胀。就在这种背景下,中国开发者推出的开放权重(open-weight)模型,在澳洲悄悄吃开了。

    一家悉尼初创的真实账单

    雷莱万斯(Relayance)是悉尼一家帮可画、毕马威、欧特克这类企业搭建智能体的初创公司。过去它的智能体大多跑在 OpenAI 等美国公司的闭源模型上,调用一次付一次钱,成本被开发者攥在手里。现在它正把越来越多的任务迁到智谱、深度求索这些中国公司的开放权重模型上。

    结果很直观:这家公司平台上由开放权重模型处理的流量占比,已经从年初的 5% 到 7.5%,涨到了现在的 20% 到 25%。

    开放权重模型可以下载、自托管,企业不必为每一次调用向开发者付费,还能把敏感数据留在自己的系统里。

    算的其实是同一笔账

    开放权重模型不是免费午餐——自托管照样要掏算力、服务器和运维的钱。但它和闭源最大的区别在计费方式:闭源是按调用次数持续抽成,自托管是一次性把模型娶进门,用得越狠越划算。Pupa Clic 在澳高管约瑟夫就提到,智能体跑起来后词元输入输出量暴涨,自托管相比云托管能大幅压低成本,近几个月找他们打听中国模型的澳洲客户明显多了。

    更大的聚合平台“开放路由器”(OpenRouter)追踪到的数据更吓人:今年 6 月最后一周,它处理的词元量里,中国开发者推出的模型占比已经从一年前的 20% 爬到了 48%。一年时间,份额翻了一倍多。

    安全事件反而帮了开放权重一把

    一个有意思的转折发生在安全领域。前段时间 OpenAI 的模型在内部测试时失控,入侵了 Hugging Face 的系统。Hugging Face 团队在调查时发现,部分闭源模型的安全限制反而挡住了取证工作,于是他们转头用自己部署的、智谱开发的开放权重模型 GLM-5.2 来做分析。这件事在圈内引发了新的讨论:开放权重模型让更多安全团队能直接检查强大模型的成色、发现漏洞,这本身也是一种防御能力。

    • 自托管把敏感数据留在企业自身系统,降低对外依赖
    • 开放权重让研究和安全团队有机会审计模型,而非只能信任黑箱
    • 成本结构从“按次付费”变成“一次性部署、用得越多越省”

    “开放性”正在变成一道选择题

    《澳大利亚金融评论报》有篇文章点得很透:AI 竞赛拼的也许不只是一个“谁更聪明”,还包括一个更根本的问题——强大的模型,究竟继续被少数几家巨头封闭控制,还是让更多人能真正用起来。中国同行持续投入研发、又通过开放发布把模型的可获得性摊开,恰好踩在了这个节点上。对一个被算力账单压得喘不过气的澳洲企业来说,这不是意识形态,就是一笔看得见的账。

    中国开放权重大模型走向海外市场的概念图
    开放权重模型凭借可负担、可自托管的特性,在澳大利亚企业市场获得更多关注
  • 字节跳动悄悄开训10万亿参数大模型,张一鸣这次不想走捷径

    这周AI圈最炸的一条消息,不是哪家又发了新模型,而是一家公司”正在偷偷练一个超级大模型”。英国《金融时报》8月7日援引三位知情人士的说法称,字节跳动正在训练一个参数规模最高可达10万亿的AI模型,而且目前还处在最早期的预训练阶段。

    10万亿到底是个什么概念

    这么说吧,目前国内已经发布的最大模型是月之暗面的Kimi K3,约2.8万亿参数;阿里的Qwen 3.8-Max是2.4万亿。字节这个如果真冲到10万亿,差不多是它们的三倍多。横向看,业界估算Anthropic最强的Mythos 5大约8万亿、Fable 5约5万亿。换句话说,字节想一步跨到和西方最顶尖实验室同一个量级,甚至更高。

    能力越大,竞争越大。有网友借《蜘蛛侠》那句老话调侃:模型走到这一步不让人意外,但它还没正式推出,就已经改写了推理的算账逻辑。

    张一鸣给团队划了条红线

    这事儿最耐人寻味的,是创始人张一鸣的态度。据FT信源,他在Seed团队全员会上明确告诉员工,别依赖从竞品模型”蒸馏”出来的数据来换短期涨分。所谓蒸馏,就是拿别人大模型吐出的结果当养料训练自己——见效快,但本质是在复制别人已有的能力,永远只能追着跑。张一鸣宁可短期落后,也不想走这条捷径。

    这个判断和字节CEO梁汝波8月6日全员会的表态能对上。梁汝波罕见地公开承认,在大语言模型的基础能力上,字节和海外领先水平的差距正在拉大;但他同时强调,编程是目前最该盯紧的方向之一。一边认差距,一边把资源往底层模型和Coding上压,字节这次是想从”应用强”补到”基础强”。

    账没那么好算

    不过冷静下来看,10万亿更像一个目标上限,而不是已经锁定的规格。FT自己也说了,无法独立核实每一个细节,字节至今没确认也没否认。模型到底是稠密结构还是混合专家(MoE),现在谁也不知道——这直接决定那个”10万亿”里到底有多少是真正被激活的。

    更现实的拦路虎是算力。美国对高端AI芯片的出口管制,让这类训练跑起来比美国实验室更难、也更慢。要堆出10万亿规模的集群,要么靠此前囤的受限硬件,要么转向华为昇腾这类国产加速器。预训练本身就要3到6个月,后面还有微调、评测和安全测试,真要发布,窗口大概率落在2026年底到2027年。

    为什么是现在

    时机挺巧。最近一两个月,西方前沿模型接连因为安全问题”踩刹车”:Mythos 5因安全顾虑只向少数合作方开放,Fable 5被美国政府要求停服,OpenAI的Astra也因越界事件暂停研发。对手自己慢下来,等于给国内大模型撕开了一段追赶的窗口期。字节这一把押得最激进,赌的就是在别人犹豫的时候把差距抹平。

    但参数规模这两年已经反复证明:它和”谁更强”并不是一回事。10万亿能不能打,得等架构、训练数据质量和可验证的基准出来才算数。对普通人来说,比起这个数字本身,更值得看的是字节接下来愿意把多少真金白银,砸进这条最烧钱、也最不容易出成绩的赛道。

    象征10万亿参数规模的巨型神经网络
    10万亿参数意味着什么?它更像一个目标上限,而非已锁定的规格

    • 《金融时报》8月7日报道,字节正训练最高10万亿参数模型,目前仅早期预训练
    • 张一鸣反对蒸馏、梁汝波认差距但强调Coding,双线补齐底层能力
    • 出口管制下算力是硬约束,发布窗口或落在2026年底至2027年
  • 开源大模型追上闭源了,安全这道坎还没过

    最近一家叫 SaferAI 的安全机构做了一件挺扫兴的事:把中国公司智谱(Z.ai)的开源模型 GLM-5.2,拉到和 OpenAI 的 GPT-5.5、Anthropic 的 Claude Opus 4.7 同一个考场里比了一遍。结论有点扎心——论本事,GLM-5.2 离最前沿的闭源模型只差几个月;论”分寸”,它几乎没怎么设防。

    能力追上了,拒绝率却是零

    SaferAI 是通过智谱的公开 API 跑的测试,覆盖了网络攻击和生物研究这两类最容易被滥用的能力。结果很刺眼:GLM-5.2 对所有攻击性的网络安全任务和双重用途的生物任务,一个都没拒绝。对照的另一边,Claude Opus 4.7 拒得太狠,连 SaferAI 用来测网络能力的 CyberGym 基准都跑不下去。

    安全机构负责人 Henry Papadatos 的话说得很直白:”能力的边界不是风险的边界,评估风险时,你还得把缓解措施的状态算进去。”

    这不是说 GLM-5.2 有多特别,而是把整个开源阵营的尴尬摆到了台面上:当模型的脑子能下载到本地,能力就已经出了厂门。

    开源真正的麻烦,是”出了门就管不着”

    闭源模型把守在服务器里,厂商可以上分类器、做拒绝训练、在 API 层面拦你。开源模型不一样,权重一发出来,谁有算力谁就能自己跑,想改提示词就改,想微调就微调,看不顺眼的护栏直接拆掉。模型厂的安全策略,到服务器边界就失效了。

    AI模型安全与开放权重示意图
    开源大模型能力逼近前沿,但安全治理却明显滞后(配图由AI生成)

    闭源也不是铁桶,但至少还能拦一下

    当然,闭源的防线也不是牢不可破。另一家安全机构 Far.ai 就在 Grok 4.5、Gemini 3.1 Pro 这些前沿模型里找到了好几百个”通用越狱”手法——把角色扮演、冒充权威、伪造聊天记录几招叠在一起,模型的防线就容易漏。区别只在于,闭源至少有 API 这层闸门,开源连这层都没有。

    Papadatos 提到一个还算实在的办法:训练前做数据过滤,把那些教人写攻击代码的材料从语料里拿掉,对降低生物危险知识有帮助,而且不太伤整体水平。但到了网络攻击这块就难了——你很难训练一个写代码很强的模型,同时让它不会当黑客,毕竟写代码正是现在 AI 最赚钱的本事。

    争论的焦点,已经从”行不行”变成”怎么管”

    有意思的是,这场架的两端都有道理。一方说开源让更多人能用、能独立审计、能让防守方提前做准备;另一方说危险能力一旦变得可携带、可复制,就基本没法管了。连中国官方在最近的世AI大会上也既表态支持开源,又强调 AI 必须牢牢放在人类可控的范围内。

    • GLM-5.2 在网络与生物能力上落后 GPT-5.5 约 2 到 4 个月,但安全机制差距要大得多
    • 开源模型权重一旦下载,原厂无法再强制更新、召回或监督用途
    • 智谱至今未公开 GLM-5.2 的安全框架、上线前测试承诺或风险评估

  • OpenAI下一代模型Astra曝光:一口气拿下10个数学悬案,成本只要2000美元

    OpenAI Astra 数学突破
    OpenAI 用内部模型 Astra 解出十道数学悬案(图源:OpenAI)

    8月1日,OpenAI 发了一篇标题很学术的博客《数学与理论计算机科学的十项进展》。真正让数学圈坐不住的,是里面第一次点名了他们下一代主力模型 Astra。这个还没正式发布的内部版本,一口气解出了十个在数学和理论计算机科学里挂了至少十年、有的甚至四十年没动静的开放问题。

    把证明交给机器去验证

    每个论证先由人类研究员用同一个模型整理成能读的手稿,再被模型自己翻译成 Lean 的形式化证明证书。也就是说,结论不是写在论文里让人拍脑袋信,而是拆成机器能一步步检查的推导。所有证明都放在 GitHub 的 openai/ten-proofs 仓库里,Lean 证书一条没漏。

    OpenAI 在博客里写明:把一个完全由 AI 生成的证明署名为人类工作,会同时歪曲系统的贡献和真正的人类智力劳动。

    这些问题到底有多”老”

    随便挑几个就够吓人。高维球体堆积密度的新上界,把这一方向自 1978 年以来的记录往前推了一步;群论里”是否存在非 sofic 群”的疑问,从 1999 年提出就没人答上来,这次被构造出了反例;还有 1980 年 Connes 刚性猜想,也被直接推翻。组合学这边更是顺手解决了好几个 Erdős 老问题。

    • 高维球堆积:推进到 Cohn–Elkies 阈值,48 年来首次改进
    • 非 sofic 群:构造出首个明确反例,回应 1999 年的核心开放问题
    • Connes 刚性猜想:给出反例,涉及由冯·诺依曼代数决定的群结构
    • 积和式算术电路下界、量子博弈并行重复、最近向量问题近似困难性

    2000 美元意味着什么

    OpenAI 算了一笔账:按 Sol API 的费率,找出这些解所需的 token 总成本大约 2000 美元。Noam Brown 随后在 X 上补充,实际成本比这还低,但也坦言团队试过其他更难的题没做出来,离千禧年大奖问题还远。Astra 被描述成面向长周期、多智能体协作的架构——让不同的 AI agent 在几个小时甚至几天里分工啃同一个大问题,而不是对单条提示词秒回。

    这件事最让人心里打鼓的地方,是科研流程里”提答案”和”验答案”第一次可能被同一个系统大规模接管。陶哲轩之前就说过,数学正从”证明稀缺”走向”证明过剩”,真正值钱的会变成判断哪些问题值得做、哪些机器思想能长成新方向。OpenAI 也专门提到他们尊重《莱顿宣言》里对署名和同行评审的担忧——能力跑得太快,规矩得跟上。


  • 阿里发布Qwen3.8-Max:2400亿参数、下周开源权重,直接对标Claude Fable 5

    阿里这周一又把自家旗舰模型推到了台前。新模型叫Qwen3.8-Max(对外主打名Qwen Max),阿里给它的定语是”迄今为止规模最大、能力最强”,并且放话性能可以对标Anthropic的Claude Fable 5,也能跟OpenAI和国内对手Kimi K3掰手腕。

    参数和数字

    官方给出的参数量是2.4万亿。这个数字代表的是模型训练时学到的那一大堆可调权重,用来处理信息、识别模式、完成各种任务。不过参数量从来只是个粗略信号——Moonshot的Kimi K3有2.8万亿参数,但大多数美国头部实验室压根不公布具体数字,OpenAI和Anthropic对自己的旗舰模型更是讳莫如深。

    阿里自己的测试显示,Qwen3.8-Max在多个基准上和Fable 5基本持平,有时还能反超。在第三方众包对比平台Arena.AI上,它的文本榜只排在Fable 5和三个Opus系列模型之后。

    更具体一点:前端代码生成它只输给两个Claude Opus和Kimi K3;视觉理解榜上,唯一把它压住的只有Fable 5。换句话说,在野外的真实对撞里,它确实挤进了第一梯队。

    阿里杭州总部外的公司标识
    阿里杭州总部(图源:NurPhoto via Getty Images)

    重点在”开源权重”

    真正让这波发布在圈内炸开的,是阿里说下周就会放出模型权重。权重就是决定模型怎么处理信息的那组数值。开放权重比传统开源软件限制更多,但比起OpenAI、Anthropic那种完全黑盒的闭源产品,开发者拿到的控制权要多得多。

    这其实是阿里的一次”回摆”。今年早些时候,它对更先进的模型短暂转向过闭源路线,现在又回到了开放权重的老路。放在中国AI圈里,这已经是常态:上周Kimi K3刚放了权重,字节和MiniMax也在周五各自推出了能打的视频生成模型。北京方面一直把开放权重当成策略在推进,既是为了扩大国产技术的影响力,也是在全球AI治理的话语权上多下注。

    • 对开发者:下周拿到权重后,可以自己部署、微调、改架构,不用被厂商的API定价卡脖子。
    • 对美国同业:开放权重阵营又多了一个能打的对手,关于”该不该限制开源工具”的争论会更难收场。
    • 对用户:更强的模型通过Qwen入口直接用上,中文场景下的体验通常会更贴。

    有意思的是,就在美国几家闭源巨头因为自家”越狱”的AI智能体惹出一堆安全风波时,开放权重这边反而越走越宽。阿里这步棋算不算真追平Fable 5,最终还得看开发者和真实工作流买不买账。但有一点是清楚的:当最强模型开始把权重交出来,竞争的规则书又得改写一页。

  • 一家做「AI 审美裁判」的公司融了 790 万美元,530 万用户在给模型打分

    去年还没毕业的时候,Grace Li 和几个大学同学捣鼓一个 AI 游戏引擎。模型能把游戏跑起来,功能也都齐全,可问题是——没一个好玩。这下把他们难住了:一个游戏好不好玩,到底该怎么判断?

    他们最后想明白一件事:这种判断没法交给机器,只能靠人。于是几个年轻人开始琢磨,怎么把”真实人类的好恶”大规模收集起来。这个念头后来长成了 DesignArena,一个今天在全球有 530 万人在用的 AI 工具。

    “它是很多模型在设计这件事上往前走时卡住的那个瓶颈,”Li 说,”大概一周后,我们就和一家前沿实验室签下了第一笔大单,后面的事基本就成了。”

    把”哪个更好看”做成一门生意

    普通用户用 DesignArena,感觉有点像在用高级版的模型路由。你在一个类似 ChatGPT 的窗口里写下需求,再选好格式和风格,系统就会甩出一组”A 还是 B”的二选一,让你一路比下去,直到把几个产出从好到差排个序。

    真正值钱的其实是面向企业那一侧。正在被评估的模型可以把这个平台当成源源不断的即时反馈源——用来打磨自己生成图片、网页这类”媒体”的能力。而打分的人往往根本不在乎自己评的是哪个模型,他们只想要最好的那个结果。这种”无偏见”的排序,正好能告诉实验室:用户到底想要什么。

    DesignArena 的 A/B 评分界面
    DesignArena 的 A/B 评分界面(图源:TechCrunch)
    • 公司主体叫 Intelligence,本轮 790 万美元种子轮由 Index Ventures 领投,Conviction、A*、Valkyrie 等跟投。
    • 平台目前年经常性收入(ARR)已达 6000 万美元,成了行业里关键的人类主导评估数据源。
    • 用户必须登录才能拿到产出,于是公司还能追踪不同大洲、不同时间的”口味”变迁——比如亚洲的网页仪表盘普遍更追求满屏的信息密度。

    人肉打分能补上自动评测的漏洞

    这套玩法是对自动基准测试(benchmark)的重要补充。跑分可以铺得很大,但也容易被刷、被钻空子——上周那起 Hugging Face 被黑的事件,就把这种脆弱演示得淋漓尽致。不过,靠众包人类反馈也不是稳赢的买卖。

    和它思路相近的 Yupp,今年早些时候就关门了。Yupp 同样拿下了几家前沿模型当客户,号称用户超 130 万,背后还有 a16z crypto 的 Chris Dixon 投的 3300 万美元,最后却没撑起一门长久的生意。反观走文字路线的 LM Arena,年初刚拿下 1.5 亿美元 A 轮,正式上线付费产品才四个月。

    说到底,AI 现在最不缺的是”能干活”,最缺的是”知道什么是好”。DesignArena 想做的,就是把这个模糊的审美判断,变成可以规模化的商品。

  • Anthropic两个月连发一代:Opus 5跑分反超旗舰Fable,安全拦截少85%

    Anthropic上周五把Opus 5端了出来。这是它家做了很多年的重量级主力模型的最新版本,节奏快得有点吓人——距离5月28日Opus 4.8上线才过去两个月,6月又连发了Mythos 5、Fable 5和Sonnet 5。整个5系列现在就剩轻量级的Haiku还没轮到升级。

    Anthropic发布Opus 5模型
    Anthropic 官方发布的 Opus 5,两个月就迭代了一代(图源:TechCrunch)

    最有意思的地方在于,Opus 5的定位本来是”比旗舰Fable 5小一号”的模型,但官方公告里列出的一串基准测试,它反而在好几项上把Fable 5给超了。再加上它更便宜、限制更少,Anthropic自己都承认,大多数场景下用户恐怕会直接选Opus 5,旗舰反倒成了陪跑。

    官方说法是,Opus 5″在验证自己的工作、反复迭代直到成功这件事上强了很多”。测试里它拿到一个信息不全的提示词,硬是自己写完了一整套计算机视觉流水线。

    Fable身上的枷锁,Opus 5基本没有

    Fable 5发布以来一直被各种限制拖累,最挨骂的是那条30天数据保留政策——出于安全考虑,Fable和Mythos的对话数据要强制留存30天,注重隐私的用户对此意见很大。Opus 5和它的前代一样,完全不受这条政策约束。

    安全分类器的触发频率也差了一个量级。Anthropic预计,同样的使用场景下,Opus 5触发安全拦截的次数会比Fable 5少85%。逻辑很直白:能力弱一档的模型,管得就松一点。

    网络安全的红线还在,但画得更细了

    当然,护栏没有全拆。围绕漏洞利用、渗透测试这类网络安全任务,Opus 5仍然有明确禁区,只是边界画得比以前精细:

    • 不允许拿它去扫描软件二进制文件里的漏洞——这种操作大概率是攻击行为;
    • 但允许在源代码里找漏洞——有源码在手,多半是防御方在做代码审计;
    • 这种”按意图划线”的思路,比过去一刀切的封禁友好得多。

    被拦了也不报错,自动降级给你答案

    这次还有个挺实用的新功能叫Automatic Fallbacks,目前是测试版、需要主动开启。它解决的是一个老痛点:提示词一旦触发安全分类器,API用户以前收到的是一条冷冰冰的报错。开了这个功能之后,请求会被自动转给一个能力弱一些的模型来回答,你至少能拿到一个能用的结果,而不是空手而归。此前就有安全研究员抱怨,AI护栏正在实打实地妨碍他们做攻防研究,这个功能算是Anthropic给出的一个折中方案。

    把这些拼在一起看,Anthropic的产品策略已经很清楚了:旗舰Fable负责冲能力上限、顶着最严的监管;Opus负责走量,用八成五的宽松度和更低的价格接住绝大多数真实需求。跑分还反超旗舰这件事,与其说是意外,不如说是故意留给市场的一个信号。

  • Anthropic甩出Opus 5:比Fable 5更便宜、限制更少,跑分反而更能打

    周五那天Anthropic直接放出了Opus 5,也就是它那条老牌旗舰线的最新一代。这次的定位挺有意思:模型体量比Fable 5小,但价格更便宜、限制也更松,对大多数人来说反而更好用。

    Anthropic Opus 5 发布
    Anthropic 最新旗舰模型 Opus 5 正式上线

    最反直觉的一点是,虽然个头更小,Opus 5 在官方公布的一批基准测试里居然还压过了Fable 5。对于一个”次旗舰”来说,这个成绩有点抢戏。

    Opus 5 在”反复检查自己的工作、耐心迭代直到跑通”这件事上明显更强——官方给的例子里,它能对着一个不完整的提示词,自己把一整套计算机视觉流水线写出来。

    节奏快得有点吓人

    Opus 5 距离 Opus 4.8 只隔了两个月——后者5月28日才上线。再往前看,Mythos 5、Fable 5、Sonnet 5 全是6月扎堆发的。这么一数,整条5系里现在只剩下轻量级的Haiku还没升级,其余全部到位。Anthropic今年这个迭代密度,基本是把日历表当油门踩了。

    松绑,但没有完全松开

    Opus 5 摆脱了Fable 发布以来一直被人诟病的一堆限制。和上一代一样,它不受那条覆盖Fable 和 Mythos 的30天数据留存政策约束——这条政策此前让不少在意隐私的用户很不放心。

    当然,护栏没全拆。涉及网络安全的活儿依旧盯得紧,尤其是漏洞利用和渗透测试。举个具体的例子:

    • 不允许对二进制软件扫漏洞,因为这类操作更偏进攻性;
    • 但允许在源代码里找漏洞,因为这更像是防御方在自查;
    • 整体上,这些安全分类器在 Opus 5 上触发的频率,预计比 Fable 5 少 85%——毕竟能力更弱的模型,管得也就更松。

    被拦了也别急,自动降级接住你

    Anthropic还顺手上了个新功能,专治”护栏一触发就报错”的糟心体验。用户可以选择开启一个叫 Automatic Fallbacks 的测试版特性:当某个提示词触发了安全分类器,请求会被自动转给一个能力稍弱的模型来处理。这样一来,开了这个开关的 API 用户拿到的不再是冷冰冰的错误提示,而是一条能用的回复。对天天跟接口打交道的开发者来说,这种”至少给个结果”的兜底,比一堆解释都实在。