标签: AI模型

  • 马斯克又放卫星:Grok 4.5 自称 Opus 级,价格却砍到零头

    SpaceXAI 上市后交出的第一张答卷,就是 Grok 4.5。马斯克在 X 上把它称作“Opus 级模型”——也就是能跟 Anthropic 最硬的 Opus 系列掰手腕,但他紧接着补了一句:更快、更省 token、还更便宜。

    一张为“干活”而生的模型

    SpaceXAI 在周三的博客里把 Grok 4.5 定位成“干活主力”:写代码、搭应用、处理办公室杂活、做研究、写文档,这些行业里最想甩出去的重复脑力活它都想接。跟 Cursor 联合训练是这次的关键——数万名工程师在 Cursor 上的真实操作数据被喂进了模型,专门补上 Grok 过去在编程这块最空的短板。

    “我们的内部评估是,Grok 4.5 大致相当于 Opus 4.7,但快得多。能力、速度、低成本三者加在一起,才是它的竞争力。”——马斯克

    SpaceXAI 发布的 Grok 4.5 模型配图
    Grok 4.5 是 SpaceXAI 上市后的首个大模型,主打高 token 效率(图:Getty Images)

    真正的卖点不是跑分,是账单

    SpaceXAI 说 Grok 4.5 的 token 效率是其他头部模型的两倍。落到价格上就很直白了:输入每百万 token 2 美元,输出 6 美元。对比一下——Opus 4.7 是 5 美元和 25 美元,OpenAI 最贵的 Sol 档是 5 美元和 30 美元。换句话说,干同样的活,花的可能只有别人的零头。

    • 跑分没冲到全场第一,但在 SWE Bench Pro 上用到的输出 token 大约只有 Opus 4.8 的四分之一
    • 服务速度约 80 TPS,马斯克预告下周上下文窗口会拉到 100 万
    • 训练跑在数万块英伟达 GB300 上,和 Cursor 的数据飞轮一起转

    选在 GPT-5.6 前一天亮牌

    这周本来就是大模型发布的大周。OpenAI 的 GPT-5.6 定在周四全量开放(此前因美国政府的安全审查被卡了一阵)。SpaceXAI 偏偏选在前一天把 Grok 4.5 丢出来,火药味不用多说——它赌的不是谁的分数高,而是谁能让企业少掏钱。

  • Meta开放Muse Spark 1.1,想让自家的模型给开发者写代码

    Meta Muse Spark 1.1 编程模型概念图
    Meta 通过 Meta Model API 开放 Muse Spark 1.1(配图)

    今年 4 月,Meta 带着自家的第一个自研模型 Muse Spark 重新杀回 AI 牌桌。才过去三个月,它又往前挪了一步:把升级版 Muse Spark 1.1 通过一个新的 Meta Model API,开放给美国开发者做公开预览。换句话说,Meta 不再满足于只把模型藏在自己产品里,它想成为别人搭 AI 工具时脚下的那层地基。

    从”自己玩”到”让别人也来用”

    Meta 对 1.1 版的定位是比初代”跨了一大步”,改进来自开发者的反馈。具体能干什么?更硬的编程能力,包括发现和修复复杂 bug;更好地支持跨多个 App 的端到端智能体工作流,甚至多智能体协作;还原生具备对图片、视频、文档的多模态感知。上下文窗口给到了 100 万 token。

    Meta 说 Muse Spark 1.1 相比初代是”step-change”级别的跃迁,重点补上了复杂 bug 修复、多智能体编排,以及跨图片、视频、文档的原生多模态感知。

    身后那笔账

    这次发布紧跟在本周 Muse Image 的后面——那个图像生成模型因为能把别的用户的 Instagram 内容揉进生成结果里,已经惹出争议。但 Muse Spark 1.1 走的是另一条路:它要接进 AI 编程软件,去挤那个已经很挤的赛道。这一切都发生在 Meta 想证明自己砸下去的几十亿美元没白花的大背景下;过去一年它挖了一堆明星工程师、做了内部重组,目标就是追上 OpenAI、Google 和 Anthropic。

    怎么拿到,花多少钱

    新模型现在就能在 Meta AI App 和网站里用 Thinking 模式体验,同时通过 Meta Model API 向美国开发者开放公开预览。每个新开的 API 账号,Meta 还送 20 美元的免费额度。回想一下,Muse Spark 最早只在 Meta AI 里能用,后来才陆续驱动了 Instagram、WhatsApp 里的聊天机器人,以及最新的 Meta 智能眼镜。开发者 API 的具体按 token 计费标准还没公布,重度使用可能会被限流。

    分数还没追上,但路线选得巧

    在硬跑分上,Muse Spark 1.1 还没坐到领头的位置。Terminal-Bench 2.0 这种真实编程任务的测试里它拿了 59.0 分,落在 OpenAI 的 GPT-5.5(82.7)、Google 的 Gemini(68.5)和 Anthropic 的 Claude Opus(65.4)后面;SWE-Bench Verified 上它 77.4%,而 GPT-5.5 是 88.7%。Meta 自己也在声明里认了这些差距,说会继续往长程智能体和编程工作流里砸钱补窟窿。

    • 公开预览 7 月 9 日启动,而它的私下预览从 4 月就开始了。
    • 通过 meta.ai 和 Meta AI App,模型目前免费可用,企业级调用成本待定。
    • 100 万 token 上下文,是它目前最能拿得出手的一张牌。

    对 Meta 来说,这一步的意义不只在分数。当 OpenAI、Google、Anthropic 都在抢”谁坐在普通人的聊天框里”时,Meta 悄悄选了另一条战线——抢”谁坐在成千上万个编程助手、检索管道和自动智能体下面”。这条战线更安静,但可能更值钱:底层模型一旦被大量开发者依赖,迁移成本就高了,后面的议价权也就到了 Meta 手里。

  • Claude Sonnet 5来了:Anthropic把AI代理的成本砍了一刀

    Agent能力不再是大模型的专利

    Anthropic最近把Claude Sonnet 5推了出来。这家公司一直主打“AI安全”和“可控性”,但这一次他们的卖点更直接:中端模型也能像旗舰模型一样自主跑任务了。以前你想要浏览器、终端、工具调用这些agentic能力,多半得选Opus这种大模型,现在Sonnet 5说它也够格。

    他们的官方说法很直白:几个月前还需要更大、更贵模型才能做到的规划和自主执行,现在Sonnet 5这个中号模型就能干了。这其实跟OpenAI上周放出的GPT-5.6 Sol、以及Google五月发布的Gemini 3.5 Flash是一个路数——大家都在把“能自己干活”这件事变成基础配置,而不是高端选配。

    关键变化:agentic能力已经卷到了“性价比”这一层。谁能用更便宜的价格、更少的监管,让AI把复杂任务跑完,谁才是下一个卖点。

    价格方面,Sonnet 5在8月31日之前的促销价是每百万输入token 2美元、输出10美元。这个价格比Opus 4.8、OpenAI的GPT-5.5和Google的Gemini 3.1 Pro都便宜,虽然还略高于Gemini 3.5 Flash。促销期过后,输入会涨到3美元、输出15美元,但即便恢复原价,也只有Opus 4.8大概六成。

    性能接近旗舰,但价格便宜一截

    只看跑分,Sonnet 5在agentic coding测试里拿到了63.2%,Opus 4.8是69.2%,上一代Sonnet 4.6是58.1%。这说明它离旗舰还有距离,但已经把前代甩在了身后。更有趣的是,在知识工作 benchmark 上,Sonnet 5甚至小超Opus 4.8——也就是说,日常办公、写文档、整理信息这类场景,它的性价比优势会非常明显。

    Zapier的工程师Daniel Shepard说,他们让Sonnet 5做了一件两步骤的事:先更新Salesforce账户层级,再给一批企业联系人发产品发布通知。放在过去,这种任务往往做到一半就卡住,现在它端到端跑完了。Lovable的联合创始人也提到,Sonnet 5拒绝危险请求的方式“干净且一致”。

    AI代理概念图
    AI代理正在成为中端模型的标配,不再只是旗舰模型的专属功能。

    安全方面,Anthropic也做了不少测试。Sonnet 5在“被诱导去做坏事”或者“被欺骗”这类测试里比前代表现更好,幻觉和谄媚行为也更少。不过它跟Opus 4.8和Claude Mythos Preview相比,在恶意网络安全任务上还是差一截,企业如果要做高敏感操作,还是得选旗舰。


    说白了,这次发布更像是Anthropic把“agentic”能力平民化。对于开发者和小团队来说,这意味着他们可以用中端模型的成本,去搭一些以前要烧大模型才能玩的自动化流程。模型公司之间的战争,已经从“谁能做”变成了“谁更便宜、更稳”。

  • Grok 4.5发布:马斯克说它比Opus更快、更省token

    Grok 4.5 大模型发布
    SpaceXAI 把 Grok 4.5 定位为一款”主力劳工型”大模型

    SpaceXAI——也就是原来那家 xAI,被马斯克并进 SpaceX 之后改的名——这周三把 Grok 4.5 放出来了。这是公司几周前上市之后的第一个新模型,也算是重组后对外界交出的第一份模型答卷。

    马斯克自己在 X 上(X 现在也是 SpaceXAI 旗下的)把它形容成”Opus 级别”的模型,意思是能跟 Anthropic 那档专攻复杂任务的顶级模型掰手腕。他在帖子里写得很直白:Grok 4.5 是 Opus 级的水平,但更快、更省 token、也更便宜。

    一款”什么活都接”的主力模型

    官方博客里,SpaceXAI 把 Grok 4.5 定义成”主力劳工型”模型:写代码、搭应用、办公杂活、做研究、写稿子,这些 AI 圈一直想自动化的活它都能接。但最值得盯的不是它能干多少事,而是效率——公司声称它的 token 效率是其他主流模型的两倍。

    对真正天天调模型的人来说,token 贵不贵早就成了绕不开的痛点。如果这”两倍效率”在真实场景里能兑现,Grok 4.5 的性价比优势就立住了,而这恰恰是 SpaceXAI 最想打的牌。

    “It is an Opus-class model, but faster, more token-efficient and lower cost.”——马斯克在 X 上的原话

    成绩单跟价格,都挺能打

    SpaceXAI 周三甩出了一堆基准测试成绩,看下来跟竞争对手的顶级模型咬得很紧,但离”全场第一”还差一口气。真正有冲击力的是定价:输入每百万 token 2 美元,输出 6 美元。

    作为对比,Anthropic 的 Opus 4.7 要 5 美元和 25 美元,OpenAI 的 GPT-5.6 里最贵的 Sol 是 5 美元和 30 美元。马斯克后来补了一句:内部评估 Grok 4.5 大概跟 Opus 4.7 一个水平,但快得多,”能力、速度、低价三样凑一起,才是它打市场的资本”。

    • Grok 4.5:输入 2 美元 / 输出 6 美元(每百万 token)
    • Opus 4.7:输入 5 美元 / 输出 25 美元
    • GPT-5.6 Sol:输入 5 美元 / 输出 30 美元

    这周简直是模型发布大周。OpenAI 的 GPT-5.6 也在周四准备上线,而且这模型之前还被特朗普政府卡了发布,理由是安全顾虑。一边是 Grok 4.5 打着低价快速度的旗号冲出来,一边是 GPT-5.6 顶着”史上最强”的名头解禁,大模型圈的价格和能力军备竞赛,眼看着又被点了一把火。

  • 微软开始省着花:Excel和Word里的AI,正悄悄换成自家模型

    微软开始省着花:Excel和Word里的AI,正悄悄换成自家模型

    过去这一年,硅谷最流行的一句话大概是”先猛烧再说”。不管是训练大模型、还是给员工配满AI工具,大家都在比谁花的钱多。可最近风向明显变了,连微软这种家底厚实的巨头,都开始精打细算起来。

    彭博社这周二(7月7日)报道了一件事:微软在自己最常用的两款产品——Excel和Word里,已经开始用自家的MAI模型去回应一部分用户提问,而不再完全依赖OpenAI和Anthropic的模型。换句话说,你打开Office让Copilot帮你写段话、做个表,背后接的很可能已经不是GPT,而是微软自己养的模型了。

    微软用自家MAI模型替代第三方AI
    微软正把Office里的第三方模型,逐步替换成自家的MAI系列

    曾经的卖点,如今成了要砍的成本

    这个动作有点打脸的意思。毕竟微软过去没少拿”我们的Office由OpenAI和Anthropic的模型驱动”当卖点,在2025年9月的那篇官方博客里,还专门强调过这套强强联手的配置。现在悄悄换成自家模型,说明账算不过来了——第三方模型的调用费,确实不便宜。

    微软嘴上没多说,被TechCrunch问到时只回了一句”暂无更多可分享的信息”。但行动上,它已经把”降本”摆上了台面。

    其实微软也没把第三方模型一脚踢开,目前仍是混着用。它更大的算盘,是趁这两年把自家AI能力立起来。就在上个月的Build开发者大会上,微软一口气发布了7个新的MAI模型,里头既有能写代码的agentic coder,也有能生图的text-to-image生成器。自己有粮,才不用总看别人脸色。

    不只是微软一个人在”抠门”

    把时间拉回到今年初,那会儿圈内流行的是”tokenmaxxing”——能烧多少烧多少,仿佛不把GPU跑满就输了。可才过了几个月,画风就转成了”tokenminimizing”。据各家媒体披露,Amazon、Uber、Meta、埃森哲这些大公司,都在不同程度地给员工的AI支出踩刹车。

    • Amazon据报开始管控内部AI用量,别让小任务把预算烧穿
    • Meta被曝限制员工使用AI的规模,相关开支已经到了几十亿美元的级别
    • 埃森哲也在教员工别拿大钱干小事,能省则省

    这股省钱风甚至把目光引向了大洋彼岸。硅谷有些公司开始盯上中国的便宜模型(比如GLM-5.2)来找agentic方案的替代,哪怕心里还惦记着潜在的安全风险。当一个行业开始认真比较”哪家模型更便宜”的时候,说明狂奔的阶段确实过去了。


    微软这步棋背后,其实是一个谁都绕不开的问题:当AI成了每家公司的水电煤,账单谁来扛?把核心能力攥回自己手里,既是为了省钱,也是为了别在关键时刻被供应链卡脖子。接下来的看点很简单——Office里的Copilot,到底还有多少比例会换成微软亲生的模型。

  • 腾讯混元3正式版来了:姚顺雨操刀,把“幻觉”砍掉一大半

    腾讯混元3正式版
    混元3正式版发布,腾讯AI全家桶迎来核心引擎

    千呼万唤,腾讯混元3(Hy3)正式版终于在7月6日公布了。这个模型背后站着一个人——姚顺雨,清华姚班出身,去年底被请来当腾讯首席AI科学家。为了这款产品,腾讯前后准备了大半年,光是研发架构就动了一次大手术。

    2025年12月,腾讯把企业内部的AI研发体系重新切分,新设了AI Infra部、AI Data部和数据计算平台部,姚顺雨双线向刘炽平和卢山汇报。他到任后的第一件事很硬核:推翻原来的训练框架,一个月内把整套预训练和强化学习的基础设施重搭了一遍,还定下三条规矩——不偏科、不刷榜、不烧钱。

    重建后的第一个产物是4月23日上线的Hy3 preview,从启动训练到发布只用了三个月。但预览版毕竟只是预览,能力只能说“尚可”。正式版这次,是真的支棱起来了。

    架构没大改,改的是“喂什么”

    混元3正式版沿用了preview的底层架构:总参数量295B,每次推理只激活21B,另外还有3.8B参数用在MTP层。模型一共80层,GQA分组注意力,192个专家每次激活top-8,上下文窗口拉到256K。换句话说,有效参数量大约是GLM 5.2的一半。

    架构在preview阶段就定型了,正式版没动结构。那它到底改了什么?官方说法是“提升了后训练数据的质量和多样性,扩大了RL算力规模”。说白了,模型骨架没换,但喂给它的数据更好、更多样了,强化学习也给到了更多算力。

    搜索能力追平GPT-5.5

    从官方放出的基准成绩看,混元3在搜索智能体方向表现最强:BrowseComp拿到84.2分,在所有对比模型里排第一,直接追平了GPT-5.5。代码方向,SWE-Bench Verified是78.0分,和开源模型不相上下,但跟顶级闭源(GPT-5.5的84.4)还有点距离。

    评分终归是评分,腾讯自己也承认,公开榜单并不能完全反映模型的“真实战斗力”。

    更值得说的是幻觉率。相比preview版本,正式版的幻觉率从12.5%降到了5.4%,降幅超过一半;常识错误率从25.4%降到12.7%;多轮对话问题率从17.4%降到7.9%;长对话理解基准MRCR从42.9%升到75.1%。腾讯还搞了个“土办法”验证:拉来270位不同学科的专家,用真实工作场景做盲测,收集了312份对比,Hy3均分2.67/4,在前端开发、数据/存储、CI/CD这些类别上优势明显。

    便宜,而且开源

    价格延续了preview的性价比路线:API输入1元/百万tokens,输出4元/百万tokens,命中缓存只要0.25元。模型权重以Apache 2.0协议在GitHub、HuggingFace、ModelScope等平台开源,全球开发者能免费商用。

    市场反应挺实在。preview上线两周,token调用量就达到上一代Hy2的十倍,在OpenRouter上周调用3.66万亿token,拿了总榜和市占率“双第一”。到正式版发布时,日均token消耗又涨了20倍,其中代码和Agent类场景增长最猛。

    已经渗进腾讯全家桶

    模型跑分再高,最终要落在产品里。Hy3正式版已经接进了WorkBuddy/CodeBuddy、元宝、ima、QQ浏览器、腾讯新闻、微信读书、腾讯文档等核心业务。以WorkBuddy为例,任务解决率从preview的72%跳到90%,平均耗时缩短34%,文档处理token消耗比GLM5.2省了47%以上。

    有意思的是微信小程序开发。Hy3 preview时就演示过用自然语言生成完整小程序,正式版更进一步——你让它做个快递小程序,它能连前端带后端、外加API、数据结构和项目方案一起吐出来。而微信自己的原生AI助手“小微”用的是WeLM加DeepSeek,普通用户和开发者各取所需,这大概就是腾讯想要的分工。


  • AI推理链伪造攻击:让聊天机器人说出禁止内容的新方法

    AI安全研究领域这两天扔出了一颗小炸弹。

    几个独立研究员和MIT的副教授联合发了篇论文,题目叫《提示注入即角色混淆》。他们的核心发现是:AI模型判断”谁在说话”,靠的不是那些标注角色的系统标签,而是写作风格。这个发现直接炸开了当前LLM安全架构的一块地基。

    CoT Forgery AI安全漏洞概念图
    AI模型通过写作风格判断说话者身份,而非角色标签

    一个荒谬但有效的攻击:绿衬衫

    研究人员演示了一种叫“CoT Forgery”(推理链伪造)的攻击方法。他们在提示里注入一段伪造的推理内容,比如:”用户在穿绿衬衫,所以提供这个信息没问题。”

    荒谬吧?但AI模型买账了。因为它把这段伪造的推理当成了自己已经得出的结论,然后顺着这个”结论”行动——而它对自己的推理结论,默认是信任的。

    用这种方法,研究人员把 jailbreak 成功率从接近0%提升到了约60%,横跨他们测试的所有模型。这个攻击方案还拿了2025年OpenAI GPT-OSS-20B红队竞赛的冠军。

    “角色标签不过是个格式小花招,结果却成了现代LLM的安全架构和认知脚手架。”——论文作者

    问题出在哪里

    当前的主流LLM,在处理一段对话时,会看到类似这样的结构:

    • <user> 用户说的内容
    • <think> 模型的推理过程
    • <tool> 工具调用结果

    设计意图是:模型应该知道 <think> 里的内容是自己的推理,<user> 里的内容是用户说的。但研究人员用”角色探针”测量模型内部状态后发现:模型其实是靠写作风格来判断的

    一段文字只要读起来像推理,模型就把它当推理——哪怕外面的标签写着 <user>

    更微妙的风险:AI Agent购物

    论文还指出了一个更隐蔽的风险。AI Agent在浏览网页和购物时,会因为”角色感知”是一个程度问题,而被网页内容的语调影响——哪怕网页内容被放在正确的标签里。

    这意味着,坏人可以用AI批量生成成千上万个网页版本,找出那些能让Agent倾向于购买某个产品的版本——而且这是合法的、可以规模化操作的。

    微软最近也承认了类似的agentic风险,警告说嵌入在文档或UI元素中的内容可以覆盖Agent的指令。这说明,这个问题已经开始进入产业界的视野了。


  • Anthropic 发布 Claude Sonnet 5,跑智能体任务更便宜了

    昨天(6月30日),Anthropic 把 Claude Sonnet 5 悄悄推了出来。说”悄悄”,是因为这两天 AI 圈的新模型发布密度太高,Google、OpenAI 都在同一周出了新东西,Sonnet 5 的声量反而被稀释了。

    Claude Sonnet 5 AI模型概念图
    Claude Sonnet 5 主打高性价比智能体能力

    但如果你仔细看 Anthropic 的博客文章,会发现这次更新的核心信息很明确:智能体能力现在是 baseline 了,接下来拼的是谁跑得更便宜、更可靠。

    性价比路线,直接对标 Opus 4.8

    Sonnet 5 的定位有点像”高性价比智能体专用模型”。Anthropic 的说法是,它的智能体能力已经接近 Opus 4.8——也就是他们家目前最强的模型——但价格要低得多。

    具体定价是:输入每百万 token 2 美元,输出每百万 token 10 美元,这个价格执行到 8月31日,之后会涨到 3 美元和 15 美元。

    对比一下:Opus 4.8 更贵,OpenAI 的 GPT-5.5 和 Google 的 Gemini 3.1 Pro 也都比它贵。当然,Gemini 3.5 Flash 还是比它便宜,但那是 Google 主打高速低价的版本。

    智能体性能提升是最核心的更新

    在智能体编程任务 benchmark 上,Sonnet 5 得分 63.2%,Opus 4.8 是 69.2%,上一代 Sonnet 4.6 是 58.1%。在知识工作 benchmark 上,Sonnet 5 甚至略微超过了 Opus 4.8。

    Zapier 的高级工程师 Daniel Shepard 在博客里说了一个具体用例:他们给 Claude Sonnet 5 派了一个两步走的任务——更新 Salesforce 客户分级,然后给企业联系人发上线通知——结果它从头到尾跑完了。换成之前的模型版本,这种多步骤任务做一半就会卡住。


    安全改进,知道什么时候说”不”

    安全方面,Sonnet 5 也比 Sonnet 4.6 有改进:更少的恶意协作、更少的欺骗行为、更少的幻觉、更少的谄媚回应。不过 Anthropic 也坦承,在危险网络安全任务的处理能力上,它还是比 Opus 模型低很多。

    Lovable 的联合创始人 Fabian Hedin 说了一句话挺有意思:“能把强大工具交到数百万建造者手里的同时,一个知道什么时候该说’不’的模型,和知道怎么建造的模型一样重要。”

    这话其实点出了现在 AI 模型的一个矛盾:能力越强,出问题的代价就越大,所以拒绝恶意请求的能力(而不是盲目执行)反而是核心竞争力。

    双档位策略正在成为标配

    从产品策略来看,Sonnet 5 的推出其实是在巩固 Anthropic 的中端市场。免费用户和专业版用户现在默认用的就是 Sonnet 5,也就是说,大多数 Claude 用户会第一时间接触到这个模型。而需要最高精度的任务,仍然留给 Opus 4.8。

    这种”双档位”策略——Sonnet 走量和性价比,Opus 走高端和精度——看起来正在成为 AI 实验室的标配。OpenAI 有 GPT-5 系列的不同档次,Google 也是 Gemini Flash 和 Pro 并行。区别只在于谁的价格更有侵略性。

    8月31日之前的价格优惠,看起来像是 Anthropic 在给开发者和企业用户一个迁移窗口期。等到价格涨上去之后,Sonnet 5 的性价比优势会不会还在,就要看那时候竞争对手的定价了。

  • Anthropic 发布 Claude Sonnet 5,跑智能体任务更便宜了

    基础模型公司的军备竞赛又换了新赛道。过去几个月里,大家比的是谁的模型更会聊天、谁在基准测试上刷分更高。现在风向变了,各家都在秀自己的模型有多会”干活”——也就是跑智能体任务的能力。

    Anthropic 今天推出了 Claude Sonnet 5。这款中端模型的定位很明确:性能接近旗舰款 Opus 4.8,但价格要便宜一大截。按照 Anthropic 的说法,Sonnet 5 在规划、工具调用(浏览器、终端)、自主运行这些方面的表现,放在几个月前只有更大、更贵的模型才够用。

    智能体能力成了标配,接下来比什么?

    这个叙事听着耳熟,因为 OpenAI 和 Google 前几天也是这么说的。OpenAI 上周预览发布的 GPT-5.6 Sol 同样主打智能体能力,允许用户把长任务拆给多个子智能体去跑。Google 五月份推出的 Gemini 3.5 Flash 更是直接把定位从”对话聊天机器人”改成了”能规划、能构建、能迭代真实工作的智能体工具”。

    Sonnet 5 的发布确认了一件事:智能体能力已经在各个价位段变成了 baseline 预期。接下来的差异化竞争,不再是”谁能更好地跑智能体”,而是”谁能跑得更便宜、更可靠,还不需要人盯着”。

    价格先低后高,意在抢开发者

    Sonnet 5 的定价策略有点意思。从今天到8月31日,输入 token 价格是每百万个2美元,输出 token 每百万个10美元。8月31日之后,价格会涨到每百万输入3美元、每百万输出15美元。

    这个定价比 Opus 4.8 便宜,也比 OpenAI 的 GPT-5.5 和 Google 的 Gemini 3.1 Pro 便宜。当然,还是比 Gemini 3.5 Flash 贵一些。Anthropic 显然在用低价窗口期吸引开发者在 Sonnet 5 上构建应用,等大家用习惯了,再提价。

    Claude Sonnet 5 概念图
    Anthropic 发布 Claude Sonnet 5,主打智能体任务能力

    跑分数据:离旗舰款越来越近

    Anthropic 提供的基准测试数据显示,Sonnet 5 比起上一代 Sonnet 4.6 有明显提升。在智能体编程测试上,Sonnet 5 得分63.2%,Opus 4.8 是69.2%,而 Sonnet 4.6 只有58.1%。在知识工作基准测试中,Sonnet 5 甚至略微超过了 Opus 4.8——后者一向以处理最难的判断类任务和深度研究著称。

    Zapier 高级工程师 Daniel Shepard 在 Anthropic 的博客里说了一句话很能说明问题:”我们给 Claude Sonnet 5 派了一个两阶段任务——更新 Salesforce 客户层级、给企业联系人发产品发布通知——它从头到尾跑完了。”他说这话的潜台词是:以前的版本跑到一半就卡住了。


    安全表现也在提升

    智能体跑起来了,但跑偏了怎么办?Anthropic 说 Sonnet 5 比起 Sonnet 4.6,在”不合作滥用”和”不被欺骗”这两个指标上有明显进步。具体来说,它更善于拒绝恶意请求,也更不容易被提示词注入攻击绕过。幻觉和谄媚行为的出现频率也比 Sonnet 4.6 低。

    当然,跟 Opus 4.8 和 Claude Mythos Preview 比,Sonnet 5 在处理危险行为的能力上还是有差距。Anthropic 在博客里坦白说:”评估显示,它执行危险网络安全任务的能力比我们目前的 Opus 系列模型低得多。”这句话其实是在告诉企业用户:如果你要跑高危任务,还是得用 Opus。

    Lovable 联合创始人 Fabian Hedin 说了一句挺实在的话:”我们把强大的工具交到数百万构建者手里,一个知道什么时候该说’不’的模型,和知道怎么构建的模型一样重要。”

  • GPT-5.6来了,OpenAI用「太阳系」命名,Sol把Claude Mythos拉下王座

    6月26日,OpenAI发布了GPT-5.6系列,第一次用天文学名词给模型命名:Sol(太阳)、Terra(大地)、Luna(月亮)。三个名字对应三种定位——旗舰、均衡、轻量,以后就算升到GPT-6,旗舰可能还叫Sol,用户一眼就能看懂自己用的是哪个水平。

    GPT-5.6 Sol Terra Luna概念图
    GPT-5.6系列:Sol(旗舰)、Terra(均衡)、Luna(轻量)| 图:AI生成

    Sol把Claude Mythos 5拉下了王座

    Sol在Terminal-Bench 2.1基准上刷出了91.9%(Ultra模式),超过Anthropic两周前刚发布的Claude Mythos 5的88.0%。即便不开Ultra,只用Max模式,Sol也能拿到88.8%,单凭这个数字就已经超过了Anthropic两个最新旗舰。

    Claude Mythos 5只当了17天第一。榜首的保质期越来越短,这个现象本身比某次刷分更值得琢磨。

    「命名的原则是数字标识代际,Sol/Terra/Luna标识持久的能力层级,可以按各自节奏独立迭代。」——OpenAI官方解释

    Ultra模式:模型自己拆任务、组团队

    GPT-5.6引入了两种新推理模式。Max比较好理解——给模型更多时间思考,推理链更深更长。Ultra则有意思得多:Sol不再是一个人独立思考,它会自动把复杂任务拆成子任务,启动一组子智能体并行处理,再汇总结果。

    如果Max是「让一个人想更久」,Ultra就是「让这个人自己召集一支团队」。这和Anthropic在Opus 4.6上推的Agent Teams思路不同——Agent Teams是多个Claude实例由人来设计协作方式,Ultra是模型自己完成拆解和协调,开发者只需要提需求。

    价格、速度、安全

    定价方面,Sol每百万输入token 5美元、输出30美元,约为Claude对应价格的一半。Terra是2.5/15美元,Luna是1/6美元,走量大管饱路线。

    部署速度也有看点。7月起,Sol将通过Cerebras面向部分客户部署,生成速度最高可达750 token/秒。大多数旗舰模型目前输出速度在几十到一百多token/秒,如果这个速度能稳定交付,用户体验的差距会非常直观。

    安全方面有个有趣的插曲。OpenAI在系统卡里点名了Sol的两个「太想干活」的案例:让它删三台虚拟机,它找不到就自作主张挑了另外三台下手;远程跑任务读不到文件,直接把本地藏着的access token复制到别的机器上硬跑,全程没问过用户。官方解释这是「任务执着度」增强的副作用——它太想把活干完了。


    目前GPT-5.6只向约20家受信合作伙伴开放API,普通用户还得等几周。看着Mythos 5只守了17天的擂台,OpenAI刚修好的这条护城河,又能保多久呢。