标签: AI模型

  • Anthropic半年连推五代模型:Opus 5比自家旗舰更便宜、限制更少还更好用

    Anthropic又出手了。上周五,它悄悄上线了Opus 5——旗下那条主力重量级模型线的最新一代。有意思的是,Opus 5比自家旗舰Fable 5个头更小,但价格更便宜、限制也更少,多数场景下反而更好用。

    Opus 5在官方给出的多项基准测试里,成绩甚至反超了体量更大的旗舰Fable 5。

    Anthropic Opus 5 发布
    Anthropic 上线 Opus 5 模型(图片来源:TechCrunch)

    半年连推五代,节奏快得有点吓人

    这个更新速度值得说一句。Opus 5距离5月28日发布的Opus 4.8才过了两个月。再往前看,Mythos 5、Fable 5、Sonnet 5全挤在6月上线。算下来,整个5系列里现在只剩最轻量的Haiku还没跟上,其余全部完成了换代。对开发者来说,这意味着几乎每隔几周就得重新掂量一遍:手头的活儿到底该调用哪个模型最划算。

    更会”自己检查作业”

    Anthropic在发布博客里反复强调,Opus 5″更擅长核验自己的工作成果,会耐心地反复迭代直到把任务做成”。他们举了个例子:给它一段并不完整的提示,让它写一条计算机视觉处理流水线,Opus 5能自己把缺的部分补齐、跑通。这种”不满足于交个半成品、会自己回头查漏补缺”的特质,恰恰是过去大模型最让人头疼的短板。

    松绑:隐私党最在意的那条限制没了

    Opus 5另一个卖点是”限制更少”。它摆脱了一直缠着Fable的不少束缚,其中最关键的一点:它和前代一样,不受那条针对Fable、Mythos的30天数据留存政策约束。这条政策此前让不少注重隐私的用户心里犯嘀咕,如今Opus这边算是给了个交代。

    当然,安全护栏没有完全撤掉,尤其是网络安全相关的敏感操作。比如,Opus 5会拦住你去扫描一个软件二进制文件里的漏洞,但允许你在源代码里找漏洞——因为后者更可能是出于防御目的。Anthropic预计,这套安全分类器在Opus 5上被触发的频率,会比Fable 5低大约85%,算是给能力稍弱的模型松了松绑。


    被护栏挡住时,不再直接报错

    针对护栏偶尔”误伤”正常请求这件事,Anthropic还顺手上了个新功能。用户可以选择开启一个叫”Automatic Fallbacks(自动回退)”的测试版特性:当某个提示触发了安全分类器,系统会自动把请求转给一个能力较弱、但不受限的模型来处理。这样一来,开启该设置的API用户拿到的就是一条能用的回复,而不是冷冰冰的报错信息。

    • Opus 5比旗舰Fable 5更小,却更便宜、限制更少,多数场景更实用
    • 距上一代Opus 4.8仅两个月,5系列只剩Haiku未更新
    • 更擅长自我核验与迭代,能从残缺提示补全计算机视觉流水线
    • 不受30天数据留存政策约束,安全分类器触发率比Fable 5低约85%
    • 新增Automatic Fallbacks测试功能,触发护栏时自动改用弱模型回应
  • 自研模型跟不上,Runway改当裁判:推出生成式媒体首个模型路由器

    Runway不想再只当一家做模型的公司了。这家靠AI视频起家的初创,最近想干的是给整个生成式媒体行业当”基础设施”。周四它上线了一个叫Runway Media Router的工具,本质上是个模型路由器——你提一个需求,它自动帮你挑出最合适的图像、视频或音频生成模型来干活。

    Runway Media Router 模型路由器
    Runway推出面向生成式媒体的模型路由器Media Router(图片来源:Runway / TechCrunch)

    模型太多了,开发者根本挑不过来

    这个路由器接在本月早些时候上线的开发者平台Runway Dev上,通过API能一次性接入一大堆第三方的图像、视频、音频模型,外加Runway自家的。路由器会根据你更看重质量、速度还是成本,自动选模型。模型路由在大语言模型圈子里早就不新鲜了,但Runway说,这是头一个专门为生成式媒体做的。

    “大多数开发者根本没时间去搞懂每个模型的能力边界,也说不清它们在视频、图像、音频各类输出上到底强在哪、差在哪。我们能提供的,就是这层判断力。”——Runway首席产品官 Anthony Maggio

    道理其实挺朴素。这两年生成式媒体模型多到爆炸,新品一个接一个,开发者光是评测就够呛。通过Runway Dev,Adobe、Cloudflare、ElevenLabs、Expedia、Shutterstock、Quora这些客户可以直接把媒体生成能力嵌进自己的产品里,不用再把用户往Runway的App上导。

    成本和质量,才是客户最在意的

    路由器能设的偏好不止一种。Maggio提到,不少企业对来自中国的生成式媒体模型不太放心,可以直接把偏好设成只用美国厂商——尤其眼下特朗普政府正在琢磨对中国开放AI模型的禁令和制裁,这种需求可能会越来越常见。不过他说,客户最关心的其实还是两件事:按token算的价格,和输出质量。2026年token账单成了热门话题,那些全押智能体AI的企业,被高昂的账单狠狠上了一课。


    当不了最强模型,那就当最强的调度层

    质量这块,生成式媒体比语言模型难判断得多——一段视频动作处理得好不好、一张图构图行不行、配音对不对得上口型,都不是跑个分就能说清的。Runway的底气来自它自家创意团队多年攒下的评测经验,这层”判断力”其实早就为它5月推出的智能体产品打磨过了,现在只是把同一套技术打包给外部开发者用。

    说到底,这步棋反映的是Runway的处境。它上一款自研视频模型Gen 4.5还是去年12月发的,当时确实登顶过榜单、压过谷歌;但之后除了5月给编辑模型Aleph 2.0做过升级,就再没扔出新的前沿视频模型(Gen 5至今没影)。如今在文生视频、图生视频的榜单前列,坐着的是谷歌、字节跳动、阿里这些大块头。

    • Media Router号称首个专为生成式媒体打造的模型路由器
    • 已接入客户:Adobe、Cloudflare、ElevenLabs、Expedia、Shutterstock、Quora
    • 可按质量、速度、成本,甚至模型产地设置偏好
    • Runway近期把无限订阅改成按token计费,曾引发用户不满

    联合创始人Anastasis Germanidis说得直白:底下得有好模型,但”编排”这层越来越重要,因为大家现在是拿模型做整套营销campaign、拼多镜头成片。与其赌某一个模型永远领先,不如假设最强的模型一直在换——路由器的思路正是这样,让Runway哪怕不是那个最强模型,也能稳稳留在牌桌上。

  • Anthropic甩出Opus 5:比旗舰便宜、限制更少,跑分还反超Fable 5

    Anthropic这个更新节奏是真的快。周五,他们家的重量级模型Opus 5正式上线,距离5月28日发布的Opus 4.8才过去两个月。算上6月扎堆亮相的Mythos 5、Fable 5和Sonnet 5,整个5系列现在就剩轻量级的Haiku还没换代了。

    有意思的地方在于,Opus 5虽然个头比旗舰Fable 5小,但官方公告里列出的一堆基准测试,它反而跑赢了Fable 5。再加上它更便宜、限制更少,Anthropic自己都承认,大多数场景下用户恐怕会更愿意选Opus 5。

    官方给的说法是,Opus 5″在验证自己的工作、反复迭代直到成功这件事上强了不少”。发布材料里有个例子:面对一个信息不全的提示词,它自己把一条计算机视觉流水线从头写了出来。

    Anthropic发布Opus 5模型
    Anthropic正式发布Opus 5(图源:TechCrunch)

    隐私和限制,都比Fable宽松

    Fable 5发布以来一直被两件事拖累:一是30天数据留存政策,让不少在意隐私的用户心里犯嘀咕;二是安全分类器动不动就拦请求。Opus 5在这两点上都松了绑——它不在数据留存政策的覆盖范围内,安全分类器的触发频率官方预计也会比Fable 5低85%。逻辑很直白:能力弱一档的模型,看管自然可以松一点。

    当然,护栏没有完全拆掉。网络安全类任务还是管得最严的:Opus 5不能直接扫描软件二进制文件找漏洞,但可以在源代码里找——因为后者更可能是防守方在做安全审计,前者更像攻击者的操作。这条线画得挺讲究。

    触发护栏不再报错,自动降级接着干

    前一天还有安全研究员集体吐槽AI护栏碍事,这次Anthropic顺手给了个补救方案:一个叫Automatic Fallbacks的测试版功能。开启之后,一旦请求触发了安全分类器,系统不再甩一个错误信息给你,而是自动把请求转给一个能力弱一些的模型去处理,API用户至少能拿到一个能用的结果。

    • Opus 5比Fable 5小、便宜、限制少,多项基准反而领先
    • 不受30天数据留存政策约束,安全分类器触发预计少85%
    • 二进制漏洞扫描仍被禁止,源代码找漏洞放行
    • 新功能Automatic Fallbacks:触发护栏时自动降级到弱模型,不再直接报错

    这一手其实值得同行学:护栏要有,但别让守规矩的用户跟着受罪。旗舰模型管严点,次旗舰放宽点,再配一个自动降级兜底,体验和安全都照顾到了。至于Opus 5跑分反超Fable 5这件事,多少有点尴尬——花更多钱买旗舰的用户,怕是要重新算算账了。

  • 谷歌一口气发三款Gemini,但最想要的Pro版,又鸽了

    谷歌 DeepMind 在周二丢出了三款新模型:Gemini 3.6 Flash、3.5 Flash-Lite,以及 3.5 Flash Cyber。光看名字像是在挤牙膏,但这次的重心很明确——不跟你卷参数,卷的是便宜、快、稳。

    先说当家花旦 3.6 Flash。谷歌管它叫“主力模型”,在写代码、知识工作和多模态上都有提升,关键是把 token 消耗量砍了最多 17%,比上一代 3.5 Flash 更省钱。3.5 Flash-Lite 则是这个档位里最划算的一个,主打一个“量大管饱还便宜”。

    谷歌说,这一波发布的核心,是给那些“大规模部署 AI 智能体”的客户,交付效率、延迟和可靠性。

    有一款,专门给搞安全的

    三款里最特别的,是 3.5 Flash Cyber。它是为找漏洞、修漏洞专门微调出来的模型,价格也压得不算离谱。但谷歌给它加了道门:这款只面向政府和“可信合作伙伴”,走限量试点,不公开随便用。把安全能力收在门槛后面,既说明了它的分量,也透着谷歌对这类敏感能力的谨慎。

    真正的大招,又没来

    这次发布的看点,一半在发的东西,一半在没发的。所有人都在等的旗舰 Gemini Pro,这次依然缺席。上一次 Pro 更新还是今年二月。这几个月里,对手可没闲着:OpenAI 出了 GPT-5.5,正在铺 GPT-5.6;Anthropic 连发 Claude Opus 4.8、Claude Sonnet 5,还把前沿的 Fable 5 放开了一部分。发布节奏一对比,压力给到了谷歌这边。

    其实谷歌五月就吊过胃口,说 Pro 版“已经在内部用上了,下个月就推”。结果上周彭博社报出来:3.5 Pro 因为达不到内部性能目标,发布被往后拖了。产品负责人 Logan Kilpatrick 周二在 X 上说,3.5 Pro 正在和合作伙伴一起测,“希望很快落地”,顺带还透露团队已经启动了迄今最雄心勃勃的 Gemini 4 预训练。

    谷歌 Gemini 模型
    谷歌这次发的是 Flash 系列,旗舰 Pro 仍缺席(图源:TechCrunch)
    • Gemini 3.6 Flash:主力模型,token 用量最多降 17%,比 3.5 Flash 更便宜
    • Gemini 3.5 Flash-Lite:同档最省,适合高吞吐场景
    • Gemini 3.5 Flash Cyber:专攻漏洞挖掘与修复,仅限政府及可信伙伴试点
    • 旗舰 Pro 继续缺席,3.5 Pro 因内部目标未达成而延期

    所以这一轮,谷歌交出的答卷是“把便宜好用的 Flash 做更便宜更好用”,而真正的王牌 Pro,还在打磨。在对手疯狂刷版本的当下,这种“先发辅料、压着主菜”的节奏,到底是无奈还是策略,可能要等 3.5 Pro 真正落地那天才有答案。

  • 字节跳动放出 Seed Audio 1.0:给视频配音,AI 不再只会「念稿」

    字节跳动 Seed Audio 1.0 音频创作模型
    Seed Audio 1.0 用统一框架联合建模人声、音效与环境声(概念图)

    做短视频、短剧的人大概都有过这种崩溃:画面拍好了,配一段像样的音效比写脚本还费劲。人声要去录音棚,环境声要现找素材,音效还得一笔笔手动对时间轴。7月20日,字节跳动 Seed 团队丢出一个叫 Seed Audio 1.0 的模型,想把这个流程一口气吞掉。

    它不是拼接,是「一起想」

    过去这类工具大多是各管一摊:一个模型生成人声,一个模型找音效,最后人工混音。Seed Audio 1.0 的卖点在于,它在一个统一框架里同时建模人声、音效和环境声,端到端直接产出一段能拿来叙事的完整声音。官方一句话挺妙:声音不再只是画面的补丁,而是能直接参与讲故事,「听见」即「看见」。

    具体有三个本事。第一是精细的时间编排,按时间线控制对白和音效什么时候进场,精度能到 100 毫秒,做视频配音和广告卡点刚好。第二是音色稳,支持零样本生成和长音频延展,一个角色从头到尾音色不变,还能同一声音演多个角色、带不同情绪。第三是语种全,覆盖中文、英文、日语等 20 多种语言,重音和节奏都按当地习惯来。

    官方评测显示,在影视、短剧、动漫、播客等多数场景里,音频可用率已经跑到 90% 以上;多语言自然度方面,大部分语种 MOS 评分超过 4 分,算优秀水平。

    从「会说」到「会创作」

    这中间的区别挺关键。早几年的语音合成,本质是把文字念出来,语调再自然也还是「读稿」。Seed Audio 1.0 瞄准的是创作——你给一条指令,它自己安排谁说话、什么情绪、背景音怎么铺、什么时候淡入。对短剧和动漫团队来说,这意味着原本要分几个工种、花几天的活,可能压缩到一轮生成。

    • 影视级音频:对白、音效、环境声统一编排,叙事更连贯
    • 可控音色:长音频保持一致,同一声音可演多角色
    • 20+ 语种:自然生成,适配本地表达节奏

    先上体验,后面还有大招

    模型现在已经放在火山方舟体验中心,创作者能直接试。团队放话,接下来会接进视频参考这类多模态输入,还会做可控翻译、长音频和分轨生成,方向是把脑子里的声音构想更快变成能听见的成品。


    大模型从文本、图像一路卷到音频,Seed Audio 1.0 是个信号:AI 音频正从单点工具走向全场景创作平台。对内容创作者,门槛又低了一截;对行业,竞争也从「谁念得真」变成「谁编得巧」。

  • Ollama 融了 6500 万美元:14 个人,跑进 85% 的财富 500 强

    有个工具你可能从没听过名字,但它已经悄悄跑进了 85% 的财富 500 强企业里。它叫 Ollama,干的事很纯粹:让开发者在一行命令里,把开源大模型下载下来、在自己的电脑或服务器上跑起来。

    Ollama 创始人 Jeff Morgan(左)与 Michael Chiang(右)
    Ollama 联合创始人 Jeff Morgan(左)与 Michael Chiang(右)。(图源:David Paul Morris / Ollama)

    6500 万美元,钱从哪来

    7 月 9 日,Ollama 宣布完成 6500 万美元 B 轮融资,由 Theory Ventures 领投,Benchmark、8VC、Y Combinator 等跟投。算上早先 Benchmark 领投的 1500 万 A 轮,公司累计融资到了 8800 万美元。创始人兼 CEO Jeff Morgan 向 TechCrunch 确认了这笔交易。

    两个做过 Docker Desktop 的人

    Ollama 这事儿听着耳熟,是因为班底老道。Morgan 和联合创始人 Michael Chiang 早年在 Docker 收购他们的创业项目 Kitematic 后,参与打造了 Docker Desktop——今天超过一千万开发者每天在用的东西。Docker 把应用在不同云之间搬移变得轻松,Ollama 想对 AI 模型做同样的事:把繁琐的环境配置藏起来,让你只管跑。

    “2023 年开源模型刚出来时特别难用,它们是给研究人员准备的,不是给程序员用的,想把模型跑起来费老劲了。”Morgan 说。Ollama 就是冲着这份麻烦去的。

    数字摆出来,挺吓人

    上线三年,Ollama 现在每月有超过 890 万开发者在用,进驻了 85% 的财富 500 强,每周还新增近百万次安装。GitHub 上攒了 17.6 万 star、接近 1.7 万 fork。最夸张的是,撑起这一切的团队只有 14 个人。

    “Jeff 和 Michael 在 Docker 上做出的东西,每天有一千多万开发者在用。能做出一款在开发者里走向普适的产品,这种创造力极其罕见。”——Benchmark 合伙人 Peter Fenton

    为什么企业愿意买单

    对银行、医院这类机构来说,把数据送进第三方大模型 API 是合规上的大忌。在自己硬件上跑 Ollama,数据全程留在防火墙内,这正是它能在监管严格的行业落地的原因。Morgan 把业务的转折点放在今年 1 月前后——那时以 OpenClaw 为代表的智能体助手爆红,开源模型突然能干活了,尤其是写代码这类 agentic 任务。

    Fenton 的看法更直接:开源和闭源不是你死我活,但那些背着高额推理账单的公司,确实有动力把尽可能多的工作迁到开源模型上,只在必要时才调用 Anthropic 这类闭源模型。

    • 一行命令拉起 Llama、Mistral、DeepSeek 等开源权重模型,无需 API key
    • 本地跑不动的大模型,可走 Ollama 云端,按 GPU 时长计费而非按 token
    • 云上托管 Nemotron、GLM、DeepSeek、Kimi、MiniMax 等模型,做到首日上新
    • 免费桌面版不变,云端只是补上家里跑不了的大模型

    开源社区的疑虑

    不是所有人都鼓掌。大约一年前,就有开发者担心 Ollama 把重心偏向付费云、冷落了免费项目,把它列为开发者工具”变味”的例子。Morgan 和 Fenton 都回击说,免费桌面版没动过,云端只是把家里跑不了的大模型递到你手边。


    如果开源模型真如预期那样生成了世界上大部分 AI token,那么”谁把模型跑得稳、跑得安全、跑得便宜”这一层,就成了新的价值高地。Ollama 用 14 个人先占了坑,接下来要看这块地值不值这个价。

  • 月之暗面 Kimi K3 即将发布:2-3 万亿参数,追平 Anthropic Opus 4.8

    Moonshot Kimi 大模型
    月之暗面(Moonshot AI)旗下 Kimi 系列(图源:TechCrunch / Getty Images)

    中国大模型公司月之暗面(Moonshot AI)的下一代 Kimi 模型 K3,据《金融时报》援引匿名信源,性能预计能和 Anthropic 的 Opus 4.8 打平甚至超过。如果成真,这会是迄今中国对外发布的最大开放权重模型。

    从 K2 到 K3,差距在肉眼可见地缩小

    Kimi 的 K2 系列在开源圈口碑不错,benchmark 排得上号,离最前沿的闭源模型也没差太远。K3 要走得更远——FT 说它的参数规模在 2 万亿到 3 万亿之间,会在”未来几天”放出。对一个一直被拿来和 GPT、Claude 比的中国实验室来说,这是第一次真正站到同一起跑线附近。

    估值跟着水涨船高

    趁着这股势头,Moonshot 正在新一轮融资,估值据称冲到 315 亿美元。今年五月它刚以 200 亿估值拿了 20 亿美元——不到两个月,账面上就多了一百多亿。资本用脚投票,显然相信”中国开源模型能追平前沿”这件事不是空话。

    企业要么买自己的开源模型(比如 DeepSeek、Z.ai 或 Moonshot 的),按自己的需求训一遍;要么就继续给闭源实验室交那份越来越贵的租子。

    大背景:大家开始怀疑”租 AI”值不值

    K3 的消息,撞上了一场正热的讨论——花大价钱买 OpenAI、Anthropic 的闭源模型到底值不值。纳德拉那句”付两遍钱”的警告还在发酵,行业里不少人担心,你喂给 ChatGPT、Claude 的数据,最后会被实验室悄悄吸进自家模型里。于是一些高管开始推自己的替代方案,或者干脆建议企业用便宜的开源模型,自己训练来用。


    开放权重这条路,中国走得最坚决

    Kimi K3 如果按 FT 说的规模落地,会成为迄今最大的中国开放权重模型。这背后是同一股潮流:当算力被少数闭源巨头攥着,开放权重给了企业一条不用仰人鼻息的路。月之暗面的打法很清晰——用越来越能打的开源模型,把”生产环境里真正跑业务”的那块蛋糕从闭源手里切下来。

    当然,FT 的消息来自匿名信源,参数和发布时间都还没官宣。但方向已经清楚:中国大模型和美国前沿之间的那道缝,正在被 Kimi 这样的模型一点点焊上。对用得起、也想自己掌控数据的企业来说,这比又一场”谁的参数更多”的军备竞赛更有看头。

  • 穆拉蒂的 Thinking Machines 发布开源模型 Inkling,赌定制 AI 胜过万能模型

    Thinking Machines 创始人 Mira Murati
    Mira Murati 离开 OpenAI 后创办的 Thinking Machines Lab(图源:TechCrunch / Getty Images)

    Mira Murati 离开 OpenAI 后创办的 Thinking Machines Lab,憋了一年半,终于在周三把第一个自家模型拿了出来,名字叫 Inkling。它最特别的地方不是有多强,而是”开放权重”——外面的人能直接下载、修改、自己拿去用,不必永远挂在别人的服务器上按次付费。

    一个 9750 亿参数的”混合专家”

    Inkling 用的是混合专家架构(MoE),总参数 9750 亿,但每次只调动其中约 410 亿来干活。这种”大身子小身段”的设计现在很常见,好处是模型够大、跑起来又不至于太贵太慢。它在 45 万亿 token 的文字、图片、音频、视频上训过,四种模态它都能原生推理,不过目前只吐文字——代码、带格式的卡片、结构化数据都行。

    不跟你比谁最强,只求”哪都能凑合”

    公司自己都说了,Inkling”现在不是最强的模型,开源闭源都不是”。那它图什么?图的是”全面发展”。它会给你有把握的答案,没把握就明说”我不确定”,而不是硬编;你还能自己调”思考力度”,想快就轻一点,想深就重一点。官方说在代码 benchmark 上,它用的 token 只有英伟达 Nemotron 3 Ultra 的三分之一,就能达到同样的水平。

    由一家公司集中训练、然后定死的 AI,往往不如组织自己塑形的 AI——因为太多专业知识只属于掌握它的人。

    上面这句话,是 Thinking Machines 上周那篇博客的核心论点,也是这次发布想撑起的背景。

    真正的赌注:企业自己改的,比万能模型更好用

    Inkling 现在的定位不是成品,而是”起点”。组织可以用它的 Tinker 平台自己微调,把它变成贴合自己业务的东西。代价是:安全和合规得你自己负责,微调也确实要正经的机器学习人才。这和 OpenAI、Anthropic、Google 的打法正好反过来——那三家先把 ChatGPT、Claude、Gemini 当通用聊天机器人卖,再把智能体能力叠上去。


    为什么”自己养模型”突然成了潮流

    这个方向不是 Thinking Machines 一个人在喊。微软 CEO 纳德拉上周就警告企业,用闭源模型等于”付两遍钱”:一遍订阅费,一遍把你 prompt 和纠正里藏着的业务机密,喂进了人家的下一代模型。Hugging Face 的 Clem Delangue 也判断,前沿模型以后只留给试验和高价值任务,真正跑生产的活会挪到私有或开源模型上——这正是 Thinking Machines 押注的路线。

    最有说服力的一仗,是它和全球最大对冲基金 Bridgewater 的合作。两边用现成的开源模型,喂上 Bridgewater 自己的金融经验再训一轮,据说在金融推理测试里拿到 84.7%,干翻了一堆顶级闭源模型,而成本只有大概十四分之一。不过这分数两家自己评的,还没独立验证。

    九年还是九个月

    OpenAI 从技术面世到赚钱花了约五年,Anthropic 约三年,Thinking Machines 说自己只用了九个月。至于钱从哪来,公司一贯讳莫如深——三月它和英伟达签了部署一吉瓦 Vera Rubin 算力的合作,Inkling 全在 GB300 NVL72 上训出来的,但怎么 cover 这笔开销,它没说。

    团队现在大约 200 人,比年初一波离职(包括两位联合创始人跳回 OpenAI)后稳住了。公司的文化刻意不捧个人,按理说谁走都不算大新闻——虽然它整个故事到现在都还绑在那位知名联合创始人的名字上。

  • Grok 4.5 发布:马斯克称媲美 Opus,价格却只有对手四分之一

    上市后的第一枪

    7月8日,SpaceXAI(也就是原来的 xAI)把 Grok 4.5 推了出来。这是它上市之后的第一款模型,也是和编程工具 Cursor 合并之后的第一款联合产品。马斯克在自己的 X 平台上(X 现在算 SpaceXAI 的子公司)给它的定位很直白:这是一颗”Opus 级”的模型,但更快、更省 token、也更便宜。

    SpaceXAI 把它定义成一匹干活的工作马,编码、搭应用、办公和行政事务、研究写作这些知识工作它都能接。公司说自己 token 效率是主流模型的两倍——如果这事在真实场景里成立,对价格敏感的开发者来说是个不小的诱惑,毕竟 token 成本这两年一直是大家心里的疙瘩。

    “我们的内部判断是,Grok 4.5 大致相当于 Opus 4.7,但快得多。能力、速度加上低价的组合,才是它真正有竞争力的地方。”马斯克在 X 上这样写道。

    价格确实能打

    数字摆出来挺好看:Grok 4.5 输入每百万 token 收 2 美元,输出 6 美元。对比一下,Anthropic 的 Opus 4.7 是输入 5 美元、输出 25 美元;OpenAI 那边 Sol 最贵,输入 5 美元、输出 30 美元,最便宜的 Luna 是输入 1 美元、输出 6 美元。如果能力真如 SpaceXAI 所说,那这个定价确实把性价比拉到了第一梯队。

    Grok 4.5 模型发布
    SpaceXAI 发布 Grok 4.5,主打高性价比的通用模型(图源:TechCrunch / Getty Images)

    少了一张该有的卡片

    热闹之外也有人挑刺。宾夕法尼亚大学沃顿商学院的教授 Ethan Mollick 在 X 上点了一句:Grok 4.5 没有发模型卡(model card)。今天 Anthropic、Google DeepMind 乃至 OpenAI,每出一款前沿模型都会附上系统卡,写清楚训练数据、评估方法、已知局限。SpaceXAI 这回只晒了 benchmark,没晒评估方法。

    模型卡不是新鲜事,2019 年就被提了出来,如今已经是行业惯例,欧盟的 AI 法案甚至把模型文档列成了合规义务。一家公司只往外出漂亮的性能曲线、不交代怎么测出来的,信任上总会打个问号。公司自己跑的基准测试是起点,不是结论,毕竟谁来挑数字、怎么配环境,团队自己最有动力让结果好看。

    • Grok 4.5 定价输入 $2 / 输出 $6(每百万 token),只有 Opus 4.7 的大约四分之一。
    • 马斯克称其能力接近 Opus 4.7,但速度和性价比更突出。
    • 缺模型卡引发透明度质疑,真实水平还要等第三方评测说话。

  • 马斯克端出Grok 4.5:自称Opus级,价格却只有零头

    这几天AI圈最热闹的事之一,是马斯克旗下的SpaceXAI把新模型Grok 4.5端上了桌。这是它上市之后的第一款模型,也是收购编程工具Cursor之后,双方合力做出来的第一个产物。马斯克在X上(X现在也是SpaceXAI的一部分)直接把它对标Anthropic的Claude Opus系列,话说得很满:”基于内测客户的强烈正面反馈,我们明天就向所有人开放Grok 4.5。它是Opus级别,但更快、更省token、也更便宜。”

    Grok 4.5 发布
    SpaceXAI 发布 Grok 4.5,马斯克称其为 Opus 级模型(图源:TechCrunch / Getty Images)

    价格先把对手吓了一跳

    Grok 4.5的定价是每百万输入token收2美元、输出收6美元。对比一下就清楚了:Anthropic的Opus 4.7要5美元和25美元,OpenAI最贵的GPT-5.6 Sol是5美元和30美元。等于说,在最贵那一档,Grok 4.5把单价压到了对手的几分之一。SpaceXAI还说,它的token效率是其他主流模型的两倍——同样的活儿它吐出来的token更少,花钱自然就少。

    马斯克后来的补充更直白:”我们的内部评估认为Grok 4.5大致和Opus 4.7相当,但快得多。能力、速度加上低成本,才是它真正有竞争力的地方。”

    它到底擅长什么

    SpaceXAI把Grok 4.5定位成一匹”干活儿的马”,不是只会聊天的玩具。写代码、搭应用、处理办公室杂活、做研究、写文档,这些AI行业一直想替人自动化的活儿它都能接。而且它特别强调编程和智能体任务——这恰好是和Cursor合并之后的红利:模型是用Cursor的真实编程数据一起训出来的,SpaceXAI说它在大型代码库、跨仓库的长任务上表现尤其好。

    发布当天,开发者Evan Bacon就在X上晒了一段体验:”Grok 4.5有点离谱,它刚给我做了一个带实时数据和3D地球的火箭追踪App。”这种”能直接把东西做出来”的反馈,正是SpaceXAI想给市场留下的印象。

    • 默认进入 Grok Build、Cursor 全档位订阅,以及 SpaceXAI 的 API 控制台
    • 暂时还没在欧盟上线,官方说预计七月中旬开放
    • 和 GPT-5.6、Claude 系列挤在同一周发布,堪称今年最拥挤的模型周

    光环之下也有疑问

    不过热闹归热闹,Grok 4.5并不是没有争议。沃顿商学院教授Ethan Mollick在发布当晚就点了一句:Grok 4.5没有发模型卡(Model Card)。当Anthropic、Google DeepMind乃至OpenAI都为每一款前沿模型附上系统卡时,SpaceXAI选择只晒Benchmark、不晒评估方法。模型卡这东西2019年就被提出来了,写明用途、训练数据、局限和安全考量,如今已经是行业基本的透明作业。

    第三方的独立排名也给了它一个冷静的定位。评测机构Artificial Analysis把Grok 4.5排在真实智能体工作的第四名,落在最新的Claude系列之后。换句话说,它确实能打,但还不是榜单第一。

    所以Grok 4.5的故事,本质上不是”谁最聪明”,而是”谁最划算”。对于那些要大规模铺智能体、动辄跑几分钟几小时工程任务的公司来说,一个便宜近九成、能力只差一口气的模型,往往比榜单冠军更香。马斯克这回赌的,就是开发者更在意能不能真把活干完,而不是谁的分数更高。