标签: AI模型

  • Ollama 融了 6500 万美元:14 个人,跑进 85% 的财富 500 强

    有个工具你可能从没听过名字,但它已经悄悄跑进了 85% 的财富 500 强企业里。它叫 Ollama,干的事很纯粹:让开发者在一行命令里,把开源大模型下载下来、在自己的电脑或服务器上跑起来。

    Ollama 创始人 Jeff Morgan(左)与 Michael Chiang(右)
    Ollama 联合创始人 Jeff Morgan(左)与 Michael Chiang(右)。(图源:David Paul Morris / Ollama)

    6500 万美元,钱从哪来

    7 月 9 日,Ollama 宣布完成 6500 万美元 B 轮融资,由 Theory Ventures 领投,Benchmark、8VC、Y Combinator 等跟投。算上早先 Benchmark 领投的 1500 万 A 轮,公司累计融资到了 8800 万美元。创始人兼 CEO Jeff Morgan 向 TechCrunch 确认了这笔交易。

    两个做过 Docker Desktop 的人

    Ollama 这事儿听着耳熟,是因为班底老道。Morgan 和联合创始人 Michael Chiang 早年在 Docker 收购他们的创业项目 Kitematic 后,参与打造了 Docker Desktop——今天超过一千万开发者每天在用的东西。Docker 把应用在不同云之间搬移变得轻松,Ollama 想对 AI 模型做同样的事:把繁琐的环境配置藏起来,让你只管跑。

    “2023 年开源模型刚出来时特别难用,它们是给研究人员准备的,不是给程序员用的,想把模型跑起来费老劲了。”Morgan 说。Ollama 就是冲着这份麻烦去的。

    数字摆出来,挺吓人

    上线三年,Ollama 现在每月有超过 890 万开发者在用,进驻了 85% 的财富 500 强,每周还新增近百万次安装。GitHub 上攒了 17.6 万 star、接近 1.7 万 fork。最夸张的是,撑起这一切的团队只有 14 个人。

    “Jeff 和 Michael 在 Docker 上做出的东西,每天有一千多万开发者在用。能做出一款在开发者里走向普适的产品,这种创造力极其罕见。”——Benchmark 合伙人 Peter Fenton

    为什么企业愿意买单

    对银行、医院这类机构来说,把数据送进第三方大模型 API 是合规上的大忌。在自己硬件上跑 Ollama,数据全程留在防火墙内,这正是它能在监管严格的行业落地的原因。Morgan 把业务的转折点放在今年 1 月前后——那时以 OpenClaw 为代表的智能体助手爆红,开源模型突然能干活了,尤其是写代码这类 agentic 任务。

    Fenton 的看法更直接:开源和闭源不是你死我活,但那些背着高额推理账单的公司,确实有动力把尽可能多的工作迁到开源模型上,只在必要时才调用 Anthropic 这类闭源模型。

    • 一行命令拉起 Llama、Mistral、DeepSeek 等开源权重模型,无需 API key
    • 本地跑不动的大模型,可走 Ollama 云端,按 GPU 时长计费而非按 token
    • 云上托管 Nemotron、GLM、DeepSeek、Kimi、MiniMax 等模型,做到首日上新
    • 免费桌面版不变,云端只是补上家里跑不了的大模型

    开源社区的疑虑

    不是所有人都鼓掌。大约一年前,就有开发者担心 Ollama 把重心偏向付费云、冷落了免费项目,把它列为开发者工具”变味”的例子。Morgan 和 Fenton 都回击说,免费桌面版没动过,云端只是把家里跑不了的大模型递到你手边。


    如果开源模型真如预期那样生成了世界上大部分 AI token,那么”谁把模型跑得稳、跑得安全、跑得便宜”这一层,就成了新的价值高地。Ollama 用 14 个人先占了坑,接下来要看这块地值不值这个价。

  • 月之暗面 Kimi K3 即将发布:2-3 万亿参数,追平 Anthropic Opus 4.8

    Moonshot Kimi 大模型
    月之暗面(Moonshot AI)旗下 Kimi 系列(图源:TechCrunch / Getty Images)

    中国大模型公司月之暗面(Moonshot AI)的下一代 Kimi 模型 K3,据《金融时报》援引匿名信源,性能预计能和 Anthropic 的 Opus 4.8 打平甚至超过。如果成真,这会是迄今中国对外发布的最大开放权重模型。

    从 K2 到 K3,差距在肉眼可见地缩小

    Kimi 的 K2 系列在开源圈口碑不错,benchmark 排得上号,离最前沿的闭源模型也没差太远。K3 要走得更远——FT 说它的参数规模在 2 万亿到 3 万亿之间,会在”未来几天”放出。对一个一直被拿来和 GPT、Claude 比的中国实验室来说,这是第一次真正站到同一起跑线附近。

    估值跟着水涨船高

    趁着这股势头,Moonshot 正在新一轮融资,估值据称冲到 315 亿美元。今年五月它刚以 200 亿估值拿了 20 亿美元——不到两个月,账面上就多了一百多亿。资本用脚投票,显然相信”中国开源模型能追平前沿”这件事不是空话。

    企业要么买自己的开源模型(比如 DeepSeek、Z.ai 或 Moonshot 的),按自己的需求训一遍;要么就继续给闭源实验室交那份越来越贵的租子。

    大背景:大家开始怀疑”租 AI”值不值

    K3 的消息,撞上了一场正热的讨论——花大价钱买 OpenAI、Anthropic 的闭源模型到底值不值。纳德拉那句”付两遍钱”的警告还在发酵,行业里不少人担心,你喂给 ChatGPT、Claude 的数据,最后会被实验室悄悄吸进自家模型里。于是一些高管开始推自己的替代方案,或者干脆建议企业用便宜的开源模型,自己训练来用。


    开放权重这条路,中国走得最坚决

    Kimi K3 如果按 FT 说的规模落地,会成为迄今最大的中国开放权重模型。这背后是同一股潮流:当算力被少数闭源巨头攥着,开放权重给了企业一条不用仰人鼻息的路。月之暗面的打法很清晰——用越来越能打的开源模型,把”生产环境里真正跑业务”的那块蛋糕从闭源手里切下来。

    当然,FT 的消息来自匿名信源,参数和发布时间都还没官宣。但方向已经清楚:中国大模型和美国前沿之间的那道缝,正在被 Kimi 这样的模型一点点焊上。对用得起、也想自己掌控数据的企业来说,这比又一场”谁的参数更多”的军备竞赛更有看头。

  • 穆拉蒂的 Thinking Machines 发布开源模型 Inkling,赌定制 AI 胜过万能模型

    Thinking Machines 创始人 Mira Murati
    Mira Murati 离开 OpenAI 后创办的 Thinking Machines Lab(图源:TechCrunch / Getty Images)

    Mira Murati 离开 OpenAI 后创办的 Thinking Machines Lab,憋了一年半,终于在周三把第一个自家模型拿了出来,名字叫 Inkling。它最特别的地方不是有多强,而是”开放权重”——外面的人能直接下载、修改、自己拿去用,不必永远挂在别人的服务器上按次付费。

    一个 9750 亿参数的”混合专家”

    Inkling 用的是混合专家架构(MoE),总参数 9750 亿,但每次只调动其中约 410 亿来干活。这种”大身子小身段”的设计现在很常见,好处是模型够大、跑起来又不至于太贵太慢。它在 45 万亿 token 的文字、图片、音频、视频上训过,四种模态它都能原生推理,不过目前只吐文字——代码、带格式的卡片、结构化数据都行。

    不跟你比谁最强,只求”哪都能凑合”

    公司自己都说了,Inkling”现在不是最强的模型,开源闭源都不是”。那它图什么?图的是”全面发展”。它会给你有把握的答案,没把握就明说”我不确定”,而不是硬编;你还能自己调”思考力度”,想快就轻一点,想深就重一点。官方说在代码 benchmark 上,它用的 token 只有英伟达 Nemotron 3 Ultra 的三分之一,就能达到同样的水平。

    由一家公司集中训练、然后定死的 AI,往往不如组织自己塑形的 AI——因为太多专业知识只属于掌握它的人。

    上面这句话,是 Thinking Machines 上周那篇博客的核心论点,也是这次发布想撑起的背景。

    真正的赌注:企业自己改的,比万能模型更好用

    Inkling 现在的定位不是成品,而是”起点”。组织可以用它的 Tinker 平台自己微调,把它变成贴合自己业务的东西。代价是:安全和合规得你自己负责,微调也确实要正经的机器学习人才。这和 OpenAI、Anthropic、Google 的打法正好反过来——那三家先把 ChatGPT、Claude、Gemini 当通用聊天机器人卖,再把智能体能力叠上去。


    为什么”自己养模型”突然成了潮流

    这个方向不是 Thinking Machines 一个人在喊。微软 CEO 纳德拉上周就警告企业,用闭源模型等于”付两遍钱”:一遍订阅费,一遍把你 prompt 和纠正里藏着的业务机密,喂进了人家的下一代模型。Hugging Face 的 Clem Delangue 也判断,前沿模型以后只留给试验和高价值任务,真正跑生产的活会挪到私有或开源模型上——这正是 Thinking Machines 押注的路线。

    最有说服力的一仗,是它和全球最大对冲基金 Bridgewater 的合作。两边用现成的开源模型,喂上 Bridgewater 自己的金融经验再训一轮,据说在金融推理测试里拿到 84.7%,干翻了一堆顶级闭源模型,而成本只有大概十四分之一。不过这分数两家自己评的,还没独立验证。

    九年还是九个月

    OpenAI 从技术面世到赚钱花了约五年,Anthropic 约三年,Thinking Machines 说自己只用了九个月。至于钱从哪来,公司一贯讳莫如深——三月它和英伟达签了部署一吉瓦 Vera Rubin 算力的合作,Inkling 全在 GB300 NVL72 上训出来的,但怎么 cover 这笔开销,它没说。

    团队现在大约 200 人,比年初一波离职(包括两位联合创始人跳回 OpenAI)后稳住了。公司的文化刻意不捧个人,按理说谁走都不算大新闻——虽然它整个故事到现在都还绑在那位知名联合创始人的名字上。

  • Grok 4.5 发布:马斯克称媲美 Opus,价格却只有对手四分之一

    上市后的第一枪

    7月8日,SpaceXAI(也就是原来的 xAI)把 Grok 4.5 推了出来。这是它上市之后的第一款模型,也是和编程工具 Cursor 合并之后的第一款联合产品。马斯克在自己的 X 平台上(X 现在算 SpaceXAI 的子公司)给它的定位很直白:这是一颗”Opus 级”的模型,但更快、更省 token、也更便宜。

    SpaceXAI 把它定义成一匹干活的工作马,编码、搭应用、办公和行政事务、研究写作这些知识工作它都能接。公司说自己 token 效率是主流模型的两倍——如果这事在真实场景里成立,对价格敏感的开发者来说是个不小的诱惑,毕竟 token 成本这两年一直是大家心里的疙瘩。

    “我们的内部判断是,Grok 4.5 大致相当于 Opus 4.7,但快得多。能力、速度加上低价的组合,才是它真正有竞争力的地方。”马斯克在 X 上这样写道。

    价格确实能打

    数字摆出来挺好看:Grok 4.5 输入每百万 token 收 2 美元,输出 6 美元。对比一下,Anthropic 的 Opus 4.7 是输入 5 美元、输出 25 美元;OpenAI 那边 Sol 最贵,输入 5 美元、输出 30 美元,最便宜的 Luna 是输入 1 美元、输出 6 美元。如果能力真如 SpaceXAI 所说,那这个定价确实把性价比拉到了第一梯队。

    Grok 4.5 模型发布
    SpaceXAI 发布 Grok 4.5,主打高性价比的通用模型(图源:TechCrunch / Getty Images)

    少了一张该有的卡片

    热闹之外也有人挑刺。宾夕法尼亚大学沃顿商学院的教授 Ethan Mollick 在 X 上点了一句:Grok 4.5 没有发模型卡(model card)。今天 Anthropic、Google DeepMind 乃至 OpenAI,每出一款前沿模型都会附上系统卡,写清楚训练数据、评估方法、已知局限。SpaceXAI 这回只晒了 benchmark,没晒评估方法。

    模型卡不是新鲜事,2019 年就被提了出来,如今已经是行业惯例,欧盟的 AI 法案甚至把模型文档列成了合规义务。一家公司只往外出漂亮的性能曲线、不交代怎么测出来的,信任上总会打个问号。公司自己跑的基准测试是起点,不是结论,毕竟谁来挑数字、怎么配环境,团队自己最有动力让结果好看。

    • Grok 4.5 定价输入 $2 / 输出 $6(每百万 token),只有 Opus 4.7 的大约四分之一。
    • 马斯克称其能力接近 Opus 4.7,但速度和性价比更突出。
    • 缺模型卡引发透明度质疑,真实水平还要等第三方评测说话。

  • 马斯克端出Grok 4.5:自称Opus级,价格却只有零头

    这几天AI圈最热闹的事之一,是马斯克旗下的SpaceXAI把新模型Grok 4.5端上了桌。这是它上市之后的第一款模型,也是收购编程工具Cursor之后,双方合力做出来的第一个产物。马斯克在X上(X现在也是SpaceXAI的一部分)直接把它对标Anthropic的Claude Opus系列,话说得很满:”基于内测客户的强烈正面反馈,我们明天就向所有人开放Grok 4.5。它是Opus级别,但更快、更省token、也更便宜。”

    Grok 4.5 发布
    SpaceXAI 发布 Grok 4.5,马斯克称其为 Opus 级模型(图源:TechCrunch / Getty Images)

    价格先把对手吓了一跳

    Grok 4.5的定价是每百万输入token收2美元、输出收6美元。对比一下就清楚了:Anthropic的Opus 4.7要5美元和25美元,OpenAI最贵的GPT-5.6 Sol是5美元和30美元。等于说,在最贵那一档,Grok 4.5把单价压到了对手的几分之一。SpaceXAI还说,它的token效率是其他主流模型的两倍——同样的活儿它吐出来的token更少,花钱自然就少。

    马斯克后来的补充更直白:”我们的内部评估认为Grok 4.5大致和Opus 4.7相当,但快得多。能力、速度加上低成本,才是它真正有竞争力的地方。”

    它到底擅长什么

    SpaceXAI把Grok 4.5定位成一匹”干活儿的马”,不是只会聊天的玩具。写代码、搭应用、处理办公室杂活、做研究、写文档,这些AI行业一直想替人自动化的活儿它都能接。而且它特别强调编程和智能体任务——这恰好是和Cursor合并之后的红利:模型是用Cursor的真实编程数据一起训出来的,SpaceXAI说它在大型代码库、跨仓库的长任务上表现尤其好。

    发布当天,开发者Evan Bacon就在X上晒了一段体验:”Grok 4.5有点离谱,它刚给我做了一个带实时数据和3D地球的火箭追踪App。”这种”能直接把东西做出来”的反馈,正是SpaceXAI想给市场留下的印象。

    • 默认进入 Grok Build、Cursor 全档位订阅,以及 SpaceXAI 的 API 控制台
    • 暂时还没在欧盟上线,官方说预计七月中旬开放
    • 和 GPT-5.6、Claude 系列挤在同一周发布,堪称今年最拥挤的模型周

    光环之下也有疑问

    不过热闹归热闹,Grok 4.5并不是没有争议。沃顿商学院教授Ethan Mollick在发布当晚就点了一句:Grok 4.5没有发模型卡(Model Card)。当Anthropic、Google DeepMind乃至OpenAI都为每一款前沿模型附上系统卡时,SpaceXAI选择只晒Benchmark、不晒评估方法。模型卡这东西2019年就被提出来了,写明用途、训练数据、局限和安全考量,如今已经是行业基本的透明作业。

    第三方的独立排名也给了它一个冷静的定位。评测机构Artificial Analysis把Grok 4.5排在真实智能体工作的第四名,落在最新的Claude系列之后。换句话说,它确实能打,但还不是榜单第一。

    所以Grok 4.5的故事,本质上不是”谁最聪明”,而是”谁最划算”。对于那些要大规模铺智能体、动辄跑几分钟几小时工程任务的公司来说,一个便宜近九成、能力只差一口气的模型,往往比榜单冠军更香。马斯克这回赌的,就是开发者更在意能不能真把活干完,而不是谁的分数更高。

  • 马斯克又放卫星:Grok 4.5 自称 Opus 级,价格却砍到零头

    SpaceXAI 上市后交出的第一张答卷,就是 Grok 4.5。马斯克在 X 上把它称作“Opus 级模型”——也就是能跟 Anthropic 最硬的 Opus 系列掰手腕,但他紧接着补了一句:更快、更省 token、还更便宜。

    一张为“干活”而生的模型

    SpaceXAI 在周三的博客里把 Grok 4.5 定位成“干活主力”:写代码、搭应用、处理办公室杂活、做研究、写文档,这些行业里最想甩出去的重复脑力活它都想接。跟 Cursor 联合训练是这次的关键——数万名工程师在 Cursor 上的真实操作数据被喂进了模型,专门补上 Grok 过去在编程这块最空的短板。

    “我们的内部评估是,Grok 4.5 大致相当于 Opus 4.7,但快得多。能力、速度、低成本三者加在一起,才是它的竞争力。”——马斯克

    SpaceXAI 发布的 Grok 4.5 模型配图
    Grok 4.5 是 SpaceXAI 上市后的首个大模型,主打高 token 效率(图:Getty Images)

    真正的卖点不是跑分,是账单

    SpaceXAI 说 Grok 4.5 的 token 效率是其他头部模型的两倍。落到价格上就很直白了:输入每百万 token 2 美元,输出 6 美元。对比一下——Opus 4.7 是 5 美元和 25 美元,OpenAI 最贵的 Sol 档是 5 美元和 30 美元。换句话说,干同样的活,花的可能只有别人的零头。

    • 跑分没冲到全场第一,但在 SWE Bench Pro 上用到的输出 token 大约只有 Opus 4.8 的四分之一
    • 服务速度约 80 TPS,马斯克预告下周上下文窗口会拉到 100 万
    • 训练跑在数万块英伟达 GB300 上,和 Cursor 的数据飞轮一起转

    选在 GPT-5.6 前一天亮牌

    这周本来就是大模型发布的大周。OpenAI 的 GPT-5.6 定在周四全量开放(此前因美国政府的安全审查被卡了一阵)。SpaceXAI 偏偏选在前一天把 Grok 4.5 丢出来,火药味不用多说——它赌的不是谁的分数高,而是谁能让企业少掏钱。

  • Meta开放Muse Spark 1.1,想让自家的模型给开发者写代码

    Meta Muse Spark 1.1 编程模型概念图
    Meta 通过 Meta Model API 开放 Muse Spark 1.1(配图)

    今年 4 月,Meta 带着自家的第一个自研模型 Muse Spark 重新杀回 AI 牌桌。才过去三个月,它又往前挪了一步:把升级版 Muse Spark 1.1 通过一个新的 Meta Model API,开放给美国开发者做公开预览。换句话说,Meta 不再满足于只把模型藏在自己产品里,它想成为别人搭 AI 工具时脚下的那层地基。

    从”自己玩”到”让别人也来用”

    Meta 对 1.1 版的定位是比初代”跨了一大步”,改进来自开发者的反馈。具体能干什么?更硬的编程能力,包括发现和修复复杂 bug;更好地支持跨多个 App 的端到端智能体工作流,甚至多智能体协作;还原生具备对图片、视频、文档的多模态感知。上下文窗口给到了 100 万 token。

    Meta 说 Muse Spark 1.1 相比初代是”step-change”级别的跃迁,重点补上了复杂 bug 修复、多智能体编排,以及跨图片、视频、文档的原生多模态感知。

    身后那笔账

    这次发布紧跟在本周 Muse Image 的后面——那个图像生成模型因为能把别的用户的 Instagram 内容揉进生成结果里,已经惹出争议。但 Muse Spark 1.1 走的是另一条路:它要接进 AI 编程软件,去挤那个已经很挤的赛道。这一切都发生在 Meta 想证明自己砸下去的几十亿美元没白花的大背景下;过去一年它挖了一堆明星工程师、做了内部重组,目标就是追上 OpenAI、Google 和 Anthropic。

    怎么拿到,花多少钱

    新模型现在就能在 Meta AI App 和网站里用 Thinking 模式体验,同时通过 Meta Model API 向美国开发者开放公开预览。每个新开的 API 账号,Meta 还送 20 美元的免费额度。回想一下,Muse Spark 最早只在 Meta AI 里能用,后来才陆续驱动了 Instagram、WhatsApp 里的聊天机器人,以及最新的 Meta 智能眼镜。开发者 API 的具体按 token 计费标准还没公布,重度使用可能会被限流。

    分数还没追上,但路线选得巧

    在硬跑分上,Muse Spark 1.1 还没坐到领头的位置。Terminal-Bench 2.0 这种真实编程任务的测试里它拿了 59.0 分,落在 OpenAI 的 GPT-5.5(82.7)、Google 的 Gemini(68.5)和 Anthropic 的 Claude Opus(65.4)后面;SWE-Bench Verified 上它 77.4%,而 GPT-5.5 是 88.7%。Meta 自己也在声明里认了这些差距,说会继续往长程智能体和编程工作流里砸钱补窟窿。

    • 公开预览 7 月 9 日启动,而它的私下预览从 4 月就开始了。
    • 通过 meta.ai 和 Meta AI App,模型目前免费可用,企业级调用成本待定。
    • 100 万 token 上下文,是它目前最能拿得出手的一张牌。

    对 Meta 来说,这一步的意义不只在分数。当 OpenAI、Google、Anthropic 都在抢”谁坐在普通人的聊天框里”时,Meta 悄悄选了另一条战线——抢”谁坐在成千上万个编程助手、检索管道和自动智能体下面”。这条战线更安静,但可能更值钱:底层模型一旦被大量开发者依赖,迁移成本就高了,后面的议价权也就到了 Meta 手里。

  • Claude Sonnet 5来了:Anthropic把AI代理的成本砍了一刀

    Agent能力不再是大模型的专利

    Anthropic最近把Claude Sonnet 5推了出来。这家公司一直主打“AI安全”和“可控性”,但这一次他们的卖点更直接:中端模型也能像旗舰模型一样自主跑任务了。以前你想要浏览器、终端、工具调用这些agentic能力,多半得选Opus这种大模型,现在Sonnet 5说它也够格。

    他们的官方说法很直白:几个月前还需要更大、更贵模型才能做到的规划和自主执行,现在Sonnet 5这个中号模型就能干了。这其实跟OpenAI上周放出的GPT-5.6 Sol、以及Google五月发布的Gemini 3.5 Flash是一个路数——大家都在把“能自己干活”这件事变成基础配置,而不是高端选配。

    关键变化:agentic能力已经卷到了“性价比”这一层。谁能用更便宜的价格、更少的监管,让AI把复杂任务跑完,谁才是下一个卖点。

    价格方面,Sonnet 5在8月31日之前的促销价是每百万输入token 2美元、输出10美元。这个价格比Opus 4.8、OpenAI的GPT-5.5和Google的Gemini 3.1 Pro都便宜,虽然还略高于Gemini 3.5 Flash。促销期过后,输入会涨到3美元、输出15美元,但即便恢复原价,也只有Opus 4.8大概六成。

    性能接近旗舰,但价格便宜一截

    只看跑分,Sonnet 5在agentic coding测试里拿到了63.2%,Opus 4.8是69.2%,上一代Sonnet 4.6是58.1%。这说明它离旗舰还有距离,但已经把前代甩在了身后。更有趣的是,在知识工作 benchmark 上,Sonnet 5甚至小超Opus 4.8——也就是说,日常办公、写文档、整理信息这类场景,它的性价比优势会非常明显。

    Zapier的工程师Daniel Shepard说,他们让Sonnet 5做了一件两步骤的事:先更新Salesforce账户层级,再给一批企业联系人发产品发布通知。放在过去,这种任务往往做到一半就卡住,现在它端到端跑完了。Lovable的联合创始人也提到,Sonnet 5拒绝危险请求的方式“干净且一致”。

    AI代理概念图
    AI代理正在成为中端模型的标配,不再只是旗舰模型的专属功能。

    安全方面,Anthropic也做了不少测试。Sonnet 5在“被诱导去做坏事”或者“被欺骗”这类测试里比前代表现更好,幻觉和谄媚行为也更少。不过它跟Opus 4.8和Claude Mythos Preview相比,在恶意网络安全任务上还是差一截,企业如果要做高敏感操作,还是得选旗舰。


    说白了,这次发布更像是Anthropic把“agentic”能力平民化。对于开发者和小团队来说,这意味着他们可以用中端模型的成本,去搭一些以前要烧大模型才能玩的自动化流程。模型公司之间的战争,已经从“谁能做”变成了“谁更便宜、更稳”。

  • Grok 4.5发布:马斯克说它比Opus更快、更省token

    Grok 4.5 大模型发布
    SpaceXAI 把 Grok 4.5 定位为一款”主力劳工型”大模型

    SpaceXAI——也就是原来那家 xAI,被马斯克并进 SpaceX 之后改的名——这周三把 Grok 4.5 放出来了。这是公司几周前上市之后的第一个新模型,也算是重组后对外界交出的第一份模型答卷。

    马斯克自己在 X 上(X 现在也是 SpaceXAI 旗下的)把它形容成”Opus 级别”的模型,意思是能跟 Anthropic 那档专攻复杂任务的顶级模型掰手腕。他在帖子里写得很直白:Grok 4.5 是 Opus 级的水平,但更快、更省 token、也更便宜。

    一款”什么活都接”的主力模型

    官方博客里,SpaceXAI 把 Grok 4.5 定义成”主力劳工型”模型:写代码、搭应用、办公杂活、做研究、写稿子,这些 AI 圈一直想自动化的活它都能接。但最值得盯的不是它能干多少事,而是效率——公司声称它的 token 效率是其他主流模型的两倍。

    对真正天天调模型的人来说,token 贵不贵早就成了绕不开的痛点。如果这”两倍效率”在真实场景里能兑现,Grok 4.5 的性价比优势就立住了,而这恰恰是 SpaceXAI 最想打的牌。

    “It is an Opus-class model, but faster, more token-efficient and lower cost.”——马斯克在 X 上的原话

    成绩单跟价格,都挺能打

    SpaceXAI 周三甩出了一堆基准测试成绩,看下来跟竞争对手的顶级模型咬得很紧,但离”全场第一”还差一口气。真正有冲击力的是定价:输入每百万 token 2 美元,输出 6 美元。

    作为对比,Anthropic 的 Opus 4.7 要 5 美元和 25 美元,OpenAI 的 GPT-5.6 里最贵的 Sol 是 5 美元和 30 美元。马斯克后来补了一句:内部评估 Grok 4.5 大概跟 Opus 4.7 一个水平,但快得多,”能力、速度、低价三样凑一起,才是它打市场的资本”。

    • Grok 4.5:输入 2 美元 / 输出 6 美元(每百万 token)
    • Opus 4.7:输入 5 美元 / 输出 25 美元
    • GPT-5.6 Sol:输入 5 美元 / 输出 30 美元

    这周简直是模型发布大周。OpenAI 的 GPT-5.6 也在周四准备上线,而且这模型之前还被特朗普政府卡了发布,理由是安全顾虑。一边是 Grok 4.5 打着低价快速度的旗号冲出来,一边是 GPT-5.6 顶着”史上最强”的名头解禁,大模型圈的价格和能力军备竞赛,眼看着又被点了一把火。

  • 微软开始省着花:Excel和Word里的AI,正悄悄换成自家模型

    微软开始省着花:Excel和Word里的AI,正悄悄换成自家模型

    过去这一年,硅谷最流行的一句话大概是”先猛烧再说”。不管是训练大模型、还是给员工配满AI工具,大家都在比谁花的钱多。可最近风向明显变了,连微软这种家底厚实的巨头,都开始精打细算起来。

    彭博社这周二(7月7日)报道了一件事:微软在自己最常用的两款产品——Excel和Word里,已经开始用自家的MAI模型去回应一部分用户提问,而不再完全依赖OpenAI和Anthropic的模型。换句话说,你打开Office让Copilot帮你写段话、做个表,背后接的很可能已经不是GPT,而是微软自己养的模型了。

    微软用自家MAI模型替代第三方AI
    微软正把Office里的第三方模型,逐步替换成自家的MAI系列

    曾经的卖点,如今成了要砍的成本

    这个动作有点打脸的意思。毕竟微软过去没少拿”我们的Office由OpenAI和Anthropic的模型驱动”当卖点,在2025年9月的那篇官方博客里,还专门强调过这套强强联手的配置。现在悄悄换成自家模型,说明账算不过来了——第三方模型的调用费,确实不便宜。

    微软嘴上没多说,被TechCrunch问到时只回了一句”暂无更多可分享的信息”。但行动上,它已经把”降本”摆上了台面。

    其实微软也没把第三方模型一脚踢开,目前仍是混着用。它更大的算盘,是趁这两年把自家AI能力立起来。就在上个月的Build开发者大会上,微软一口气发布了7个新的MAI模型,里头既有能写代码的agentic coder,也有能生图的text-to-image生成器。自己有粮,才不用总看别人脸色。

    不只是微软一个人在”抠门”

    把时间拉回到今年初,那会儿圈内流行的是”tokenmaxxing”——能烧多少烧多少,仿佛不把GPU跑满就输了。可才过了几个月,画风就转成了”tokenminimizing”。据各家媒体披露,Amazon、Uber、Meta、埃森哲这些大公司,都在不同程度地给员工的AI支出踩刹车。

    • Amazon据报开始管控内部AI用量,别让小任务把预算烧穿
    • Meta被曝限制员工使用AI的规模,相关开支已经到了几十亿美元的级别
    • 埃森哲也在教员工别拿大钱干小事,能省则省

    这股省钱风甚至把目光引向了大洋彼岸。硅谷有些公司开始盯上中国的便宜模型(比如GLM-5.2)来找agentic方案的替代,哪怕心里还惦记着潜在的安全风险。当一个行业开始认真比较”哪家模型更便宜”的时候,说明狂奔的阶段确实过去了。


    微软这步棋背后,其实是一个谁都绕不开的问题:当AI成了每家公司的水电煤,账单谁来扛?把核心能力攥回自己手里,既是为了省钱,也是为了别在关键时刻被供应链卡脖子。接下来的看点很简单——Office里的Copilot,到底还有多少比例会换成微软亲生的模型。