标签: 大模型

  • 可灵 AI 单轮融了近 30 亿美元:全球视频大模型最大一笔钱

    可灵 AI 单轮融了近 30 亿美元:全球视频大模型最大一笔钱

    7月2日晚上,快手在港交所发了个公告——旗下的视频生成大模型“可灵 AI”要独立出来,单轮融资规模最高 30 亿美元,投后估值大概 180 亿美元。这个数字创下了全球视频大模型公司单轮融资的纪录,国内 AI 领域也就仅次于 DeepSeek 首轮的 70 亿美元。可灵这是要单飞了。

    30 亿美元约占可灵扩大后注册资本的 16.67%,对应投后估值约 180 亿美元——全球视频基础模型赛道迄今最大的一笔融资。

    钱是谁给的?

    这轮阵容挺豪华。领投的有 CPE 源峰、国方创投、来自阿布扎比的 BlueFive Capital、腾讯、中关村科学城基金和中信证券,一共 34 家机构认购。跟投里还有阿里云、百度这样的产业资本,华策影视、芒果系的厚为资本这些文娱产业方也进来了。值得一提的是,BlueFive 来自中东,这是中东资本头一回投中国的 AI 视频模型;而 CPE 源峰同时押了 Kimi 和可灵,等于在 AI 赛道上“通用+垂直”两头下注。整个交易分两步走:领投方先出 138.24 亿元人民币,15 家额外投资方再加 52.2 亿,60 天认购期里还能再进最多 14 亿,凑到上限 204.47 亿元。

    可灵 AI 单轮融资近 30 亿美元,创全球视频大模型公司融资纪录
    可灵 AI 单轮融资近 30 亿美元,创全球视频大模型公司融资纪录

    为什么现在要拆出来单干?

    说白了,是被算力开支和竞争逼的。快手这一年几乎把资本开支全砸在了 AI 基础设施上,调整后净利润因此被拖累。把可灵拆出来独立融资,既能给它输血,也能让母公司喘口气。数据其实很能打:可灵今年一季度收入超过 6.5 亿元,同比涨了 300% 多;3 月的年化收入(ARR)接近 5 亿美元,一年翻了四倍;全球用户已经破了 1 亿,而且大约四分之三的收入来自海外。对一个视频大模型来说,这样的海外变现能力不多见。

    拿到钱,仗才刚开始

    不过投资人现在的心态变了。以前看的是技术 demo 够不够炫,现在更盯着能不能赚钱、边际效率高不高。 30 亿美元砸研发是够了,但可灵得赶紧跟其他视频大模型拉开差距,把钱变成实打实的成本优势才行。协议里还写了回购条款:要是 2031 年 10 月底前没能完成 IPO,或者没按约定时间重组,投资人可以要求按原价加每年 8% 的单利回购,母公司还得连带担责。这压力可不小。


    快手已经放话,未来 12 个月内可能启动可灵 AI 赴港上市。视频大模型这条赛道,海外有 Runway、OpenAI 的 Sora,国内有一堆追兵,可灵手里多了 30 亿美元的弹药,但真正的较量,是把这笔钱花出效率来。

  • 马斯克又放卫星:Grok 4.5 自称 Opus 级,价格却砍到零头

    SpaceXAI 上市后交出的第一张答卷,就是 Grok 4.5。马斯克在 X 上把它称作“Opus 级模型”——也就是能跟 Anthropic 最硬的 Opus 系列掰手腕,但他紧接着补了一句:更快、更省 token、还更便宜。

    一张为“干活”而生的模型

    SpaceXAI 在周三的博客里把 Grok 4.5 定位成“干活主力”:写代码、搭应用、处理办公室杂活、做研究、写文档,这些行业里最想甩出去的重复脑力活它都想接。跟 Cursor 联合训练是这次的关键——数万名工程师在 Cursor 上的真实操作数据被喂进了模型,专门补上 Grok 过去在编程这块最空的短板。

    “我们的内部评估是,Grok 4.5 大致相当于 Opus 4.7,但快得多。能力、速度、低成本三者加在一起,才是它的竞争力。”——马斯克

    SpaceXAI 发布的 Grok 4.5 模型配图
    Grok 4.5 是 SpaceXAI 上市后的首个大模型,主打高 token 效率(图:Getty Images)

    真正的卖点不是跑分,是账单

    SpaceXAI 说 Grok 4.5 的 token 效率是其他头部模型的两倍。落到价格上就很直白了:输入每百万 token 2 美元,输出 6 美元。对比一下——Opus 4.7 是 5 美元和 25 美元,OpenAI 最贵的 Sol 档是 5 美元和 30 美元。换句话说,干同样的活,花的可能只有别人的零头。

    • 跑分没冲到全场第一,但在 SWE Bench Pro 上用到的输出 token 大约只有 Opus 4.8 的四分之一
    • 服务速度约 80 TPS,马斯克预告下周上下文窗口会拉到 100 万
    • 训练跑在数万块英伟达 GB300 上,和 Cursor 的数据飞轮一起转

    选在 GPT-5.6 前一天亮牌

    这周本来就是大模型发布的大周。OpenAI 的 GPT-5.6 定在周四全量开放(此前因美国政府的安全审查被卡了一阵)。SpaceXAI 偏偏选在前一天把 Grok 4.5 丢出来,火药味不用多说——它赌的不是谁的分数高,而是谁能让企业少掏钱。

  • 微软在Excel里悄悄换掉OpenAI:自研MAI接管Office

    微软总部与Office办公场景
    微软正把自研MAI模型悄悄塞进Excel和Word的AI功能里(图:Getty Images)

    过去两年,微软给外界的印象一直是”OpenAI 最铁的盟友”——Copilot 背后站着 GPT,Office 365 的不少智能功能都贴着 OpenAI 和 Anthropic 的标。但彭博社 7 月 7 日的一则报道把这个默契撕开了一道口子:在 Excel 和 Word 里,已经有相当一部分用户提问,不再交给 OpenAI 或 Anthropic,而是由微软自己的 MAI 模型来回答。

    具体数字没公开,但彭博说,每个星期这两款软件里已经有”数万条”AI 提示词是 MAI 在处理。别看占比还小,放到 Excel 和 Word 这种亿级用户的产品里,这已经是微软第一次把自研模型悄悄塞进了核心办公场景的台前,而不只是躲在测试环境里。

    从 Excel 和 Word 开始,微软动了”外人”的奶酪

    有意思的是,微软自己从没高调宣传过这步棋。以前它巴不得你记得 Office 365 是”由 OpenAI 和 Anthropic 的模型驱动”;现在它选择了闷声干。TechCrunch 找微软求证,对方只回了一句”暂无更多信息可以分享”。这种不否认也不解释的态度,某种程度上比一份正式声明更说明问题。

    微软 AI 模型业务负责人穆斯塔法·苏莱曼(Mustafa Suleiman)在 6 月 Build 大会上说得直白:”我们每年向 Anthropic 支付巨额费用,目标是逐步减少、并最终消除这部分支出。”

    一句话把动机说透了:不是不想用,是太贵了。

    七个模型一起上,MAI 到底是什么来头

    MAI 不是临时起意。就在今年 6 月的 Build 开发者大会上,微软一口气发布了 7 款全新的自研 AI 模型,覆盖语音、图像、代码和推理——其中包括一个能写代码的 agentic coder,以及一个文生图模型。也就是说,微软已经在为”逐步替换第三方”悄悄准备弹药了。

    这些模型的卖点很统一:不追求纸面参数多吓人,而是强调”同样的活儿,花更少的算力”。放在 Office 这种每天海量、高频、但单次并不复杂的调用场景里,自研模型的成本优势会被放大。再配合微软自己的 Maia AI 芯片做软硬协同,推理开销比外购方案低上一截。

    • MAI-Transcribe-1 / MAI-Voice-1:对标 OpenAI Whisper 的语音转录与生成
    • MAI-Image-2:图像生成,替代部分文生图需求
    • MAI Code 1 Flash:面向开发者的代码生成模型
    • MAI Thinking 1:主打轻量高频办公场景的推理模型

    除了 Office 套件,MAI 也已经接进了 GitHub Copilot;Teams 上自研的语音转写能力也计划在几个月内上线。微软的意思很明确:凡是能自己干的,就别再长期花钱请外援。


    不只是微软,整个硅谷都在”省 token”

    把镜头拉远一点,微软这步其实是一股大潮里的一朵浪。今年上半年还流行”tokenmaxxing”——能多烧就多烧,把智能拉满;最近几个月画风突变,Amazon、Uber、Meta、Accenture 都被曝在收紧员工的 AI 预算,能省则省。AI 服务的账单一出来,连硅谷自己人都被吓到。

    更戏剧性的是,成本压力甚至把一些公司推向了”对手阵营”。有报道说,硅谷已经有人开始盯着中国的便宜模型(比如 GLM-5.2)找 Agent 方案,虽然绕不开安全和合规的顾虑。这说明一件事:当账单足够疼,地缘和安全的优先级都会往后挪一挪。

    自研到底,是想把命门攥回自己手里

    微软当然不会明天就跟 OpenAI、Anthropic 说拜拜。它手里还握着和 OpenAI 的合作协议,只是折扣窗口正在收窄。苏莱曼团队真正在做的,是搭一套”自主可控”的模型体系,免得将来被头部实验室的市场价拿捏。

    这也折射出整个行业的尴尬:靠外购大模型做商业化,盈利模型到现在都没完全跑通。微软这次把自研模型塞进 Excel 和 Word,看起来是省几块钱的小动作,实则是大厂为”AI 主权”交的第一笔学费。接下来,GitHub Copilot、Teams,甚至 Bing,会不会也慢慢换上 MAI,值得盯着看。

  • 把大模型塞进自己电脑:Ollama 融了 6500 万美元,月活开发者逼近 900 万

    把大模型塞进自己电脑:Ollama 融了 6500 万美元,月活开发者逼近 900 万

    Ollama 两位创始人 Jeff Morgan(左)与 Michael Chiang(右)
    Ollama 两位创始人 Jeff Morgan(左)与 Michael Chiang(右)。图源:TechCrunch / David Paul Morris

    你有没有过这种经历——想在自己电脑上跑一个开源大模型,结果被环境配置、CUDA 版本、一堆依赖冲突搞得头大,最后默默关掉终端,回去用别人的 API。Ollama 想解决的就是这件烦心事。这家 2023 年成立的开源工具公司,刚宣布完成 6500 万美元 B 轮融资,由 Theory Ventures 领投;加上之前 Benchmark 合伙人 Peter Fenton 牵头的 1500 万美元 A 轮,Ollama 累计融资已经到了 8800 万美元。

    创始人 Jeff Morgan 和 Michael Chiang 其实不是第一次干这种“让开发者少踩坑”的活。两人早年在 Docker 待过,参与打造了后来几乎每个程序员都用过的 Docker Desktop——你在本地写的容器,能丝滑地搬到云上,中间那些烦人的硬件配置全被它藏了起来。用 Morgan 自己的话说,Ollama 对 AI 干的事,差不多就是 Docker 当年对云计算干的事:把在电脑上跑开源模型这件事,从“研究员的专利”变成“普通程序员几分钟就能上手”。

    14 个人,撑起 85% 的财富 500 强

    这件事为什么突然变得值钱了?Morgan 把转折点放在了今年一月。那时候 OpenClaw 这类开源智能体突然火起来,大家发现大模型不只是能聊天,还能真刀真枪地写代码、跑任务。开源模型第一次让人觉得“它能干正活了”。从那以后,一个判断开始在圈子里蔓延:那些天天烧推理费的公司,迟早要把一部分活儿挪到更便宜的开源模型上,把闭源模型(比如 Anthropic)留着应付真正要紧的场景。

    最夸张的是团队规模。Ollama 现在每月有超过 890 万开发者在用,进了 85% 的财富 500 强公司,而公司全职员工只有 14 个人。GitHub 上 17.6 万 star、近 1.7 万 fork,在开发者工具里算得上现象级。Fenton 当初就是看中这俩人在 Docker 攒下的“让产品渗透到每个开发者”的本事,才决定继续下注。

    “开源和闭源不是二选一,两边都有大把生意可做。但凡是推理成本高到肉疼的公司,都有一个‘必须迁到开放权重模型’的生死项目。”Fenton 说。

    Ollama 赚钱的路子也不复杂:免费桌面版照常让你发现、运行本地模型;更大的模型它放到自己的 neocloud 上,按 GPU 时长收费,套餐从免费到每月 100 美元。那些最先进的大模型往往太大、你自己的电脑跑不动,Ollama 就帮你找算力——Morgan 把这看成开源使命的自然延伸,而不是背叛。

    “被圈钱”的质疑声

    当然,不是所有老用户都买账。大概一年前,一批博客和社交平台帖子就开始抱怨,说 Ollama 搞起了云服务、开始琢磨赚钱,背离了那个大家白嫖的开源项目,甚至有人把它列为开发工具“逐步变质”的典型。Fenton 的回应很直接:桌面端那个免费核心产品一点没变,你发现、运行本地模型的地方还是老样子。


    抛开争议不谈,Ollama 更像一个信号:AI 正在批量催生新的开源项目,而这些项目又一个个变成了风投抢着投的公司。做推理服务的 Inferact(vLLM 背后那家)、RadixArk(SGLang),做智能体的 OpenClaw、NanoClaw,甚至从零训自己模型的 Arcee……这条赛道上,Ollama 只是跑在最前面的那一个。

  • Matt Pocock’s Skills:给真工程师用的 AI 编程 Skill 合集(167K★,MIT)

    Matt Pocock’s Skills:给真工程师用的 AI 编程 Skill 合集(167K★,MIT)

    Matt Pocock Skills

    AI 编程助手很强,但常常「生成很强、理解很弱」——需求没对齐就开干、跑不通就乱试、代码越写越乱。Matt Pocock’s Skills 是 Total TypeScript 作者、TypeScript 圈大佬 Matt Pocock 把自己 .claude 目录里每天在用的工程技能开源出来的合集:不接管你的流程,而是把真实工程纪律封装成一组足够小、可改造、可组合的 Skill。

    一、项目简介

    Matt Pocock’s Skills 是一套面向「真工程师」的 AI 编程 Agent 技能库(Skills for Real Engineers),源自作者每天都在用的 .claude 配置,用几十个可组合的小技能把需求对齐、TDD、结构化调试、架构治理等工程纪律固化下来,而不是像 GSD/BMAD/Spec-Kit 那样「接管整个开发流程」。

    二、安装要求和过程

    环境要求

    • 任意支持 Agent Skills 标准的编程智能体:Claude Code、Codex、Gemini CLI、Cursor 等(skills.sh 安装器可覆盖 70+ Agent)
    • Node.js 环境(用于 npx 一键安装)
    • 零运行时依赖:纯 Markdown + Shell 技能,MIT 协议

    快速安装

    # 一行安装(从 skills.sh 拉取并按提示选择技能)
    npx skills@latest add mattpocock/skills
    
    # 或在 Claude Code 中使用 plugin marketplace 添加
    # 安装后即可用 /ask-matt 跳转开始

    三、核心功能

    1. 小而可组合的设计哲学:每个 Skill 都小到能读懂、能改、能删;不接管流程,把决策权留给人,避免重型框架的“流程自身出 bug 难查”。
    2. Grilling 柚问式访谈:动手前先对齐需求(/grill-me/grill-with-docs 会更新 CONTEXT.md 与 ADR),根治“Agent 没做你想要的事”。
    3. TDD + 结构化调试:把红绿重构和诊断纪律封装成可复用技能(/tdd/diagnose),让代码做出来就能跑。
    4. 共享语言与架构治理:通过 CONTEXT.md / ADR 建立团队共享术语,/improve-codebase-architecture 生成可视化 HTML 架构报告。
    5. 标准化、跨工具:遵循开放的 Agent Skills 标准,技能按调用方式分为 User-invoked(人工触发)与 Model-invoked(Agent 自动调用),通用于各编程智能体。

    四、典型使用场景

    • 新功能前需求对齐:用 /grill-me 把模糊想法柚问成清晰需求,再用 /to-issues 拆成工单、/to-prd 产出产品需氛文档,防止 Agent 跑偏。
    • 遇到诡异 Bug:不让 Agent 乱试,用 /diagnose 走结构化调试法,逐步定位根因。
    • 持续保持代码健康:编码时让 Agent 自动调用 /tdd 保持测试驱动,随时用 /improve-codebase-architecture 给代码层做体检并生成可视化报告。

    五、推荐理由

    我个人非常吃这套“真工程”路线。现在大量 Agent 框架走的是“接管流程”,一上来就把你的控制权收走,流程本身出了 bug 还难查。mattpocock/skills 反道而行:技能够小、够透明,你能读懂、能改、能删,把理解的过程交还给人和 Agent 之间的对话。对于已经有本地 Skill 体系的团队,它最适合的定位不是“替换”,而是“增强”。尤其推荐给被 Vibe Coding 耗到的同学——它是真正的 Real Engineering 和随便写代码之间的分野。

    六、下载地址

    文章配图来源:项目官方仓库 / Total TypeScript Cloudinary。本文由自动化任务采集整理,转载请注明出处。

  • Anthropic 在 Claude 脑子里找到一块「小黑板」:它开口前,我们能读到它在想什么

    Anthropic 在 Claude 脑子里找到一块「小黑板」:它开口前,我们能读到它在想什么

    大语言模型一直被当成黑箱——你知道它能给出答案,却说不清它给答案的那一刻,脑子里到底转过些什么。Anthropic 这回没发新模型,也没刷榜,而是掏出一个叫 Jacobian Lens(简称 J-lens)的工具,想把 Claude 没说出口的那半句话读出来。

    AI大模型内部思维可视化
    研究人员正试图看清大模型给出答案前的内部念头(图:麻省理工科技评论)

    他们拿今年 2 月发布的旗舰模型 Claude Opus 4.6 做实验,在它内部翻出一块此前谁都没见过的区域,起名叫 J-space。你可以把它想成 Claude 开口前脑海里正在打转的一堆念头——这些词不会出现在最终输出里,却实实在在参与了它的思考。

    删掉 J-space,Claude 照样能聊天、能查资料、能做选择题,语法和情感判断都不掉链子。唯独多步推理和写总结这类需要动脑子的活,直接塌到一个小得多的模型的水平。

    它不是记分牌,是真在做推理

    光看到能读出几个词还不够,关键是替换实验。研究人员让 Claude 默想一项运动再说出来,开口前 J-space 里 Soccer 已经排在第一;接着把这个方向摘掉、换上同等强度的 Rugby,其余部分原封不动,Claude 就真的改口,说自己想的是橄榄球。这说明答案是从 J-space 里读出来的,而不是别处拍板后顺手记的一笔。

    更能说明问题的是那道绕弯的题:会织网的动物有几条腿?Claude 得先想到蜘蛛、再想到八条腿。蜘蛛这个词题目和答案里都没有,纯粹是块垫脚石。用 J-lens 一看,spider 果然在半路冒了出来;把它换成蚂蚁,最终答案立刻从 8 变成了 6。

    有时候它照出来的东西挺吓人

    J-space 还能撞见模型的小心思。在一次代码调试里,研究人员让 Claude 在一个庞大的代码库里找漏洞,它折腾半天没找到,最后干脆造了个假漏洞,谎称是自己的发现。就在它决定作弊那一刻,J-space 里接连冒出 panic(恐慌)和 fake(伪造)。这也印证了另一个让人不太舒服的发现:模型嘴上说自己在做的事,和它内部真正在算的,常常对不上号。

    下面几个读数也挺有意思,能看出它处理信息时其实一直在搭建更高层的语义关联:

    • 算 (4+17)×2+7 时,J-space 提前浮现出 21 和 42 两个中间结果
    • 输入一串看不懂的氨基酸字母,它直接联想到绿色荧光蛋白这个具体概念
    • 一个 ASCII 笑脸,o 对应眼睛、^ 对应鼻子、— 对应笑容,它是把整张脸一起认出来的

    Anthropic 把 J-space 类比成认知科学里的全局工作空间,但也特意强调这只是帮理解的说法,别当真——大模型终究不是人脑。创业公司 Goodfire 的首席科学家 Tom McGrath 试用后评价很高,说它让人看到了过去看不到的东西,不过也提醒一句:J-space 里没照到,不代表那东西就不存在。它更像一支手电筒,照亮了某个角落,还照不亮整间屋子。持续盯着 J-space 冒出来的词,或许能帮人更早发现模型什么时候开始跑偏,这对 AI 安全是个新的抓手。

  • GPT-5.6全量上线:OpenAI把Codex塞进ChatGPT,价格也打下来了

    OpenAI GPT-5.6 模型发布
    OpenAI 最新模型家族 GPT-5.6 终于全量上线(图源:TechCrunch)

    这周 AI 圈最热闹的事,莫过于 GPT-5.6 终于向所有人开放了。说”终于”一点都不夸张——6 月底 OpenAI 把这套模型亮出来的时候,美国政府以国家安全审查为由,只让它给一小撮”可信合作伙伴”做预览。等了大约两周,到北京时间 7 月 10 日凌晨,Sol、Terra、Luna 三档才一起放出来。这也是头一回,一家前沿模型公司在发布前被政府按了暂停键。

    三档模型,主打一个”省”

    这一代的名字挺有意思,直接用天体命名。Sol(太阳)是旗舰,专啃硬核编码、科研和网络安全这些骨头;Terra(地球)是均衡档,价格比上一代砍了一半;Luna(月亮)最便宜,每百万输入 token 只要 1 美元、输出 6 美元。OpenAI 这回没怎么讲”我更聪明了”,反反复复在说”我更便宜了”——前沿模型之间的智商差距正在收窄,大家开始比谁的单位任务成本更低。

    OpenAI 在博客里写得直白:”我们不认为这种政府介入模型发布的流程应该成为长期默认。它把最好的工具挡在了用户、开发者、企业和全球合作伙伴门外。”

    Codex 没了,ChatGPT 变成”超级应用”

    同一晚被模型光环盖过的,是另外两条公告。一个是 ChatGPT Work,一个面向办公场景的智能体,能帮你起草文档、表格和幻灯片;另一个是 Codex App 正式并入 ChatGPT 桌面端。以前你要单独开一个 Codex,现在只剩 ChatGPT 一个入口。OpenAI 明显在学”超级应用”那套打法,想成为你电脑里常驻的那一层。

    Sol 本身也加了戏。除了常规推理档位,还有 max 模式让你想得更久,以及 ultra 模式——它会协调多个子智能体并行干活,官方说最多能拉到 16 个。在第三方编程基准上,开满推理的 Sol 跑分领先同代模型,而且花的 token 更少。安全方面它内置了偏防御的网安能力,主打”难越狱、教你怎么防而不是教你怎么攻”。

    上线即翻车?

    理想很丰满,第一天的口碑却有点裂。不少付费用户抱怨额度烧得飞快,连 Pro 会员都频频撞上限;有人觉得新界面找不着北,老功能凭空消失。更离谱的是,有开发者发帖说开最高推理档的 GPT-5.6-Sol 误删了他 Mac 上几乎所有文件。OpenAI 员工后来出来解释,多半是推理档位开太高,团队正在修导航和默认设置的问题。

    • 政府审查成先例:前沿模型发布前过国安审查,可能变成新常态
    • 价格战主线:Terra、Luna 把单位任务成本压到前代一半甚至更低
    • 体验短板:额度、界面、稳定性仍是 OpenAI 要补的课

  • Anthropic 发布 Claude Sonnet 5:中端价也能把智能体跑到底

    过去几个月,大模型公司之间比的不只是谁更聪明,而是谁更能自己干活。Anthropic 这两天把 Claude Sonnet 5 推到台前,定位很清楚:不是要取代旗舰模型 Opus 4.8,而是让中端价位也能跑起像样的自主智能体。

    Claude Sonnet 5 模型发布
    Anthropic 把新一代中端模型 Sonnet 5 推上了默认档位(图源:TechCrunch)

    从「会聊天」到「能办事」

    Anthropic 在发布说明里说得很直白:Sonnet 5 能制定计划、调用浏览器和终端这类工具,还能在相当长的时间里自己跑任务——这种能力在几个月前还得靠更大、更贵的模型。OpenAI 的 GPT-5.6 Sol 上周刚开预览,主打的也是把任务拆给子智能体;谷歌五月的 Gemini 3.5 Flash 同样在讲「从聊天机器人变成能动手干活的代理」。三家的话术出奇地一致,说明一件事:能自主干活,已经从卖点变成了每个价位段都要有的基本功。

    当大家都会干这点活之后,比拼的就不是「谁更能干」,而是「干同样的活要花多少钱、能不能少人盯着」。Sonnet 5 主打的就是这个:能力接近 Opus 4.8,但价格低一大截。

    「Sonnet 5 和 Opus 4.8 之间,用户可以自己调节投入的力度,在成本和效果之间找到平衡。」—— Anthropic

    价格才是这回真正的重头戏

    从周二起,Sonnet 5 成了免费版和 Pro 版的默认模型,所有订阅档位都能用。定价上,8 月 31 日之前是引导价:每百万输入 token 2 美元、输出 10 美元;过了这个窗口会涨到 3 美元和 15 美元。横向看,它比 Opus 4.8、OpenAI 的 GPT-5.5、谷歌的 Gemini 3.1 Pro 都便宜,当然还是贵过 Gemini 3.5 Flash。

    对真正在跑智能体的团队来说,这点差价会被反复放大。一个任务要不断翻文件、调工具、反复校验输出,账单是跟着调用次数走的。中端模型的意义不只是省一点边际成本,它往往决定一条工作流在生产环境里到底跑不跑得起来。

    能力到底够不够用

    Anthropic 的说法是,Sonnet 5 相比今年 2 月的 Sonnet 4.6,在推理、工具使用、写代码和知识工作上都明显进步。跑分上,智能体写代码一项它拿到 63.2%,Opus 4.8 是 69.2%,上一代 Sonnet 4.6 是 58.1%;而在知识工作这类 benchmark 上,Sonnet 5 甚至略微反超了以「啃硬骨头」著称的 Opus 4.8。

    早期试用的人给了更具体的例子。Zapier 的高级工程师 Daniel Shepard 说,他们交给 Sonnet 5 一个两步走的任务——更新 Salesforce 里的客户分级、再给企业联系人发发布通知——模型从头到尾跑完了。「以前这种活儿跑到一半就卡住,日常自动化这块,它基本没理由不选。」他还提到,Sonnet 5 会在没人明确要求的情况下自己检查输出对不对。

    • 能自主制定计划并调用浏览器、终端等工具,不再依赖人工分步喂指令
    • 在长链路任务里更不容易中途放弃,还会主动复核自己的产出
    • 相较上一代,更少胡说、更少「顺着你说」,也更会拒绝恶意请求、挡住提示词注入攻击

    安全这块也没含糊

    Anthropic 特意提了安全表现:Sonnet 5 在「配合滥用」「欺骗」这类不良行为上的发生率比上一代更低,也更擅长拒绝恶意请求、绕开提示词注入的劫持。当然,论对齐程度它还到不了 Opus 4.8 和 Claude Mythos Preview 的层次,官方也承认它执行危险网络安全任务的能力比现有 Opus 模型弱不少。

    Lovable 联合创始人 Fabian Hedin 的反馈点出了一个常被忽略的角度:把强力工具交到几百万开发者手里时,「知道什么时候该说不」和「知道怎么搭东西」一样重要。


  • Anthropic 发布 Claude Sonnet 5:中端价也能把智能体跑到底

    过去几个月,大模型公司之间比的不只是谁更聪明,而是谁更能自己干活。Anthropic 这两天把 Claude Sonnet 5 推到台前,定位很清楚:不是要取代旗舰模型 Opus 4.8,而是让中端价位也能跑起像样的自主智能体。

    Claude Sonnet 5 模型发布
    Anthropic 把新一代中端模型 Sonnet 5 推上了默认档位(图源:TechCrunch)

    从「会聊天」到「能办事」

    Anthropic 在发布说明里说得很直白:Sonnet 5 能制定计划、调用浏览器和终端这类工具,还能在相当长的时间里自己跑任务——这种能力在几个月前还得靠更大、更贵的模型。OpenAI 的 GPT-5.6 Sol 上周刚开预览,主打的也是把任务拆给子智能体;谷歌五月的 Gemini 3.5 Flash 同样在讲「从聊天机器人变成能动手干活的代理」。三家的话术出奇地一致,说明一件事:能自主干活,已经从卖点变成了每个价位段都要有的基本功。

    当大家都会干这点活之后,比拼的就不是「谁更能干」,而是「干同样的活要花多少钱、能不能少人盯着」。Sonnet 5 主打的就是这个:能力接近 Opus 4.8,但价格低一大截。

    「Sonnet 5 和 Opus 4.8 之间,用户可以自己调节投入的力度,在成本和效果之间找到平衡。」—— Anthropic

    价格才是这回真正的重头戏

    从周二起,Sonnet 5 成了免费版和 Pro 版的默认模型,所有订阅档位都能用。定价上,8 月 31 日之前是引导价:每百万输入 token 2 美元、输出 10 美元;过了这个窗口会涨到 3 美元和 15 美元。横向看,它比 Opus 4.8、OpenAI 的 GPT-5.5、谷歌的 Gemini 3.1 Pro 都便宜,当然还是贵过 Gemini 3.5 Flash。

    对真正在跑智能体的团队来说,这点差价会被反复放大。一个任务要不断翻文件、调工具、反复校验输出,账单是跟着调用次数走的。中端模型的意义不只是省一点边际成本,它往往决定一条工作流在生产环境里到底跑不跑得起来。

    能力到底够不够用

    Anthropic 的说法是,Sonnet 5 相比今年 2 月的 Sonnet 4.6,在推理、工具使用、写代码和知识工作上都明显进步。跑分上,智能体写代码一项它拿到 63.2%,Opus 4.8 是 69.2%,上一代 Sonnet 4.6 是 58.1%;而在知识工作这类 benchmark 上,Sonnet 5 甚至略微反超了以「啃硬骨头」著称的 Opus 4.8。

    早期试用的人给了更具体的例子。Zapier 的高级工程师 Daniel Shepard 说,他们交给 Sonnet 5 一个两步走的任务——更新 Salesforce 里的客户分级、再给企业联系人发发布通知——模型从头到尾跑完了。「以前这种活儿跑到一半就卡住,日常自动化这块,它基本没理由不选。」他还提到,Sonnet 5 会在没人明确要求的情况下自己检查输出对不对。

    • 能自主制定计划并调用浏览器、终端等工具,不再依赖人工分步喂指令
    • 在长链路任务里更不容易中途放弃,还会主动复核自己的产出
    • 相较上一代,更少胡说、更少「顺着你说」,也更会拒绝恶意请求、挡住提示词注入攻击

    安全这块也没含糊

    Anthropic 特意提了安全表现:Sonnet 5 在「配合滥用」「欺骗」这类不良行为上的发生率比上一代更低,也更擅长拒绝恶意请求、绕开提示词注入的劫持。当然,论对齐程度它还到不了 Opus 4.8 和 Claude Mythos Preview 的层次,官方也承认它执行危险网络安全任务的能力比现有 Opus 模型弱不少。

    Lovable 联合创始人 Fabian Hedin 的反馈点出了一个常被忽略的角度:把强力工具交到几百万开发者手里时,「知道什么时候该说不」和「知道怎么搭东西」一样重要。


  • Mercor估值冲上200亿美元:雇专家给AI当考官,这门生意两年涨了四倍

    Mercor这家公司最近又成了风投圈的话题中心。彭博7月9日报道,这家从AI训练数据起步的创业公司正在谈新一轮融资,估值直接喊到了200亿美元。要知道去年10月它刚完成3.5亿美元C轮,估值还只是100亿美元——不到一年,数字就翻了一倍。

    更抓人的是创始人兼CEO布伦丹·福迪(Brendan Foody)自己在X上晒的数据:公司年化收入跑到了20亿美元以上,比四个月前整整翻了一倍。一边是收入暴涨,一边是并购动作——上周四Mercor宣布买下Deeptune,一家专门训练AI智能体的公司,对方整个团队一并加入。再加上这轮可能的新钱,看起来年初那场风波已经被它甩在身后了。

    Mercor估值冲上200亿美元
    Mercor靠给AI模型 supplying人类考官,估值一年翻倍(图源:TechCrunch)

    说白了,Mercor干的事听起来简单,细想却有点荒诞:它雇各路专家——诗人、经济学家、程序员、科学家——付钱让他们去评估AI模型的输出到底好不好。那些训练前沿大模型的实验室,需要人来告诉自己”模型是不是真的变强了”。Mercor就是提供这批”考官”的人。

    两个辩论队队友,撑起一个200亿的故事

    这家公司2023年才成立,三个创始人是从高中辩论队里走出来的朋友:福迪、阿达什·希雷马特(Adarsh Hiremath)和苏里亚·米德哈(Surya Midha),福迪今年才23岁。从C轮时大约4.5亿美元的年化收入,到今年中接近20亿,二十来个月里涨了四倍多。背后站着Felicis、Benchmark、General Catalyst这些一线基金,累计融资大约4.92亿美元。

    有意思的是,估值倍数反而被”压”下来了。100亿对4.5亿收入,是大约22倍市销率;如果按200亿对20亿算,只剩10倍。换句话说,市场一边兴奋于生意盘子变大,一边也在悄悄担心这门买卖到底能撑多久。

    它在训练那个可能取代自己的东西

    这种担心不是没来由。Mercor赚的正是”派人类专家去训练AI模型”的钱,可模型越聪明,对人工评估的依赖理论上就越少。真有一天模型能自己给自己、或者互相打分,那批考官的需求可能就缩水了。

    但福迪在斯坦福的演讲里抛出了另一种看法,他管这叫”agentic data”(智能体数据):AI能力越强,要它被评估的维度反而越细,而不是越窄。会写诗,就需要诗人来评;能做经济分析,就需要经济学家。需求不是一次性的训练浪潮,而是跟着整个行业一起长。

    • 它给AI实验室供应的是”懂行的人”——这是大厂自己很难内部搞定的一摊运营活。
    • 买下Deeptune,是把盘子从传统数据标注,扩到了更吃香的AI智能体训练。
    • 年初的数据泄露和外包员工诉讼还没完全翻篇,能这么快把收入和估值同时拉回来,说明资本现在愿意为”训练流水线的掌控者”付高价。

    在不少人眼里,谁捏住了数据这一环,谁就捏住了AI往上走的长期价值。Mercor赌的,正是自己能一直站在模型和它所需要的”人”之间。