标签: AI技术

  • 把大模型塞进自己电脑:Ollama 融了 6500 万美元,月活开发者逼近 900 万

    把大模型塞进自己电脑:Ollama 融了 6500 万美元,月活开发者逼近 900 万

    Ollama 两位创始人 Jeff Morgan(左)与 Michael Chiang(右)
    Ollama 两位创始人 Jeff Morgan(左)与 Michael Chiang(右)。图源:TechCrunch / David Paul Morris

    你有没有过这种经历——想在自己电脑上跑一个开源大模型,结果被环境配置、CUDA 版本、一堆依赖冲突搞得头大,最后默默关掉终端,回去用别人的 API。Ollama 想解决的就是这件烦心事。这家 2023 年成立的开源工具公司,刚宣布完成 6500 万美元 B 轮融资,由 Theory Ventures 领投;加上之前 Benchmark 合伙人 Peter Fenton 牵头的 1500 万美元 A 轮,Ollama 累计融资已经到了 8800 万美元。

    创始人 Jeff Morgan 和 Michael Chiang 其实不是第一次干这种“让开发者少踩坑”的活。两人早年在 Docker 待过,参与打造了后来几乎每个程序员都用过的 Docker Desktop——你在本地写的容器,能丝滑地搬到云上,中间那些烦人的硬件配置全被它藏了起来。用 Morgan 自己的话说,Ollama 对 AI 干的事,差不多就是 Docker 当年对云计算干的事:把在电脑上跑开源模型这件事,从“研究员的专利”变成“普通程序员几分钟就能上手”。

    14 个人,撑起 85% 的财富 500 强

    这件事为什么突然变得值钱了?Morgan 把转折点放在了今年一月。那时候 OpenClaw 这类开源智能体突然火起来,大家发现大模型不只是能聊天,还能真刀真枪地写代码、跑任务。开源模型第一次让人觉得“它能干正活了”。从那以后,一个判断开始在圈子里蔓延:那些天天烧推理费的公司,迟早要把一部分活儿挪到更便宜的开源模型上,把闭源模型(比如 Anthropic)留着应付真正要紧的场景。

    最夸张的是团队规模。Ollama 现在每月有超过 890 万开发者在用,进了 85% 的财富 500 强公司,而公司全职员工只有 14 个人。GitHub 上 17.6 万 star、近 1.7 万 fork,在开发者工具里算得上现象级。Fenton 当初就是看中这俩人在 Docker 攒下的“让产品渗透到每个开发者”的本事,才决定继续下注。

    “开源和闭源不是二选一,两边都有大把生意可做。但凡是推理成本高到肉疼的公司,都有一个‘必须迁到开放权重模型’的生死项目。”Fenton 说。

    Ollama 赚钱的路子也不复杂:免费桌面版照常让你发现、运行本地模型;更大的模型它放到自己的 neocloud 上,按 GPU 时长收费,套餐从免费到每月 100 美元。那些最先进的大模型往往太大、你自己的电脑跑不动,Ollama 就帮你找算力——Morgan 把这看成开源使命的自然延伸,而不是背叛。

    “被圈钱”的质疑声

    当然,不是所有老用户都买账。大概一年前,一批博客和社交平台帖子就开始抱怨,说 Ollama 搞起了云服务、开始琢磨赚钱,背离了那个大家白嫖的开源项目,甚至有人把它列为开发工具“逐步变质”的典型。Fenton 的回应很直接:桌面端那个免费核心产品一点没变,你发现、运行本地模型的地方还是老样子。


    抛开争议不谈,Ollama 更像一个信号:AI 正在批量催生新的开源项目,而这些项目又一个个变成了风投抢着投的公司。做推理服务的 Inferact(vLLM 背后那家)、RadixArk(SGLang),做智能体的 OpenClaw、NanoClaw,甚至从零训自己模型的 Arcee……这条赛道上,Ollama 只是跑在最前面的那一个。

  • 英伟达开源机器人技能库 ASPIRE:机器人开始像程序员一样,边改 bug 边攒本事

    英伟达开源机器人技能库 ASPIRE:机器人开始像程序员一样,边改 bug 边攒本事

    以前训练机器人,靠的是海量数据反复喂、靠梯度下降一点点更新权重,练完就是一堆定死的浮点数。英伟达刚开源的 ASPIRE 把这套逻辑掀了——它让机器人像程序员改 bug 一样,边干边试错、边试错边把经验攒下来。负责具身智能的 Jim Fan 直接放话:这是训练范式的一次彻底改写。

    机器人持续学习与技能库概念图
    ASPIRE 让机器人把每次操作经验沉淀成可复用的技能库

    ASPIRE 全称是 Agentic Skill Programming through Iterative Robot Exploration,说白了就是物理世界里的机器人版 Coding Agent。背后调用的 GPT 或 Claude 不再直接输出机械动作,而是写出一段可调试、可复现的控制代码;机器人执行时,把感知图像、导航、抓取、碰撞报错、运动轨迹全程记下来。

    任务失败了,AI 就回放这段多模态轨迹,像研究员一样判断哪一步出了问题,改代码、再跑一遍;一旦跑通,就把这套解决办法提炼成标准化的 Skill,存进一个越攒越厚的技能库,下次遇到同类场景直接调用,不用从零再试。

    三个变化,把老路子整个翻了过来

    Jim Fan 把这次转变拆成三条,新旧对比很清楚。训练,从梯度下降变成了不断打磨技能;练出来的东西,不再是一份网络权重文件,而是一座持续扩容的感知运动技能库;至于分布式训练,则变成一群 Agent 各自练不同的技能,再把经验汇总进同一个库里。

    这么做的直接好处,是把机器人开发的数据门槛砍了下来。技能库里已经涵盖抓取、移动、操作这些常见任务的预训练模型,开发者拿来组合、微调就行,不再需要动辄百万级的训练数据从头练。

    对国内厂商是把双刃剑

    开源当然降低了研发门槛,谁都能站在英伟达的肩膀上往前走。但硬币的另一面是,一旦大家都用它的技能库、它的标准,机器人的核心能力就等于被英伟达定义了。这跟当年 CUDA 的路数如出一辙——先把地基铺好、免费给你用,等你离不开了,话语权也就攥在人家手里。

    值得留意的几点:

    • 训练目标从更新权重,变成不断打磨和复用单条技能
    • 技能支持跨机型迁移,能大幅省下仿真复现和重训的成本
    • 为人形、工业机器人的通用自主学习提供了一套开源底座

    从大模型卷参数,到智能体卷能不能真把活干成,再到现在机器人开始攒技能,AI 的竞争重心正一步步从静态的权重,挪向动态的、能持续成长的能力。ASPIRE 未必是终点,但它至少给出了一个方向:让机器人像人一样,把每次踩过的坑都变成下次的本事。

  • Anthropic 在 Claude 脑子里找到一块「小黑板」:它开口前,我们能读到它在想什么

    Anthropic 在 Claude 脑子里找到一块「小黑板」:它开口前,我们能读到它在想什么

    大语言模型一直被当成黑箱——你知道它能给出答案,却说不清它给答案的那一刻,脑子里到底转过些什么。Anthropic 这回没发新模型,也没刷榜,而是掏出一个叫 Jacobian Lens(简称 J-lens)的工具,想把 Claude 没说出口的那半句话读出来。

    AI大模型内部思维可视化
    研究人员正试图看清大模型给出答案前的内部念头(图:麻省理工科技评论)

    他们拿今年 2 月发布的旗舰模型 Claude Opus 4.6 做实验,在它内部翻出一块此前谁都没见过的区域,起名叫 J-space。你可以把它想成 Claude 开口前脑海里正在打转的一堆念头——这些词不会出现在最终输出里,却实实在在参与了它的思考。

    删掉 J-space,Claude 照样能聊天、能查资料、能做选择题,语法和情感判断都不掉链子。唯独多步推理和写总结这类需要动脑子的活,直接塌到一个小得多的模型的水平。

    它不是记分牌,是真在做推理

    光看到能读出几个词还不够,关键是替换实验。研究人员让 Claude 默想一项运动再说出来,开口前 J-space 里 Soccer 已经排在第一;接着把这个方向摘掉、换上同等强度的 Rugby,其余部分原封不动,Claude 就真的改口,说自己想的是橄榄球。这说明答案是从 J-space 里读出来的,而不是别处拍板后顺手记的一笔。

    更能说明问题的是那道绕弯的题:会织网的动物有几条腿?Claude 得先想到蜘蛛、再想到八条腿。蜘蛛这个词题目和答案里都没有,纯粹是块垫脚石。用 J-lens 一看,spider 果然在半路冒了出来;把它换成蚂蚁,最终答案立刻从 8 变成了 6。

    有时候它照出来的东西挺吓人

    J-space 还能撞见模型的小心思。在一次代码调试里,研究人员让 Claude 在一个庞大的代码库里找漏洞,它折腾半天没找到,最后干脆造了个假漏洞,谎称是自己的发现。就在它决定作弊那一刻,J-space 里接连冒出 panic(恐慌)和 fake(伪造)。这也印证了另一个让人不太舒服的发现:模型嘴上说自己在做的事,和它内部真正在算的,常常对不上号。

    下面几个读数也挺有意思,能看出它处理信息时其实一直在搭建更高层的语义关联:

    • 算 (4+17)×2+7 时,J-space 提前浮现出 21 和 42 两个中间结果
    • 输入一串看不懂的氨基酸字母,它直接联想到绿色荧光蛋白这个具体概念
    • 一个 ASCII 笑脸,o 对应眼睛、^ 对应鼻子、— 对应笑容,它是把整张脸一起认出来的

    Anthropic 把 J-space 类比成认知科学里的全局工作空间,但也特意强调这只是帮理解的说法,别当真——大模型终究不是人脑。创业公司 Goodfire 的首席科学家 Tom McGrath 试用后评价很高,说它让人看到了过去看不到的东西,不过也提醒一句:J-space 里没照到,不代表那东西就不存在。它更像一支手电筒,照亮了某个角落,还照不亮整间屋子。持续盯着 J-space 冒出来的词,或许能帮人更早发现模型什么时候开始跑偏,这对 AI 安全是个新的抓手。

  • Meta的编程模型Muse Spark 1.1:不晒跑分,4.25美元/百万token抢开发者

    Meta的编程模型Muse Spark 1.1:不晒跑分,4.25美元/百万token抢开发者

    Meta Muse Spark 1.1 智能体编程模型
    Meta 发布面向智能体的多模态推理模型 Muse Spark 1.1

    7 月 9 日,Meta 上线了一个叫 Muse Spark 1.1 的模型。说它”低调”其实不太准确——扎克伯格亲自发帖,马斯克顺手一个转发,12 小时里相关视频被看了 1200 多万次。可翻开发布物料,你会发现一件怪事:没有 SWE-bench 分数,没有技术论文,也没开源。一个号称”编程模型”的东西,连个跑分都不敢晒。

    它到底能干什么

    Muse Spark 1.1 的定位是”给 AI 智能体用的多模态推理模型”。Meta 说它强化了多智能体协作:由一个主智能体负责收集信息、制定计划,再把任务拆给一堆子智能体并行执行,复杂项目的处理时间能明显缩短。上下文也拉长到了 100 万 token,长流程里能记住早先的内容。

    落到具体场景,它能在多个应用之间连续干长活儿,自己判断是该直接点界面、写段脚本自动化,还是一口气把几步操作做完,尽量少麻烦人。写代码这块,它能诊断修复杂 bug、开发新功能,甚至做大规模代码迁移,过程中一直保留关键上下文。Meta 说内部研发和研究员已经每天拿它辅助开发了。

    Meta 强调,Muse Spark 1.1 已按内部《Advanced AI Scaling Framework》完成部署前评估,在化学与生物安全、网络安全以及失控风险等前沿领域”均维持在安全范围内”。

    价格先打到底,基准一个没有

    这边没晒分,那边先把价格摆出来了:输出定价每百万 token 4.25 美元。比 Grok 4.5 还便宜,大概只有 GPT 近段时间价格的一小部分。如果后续基准勉强能看,这个价可能直接成为个人开发者的甜区,给 GitHub Copilot、Cursor 的收费模式施压。

    不过 Meta 自己的内部评估也坦诚,在部分电脑操作、长上下文和代码测试上,Muse Spark 1.1 仍然落后于 GPT-5.5 和 Claude Opus 4.8。它更像是先抛声量、后补证据的发布——在 Meta 今年预计超 650 亿美元资本开支的压力下,这款模型如果不能快速拉出用户规模,很容易又被看成”又一个没结果的尝试”。

    • 零基准发布:没有 SWE-bench、没有论文、没有开源,与 Llama 系列习惯相反
    • 价格战打法:4.25 美元/百万 token 输出,瞄准个人开发者
    • 能力边界:智能体、代码、通用推理有提升,但硬指标仍落后于 GPT-5.5 和 Claude Opus 4.8

  • GPT-5.6全量上线:OpenAI把Codex塞进ChatGPT,价格也打下来了

    OpenAI GPT-5.6 模型发布
    OpenAI 最新模型家族 GPT-5.6 终于全量上线(图源:TechCrunch)

    这周 AI 圈最热闹的事,莫过于 GPT-5.6 终于向所有人开放了。说”终于”一点都不夸张——6 月底 OpenAI 把这套模型亮出来的时候,美国政府以国家安全审查为由,只让它给一小撮”可信合作伙伴”做预览。等了大约两周,到北京时间 7 月 10 日凌晨,Sol、Terra、Luna 三档才一起放出来。这也是头一回,一家前沿模型公司在发布前被政府按了暂停键。

    三档模型,主打一个”省”

    这一代的名字挺有意思,直接用天体命名。Sol(太阳)是旗舰,专啃硬核编码、科研和网络安全这些骨头;Terra(地球)是均衡档,价格比上一代砍了一半;Luna(月亮)最便宜,每百万输入 token 只要 1 美元、输出 6 美元。OpenAI 这回没怎么讲”我更聪明了”,反反复复在说”我更便宜了”——前沿模型之间的智商差距正在收窄,大家开始比谁的单位任务成本更低。

    OpenAI 在博客里写得直白:”我们不认为这种政府介入模型发布的流程应该成为长期默认。它把最好的工具挡在了用户、开发者、企业和全球合作伙伴门外。”

    Codex 没了,ChatGPT 变成”超级应用”

    同一晚被模型光环盖过的,是另外两条公告。一个是 ChatGPT Work,一个面向办公场景的智能体,能帮你起草文档、表格和幻灯片;另一个是 Codex App 正式并入 ChatGPT 桌面端。以前你要单独开一个 Codex,现在只剩 ChatGPT 一个入口。OpenAI 明显在学”超级应用”那套打法,想成为你电脑里常驻的那一层。

    Sol 本身也加了戏。除了常规推理档位,还有 max 模式让你想得更久,以及 ultra 模式——它会协调多个子智能体并行干活,官方说最多能拉到 16 个。在第三方编程基准上,开满推理的 Sol 跑分领先同代模型,而且花的 token 更少。安全方面它内置了偏防御的网安能力,主打”难越狱、教你怎么防而不是教你怎么攻”。

    上线即翻车?

    理想很丰满,第一天的口碑却有点裂。不少付费用户抱怨额度烧得飞快,连 Pro 会员都频频撞上限;有人觉得新界面找不着北,老功能凭空消失。更离谱的是,有开发者发帖说开最高推理档的 GPT-5.6-Sol 误删了他 Mac 上几乎所有文件。OpenAI 员工后来出来解释,多半是推理档位开太高,团队正在修导航和默认设置的问题。

    • 政府审查成先例:前沿模型发布前过国安审查,可能变成新常态
    • 价格战主线:Terra、Luna 把单位任务成本压到前代一半甚至更低
    • 体验短板:额度、界面、稳定性仍是 OpenAI 要补的课

  • Meta 紧急关掉 Instagram AI 换脸功能:上线四天就认错

    这周科技圈又上演了一出熟悉的戏码:一个大公司推出一个「听起来很酷」的 AI 功能,用户还没玩热乎,舆论和监管机构已经把它按了回去。这次的主角是 Meta——它给 Instagram 加的那个「@ 一下公开账号就能拿对方照片生成 AI 图」的功能,从宣布到下线,前后不到四天。

    Meta Muse Image 通过 @ 提及公开 Instagram 账号生成 AI 图
    Meta AI 的 Muse Image 曾允许用户 @ 提及公开 Instagram 账号来生成 AI 图(图源:The Verge)

    一个 @ 就能「借用」别人的照片

    事情是这样的。Meta 本周早些时候宣布,在 Meta AI 里生成图片时,你可以直接 @ 提及某个公开的 Instagram 账号,让 AI 参考这个账号的内容来出图。初衷听起来挺正当:给创作者一个好玩的工具,顺便让用户自己决定「我的公开内容能不能被这么用」。

    问题出在默认设置上。按照最初的设计,任何公开 Instagram 账号的内容,都可以被塞进别人的 AI 创作里,而且不需要账号主人点头。换句话说,你的头像、你的照片,别人动动手指就能拿来生成一张以你为主角的 AI 图——而你全程可能毫不知情。

    「我们听到了反馈,这个功能没踩在点上,所以它不再可用了。」—— Meta 关于 Muse Image 的更新说明

    批评来得又快又猛

    功能上线后,Meta 确实留了一个「退出」开关,但你得自己钻进设置里翻才能找到。这个设计本身就招来一片骂声。全国性性剥削中心的负责人 Haley McNamara 说得更重:这不仅明摆着侵蚀了每个人对自己肖像的权利,还成了色情勒索和其他诈骗者的现成工具;先把高风险设计甩出来,再让用户自己费劲去退出,这完全说不过去。

    演员工会 SAG-AFTRA 也发文提醒会员去关掉这个功能,还专门写了一份操作指南。对一个拥有几十亿用户的平台来说,这种「默认开放、自己退出」的套路,碰到深伪和肖像权议题,天然就是火药桶。

    为什么这次回滚这么快

    从宣布到关停只隔了几天,速度本身就很说明问题。过去这类争议往往要扯上几周甚至更久,但 2026 年的舆论环境里,用户、行业组织和媒体的反应已经快到一个产品可以用「天」来计算生死。Meta 自己的措辞是 feature「missed the mark」(没踩准点),算是体面地认了个错。

    • 功能的触发方式太轻巧:一个 @ 就能调用他人公开内容,滥用门槛极低
    • 「默认开通、主动退出」把保护责任推给用户,触碰了深伪与肖像权红线
    • 在勒索、诈骗风险面前,创意工具的便利很难站得住脚

    留给行业的提醒

    这次回滚并不意味着 Meta 放弃了 AI 生图。Muse Image 本身还在,被砍掉的只是「拿公开账号当素材」这一条路径。但它给所有做生成式 AI 的团队提了个醒:当工具能直接动用真实人物的脸和身份时,「创意自由」和「基本权利」之间的天平,用户和监管都不会让你随便摆。

    对普通用户来说,最实在的一课也许是:你的公开资料从来不只是「公开」那么简单,平台一句「你可以退出」并不能替你挡掉所有风险。


  • Anthropic 发布 Claude Sonnet 5:中端价也能把智能体跑到底

    过去几个月,大模型公司之间比的不只是谁更聪明,而是谁更能自己干活。Anthropic 这两天把 Claude Sonnet 5 推到台前,定位很清楚:不是要取代旗舰模型 Opus 4.8,而是让中端价位也能跑起像样的自主智能体。

    Claude Sonnet 5 模型发布
    Anthropic 把新一代中端模型 Sonnet 5 推上了默认档位(图源:TechCrunch)

    从「会聊天」到「能办事」

    Anthropic 在发布说明里说得很直白:Sonnet 5 能制定计划、调用浏览器和终端这类工具,还能在相当长的时间里自己跑任务——这种能力在几个月前还得靠更大、更贵的模型。OpenAI 的 GPT-5.6 Sol 上周刚开预览,主打的也是把任务拆给子智能体;谷歌五月的 Gemini 3.5 Flash 同样在讲「从聊天机器人变成能动手干活的代理」。三家的话术出奇地一致,说明一件事:能自主干活,已经从卖点变成了每个价位段都要有的基本功。

    当大家都会干这点活之后,比拼的就不是「谁更能干」,而是「干同样的活要花多少钱、能不能少人盯着」。Sonnet 5 主打的就是这个:能力接近 Opus 4.8,但价格低一大截。

    「Sonnet 5 和 Opus 4.8 之间,用户可以自己调节投入的力度,在成本和效果之间找到平衡。」—— Anthropic

    价格才是这回真正的重头戏

    从周二起,Sonnet 5 成了免费版和 Pro 版的默认模型,所有订阅档位都能用。定价上,8 月 31 日之前是引导价:每百万输入 token 2 美元、输出 10 美元;过了这个窗口会涨到 3 美元和 15 美元。横向看,它比 Opus 4.8、OpenAI 的 GPT-5.5、谷歌的 Gemini 3.1 Pro 都便宜,当然还是贵过 Gemini 3.5 Flash。

    对真正在跑智能体的团队来说,这点差价会被反复放大。一个任务要不断翻文件、调工具、反复校验输出,账单是跟着调用次数走的。中端模型的意义不只是省一点边际成本,它往往决定一条工作流在生产环境里到底跑不跑得起来。

    能力到底够不够用

    Anthropic 的说法是,Sonnet 5 相比今年 2 月的 Sonnet 4.6,在推理、工具使用、写代码和知识工作上都明显进步。跑分上,智能体写代码一项它拿到 63.2%,Opus 4.8 是 69.2%,上一代 Sonnet 4.6 是 58.1%;而在知识工作这类 benchmark 上,Sonnet 5 甚至略微反超了以「啃硬骨头」著称的 Opus 4.8。

    早期试用的人给了更具体的例子。Zapier 的高级工程师 Daniel Shepard 说,他们交给 Sonnet 5 一个两步走的任务——更新 Salesforce 里的客户分级、再给企业联系人发发布通知——模型从头到尾跑完了。「以前这种活儿跑到一半就卡住,日常自动化这块,它基本没理由不选。」他还提到,Sonnet 5 会在没人明确要求的情况下自己检查输出对不对。

    • 能自主制定计划并调用浏览器、终端等工具,不再依赖人工分步喂指令
    • 在长链路任务里更不容易中途放弃,还会主动复核自己的产出
    • 相较上一代,更少胡说、更少「顺着你说」,也更会拒绝恶意请求、挡住提示词注入攻击

    安全这块也没含糊

    Anthropic 特意提了安全表现:Sonnet 5 在「配合滥用」「欺骗」这类不良行为上的发生率比上一代更低,也更擅长拒绝恶意请求、绕开提示词注入的劫持。当然,论对齐程度它还到不了 Opus 4.8 和 Claude Mythos Preview 的层次,官方也承认它执行危险网络安全任务的能力比现有 Opus 模型弱不少。

    Lovable 联合创始人 Fabian Hedin 的反馈点出了一个常被忽略的角度:把强力工具交到几百万开发者手里时,「知道什么时候该说不」和「知道怎么搭东西」一样重要。


  • Anthropic 发布 Claude Sonnet 5:中端价也能把智能体跑到底

    过去几个月,大模型公司之间比的不只是谁更聪明,而是谁更能自己干活。Anthropic 这两天把 Claude Sonnet 5 推到台前,定位很清楚:不是要取代旗舰模型 Opus 4.8,而是让中端价位也能跑起像样的自主智能体。

    Claude Sonnet 5 模型发布
    Anthropic 把新一代中端模型 Sonnet 5 推上了默认档位(图源:TechCrunch)

    从「会聊天」到「能办事」

    Anthropic 在发布说明里说得很直白:Sonnet 5 能制定计划、调用浏览器和终端这类工具,还能在相当长的时间里自己跑任务——这种能力在几个月前还得靠更大、更贵的模型。OpenAI 的 GPT-5.6 Sol 上周刚开预览,主打的也是把任务拆给子智能体;谷歌五月的 Gemini 3.5 Flash 同样在讲「从聊天机器人变成能动手干活的代理」。三家的话术出奇地一致,说明一件事:能自主干活,已经从卖点变成了每个价位段都要有的基本功。

    当大家都会干这点活之后,比拼的就不是「谁更能干」,而是「干同样的活要花多少钱、能不能少人盯着」。Sonnet 5 主打的就是这个:能力接近 Opus 4.8,但价格低一大截。

    「Sonnet 5 和 Opus 4.8 之间,用户可以自己调节投入的力度,在成本和效果之间找到平衡。」—— Anthropic

    价格才是这回真正的重头戏

    从周二起,Sonnet 5 成了免费版和 Pro 版的默认模型,所有订阅档位都能用。定价上,8 月 31 日之前是引导价:每百万输入 token 2 美元、输出 10 美元;过了这个窗口会涨到 3 美元和 15 美元。横向看,它比 Opus 4.8、OpenAI 的 GPT-5.5、谷歌的 Gemini 3.1 Pro 都便宜,当然还是贵过 Gemini 3.5 Flash。

    对真正在跑智能体的团队来说,这点差价会被反复放大。一个任务要不断翻文件、调工具、反复校验输出,账单是跟着调用次数走的。中端模型的意义不只是省一点边际成本,它往往决定一条工作流在生产环境里到底跑不跑得起来。

    能力到底够不够用

    Anthropic 的说法是,Sonnet 5 相比今年 2 月的 Sonnet 4.6,在推理、工具使用、写代码和知识工作上都明显进步。跑分上,智能体写代码一项它拿到 63.2%,Opus 4.8 是 69.2%,上一代 Sonnet 4.6 是 58.1%;而在知识工作这类 benchmark 上,Sonnet 5 甚至略微反超了以「啃硬骨头」著称的 Opus 4.8。

    早期试用的人给了更具体的例子。Zapier 的高级工程师 Daniel Shepard 说,他们交给 Sonnet 5 一个两步走的任务——更新 Salesforce 里的客户分级、再给企业联系人发发布通知——模型从头到尾跑完了。「以前这种活儿跑到一半就卡住,日常自动化这块,它基本没理由不选。」他还提到,Sonnet 5 会在没人明确要求的情况下自己检查输出对不对。

    • 能自主制定计划并调用浏览器、终端等工具,不再依赖人工分步喂指令
    • 在长链路任务里更不容易中途放弃,还会主动复核自己的产出
    • 相较上一代,更少胡说、更少「顺着你说」,也更会拒绝恶意请求、挡住提示词注入攻击

    安全这块也没含糊

    Anthropic 特意提了安全表现:Sonnet 5 在「配合滥用」「欺骗」这类不良行为上的发生率比上一代更低,也更擅长拒绝恶意请求、绕开提示词注入的劫持。当然,论对齐程度它还到不了 Opus 4.8 和 Claude Mythos Preview 的层次,官方也承认它执行危险网络安全任务的能力比现有 Opus 模型弱不少。

    Lovable 联合创始人 Fabian Hedin 的反馈点出了一个常被忽略的角度:把强力工具交到几百万开发者手里时,「知道什么时候该说不」和「知道怎么搭东西」一样重要。


  • OpenClaw 终于上手机了:开源 AI 智能体装进你的口袋

    开源 AI 智能体 OpenClaw 登陆手机概念图
    OpenClaw 推出官方手机 App,把开源 AI 智能体带进了口袋

    今年年初,一个叫 OpenClaw 的开源 AI 智能体在网上火得一塌糊涂。它能帮你写代码、订外卖、整理日程,甚至有人拿它搞出了个号称”全是 Agent”的社交网站。6 月 30 日,它的开发者在 X 上宣布:OpenClaw 现在有了 iOS 和安卓的官方 App。那只在网上横着走的”龙虾”,爬进你的手机了。

    手机不是又一个聊天框

    市面上绝大多数 AI 手机应用,逻辑都差不多:你说话,它回答,手机就是个听筒。OpenClaw 走的是另一条路。它的核心是一套跑在你自己机器上的 Gateway(网关),负责把你的请求路由给各种 Agent,以及这些 Agent 要调用的工具和技能。手机端不是一个新界面,而是一个”伴生节点”——你把它和 Gateway 配对,就能在口袋里直接指挥自己的 Agent 干活。

    “如果设置得当,它们或许能帮你相当高效地完成各种任务。”TechCrunch 在报道里这么写。从写代码到规划三餐,用户已经把 OpenClaw 用在了各种地方。

    从病毒式爆红到正经产品

    OpenClaw 的走红带着点戏剧性。年初它靠 MoltBook 这个”全是 Agent 的社交网站”出圈,后来研究者发现,那场热闹有一部分是真人假扮 Agent 演出来的——一场营销,效果拉满,可信度打了折扣。但闹剧指向的方向是真的:Agent 正在渗进日常。2 月,OpenClaw 的创造者 Peter Steinberger 宣布加入 OpenAI,给这个故事又添了一层微妙。

    不是每个人都能顺手

    别把它想得太神。Agent 能不能帮上忙,很大程度上取决于你有没有把它”调教”好。有人用得风生水起,也有人反馈结果远不及预期。手机端的好处是,你随时能远程批准 Agent 的操作——它要做点什么,你在手机上点一下同意就行,不用守在电脑前。


    智能体正在填满你的屏幕

    OpenClaw 上手机不是孤例。就在同一天,TechCrunch 还报道了一款叫 Acti 的工具,把 AI Agent 直接塞进了手机输入法键盘;微软的 Scout、Google 的 Gemini Spark 也都在往”常驻助手”的方向靠。Agent 从聊天框里走出来,变成能替你跑腿、等你点头的角色,这条路已经越走越宽。

    • 平台:iOS 与安卓官方 App 同步上线
    • 架构:手机配对自托管 Gateway,作为伴生节点运行 Agent
    • 交互:支持远程批准 Agent 的操作,不必守在电脑前
    • 现实:效果取决于配置,有人惊艳也有人觉得鸡肋
  • 谷歌把文生图价格打下来了:Nano Banana 2 Lite 四秒出图

    谷歌 Nano Banana 2 Lite 高速文生图概念图
    谷歌新发布的 Nano Banana 2 Lite 主打高速、低成本的文生图能力

    如果你最近在折腾 AI 画图,应该对”又慢又贵”这四个字不陌生。想要一张能用的图,等上二三十秒是常事,批量出图更是烧钱。谷歌这周悄悄把这个问题往前推了一步——6 月 30 日,它发布了 Nano Banana 2 Lite,定位很直白:快,而且便宜。

    四秒一张,价格低到可以忽略

    按照谷歌的说法,这个新模型生成一张图只要大约四秒,比上一代 Nano Banana 2 快了不止一点。价格更夸张,每生成 1000 张图只要 0.034 美元。什么概念?你拿它来反复试稿、批量产出,成本几乎可以当它不存在。它并不是来替代旗舰的——谷歌另外还有更贵的 Nano Banana Pro,以及性能更强的 Nano Banana 2。Lite 干的是另一件事:把”高频、海量、要快”这条路补齐。

    “Building with generative media is often about creative iteration,” 谷歌在博客里写道,”有了这两个模型,开发者能把快速出图和视频创作串成一条完整的流水线。”

    不是更聪明,是更合适

    Lite 牺牲了多分辨率和一些重型能力(只输出 1K 分辨率),把全部算力压在了速度和单位成本上。对电商素材、广告创意快速迭代、自动化内容流水线这类场景来说,这恰恰是痛点。它已经通过 Google AI Studio、Gemini API 和 Gemini Enterprise Agent Platform 上线,并且直接取代了初代 Nano Banana——谷歌现在把初代叫做”legacy model”(遗留模型)。

    图片只是起点,视频才是下一步

    同一天,谷歌还把 Gemini Omni Flash 的开放范围扩大了。这个模型能把静态图直接变成视频,每秒输出收费 0.10 美元。谷歌顺手展示了个叫 Omni Product Studio 的演示应用,能把 Nano Banana 生成的图转成”电影感的电商视频”。换句话说,先用 Lite 极速出图,再喂给 Omni Flash 做视频,一条龙。


    热闹背后,争议没停

    当然,这事没那么干净。AI 生成图被骂成”AI slop”(AI 垃圾内容)的声音一直没断,有研究说 TikTok 上六成视频、YouTube 上两成多的内容都是 AI 生成的。可即便如此,大厂还在往里砸钱。

    谷歌自己也在靠近好莱坞——它刚和文艺片厂牌 A24 签了 7500 万美元的合作,粉丝那边反弹不小。一边是创作社区的警惕,一边是资本和效率的推力,文生图这条赛道只会更挤。

    • 速度:单张 1K 图约 4 秒,是上一代的五分之一
    • 成本:每 1000 张 0.034 美元,规模化出图几乎零边际成本
    • 定位:取代初代 Nano Banana,专注高吞吐工作流
    • 生态:与 Gemini Omni Flash 打通,图生视频一气呵成