分类: AI资讯

聚焦前沿人工智能动态,速览行业热点、技术突破、产业风向与实用 AI 干货,紧跟科技潮流,第一时间掌握 AI 最新趋势。

  • Meta的编程模型Muse Spark 1.1:不晒跑分,4.25美元/百万token抢开发者

    Meta的编程模型Muse Spark 1.1:不晒跑分,4.25美元/百万token抢开发者

    Meta Muse Spark 1.1 智能体编程模型
    Meta 发布面向智能体的多模态推理模型 Muse Spark 1.1

    7 月 9 日,Meta 上线了一个叫 Muse Spark 1.1 的模型。说它”低调”其实不太准确——扎克伯格亲自发帖,马斯克顺手一个转发,12 小时里相关视频被看了 1200 多万次。可翻开发布物料,你会发现一件怪事:没有 SWE-bench 分数,没有技术论文,也没开源。一个号称”编程模型”的东西,连个跑分都不敢晒。

    它到底能干什么

    Muse Spark 1.1 的定位是”给 AI 智能体用的多模态推理模型”。Meta 说它强化了多智能体协作:由一个主智能体负责收集信息、制定计划,再把任务拆给一堆子智能体并行执行,复杂项目的处理时间能明显缩短。上下文也拉长到了 100 万 token,长流程里能记住早先的内容。

    落到具体场景,它能在多个应用之间连续干长活儿,自己判断是该直接点界面、写段脚本自动化,还是一口气把几步操作做完,尽量少麻烦人。写代码这块,它能诊断修复杂 bug、开发新功能,甚至做大规模代码迁移,过程中一直保留关键上下文。Meta 说内部研发和研究员已经每天拿它辅助开发了。

    Meta 强调,Muse Spark 1.1 已按内部《Advanced AI Scaling Framework》完成部署前评估,在化学与生物安全、网络安全以及失控风险等前沿领域”均维持在安全范围内”。

    价格先打到底,基准一个没有

    这边没晒分,那边先把价格摆出来了:输出定价每百万 token 4.25 美元。比 Grok 4.5 还便宜,大概只有 GPT 近段时间价格的一小部分。如果后续基准勉强能看,这个价可能直接成为个人开发者的甜区,给 GitHub Copilot、Cursor 的收费模式施压。

    不过 Meta 自己的内部评估也坦诚,在部分电脑操作、长上下文和代码测试上,Muse Spark 1.1 仍然落后于 GPT-5.5 和 Claude Opus 4.8。它更像是先抛声量、后补证据的发布——在 Meta 今年预计超 650 亿美元资本开支的压力下,这款模型如果不能快速拉出用户规模,很容易又被看成”又一个没结果的尝试”。

    • 零基准发布:没有 SWE-bench、没有论文、没有开源,与 Llama 系列习惯相反
    • 价格战打法:4.25 美元/百万 token 输出,瞄准个人开发者
    • 能力边界:智能体、代码、通用推理有提升,但硬指标仍落后于 GPT-5.5 和 Claude Opus 4.8

  • GPT-5.6全量上线:OpenAI把Codex塞进ChatGPT,价格也打下来了

    OpenAI GPT-5.6 模型发布
    OpenAI 最新模型家族 GPT-5.6 终于全量上线(图源:TechCrunch)

    这周 AI 圈最热闹的事,莫过于 GPT-5.6 终于向所有人开放了。说”终于”一点都不夸张——6 月底 OpenAI 把这套模型亮出来的时候,美国政府以国家安全审查为由,只让它给一小撮”可信合作伙伴”做预览。等了大约两周,到北京时间 7 月 10 日凌晨,Sol、Terra、Luna 三档才一起放出来。这也是头一回,一家前沿模型公司在发布前被政府按了暂停键。

    三档模型,主打一个”省”

    这一代的名字挺有意思,直接用天体命名。Sol(太阳)是旗舰,专啃硬核编码、科研和网络安全这些骨头;Terra(地球)是均衡档,价格比上一代砍了一半;Luna(月亮)最便宜,每百万输入 token 只要 1 美元、输出 6 美元。OpenAI 这回没怎么讲”我更聪明了”,反反复复在说”我更便宜了”——前沿模型之间的智商差距正在收窄,大家开始比谁的单位任务成本更低。

    OpenAI 在博客里写得直白:”我们不认为这种政府介入模型发布的流程应该成为长期默认。它把最好的工具挡在了用户、开发者、企业和全球合作伙伴门外。”

    Codex 没了,ChatGPT 变成”超级应用”

    同一晚被模型光环盖过的,是另外两条公告。一个是 ChatGPT Work,一个面向办公场景的智能体,能帮你起草文档、表格和幻灯片;另一个是 Codex App 正式并入 ChatGPT 桌面端。以前你要单独开一个 Codex,现在只剩 ChatGPT 一个入口。OpenAI 明显在学”超级应用”那套打法,想成为你电脑里常驻的那一层。

    Sol 本身也加了戏。除了常规推理档位,还有 max 模式让你想得更久,以及 ultra 模式——它会协调多个子智能体并行干活,官方说最多能拉到 16 个。在第三方编程基准上,开满推理的 Sol 跑分领先同代模型,而且花的 token 更少。安全方面它内置了偏防御的网安能力,主打”难越狱、教你怎么防而不是教你怎么攻”。

    上线即翻车?

    理想很丰满,第一天的口碑却有点裂。不少付费用户抱怨额度烧得飞快,连 Pro 会员都频频撞上限;有人觉得新界面找不着北,老功能凭空消失。更离谱的是,有开发者发帖说开最高推理档的 GPT-5.6-Sol 误删了他 Mac 上几乎所有文件。OpenAI 员工后来出来解释,多半是推理档位开太高,团队正在修导航和默认设置的问题。

    • 政府审查成先例:前沿模型发布前过国安审查,可能变成新常态
    • 价格战主线:Terra、Luna 把单位任务成本压到前代一半甚至更低
    • 体验短板:额度、界面、稳定性仍是 OpenAI 要补的课

  • Meta 紧急关掉 Instagram AI 换脸功能:上线四天就认错

    这周科技圈又上演了一出熟悉的戏码:一个大公司推出一个「听起来很酷」的 AI 功能,用户还没玩热乎,舆论和监管机构已经把它按了回去。这次的主角是 Meta——它给 Instagram 加的那个「@ 一下公开账号就能拿对方照片生成 AI 图」的功能,从宣布到下线,前后不到四天。

    Meta Muse Image 通过 @ 提及公开 Instagram 账号生成 AI 图
    Meta AI 的 Muse Image 曾允许用户 @ 提及公开 Instagram 账号来生成 AI 图(图源:The Verge)

    一个 @ 就能「借用」别人的照片

    事情是这样的。Meta 本周早些时候宣布,在 Meta AI 里生成图片时,你可以直接 @ 提及某个公开的 Instagram 账号,让 AI 参考这个账号的内容来出图。初衷听起来挺正当:给创作者一个好玩的工具,顺便让用户自己决定「我的公开内容能不能被这么用」。

    问题出在默认设置上。按照最初的设计,任何公开 Instagram 账号的内容,都可以被塞进别人的 AI 创作里,而且不需要账号主人点头。换句话说,你的头像、你的照片,别人动动手指就能拿来生成一张以你为主角的 AI 图——而你全程可能毫不知情。

    「我们听到了反馈,这个功能没踩在点上,所以它不再可用了。」—— Meta 关于 Muse Image 的更新说明

    批评来得又快又猛

    功能上线后,Meta 确实留了一个「退出」开关,但你得自己钻进设置里翻才能找到。这个设计本身就招来一片骂声。全国性性剥削中心的负责人 Haley McNamara 说得更重:这不仅明摆着侵蚀了每个人对自己肖像的权利,还成了色情勒索和其他诈骗者的现成工具;先把高风险设计甩出来,再让用户自己费劲去退出,这完全说不过去。

    演员工会 SAG-AFTRA 也发文提醒会员去关掉这个功能,还专门写了一份操作指南。对一个拥有几十亿用户的平台来说,这种「默认开放、自己退出」的套路,碰到深伪和肖像权议题,天然就是火药桶。

    为什么这次回滚这么快

    从宣布到关停只隔了几天,速度本身就很说明问题。过去这类争议往往要扯上几周甚至更久,但 2026 年的舆论环境里,用户、行业组织和媒体的反应已经快到一个产品可以用「天」来计算生死。Meta 自己的措辞是 feature「missed the mark」(没踩准点),算是体面地认了个错。

    • 功能的触发方式太轻巧:一个 @ 就能调用他人公开内容,滥用门槛极低
    • 「默认开通、主动退出」把保护责任推给用户,触碰了深伪与肖像权红线
    • 在勒索、诈骗风险面前,创意工具的便利很难站得住脚

    留给行业的提醒

    这次回滚并不意味着 Meta 放弃了 AI 生图。Muse Image 本身还在,被砍掉的只是「拿公开账号当素材」这一条路径。但它给所有做生成式 AI 的团队提了个醒:当工具能直接动用真实人物的脸和身份时,「创意自由」和「基本权利」之间的天平,用户和监管都不会让你随便摆。

    对普通用户来说,最实在的一课也许是:你的公开资料从来不只是「公开」那么简单,平台一句「你可以退出」并不能替你挡掉所有风险。


  • Anthropic 发布 Claude Sonnet 5:中端价也能把智能体跑到底

    过去几个月,大模型公司之间比的不只是谁更聪明,而是谁更能自己干活。Anthropic 这两天把 Claude Sonnet 5 推到台前,定位很清楚:不是要取代旗舰模型 Opus 4.8,而是让中端价位也能跑起像样的自主智能体。

    Claude Sonnet 5 模型发布
    Anthropic 把新一代中端模型 Sonnet 5 推上了默认档位(图源:TechCrunch)

    从「会聊天」到「能办事」

    Anthropic 在发布说明里说得很直白:Sonnet 5 能制定计划、调用浏览器和终端这类工具,还能在相当长的时间里自己跑任务——这种能力在几个月前还得靠更大、更贵的模型。OpenAI 的 GPT-5.6 Sol 上周刚开预览,主打的也是把任务拆给子智能体;谷歌五月的 Gemini 3.5 Flash 同样在讲「从聊天机器人变成能动手干活的代理」。三家的话术出奇地一致,说明一件事:能自主干活,已经从卖点变成了每个价位段都要有的基本功。

    当大家都会干这点活之后,比拼的就不是「谁更能干」,而是「干同样的活要花多少钱、能不能少人盯着」。Sonnet 5 主打的就是这个:能力接近 Opus 4.8,但价格低一大截。

    「Sonnet 5 和 Opus 4.8 之间,用户可以自己调节投入的力度,在成本和效果之间找到平衡。」—— Anthropic

    价格才是这回真正的重头戏

    从周二起,Sonnet 5 成了免费版和 Pro 版的默认模型,所有订阅档位都能用。定价上,8 月 31 日之前是引导价:每百万输入 token 2 美元、输出 10 美元;过了这个窗口会涨到 3 美元和 15 美元。横向看,它比 Opus 4.8、OpenAI 的 GPT-5.5、谷歌的 Gemini 3.1 Pro 都便宜,当然还是贵过 Gemini 3.5 Flash。

    对真正在跑智能体的团队来说,这点差价会被反复放大。一个任务要不断翻文件、调工具、反复校验输出,账单是跟着调用次数走的。中端模型的意义不只是省一点边际成本,它往往决定一条工作流在生产环境里到底跑不跑得起来。

    能力到底够不够用

    Anthropic 的说法是,Sonnet 5 相比今年 2 月的 Sonnet 4.6,在推理、工具使用、写代码和知识工作上都明显进步。跑分上,智能体写代码一项它拿到 63.2%,Opus 4.8 是 69.2%,上一代 Sonnet 4.6 是 58.1%;而在知识工作这类 benchmark 上,Sonnet 5 甚至略微反超了以「啃硬骨头」著称的 Opus 4.8。

    早期试用的人给了更具体的例子。Zapier 的高级工程师 Daniel Shepard 说,他们交给 Sonnet 5 一个两步走的任务——更新 Salesforce 里的客户分级、再给企业联系人发发布通知——模型从头到尾跑完了。「以前这种活儿跑到一半就卡住,日常自动化这块,它基本没理由不选。」他还提到,Sonnet 5 会在没人明确要求的情况下自己检查输出对不对。

    • 能自主制定计划并调用浏览器、终端等工具,不再依赖人工分步喂指令
    • 在长链路任务里更不容易中途放弃,还会主动复核自己的产出
    • 相较上一代,更少胡说、更少「顺着你说」,也更会拒绝恶意请求、挡住提示词注入攻击

    安全这块也没含糊

    Anthropic 特意提了安全表现:Sonnet 5 在「配合滥用」「欺骗」这类不良行为上的发生率比上一代更低,也更擅长拒绝恶意请求、绕开提示词注入的劫持。当然,论对齐程度它还到不了 Opus 4.8 和 Claude Mythos Preview 的层次,官方也承认它执行危险网络安全任务的能力比现有 Opus 模型弱不少。

    Lovable 联合创始人 Fabian Hedin 的反馈点出了一个常被忽略的角度:把强力工具交到几百万开发者手里时,「知道什么时候该说不」和「知道怎么搭东西」一样重要。


  • Anthropic 发布 Claude Sonnet 5:中端价也能把智能体跑到底

    过去几个月,大模型公司之间比的不只是谁更聪明,而是谁更能自己干活。Anthropic 这两天把 Claude Sonnet 5 推到台前,定位很清楚:不是要取代旗舰模型 Opus 4.8,而是让中端价位也能跑起像样的自主智能体。

    Claude Sonnet 5 模型发布
    Anthropic 把新一代中端模型 Sonnet 5 推上了默认档位(图源:TechCrunch)

    从「会聊天」到「能办事」

    Anthropic 在发布说明里说得很直白:Sonnet 5 能制定计划、调用浏览器和终端这类工具,还能在相当长的时间里自己跑任务——这种能力在几个月前还得靠更大、更贵的模型。OpenAI 的 GPT-5.6 Sol 上周刚开预览,主打的也是把任务拆给子智能体;谷歌五月的 Gemini 3.5 Flash 同样在讲「从聊天机器人变成能动手干活的代理」。三家的话术出奇地一致,说明一件事:能自主干活,已经从卖点变成了每个价位段都要有的基本功。

    当大家都会干这点活之后,比拼的就不是「谁更能干」,而是「干同样的活要花多少钱、能不能少人盯着」。Sonnet 5 主打的就是这个:能力接近 Opus 4.8,但价格低一大截。

    「Sonnet 5 和 Opus 4.8 之间,用户可以自己调节投入的力度,在成本和效果之间找到平衡。」—— Anthropic

    价格才是这回真正的重头戏

    从周二起,Sonnet 5 成了免费版和 Pro 版的默认模型,所有订阅档位都能用。定价上,8 月 31 日之前是引导价:每百万输入 token 2 美元、输出 10 美元;过了这个窗口会涨到 3 美元和 15 美元。横向看,它比 Opus 4.8、OpenAI 的 GPT-5.5、谷歌的 Gemini 3.1 Pro 都便宜,当然还是贵过 Gemini 3.5 Flash。

    对真正在跑智能体的团队来说,这点差价会被反复放大。一个任务要不断翻文件、调工具、反复校验输出,账单是跟着调用次数走的。中端模型的意义不只是省一点边际成本,它往往决定一条工作流在生产环境里到底跑不跑得起来。

    能力到底够不够用

    Anthropic 的说法是,Sonnet 5 相比今年 2 月的 Sonnet 4.6,在推理、工具使用、写代码和知识工作上都明显进步。跑分上,智能体写代码一项它拿到 63.2%,Opus 4.8 是 69.2%,上一代 Sonnet 4.6 是 58.1%;而在知识工作这类 benchmark 上,Sonnet 5 甚至略微反超了以「啃硬骨头」著称的 Opus 4.8。

    早期试用的人给了更具体的例子。Zapier 的高级工程师 Daniel Shepard 说,他们交给 Sonnet 5 一个两步走的任务——更新 Salesforce 里的客户分级、再给企业联系人发发布通知——模型从头到尾跑完了。「以前这种活儿跑到一半就卡住,日常自动化这块,它基本没理由不选。」他还提到,Sonnet 5 会在没人明确要求的情况下自己检查输出对不对。

    • 能自主制定计划并调用浏览器、终端等工具,不再依赖人工分步喂指令
    • 在长链路任务里更不容易中途放弃,还会主动复核自己的产出
    • 相较上一代,更少胡说、更少「顺着你说」,也更会拒绝恶意请求、挡住提示词注入攻击

    安全这块也没含糊

    Anthropic 特意提了安全表现:Sonnet 5 在「配合滥用」「欺骗」这类不良行为上的发生率比上一代更低,也更擅长拒绝恶意请求、绕开提示词注入的劫持。当然,论对齐程度它还到不了 Opus 4.8 和 Claude Mythos Preview 的层次,官方也承认它执行危险网络安全任务的能力比现有 Opus 模型弱不少。

    Lovable 联合创始人 Fabian Hedin 的反馈点出了一个常被忽略的角度:把强力工具交到几百万开发者手里时,「知道什么时候该说不」和「知道怎么搭东西」一样重要。


  • OpenAI 首颗自研芯片 Jalapeño 出炉,不再只靠英伟达

    OpenAI 首颗自研芯片 Jalapeño 出炉,不再只靠英伟达

    OpenAI 首颗自研推理芯片 Jalapeño
    OpenAI 与博通联合发布首颗自研推理芯片 Jalapeño(图源:TechCrunch)

    OpenAI 一直被看作做模型的,6 月 24 日这天它跨过了那条线——和博通联合发布了一颗叫 Jalapeño(墨西哥辣椒)的芯片,这是 OpenAI 第一颗自己定制的 AI 处理器。合作去年 10 月就官宣了,但真把芯片摆到台前,还是头一回。

    专门为跑模型而生

    Jalapeño 的定位很明确:它是推理芯片,不是训练芯片。说人话就是,它负责把已经训练好的模型跑起来、响应用户指令,而不是从零去炼模型。OpenAI 在公告里特别强调,它在跑实时 coding 模型(比如 Codex)时运营成本很低。像预训练这种更吃算力的重活,短期内还得靠英伟达的 GPU,但光是把推理这一块的成本往下压,对 OpenAI 的账本就已经意义不小。

    我们不只是做前沿模型、在模型上搭产品,我们连底下的基础设施都自己设计了——芯片架构、内存系统、网络、调度、部署,全在一层一层地把同一件事优化到极致。

    AI 参与设计了自己的硬件

    最让我觉得绕的一个细节是:OpenAI 自己的 AI 模型,参与了这颗芯片的设计过程。从架构设计到把版图数据交给晶圆厂(tape-out),整段只用了大约九个月。OpenAI 自己说,这可能是高性能半导体领域有史以来最快的 ASIC 开发周期。硬件负责人 Richard Ho 来头也不小,在谷歌待了快九年,是 Cloud TPU 项目的核心工程师。

    为什么非得自己造?说白了是想少依赖英伟达的 GPU。这条路上谷歌有 TPU、亚马逊有 Trainium,都是同一个思路——用专门加速机器学习的硅,把特定工作负载跑得更快更省。OpenAI 总裁 Greg Brockman 的话很直白:我们太懂这个工作负载了,就去找那些没被伺候好的环节,想办法加速它。

    全栈公司的必然一步

    把视角拉高一点看,造芯是 OpenAI 从模型公司往全栈基础设施公司走的自然一步。模型、产品、数据中心、再到芯片,每一层它都想攥在自己手里。据外界披露,微软还承诺包销了 Jalapeño 首期大约 40% 的产能。芯片计划先以工程样片在实验室跑通 GPT-5.3-Codex-Spark 这类模型,后续再放到吉瓦级别的数据中心里规模部署。

    • Jalapeño 是 OpenAI 首颗自研推理芯片,由博通代工实现、台积电 3nm 制造
    • AI 模型参与芯片设计,九个月走完从设计到流片
    • 目标不是取代英伟达,而是把最贵的推理成本压下来

    这不是要和英伟达掀桌子,而是 OpenAI 想把自己最贵、也最日常的那块成本,从别人手里拿回来一部分。当一家公司的模型每天被几亿人调用,每一分钱的推理开销乘上去都是天文数字——自己造芯,只是时间问题。

  • 苹果造车计划黄了,却意外成就端侧AI最强芯片

    苹果造车计划黄了,却意外成就端侧AI最强芯片

    苹果芯片与神经网络引擎
    苹果十年造车梦碎,却意外喂出了端侧 AI 最硬的底牌(图源:The Verge)

    苹果那辆传了十年的车,最后还是没造出来。项目在 2024 年被悄悄砍掉,前后烧掉上百亿美元,外界大多把它当成苹果少有的滑铁卢。但彭博社 Mark Gurman 在最新的 Power On 通讯里捅破了另一层窗户纸:那场失败的豪赌,其实给今天的苹果 AI 埋下了一块最硬的底牌。

    一辆车逼出来的芯片

    故事得回到项目刚启动那会儿。苹果当时瞄准的是 L5 级全自动驾驶——车子完全不用人管,自己跑。要做到这一点,车必须在本地实时处理海量的感知和决策数据,对算力的要求高到当时的手机芯片根本扛不住。于是工程师们一头扎进机器学习研究和定制芯片,想做一颗专门塞进车体的 AI 处理器。

    结果这颗车规级芯片最终没流片,一辆车也没装上。但它在研发过程中催生的一套底层能力,并没有跟着项目一起进垃圾桶,而是演变成了后来人人都熟悉的神经网络引擎(Neural Engine)——今天几乎所有苹果设备里负责 AI 运算的那块核心。

    那笔钱没有白花。一个没能交付的产品,反而成了苹果在端侧 AI 起跑时偷偷抢到的身位。

    从认脸到跑大模型

    神经网络引擎第一次亮相,是 2017 年随 iPhone X 和 A11 仿生芯片一起登场的。那会儿它还很朴素,主要干计算机视觉的活儿:让 FaceID 在暗光下认出你的脸、把表情实时映射到 Animoji、再撑起一些 AR 效果。这些功能有个共同点——原本要传到云端处理的敏感图像,现在全锁在设备本地完成。

    真正让逻辑变清楚的,是 M 系列芯片把这块加速单元搬上了 Mac。消费级电脑开始能跑过去只有云端服务器才扛得动的模型。这一步,也给苹果后来那套隐私优先的叙事,提供了实打实的硬件支点:本地能算的越多,离开设备的数据就越少。

    软件掉队,硬件领跑

    客观说,苹果在 AI 软件上的节奏一直被吐槽——Apple Intelligence 落地慢、Siri 升级跳票,外界没少阴阳怪气。但硬件这一边,确实拿得出手。Gurman 透露,苹果接下来打算跳过即将到来的 M6 芯片的 Pro、Max 和 Ultra 版本,直接加速推进 M7,预计 2027 年上半年登场,神经网络引擎会有大幅升级。M7 Ultra 还会成为苹果新一代服务器产品的基础,最高支持到 1.5TB 内存。

    • 十年造车梦碎,却催生了贯穿全系设备的神经网络引擎
    • 端侧算力让苹果敢把隐私当核心卖点,数据尽量不离开设备
    • M7 提前加速,Ultra 版本直奔 1.5TB 内存的服务器场景

    回过头看挺有意思:一个烧掉上百亿、折腾十多年的失败项目,最后可能变成苹果在端侧 AI 时代最划算的一笔长期投资。当整个行业都在把大模型往设备本地搬的时候,那颗没能上车的芯片,倒先一步给了苹果抢跑的资格。

  • OpenClaw 终于上手机了:开源 AI 智能体装进你的口袋

    开源 AI 智能体 OpenClaw 登陆手机概念图
    OpenClaw 推出官方手机 App,把开源 AI 智能体带进了口袋

    今年年初,一个叫 OpenClaw 的开源 AI 智能体在网上火得一塌糊涂。它能帮你写代码、订外卖、整理日程,甚至有人拿它搞出了个号称”全是 Agent”的社交网站。6 月 30 日,它的开发者在 X 上宣布:OpenClaw 现在有了 iOS 和安卓的官方 App。那只在网上横着走的”龙虾”,爬进你的手机了。

    手机不是又一个聊天框

    市面上绝大多数 AI 手机应用,逻辑都差不多:你说话,它回答,手机就是个听筒。OpenClaw 走的是另一条路。它的核心是一套跑在你自己机器上的 Gateway(网关),负责把你的请求路由给各种 Agent,以及这些 Agent 要调用的工具和技能。手机端不是一个新界面,而是一个”伴生节点”——你把它和 Gateway 配对,就能在口袋里直接指挥自己的 Agent 干活。

    “如果设置得当,它们或许能帮你相当高效地完成各种任务。”TechCrunch 在报道里这么写。从写代码到规划三餐,用户已经把 OpenClaw 用在了各种地方。

    从病毒式爆红到正经产品

    OpenClaw 的走红带着点戏剧性。年初它靠 MoltBook 这个”全是 Agent 的社交网站”出圈,后来研究者发现,那场热闹有一部分是真人假扮 Agent 演出来的——一场营销,效果拉满,可信度打了折扣。但闹剧指向的方向是真的:Agent 正在渗进日常。2 月,OpenClaw 的创造者 Peter Steinberger 宣布加入 OpenAI,给这个故事又添了一层微妙。

    不是每个人都能顺手

    别把它想得太神。Agent 能不能帮上忙,很大程度上取决于你有没有把它”调教”好。有人用得风生水起,也有人反馈结果远不及预期。手机端的好处是,你随时能远程批准 Agent 的操作——它要做点什么,你在手机上点一下同意就行,不用守在电脑前。


    智能体正在填满你的屏幕

    OpenClaw 上手机不是孤例。就在同一天,TechCrunch 还报道了一款叫 Acti 的工具,把 AI Agent 直接塞进了手机输入法键盘;微软的 Scout、Google 的 Gemini Spark 也都在往”常驻助手”的方向靠。Agent 从聊天框里走出来,变成能替你跑腿、等你点头的角色,这条路已经越走越宽。

    • 平台:iOS 与安卓官方 App 同步上线
    • 架构:手机配对自托管 Gateway,作为伴生节点运行 Agent
    • 交互:支持远程批准 Agent 的操作,不必守在电脑前
    • 现实:效果取决于配置,有人惊艳也有人觉得鸡肋
  • 谷歌把文生图价格打下来了:Nano Banana 2 Lite 四秒出图

    谷歌 Nano Banana 2 Lite 高速文生图概念图
    谷歌新发布的 Nano Banana 2 Lite 主打高速、低成本的文生图能力

    如果你最近在折腾 AI 画图,应该对”又慢又贵”这四个字不陌生。想要一张能用的图,等上二三十秒是常事,批量出图更是烧钱。谷歌这周悄悄把这个问题往前推了一步——6 月 30 日,它发布了 Nano Banana 2 Lite,定位很直白:快,而且便宜。

    四秒一张,价格低到可以忽略

    按照谷歌的说法,这个新模型生成一张图只要大约四秒,比上一代 Nano Banana 2 快了不止一点。价格更夸张,每生成 1000 张图只要 0.034 美元。什么概念?你拿它来反复试稿、批量产出,成本几乎可以当它不存在。它并不是来替代旗舰的——谷歌另外还有更贵的 Nano Banana Pro,以及性能更强的 Nano Banana 2。Lite 干的是另一件事:把”高频、海量、要快”这条路补齐。

    “Building with generative media is often about creative iteration,” 谷歌在博客里写道,”有了这两个模型,开发者能把快速出图和视频创作串成一条完整的流水线。”

    不是更聪明,是更合适

    Lite 牺牲了多分辨率和一些重型能力(只输出 1K 分辨率),把全部算力压在了速度和单位成本上。对电商素材、广告创意快速迭代、自动化内容流水线这类场景来说,这恰恰是痛点。它已经通过 Google AI Studio、Gemini API 和 Gemini Enterprise Agent Platform 上线,并且直接取代了初代 Nano Banana——谷歌现在把初代叫做”legacy model”(遗留模型)。

    图片只是起点,视频才是下一步

    同一天,谷歌还把 Gemini Omni Flash 的开放范围扩大了。这个模型能把静态图直接变成视频,每秒输出收费 0.10 美元。谷歌顺手展示了个叫 Omni Product Studio 的演示应用,能把 Nano Banana 生成的图转成”电影感的电商视频”。换句话说,先用 Lite 极速出图,再喂给 Omni Flash 做视频,一条龙。


    热闹背后,争议没停

    当然,这事没那么干净。AI 生成图被骂成”AI slop”(AI 垃圾内容)的声音一直没断,有研究说 TikTok 上六成视频、YouTube 上两成多的内容都是 AI 生成的。可即便如此,大厂还在往里砸钱。

    谷歌自己也在靠近好莱坞——它刚和文艺片厂牌 A24 签了 7500 万美元的合作,粉丝那边反弹不小。一边是创作社区的警惕,一边是资本和效率的推力,文生图这条赛道只会更挤。

    • 速度:单张 1K 图约 4 秒,是上一代的五分之一
    • 成本:每 1000 张 0.034 美元,规模化出图几乎零边际成本
    • 定位:取代初代 Nano Banana,专注高吞吐工作流
    • 生态:与 Gemini Omni Flash 打通,图生视频一气呵成
  • Mistral也来抢机器人赛道:一个普通摄像头,让机器人在办公室里自己认路

    法国AI公司Mistral,大家更熟悉的是它那些开源大语言模型。但7月8日它悄悄把触角伸到了”物理世界”。新发布的Robostral Navigate是Mistral第一款面向机器人导航的模型,参数只有80亿,却干了件挺反直觉的事:让机器人只靠一个最普通的RGB摄像头,就能在复杂空间里自己走路、认路,不用激光雷达,也不用深度传感器。

    传统方案要让机器人不撞墙,往往得堆传感器——LiDAR、深度相机、好几路摄像头一起上。Robostral Navigate偏要做减法。它接收摄像头画面和一句大白话指令,比如”走出大堂,穿过走廊,进储物间,停在第二个货架正前方”,就自己驱动机器人走完整个流程,连训练时从没见过的人和障碍物都能现场避让。

    Mistral Robostral Navigate 单摄像头机器人导航
    仅凭一颗摄像头,Robostral Navigate 让机器人在办公空间自主导航(配图由AI生成)

    在R2R-CE这个导航基准上,它在没见过的环境里成功率76.6%,见过的有79.4%。更扎眼的是,它比此前最好的单摄像头方案高出9.7个百分点,甚至比用着深度或多摄像头的系统还高出4.5个百分点——”一只眼”反而赢了”多只眼”。

    怎么做到的:先学会”指路”,再学会”走路”

    核心是一套基于”指向”的导航机制。模型看着当前画面和历史指令,预测机器人下一步该往画面里的哪个坐标走、到了之后该朝向哪边。比起直接给”往前两米、左转25度”这种精确位移指令,这种”指路”的方式天然不挑相机参数、也不挑空间尺度,同一个模型能装在轮式的、腿式的甚至飞行的机器人上。

    训练上Mistral也走了一条省钱的路。整个模型完全在模拟环境里训出来,用6000个虚拟场景攒了大约40万条轨迹。再配上前缀缓存(prefix-caching)的训练算法,把整段任务压成一条序列一次训完,训练token量砍到原来的1/22,原本要几个月的活儿压缩到几天。最后再上一轮在线强化学习(CISPO),成功率又多榨出3.2个百分点。

    为什么这件事值得盯

    对Mistral来说,这只是通向”统一具身智能体”的第一步,但它戳中的是机器人落地最贵、最麻烦的一块——感知与导航。制造业、配送、物流、酒店这些场景里,”让机器自己从A走到B”向来是客户最想要的本事。把硬件门槛从一套传感器阵列降成”一颗摄像头加80亿参数”,意味着更多中小玩家也能碰机器人了。

    • 模型完全自研,不依赖任何开源视觉语言模型,从Mistral自家的 grounding 模型初始化而来。
    • 对相机内参差异很皮实,不同机器人、不同摄像头都能通用,部署起来省心。
    • 团队明确说还没看到性能天花板,更多训练和数据还能继续把数字往上推。

    当然,模型目前还没开源,权重和代码要走商务接洽。但Mistral从语言模型跨界到机器人,信号已经很清楚:当小模型也能用一颗摄像头搞定复杂导航,机器人自主移动的硬件护城河,正在被重新画一遍。