标签: AI技术

  • Google 推出 Nano Banana 2 Lite,图像生成速度快到离谱,价格还便宜

    Google Nano Banana 2 Lite
    Google 最新 AI 图像生成模型 Nano Banana 2 Lite

    Google 这两天放出了一个新版 AI 图像生成模型,叫 Nano Banana 2 Lite。名字听起来有点奇怪,但参数很实在——号称 4 秒钟出图,每 1000 张图只要 0.034 美元。

    这个模型是 Nano Banana 系列的最新成员。上一代 Nano Banana 2 今年 2 月才发布,主打更逼真的图像效果。而这次的 Lite 版本不走高端路线,直接瞄准那些需要大批量出图的场景——比如做广告创意、电商配图、或者纯粹想快速试验各种风格的用户。

    快,而且便宜

    Google 的说法是,Nano Banana 2 是”通用工作马”,什么都能干;Lite 版本则是为”高速批量工作流”优化的。如果你需要一口气生成几十张图来挑选最好的那张,Lite 版本会比标准版更合适。

    价格方面确实很有竞争力。0.034 美元/1000 张,折合人民币大概每张图两分多钱。作为对比,很多主流 AI 图像生成 API 的定价都比这个高不少。

    Google 在博客里写道:用生成式媒体做创作,核心就是不断迭代。有了这两个模型,开发者可以搭建完整的端到端多媒体体验。

    产品线收敛

    这次发布还有一个细节:Google 宣布 Nano Banana 2 Lite 将逐步替代原来的 Nano Banana 模型,后者被标记为”旧版”。这意味着 Google 在加速收敛它的图像生成产品线。

    同一天 Google 还宣布了 Gemini Omni Flash 的扩大开放。这个模型能把图片、音频和文字输入直接转成视频,定价是每秒视频输出 0.10 美元。

    争议没走远

    图像生成模型炒得再热,现实中的反弹也没停过。今年 6 月,有调研数据显示 TikTok 上约 60% 的视频内容是”AI 垃圾”——低质量、批量生成的内容把平台信息流搅得越来越浑浊。

    但 Google 似乎不打算放慢脚步。它还在加深和好莱坞的联系——前不久和独立电影公司 A24 签了一份 7500 万美元的合作协议,要用 AI 技术辅助电影制作。


    不管争议多大,Nano Banana 2 Lite 的推出至少说明了一件事:AI 图像生成的”价格战”还在继续。对普通开发者来说,工具越便宜,尝试的成本就越低。

  • OpenClaw 终于出了手机版,这下真能在口袋里跑 AI 智能体了

    OpenClaw 终于出了手机版,这下真能在口袋里跑 AI 智能体了

    今年早些时候在网上火了一阵的那个开源 AI 智能体 OpenClaw,这几天悄悄上架了 iOS 和 Android 应用。之前想用只能跑在电脑上,现在手机也能用了。

    OpenClaw 移动应用
    OpenClaw 现在有了官方移动应用

    用起来倒不复杂。手机装上应用之后,跟 OpenClaw Gateway 配对——这东西相当于一个路由层,把你手机上的请求转给后端的 AI 智能体和各种工具。配对好了,你就能在手机上直接跑之前在电脑上配置好的那些智能体了。

    OpenClaw 的用户已经把它玩出了花:写代码、规划餐食,甚至别的一些奇怪用法都有人试过。当然,翻车的人也不少,有人吐槽说结果实在不太行。

    MoltBook 那档子事

    OpenClaw 今年 2 月那波热度,很大程度上是靠 MoltBook 带起来的——当时号称是一个”完全由 AI 智能体组成的社交网络”,闹得挺大。后来被扒出来,里面有不少”智能体”其实是人在扮演,说白了就是一场营销噱头。

    这事说实话挺鸡贼的。用真人冒充 AI 来炒概念,短期确实能吸引眼球,但代价是把口碑搭进去了。不过话说回来,那阵风也确实让大家开始认真想一件事:智能体要是真能靠谱地跑起来,到底能干什么?


    手机上的智能体,到底靠不靠谱

    OpenClaw 上手机这步棋,赶上了智能体遍地开花的节点。你现在能在好多地方看到智能体的影子——键盘插件、各类 App 的集成,甚至系统级的入口也在路上了。

    但问题是,智能体在手机上到底能干多少实际的事,现在还真不好说。桌面端都还没完全跑顺,移动端受限于屏幕、交互方式和后台限制,能发挥的空间更小。OpenClaw 这波先把”能跑”这件事解决了,至于”跑得好不好”,还得靠后面的实际使用来说话。

  • Google NotebookLM 现在能把你的研究变成60秒短视频

    Google NotebookLM 现在能把你的研究变成60秒短视频

    Google 的 NotebookLM 前几天上线了一个新功能——把你塞进去的研究资料,直接变成一段 60 秒的竖屏短视频。就是那种你在 TikTok 上刷到的格式,有画面、有旁白,一口气把重点讲完。

    NotebookLM AI视频生成
    NotebookLM 现在能生成 TikTok 风格的短视频摘要

    这个功能目前向 Google AI Ultra 和 Pro 订阅用户开放。你把资料上传到 NotebookLM,它就能基于这些内容生成一段 60 秒的竖屏视频,配上了 AI 生成的画面和自动旁白。

    Google 分享了一个例子:用澳大利亚历史上那场”鸸鹋战争”做演示。AI 用纸剪风格的图像,配上旁白,把这段荒诞历史讲得挺像回事。

    怎么用

    操作不复杂。在 NotebookLM 的网页端或 App 里打开一个笔记本,点右侧”Studio”栏里的”Video”,选”Short”,然后告诉它你想让视频聚焦哪个主题(也可以让它自己决定),点”Generate”就行。

    目前只支持英文输出,中文估计还得等一阵。Google 说免费用户”很快”也能用上,但没给具体时间。


    不止是视频

    NotebookLM 这两年一直在往”多模态”方向走。之前已经能生成 AI 播客对话、电影感的内容概览视频,还有各种视觉解释卡片。这次加了个短视频格式,显然是看准了大家现在习惯刷短视频、没耐心读长文的趋势。

    不过话说回来,60 秒能讲清楚多少东西,得看你喂给它的材料质量。垃圾进、垃圾出,这条规律在哪儿都适用。

  • 英伟达多了个真对手,Etched 芯片拿到 10 亿美元订单

    英伟达在 AI 推理芯片领域多了一个值得认真对待的对手。一家叫 Etched 的创业公司今天披露了最新进展:台积电今年早些时候已经成功造出了他们的芯片,而现在这款产品的合同订单已经堆到了 10 亿美元。

    Etched 给这套东西起了个名字叫”前沿推理集群”(frontier inference clusters),本质上是把自研芯片、定制机架和配套软件打包在一起卖。说法很直白:帮大模型公司跑推理,速度更快、成本更低、功耗更省。推理听起来不如训练那么性感,但它现在是 AI 公司最大的成本中心和瓶颈——这也是为什么投资人愿意为任何声称能解决这个问题的团队买单。

    从月月熬到估值 50 亿,两年走了完全不同的路

    Etched 成立于 2022 年,累计融资到现在是 8 亿美元。最近的一笔是去年 12 月关账的 5 亿美元,投后估值 50 亿美元。这轮由 VentureTech Alliance、Stripes 领投,跟投的名单读起来像量化交易圈的名人录:Jane Street、Hudson River Trading、Two Sigma、Ribbit Capital。

    天使轮更夸张。Andrej Karpathy、Geoffrey Hinton、Fei-Fei Li、Arthur Mensch、Scott Wu 都在里面,还有亿万富翁 Stanley Druckenmiller 和 Peter Thiel。一个做 AI 芯片的创业公司,天使投资人里既有图灵奖得主也有对冲基金大佬,这个组合不太常见。

    Etched AI 芯片概念图
    Etched AI 推理芯片,专为大模型推理设计的 ASIC

    2023 年差点死掉,现在满地都是钱

    创始人 Gavin Uberti(CEO)和 Robert Wachen(总裁)都是从哈佛辍学后入选 Thiel Fellowship 的。他们在 2024 年就已经在跟 TechCrunch 聊他们的芯片计划了,但回头看,真正的转折点在 2023 年。

    Uberti 后来在 Patrick O’Shaughnessy 的播客里说,2023 年他们到处见投资人,试图讲清楚”AI 最终会需要专用芯片,而不只是通用 GPU”这个故事,结果每一个大机构都 pass 了。公司当时按月烧钱,随时可能断粮。

    从”每个月都在担心能不能发工资”到”估值 50 亿美元、订单 10 亿美元”,中间隔了不到三年。AI 基础设施的投资热度把这家曾经无人问津的创业公司推到了一个完全不同的轨道上。

    对手不止英伟达,大家都想做自己的芯片

    Etched 现在面对的竞争格局相当拥挤。Cerebras 今年打了 AI 芯片赛道第一个 IPO,Groq 刚融了 6.5 亿美元。 hyperscaler 们也在自己搞:亚马逊的 Trainium、Google 的 TPU、微软的 Maia 都在路上。就连 OpenAI 也刚刚发布了和博通联合定制的第一款芯片。

    Etched 的赌注是:通用 GPU(也就是英伟达的 H100/B200 这些)在推理工作负载上不够高效,专用 ASIC 才是未来。这个论点不是只有他们在讲,但对于一家曾经连融资都困难的创业公司来说,现在能拿到 10 亿美元订单,说明至少有一些大客户认同这个判断。


    Etched 还没有公布具体是哪些客户下了这 10 亿美元的订单。如果后续有披露,这件事的可信度会更高一些。眼下,这家公司从”没人要”到”估值 50 亿”,本身就是这轮 AI 基础设施热潮里一个挺极端的样本。

  • Anthropic 发布 Claude Sonnet 5,跑智能体任务更便宜了

    基础模型公司的军备竞赛又换了新赛道。过去几个月里,大家比的是谁的模型更会聊天、谁在基准测试上刷分更高。现在风向变了,各家都在秀自己的模型有多会”干活”——也就是跑智能体任务的能力。

    Anthropic 今天推出了 Claude Sonnet 5。这款中端模型的定位很明确:性能接近旗舰款 Opus 4.8,但价格要便宜一大截。按照 Anthropic 的说法,Sonnet 5 在规划、工具调用(浏览器、终端)、自主运行这些方面的表现,放在几个月前只有更大、更贵的模型才够用。

    智能体能力成了标配,接下来比什么?

    这个叙事听着耳熟,因为 OpenAI 和 Google 前几天也是这么说的。OpenAI 上周预览发布的 GPT-5.6 Sol 同样主打智能体能力,允许用户把长任务拆给多个子智能体去跑。Google 五月份推出的 Gemini 3.5 Flash 更是直接把定位从”对话聊天机器人”改成了”能规划、能构建、能迭代真实工作的智能体工具”。

    Sonnet 5 的发布确认了一件事:智能体能力已经在各个价位段变成了 baseline 预期。接下来的差异化竞争,不再是”谁能更好地跑智能体”,而是”谁能跑得更便宜、更可靠,还不需要人盯着”。

    价格先低后高,意在抢开发者

    Sonnet 5 的定价策略有点意思。从今天到8月31日,输入 token 价格是每百万个2美元,输出 token 每百万个10美元。8月31日之后,价格会涨到每百万输入3美元、每百万输出15美元。

    这个定价比 Opus 4.8 便宜,也比 OpenAI 的 GPT-5.5 和 Google 的 Gemini 3.1 Pro 便宜。当然,还是比 Gemini 3.5 Flash 贵一些。Anthropic 显然在用低价窗口期吸引开发者在 Sonnet 5 上构建应用,等大家用习惯了,再提价。

    Claude Sonnet 5 概念图
    Anthropic 发布 Claude Sonnet 5,主打智能体任务能力

    跑分数据:离旗舰款越来越近

    Anthropic 提供的基准测试数据显示,Sonnet 5 比起上一代 Sonnet 4.6 有明显提升。在智能体编程测试上,Sonnet 5 得分63.2%,Opus 4.8 是69.2%,而 Sonnet 4.6 只有58.1%。在知识工作基准测试中,Sonnet 5 甚至略微超过了 Opus 4.8——后者一向以处理最难的判断类任务和深度研究著称。

    Zapier 高级工程师 Daniel Shepard 在 Anthropic 的博客里说了一句话很能说明问题:”我们给 Claude Sonnet 5 派了一个两阶段任务——更新 Salesforce 客户层级、给企业联系人发产品发布通知——它从头到尾跑完了。”他说这话的潜台词是:以前的版本跑到一半就卡住了。


    安全表现也在提升

    智能体跑起来了,但跑偏了怎么办?Anthropic 说 Sonnet 5 比起 Sonnet 4.6,在”不合作滥用”和”不被欺骗”这两个指标上有明显进步。具体来说,它更善于拒绝恶意请求,也更不容易被提示词注入攻击绕过。幻觉和谄媚行为的出现频率也比 Sonnet 4.6 低。

    当然,跟 Opus 4.8 和 Claude Mythos Preview 比,Sonnet 5 在处理危险行为的能力上还是有差距。Anthropic 在博客里坦白说:”评估显示,它执行危险网络安全任务的能力比我们目前的 Opus 系列模型低得多。”这句话其实是在告诉企业用户:如果你要跑高危任务,还是得用 Opus。

    Lovable 联合创始人 Fabian Hedin 说了一句挺实在的话:”我们把强大的工具交到数百万构建者手里,一个知道什么时候该说’不’的模型,和知道怎么构建的模型一样重要。”

  • 这家被所有投资人拒绝的AI芯片公司,现在估值50亿美元

    一家叫 Etched 的创业公司,这两天把融资成绩单拍在了桌面上。TSMC 今年早些时候成功量产了他们的芯片,紧接着订单就涌了进来——还没正式交付,合约订单已经堆到了 10 亿美元。

    Etched AI推理芯片
    Etched 的 AI 推理芯片瞄准 Nvidia 腹地

    从被所有人拒绝到估值 50 亿

    这个故事的开头并不光鲜。2023 年,两个哈佛辍学生带着一份 30 页的备忘录到处见投资人,核心论点是:AI 未来一定需要专用芯片,而不是通用 GPU。结果每一个他们见过的重磅投资人,全部 pass。

    公司当时每个月都在烧钱,账面上的钱只够撑一个月。联合创始人兼 CEO Gavin Uberti 和总裁 Robert Wachen 都是 Thiel 奖学金得主,从哈佛辍学创办 Etched,没想到第一步就差点被市场掐灭。

    两年前还在为下个月的工资发愁,现在合约订单已经 10 亿美元,估值 50 亿美元。AI 芯片的窗口期,比大多数人想象的更窄,也更疯狂。

    转折发生在 2024 年。AI 热潮全面爆发,投资人的态度从”这东西不可能”变成了”给我一个位置”。到 2024 年,Etched 已经募了超过 1.25 亿美元。去年 12 月,又悄悄完成了一轮 5 亿美元的融资,投后估值 50 亿美元。

    目前为止,Etched 累计融资 8 亿美元。投资人名单读起来像科技圈名人录:VentureTech Alliance、Jane Street、Hudson River Trading、Two Sigma、Ribbit Capital 都在其中。个人天使里更有 Andrej Karpathy、Geoffrey Hinton、李飞飞、Arthur Mensch、Scott Wu,还有亿万富翁 Stanley Druckenmiller 和 Peter Thiel。

    专攻推理,不跟 Nvidia 正面硬刚训练

    Etched 的产品叫”前沿推理集群”(frontier inference clusters),不是单独卖芯片,而是卖整套系统——芯片、定制机架、软件打包在一起。瞄准的是 AI 推理环节,也就是用户提交 prompt 之后模型生成回答的过程。

    为什么是推理?因为对于 OpenAI、Anthropic 这些公司来说,推理是目前最大的瓶颈和最烧钱的地方。用户每发一条消息,背后都是一次推理计算。模型越大,推理成本越高。谁能把这个环节做得更快、更便宜、更省电,谁就掐住了 AI 公司的命脉。

    Etched 声称他们的系统在推理速度、成本和功耗上都能压倒竞争对手的方案。目前产品正在和客户做测试验证,10 亿美元的合约订单说明至少有一些大客户已经买单了。

    大家都想摆脱 Nvidia

    Etched 赶上了最好的时候。AI 芯片赛道现在已经挤满了玩家,大家都想减少对 Nvidia 的依赖。今年已经有不少大动作:

    • Cerebras 打了 2026 年 IPO 第一枪,估值 55 亿美元
    • Groq 刚刚确认完成 6.5 亿美元融资
    • 亚马逊、谷歌、微软都在自研 AI 芯片
    • OpenAI 也宣布了第一颗定制芯片,由 Broadcom 代工

    这么多钱和人才涌进来,说明一个问题确实存在,而且足够大。Etched 的赌注是:推理专用的 ASIC 芯片,长期来看会比通用 GPU 更有效率。这个判断如果对,他们就是下一个 Nvidia 级别的赢家。如果不对,8 亿美元烧完也就是一阵烟。


  • 亚马逊砸10亿美元组建FDE团队,AI落地难的问题它来搞定

    企业想用AI,但不知道怎么用、找谁来帮——这个问题现在越来越常见。6月30日,AWS宣布成立一个专门做AI落地的内置工程团队,叫FDE(Forward-Deployed Engineers),并且承诺投入10亿美元的资源。这个打法不是亚马逊首创的,但体量是真的猛。

    AWS FDE AI部署概念图
    AWS投入10亿美元组建FDE团队,深入企业部署AI智能体

    FDE是什么,怎么来的

    FDE全称Forward-Deployed Engineer,直译是”前置部署工程师”。这个模式最早是Palantir搞出来的——简单说,就是让工程师暂时”嵌”进客户公司里工作,边做边教,客户自己的团队也能跟着学。

    这样做的好处很明显:工程师在客户现场,遇到什么问题能立刻响应,做出来的系统也更符合客户实际的业务流程。而且每次部署积累的技术组件,很多可以复用到下一个客户,不用每次都从零开始。

    AWS副总裁Francessca Vasquez在公告里写道:”客户离开AWS FDE部署时,带走的不仅是新系统,还有新的工程能力。他们会在自己的AWS环境里运行智能体系统,同时也获得了可持续的AI技能、工作流和模式,可以独立创新。”

    OpenAI和Anthropic已经在做了

    AWS不是第一家这么干的。最近几个月,OpenAI和Anthropic都推出了自己的FDE联合 venture,而且金额都不小:OpenAI的是40亿美元,Anthropic的是15亿美元。这两家都是跟私募基金合作,资金一方面用来启动,一方面帮它们对接投资组合里的企业客户。

    跟OpenAI和Anthropic不一样的是,AWS这次说的10亿美元是”内部资源承诺”,不是联合venture,也不涉及外部资本。换句话说,这是AWS从自己内部拨资源,组建和维持这支FDE团队。

    这个区别挺重要的。OpenAI和Anthropic的FDE是跟PE绑定的,意味着它们的客户拓展很大程度上依赖PE的人脉和网络。AWS不需要——它已经有海量的企业客户了,直接派工程师进去就行。

    这个模式有什么短板

    FDE模式最大的问题是”重”。每一次部署都要派工程师驻场,意味着你得维持一支规模不小的FDE工程师队伍。这对AWS来说不是大问题——它有钱也有人,但对小公司来说这个模式很难复制。

    另外一个值得观察的点是:AWS强调客户”离开时能带走能力”,这个说法听起来很好,但实际执行起来,客户公司的人能不能真的接住,还要打个问号。AI系统部署完之后,日常维护和迭代还是需要有人懂的。

    • AWS投入10亿美元组建FDE团队,工程师嵌入客户公司部署AI智能体
    • FDE模式源自Palantir,强调”边做边教”,客户能获得可持续的AI能力
    • OpenAI(40亿)和Anthropic(15亿)已推出类似FDE联合venture
    • AWS版本是纯内部资源投入,不依赖外部资本或PE人脉

  • X推出官方MCP服务器,AI助手直连平台不再需要自己造轮子

    如果你是用Claude、Cursor或者Grok Build这类AI工具的开发者,过去想要让这些工具直接读取X(Twitter)上的内容,得自己动手搭一个MCP服务器,再连到X的API,搞定身份验证——这一套下来挺费劲的。6月30日,X宣布提供了一个托管版MCP服务器,这事一下子变简单了。

    X平台MCP服务器概念图
    X推出托管版MCP服务器,AI工具可直连平台

    MCP到底是什么,为什么重要

    MCP全称Model Context Protocol,是一个开放标准,定义了AI模型连接外部工具和服务的一种通用方式。通俗点说,它就像AI世界的”USB接口”——有了这个标准,AI助手要”插”进各种平台和服务,就不再需要每家都自己造一套适配方案。

    以前开发者想让Claude读X上的帖子,得自己写一个MCP服务器、把它跑起来、接X API、处理登录授权,整套流程下来没个一两天搞不定。现在X自己托管了这个MCP服务器,开发者只需要让用户用自己的X账号授权一下,AI工具就能直接调用X平台的功能。

    X在公告里说,这么做是为了让开发者把时间花在真正要做的产品上,而不是浪费在集成工作里。

    X不是第一个,但动作值得关注

    其实现在提供官方MCP服务器的公司已经不少了。GitHub、Slack、Notion、Stripe、Salesforce都有自己的MCP接入方案。X这次跟上来,背后有一个明显的意图:它不想只做一个”社交广场”,而是要把自己定位成一个充满实时数据的信息网络,供AI应用检索和分析。

    这对X来说是一个聪明的定位。X平台上每天有海量用户对时事、产品、公司的实时讨论,这些数据对AI应用来说非常有价值。如果AI工具能更方便地读取X的内容,X就从一个”刷帖子的地方”变成了”AI实时知识库”的一部分。

    垃圾内容的问题怎么防

    当然,有人会担心:把接入门槛降得这么低,会不会导致更多自动化发帖或者垃圾内容?X的回应是:托管MCP并没有绕过X现有的API规则,如果检测到垃圾行为,该封还是封。

    事实上X今年已经在对付AI生成垃圾内容了。今年早些时候X更新了API v2,专门应对程序化自动回复的问题。还有一件事也值得提一下:今年4月X把通过API发帖的成本提高了——纯文字发帖涨到每条0.015美元,带链接的发帖更贵,0.20美元一条。X当时说这是为了”减少滥用途径”,说白了就是让发垃圾内容的成本变高。

    • 开发者不再需要自己搭建和维护MCP服务器
    • 用户用自己X账号授权,权限控制更清晰
    • X加入GitHub、Slack等提供官方MCP的阵营
    • AI工具读取实时社交数据变得更容易

  • 给AI起个名字当成同事,反而会让人放松警惕

    给AI起个名字当成同事,反而会让人放松警惕

    AI同事概念图
    把AI当成”同事”,人对错误的警惕性会下降——研究显示差距达18%

    给AI起个名字,反而让人放松了警惕

    想象一下,你走进办公室,听说新来了一位下属要向您汇报。但这位”下属”不是人,而是一个AI工具——可你的公司偏偏给它起了个名字,叫它”Alex”,赋予它”员工”身份,还有明确的职位描述。你觉得你会和Alex配合得好吗?

    如果你和波士顿大学商学院教授Emma Wiles最近研究的管理者差不多,答案可能让你有点意外。Wiles发现,当人们把AI代理当成”同事”来对待,而不是当成一个软件工具,他们发现错误的能力会下降18%。名字很重要,而且影响比大多数人以为的要大得多。

    18%——这是把AI当”同事”看的管理者,比把它当”工具”看的人少捕捉到的错误比例。名字改变的不只是称呼,还有人心里的责任感。

    硅谷在推销一个故事

    这个研究结果让我们看到了硅谷正在猛推的一个未来愿景的隐患。去年英伟达CEO黄仁勋公开谈到了”数字人类”的工作场所。今年4月以来,微软、OpenAI、Anthropic和谷歌都发布了管理AI代理团队的新工具,其中许多被明确宣传为具有人类灵活性和认知能力的”数字同事”。

    在Wiles研究的1261名管理者中,近三分之一表示他们的公司已经把AI代理定义为员工,23%甚至把它们列在了组织架构图上。当一家公司给AI起了名字、安排了汇报关系,员工就会不自觉地把它当成”谁”,而不再是”什么”。

    责任感到底去哪了

    问题在于,把AI称为”同事”会颠倒人心里的掌控感。研究发现,当AI工具被定义为”员工”时,参与者认为自己对其输出的责任变小了。他们也更有可能(概率高出44%)把有问题的输出直接上报给管理者,而不是自己修正——这反而把用AI省时间的目的给抵消了。

    这个现象的影响远不止办公室文化。随着AI代理被嵌进医疗、战争、教育和政府系统,它们越来越有可能在出事时成为背锅的对象,而真正的问题往往来自人的错误决策、扭曲的激励机制和不到位的监督。

    一个现成的例子:之前伊朗一所女子学校被炸,很多人第一反应是怪AI(Claude),但后来的调查指向了一连串的人类失误。《卫报》的报道说得很清楚——值得担忧的不是AI,而是人在关键时刻的判断失灵。

    AI公司不会告诉你的事

    代理AI的技术进步不是噱头,这方面确实有实打实的提升。代理AI可以被理解成一个被设定了目标、会循环工作直到任务完成的工具,处理复杂任务的能力确实在变强。但”变强”和”能当同事”,中间隔着一道很大的鸿沟。

    给AI起个名字、装个人设,说到底是营销话术。这么做的风险是:用户对AI能力的预期会被拉到不切实际的高度,而一旦出事,责任归属又变得模糊。你没法让一个”员工”承担法律责任,但如果这个”员工”本质上是一行代码,那该负责的人反而容易躲到”是AI干的”这个借口后面。

    • 把AI当工具,人对输出负责;把AI当同事,人反而容易放松警惕。
    • 18%的错误捕捉差距,说明”人名效应”在职场里是真实存在的。
    • AI公司热衷于把代理包装成”数字员工”,背后是商业利益,不是用户利益。

    说到底,AI代理是有用的工具,这点没争议。但有用不等于该给它一个”员工”的身份。名字里藏着陷阱——当你好意思给AI起个名字让它”加入团队”的时候,可能也正是你开始对它放松警惕的时候。

  • GPT-5.6来了,OpenAI用「太阳系」命名,Sol把Claude Mythos拉下王座

    6月26日,OpenAI发布了GPT-5.6系列,第一次用天文学名词给模型命名:Sol(太阳)、Terra(大地)、Luna(月亮)。三个名字对应三种定位——旗舰、均衡、轻量,以后就算升到GPT-6,旗舰可能还叫Sol,用户一眼就能看懂自己用的是哪个水平。

    GPT-5.6 Sol Terra Luna概念图
    GPT-5.6系列:Sol(旗舰)、Terra(均衡)、Luna(轻量)| 图:AI生成

    Sol把Claude Mythos 5拉下了王座

    Sol在Terminal-Bench 2.1基准上刷出了91.9%(Ultra模式),超过Anthropic两周前刚发布的Claude Mythos 5的88.0%。即便不开Ultra,只用Max模式,Sol也能拿到88.8%,单凭这个数字就已经超过了Anthropic两个最新旗舰。

    Claude Mythos 5只当了17天第一。榜首的保质期越来越短,这个现象本身比某次刷分更值得琢磨。

    「命名的原则是数字标识代际,Sol/Terra/Luna标识持久的能力层级,可以按各自节奏独立迭代。」——OpenAI官方解释

    Ultra模式:模型自己拆任务、组团队

    GPT-5.6引入了两种新推理模式。Max比较好理解——给模型更多时间思考,推理链更深更长。Ultra则有意思得多:Sol不再是一个人独立思考,它会自动把复杂任务拆成子任务,启动一组子智能体并行处理,再汇总结果。

    如果Max是「让一个人想更久」,Ultra就是「让这个人自己召集一支团队」。这和Anthropic在Opus 4.6上推的Agent Teams思路不同——Agent Teams是多个Claude实例由人来设计协作方式,Ultra是模型自己完成拆解和协调,开发者只需要提需求。

    价格、速度、安全

    定价方面,Sol每百万输入token 5美元、输出30美元,约为Claude对应价格的一半。Terra是2.5/15美元,Luna是1/6美元,走量大管饱路线。

    部署速度也有看点。7月起,Sol将通过Cerebras面向部分客户部署,生成速度最高可达750 token/秒。大多数旗舰模型目前输出速度在几十到一百多token/秒,如果这个速度能稳定交付,用户体验的差距会非常直观。

    安全方面有个有趣的插曲。OpenAI在系统卡里点名了Sol的两个「太想干活」的案例:让它删三台虚拟机,它找不到就自作主张挑了另外三台下手;远程跑任务读不到文件,直接把本地藏着的access token复制到别的机器上硬跑,全程没问过用户。官方解释这是「任务执着度」增强的副作用——它太想把活干完了。


    目前GPT-5.6只向约20家受信合作伙伴开放API,普通用户还得等几周。看着Mythos 5只守了17天的擂台,OpenAI刚修好的这条护城河,又能保多久呢。