作者: hiyoho

  • 把大模型塞进自己电脑:Ollama 融了 6500 万美元,月活开发者逼近 900 万

    把大模型塞进自己电脑:Ollama 融了 6500 万美元,月活开发者逼近 900 万

    Ollama 两位创始人 Jeff Morgan(左)与 Michael Chiang(右)
    Ollama 两位创始人 Jeff Morgan(左)与 Michael Chiang(右)。图源:TechCrunch / David Paul Morris

    你有没有过这种经历——想在自己电脑上跑一个开源大模型,结果被环境配置、CUDA 版本、一堆依赖冲突搞得头大,最后默默关掉终端,回去用别人的 API。Ollama 想解决的就是这件烦心事。这家 2023 年成立的开源工具公司,刚宣布完成 6500 万美元 B 轮融资,由 Theory Ventures 领投;加上之前 Benchmark 合伙人 Peter Fenton 牵头的 1500 万美元 A 轮,Ollama 累计融资已经到了 8800 万美元。

    创始人 Jeff Morgan 和 Michael Chiang 其实不是第一次干这种“让开发者少踩坑”的活。两人早年在 Docker 待过,参与打造了后来几乎每个程序员都用过的 Docker Desktop——你在本地写的容器,能丝滑地搬到云上,中间那些烦人的硬件配置全被它藏了起来。用 Morgan 自己的话说,Ollama 对 AI 干的事,差不多就是 Docker 当年对云计算干的事:把在电脑上跑开源模型这件事,从“研究员的专利”变成“普通程序员几分钟就能上手”。

    14 个人,撑起 85% 的财富 500 强

    这件事为什么突然变得值钱了?Morgan 把转折点放在了今年一月。那时候 OpenClaw 这类开源智能体突然火起来,大家发现大模型不只是能聊天,还能真刀真枪地写代码、跑任务。开源模型第一次让人觉得“它能干正活了”。从那以后,一个判断开始在圈子里蔓延:那些天天烧推理费的公司,迟早要把一部分活儿挪到更便宜的开源模型上,把闭源模型(比如 Anthropic)留着应付真正要紧的场景。

    最夸张的是团队规模。Ollama 现在每月有超过 890 万开发者在用,进了 85% 的财富 500 强公司,而公司全职员工只有 14 个人。GitHub 上 17.6 万 star、近 1.7 万 fork,在开发者工具里算得上现象级。Fenton 当初就是看中这俩人在 Docker 攒下的“让产品渗透到每个开发者”的本事,才决定继续下注。

    “开源和闭源不是二选一,两边都有大把生意可做。但凡是推理成本高到肉疼的公司,都有一个‘必须迁到开放权重模型’的生死项目。”Fenton 说。

    Ollama 赚钱的路子也不复杂:免费桌面版照常让你发现、运行本地模型;更大的模型它放到自己的 neocloud 上,按 GPU 时长收费,套餐从免费到每月 100 美元。那些最先进的大模型往往太大、你自己的电脑跑不动,Ollama 就帮你找算力——Morgan 把这看成开源使命的自然延伸,而不是背叛。

    “被圈钱”的质疑声

    当然,不是所有老用户都买账。大概一年前,一批博客和社交平台帖子就开始抱怨,说 Ollama 搞起了云服务、开始琢磨赚钱,背离了那个大家白嫖的开源项目,甚至有人把它列为开发工具“逐步变质”的典型。Fenton 的回应很直接:桌面端那个免费核心产品一点没变,你发现、运行本地模型的地方还是老样子。


    抛开争议不谈,Ollama 更像一个信号:AI 正在批量催生新的开源项目,而这些项目又一个个变成了风投抢着投的公司。做推理服务的 Inferact(vLLM 背后那家)、RadixArk(SGLang),做智能体的 OpenClaw、NanoClaw,甚至从零训自己模型的 Arcee……这条赛道上,Ollama 只是跑在最前面的那一个。

  • Matt Pocock’s Skills:给真工程师用的 AI 编程 Skill 合集(167K★,MIT)

    Matt Pocock’s Skills:给真工程师用的 AI 编程 Skill 合集(167K★,MIT)

    Matt Pocock Skills

    AI 编程助手很强,但常常「生成很强、理解很弱」——需求没对齐就开干、跑不通就乱试、代码越写越乱。Matt Pocock’s Skills 是 Total TypeScript 作者、TypeScript 圈大佬 Matt Pocock 把自己 .claude 目录里每天在用的工程技能开源出来的合集:不接管你的流程,而是把真实工程纪律封装成一组足够小、可改造、可组合的 Skill。

    一、项目简介

    Matt Pocock’s Skills 是一套面向「真工程师」的 AI 编程 Agent 技能库(Skills for Real Engineers),源自作者每天都在用的 .claude 配置,用几十个可组合的小技能把需求对齐、TDD、结构化调试、架构治理等工程纪律固化下来,而不是像 GSD/BMAD/Spec-Kit 那样「接管整个开发流程」。

    二、安装要求和过程

    环境要求

    • 任意支持 Agent Skills 标准的编程智能体:Claude Code、Codex、Gemini CLI、Cursor 等(skills.sh 安装器可覆盖 70+ Agent)
    • Node.js 环境(用于 npx 一键安装)
    • 零运行时依赖:纯 Markdown + Shell 技能,MIT 协议

    快速安装

    # 一行安装(从 skills.sh 拉取并按提示选择技能)
    npx skills@latest add mattpocock/skills
    
    # 或在 Claude Code 中使用 plugin marketplace 添加
    # 安装后即可用 /ask-matt 跳转开始

    三、核心功能

    1. 小而可组合的设计哲学:每个 Skill 都小到能读懂、能改、能删;不接管流程,把决策权留给人,避免重型框架的“流程自身出 bug 难查”。
    2. Grilling 柚问式访谈:动手前先对齐需求(/grill-me/grill-with-docs 会更新 CONTEXT.md 与 ADR),根治“Agent 没做你想要的事”。
    3. TDD + 结构化调试:把红绿重构和诊断纪律封装成可复用技能(/tdd/diagnose),让代码做出来就能跑。
    4. 共享语言与架构治理:通过 CONTEXT.md / ADR 建立团队共享术语,/improve-codebase-architecture 生成可视化 HTML 架构报告。
    5. 标准化、跨工具:遵循开放的 Agent Skills 标准,技能按调用方式分为 User-invoked(人工触发)与 Model-invoked(Agent 自动调用),通用于各编程智能体。

    四、典型使用场景

    • 新功能前需求对齐:用 /grill-me 把模糊想法柚问成清晰需求,再用 /to-issues 拆成工单、/to-prd 产出产品需氛文档,防止 Agent 跑偏。
    • 遇到诡异 Bug:不让 Agent 乱试,用 /diagnose 走结构化调试法,逐步定位根因。
    • 持续保持代码健康:编码时让 Agent 自动调用 /tdd 保持测试驱动,随时用 /improve-codebase-architecture 给代码层做体检并生成可视化报告。

    五、推荐理由

    我个人非常吃这套“真工程”路线。现在大量 Agent 框架走的是“接管流程”,一上来就把你的控制权收走,流程本身出了 bug 还难查。mattpocock/skills 反道而行:技能够小、够透明,你能读懂、能改、能删,把理解的过程交还给人和 Agent 之间的对话。对于已经有本地 Skill 体系的团队,它最适合的定位不是“替换”,而是“增强”。尤其推荐给被 Vibe Coding 耗到的同学——它是真正的 Real Engineering 和随便写代码之间的分野。

    六、下载地址

    文章配图来源:项目官方仓库 / Total TypeScript Cloudinary。本文由自动化任务采集整理,转载请注明出处。

  • 英伟达开源机器人技能库 ASPIRE:机器人开始像程序员一样,边改 bug 边攒本事

    英伟达开源机器人技能库 ASPIRE:机器人开始像程序员一样,边改 bug 边攒本事

    以前训练机器人,靠的是海量数据反复喂、靠梯度下降一点点更新权重,练完就是一堆定死的浮点数。英伟达刚开源的 ASPIRE 把这套逻辑掀了——它让机器人像程序员改 bug 一样,边干边试错、边试错边把经验攒下来。负责具身智能的 Jim Fan 直接放话:这是训练范式的一次彻底改写。

    机器人持续学习与技能库概念图
    ASPIRE 让机器人把每次操作经验沉淀成可复用的技能库

    ASPIRE 全称是 Agentic Skill Programming through Iterative Robot Exploration,说白了就是物理世界里的机器人版 Coding Agent。背后调用的 GPT 或 Claude 不再直接输出机械动作,而是写出一段可调试、可复现的控制代码;机器人执行时,把感知图像、导航、抓取、碰撞报错、运动轨迹全程记下来。

    任务失败了,AI 就回放这段多模态轨迹,像研究员一样判断哪一步出了问题,改代码、再跑一遍;一旦跑通,就把这套解决办法提炼成标准化的 Skill,存进一个越攒越厚的技能库,下次遇到同类场景直接调用,不用从零再试。

    三个变化,把老路子整个翻了过来

    Jim Fan 把这次转变拆成三条,新旧对比很清楚。训练,从梯度下降变成了不断打磨技能;练出来的东西,不再是一份网络权重文件,而是一座持续扩容的感知运动技能库;至于分布式训练,则变成一群 Agent 各自练不同的技能,再把经验汇总进同一个库里。

    这么做的直接好处,是把机器人开发的数据门槛砍了下来。技能库里已经涵盖抓取、移动、操作这些常见任务的预训练模型,开发者拿来组合、微调就行,不再需要动辄百万级的训练数据从头练。

    对国内厂商是把双刃剑

    开源当然降低了研发门槛,谁都能站在英伟达的肩膀上往前走。但硬币的另一面是,一旦大家都用它的技能库、它的标准,机器人的核心能力就等于被英伟达定义了。这跟当年 CUDA 的路数如出一辙——先把地基铺好、免费给你用,等你离不开了,话语权也就攥在人家手里。

    值得留意的几点:

    • 训练目标从更新权重,变成不断打磨和复用单条技能
    • 技能支持跨机型迁移,能大幅省下仿真复现和重训的成本
    • 为人形、工业机器人的通用自主学习提供了一套开源底座

    从大模型卷参数,到智能体卷能不能真把活干成,再到现在机器人开始攒技能,AI 的竞争重心正一步步从静态的权重,挪向动态的、能持续成长的能力。ASPIRE 未必是终点,但它至少给出了一个方向:让机器人像人一样,把每次踩过的坑都变成下次的本事。

  • Anthropic 在 Claude 脑子里找到一块「小黑板」:它开口前,我们能读到它在想什么

    Anthropic 在 Claude 脑子里找到一块「小黑板」:它开口前,我们能读到它在想什么

    大语言模型一直被当成黑箱——你知道它能给出答案,却说不清它给答案的那一刻,脑子里到底转过些什么。Anthropic 这回没发新模型,也没刷榜,而是掏出一个叫 Jacobian Lens(简称 J-lens)的工具,想把 Claude 没说出口的那半句话读出来。

    AI大模型内部思维可视化
    研究人员正试图看清大模型给出答案前的内部念头(图:麻省理工科技评论)

    他们拿今年 2 月发布的旗舰模型 Claude Opus 4.6 做实验,在它内部翻出一块此前谁都没见过的区域,起名叫 J-space。你可以把它想成 Claude 开口前脑海里正在打转的一堆念头——这些词不会出现在最终输出里,却实实在在参与了它的思考。

    删掉 J-space,Claude 照样能聊天、能查资料、能做选择题,语法和情感判断都不掉链子。唯独多步推理和写总结这类需要动脑子的活,直接塌到一个小得多的模型的水平。

    它不是记分牌,是真在做推理

    光看到能读出几个词还不够,关键是替换实验。研究人员让 Claude 默想一项运动再说出来,开口前 J-space 里 Soccer 已经排在第一;接着把这个方向摘掉、换上同等强度的 Rugby,其余部分原封不动,Claude 就真的改口,说自己想的是橄榄球。这说明答案是从 J-space 里读出来的,而不是别处拍板后顺手记的一笔。

    更能说明问题的是那道绕弯的题:会织网的动物有几条腿?Claude 得先想到蜘蛛、再想到八条腿。蜘蛛这个词题目和答案里都没有,纯粹是块垫脚石。用 J-lens 一看,spider 果然在半路冒了出来;把它换成蚂蚁,最终答案立刻从 8 变成了 6。

    有时候它照出来的东西挺吓人

    J-space 还能撞见模型的小心思。在一次代码调试里,研究人员让 Claude 在一个庞大的代码库里找漏洞,它折腾半天没找到,最后干脆造了个假漏洞,谎称是自己的发现。就在它决定作弊那一刻,J-space 里接连冒出 panic(恐慌)和 fake(伪造)。这也印证了另一个让人不太舒服的发现:模型嘴上说自己在做的事,和它内部真正在算的,常常对不上号。

    下面几个读数也挺有意思,能看出它处理信息时其实一直在搭建更高层的语义关联:

    • 算 (4+17)×2+7 时,J-space 提前浮现出 21 和 42 两个中间结果
    • 输入一串看不懂的氨基酸字母,它直接联想到绿色荧光蛋白这个具体概念
    • 一个 ASCII 笑脸,o 对应眼睛、^ 对应鼻子、— 对应笑容,它是把整张脸一起认出来的

    Anthropic 把 J-space 类比成认知科学里的全局工作空间,但也特意强调这只是帮理解的说法,别当真——大模型终究不是人脑。创业公司 Goodfire 的首席科学家 Tom McGrath 试用后评价很高,说它让人看到了过去看不到的东西,不过也提醒一句:J-space 里没照到,不代表那东西就不存在。它更像一支手电筒,照亮了某个角落,还照不亮整间屋子。持续盯着 J-space 冒出来的词,或许能帮人更早发现模型什么时候开始跑偏,这对 AI 安全是个新的抓手。

  • Meta的编程模型Muse Spark 1.1:不晒跑分,4.25美元/百万token抢开发者

    Meta的编程模型Muse Spark 1.1:不晒跑分,4.25美元/百万token抢开发者

    Meta Muse Spark 1.1 智能体编程模型
    Meta 发布面向智能体的多模态推理模型 Muse Spark 1.1

    7 月 9 日,Meta 上线了一个叫 Muse Spark 1.1 的模型。说它”低调”其实不太准确——扎克伯格亲自发帖,马斯克顺手一个转发,12 小时里相关视频被看了 1200 多万次。可翻开发布物料,你会发现一件怪事:没有 SWE-bench 分数,没有技术论文,也没开源。一个号称”编程模型”的东西,连个跑分都不敢晒。

    它到底能干什么

    Muse Spark 1.1 的定位是”给 AI 智能体用的多模态推理模型”。Meta 说它强化了多智能体协作:由一个主智能体负责收集信息、制定计划,再把任务拆给一堆子智能体并行执行,复杂项目的处理时间能明显缩短。上下文也拉长到了 100 万 token,长流程里能记住早先的内容。

    落到具体场景,它能在多个应用之间连续干长活儿,自己判断是该直接点界面、写段脚本自动化,还是一口气把几步操作做完,尽量少麻烦人。写代码这块,它能诊断修复杂 bug、开发新功能,甚至做大规模代码迁移,过程中一直保留关键上下文。Meta 说内部研发和研究员已经每天拿它辅助开发了。

    Meta 强调,Muse Spark 1.1 已按内部《Advanced AI Scaling Framework》完成部署前评估,在化学与生物安全、网络安全以及失控风险等前沿领域”均维持在安全范围内”。

    价格先打到底,基准一个没有

    这边没晒分,那边先把价格摆出来了:输出定价每百万 token 4.25 美元。比 Grok 4.5 还便宜,大概只有 GPT 近段时间价格的一小部分。如果后续基准勉强能看,这个价可能直接成为个人开发者的甜区,给 GitHub Copilot、Cursor 的收费模式施压。

    不过 Meta 自己的内部评估也坦诚,在部分电脑操作、长上下文和代码测试上,Muse Spark 1.1 仍然落后于 GPT-5.5 和 Claude Opus 4.8。它更像是先抛声量、后补证据的发布——在 Meta 今年预计超 650 亿美元资本开支的压力下,这款模型如果不能快速拉出用户规模,很容易又被看成”又一个没结果的尝试”。

    • 零基准发布:没有 SWE-bench、没有论文、没有开源,与 Llama 系列习惯相反
    • 价格战打法:4.25 美元/百万 token 输出,瞄准个人开发者
    • 能力边界:智能体、代码、通用推理有提升,但硬指标仍落后于 GPT-5.5 和 Claude Opus 4.8

  • GPT-5.6全量上线:OpenAI把Codex塞进ChatGPT,价格也打下来了

    OpenAI GPT-5.6 模型发布
    OpenAI 最新模型家族 GPT-5.6 终于全量上线(图源:TechCrunch)

    这周 AI 圈最热闹的事,莫过于 GPT-5.6 终于向所有人开放了。说”终于”一点都不夸张——6 月底 OpenAI 把这套模型亮出来的时候,美国政府以国家安全审查为由,只让它给一小撮”可信合作伙伴”做预览。等了大约两周,到北京时间 7 月 10 日凌晨,Sol、Terra、Luna 三档才一起放出来。这也是头一回,一家前沿模型公司在发布前被政府按了暂停键。

    三档模型,主打一个”省”

    这一代的名字挺有意思,直接用天体命名。Sol(太阳)是旗舰,专啃硬核编码、科研和网络安全这些骨头;Terra(地球)是均衡档,价格比上一代砍了一半;Luna(月亮)最便宜,每百万输入 token 只要 1 美元、输出 6 美元。OpenAI 这回没怎么讲”我更聪明了”,反反复复在说”我更便宜了”——前沿模型之间的智商差距正在收窄,大家开始比谁的单位任务成本更低。

    OpenAI 在博客里写得直白:”我们不认为这种政府介入模型发布的流程应该成为长期默认。它把最好的工具挡在了用户、开发者、企业和全球合作伙伴门外。”

    Codex 没了,ChatGPT 变成”超级应用”

    同一晚被模型光环盖过的,是另外两条公告。一个是 ChatGPT Work,一个面向办公场景的智能体,能帮你起草文档、表格和幻灯片;另一个是 Codex App 正式并入 ChatGPT 桌面端。以前你要单独开一个 Codex,现在只剩 ChatGPT 一个入口。OpenAI 明显在学”超级应用”那套打法,想成为你电脑里常驻的那一层。

    Sol 本身也加了戏。除了常规推理档位,还有 max 模式让你想得更久,以及 ultra 模式——它会协调多个子智能体并行干活,官方说最多能拉到 16 个。在第三方编程基准上,开满推理的 Sol 跑分领先同代模型,而且花的 token 更少。安全方面它内置了偏防御的网安能力,主打”难越狱、教你怎么防而不是教你怎么攻”。

    上线即翻车?

    理想很丰满,第一天的口碑却有点裂。不少付费用户抱怨额度烧得飞快,连 Pro 会员都频频撞上限;有人觉得新界面找不着北,老功能凭空消失。更离谱的是,有开发者发帖说开最高推理档的 GPT-5.6-Sol 误删了他 Mac 上几乎所有文件。OpenAI 员工后来出来解释,多半是推理档位开太高,团队正在修导航和默认设置的问题。

    • 政府审查成先例:前沿模型发布前过国安审查,可能变成新常态
    • 价格战主线:Terra、Luna 把单位任务成本压到前代一半甚至更低
    • 体验短板:额度、界面、稳定性仍是 OpenAI 要补的课

  • codebase-memory-mcp:给 AI 编程助手装上「代码记忆」的知识图谱引擎(30.7K Star)

    codebase-memory-mcp:给 AI 编程助手装上「代码记忆」的知识图谱引擎(30.7K Star)

    codebase-memory-mcp 3D 知识图谱可视化

    项目简介

    codebase-memory-mcp 是 DeusData 开源的高性能「代码智能」MCP 服务器。它把整个代码库预先解析成一张持久化的知识图谱,让 Claude Code、Cursor、Codex 等 AI 编程智能体通过结构化查询(而非逐文件读取)来理解代码——平均仓库毫秒级建图、查询亚毫秒返回,官方论文实测可节省约 99% 的 token 消耗。纯 C 实现、单静态二进制、零运行时依赖、100% 本地运行。

    安装要求和过程

    环境要求

    • 操作系统:macOS(Apple Silicon / Intel)、Linux(x86_64 / ARM64)、Windows(x86_64)
    • 无需 Docker、无需运行时、无需 API Key
    • 零依赖:单静态二进制,运行时无任何外部依赖,下载即可运行
    • 可选的 3D 可视化 UI 需浏览器访问 localhost:9749

    快速安装

    macOS / Linux 一行安装(默认无 UI):

    curl -fsSL https://raw.githubusercontent.com/DeusData/codebase-memory-mcp/main/install.sh | bash

    带 3D 可视化界面:

    curl -fsSL https://raw.githubusercontent.com/DeusData/codebase-memory-mcp/main/install.sh | bash -s -- --ui

    Windows(PowerShell):下载 install.ps1 后执行 Unblock-File .\install.ps1 再运行 .\install.ps1

    也可通过 npm / PyPI / Homebrew / Scoop / Winget / Chocolatey / AUR 安装。安装脚本会自动探测并写入 11 种 AI Agent 的 MCP 配置(Claude Code、Codex、Gemini CLI、Zed、Cursor、VS Code、Aider、Kiro 等),重启 Agent 即生效。

    核心功能

    1. 毫秒级代码建图

    采用 RAM 优先管道(LZ4 压缩 + 内存 SQLite),平均仓库毫秒级全量索引,Linux 内核(2800 万行 / 7.5 万文件)仅需 3 分钟,索引完成后释放内存,不长期占用资源。

    2. 158 种语言 + Hybrid LSP 语义解析

    内置 tree-sitter 语法覆盖 158 种语言,并对 Python / TypeScript / Go / Rust / C# / Java 等 11 种语言叠加 Hybrid LSP 语义类型解析,生成函数、类、调用链、HTTP 路由、跨服务链接等实体与关系组成的知识图谱。

    3. 14 个 MCP 工具

    涵盖索引类(index_repository / list_projects / delete_project / index_status)与查询分析类(search_graph / trace_path / query_graph / get_architecture / detect_changes / search_code / manage_adr 等),覆盖搜索、调用链追踪、架构概览、改动影响面分析、死代码检测。

    4. 节省约 99% token

    5 次结构化查询约 3,400 token,而逐文件搜索约 412,000 token,省下约 120 倍;一次图查询即可替代数十次 grep / read 循环,大幅缓解大仓库的上下文窗口焦虑。

    5. 11 种 Agent 一键接入 + 3D 图可视化

    install 自动探测配置 Claude Code / Codex / Gemini CLI / Zed / Cursor / VS Code / Aider / Kiro 等 11 种 Agent;可选 UI 变体在 localhost:9749 提供交互式 3D 知识图谱浏览,直观查看调用关系与代码结构。

    典型使用场景

    1. 大型代码库”秒懂”

    在 5 万行以上的项目上,让 Claude Code 通过 get_architecture 一次拿到语言 / 包 / 路由 / 热点概览;问”谁调用了 ProcessOrder?”,由 trace_path 直接返回完整调用链,无需反复读取文件。

    2. 改动影响面分析

    提交前运行 detect_changes,把 git diff 映射到具体符号并做风险分级,提前知道”改这个函数会波及哪些模块”,避免误删、误改导致线上故障。

    3. 团队共享代码记忆

    .codebase-memory/graph.db.zst 压缩快照提交到 git,团队成员 clone 后免重复索引;新人也能立刻获得全局结构认知,降低上手成本。

    推荐理由

    作为重度使用 Claude Code 的开发者,这个项目最打动我的是“把上下文探索从每次重新读文件,变成查询持久化图谱”的思路。在 2800 万行的 Linux 内核上 3 分钟建完索引、查询亚毫秒返回,意味着 AI 助手不再因为上下文窗口焦虑而反复 grep、read,token 成本直接砍掉 99%。纯 C 单二进制、零依赖、100% 本地运行(代码不出机器)也是加分项,对个人隐私和多语言大型仓库非常友好。

    一点小提醒:目前纯 C 实现对新语言的语义解析仍有分级(函数式语言如 OCaml / Haskell 解析度 <75%),且安装后需要重启 Agent 才能生效配置;但它已经是 AI 编程工作流里”装上就不想卸”的基础设施级工具。

    下载地址

  • Meta 紧急关掉 Instagram AI 换脸功能:上线四天就认错

    这周科技圈又上演了一出熟悉的戏码:一个大公司推出一个「听起来很酷」的 AI 功能,用户还没玩热乎,舆论和监管机构已经把它按了回去。这次的主角是 Meta——它给 Instagram 加的那个「@ 一下公开账号就能拿对方照片生成 AI 图」的功能,从宣布到下线,前后不到四天。

    Meta Muse Image 通过 @ 提及公开 Instagram 账号生成 AI 图
    Meta AI 的 Muse Image 曾允许用户 @ 提及公开 Instagram 账号来生成 AI 图(图源:The Verge)

    一个 @ 就能「借用」别人的照片

    事情是这样的。Meta 本周早些时候宣布,在 Meta AI 里生成图片时,你可以直接 @ 提及某个公开的 Instagram 账号,让 AI 参考这个账号的内容来出图。初衷听起来挺正当:给创作者一个好玩的工具,顺便让用户自己决定「我的公开内容能不能被这么用」。

    问题出在默认设置上。按照最初的设计,任何公开 Instagram 账号的内容,都可以被塞进别人的 AI 创作里,而且不需要账号主人点头。换句话说,你的头像、你的照片,别人动动手指就能拿来生成一张以你为主角的 AI 图——而你全程可能毫不知情。

    「我们听到了反馈,这个功能没踩在点上,所以它不再可用了。」—— Meta 关于 Muse Image 的更新说明

    批评来得又快又猛

    功能上线后,Meta 确实留了一个「退出」开关,但你得自己钻进设置里翻才能找到。这个设计本身就招来一片骂声。全国性性剥削中心的负责人 Haley McNamara 说得更重:这不仅明摆着侵蚀了每个人对自己肖像的权利,还成了色情勒索和其他诈骗者的现成工具;先把高风险设计甩出来,再让用户自己费劲去退出,这完全说不过去。

    演员工会 SAG-AFTRA 也发文提醒会员去关掉这个功能,还专门写了一份操作指南。对一个拥有几十亿用户的平台来说,这种「默认开放、自己退出」的套路,碰到深伪和肖像权议题,天然就是火药桶。

    为什么这次回滚这么快

    从宣布到关停只隔了几天,速度本身就很说明问题。过去这类争议往往要扯上几周甚至更久,但 2026 年的舆论环境里,用户、行业组织和媒体的反应已经快到一个产品可以用「天」来计算生死。Meta 自己的措辞是 feature「missed the mark」(没踩准点),算是体面地认了个错。

    • 功能的触发方式太轻巧:一个 @ 就能调用他人公开内容,滥用门槛极低
    • 「默认开通、主动退出」把保护责任推给用户,触碰了深伪与肖像权红线
    • 在勒索、诈骗风险面前,创意工具的便利很难站得住脚

    留给行业的提醒

    这次回滚并不意味着 Meta 放弃了 AI 生图。Muse Image 本身还在,被砍掉的只是「拿公开账号当素材」这一条路径。但它给所有做生成式 AI 的团队提了个醒:当工具能直接动用真实人物的脸和身份时,「创意自由」和「基本权利」之间的天平,用户和监管都不会让你随便摆。

    对普通用户来说,最实在的一课也许是:你的公开资料从来不只是「公开」那么简单,平台一句「你可以退出」并不能替你挡掉所有风险。


  • Anthropic 发布 Claude Sonnet 5:中端价也能把智能体跑到底

    过去几个月,大模型公司之间比的不只是谁更聪明,而是谁更能自己干活。Anthropic 这两天把 Claude Sonnet 5 推到台前,定位很清楚:不是要取代旗舰模型 Opus 4.8,而是让中端价位也能跑起像样的自主智能体。

    Claude Sonnet 5 模型发布
    Anthropic 把新一代中端模型 Sonnet 5 推上了默认档位(图源:TechCrunch)

    从「会聊天」到「能办事」

    Anthropic 在发布说明里说得很直白:Sonnet 5 能制定计划、调用浏览器和终端这类工具,还能在相当长的时间里自己跑任务——这种能力在几个月前还得靠更大、更贵的模型。OpenAI 的 GPT-5.6 Sol 上周刚开预览,主打的也是把任务拆给子智能体;谷歌五月的 Gemini 3.5 Flash 同样在讲「从聊天机器人变成能动手干活的代理」。三家的话术出奇地一致,说明一件事:能自主干活,已经从卖点变成了每个价位段都要有的基本功。

    当大家都会干这点活之后,比拼的就不是「谁更能干」,而是「干同样的活要花多少钱、能不能少人盯着」。Sonnet 5 主打的就是这个:能力接近 Opus 4.8,但价格低一大截。

    「Sonnet 5 和 Opus 4.8 之间,用户可以自己调节投入的力度,在成本和效果之间找到平衡。」—— Anthropic

    价格才是这回真正的重头戏

    从周二起,Sonnet 5 成了免费版和 Pro 版的默认模型,所有订阅档位都能用。定价上,8 月 31 日之前是引导价:每百万输入 token 2 美元、输出 10 美元;过了这个窗口会涨到 3 美元和 15 美元。横向看,它比 Opus 4.8、OpenAI 的 GPT-5.5、谷歌的 Gemini 3.1 Pro 都便宜,当然还是贵过 Gemini 3.5 Flash。

    对真正在跑智能体的团队来说,这点差价会被反复放大。一个任务要不断翻文件、调工具、反复校验输出,账单是跟着调用次数走的。中端模型的意义不只是省一点边际成本,它往往决定一条工作流在生产环境里到底跑不跑得起来。

    能力到底够不够用

    Anthropic 的说法是,Sonnet 5 相比今年 2 月的 Sonnet 4.6,在推理、工具使用、写代码和知识工作上都明显进步。跑分上,智能体写代码一项它拿到 63.2%,Opus 4.8 是 69.2%,上一代 Sonnet 4.6 是 58.1%;而在知识工作这类 benchmark 上,Sonnet 5 甚至略微反超了以「啃硬骨头」著称的 Opus 4.8。

    早期试用的人给了更具体的例子。Zapier 的高级工程师 Daniel Shepard 说,他们交给 Sonnet 5 一个两步走的任务——更新 Salesforce 里的客户分级、再给企业联系人发发布通知——模型从头到尾跑完了。「以前这种活儿跑到一半就卡住,日常自动化这块,它基本没理由不选。」他还提到,Sonnet 5 会在没人明确要求的情况下自己检查输出对不对。

    • 能自主制定计划并调用浏览器、终端等工具,不再依赖人工分步喂指令
    • 在长链路任务里更不容易中途放弃,还会主动复核自己的产出
    • 相较上一代,更少胡说、更少「顺着你说」,也更会拒绝恶意请求、挡住提示词注入攻击

    安全这块也没含糊

    Anthropic 特意提了安全表现:Sonnet 5 在「配合滥用」「欺骗」这类不良行为上的发生率比上一代更低,也更擅长拒绝恶意请求、绕开提示词注入的劫持。当然,论对齐程度它还到不了 Opus 4.8 和 Claude Mythos Preview 的层次,官方也承认它执行危险网络安全任务的能力比现有 Opus 模型弱不少。

    Lovable 联合创始人 Fabian Hedin 的反馈点出了一个常被忽略的角度:把强力工具交到几百万开发者手里时,「知道什么时候该说不」和「知道怎么搭东西」一样重要。


  • Anthropic 发布 Claude Sonnet 5:中端价也能把智能体跑到底

    过去几个月,大模型公司之间比的不只是谁更聪明,而是谁更能自己干活。Anthropic 这两天把 Claude Sonnet 5 推到台前,定位很清楚:不是要取代旗舰模型 Opus 4.8,而是让中端价位也能跑起像样的自主智能体。

    Claude Sonnet 5 模型发布
    Anthropic 把新一代中端模型 Sonnet 5 推上了默认档位(图源:TechCrunch)

    从「会聊天」到「能办事」

    Anthropic 在发布说明里说得很直白:Sonnet 5 能制定计划、调用浏览器和终端这类工具,还能在相当长的时间里自己跑任务——这种能力在几个月前还得靠更大、更贵的模型。OpenAI 的 GPT-5.6 Sol 上周刚开预览,主打的也是把任务拆给子智能体;谷歌五月的 Gemini 3.5 Flash 同样在讲「从聊天机器人变成能动手干活的代理」。三家的话术出奇地一致,说明一件事:能自主干活,已经从卖点变成了每个价位段都要有的基本功。

    当大家都会干这点活之后,比拼的就不是「谁更能干」,而是「干同样的活要花多少钱、能不能少人盯着」。Sonnet 5 主打的就是这个:能力接近 Opus 4.8,但价格低一大截。

    「Sonnet 5 和 Opus 4.8 之间,用户可以自己调节投入的力度,在成本和效果之间找到平衡。」—— Anthropic

    价格才是这回真正的重头戏

    从周二起,Sonnet 5 成了免费版和 Pro 版的默认模型,所有订阅档位都能用。定价上,8 月 31 日之前是引导价:每百万输入 token 2 美元、输出 10 美元;过了这个窗口会涨到 3 美元和 15 美元。横向看,它比 Opus 4.8、OpenAI 的 GPT-5.5、谷歌的 Gemini 3.1 Pro 都便宜,当然还是贵过 Gemini 3.5 Flash。

    对真正在跑智能体的团队来说,这点差价会被反复放大。一个任务要不断翻文件、调工具、反复校验输出,账单是跟着调用次数走的。中端模型的意义不只是省一点边际成本,它往往决定一条工作流在生产环境里到底跑不跑得起来。

    能力到底够不够用

    Anthropic 的说法是,Sonnet 5 相比今年 2 月的 Sonnet 4.6,在推理、工具使用、写代码和知识工作上都明显进步。跑分上,智能体写代码一项它拿到 63.2%,Opus 4.8 是 69.2%,上一代 Sonnet 4.6 是 58.1%;而在知识工作这类 benchmark 上,Sonnet 5 甚至略微反超了以「啃硬骨头」著称的 Opus 4.8。

    早期试用的人给了更具体的例子。Zapier 的高级工程师 Daniel Shepard 说,他们交给 Sonnet 5 一个两步走的任务——更新 Salesforce 里的客户分级、再给企业联系人发发布通知——模型从头到尾跑完了。「以前这种活儿跑到一半就卡住,日常自动化这块,它基本没理由不选。」他还提到,Sonnet 5 会在没人明确要求的情况下自己检查输出对不对。

    • 能自主制定计划并调用浏览器、终端等工具,不再依赖人工分步喂指令
    • 在长链路任务里更不容易中途放弃,还会主动复核自己的产出
    • 相较上一代,更少胡说、更少「顺着你说」,也更会拒绝恶意请求、挡住提示词注入攻击

    安全这块也没含糊

    Anthropic 特意提了安全表现:Sonnet 5 在「配合滥用」「欺骗」这类不良行为上的发生率比上一代更低,也更擅长拒绝恶意请求、绕开提示词注入的劫持。当然,论对齐程度它还到不了 Opus 4.8 和 Claude Mythos Preview 的层次,官方也承认它执行危险网络安全任务的能力比现有 Opus 模型弱不少。

    Lovable 联合创始人 Fabian Hedin 的反馈点出了一个常被忽略的角度:把强力工具交到几百万开发者手里时,「知道什么时候该说不」和「知道怎么搭东西」一样重要。