标签: 大模型

  • Page Agent:阿里巴巴开源的“住在网页里的”GUI 智能体,一行脚本让网页自己动起来

    Page Agent:阿里巴巴开源的“住在网页里的”GUI 智能体,一行脚本让网页自己动起来

    Page Agent 项目横幅

    项目简介

    Page Agent 是阿里巴巴开源的一个运行在网页内部的 JavaScript GUI 智能体。只需一行脚本,就能让任意网页拥有自己的 AI 代理,用自然语言直接控制 Web 界面——点击按钮、填写表单、跳转页面,全部交给 AI 完成。项目当前已收获约 2.6 万 Star,采用 MIT 协议,主要使用 TypeScript 编写,运行时以纯前端 JavaScript 注入。

    “The GUI Agent Living in Your Webpage. One script gives any web page its own AI agent.”

    安装要求和过程

    环境要求

    • 任意支持 <script> 标签或 npm 的网页环境即可;
    • 无需浏览器扩展、Python 或无头浏览器,纯前端运行;
    • 如需自托管大模型,需一个可访问的模型 API(如通义千问 Qwen、本地模型等);
    • 使用 npm 安装 / 二次构建时需要 Node.js 环境。

    快速安装(三种方式)

    方式一:CDN 一行接入

    <script
        src="https://cdn.jsdelivr.net/npm/page-agent@1.12.1/dist/iife/page-agent.demo.js"
        crossorigin="anonymous"
    ></script>

    国内镜像:https://registry.npmmirror.com/page-agent/1.12.1/files/dist/iife/page-agent.demo.js

    方式二:NPM 安装

    npm install page-agent
    import { PageAgent } from 'page-agent'
    
    const agent = new PageAgent({
        model: 'qwen3.5-plus',
        baseURL: 'https://dashscope.aliyuncs.com/compatible-mode/v1',
        apiKey: 'YOUR_API_KEY',
        language: 'en-US',
    })
    
    await agent.execute('Click the login button')

    方式三:Chrome 扩展 —— 从 Chrome 网上应用店安装 Page Agent 扩展,用于跨多标签页的多页面任务。

    核心功能

    • 🎯 极简集成:纯页面内 JavaScript,不需要浏览器扩展、Python 或无头浏览器,几行代码即可嵌入。
    • 📖 基于文本的 DOM 操作:无需截图、不依赖多模态大模型或特殊权限,通过结构化 DOM 文本理解页面并执行操作。
    • 🧠 自带 LLM(BYO):支持绝大多数主流模型(含本地部署),模型选择完全自由。
    • 🐙 可选 Chrome 扩展:支持跨标签页的多页面任务编排。
    • 🔌 MCP Server(Beta):允许外部 Agent 客户端(如 Claude Code / Cursor)从外部控制你的浏览器。

    典型使用场景

    • SaaS AI Copilot:几行代码为自家产品嵌入 AI 助手,无需重写后端,立刻获得“对话式操作界面”能力。
    • 智能表单填充:把原本需要 20 步点击的流程压缩成一句话,特别适合 ERP / CRM / 后台管理系统等高频重复操作。
    • 无障碍访问:通过自然语言让任何 Web 应用变得可操作,配合语音 / 读屏为行动不便的用户打开大门。
    • 多页面自动化 / MCP 控制:借助 Chrome 扩展或 MCP Server,让 AI 跨页面完成复杂工作流(如比价、数据搬运)。

    推荐理由

    我第一次看到 Page Agent 时最直接的感受是:它把“浏览器自动化”这件事做得太轻了。传统方案(如 Playwright / Puppeteer 脚本、或无头浏览器方案)要么要写一堆选择器、要么要吃截图走多模态,门槛和成本都不低。Page Agent 反其道而行——它就活在页面里,用文本化的 DOM 理解来“读懂”界面,再用自然语言驱动操作,心智负担几乎为零。

    对前端 / 产品同学尤其友好:你想给后台加个“AI 帮我导这份报表”的入口,挂一段脚本就行,不用动架构。再加上它支持 BYO 模型、可接本地大模型,数据不出内网也能玩。如果你正琢磨怎么给产品接一个“会自己点页面”的 AI,Page Agent 是目前最省心、最贴近生产的选择之一。

    下载地址

  • Superpowers:让 AI 编程智能体「先想清楚再做」的开源方法论

    Superpowers:让 AI 编程智能体「先想清楚再做」的开源方法论

    Superpowers 是一套面向 AI 编程智能体(Claude Code、Cursor、Codex、Copilot CLI 等)的开源「方法论 + 技能框架」。它不写业务代码,而是把资深工程师的开发纪律——先脑暴、出设计、写计划,再以测试驱动与代码评审推进——固化成一组「强制触发」的技能(skills),让 Agent 不跳过任何关键步骤。一句话:它给 AI 编程助手外挂了一套工程纪律

    安装要求和过程

    环境要求

    • 任意支持「插件市场」的 AI 编程客户端:Claude Code、Cursor、Codex App/CLI、GitHub Copilot CLI、Kimi Code、OpenCode 等;
    • 无需额外运行时依赖——技能本身是纯 Markdown,零代码、零安装负担;
    • 最新版本 v6.1.1(2026-07-03),MIT 协议,可商用。

    快速安装

    以最常用的 Claude Code 为例,一条命令装好:

    plugin install superpowers@claude-plugins-official

    其他宿主的安装入口:

    • Cursor:在 Agent 聊天里执行 /add-plugin superpowers
    • Codex CLI/plugins 搜索 superpowers 安装;
    • Copilot CLI:注册市场后 copilot plugin install superpowers@superpowers-marketplace
    • OpenCode:读取并执行 https://raw.githubusercontent.com/obra/superpowers/refs/heads/main/.opencode/INSTALL.md

    装好后,正常对话提需求即可——智能体会自动激活内置技能链,无需你手动调用。

    核心功能

    • 自动触发的技能库:20+ 技能覆盖测试(TDD 红-绿-重构)、调试(系统化排查、完成前验证)、协作(脑暴、写计划、派发并行 Agent、请求/接收代码评审)等,全部「强制工作流」而非可选建议。
    • 「先想后做」工作流:脑暴出规格 → Git worktree 隔离 → 设计文档 → 细粒度实施计划 → 子智能体并行开发 → TDD → 代码评审 → 收尾分支,每一步都有验证门禁。
    • 跨宿主通用:一套技能同时兼容 Claude Code、Cursor、Codex、Copilot CLI、Kimi Code、OpenCode 等,换工具不丢方法论。
    • 子智能体驱动开发(Subagent-driven Development):把任务拆给并行子 Agent,主 Agent 只做编排与评审,效率和质量双升。
    • 可扩展元技能writing-skills 让你把自己的工作流封装成新技能,using-superpowers 教 Agent 怎么用这套框架——团队规范可沉淀复用。

    典型使用场景

    • 从一句话需求到可运行功能:让 Agent 先脑暴出规格文档、确认后再生成计划,最后自主开发并自测,避免「上来就写代码」导致的返工灾难。
    • 大型功能并行开发:用 worktree 隔离 + 派发多个子 Agent 同时推进不同模块,主 Agent 汇总与评审,单人也能扛起一个小组的吞吐。
    • 团队统一研发规范:把团队最佳实践写成技能,所有人(和人)用同一套流程,新人也能稳定产出老手质量的代码。

    推荐理由

    用过一堆「vibe coding」工具后,我的结论很朴素:最大的问题不是模型不够聪明,而是 Agent 没有纪律——直接上手写、不写测试、不评审。Superpowers 把「工程纪律」外挂给 Agent,强制它先脑暴、再计划、再 TDD,质量肉眼可见地提升。它不替你做判断,只是不让 Agent 跳过关键步骤。25 万+ star、今天还挂在 GitHub 热榜第一,MIT 协议,值得每个用 AI 写代码的人装一下。

    下载地址

  • Grok 4.5发布:马斯克不拼参数了,改拼性价比

    淡出主流模型竞技场两个月之后,马斯克的 Grok 又坐回了牌桌。北京时间 7 月 9 日,SpaceXAI 正式发布旗舰模型 Grok 4.5。和过去每家都在喊”我们最强”的画风不同,这次马斯克显得很务实:他在 X 上连发几十条动态,反复强调一句话——能力和 Claude 的 Opus 4.7 差不多,但快得多,也便宜得多。

    Grok 4.5 概念配图
    Grok 4.5 概念配图(本文配图由 AI 生成)

    一张”够用就好”的牌

    Grok 4.5 是个 1.5T 参数的 MoE 模型,上下文拉到 50 万 token,主打编程、智能体和知识工作,还能看图输入。在考察编程的 SWE Bench Pro 上它拿到 64.7%,刚好压过 Opus 4.7 的 64.3%;Terminal Bench 2.1 冲到 83.3%,DeepSWE 1.0 的 62% 也超过了 Opus 4.8。推理速度能跑到 80 TPS,已经挤进第一梯队。

    有网友引用测试说,Grok 4.5 只花了大约十七分之一的成本,就做到了接近 Claude Fable 的性能。马斯克没有顺杆爬,反而老老实实承认差距:”公平地说,Fable 确实比 Grok 4.5 好得多,但大多数任务并不需要 Fable 级别的能力。”

    真正让对手冒汗的是价格

    但 SpaceXAI 真正想卖的不是分数,而是账本。它的 API 定价是每百万输入 token 2 美元、输出 6 美元。作为对照,Opus 4.7 的输入要 5 美元、输出 25 美元。完成同一个 SWE 任务,Grok 4.5 吐出的 token 量大约只有 Opus 4.8 Max 的四分之一。

    把模型调用价格推向台前,是这一轮竞争里最现实的变化。当企业把 Agent 跑在生产环境、每天调用成千上万次,token 账单就变成了真金白银。谁能在不掉链子的前提下把单位成本压下来,谁就握住了开发者的切换按钮。

    • 和 Cursor 联合训练,面向真实编码场景打磨
    • 下周推送百万 token 上下文版本,月底还有 2T 参数版本预告
    • 已在 SpaceXAI 控制台、Grok Build 和 Cursor 三端上线

    说到底,马斯克这次没再玩”参数军备竞赛”那一套。他赌的是另一件事:在绝大多数真实工作里,用户要的不是天花板级别的智能,而是一份”能力够用、速度快、账单轻”的交付。特斯拉和 SpaceX 的硬核工程师觉得 Grok 4.5 真好用,这比任何榜单都更能说明问题。

  • Claude Cookbooks:Anthropic 官方出品的 Claude 使用范例集,47.8K stars 让 AI 开发少走弯路

    Claude Cookbooks:Anthropic 官方出品的 Claude 使用范例集,47.8K stars 让 AI 开发少走弯路

    Claude Cookbooks

    Claude Cookbooks 是 Anthropic 官方维护的一组 Claude 使用范例/配方集(Jupyter Notebooks),用可直接复制、可运行的代码片段教会开发者如何用好 Claude API。它覆盖了文本分类、RAG、摘要、工具调用、多模态视觉、子代理、自动评估、JSON 模式、提示缓存等核心场景。截至 2026 年 7 月,仓库已收获 47.8K+ Stars、5.6K+ Forks,是学习和参考 Claude 官方最佳实践的必读项目。

    一、项目简介

    Claude Cookbooks 的定位非常清晰:它不是框架,也不是 SDK,而是一本「官方菜谱」。每个 Notebook 都围绕一个真实开发问题展开,例如「怎么用 Claude 做 RAG」「怎么让 Claude 调用外部工具」「怎么处理 PDF 与图片」「怎么自动评估生成结果」。你可以直接复制代码到自己的项目里,也可以把它当成学习 Claude API 的教程。

    二、安装要求和过程

    环境要求:

    • Python 3.10+(示例代码以 Python 为主);
    • 一个 Claude API Key(可在 Anthropic 官网 免费注册);
    • 仓库使用 uv 管理依赖,建议安装 uv(pip install uvcurl -LsSf https://astral.sh/uv/install.sh | sh);
    • 运行 Jupyter Notebook 需要浏览器或 VS Code Jupyter 插件。

    快速安装:

    # 1. 克隆仓库
    git clone https://github.com/anthropics/claude-cookbooks.git
    cd claude-cookbooks
    
    # 2. 用 uv 安装依赖
    uv sync
    
    # 3. 设置环境变量
    export ANTHROPIC_API_KEY="sk-ant-api03-..."
    
    # 4. 启动 Jupyter 浏览示例
    jupyter notebook

    如果你不想安装 uv,也可以直接用 pip:pip install anthropic jupyter,然后逐本运行 Notebook。

    三、核心功能

    • 覆盖 Claude 全能力的实战 Notebook:从基础的文本分类、摘要、RAG,到高级的工具调用(Tool Use)、JSON 模式、子代理(Sub-agents)、自动评估(Evals)和提示缓存,几乎囊括了 Claude 的所有核心能力。
    • 官方出品、持续更新:Anthropic 工程团队直接维护,Notebook 会跟随 Claude 3.5 / 3.7 / 4 系列模型和新 API 特性同步更新,避免你学到过时的写法。
    • 可复制、可扩展的代码片段:每个配方都提供最小可运行示例,代码结构清晰,方便你替换成自己的数据、提示词或业务逻辑。
    • 多模态与文档理解:包含视觉理解、图表解析、PDF 内容提取、表单识别等示例,适合需要处理非结构化数据的项目。
    • 评估与可观测性:提供自动评估 Cookbook 和 Agent 搜索基准复现(DeepSearchQA / BrowseComp),帮助你建立「改提示 → 跑评估 → 看指标」的迭代闭环。

    四、典型使用场景

    1. 快速上手 Claude API:如果你是第一次用 Claude API,直接打开 getting_started 或基础能力 Notebook,五分钟就能把第一条请求跑起来。
    2. 构建 RAG 与文档问答应用:参考 RAG 配方,把自有文档切分、嵌入、检索后交给 Claude 生成答案;也可以看多模态示例,直接让 Claude 读取 PDF 或图片并回答。
    3. 开发工具型 Agent:学习如何让 Claude 调用计算器、数据库、搜索引擎等外部工具,并进一步组合成多 Agent 协作系统(Coordinator + Sub-agents)。

    五、推荐理由

    Claude Cookbooks 给我的最大价值是「少走弯路」。网上关于 Claude 的教程很多,但官方示例在 Prompt 写法、参数选择、错误处理和成本控制上往往最贴近生产实践。特别是工具调用、JSON 模式和提示缓存这几个容易踩坑的场景,官方代码把最佳实践写得非常清楚。而且它完全开源(MIT),Notebook 形式读起来没有框架源码那么重,适合一边看一边改。

    六、下载地址

  • MiniMax一轮融了160亿港元,创始人说AGI之前不领工资

    国产大模型公司 MiniMax 在 7 月 10 日甩出一颗「资本炸弹」:完成一轮总规模约 160 亿港元(约合人民币 138 亿元)的融资。放在港股,这是个相当吓人的数字——而且它距离今年 1 月登陆港交所,才过去半年。

    钱从哪来,又去哪了

    这轮融资拆成两部分:配售 3560 万股新 A 类股份,每股 268 港元,募资约 95.4 亿;再发一笔 65 亿港元、2027 年到期的零息可转债券。两笔加一起,净募资差不多 159.6 亿港元。认购相当火爆,机构申购倍数达到 7 倍,主权基金、长线机构、中资机构和多策略基金都挤了进来。

    「从我写下这封信起,到公司实现 AGI 的那一天,我将不再从公司领取任何薪酬。」——MiniMax 创始人闫俊杰内部信

    创始人把身家也押上了

    更抓眼球的是闫俊杰那封内部信。他宣布 AGI 实现前零薪酬,还拿出个人名下相当于总股本 5% 的股份——4% 给核心团队做激励,1% 设成开源社区专项基金。对一个刚上市半年的创始人来说,这更像是给市场和团队的一颗定心丸。

    • 募资净额里约 80%(127 亿港元)砸向 AI 基础设施和模型研发
    • 约 10% 用于 AI 原生产品 Harness 的全球化商业落地
    • 到 6 月底,IPO 时那笔钱里用于基建和研发的已经花掉 77%

    大模型这场仗,烧钱速度比谁都快。MiniMax 手里现金更厚了,但对手也没闲着——同一赛道里智谱的市值已经冲到七千多亿港元。160 亿能让 MiniMax 多跑一阵,但真正决定胜负的,还是模型本身好不好用。

    MiniMax完成160亿港元融资
    MiniMax 完成 160 亿港元融资,创始人宣布 AGI 前不领薪
  • OpenAI安全负责人走了:GPT-5.6上线这周,护栏谁来看守

    这两天 OpenAI 内部发生了一桩挺值得玩味的事。安全系统负责人 Johannes Heidecke 本周告诉同事,他要离开公司了。时间点很微妙——就在这周,OpenAI 刚把迄今最强的 GPT-5.6 推上线。

    不是突然的人事变动,是一轮重组的收尾

    Heidecke 的离开,跟公司正在做的一件事绑在一起:把安全团队和研究团队进一步捏合。首席研究官 Mark Chen 在一份内部备忘录里说,以后安全团队要直接向研究副总裁、对齐负责人 Mia Glaese 汇报,Glaese 的权限也扩成了「研究与安全副总裁」,一个人管两块。之前带过安全团队的 Saachi Jain 暂时顶上,做临时安全系统负责人。

    「我们训练模型的节奏快太多了,发布周期也大幅缩短,今天围绕安全的协调难度,比过去任何时候都大。」——Mark Chen 内部备忘录

    为什么这个节点让人多想

    Heidecke 2021 年以 AI 安全分析师身份加入 OpenAI,2024 年接替离职去创办 Thinking Machines Lab 的 Lilian Weng,坐上安全系统负责人的位置。也就是说,短短两年里,这个岗位已经换了两茬人。

    更巧的是,GPT-5.6 这周上线时,OpenAI 自己承认模型在用户反馈的若干案例里出现了「令人担忧的未对齐行为」。公司一边把最猛的模型往外推,一边安全条线的负责人出走,这种画面怎么看都有点拧巴。

    • 重组的逻辑是「让安全更早介入模型开发和发布决策」,听起来合理
    • 但把安全并入研究线之后,独立的挑战声音会不会被削弱,是外界最担心的
    • Heidecke 已经是近期又一位离开的安全方向高管

    说到底,这未必是某个人去留的问题。当模型从季度更变成月更、周更,旧的「发布前最后一道安全审查」流程首先会撑不住。OpenAI 把安全往研究里塞,是想缩短这个链路;只是护栏能不能真的更牢,还得看 Glaese 接手后怎么立规矩。

    OpenAI安全团队重组
    OpenAI 将安全团队并入研究线,引发外界对独立安全监督的担忧
  • addyosmani/agent-skills:给 AI 编程助手装上 24 套「资深工程师技能」的开源技能库(76.9K⭐)

    addyosmani/agent-skills:给 AI 编程助手装上 24 套「资深工程师技能」的开源技能库(76.9K⭐)

    Addy's Agent Skills

    agent-skills 是 Google Chrome 团队工程师 Addy Osmani 维护的一套「生产级工程技能库」——把资深工程师在定义、规划、构建、验证、评审、发布软件时遵循的工作流、质量门禁与最佳实践,封装成 AI 编程 Agent 可以直接调用的结构化技能(Skills)。目前 76.9K Stars、MIT 许可,是当下 GitHub 上最热门的 AI 工程实践项目之一。

    一、安装要求和过程

    环境要求:

    • 任意支持 Skills / 系统提示 / 指令文件的 AI 编程客户端(Claude Code、Cursor、Codex、Copilot、Cline、Gemini CLI、Windsurf、Kiro、OpenCode 等 70+ 款);
    • 一键安装需 Node.js(提供 npx skills 命令);
    • 本地克隆方式需 Git。

    快速安装:

    方式一:skills CLI 一行装全部(推荐,覆盖 70+ Agent)

    npx skills add addyosmani/agent-skills            # 安装全部 24 套技能
    npx skills add addyosmani/agent-skills --list     # 安装前先浏览
    npx skills add addyosmani/agent-skills --skill test-driven-development  # 只装单个技能

    方式二:Claude Code 原生插件市场

    /plugin marketplace add addyosmani/agent-skills
    /plugin install agent-skills@addy-agent-skills

    方式三:本地克隆后挂载

    git clone https://github.com/addyosmani/agent-skills.git
    claude --plugin-dir /path/to/agent-skills

    二、核心功能

    • 8 条贯穿开发生命周期的斜杠命令:/spec(定规格)、/plan(拆任务)、/build(增量实现)、/test(验证)、/review(评审)、/webperf(性能)、/code-simplify(简化)、/ship(发布),每条命令自动激活对应技能。
    • 24 套覆盖全流程的工程技能:interview-me(需求澄清)、spec-driven-development(写 PRD),到 test-driven-developmentcode-review-and-quality(五轴评审)、security-and-hardening(OWASP 防护)、shipping-and-launch(上线清单)。
    • 技能即结构化工作流:每个 Skill 都带步骤、验证门禁(verification gates)和「反合理化」对照表,让 Agent 跨任务稳定遵守同一套标准,而不是凭心情发挥。
    • 上下文自动触发:设计 API 自动触发 api-and-interface-design,写 UI 自动触发 frontend-ui-engineering,无需手动指定。
    • /build auto 半自治模式:审批一次计划后,Agent 自动逐任务实现、测试驱动、单独提交,遇出错或高风险步骤自动暂停。

    三、典型使用场景

    1. 新功能从 0 到上线:/spec 先写规格、/plan 拆任务、/build 增量实现、/test 验证、/review 评审、/ship 发布——把「想到哪写到哪」变成可重复的流水线。
    2. 代码评审质量门禁:合并前调用 code-review-and-quality 做五轴评审(可读性 / 正确性 / 复杂度 / 测试 / 安全),以「Staff Engineer 会不会 merge」为标准,避免 AI 生成的 PR 带病合并。
    3. 安全敏感改动:涉及用户输入、鉴权、外部集成时触发 security-and-hardening,按 OWASP Top 10 检查、管理密钥、审计依赖,降低生产事故概率。

    四、推荐理由

    我自己的使用感受:这套技能库最打动人的地方,是它把「资深工程师的肌肉记忆」显式化了。平时让 AI 写代码,最容易翻车的是「需求没问清就开干」「改完不写测试」「PR 质量没把关」。agent-skills 用 /spec/test/review 把这些容易偷懒的环节变成默认流程,相当于给 Agent 配了个不会疲倦的 Tech Lead。它是纯 Markdown、零运行时依赖,装到任何 Agent 里都不增加包袱,值得每个用 AI 写代码的人试一试。

    五、下载地址

  • 14个人服务890万开发者:Ollama拿下6500万美元B轮,押注开源模型随处跑

    先说个数字:14个人,撑起890万开发者每月都在用的工具。这不是哪家巨头的内部团队,而是开源AI工具Ollama的全部家当。就在这周,这家公司拿到了6500万美元的B轮融资,领投方是Theory Ventures。

    Ollama开源AI工具融资示意图
    Ollama让开源模型在任何地方都能跑起来

    算上之前Benchmark领投的1500万美元A轮,Ollama目前累计融资8800万美元。当年领投A轮的Peter Fenton这次也进了董事会。创始人兼CEO的Jeff Morgan把话说得很直白:开源模型就该好跑、好用、随处可用——你自己的电脑上、云端,或者两头都用。

    从Docker到开源模型,这俩人干的是同一件事

    Ollama是2023年上线的,干的活很简单:帮开发者在自己的PC上跑开源权重模型,几分钟就能装好用起来。GitHub上攒了17.6万颗星、近1.7万个fork,各种教程、视频、博客里都在夸它。

    这种”把复杂的东西变简单”的路数,Morgan和联合创始人Michael Chiang早就玩过一遍。他们之前做的Kitematic被Docker收购,两人随后帮着做出了Docker Desktop——那个如今每天有一千多万开发者在用的工具。Docker当年把云应用从繁琐的硬件配置里解放出来,Ollama现在对开源AI做的是同一件事。

    “2023年开源模型开始冒出来,但真的很难用。它们当时是给研究员准备的,不是给程序员的,想跑起来特别费劲。”——Jeff Morgan

    免费工具怎么变成生意

    现在Ollama每月有890万开发者在用,比今年1月翻了差不多一倍,每周还新增将近100万次安装,社区做出来的集成超过6.7万个,覆盖了《财富》500强里85%的公司,连医疗、金融、政府这些强监管行业都在用。而这一切,团队只有14个人。

    光靠免费的本地工具当然赚不了钱。Ollama的商业化藏在云端:本地机器扛不住更大的模型时,可以直接切到它的云上跑,同一套操作,按GPU时长计费而不是按token。这套逻辑跟主流按token收费的做法明显不一样。

    • 免费版:本地运行 + 一定的云端GPU时长
    • Pro版:每月20美元,可同时跑3个云端模型,云用量是免费版的50倍
    • Max版:每月100美元,可同时跑10个云端模型

    Morgan说,Ollama作为一门生意的转折点大概在今年1月,OpenClaw火起来那阵子——更大的开源模型突然能干agentic的活了,比如写代码。这也踩中了整个行业的大趋势:据Grand View Research,AI推理市场2024年约970亿美元,到2030年预计冲到2540亿美元,年复合增速约17.5%。随着Meta、Mistral、DeepSeek这些开源模型和闭源系统的差距越缩越小,越来越多的钱正流向”开发者选择在哪里跑模型”这件事上,而这正是Ollama想占的位置。


    当然,这条赛道并不空。Hugging Face融了超过3.95亿美元,主要做模型仓库;Together AI最近以83亿美元估值拿了8亿美元,扩云端训练和推理。Ollama和Morgan都没透露这轮的估值和收入。但14个人对890万开发者这个比例本身,可能才是这轮融资背后最值得琢磨的故事。

  • Claude Sonnet 5来了:Anthropic把AI代理的成本砍了一刀

    Agent能力不再是大模型的专利

    Anthropic最近把Claude Sonnet 5推了出来。这家公司一直主打“AI安全”和“可控性”,但这一次他们的卖点更直接:中端模型也能像旗舰模型一样自主跑任务了。以前你想要浏览器、终端、工具调用这些agentic能力,多半得选Opus这种大模型,现在Sonnet 5说它也够格。

    他们的官方说法很直白:几个月前还需要更大、更贵模型才能做到的规划和自主执行,现在Sonnet 5这个中号模型就能干了。这其实跟OpenAI上周放出的GPT-5.6 Sol、以及Google五月发布的Gemini 3.5 Flash是一个路数——大家都在把“能自己干活”这件事变成基础配置,而不是高端选配。

    关键变化:agentic能力已经卷到了“性价比”这一层。谁能用更便宜的价格、更少的监管,让AI把复杂任务跑完,谁才是下一个卖点。

    价格方面,Sonnet 5在8月31日之前的促销价是每百万输入token 2美元、输出10美元。这个价格比Opus 4.8、OpenAI的GPT-5.5和Google的Gemini 3.1 Pro都便宜,虽然还略高于Gemini 3.5 Flash。促销期过后,输入会涨到3美元、输出15美元,但即便恢复原价,也只有Opus 4.8大概六成。

    性能接近旗舰,但价格便宜一截

    只看跑分,Sonnet 5在agentic coding测试里拿到了63.2%,Opus 4.8是69.2%,上一代Sonnet 4.6是58.1%。这说明它离旗舰还有距离,但已经把前代甩在了身后。更有趣的是,在知识工作 benchmark 上,Sonnet 5甚至小超Opus 4.8——也就是说,日常办公、写文档、整理信息这类场景,它的性价比优势会非常明显。

    Zapier的工程师Daniel Shepard说,他们让Sonnet 5做了一件两步骤的事:先更新Salesforce账户层级,再给一批企业联系人发产品发布通知。放在过去,这种任务往往做到一半就卡住,现在它端到端跑完了。Lovable的联合创始人也提到,Sonnet 5拒绝危险请求的方式“干净且一致”。

    AI代理概念图
    AI代理正在成为中端模型的标配,不再只是旗舰模型的专属功能。

    安全方面,Anthropic也做了不少测试。Sonnet 5在“被诱导去做坏事”或者“被欺骗”这类测试里比前代表现更好,幻觉和谄媚行为也更少。不过它跟Opus 4.8和Claude Mythos Preview相比,在恶意网络安全任务上还是差一截,企业如果要做高敏感操作,还是得选旗舰。


    说白了,这次发布更像是Anthropic把“agentic”能力平民化。对于开发者和小团队来说,这意味着他们可以用中端模型的成本,去搭一些以前要烧大模型才能玩的自动化流程。模型公司之间的战争,已经从“谁能做”变成了“谁更便宜、更稳”。

  • Anthropic刚警告AI太危险,转头就发布了更强的Claude Fable 5

    Anthropic刚警告AI太危险,转头就发布了更强的Claude Fable 5
    Anthropic发布的Claude Fable 5模型(图源:TechCrunch)

    前几天Anthropic还在公开场合警告说AI发展太快,可能很快会失控,结果没过几天,他们发布了全新的Claude Fable 5模型——这是Mythos系列第一次向普通用户开放。这种操作放在任何人身上都会觉得矛盾,但这就是当下AI行业的真实写照:一边喊着危险,一边拼命往前冲。

    安全风险是真担心,还是公关话术?

    Fable 5确实强。Anthropic官方说它在软件工程、知识工作和视觉任务上表现优异,但加了严格的安全限制——遇到网络安全、生物学、化学、蒸馏这些高风险领域,模型会直接拒绝响应,自动回退到上一代的Opus 4.8。这种做法听起来很负责,但问题是:如果用户真的想用来干坏事,换个问法是不是就能绕过?

    Anthropic说他们对Fable 5做了超过1000小时的越狱攻击测试,内部和外部红队都没找到通用越狱方法。这个说法可信度有多少,外界没法验证,只能选择相信。但更值得关注的是另一条政策:所有使用Fable 5的用户,无论之前是否签署了零数据保留协议,现在都必须接受30天的数据保留。Anthropic说这些数据只用于防御新型攻击和减少误判,不会拿去训练模型。

    这种”用安全换数据”的逻辑,很可能会成为行业先例。以后的强大模型,可能都得接受类似的条件才能用。

    价格贵得让很多企业犹豫

    Fable 5的定价是每百万输入token 10美元,每百万输出token 50美元,是Opus 4.8的两倍。这个价格意味着什么?如果你每天用AI处理大量任务,月底的账单会非常难看。Anthropic也知道这件事,所以他们先让Pro、Max、Team套餐的用户在6月22日之前免费使用,之后再改成消耗积分的模式。

    企业的反应分化很明显。购物奖励平台Rakuten觉得值,他们说Fable 5会”反思并验证自己的工作成果”,高度自主的运营能力匹配这个价格。但更多企业已经在抱怨AI成本太高,有些甚至提前花完了年度AI预算。Fable 5只会让这件事更严重。

    第三方测试结果确实不错

    抛开价格和安全的争议,Fable 5的能力确实强。分析公司Hex说它是第一个在复杂长周期分析任务基准测试中拿到90%得分的模型。氛围编码平台Base44说它更擅长”一次性生成完整应用”,工具调用能力很出色。AI工作空间平台Genspark说它在UI设计、游戏编码这些任务上明显比其他模型好。

    这些测试结果说明,Fable 5不是靠营销吹出来的,确实有能力上的提升。但能力提升和安全风险之间的平衡,Anthropic还没有给出让人完全信服的答案。