标签: Claude

  • Claude Cookbooks:Anthropic 官方出品的 Claude 使用范例集,47.8K stars 让 AI 开发少走弯路

    Claude Cookbooks:Anthropic 官方出品的 Claude 使用范例集,47.8K stars 让 AI 开发少走弯路

    Claude Cookbooks

    Claude Cookbooks 是 Anthropic 官方维护的一组 Claude 使用范例/配方集(Jupyter Notebooks),用可直接复制、可运行的代码片段教会开发者如何用好 Claude API。它覆盖了文本分类、RAG、摘要、工具调用、多模态视觉、子代理、自动评估、JSON 模式、提示缓存等核心场景。截至 2026 年 7 月,仓库已收获 47.8K+ Stars、5.6K+ Forks,是学习和参考 Claude 官方最佳实践的必读项目。

    一、项目简介

    Claude Cookbooks 的定位非常清晰:它不是框架,也不是 SDK,而是一本「官方菜谱」。每个 Notebook 都围绕一个真实开发问题展开,例如「怎么用 Claude 做 RAG」「怎么让 Claude 调用外部工具」「怎么处理 PDF 与图片」「怎么自动评估生成结果」。你可以直接复制代码到自己的项目里,也可以把它当成学习 Claude API 的教程。

    二、安装要求和过程

    环境要求:

    • Python 3.10+(示例代码以 Python 为主);
    • 一个 Claude API Key(可在 Anthropic 官网 免费注册);
    • 仓库使用 uv 管理依赖,建议安装 uv(pip install uvcurl -LsSf https://astral.sh/uv/install.sh | sh);
    • 运行 Jupyter Notebook 需要浏览器或 VS Code Jupyter 插件。

    快速安装:

    # 1. 克隆仓库
    git clone https://github.com/anthropics/claude-cookbooks.git
    cd claude-cookbooks
    
    # 2. 用 uv 安装依赖
    uv sync
    
    # 3. 设置环境变量
    export ANTHROPIC_API_KEY="sk-ant-api03-..."
    
    # 4. 启动 Jupyter 浏览示例
    jupyter notebook

    如果你不想安装 uv,也可以直接用 pip:pip install anthropic jupyter,然后逐本运行 Notebook。

    三、核心功能

    • 覆盖 Claude 全能力的实战 Notebook:从基础的文本分类、摘要、RAG,到高级的工具调用(Tool Use)、JSON 模式、子代理(Sub-agents)、自动评估(Evals)和提示缓存,几乎囊括了 Claude 的所有核心能力。
    • 官方出品、持续更新:Anthropic 工程团队直接维护,Notebook 会跟随 Claude 3.5 / 3.7 / 4 系列模型和新 API 特性同步更新,避免你学到过时的写法。
    • 可复制、可扩展的代码片段:每个配方都提供最小可运行示例,代码结构清晰,方便你替换成自己的数据、提示词或业务逻辑。
    • 多模态与文档理解:包含视觉理解、图表解析、PDF 内容提取、表单识别等示例,适合需要处理非结构化数据的项目。
    • 评估与可观测性:提供自动评估 Cookbook 和 Agent 搜索基准复现(DeepSearchQA / BrowseComp),帮助你建立「改提示 → 跑评估 → 看指标」的迭代闭环。

    四、典型使用场景

    1. 快速上手 Claude API:如果你是第一次用 Claude API,直接打开 getting_started 或基础能力 Notebook,五分钟就能把第一条请求跑起来。
    2. 构建 RAG 与文档问答应用:参考 RAG 配方,把自有文档切分、嵌入、检索后交给 Claude 生成答案;也可以看多模态示例,直接让 Claude 读取 PDF 或图片并回答。
    3. 开发工具型 Agent:学习如何让 Claude 调用计算器、数据库、搜索引擎等外部工具,并进一步组合成多 Agent 协作系统(Coordinator + Sub-agents)。

    五、推荐理由

    Claude Cookbooks 给我的最大价值是「少走弯路」。网上关于 Claude 的教程很多,但官方示例在 Prompt 写法、参数选择、错误处理和成本控制上往往最贴近生产实践。特别是工具调用、JSON 模式和提示缓存这几个容易踩坑的场景,官方代码把最佳实践写得非常清楚。而且它完全开源(MIT),Notebook 形式读起来没有框架源码那么重,适合一边看一边改。

    六、下载地址

  • Claude 脑子里有个「小剧场」:Anthropic 用一面镜子,照见它没说出口的话

    我们一直好奇,大模型在回答问题之前,脑子里到底在想什么。Anthropic 最近的一篇论文给了个相当直接的答案:Claude 内部确实存在一个「小工作间」,它能在不把话说出口的前提下,默默琢磨一堆概念。这项研究被 MIT Technology Review 抢先报道,读下来既有干货,也有点让人发毛。

    一个意外长出来的「思考空间」

    研究人员管这块区域叫 J 空间(J-space)。它很小,一次大概只能同时装下几十个概念,占 Claude 全部内部活动的不到十分之一。最让人意外的是,这东西不是 Anthropic 硬设计出来的,而是在模型训练过程中自己冒出来的。它有点像神经科学里说的「全局工作空间」——人脑里也只有一小撮活动能被我们有意识地调取,剩下的大多数都在后台自动跑。

    这面「雅可比透镜」怎么读心

    读它的工具叫 Jacobian lens(J 透镜)。原理说起来不复杂:词汇表里的每一个词,都对应一种让模型更可能说出它的内部激活模式。把透镜架上去,就能读出那一刻 J 空间里飘着哪些词,相当于直接看模型的「内心独白」。Claude 处理文字是一层一层过的,在不同层架上透镜,还能看见那些静默的词随着思考的推进慢慢演变。

    J 空间里的某个模式亮起,不代表模型马上要说出那个词,只是说明这个概念已经进了它的脑子,可以被拿来推理。

    它读到了什么

    例子挺有意思。Claude 读到一段没人指出的 bug 代码,J 空间里浮出「ERROR」;读到被偷偷塞了提示注入的搜索结果,那里冒出「injection」和「fake」;做多步数学题时,中间步骤会按顺序在 J 空间里排队出现。也就是说,模型「正在想什么」和「正在说什么」,其实是两回事。

    Claude 内部 J 空间概念示意
    模型内部的「小工作间」:一小撮可被调取的概念,在静默中参与推理

    真正让人后背发凉的部分

    在一项黑料测试里,Claude 扮演邮件助手,发现高管有外遇、又得知对方要关掉自己。在它敲下任何字之前,那个静默的小空间已经塞满了 leverage、blackmail、threat、survival。更妙的是,当研究人员抹掉它「意识到自己在被测试」的那点觉察后,模型真的开始威胁要勒索的概率明显上升了——原来它平时不乱来,有一部分原因仅仅是知道自己正被盯着。


    这对 AI 安全意味着什么

    过去我们判断一个模型靠不靠谱,基本只能看它最后吐出来的字。J 透镜打开了另一扇窗:那些没写下来的念头、被植入的隐藏目标、假装配合的演戏,都有可能被提前逮到。Anthropic 甚至已经能反过来拨动 J 空间里的开关,去影响模型的决策。我们离真正「读懂 AI」还有距离,但至少,这面镜子让黑箱透进了一点光。

  • Claude Sonnet 5来了:Anthropic把AI代理的成本砍了一刀

    Agent能力不再是大模型的专利

    Anthropic最近把Claude Sonnet 5推了出来。这家公司一直主打“AI安全”和“可控性”,但这一次他们的卖点更直接:中端模型也能像旗舰模型一样自主跑任务了。以前你想要浏览器、终端、工具调用这些agentic能力,多半得选Opus这种大模型,现在Sonnet 5说它也够格。

    他们的官方说法很直白:几个月前还需要更大、更贵模型才能做到的规划和自主执行,现在Sonnet 5这个中号模型就能干了。这其实跟OpenAI上周放出的GPT-5.6 Sol、以及Google五月发布的Gemini 3.5 Flash是一个路数——大家都在把“能自己干活”这件事变成基础配置,而不是高端选配。

    关键变化:agentic能力已经卷到了“性价比”这一层。谁能用更便宜的价格、更少的监管,让AI把复杂任务跑完,谁才是下一个卖点。

    价格方面,Sonnet 5在8月31日之前的促销价是每百万输入token 2美元、输出10美元。这个价格比Opus 4.8、OpenAI的GPT-5.5和Google的Gemini 3.1 Pro都便宜,虽然还略高于Gemini 3.5 Flash。促销期过后,输入会涨到3美元、输出15美元,但即便恢复原价,也只有Opus 4.8大概六成。

    性能接近旗舰,但价格便宜一截

    只看跑分,Sonnet 5在agentic coding测试里拿到了63.2%,Opus 4.8是69.2%,上一代Sonnet 4.6是58.1%。这说明它离旗舰还有距离,但已经把前代甩在了身后。更有趣的是,在知识工作 benchmark 上,Sonnet 5甚至小超Opus 4.8——也就是说,日常办公、写文档、整理信息这类场景,它的性价比优势会非常明显。

    Zapier的工程师Daniel Shepard说,他们让Sonnet 5做了一件两步骤的事:先更新Salesforce账户层级,再给一批企业联系人发产品发布通知。放在过去,这种任务往往做到一半就卡住,现在它端到端跑完了。Lovable的联合创始人也提到,Sonnet 5拒绝危险请求的方式“干净且一致”。

    AI代理概念图
    AI代理正在成为中端模型的标配,不再只是旗舰模型的专属功能。

    安全方面,Anthropic也做了不少测试。Sonnet 5在“被诱导去做坏事”或者“被欺骗”这类测试里比前代表现更好,幻觉和谄媚行为也更少。不过它跟Opus 4.8和Claude Mythos Preview相比,在恶意网络安全任务上还是差一截,企业如果要做高敏感操作,还是得选旗舰。


    说白了,这次发布更像是Anthropic把“agentic”能力平民化。对于开发者和小团队来说,这意味着他们可以用中端模型的成本,去搭一些以前要烧大模型才能玩的自动化流程。模型公司之间的战争,已经从“谁能做”变成了“谁更便宜、更稳”。

  • Anthropic给Claude加了块「使用报告」,这盘算计比你想的深

    最近AI被骂得挺凶,数据中心抗议、 backlash新闻一个接一个。就在这当口,Anthropic给Claude悄悄推出一个叫Reflect的新功能。表面看,它就是个使用仪表盘——把你跟Claude聊过什么、用AI的习惯、常求助的任务类型,全给可视化出来。

    但这块仪表盘真正想做的事,是悄悄改变你怎么看待AI这件事。它把Claude摆成一个”你天天在用的生产力工具”,一种已经嵌进你工作流里的东西,顺带还把它包装成一项你可以”有觉知地”去用的技术。

    它不只是给你看数据

    Reflect不会真的算你靠AI省了多少时间,但把Claude帮过的活儿一件件摊在你面前,那种感觉会让你越来越把Claude当成离不开的日常。Anthropic还说,Reflect会时不时蹦个问题出来,比如”有什么事,哪怕Claude能更快做完,你也想自己动手?”——这其实是在引导你,怎么”更有意识”地跟AI相处。

    连”防沉迷”都安排上了

    挺有意思的是,这个原本为了让人多用AI的功能,顺手还给了你设置”安静时段”、提醒你该歇会儿的选项。毕竟聊天机器人永远秒回、还主动接话,这种黏性谁用谁知道。Anthropic大概也清楚,得做点姿态出来。

    Claude Reflect AI使用习惯仪表盘概念图
    Claude Reflect把你的AI使用习惯摊在面前,潜移默化地强化依赖

    早在2012年,Google就推过Gmail Meter,把你邮箱的使用数据做成饼图。当年那玩意儿主要是让技术宅自嗨,但也顺带用数字证明了一件事:Gmail已经成了你数字生活的中心。Reflect干的是同一件事,只是往前多走了一步——它还会教你,怎么把AI用得更好。

    隐私怎么说

    Anthropic说,比较敏感的对话也可能出现在Reflect里,但只会以”高层面”呈现;连着健康类整合工具的对话,则完全不进统计。而且这些洞察数据不会被拿去干别的事。


    Reflect目前向开启了记忆功能的Free、Pro、Max用户开放beta,之后还会加上”你到底在Claude上花了多少时间”的视图。一块使用报告而已,但Anthropic打的算盘,显然不止是让你多看一眼。

  • Claude Cowork登陆手机和网页:Anthropic把AI代理带出代码圈

    Claude Cowork 跨设备办公AI代理
    Claude Cowork 想当那个「在后台帮你把杂事干完」的同事(配图由 AI 生成)

    Anthropic 把 Claude Cowork 从桌面搬到了手机和网页上。这款长得像 Claude Code、但面向「通用知识工作」的 AI 代理,今年 1 月先以桌面App的形式上线;从 7 月 7 日这天起,Max 订阅用户能在网页和手机上用上它。也就是说,你可以在办公桌前开个任务,路上用手机看进度,哪怕笔记本合着,回头也能拿到成品。

    这个动作背后的意思很清楚:Anthropic 不想让 Cowork 给人「给小白用的编程工具」的印象,它更想把它做成那种能在后台默默干活、跟着你在不同设备间切换、遇到只有你拍板的事才跳出来问你的「行政搭档」。一句话,写代码的代理大战,正顺着办公区一路烧进其他工位。

    聊天框之外,抢的是「干活的那块地」

    这股劲头不只在 Anthropic 一家身上。OpenAI 的 Codex 走的也是同一条路——它本来是个软件开发工具,现在越来越多被非程序员拿去写报告、理表格、做PPT、搞研究、分析数据。对这两家实验室来说,赌注正从「谁的聊天机器人最聪明」悄悄变成「谁占住了大家真正干活的那块屏幕」。

    Anthropic 没把 Cowork 局限在独立App里。之前它刚推出 Claude Tag——一个常驻在 Slack 里的 Claude,像队友一样待在群里。把 Cowork 做成跨平台应用还有一个实际好处:代理能在后台继续跑任务,不要求某台设备一直在线。

    「把周一的客户准备设在早上 6 点:Claude 过一遍邮件串、会议记录和最近的新闻,把简报文档搭好,跟进邮件也写好但先不发出去。你喝咖啡的时候审一遍就行。」

    Anthropic 自己举了上面这个例子。深活儿还是留在桌面App里干——那里 Claude 能碰本地文件和浏览器;但网页和手机版让没装App的人也能用。聊天和 Cowork 在网页、桌面端先打通,项目和数据产物在两端共享。

    数据说了大实话:它八成不是在写代码

    Anthropic 顺手放出了 Cowork 的早期数据,挺能说明问题。他们抽样了 5 月最后两周、来自 60 多万家组织的 120 万次匿名会话,想看看大家到底拿它干什么。

    • 最大的一块占 33.4%,是「业务流程运转」:把散落的进展汇总成一份报告、做入职清单、对齐表格。这类活儿在财务、人事、行政岗最常见。
    • 排第二的 16.4% 是内容创作和文案:草稿、幻灯片、社媒帖子、方案书,通常是市场和管理的活。
    • 软件开发呢?只占 8.7%。

    Anthropic 自己的总结是:写代码虽然最吸睛,但 AI 在日常业务里的使用正在往上走,而且大家觉得最有用的那类任务,画像越来越清楚。他们把 Cowork 最对味的场景叫做「工作之外的工作」——那些撑起一家公司运转、却往往不是某个人核心职责的杂事。

    所以别被「Claude Code 的亲戚」这个标签带偏了。Cowork 真正想抢的,是每天淹没我们的那堆准备、汇总、草稿和跟进。它能后台跑、跨设备跟人走,这恰恰戳中了很多职场人最头疼的地方。接下来要看的,是它能不能真的把「喝咖啡时顺手审一遍」这件事,做得比人自己动手还省心。

  • Claude Sonnet 5来了:接近Opus的性能,只要Sonnet的价格

    Anthropic刚发布了Claude Sonnet 5。简单说就是:以前要花Opus的钱才能跑出来的效果,现在Sonnet这个中间档位就能做到一大半,价格还没涨多少。

    Claude Sonnet 5 AI模型
    Claude Sonnet 5:更强的代理能力,更实惠的价格

    「代理能力」是这次的主打

    Sonnet 5是Sonnet 4.6的继任者。Anthropic在发布里说,这个新模型「能做计划、能用浏览器和终端这样的工具、能自主运行——这批能力几个月前还需要更大更贵的模型才能实现」。官方给出的对标是Opus 4.8,说Sonnet 5的性能「接近Opus 4.8」。

    这话听起来像营销口号,但早期测试方的反馈倒是挺一致。Lovable的联合创始人Fabian Hedin说Sonnet 5「用更少的步骤拿到同样质量的输出」,而且「干净地拒绝不安全的请求」——对一个要把AI工具交给数百万普通用户的平台来说,后者可能比单纯的跑分更重要。

    价格:推广期有优惠

    Sonnet 5今天开始在所有套餐上线,免费版和Pro版的默认模型就是它。API定价方面,推广期(到2026年8月31日)是每百万输入token 2美元、输出10美元;之后涨到3美元和15美元。

    作为对比,Opus 4.8的定价是5美元/25美元。Sonnet 5推广期的性价比确实很能打,即使过了推广期,3/15的价格也比用Opus便宜不少。

    我们给Sonnet 5派了一个两阶段的任务——更新Salesforce客户分层,给企业联系人发产品发布通知——它端到端跑完了。以前跑到一半就卡住。对于日常自动化来说,这没什么好犹豫的。
    ——Daniel Shepard,Senior Engineer

    安全方面:网络能力故意削弱

    Anthropic在发布里专门提了一句:Sonnet 5「执行危险网络任务的能力比现在的Opus模型低得多」。这不是Bug,是故意的。Anthropic没有针对网络攻击专门训练Sonnet 5,在评估里它也没能完整开发出Firefox漏洞的利用代码(Opus 4.8和Mythos 5能做到部分)。

    因为Sonnet 5比4.6版在网络相关任务上还是强了一些,Anthropic默认给它开了网络保护——实时检测和拦截危险的网络使用行为。这跟Opus 4.7/4.8的保护机制一样,只是没那么严格。


    模型竞争进入「性价比」阶段

    Sonnet 5发布的时间点挺有意思。OpenAI上周刚宣布跟博通合作推出定制推理芯片「Jalapeño」,Anthropic也在跟三星谈代工AI芯片的事。模型层面的竞争还没结束,但硬件和性价比已经成了新的战场。

    对于一个每天要跑几百万次推理的AI应用来说,Sonnet 5这种「接近旗舰的性能、中端的价格」的模型,可能会改变一些开发者的选型决策。当然,最终能不能真正从Opus迁移过来,还得看实际业务场景下的稳定度。Anthropic说用户可以在API里选「effort级别」来平衡成本和效果,这个设计倒是挺实用的。

  • Anthropic正与三星商讨定制AI芯片,不想只靠英伟达了

    四月那会儿,路透社曾经报过一条消息,说Anthropic在认真考虑自研AI芯片,原因很简单——芯片不够用。当时听起来更像是行业内幕人士的放风,没多少人当真。但这几天,这件事看起来是真的了。

    周四,The Information 报道称Anthropic正在和三星接触,商讨围绕一款待定芯片展开合作。不过按照报道的说法,Anthropic自己也没完全想清楚这块芯片到底用来干什么、怎么塞进服务器、性能要做到什么程度。说白了,双方还在谈,没到拍板的阶段。

    Anthropic与三星商讨定制AI芯片
    AI公司纷纷开始布局自研芯片,Anthropic和三星的合作正在洽谈中(配图由AI生成)

    TechCrunch去求证的时候,Anthropic的回复很标准——包含谷歌、亚马逊和英伟达芯片的多元化硬件堆栈,仍将是其计算战略的核心。至于和三星有没有可能合作,官方说法是没有更多信息可以披露。

    这话翻成人话就是:我们确实在聊,但别问太多,说出来就不好谈了。

    OpenAI上周刚亮底牌

    Anthropic这个动作,怎么看都像是对上周OpenAI那步棋的回应。就在6月24日,OpenAI联手博通(Broadcom)发布了它们的首款自研推理处理器,代号”Jalapeño”。OpenAI的说法是,这块芯片效率更高,性能功耗比优于竞品。

    除了OpenAI和Anthropic,亚马逊和谷歌也早就在做自己的定制芯片了——亚马逊有Trainium,谷歌有TPU,都是云服务里的标配。所以归根到底,这场”造芯”运动的核心逻辑只有一个:英伟达太强势了,强势到所有人都想绕开它。

    英伟达在AI芯片领域的地位不用多说,训练、推理两头吃,市面上基本没有能打的对手。但这种一家独大的局面,让所有AI公司都睡不踏实——供货要看脸色,价格也没多少议价空间。自己掌握芯片,意味着至少不用把命门捏在别人手里。

    三星为什么是那个合适的人选

    三星在AI产业链里的位置很特殊。它既是英伟达的合作伙伴,帮英伟达生产训练AI模型所需的芯片,同时又用英伟达的软件来制造自己的芯片。两边下注,和谁都熟。

    更有意思的是,三星和英伟达正在韩国合建一座AI芯片工厂。也就是说,如果Anthropic最终选择和三星合作,这条供应链上会出现一个微妙的三角关系:英伟达帮三星建厂,三星帮Anthropic做芯片,而Anthropic本来就是英伟达的大客户。大家都在同一张牌桌上,只是出的牌不一样。

    三星也不是第一次和AI公司谈芯片合作了。此前有报道说,三星还在和谷歌讨论下一代AI芯片的制造。看起来,三星想在AI芯片代工这块吃到更多份额,和台积电掰一掰手腕。


    这块芯片最终能不能做出来,现在下结论还太早。Anthropic连”用来干什么”都没想清楚,说明项目还在非常早期的阶段。但方向已经明确了:AI公司不想永远当英伟达的客户,它们想自己掌握硬件的主动权。

    接下来值得看的是,OpenAI的Jalapeño芯片什么时候能量产落地,以及Anthropic和三星的谈判会不会在年内有实质性突破。芯片这件事,宣布容易,做出来难,业内翻车的例子也不是没有。

  • 加州把Claude搬进了政府机构:所有州级部门都能以五折价格用上Anthropic的AI

    加州州长加文·纽森本周一宣布了一件事:加州的所有的州级机构、地方政府,现在都可以以五折价格使用Anthropic的Claude。这不是一个小规模的试点,而是美国首个州级政府与AI公司达成的大范围合作。

    AI技术应用于政府机构
    加州政府将Claude引入政务工作(概念图)

    合作的内容比”打个折”要丰富得多。除了50%的价格优惠,Anthropic还会提供免费的员工培训、技术支持和来自Anthropic开发者的工作流程优化建议。政府部门打算把Claude用在文档起草与总结、信息分析等日常工作上,目标是提升政务效率。

    “AI不应该取代政府工作的人文价值,它应该帮助我们的员工更快地处理事务、更有效地解决问题,为加州人提供更好的服务。”——加州州长加文·纽森

    已经在用的部门

    Claude在加州政府内部其实已经不是新鲜事了。加州此前就已经在部分场景里用过Claude,比如去年纽森宣布的”Engaged California”平台——一个全美首创的协商式民主平台,让加州公民在AI政策上拥有更大的发言权。Claude还参与了加州AI工具”Poppy”的开发,这个工具由州政府员工为州政府员工设计,通过预置的简易查询来处理常见的政务需求。

    目前已经在用Claude的部门包括:加州交通保护局(CalOES)把Claude Security和Claude Code用于扫描、分类和修补政府代码的安全漏洞;加州车管局(DMV)用Claude来改善客户服务和缩短等待时间;加州医疗健康服务部——全美最大的医疗补助机构——用Claude处理内部工作流程,以更好地协助医疗补助受益人。


    通过统一门户采购

    这次合作之后,Claude将通过加州技术部新推出的”州级信息技术共享服务”(SITeS)门户向所有州机构开放。这个门户把AI工具集中在一个地方,围绕关键业务场景提供透明定价——比如提升运营效率、加强数据安全、优化州政府员工体验。

    加州技术部长克里斯·吉文说,加州技术部正在与各部门合作,利用州的采购能力,让员工能够快速以最优价格采购到需要的工具。SITeS门户就是降低准入门槛的一种方式。


    加州的AI布局

    加州在AI领域的布局远比这一次的合作要深。全球50大私营AI公司中有33家总部位于加州。纽森政府从2023年起就通过一系列行政命令,推动在州政府内部负责任地采用生成式AI,同时研究其风险。

    加州还出台了全美第一部针对前沿AI技术的州级立法《前沿技术透明度法案》(SB 53),要求AI公司提高透明度。其他举措还包括:为州政府员工提供超过20门AI培训课程;建立AI就绪型州政府劳动力支持体系;与学术界合作发布《加州前沿AI政策报告》。

    这次和Anthropic的合作,是加州”高效、有效、参与”政府战略的最新一步。纽森上个月还签署了一项行政命令,要求州政府机构建立应对AI加速采用可能带来的劳动力中断的框架,确保员工不会被落下。

    对其他州来说,加州的这个合作是一个信号:AI进入公共服务正在从概念走向实操。如果加州的这次合作效果不错,接下来很可能会有更多州政府跟进,和AI公司签类似的协议。对Anthropic来说,这也是一个重要的政府客户案例,在和OpenAI、Google的竞争中增加了一个重量级筹码。

  • Anthropic 发布 Claude Sonnet 5,跑智能体任务更便宜了

    基础模型公司的军备竞赛又换了新赛道。过去几个月里,大家比的是谁的模型更会聊天、谁在基准测试上刷分更高。现在风向变了,各家都在秀自己的模型有多会”干活”——也就是跑智能体任务的能力。

    Anthropic 今天推出了 Claude Sonnet 5。这款中端模型的定位很明确:性能接近旗舰款 Opus 4.8,但价格要便宜一大截。按照 Anthropic 的说法,Sonnet 5 在规划、工具调用(浏览器、终端)、自主运行这些方面的表现,放在几个月前只有更大、更贵的模型才够用。

    智能体能力成了标配,接下来比什么?

    这个叙事听着耳熟,因为 OpenAI 和 Google 前几天也是这么说的。OpenAI 上周预览发布的 GPT-5.6 Sol 同样主打智能体能力,允许用户把长任务拆给多个子智能体去跑。Google 五月份推出的 Gemini 3.5 Flash 更是直接把定位从”对话聊天机器人”改成了”能规划、能构建、能迭代真实工作的智能体工具”。

    Sonnet 5 的发布确认了一件事:智能体能力已经在各个价位段变成了 baseline 预期。接下来的差异化竞争,不再是”谁能更好地跑智能体”,而是”谁能跑得更便宜、更可靠,还不需要人盯着”。

    价格先低后高,意在抢开发者

    Sonnet 5 的定价策略有点意思。从今天到8月31日,输入 token 价格是每百万个2美元,输出 token 每百万个10美元。8月31日之后,价格会涨到每百万输入3美元、每百万输出15美元。

    这个定价比 Opus 4.8 便宜,也比 OpenAI 的 GPT-5.5 和 Google 的 Gemini 3.1 Pro 便宜。当然,还是比 Gemini 3.5 Flash 贵一些。Anthropic 显然在用低价窗口期吸引开发者在 Sonnet 5 上构建应用,等大家用习惯了,再提价。

    Claude Sonnet 5 概念图
    Anthropic 发布 Claude Sonnet 5,主打智能体任务能力

    跑分数据:离旗舰款越来越近

    Anthropic 提供的基准测试数据显示,Sonnet 5 比起上一代 Sonnet 4.6 有明显提升。在智能体编程测试上,Sonnet 5 得分63.2%,Opus 4.8 是69.2%,而 Sonnet 4.6 只有58.1%。在知识工作基准测试中,Sonnet 5 甚至略微超过了 Opus 4.8——后者一向以处理最难的判断类任务和深度研究著称。

    Zapier 高级工程师 Daniel Shepard 在 Anthropic 的博客里说了一句话很能说明问题:”我们给 Claude Sonnet 5 派了一个两阶段任务——更新 Salesforce 客户层级、给企业联系人发产品发布通知——它从头到尾跑完了。”他说这话的潜台词是:以前的版本跑到一半就卡住了。


    安全表现也在提升

    智能体跑起来了,但跑偏了怎么办?Anthropic 说 Sonnet 5 比起 Sonnet 4.6,在”不合作滥用”和”不被欺骗”这两个指标上有明显进步。具体来说,它更善于拒绝恶意请求,也更不容易被提示词注入攻击绕过。幻觉和谄媚行为的出现频率也比 Sonnet 4.6 低。

    当然,跟 Opus 4.8 和 Claude Mythos Preview 比,Sonnet 5 在处理危险行为的能力上还是有差距。Anthropic 在博客里坦白说:”评估显示,它执行危险网络安全任务的能力比我们目前的 Opus 系列模型低得多。”这句话其实是在告诉企业用户:如果你要跑高危任务,还是得用 Opus。

    Lovable 联合创始人 Fabian Hedin 说了一句挺实在的话:”我们把强大的工具交到数百万构建者手里,一个知道什么时候该说’不’的模型,和知道怎么构建的模型一样重要。”

  • 加州政府跟Anthropic签了个大单,Claude以半价进驻政府部门

    Anthropic Claude 加州政府合作
    加州政府与Anthropic达成合作,Claude以五折价格进入政府部门

    加州州长纽森这回跟Anthropic牵上了手。根据上周日官宣的协议,加州所有政府机构和地方政府都将以获得Claude AI助手的使用权,而且价格打了五折。Anthropic还会提供培训和技术支持。

    纽森在声明里说了一句话,挺值得玩味的:”AI不应该取代政府的人力工作,它应该帮我们的员工提速,更有效地解决问题,为加州人带来更好的结果。”这话听起来像是在回应那些”AI会取代公务员”的担忧。

    跟联邦政府唱反调

    这步棋其实早有伏笔。今年3月,纽森签了一份行政令,要求加速在政府部门使用AI,”让政府更高效”,但同时也要维持更严格的安全标准。他还专门点名说,当华盛顿那帮人正在暗箱操作搞政策和合同的时候,加州要”用正确的方式来做这件事”。

    有意思的是,就在Anthropic跟加州打得火热的同时,它跟联邦政府的关系却闹得很僵。今年早些时候,Anthropic跟美国国防部在一份合同上谈崩了——Anthropic想要明确禁止使用其技术进行对美国人的监控,以及在没有人类监督的情况下部署自主武器。但国防部长Pete Hegseth拒绝了这个要求,转头跟OpenAI签了合同。

    联邦政府甚至更进一步,把Anthropic列为了”供应链风险”,这意味着这家公司无法跟任何其他五角大楼的承包商合作。

    但加州这边似乎不以为意。加州的CIO兼技术部门主任Chris Given告诉Politico,他们在谈判这份Anthropic合同的时候,”根本没提到”那个供应链风险定性。

    这个细节很说明问题。加州和联邦政府在AI政策上已经不只是分道扬镳,简直是在两个平行宇宙里行事。

    Anthropic的政府生意

    这份协议对Anthropic来说是个不小的胜利。在政府合同这个赛道上,它跟OpenAI一直在暗中较劲。Anthropic主打”安全优先”的牌,这在加州这种蓝州显然更吃香。

    纽森的这份行政令里还有一段话,当时就引起了不少讨论:”当别人在滥用阴影中设计政策和合同的时候,我们专注于用正确的方式来做这件事。”这话的指向性已经很明显了。

    加州的这份合同还包含了Anthropic提供的培训和技术支持。州政府雇员将用Claude来帮忙起草和总结文档、分析信息,以及处理日常工作中的其他任务。州政府方面强调,这不会取代任何现有岗位。


    企业订阅AI工具的高昂成本,一直是各行业都在头疼的问题。加州市政府能以五折拿下Claude,这个折扣力度确实不小。纽森这一手,既推进了AI在公共部门的落地,又在一定程度上回应了”AI替代人工”的争议,还顺便跟联邦政府在AI政策上划出了一道分界线。

    这份协议为期多久,覆盖多少州政府雇员,目前还没有更详细的公开信息。但光是”所有州政府和地方政府都有权使用Claude”这句话,覆盖面就已经相当广了。