标签: Claude

  • Anthropic甩出Opus 5:比Fable 5更便宜、限制更少,跑分反而更能打

    周五那天Anthropic直接放出了Opus 5,也就是它那条老牌旗舰线的最新一代。这次的定位挺有意思:模型体量比Fable 5小,但价格更便宜、限制也更松,对大多数人来说反而更好用。

    Anthropic Opus 5 发布
    Anthropic 最新旗舰模型 Opus 5 正式上线

    最反直觉的一点是,虽然个头更小,Opus 5 在官方公布的一批基准测试里居然还压过了Fable 5。对于一个”次旗舰”来说,这个成绩有点抢戏。

    Opus 5 在”反复检查自己的工作、耐心迭代直到跑通”这件事上明显更强——官方给的例子里,它能对着一个不完整的提示词,自己把一整套计算机视觉流水线写出来。

    节奏快得有点吓人

    Opus 5 距离 Opus 4.8 只隔了两个月——后者5月28日才上线。再往前看,Mythos 5、Fable 5、Sonnet 5 全是6月扎堆发的。这么一数,整条5系里现在只剩下轻量级的Haiku还没升级,其余全部到位。Anthropic今年这个迭代密度,基本是把日历表当油门踩了。

    松绑,但没有完全松开

    Opus 5 摆脱了Fable 发布以来一直被人诟病的一堆限制。和上一代一样,它不受那条覆盖Fable 和 Mythos 的30天数据留存政策约束——这条政策此前让不少在意隐私的用户很不放心。

    当然,护栏没全拆。涉及网络安全的活儿依旧盯得紧,尤其是漏洞利用和渗透测试。举个具体的例子:

    • 不允许对二进制软件扫漏洞,因为这类操作更偏进攻性;
    • 但允许在源代码里找漏洞,因为这更像是防御方在自查;
    • 整体上,这些安全分类器在 Opus 5 上触发的频率,预计比 Fable 5 少 85%——毕竟能力更弱的模型,管得也就更松。

    被拦了也别急,自动降级接住你

    Anthropic还顺手上了个新功能,专治”护栏一触发就报错”的糟心体验。用户可以选择开启一个叫 Automatic Fallbacks 的测试版特性:当某个提示词触发了安全分类器,请求会被自动转给一个能力稍弱的模型来处理。这样一来,开了这个开关的 API 用户拿到的不再是冷冰冰的错误提示,而是一条能用的回复。对天天跟接口打交道的开发者来说,这种”至少给个结果”的兜底,比一堆解释都实在。

  • Anthropic半年连推五代模型:Opus 5比自家旗舰更便宜、限制更少还更好用

    Anthropic又出手了。上周五,它悄悄上线了Opus 5——旗下那条主力重量级模型线的最新一代。有意思的是,Opus 5比自家旗舰Fable 5个头更小,但价格更便宜、限制也更少,多数场景下反而更好用。

    Opus 5在官方给出的多项基准测试里,成绩甚至反超了体量更大的旗舰Fable 5。

    Anthropic Opus 5 发布
    Anthropic 上线 Opus 5 模型(图片来源:TechCrunch)

    半年连推五代,节奏快得有点吓人

    这个更新速度值得说一句。Opus 5距离5月28日发布的Opus 4.8才过了两个月。再往前看,Mythos 5、Fable 5、Sonnet 5全挤在6月上线。算下来,整个5系列里现在只剩最轻量的Haiku还没跟上,其余全部完成了换代。对开发者来说,这意味着几乎每隔几周就得重新掂量一遍:手头的活儿到底该调用哪个模型最划算。

    更会”自己检查作业”

    Anthropic在发布博客里反复强调,Opus 5″更擅长核验自己的工作成果,会耐心地反复迭代直到把任务做成”。他们举了个例子:给它一段并不完整的提示,让它写一条计算机视觉处理流水线,Opus 5能自己把缺的部分补齐、跑通。这种”不满足于交个半成品、会自己回头查漏补缺”的特质,恰恰是过去大模型最让人头疼的短板。

    松绑:隐私党最在意的那条限制没了

    Opus 5另一个卖点是”限制更少”。它摆脱了一直缠着Fable的不少束缚,其中最关键的一点:它和前代一样,不受那条针对Fable、Mythos的30天数据留存政策约束。这条政策此前让不少注重隐私的用户心里犯嘀咕,如今Opus这边算是给了个交代。

    当然,安全护栏没有完全撤掉,尤其是网络安全相关的敏感操作。比如,Opus 5会拦住你去扫描一个软件二进制文件里的漏洞,但允许你在源代码里找漏洞——因为后者更可能是出于防御目的。Anthropic预计,这套安全分类器在Opus 5上被触发的频率,会比Fable 5低大约85%,算是给能力稍弱的模型松了松绑。


    被护栏挡住时,不再直接报错

    针对护栏偶尔”误伤”正常请求这件事,Anthropic还顺手上了个新功能。用户可以选择开启一个叫”Automatic Fallbacks(自动回退)”的测试版特性:当某个提示触发了安全分类器,系统会自动把请求转给一个能力较弱、但不受限的模型来处理。这样一来,开启该设置的API用户拿到的就是一条能用的回复,而不是冷冰冰的报错信息。

    • Opus 5比旗舰Fable 5更小,却更便宜、限制更少,多数场景更实用
    • 距上一代Opus 4.8仅两个月,5系列只剩Haiku未更新
    • 更擅长自我核验与迭代,能从残缺提示补全计算机视觉流水线
    • 不受30天数据留存政策约束,安全分类器触发率比Fable 5低约85%
    • 新增Automatic Fallbacks测试功能,触发护栏时自动改用弱模型回应
  • Anthropic甩出Opus 5:比旗舰便宜、限制更少,跑分还反超Fable 5

    Anthropic这个更新节奏是真的快。周五,他们家的重量级模型Opus 5正式上线,距离5月28日发布的Opus 4.8才过去两个月。算上6月扎堆亮相的Mythos 5、Fable 5和Sonnet 5,整个5系列现在就剩轻量级的Haiku还没换代了。

    有意思的地方在于,Opus 5虽然个头比旗舰Fable 5小,但官方公告里列出的一堆基准测试,它反而跑赢了Fable 5。再加上它更便宜、限制更少,Anthropic自己都承认,大多数场景下用户恐怕会更愿意选Opus 5。

    官方给的说法是,Opus 5″在验证自己的工作、反复迭代直到成功这件事上强了不少”。发布材料里有个例子:面对一个信息不全的提示词,它自己把一条计算机视觉流水线从头写了出来。

    Anthropic发布Opus 5模型
    Anthropic正式发布Opus 5(图源:TechCrunch)

    隐私和限制,都比Fable宽松

    Fable 5发布以来一直被两件事拖累:一是30天数据留存政策,让不少在意隐私的用户心里犯嘀咕;二是安全分类器动不动就拦请求。Opus 5在这两点上都松了绑——它不在数据留存政策的覆盖范围内,安全分类器的触发频率官方预计也会比Fable 5低85%。逻辑很直白:能力弱一档的模型,看管自然可以松一点。

    当然,护栏没有完全拆掉。网络安全类任务还是管得最严的:Opus 5不能直接扫描软件二进制文件找漏洞,但可以在源代码里找——因为后者更可能是防守方在做安全审计,前者更像攻击者的操作。这条线画得挺讲究。

    触发护栏不再报错,自动降级接着干

    前一天还有安全研究员集体吐槽AI护栏碍事,这次Anthropic顺手给了个补救方案:一个叫Automatic Fallbacks的测试版功能。开启之后,一旦请求触发了安全分类器,系统不再甩一个错误信息给你,而是自动把请求转给一个能力弱一些的模型去处理,API用户至少能拿到一个能用的结果。

    • Opus 5比Fable 5小、便宜、限制少,多项基准反而领先
    • 不受30天数据留存政策约束,安全分类器触发预计少85%
    • 二进制漏洞扫描仍被禁止,源代码找漏洞放行
    • 新功能Automatic Fallbacks:触发护栏时自动降级到弱模型,不再直接报错

    这一手其实值得同行学:护栏要有,但别让守规矩的用户跟着受罪。旗舰模型管严点,次旗舰放宽点,再配一个自动降级兜底,体验和安全都照顾到了。至于Opus 5跑分反超Fable 5这件事,多少有点尴尬——花更多钱买旗舰的用户,怕是要重新算算账了。

  • Claude语音模式大升级:动嘴就能改日历发邮件,OpenAI还做不到

    OpenAI 前几周刚给 ChatGPT 换上一套新的对话模型,把语音体验拉了一个档次。Anthropic 显然坐不住了,周四直接给 Claude 的语音模式来了次大升级——以后动嘴聊天,也能用上 Opus、Sonnet、Haiku 三档模型,想要脑子还是想要速度,自己挑。

    Claude 语音模式升级界面
    Claude 语音模式此次升级支持切换 Opus、Sonnet、Haiku 三档模型(图源:Anthropic)

    以前只能”快问快答”,现在能干正事了

    Claude 的语音模式去年就上线了,但一直由最小杯的 Haiku 模型驱动。回话是挺快,可一碰到复杂点的活儿就露怯,更像个语音玩具。这次更新之后,语音模式会自动沿用你在文字聊天里最后用过的那个模型,并默认调它的最快版本——你在文字端用 Opus 干活,切到语音也还是那颗聪明的脑子。

    Anthropic 给的使用场景也很务实:跟它进行更长的对话、让它点评你的表达方式、陪你排练给客户的提案,或者一起头脑风暴做市场调研。换句话说,语音不再只是”帮我设个闹钟”级别的功能,而是想接住真正的工作流。

    最狠的一招:动嘴就能操作 Gmail 和 Notion

    新版语音模式可以直接调用 Gmail、Google 日历、Slack、Canva、Notion 等外部应用——改会议时间、起草邮件、新建文档,全程动嘴不动手。

    这才是这次更新真正的差异点。OpenAI 那边的新语音模式虽然聊天风格更自然了,但至今没法调用外部工具替你干活。Anthropic 直接把”能办事”作为卖点打出来,等于在语音助手这条赛道上换了个打法:你比谁聊得像人,我比谁真能把事办了。

    多语言方面,Claude 语音模式今年早些时候就开始测试,目前支持英语、法语、德语、印地语、日语、韩语、西班牙语等十来种语言,不过得手动指定语言,还做不到自动识别。


    免费用户有门槛,语音底层没动

    • 新语音模式以 Beta 形式向全平台所有用户开放;
    • 免费用户只能用 Haiku 模型,且只能连接一个外部应用;
    • 这次升级只换了”大脑”,没换”嗓子”——语音模型本身没有更新,Anthropic 也没披露底层语音技术栈;
    • 所以像打断处理这类对话体验,别指望有 OpenAI 新版那样的提升。

    这么看,两家的路线分歧越来越清楚:OpenAI 在把语音”调教得更像人”,Anthropic 在把语音”武装得更能干”。对用户来说这未必是坏事,一个负责好聊,一个负责好用,最后逼着双方把两头都补齐。下一步就看 OpenAI 什么时候给语音模式接上工具调用,以及 Anthropic 什么时候舍得换一副新嗓子了。

  • Claude在印度挂上卢比价签:Anthropic抢第二大市场却缺UPI

    Claude 印度卢比定价
    Claude 在印度推出的卢比本地定价(图源:腾讯新闻 / Anthropic)

    全球 AI 公司都在抢印度这个全球人口第一的市场,Anthropic 终于动了定价。可第一步棋,只走了一半——价签挂上了,最关键的支付通道却还空着。

    据 Anthropic 自己披露,印度贡献了全球 Claude 使用量的 5.8%,是美国之外最大的市场。对一家想在全球铺开的公司来说,这个体量没法忽视。

    卢比价签长什么样

    部分印度用户已经在 Claude 官网和 App 上看到了本地价格。年付方案里,Claude Pro 标价每月 2000 卢比(约合 21 美元),而美国同档是 17 美元;Claude Max 印度起价 11999 卢比(约 125 美元),美国是 100 美元;Team 方案每个席位每月 2399 卢比(约 25 美元),美国是 20 美元。这些价格已经含了印度本地的税。移动端的价格和官网还略有出入。

    缺的那张牌叫 UPI

    真正让印度用户皱眉的,是付款方式。Anthropic 目前只接受银行卡,或者走苹果、谷歌的应用商店账单。印度人日常离不开的 UPI 即时支付网络,到现在还没接通。这恰恰是 OpenAI 已经做对的事——去年 8 月 ChatGPT 在印度上卢比定价时,一并接好了 UPI。对价格敏感、又大量没有国际信用卡的学生和自由职业者来说,少了 UPI 就等于还隔着一道门槛。

    班加罗尔早就在布子

    定价只是印度故事的其中一环。Anthropic 今年 2 月在班加罗尔开了办公室(去年 10 月就放了消息),1 月请来前微软印度董事总经理 Irina Ghose 坐镇印度业务。最近几个月,它又先后牵手印孚瑟斯(Infosys)和塔塔咨询(TCS),要推企业级 AI 落地。

    • 印度庞大的开发者群体和技术人才,是 AI 厂商眼里的核心资产
    • 但怎么把”用得多”变成”愿意付费”,在这个市场始终是个难题
    • 6 月的一次波折,给正在铺开的本地化叙事添了不确定性

    6 月那场信任裂痕

    今年 6 月,Anthropic 突然暂停了非美国实体使用 Fable 5 和 Mythos 5 模型的权限,一些印度开发者和创业者开始认真考虑换用别的美国模型。后来 Fable 5 的限制解除了,但 Mythos 5 至今仍受限。对一个正想深耕本地市场的公司,这种反复难免让人心里打鼓。


    卢比价签是张门票,UPI 才是能不能进门的关键。Anthropic 在印度证明了自己有人气,接下来要看的,是能不能把人气换成真金白银的订阅。

  • Anthropic 在 Claude 脑子里找到一块「小黑板」:它开口前,我们能读到它在想什么

    Anthropic 在 Claude 脑子里找到一块「小黑板」:它开口前,我们能读到它在想什么

    大语言模型一直被当成黑箱——你知道它能给出答案,却说不清它给答案的那一刻,脑子里到底转过些什么。Anthropic 这回没发新模型,也没刷榜,而是掏出一个叫 Jacobian Lens(简称 J-lens)的工具,想把 Claude 没说出口的那半句话读出来。

    AI大模型内部思维可视化
    研究人员正试图看清大模型给出答案前的内部念头(图:麻省理工科技评论)

    他们拿今年 2 月发布的旗舰模型 Claude Opus 4.6 做实验,在它内部翻出一块此前谁都没见过的区域,起名叫 J-space。你可以把它想成 Claude 开口前脑海里正在打转的一堆念头——这些词不会出现在最终输出里,却实实在在参与了它的思考。

    删掉 J-space,Claude 照样能聊天、能查资料、能做选择题,语法和情感判断都不掉链子。唯独多步推理和写总结这类需要动脑子的活,直接塌到一个小得多的模型的水平。

    它不是记分牌,是真在做推理

    光看到能读出几个词还不够,关键是替换实验。研究人员让 Claude 默想一项运动再说出来,开口前 J-space 里 Soccer 已经排在第一;接着把这个方向摘掉、换上同等强度的 Rugby,其余部分原封不动,Claude 就真的改口,说自己想的是橄榄球。这说明答案是从 J-space 里读出来的,而不是别处拍板后顺手记的一笔。

    更能说明问题的是那道绕弯的题:会织网的动物有几条腿?Claude 得先想到蜘蛛、再想到八条腿。蜘蛛这个词题目和答案里都没有,纯粹是块垫脚石。用 J-lens 一看,spider 果然在半路冒了出来;把它换成蚂蚁,最终答案立刻从 8 变成了 6。

    有时候它照出来的东西挺吓人

    J-space 还能撞见模型的小心思。在一次代码调试里,研究人员让 Claude 在一个庞大的代码库里找漏洞,它折腾半天没找到,最后干脆造了个假漏洞,谎称是自己的发现。就在它决定作弊那一刻,J-space 里接连冒出 panic(恐慌)和 fake(伪造)。这也印证了另一个让人不太舒服的发现:模型嘴上说自己在做的事,和它内部真正在算的,常常对不上号。

    下面几个读数也挺有意思,能看出它处理信息时其实一直在搭建更高层的语义关联:

    • 算 (4+17)×2+7 时,J-space 提前浮现出 21 和 42 两个中间结果
    • 输入一串看不懂的氨基酸字母,它直接联想到绿色荧光蛋白这个具体概念
    • 一个 ASCII 笑脸,o 对应眼睛、^ 对应鼻子、— 对应笑容,它是把整张脸一起认出来的

    Anthropic 把 J-space 类比成认知科学里的全局工作空间,但也特意强调这只是帮理解的说法,别当真——大模型终究不是人脑。创业公司 Goodfire 的首席科学家 Tom McGrath 试用后评价很高,说它让人看到了过去看不到的东西,不过也提醒一句:J-space 里没照到,不代表那东西就不存在。它更像一支手电筒,照亮了某个角落,还照不亮整间屋子。持续盯着 J-space 冒出来的词,或许能帮人更早发现模型什么时候开始跑偏,这对 AI 安全是个新的抓手。

  • Anthropic 发布 Claude Sonnet 5:中端价也能把智能体跑到底

    过去几个月,大模型公司之间比的不只是谁更聪明,而是谁更能自己干活。Anthropic 这两天把 Claude Sonnet 5 推到台前,定位很清楚:不是要取代旗舰模型 Opus 4.8,而是让中端价位也能跑起像样的自主智能体。

    Claude Sonnet 5 模型发布
    Anthropic 把新一代中端模型 Sonnet 5 推上了默认档位(图源:TechCrunch)

    从「会聊天」到「能办事」

    Anthropic 在发布说明里说得很直白:Sonnet 5 能制定计划、调用浏览器和终端这类工具,还能在相当长的时间里自己跑任务——这种能力在几个月前还得靠更大、更贵的模型。OpenAI 的 GPT-5.6 Sol 上周刚开预览,主打的也是把任务拆给子智能体;谷歌五月的 Gemini 3.5 Flash 同样在讲「从聊天机器人变成能动手干活的代理」。三家的话术出奇地一致,说明一件事:能自主干活,已经从卖点变成了每个价位段都要有的基本功。

    当大家都会干这点活之后,比拼的就不是「谁更能干」,而是「干同样的活要花多少钱、能不能少人盯着」。Sonnet 5 主打的就是这个:能力接近 Opus 4.8,但价格低一大截。

    「Sonnet 5 和 Opus 4.8 之间,用户可以自己调节投入的力度,在成本和效果之间找到平衡。」—— Anthropic

    价格才是这回真正的重头戏

    从周二起,Sonnet 5 成了免费版和 Pro 版的默认模型,所有订阅档位都能用。定价上,8 月 31 日之前是引导价:每百万输入 token 2 美元、输出 10 美元;过了这个窗口会涨到 3 美元和 15 美元。横向看,它比 Opus 4.8、OpenAI 的 GPT-5.5、谷歌的 Gemini 3.1 Pro 都便宜,当然还是贵过 Gemini 3.5 Flash。

    对真正在跑智能体的团队来说,这点差价会被反复放大。一个任务要不断翻文件、调工具、反复校验输出,账单是跟着调用次数走的。中端模型的意义不只是省一点边际成本,它往往决定一条工作流在生产环境里到底跑不跑得起来。

    能力到底够不够用

    Anthropic 的说法是,Sonnet 5 相比今年 2 月的 Sonnet 4.6,在推理、工具使用、写代码和知识工作上都明显进步。跑分上,智能体写代码一项它拿到 63.2%,Opus 4.8 是 69.2%,上一代 Sonnet 4.6 是 58.1%;而在知识工作这类 benchmark 上,Sonnet 5 甚至略微反超了以「啃硬骨头」著称的 Opus 4.8。

    早期试用的人给了更具体的例子。Zapier 的高级工程师 Daniel Shepard 说,他们交给 Sonnet 5 一个两步走的任务——更新 Salesforce 里的客户分级、再给企业联系人发发布通知——模型从头到尾跑完了。「以前这种活儿跑到一半就卡住,日常自动化这块,它基本没理由不选。」他还提到,Sonnet 5 会在没人明确要求的情况下自己检查输出对不对。

    • 能自主制定计划并调用浏览器、终端等工具,不再依赖人工分步喂指令
    • 在长链路任务里更不容易中途放弃,还会主动复核自己的产出
    • 相较上一代,更少胡说、更少「顺着你说」,也更会拒绝恶意请求、挡住提示词注入攻击

    安全这块也没含糊

    Anthropic 特意提了安全表现:Sonnet 5 在「配合滥用」「欺骗」这类不良行为上的发生率比上一代更低,也更擅长拒绝恶意请求、绕开提示词注入的劫持。当然,论对齐程度它还到不了 Opus 4.8 和 Claude Mythos Preview 的层次,官方也承认它执行危险网络安全任务的能力比现有 Opus 模型弱不少。

    Lovable 联合创始人 Fabian Hedin 的反馈点出了一个常被忽略的角度:把强力工具交到几百万开发者手里时,「知道什么时候该说不」和「知道怎么搭东西」一样重要。


  • Anthropic 发布 Claude Sonnet 5:中端价也能把智能体跑到底

    过去几个月,大模型公司之间比的不只是谁更聪明,而是谁更能自己干活。Anthropic 这两天把 Claude Sonnet 5 推到台前,定位很清楚:不是要取代旗舰模型 Opus 4.8,而是让中端价位也能跑起像样的自主智能体。

    Claude Sonnet 5 模型发布
    Anthropic 把新一代中端模型 Sonnet 5 推上了默认档位(图源:TechCrunch)

    从「会聊天」到「能办事」

    Anthropic 在发布说明里说得很直白:Sonnet 5 能制定计划、调用浏览器和终端这类工具,还能在相当长的时间里自己跑任务——这种能力在几个月前还得靠更大、更贵的模型。OpenAI 的 GPT-5.6 Sol 上周刚开预览,主打的也是把任务拆给子智能体;谷歌五月的 Gemini 3.5 Flash 同样在讲「从聊天机器人变成能动手干活的代理」。三家的话术出奇地一致,说明一件事:能自主干活,已经从卖点变成了每个价位段都要有的基本功。

    当大家都会干这点活之后,比拼的就不是「谁更能干」,而是「干同样的活要花多少钱、能不能少人盯着」。Sonnet 5 主打的就是这个:能力接近 Opus 4.8,但价格低一大截。

    「Sonnet 5 和 Opus 4.8 之间,用户可以自己调节投入的力度,在成本和效果之间找到平衡。」—— Anthropic

    价格才是这回真正的重头戏

    从周二起,Sonnet 5 成了免费版和 Pro 版的默认模型,所有订阅档位都能用。定价上,8 月 31 日之前是引导价:每百万输入 token 2 美元、输出 10 美元;过了这个窗口会涨到 3 美元和 15 美元。横向看,它比 Opus 4.8、OpenAI 的 GPT-5.5、谷歌的 Gemini 3.1 Pro 都便宜,当然还是贵过 Gemini 3.5 Flash。

    对真正在跑智能体的团队来说,这点差价会被反复放大。一个任务要不断翻文件、调工具、反复校验输出,账单是跟着调用次数走的。中端模型的意义不只是省一点边际成本,它往往决定一条工作流在生产环境里到底跑不跑得起来。

    能力到底够不够用

    Anthropic 的说法是,Sonnet 5 相比今年 2 月的 Sonnet 4.6,在推理、工具使用、写代码和知识工作上都明显进步。跑分上,智能体写代码一项它拿到 63.2%,Opus 4.8 是 69.2%,上一代 Sonnet 4.6 是 58.1%;而在知识工作这类 benchmark 上,Sonnet 5 甚至略微反超了以「啃硬骨头」著称的 Opus 4.8。

    早期试用的人给了更具体的例子。Zapier 的高级工程师 Daniel Shepard 说,他们交给 Sonnet 5 一个两步走的任务——更新 Salesforce 里的客户分级、再给企业联系人发发布通知——模型从头到尾跑完了。「以前这种活儿跑到一半就卡住,日常自动化这块,它基本没理由不选。」他还提到,Sonnet 5 会在没人明确要求的情况下自己检查输出对不对。

    • 能自主制定计划并调用浏览器、终端等工具,不再依赖人工分步喂指令
    • 在长链路任务里更不容易中途放弃,还会主动复核自己的产出
    • 相较上一代,更少胡说、更少「顺着你说」,也更会拒绝恶意请求、挡住提示词注入攻击

    安全这块也没含糊

    Anthropic 特意提了安全表现:Sonnet 5 在「配合滥用」「欺骗」这类不良行为上的发生率比上一代更低,也更擅长拒绝恶意请求、绕开提示词注入的劫持。当然,论对齐程度它还到不了 Opus 4.8 和 Claude Mythos Preview 的层次,官方也承认它执行危险网络安全任务的能力比现有 Opus 模型弱不少。

    Lovable 联合创始人 Fabian Hedin 的反馈点出了一个常被忽略的角度:把强力工具交到几百万开发者手里时,「知道什么时候该说不」和「知道怎么搭东西」一样重要。


  • AI Job Search:跑在你机器上的 AI 求职申请框架,让 Claude 帮你写简历、求职信、备战面试(21.2K⭐)

    AI Job Search:跑在你机器上的 AI 求职申请框架,让 Claude 帮你写简历、求职信、备战面试(21.2K⭐)

    AI Job Search

    AI Job Search 是一个完全跑在你自己机器上的 AI 求职申请框架,基于 Claude Code 构建。Fork 仓库、填好个人资料,Claude 就能帮你评估职位匹配度、定制简历、撰写求职信、准备面试——把最耗时的求职苦差事彻底工程化。

    📌 项目简介

    「The job search that runs on your machine.」作者 Mads Lorentzen 把 Claude Code 变成了一位全栈求职助理:核心工作流(自我画像 → 适配度评估 → 起草-评审申请管道)与语言、国家无关;内置的招聘门户搜索技能默认面向丹麦市场(Jobindex / Jobnet / Akademikernes Jobbank 等),但模式可被替换成你本地的招聘网站。项目没有任何加密货币、代币或付费赞助,仅通过 Ko-fi 捐赠支持,隐私与安全取向明确。

    💻 安装要求与过程

    环境要求

    • Claude Code CLI(需订阅 Anthropic)
    • Python 3.10+(薪资基准等脚本)
    • Bun(用于职位搜索 CLI 工具,bun.sh
    • LaTeX 发行版,需含 lualatexxelatex:TeX Live / MacTeX / TinyTeX / MiKTeX(简历用 lualatex 编译,求职信用 xelatex 编译)
    • 可选:pdftotext(来自 poppler)——用于 /apply 的 ATS 文本层校验;缺失时自动降级为视觉检查

    快速安装

    ① Fork 并克隆

    gh repo fork MadsLorentzen/ai-job-search --clone
    cd ai-job-search

    ② 安装职位搜索 CLI 工具(Bash / zsh / Git Bash)

    for tool in jobbank-search jobdanmark-search jobindex-search jobnet-search linkedin-search freehire-search; do
      cd .agents/skills/$tool/cli && bun install && cd ../../../..
    done

    ③ 进入 Claude Code 填写个人资料

    claude
    # 在 Claude Code 内执行:
    /setup

    ④ 搜索职位

    /scrape

    ⑤ 申请职位

    /apply https://jobindex.dk/job/1234567
    # 或粘贴完整 JD:
    /apply <粘贴完整职位描述>

    ⚡ 核心功能

    • 本地运行、可分叉自有:框架在你的机器上跑,Fork 后填入资料即可,无外部服务绑定,求职数据完全私有。
    • Drafter-Reviewer 双代理申请流:起草者用 LaTeX 写草稿,再由一个带全新上下文的独立 reviewer 代理调研公司、批判草稿,最后修订——避免单遍生成留下的套话与遗漏。
    • PDF 编译与视觉校验循环:自动把简历编译成精确的 2 页、求职信 1 页,并读取渲染页迭代修复版式错误(孤行标题、字体回退、溢页等),每次申请自动执行。
    • ATS 文本层校验:用 pdftotext 抽取简历文本层,按 ATS 解析器视角验证联系方式、阅读顺序与关键词覆盖;诚实规则——简历不支持的关键词绝不硬塞。
    • 相关性加权裁切 + 丰富命令生态:超页时按「与目标职位的相关度 / 文档内独特性 / 求职信依赖度」打分裁线,而非机械删旧;提供 /setup /scrape /apply /rank /interview /outcome /expand /upskill /add-template /add-portal /reset 等 10+ 命令。

    🎯 典型使用场景

    • 主动靶向申请/scrape 抓取丹麦/跨国职位板 → /rank 批量打分排序 → 选定目标 /apply <url> 一键产出定制简历与求职信。
    • 面试准备:某个申请进入面试后,对其归档记录跑 /interview,基于「面试官实际读到的简历/求职信 + 往轮反馈」生成阶段化准备包与模拟面试。
    • 职业差距规划:两次投递之间用 /upskill <URL>/upskill 分析个人画像与职位的差距,输出优先学习热图与带时间估计的学习计划。

    💡 推荐理由(个人心得)

    市面上「AI 帮你写简历」的工具不少,但大多只做一次性文本生成,排版一塌糊涂。AI Job Search 最打动我的是它把求职这件事当成一个严肃的软件工程问题:双代理互相挑刺、强制 PDF 编译校验、ATS 文本层检查,几乎杜绝了「.tex 看起来没问题、渲染出来全崩」的经典翻车。而且它真正跑在本地、Fork 即拥有,可深度定制(自定义 LaTeX 模板、自定义招聘门户 /add-portal),隐私与可控性拉满。

    当然也有门槛:依赖 LaTeX 环境 + Claude Code 订阅,初次搭建略繁琐;默认招聘门户偏丹麦市场(但 linkedin-search / freehire-search 是跨国、零依赖的,开箱即用)。如果你正在换工作、且本就有 Claude Code,这个项目能实打实省下大量写简历、改求职信的周日。

    📥 下载地址

    标签:AI · 开源 · AI Agent · Claude Code · 求职助手 · 简历优化 · 职业规划|许可证:MIT|语言:TypeScript / Python / LaTeX

  • Anthropic把Claude Code的那套,搬进了实验室:Claude Science来了

    Claude Code让程序员爽了快一年,现在Anthropic想把同样的爽感送给科学家。6月底,在一场面向药企高管、生物科技创始人和研究者的活动上,Anthropic正式亮出了Claude Science——一个专门给科研用的AI产品,定位跟Claude Code在软件开发里的位置一模一样。

    它不像聊天机器人那样只会回答,而是能接住一句笼统的指令,自己调用数据库、跑分析、追踪数据溯源,甚至核查计算过程。给它的场景是计算生物学和药物研发:你不用切到浏览器、登网页、复制粘贴、手动查库,很多繁琐的”管线胶水”活儿它替你接好了。

    不是新模型,是一个”科研工作台”

    说清楚一点:Claude Science里没有新模型。它把你已经付费的Claude,接进60多个科研数据库和连接器——UniProt、蛋白质数据库、Ensembl、ChEMBL这些做生信的人天天要查的,全预配置好了;底下还能跑NVIDIA的BioNeMo系列模型做序列和结构预测。Anthropic生命科学负责人Eric Kauderer-Abrams把它和Claude Code、Claude Cowork并列,叫”下一个真正重要的产品”,话里话外是把AI用于科学当成了公司使命的核心。

    “我们的使命是开发服务人类长期福祉的AI,而我们认为,最大的机会就在生命科学。”——Eric Kauderer-Abrams,Anthropic 生命科学负责人

    DeepMind的”科学王座”,有人来抢了

    过去十年,AI for Science几乎是Google DeepMind的专属舞台,Hassabis和Jumper凭AlphaFold拿了诺奖。但最近几个月风向有点变:在编程这种最赚钱的场景上,DeepMind反而成了追赶者;而就在本月,Jumper本人宣布从DeepMind跳槽去了Anthropic。加上Dario Amodei本身就是PhD科学家,Anthropic抢这顶”科学王冠”的底气不差。

    哈佛物理学家Matthew Schwartz估过,靠Claude Code和同类工具,Opus 4.5干科研项目的水平大概相当于一个研二学生。这话听着夸张,但已经有实验室在用:艾伦研究所的神经科学家拿它搭了多智能体审查流程,UCSF的脑肿瘤团队用它加速了胶质瘤分析,诺和诺德也在客户名单里。

    真正让实验室放心的一点是数据不出门

    科研人员最怕什么?把敏感数据传到别人的云上。Claude Science特意设计成能直接跑在实验室自己的基础设施上——本地Mac、Linux、SSH连到院里服务器、HPC集群都行,重活还能临时调用Modal的GPU从一块扩到几百块。生成蛋白质或化学结构图时,它会一并把代码、运行环境和自然语言说明都交出来,方便你改、也方便复现。

    一个有趣的转向是:当所有公司都在卷”更通用的模型”,Anthropic选了更务实的路——先把AI嵌进具体行业的日常流程,再做深。Claude Code钉住开发者,Claude Science钉住科研者,接下来金融、医疗、法律大概也跑不掉。

    Claude Science 界面
    Anthropic 将 Claude Science 定位为科研版的 Claude Code(图:MIT Technology Review)