标签: AI

  • Anthropic 发布 Claude Sonnet 5:中端价也能把智能体跑到底

    过去几个月,大模型公司之间比的不只是谁更聪明,而是谁更能自己干活。Anthropic 这两天把 Claude Sonnet 5 推到台前,定位很清楚:不是要取代旗舰模型 Opus 4.8,而是让中端价位也能跑起像样的自主智能体。

    Claude Sonnet 5 模型发布
    Anthropic 把新一代中端模型 Sonnet 5 推上了默认档位(图源:TechCrunch)

    从「会聊天」到「能办事」

    Anthropic 在发布说明里说得很直白:Sonnet 5 能制定计划、调用浏览器和终端这类工具,还能在相当长的时间里自己跑任务——这种能力在几个月前还得靠更大、更贵的模型。OpenAI 的 GPT-5.6 Sol 上周刚开预览,主打的也是把任务拆给子智能体;谷歌五月的 Gemini 3.5 Flash 同样在讲「从聊天机器人变成能动手干活的代理」。三家的话术出奇地一致,说明一件事:能自主干活,已经从卖点变成了每个价位段都要有的基本功。

    当大家都会干这点活之后,比拼的就不是「谁更能干」,而是「干同样的活要花多少钱、能不能少人盯着」。Sonnet 5 主打的就是这个:能力接近 Opus 4.8,但价格低一大截。

    「Sonnet 5 和 Opus 4.8 之间,用户可以自己调节投入的力度,在成本和效果之间找到平衡。」—— Anthropic

    价格才是这回真正的重头戏

    从周二起,Sonnet 5 成了免费版和 Pro 版的默认模型,所有订阅档位都能用。定价上,8 月 31 日之前是引导价:每百万输入 token 2 美元、输出 10 美元;过了这个窗口会涨到 3 美元和 15 美元。横向看,它比 Opus 4.8、OpenAI 的 GPT-5.5、谷歌的 Gemini 3.1 Pro 都便宜,当然还是贵过 Gemini 3.5 Flash。

    对真正在跑智能体的团队来说,这点差价会被反复放大。一个任务要不断翻文件、调工具、反复校验输出,账单是跟着调用次数走的。中端模型的意义不只是省一点边际成本,它往往决定一条工作流在生产环境里到底跑不跑得起来。

    能力到底够不够用

    Anthropic 的说法是,Sonnet 5 相比今年 2 月的 Sonnet 4.6,在推理、工具使用、写代码和知识工作上都明显进步。跑分上,智能体写代码一项它拿到 63.2%,Opus 4.8 是 69.2%,上一代 Sonnet 4.6 是 58.1%;而在知识工作这类 benchmark 上,Sonnet 5 甚至略微反超了以「啃硬骨头」著称的 Opus 4.8。

    早期试用的人给了更具体的例子。Zapier 的高级工程师 Daniel Shepard 说,他们交给 Sonnet 5 一个两步走的任务——更新 Salesforce 里的客户分级、再给企业联系人发发布通知——模型从头到尾跑完了。「以前这种活儿跑到一半就卡住,日常自动化这块,它基本没理由不选。」他还提到,Sonnet 5 会在没人明确要求的情况下自己检查输出对不对。

    • 能自主制定计划并调用浏览器、终端等工具,不再依赖人工分步喂指令
    • 在长链路任务里更不容易中途放弃,还会主动复核自己的产出
    • 相较上一代,更少胡说、更少「顺着你说」,也更会拒绝恶意请求、挡住提示词注入攻击

    安全这块也没含糊

    Anthropic 特意提了安全表现:Sonnet 5 在「配合滥用」「欺骗」这类不良行为上的发生率比上一代更低,也更擅长拒绝恶意请求、绕开提示词注入的劫持。当然,论对齐程度它还到不了 Opus 4.8 和 Claude Mythos Preview 的层次,官方也承认它执行危险网络安全任务的能力比现有 Opus 模型弱不少。

    Lovable 联合创始人 Fabian Hedin 的反馈点出了一个常被忽略的角度:把强力工具交到几百万开发者手里时,「知道什么时候该说不」和「知道怎么搭东西」一样重要。


  • Anthropic 发布 Claude Sonnet 5:中端价也能把智能体跑到底

    过去几个月,大模型公司之间比的不只是谁更聪明,而是谁更能自己干活。Anthropic 这两天把 Claude Sonnet 5 推到台前,定位很清楚:不是要取代旗舰模型 Opus 4.8,而是让中端价位也能跑起像样的自主智能体。

    Claude Sonnet 5 模型发布
    Anthropic 把新一代中端模型 Sonnet 5 推上了默认档位(图源:TechCrunch)

    从「会聊天」到「能办事」

    Anthropic 在发布说明里说得很直白:Sonnet 5 能制定计划、调用浏览器和终端这类工具,还能在相当长的时间里自己跑任务——这种能力在几个月前还得靠更大、更贵的模型。OpenAI 的 GPT-5.6 Sol 上周刚开预览,主打的也是把任务拆给子智能体;谷歌五月的 Gemini 3.5 Flash 同样在讲「从聊天机器人变成能动手干活的代理」。三家的话术出奇地一致,说明一件事:能自主干活,已经从卖点变成了每个价位段都要有的基本功。

    当大家都会干这点活之后,比拼的就不是「谁更能干」,而是「干同样的活要花多少钱、能不能少人盯着」。Sonnet 5 主打的就是这个:能力接近 Opus 4.8,但价格低一大截。

    「Sonnet 5 和 Opus 4.8 之间,用户可以自己调节投入的力度,在成本和效果之间找到平衡。」—— Anthropic

    价格才是这回真正的重头戏

    从周二起,Sonnet 5 成了免费版和 Pro 版的默认模型,所有订阅档位都能用。定价上,8 月 31 日之前是引导价:每百万输入 token 2 美元、输出 10 美元;过了这个窗口会涨到 3 美元和 15 美元。横向看,它比 Opus 4.8、OpenAI 的 GPT-5.5、谷歌的 Gemini 3.1 Pro 都便宜,当然还是贵过 Gemini 3.5 Flash。

    对真正在跑智能体的团队来说,这点差价会被反复放大。一个任务要不断翻文件、调工具、反复校验输出,账单是跟着调用次数走的。中端模型的意义不只是省一点边际成本,它往往决定一条工作流在生产环境里到底跑不跑得起来。

    能力到底够不够用

    Anthropic 的说法是,Sonnet 5 相比今年 2 月的 Sonnet 4.6,在推理、工具使用、写代码和知识工作上都明显进步。跑分上,智能体写代码一项它拿到 63.2%,Opus 4.8 是 69.2%,上一代 Sonnet 4.6 是 58.1%;而在知识工作这类 benchmark 上,Sonnet 5 甚至略微反超了以「啃硬骨头」著称的 Opus 4.8。

    早期试用的人给了更具体的例子。Zapier 的高级工程师 Daniel Shepard 说,他们交给 Sonnet 5 一个两步走的任务——更新 Salesforce 里的客户分级、再给企业联系人发发布通知——模型从头到尾跑完了。「以前这种活儿跑到一半就卡住,日常自动化这块,它基本没理由不选。」他还提到,Sonnet 5 会在没人明确要求的情况下自己检查输出对不对。

    • 能自主制定计划并调用浏览器、终端等工具,不再依赖人工分步喂指令
    • 在长链路任务里更不容易中途放弃,还会主动复核自己的产出
    • 相较上一代,更少胡说、更少「顺着你说」,也更会拒绝恶意请求、挡住提示词注入攻击

    安全这块也没含糊

    Anthropic 特意提了安全表现:Sonnet 5 在「配合滥用」「欺骗」这类不良行为上的发生率比上一代更低,也更擅长拒绝恶意请求、绕开提示词注入的劫持。当然,论对齐程度它还到不了 Opus 4.8 和 Claude Mythos Preview 的层次,官方也承认它执行危险网络安全任务的能力比现有 Opus 模型弱不少。

    Lovable 联合创始人 Fabian Hedin 的反馈点出了一个常被忽略的角度:把强力工具交到几百万开发者手里时,「知道什么时候该说不」和「知道怎么搭东西」一样重要。


  • Strix:让 AI 当黑客,自动找出并修复你应用的真实漏洞(40.8K Stars)

    Strix:让 AI 当黑客,自动找出并修复你应用的真实漏洞(40.8K Stars)

    Strix 封面

    一句话先说清楚:Strix 是一个开源的自主 AI 渗透测试智能体(Autonomous AI Pentesting Agents)。它不像传统扫描器那样丢给你一堆“可能存在风险”的噪音告警,而是真的会动态跑起你的代码、模拟攻击者思维去打、再用可验证的 PoC 证明漏洞确实存在——最后还顺手把补丁和报告给你写了。

    项目简介

    usestrix/strix,Apache-2.0 协议,纯 Python 写就,目前在 GitHub 上已经 4 万+ Stars,连续多周霸榜 Trending。它的定位很直白:把“请安全公司做一次渗透测试”这件事,从“几万块、等几周”,变成“一条命令、几分钟”。它支持本地代码库、GitHub 仓库、线上应用三种目标模式,也能多目标并行扫描。

    安装要求和过程

    Strix 的依赖极其克制,你只需要两样东西:

    • 一个正在运行的 Docker(首次运行自动拉取沙箱镜像,把攻击行为关在隔离环境里);
    • 一个任意主流 LLM 的 API Key(OpenAI / Anthropic / Google 都行,底层走 LiteLLM)。

    安装就一行:

    curl -sSL https://strix.ai/install | bash

    配置好供应商和目标,开跑:

    export STRIX_LLM="openai/gpt-5.4"
    export LLM_API_KEY="your-api-key"
    strix --target ./app-directory

    首次运行会自动拉取沙箱 Docker 镜像,结果全部落进 strix_runs/<run-name>。如果你是 Windows,注意它本质是个 Python 包 + Docker,建议走 WSL2,别在原生 CMD 里硬刚。

    核心功能

    1. 真实漏洞验证,拒绝误报——这是它和传统扫描器最大的区别。Strix 会实际构造攻击载荷、命中、再生成可复现的 PoC 代码,只报“已被验证”的漏洞。传统工具 60-80% 的误报率,在这里被砍掉了。

    2. 多智能体协同的“红队”——侦察 Agent 画攻击面地图,注入测试 Agent 专攻 SQL/命令注入,权限提升 Agent 测越权与认证绕过,前端 Agent 查 XSS/CSRF。它们并行工作、互相共享线索,像一支真实的安全团队。

    3. 覆盖 OWASP Top 10 全栈——越权、注入、服务端/客户端攻击、业务逻辑缺陷、认证与会话、基础设施/云、API 安全,一锅端。

    4. 自动修复 + 合规报告——不光告诉你哪儿漏了,还生成补丁和合规报告。开发者优先的 CLI,每条发现都带修复指导。

    5. 代理式工具箱——内置 HTTP 拦截代理(Caido)、浏览器利用、Shell 执行、自定义利用运行时、侦察/OSINT、静态/动态分析、漏洞知识库。

    典型使用场景

    场景一:开发流程里的“安全卡点”
    把 Strix 接进 CI/CD。每次 PR 合并前跑一遍 strix -n --target ./ --scan-mode quick,上线前自动兜底。这是它最实用的姿势——让安全从“上线后救火”变成“开发时拦截”,修复成本直接降一个数量级。

    Strix 演示截图

    场景二:Bug Bounty 自动化
    独立安全研究员用它批量扫目标、自动出 PoC。配合 --target-list ./targets.txt 多目标并行,把重复劳动交给 AI,自己专注高价值的逻辑漏洞挖掘。

    场景三:黑盒 Web 应用快速体检
    strix --target https://your-app.com,通过 --instruction 给自然语言指令(比如“用 user:pass 做认证测试”),AI 会像红队一样从外往里打,几分钟出一份带证据的安全评估。

    推荐理由

    我挺吃 Strix 这套“用 AI 模拟真实黑客”的思路。过去做安全,要么花钱请人、要么自己扛一堆误报告警大海捞针。Strix 把“验证”这件事做在了前面——它不拿签名库糊弄你,而是真跑、真打、真证明。多智能体架构也比单 Agent 更像人,侦察-利用-后利用的链条能自动衔接。

    当然,也得泼盆冷水:它目前还很“Alpha”,社区里有资深安全研究员指出它的提示模板还偏基础,跟顶级商业工具比仍有差距;AI 的扫描结果必须人工复核,且绝对不能拿去打未授权目标。但作为开发自测、CI 卡点和学习红队思维的开源玩具,它已经足够香,而且免费、可商用(Apache-2.0)。

    ⚠️ 安全声明:Strix 仅可用于你拥有授权的目标。运行前务必隔离环境,防止模型抽风导致密钥或数据泄露。

    下载地址

  • OpenClaw 终于上手机了:开源 AI 智能体装进你的口袋

    开源 AI 智能体 OpenClaw 登陆手机概念图
    OpenClaw 推出官方手机 App,把开源 AI 智能体带进了口袋

    今年年初,一个叫 OpenClaw 的开源 AI 智能体在网上火得一塌糊涂。它能帮你写代码、订外卖、整理日程,甚至有人拿它搞出了个号称”全是 Agent”的社交网站。6 月 30 日,它的开发者在 X 上宣布:OpenClaw 现在有了 iOS 和安卓的官方 App。那只在网上横着走的”龙虾”,爬进你的手机了。

    手机不是又一个聊天框

    市面上绝大多数 AI 手机应用,逻辑都差不多:你说话,它回答,手机就是个听筒。OpenClaw 走的是另一条路。它的核心是一套跑在你自己机器上的 Gateway(网关),负责把你的请求路由给各种 Agent,以及这些 Agent 要调用的工具和技能。手机端不是一个新界面,而是一个”伴生节点”——你把它和 Gateway 配对,就能在口袋里直接指挥自己的 Agent 干活。

    “如果设置得当,它们或许能帮你相当高效地完成各种任务。”TechCrunch 在报道里这么写。从写代码到规划三餐,用户已经把 OpenClaw 用在了各种地方。

    从病毒式爆红到正经产品

    OpenClaw 的走红带着点戏剧性。年初它靠 MoltBook 这个”全是 Agent 的社交网站”出圈,后来研究者发现,那场热闹有一部分是真人假扮 Agent 演出来的——一场营销,效果拉满,可信度打了折扣。但闹剧指向的方向是真的:Agent 正在渗进日常。2 月,OpenClaw 的创造者 Peter Steinberger 宣布加入 OpenAI,给这个故事又添了一层微妙。

    不是每个人都能顺手

    别把它想得太神。Agent 能不能帮上忙,很大程度上取决于你有没有把它”调教”好。有人用得风生水起,也有人反馈结果远不及预期。手机端的好处是,你随时能远程批准 Agent 的操作——它要做点什么,你在手机上点一下同意就行,不用守在电脑前。


    智能体正在填满你的屏幕

    OpenClaw 上手机不是孤例。就在同一天,TechCrunch 还报道了一款叫 Acti 的工具,把 AI Agent 直接塞进了手机输入法键盘;微软的 Scout、Google 的 Gemini Spark 也都在往”常驻助手”的方向靠。Agent 从聊天框里走出来,变成能替你跑腿、等你点头的角色,这条路已经越走越宽。

    • 平台:iOS 与安卓官方 App 同步上线
    • 架构:手机配对自托管 Gateway,作为伴生节点运行 Agent
    • 交互:支持远程批准 Agent 的操作,不必守在电脑前
    • 现实:效果取决于配置,有人惊艳也有人觉得鸡肋
  • 谷歌把文生图价格打下来了:Nano Banana 2 Lite 四秒出图

    谷歌 Nano Banana 2 Lite 高速文生图概念图
    谷歌新发布的 Nano Banana 2 Lite 主打高速、低成本的文生图能力

    如果你最近在折腾 AI 画图,应该对”又慢又贵”这四个字不陌生。想要一张能用的图,等上二三十秒是常事,批量出图更是烧钱。谷歌这周悄悄把这个问题往前推了一步——6 月 30 日,它发布了 Nano Banana 2 Lite,定位很直白:快,而且便宜。

    四秒一张,价格低到可以忽略

    按照谷歌的说法,这个新模型生成一张图只要大约四秒,比上一代 Nano Banana 2 快了不止一点。价格更夸张,每生成 1000 张图只要 0.034 美元。什么概念?你拿它来反复试稿、批量产出,成本几乎可以当它不存在。它并不是来替代旗舰的——谷歌另外还有更贵的 Nano Banana Pro,以及性能更强的 Nano Banana 2。Lite 干的是另一件事:把”高频、海量、要快”这条路补齐。

    “Building with generative media is often about creative iteration,” 谷歌在博客里写道,”有了这两个模型,开发者能把快速出图和视频创作串成一条完整的流水线。”

    不是更聪明,是更合适

    Lite 牺牲了多分辨率和一些重型能力(只输出 1K 分辨率),把全部算力压在了速度和单位成本上。对电商素材、广告创意快速迭代、自动化内容流水线这类场景来说,这恰恰是痛点。它已经通过 Google AI Studio、Gemini API 和 Gemini Enterprise Agent Platform 上线,并且直接取代了初代 Nano Banana——谷歌现在把初代叫做”legacy model”(遗留模型)。

    图片只是起点,视频才是下一步

    同一天,谷歌还把 Gemini Omni Flash 的开放范围扩大了。这个模型能把静态图直接变成视频,每秒输出收费 0.10 美元。谷歌顺手展示了个叫 Omni Product Studio 的演示应用,能把 Nano Banana 生成的图转成”电影感的电商视频”。换句话说,先用 Lite 极速出图,再喂给 Omni Flash 做视频,一条龙。


    热闹背后,争议没停

    当然,这事没那么干净。AI 生成图被骂成”AI slop”(AI 垃圾内容)的声音一直没断,有研究说 TikTok 上六成视频、YouTube 上两成多的内容都是 AI 生成的。可即便如此,大厂还在往里砸钱。

    谷歌自己也在靠近好莱坞——它刚和文艺片厂牌 A24 签了 7500 万美元的合作,粉丝那边反弹不小。一边是创作社区的警惕,一边是资本和效率的推力,文生图这条赛道只会更挤。

    • 速度:单张 1K 图约 4 秒,是上一代的五分之一
    • 成本:每 1000 张 0.034 美元,规模化出图几乎零边际成本
    • 定位:取代初代 Nano Banana,专注高吞吐工作流
    • 生态:与 Gemini Omni Flash 打通,图生视频一气呵成
  • OpenMontage:把 AI 编程助手变成「全自动视频制片厂」的开源智能体系统(37.4K★)

    OpenMontage:把 AI 编程助手变成「全自动视频制片厂」的开源智能体系统(37.4K★)

    OpenMontage 是全球首个开源的「智能体驱动(agentic)视频生产系统」,用 12 条生产流水线、52 个工具和 500+ 智能体技能,把 Claude Code / Cursor / Copilot 等 AI 编程助手直接变成一间完整的视频制片厂。

    项目简介

    一句话:把你的 AI 编程助手变成一间全自动视频制片厂。你只需用自然语言描述想法,OpenMontage 的流水线就会自动完成联网调研、脚本撰写、素材检索/生成、剪辑合成与质量自检,端到端产出成片。零付费 API Key 也能跑通完整链路。

    安装要求和过程

    环境要求

    • Python 3.10+(python.org 下载)
    • Node.js 18+(nodejs.org 下载)
    • 系统安装 FFmpeg(brew install ffmpeg / sudo apt install ffmpeg)
    • 一个能读取文件并运行代码的 AI 编程助手:Claude Code、Cursor、Copilot、Windsurf 或 Codex 任一即可
    • 可选 GPU:用于本地免费视频生成(make install-gpu,支持 wan2.1-1.3b 等模型)
    • API Key 全部可选:不付费也能出片,付费图像/视频商仅用于更高画质

    快速安装

    标准流程(需 make):

    git clone https://github.com/calesthio/OpenMontage.git
    cd OpenMontage
    make setup

    随后在 AI 编程助手中打开项目,输入需求即可,例如:

    "Make a 60-second animated explainer about how neural networks learn"

    无 make 环境可手动建虚拟环境(README 提供 macOS/Linux 与 Windows PowerShell 两套命令):

    python3 -m venv .venv
    source .venv/bin/activate
    pip install -r requirements.txt
    cd remotion-composer && npm install && cd ..
    pip install piper-tts
    cp .env.example .env

    make setup 后已自带 Piper 本地 TTS、Archive.org / NASA / Wikimedia 开放素材、Pexels / Unsplash / Pixabay、Remotion、HyperFrames、FFmpeg 与内置字幕。

    核心功能

    1. 端到端生产流水线:12 条预置流水线(科普解说、口播、纪录片混剪等),统一走 research → proposal → script → scene_plan → assets → edit → compose 七个阶段。
    2. 真实素材纪录片制作:无需付费视频模型,从 Archive.org / NASA / Wikimedia 等开放素材库语义检索并剪辑成片,而非仅仅把静态图做成动画。
    3. 参考驱动创作:贴一个你喜欢的视频,智能体会分析其节奏与钩子,生成差异化的制作方案(保留手法、替换主题)。
    4. 内置实时联网调研:写脚本前自动跑 15–25+ 次跨 YouTube / Reddit / 新闻 / 学术源的搜索,用真实数据支撑内容。
    5. 生产级质量门禁与预算治理:人工审批门、预合成验证、渲染后自检(ffprobe 抽帧 + 音频分析)、7 维打分选商、成本预估与上限(默认总预算 $10)。

    Backlot 制作工作台

    OpenMontage 内置 Backlot 可视化工作台,覆盖实时看板、故事板与素材库,让自然语言需求落到可逐帧审阅的制作流程:

    Backlot 实时制作看板(board-live)
    Backlot 实时制作看板(board-live)
    Backlot 故事板(storyboard)
    Backlot 故事板(storyboard)
    Backlot 素材库(library)
    Backlot 素材库(library)

    典型使用场景

    • 零 Key 科普 / 教学短片:一句 "Make a 45-second animated explainer about why the sky is blue" 即可生成带解说与字幕的动画片。
    • 免费真实素材纪录片:如 "Make a 90-second documentary montage about what a city feels like at 4am. Use real footage only",直接调用开放素材库剪辑,零成本成片。
    • 商业预告片(配置图像/视频商后约 $1–$3):科幻概念预告片、产品发布 Teaser 等;已展示案例成本最低 $0.02、最高数美元(如 Kling v3 成片 $1.33)。

    推荐理由

    OpenMontage 最打动我的是它把「做视频」从专业软件的高门槛,解放成一句自然语言需求。三点尤其值得一试:

    • 零 Key 也能跑通全链路:本地 Piper TTS + 开放素材 + Remotion 合成,对想低成本试水 AI 视频的人极友好。
    • 架构清爽、可扩展tools/ + pipeline_defs/ + skills/ 三层知识架构,可以自己加技能 / 工具;AGPL-3.0 开源、可自托管。
    • 内容有真实出处:「参考驱动 + 联网调研」让脚本不像纯生成那样空洞,预算门禁也让人敢放心把任务交给智能体跑。

    个人体会:第一次用 "Make a 60-second animated explainer about how neural networks learn" 跑通时,最惊艳的是它真的会先去查资料再写脚本——出来的东西有依据、有节奏,而不是随机拼接的炫技片段。

    下载地址

  • Mistral也来抢机器人赛道:一个普通摄像头,让机器人在办公室里自己认路

    法国AI公司Mistral,大家更熟悉的是它那些开源大语言模型。但7月8日它悄悄把触角伸到了”物理世界”。新发布的Robostral Navigate是Mistral第一款面向机器人导航的模型,参数只有80亿,却干了件挺反直觉的事:让机器人只靠一个最普通的RGB摄像头,就能在复杂空间里自己走路、认路,不用激光雷达,也不用深度传感器。

    传统方案要让机器人不撞墙,往往得堆传感器——LiDAR、深度相机、好几路摄像头一起上。Robostral Navigate偏要做减法。它接收摄像头画面和一句大白话指令,比如”走出大堂,穿过走廊,进储物间,停在第二个货架正前方”,就自己驱动机器人走完整个流程,连训练时从没见过的人和障碍物都能现场避让。

    Mistral Robostral Navigate 单摄像头机器人导航
    仅凭一颗摄像头,Robostral Navigate 让机器人在办公空间自主导航(配图由AI生成)

    在R2R-CE这个导航基准上,它在没见过的环境里成功率76.6%,见过的有79.4%。更扎眼的是,它比此前最好的单摄像头方案高出9.7个百分点,甚至比用着深度或多摄像头的系统还高出4.5个百分点——”一只眼”反而赢了”多只眼”。

    怎么做到的:先学会”指路”,再学会”走路”

    核心是一套基于”指向”的导航机制。模型看着当前画面和历史指令,预测机器人下一步该往画面里的哪个坐标走、到了之后该朝向哪边。比起直接给”往前两米、左转25度”这种精确位移指令,这种”指路”的方式天然不挑相机参数、也不挑空间尺度,同一个模型能装在轮式的、腿式的甚至飞行的机器人上。

    训练上Mistral也走了一条省钱的路。整个模型完全在模拟环境里训出来,用6000个虚拟场景攒了大约40万条轨迹。再配上前缀缓存(prefix-caching)的训练算法,把整段任务压成一条序列一次训完,训练token量砍到原来的1/22,原本要几个月的活儿压缩到几天。最后再上一轮在线强化学习(CISPO),成功率又多榨出3.2个百分点。

    为什么这件事值得盯

    对Mistral来说,这只是通向”统一具身智能体”的第一步,但它戳中的是机器人落地最贵、最麻烦的一块——感知与导航。制造业、配送、物流、酒店这些场景里,”让机器自己从A走到B”向来是客户最想要的本事。把硬件门槛从一套传感器阵列降成”一颗摄像头加80亿参数”,意味着更多中小玩家也能碰机器人了。

    • 模型完全自研,不依赖任何开源视觉语言模型,从Mistral自家的 grounding 模型初始化而来。
    • 对相机内参差异很皮实,不同机器人、不同摄像头都能通用,部署起来省心。
    • 团队明确说还没看到性能天花板,更多训练和数据还能继续把数字往上推。

    当然,模型目前还没开源,权重和代码要走商务接洽。但Mistral从语言模型跨界到机器人,信号已经很清楚:当小模型也能用一颗摄像头搞定复杂导航,机器人自主移动的硬件护城河,正在被重新画一遍。


  • Mercor估值冲上200亿美元:雇专家给AI当考官,这门生意两年涨了四倍

    Mercor这家公司最近又成了风投圈的话题中心。彭博7月9日报道,这家从AI训练数据起步的创业公司正在谈新一轮融资,估值直接喊到了200亿美元。要知道去年10月它刚完成3.5亿美元C轮,估值还只是100亿美元——不到一年,数字就翻了一倍。

    更抓人的是创始人兼CEO布伦丹·福迪(Brendan Foody)自己在X上晒的数据:公司年化收入跑到了20亿美元以上,比四个月前整整翻了一倍。一边是收入暴涨,一边是并购动作——上周四Mercor宣布买下Deeptune,一家专门训练AI智能体的公司,对方整个团队一并加入。再加上这轮可能的新钱,看起来年初那场风波已经被它甩在身后了。

    Mercor估值冲上200亿美元
    Mercor靠给AI模型 supplying人类考官,估值一年翻倍(图源:TechCrunch)

    说白了,Mercor干的事听起来简单,细想却有点荒诞:它雇各路专家——诗人、经济学家、程序员、科学家——付钱让他们去评估AI模型的输出到底好不好。那些训练前沿大模型的实验室,需要人来告诉自己”模型是不是真的变强了”。Mercor就是提供这批”考官”的人。

    两个辩论队队友,撑起一个200亿的故事

    这家公司2023年才成立,三个创始人是从高中辩论队里走出来的朋友:福迪、阿达什·希雷马特(Adarsh Hiremath)和苏里亚·米德哈(Surya Midha),福迪今年才23岁。从C轮时大约4.5亿美元的年化收入,到今年中接近20亿,二十来个月里涨了四倍多。背后站着Felicis、Benchmark、General Catalyst这些一线基金,累计融资大约4.92亿美元。

    有意思的是,估值倍数反而被”压”下来了。100亿对4.5亿收入,是大约22倍市销率;如果按200亿对20亿算,只剩10倍。换句话说,市场一边兴奋于生意盘子变大,一边也在悄悄担心这门买卖到底能撑多久。

    它在训练那个可能取代自己的东西

    这种担心不是没来由。Mercor赚的正是”派人类专家去训练AI模型”的钱,可模型越聪明,对人工评估的依赖理论上就越少。真有一天模型能自己给自己、或者互相打分,那批考官的需求可能就缩水了。

    但福迪在斯坦福的演讲里抛出了另一种看法,他管这叫”agentic data”(智能体数据):AI能力越强,要它被评估的维度反而越细,而不是越窄。会写诗,就需要诗人来评;能做经济分析,就需要经济学家。需求不是一次性的训练浪潮,而是跟着整个行业一起长。

    • 它给AI实验室供应的是”懂行的人”——这是大厂自己很难内部搞定的一摊运营活。
    • 买下Deeptune,是把盘子从传统数据标注,扩到了更吃香的AI智能体训练。
    • 年初的数据泄露和外包员工诉讼还没完全翻篇,能这么快把收入和估值同时拉回来,说明资本现在愿意为”训练流水线的掌控者”付高价。

    在不少人眼里,谁捏住了数据这一环,谁就捏住了AI往上走的长期价值。Mercor赌的,正是自己能一直站在模型和它所需要的”人”之间。


  • AI Job Search:跑在你机器上的 AI 求职申请框架,让 Claude 帮你写简历、求职信、备战面试(21.2K⭐)

    AI Job Search:跑在你机器上的 AI 求职申请框架,让 Claude 帮你写简历、求职信、备战面试(21.2K⭐)

    AI Job Search

    AI Job Search 是一个完全跑在你自己机器上的 AI 求职申请框架,基于 Claude Code 构建。Fork 仓库、填好个人资料,Claude 就能帮你评估职位匹配度、定制简历、撰写求职信、准备面试——把最耗时的求职苦差事彻底工程化。

    📌 项目简介

    「The job search that runs on your machine.」作者 Mads Lorentzen 把 Claude Code 变成了一位全栈求职助理:核心工作流(自我画像 → 适配度评估 → 起草-评审申请管道)与语言、国家无关;内置的招聘门户搜索技能默认面向丹麦市场(Jobindex / Jobnet / Akademikernes Jobbank 等),但模式可被替换成你本地的招聘网站。项目没有任何加密货币、代币或付费赞助,仅通过 Ko-fi 捐赠支持,隐私与安全取向明确。

    💻 安装要求与过程

    环境要求

    • Claude Code CLI(需订阅 Anthropic)
    • Python 3.10+(薪资基准等脚本)
    • Bun(用于职位搜索 CLI 工具,bun.sh
    • LaTeX 发行版,需含 lualatexxelatex:TeX Live / MacTeX / TinyTeX / MiKTeX(简历用 lualatex 编译,求职信用 xelatex 编译)
    • 可选:pdftotext(来自 poppler)——用于 /apply 的 ATS 文本层校验;缺失时自动降级为视觉检查

    快速安装

    ① Fork 并克隆

    gh repo fork MadsLorentzen/ai-job-search --clone
    cd ai-job-search

    ② 安装职位搜索 CLI 工具(Bash / zsh / Git Bash)

    for tool in jobbank-search jobdanmark-search jobindex-search jobnet-search linkedin-search freehire-search; do
      cd .agents/skills/$tool/cli && bun install && cd ../../../..
    done

    ③ 进入 Claude Code 填写个人资料

    claude
    # 在 Claude Code 内执行:
    /setup

    ④ 搜索职位

    /scrape

    ⑤ 申请职位

    /apply https://jobindex.dk/job/1234567
    # 或粘贴完整 JD:
    /apply <粘贴完整职位描述>

    ⚡ 核心功能

    • 本地运行、可分叉自有:框架在你的机器上跑,Fork 后填入资料即可,无外部服务绑定,求职数据完全私有。
    • Drafter-Reviewer 双代理申请流:起草者用 LaTeX 写草稿,再由一个带全新上下文的独立 reviewer 代理调研公司、批判草稿,最后修订——避免单遍生成留下的套话与遗漏。
    • PDF 编译与视觉校验循环:自动把简历编译成精确的 2 页、求职信 1 页,并读取渲染页迭代修复版式错误(孤行标题、字体回退、溢页等),每次申请自动执行。
    • ATS 文本层校验:用 pdftotext 抽取简历文本层,按 ATS 解析器视角验证联系方式、阅读顺序与关键词覆盖;诚实规则——简历不支持的关键词绝不硬塞。
    • 相关性加权裁切 + 丰富命令生态:超页时按「与目标职位的相关度 / 文档内独特性 / 求职信依赖度」打分裁线,而非机械删旧;提供 /setup /scrape /apply /rank /interview /outcome /expand /upskill /add-template /add-portal /reset 等 10+ 命令。

    🎯 典型使用场景

    • 主动靶向申请/scrape 抓取丹麦/跨国职位板 → /rank 批量打分排序 → 选定目标 /apply <url> 一键产出定制简历与求职信。
    • 面试准备:某个申请进入面试后,对其归档记录跑 /interview,基于「面试官实际读到的简历/求职信 + 往轮反馈」生成阶段化准备包与模拟面试。
    • 职业差距规划:两次投递之间用 /upskill <URL>/upskill 分析个人画像与职位的差距,输出优先学习热图与带时间估计的学习计划。

    💡 推荐理由(个人心得)

    市面上「AI 帮你写简历」的工具不少,但大多只做一次性文本生成,排版一塌糊涂。AI Job Search 最打动我的是它把求职这件事当成一个严肃的软件工程问题:双代理互相挑刺、强制 PDF 编译校验、ATS 文本层检查,几乎杜绝了「.tex 看起来没问题、渲染出来全崩」的经典翻车。而且它真正跑在本地、Fork 即拥有,可深度定制(自定义 LaTeX 模板、自定义招聘门户 /add-portal),隐私与可控性拉满。

    当然也有门槛:依赖 LaTeX 环境 + Claude Code 订阅,初次搭建略繁琐;默认招聘门户偏丹麦市场(但 linkedin-search / freehire-search 是跨国、零依赖的,开箱即用)。如果你正在换工作、且本就有 Claude Code,这个项目能实打实省下大量写简历、改求职信的周日。

    📥 下载地址

    标签:AI · 开源 · AI Agent · Claude Code · 求职助手 · 简历优化 · 职业规划|许可证:MIT|语言:TypeScript / Python / LaTeX

  • Anthropic把Claude Code的那套,搬进了实验室:Claude Science来了

    Claude Code让程序员爽了快一年,现在Anthropic想把同样的爽感送给科学家。6月底,在一场面向药企高管、生物科技创始人和研究者的活动上,Anthropic正式亮出了Claude Science——一个专门给科研用的AI产品,定位跟Claude Code在软件开发里的位置一模一样。

    它不像聊天机器人那样只会回答,而是能接住一句笼统的指令,自己调用数据库、跑分析、追踪数据溯源,甚至核查计算过程。给它的场景是计算生物学和药物研发:你不用切到浏览器、登网页、复制粘贴、手动查库,很多繁琐的”管线胶水”活儿它替你接好了。

    不是新模型,是一个”科研工作台”

    说清楚一点:Claude Science里没有新模型。它把你已经付费的Claude,接进60多个科研数据库和连接器——UniProt、蛋白质数据库、Ensembl、ChEMBL这些做生信的人天天要查的,全预配置好了;底下还能跑NVIDIA的BioNeMo系列模型做序列和结构预测。Anthropic生命科学负责人Eric Kauderer-Abrams把它和Claude Code、Claude Cowork并列,叫”下一个真正重要的产品”,话里话外是把AI用于科学当成了公司使命的核心。

    “我们的使命是开发服务人类长期福祉的AI,而我们认为,最大的机会就在生命科学。”——Eric Kauderer-Abrams,Anthropic 生命科学负责人

    DeepMind的”科学王座”,有人来抢了

    过去十年,AI for Science几乎是Google DeepMind的专属舞台,Hassabis和Jumper凭AlphaFold拿了诺奖。但最近几个月风向有点变:在编程这种最赚钱的场景上,DeepMind反而成了追赶者;而就在本月,Jumper本人宣布从DeepMind跳槽去了Anthropic。加上Dario Amodei本身就是PhD科学家,Anthropic抢这顶”科学王冠”的底气不差。

    哈佛物理学家Matthew Schwartz估过,靠Claude Code和同类工具,Opus 4.5干科研项目的水平大概相当于一个研二学生。这话听着夸张,但已经有实验室在用:艾伦研究所的神经科学家拿它搭了多智能体审查流程,UCSF的脑肿瘤团队用它加速了胶质瘤分析,诺和诺德也在客户名单里。

    真正让实验室放心的一点是数据不出门

    科研人员最怕什么?把敏感数据传到别人的云上。Claude Science特意设计成能直接跑在实验室自己的基础设施上——本地Mac、Linux、SSH连到院里服务器、HPC集群都行,重活还能临时调用Modal的GPU从一块扩到几百块。生成蛋白质或化学结构图时,它会一并把代码、运行环境和自然语言说明都交出来,方便你改、也方便复现。

    一个有趣的转向是:当所有公司都在卷”更通用的模型”,Anthropic选了更务实的路——先把AI嵌进具体行业的日常流程,再做深。Claude Code钉住开发者,Claude Science钉住科研者,接下来金融、医疗、法律大概也跑不掉。

    Claude Science 界面
    Anthropic 将 Claude Science 定位为科研版的 Claude Code(图:MIT Technology Review)