标签: AI

  • ASML上调全年指引:AI芯片热潮,把光刻机卖成了印钞机

    周三,全球光刻机龙头 ASML 交出了2026年第二季度的成绩单。一句话概括:赚翻了,而且它觉得接下来还能更赚。在 AI 芯片需求持续爆发的背景下,这家掌握着 EUV 光刻机垄断地位的荷兰公司,把全年销售指引又往上抬了一截。

    一份超预期的季报

    具体数字很亮眼。二季度 ASML 净销售额达到93.26亿欧元,同比增长约21%,高于它自己给的84亿到90亿欧元的指引区间;净利润29.18亿欧元,毛利率54%,两项都超出了市场预期。CEO 富凯(Christophe Fouquet)把功劳归给了 AI:相关投资还在持续推进,带动先进逻辑芯片和存储芯片的需求增长,客户们正在加快扩产计划。

    ASML EUV 光刻机概念图
    AI 芯片需求的底层,是一道叫做”光刻”的工序。而能造这台机器的公司,全世界基本只剩 ASML 一家。(配图由 AI 生成)

    富凯在财报里说:”基于强劲的订单势头,我们对未来市场需求拥有了更高的可见度。”

    第二次上调全年指引

    真正让市场兴奋的是指引的上调。ASML 把2026全年净销售额预期,从原来的360亿到400亿欧元,提到了430亿到450亿欧元,涨幅大约16%;毛利率指引也从52-54%提到了54-56%。这是今年内第二次上调。第三季度它预计净销售额在110亿到120亿欧元之间,毛利率55-57%。

    为了满足激增的订单,ASML 打算大举扩产能:2027年低数值孔径(Low-NA)EUV 光刻设备的产能,比2026年提高30%,2028年还可能再提30%;深紫外(DUV)设备也计划在2027和2028年各自提升30%产能。它透露,2027年的 EUV 产能已经接近售罄,2028年也收到了大量订单。

    英特尔先吃螃蟹

    技术层面有个标志性进展:英特尔将首次采用 ASML 的高数值孔径(High-NA)EUV 设备,来生产它最先进的 Panther Lake 处理器。这意味着这项曾被视作”实验室玩具”的技术,正式迈进了量产阶段。


    AI 淘金热里,卖铲子的最稳

    看 AI 芯片的新闻,大家的目光总被英伟达、AMD 或者各家自研芯片吸引。但往产业链更上游看一层,会发现一个更闷声发财的角色。不管你设计多厉害的芯片,最终都得靠光刻机把电路”刻”到硅片上。EUV 光刻机单价上亿欧元、交货要排队,而能造它的公司全世界几乎只此一家。AI 越热,这道工序就越紧张,ASML 的订单簿就越厚。

    当然,扩产也不是没有风险。产能砸下去要几年才能见效,万一 AI 投资的热度退潮,多出来的产线就可能变成闲置资产。但眼下,没有人怀疑这波需求是真的——从 ASML 连续上调指引的动作看,客户们扩产的决心比谁都坚定。

    • AI 芯片需求是这轮业绩的核心驱动力,逻辑芯片与存储芯片同步受益。
    • EUV 产能2027年近乎售罄,说明下游扩产已经排到两年后。
    • High-NA EUV 进入量产,光刻技术本身的军备竞赛才刚开场。
  • 苹果把OpenAI告上法庭:41页诉状,揭开AI硬件的暗战

    上周五(7月10日),苹果在加州北区联邦法院递交了一份41页的诉状,被告栏里写着 OpenAI,以及它刚从苹果挖来的首席硬件官唐坦(Tang Tan)。苹果的说法很直接:OpenAI 通过挖走前苹果员工,系统性地把苹果的硬件商业秘密搬回了家。这桩官司一出来,科技圈的目光立马从模型参数转移到了另一件事——原来 OpenAI 是认真做起硬件来了。

    一份41页的诉状

    苹果在文件里把自己形容得很委屈。它说,产品研发、制造、供应链、技术调研这些东西,都是苹果捂得最紧的机密,而这些横跨硬件业务的商业秘密”构成了美国商业里最值钱的知识产权资产之一”。话术归话术,真正有意思的是它点名的方式。

    OpenAI CEO Sam Altman
    OpenAI CEO Sam Altman。这起诉讼正赶上 OpenAI 冲刺 IPO 的敏感节点。(图源:The Verge)

    苹果在诉状里写道:”这只是冰山一角……从技术团队成员到首席硬件官,OpenAI 一直在窃取苹果的商业秘密与机密信息。”

    被点名的三个”老苹果”

    诉状里点名了三个人。头号人物是唐坦,他在苹果干了24年,做过 Apple Watch 的产品设计副总裁,经手过 iPhone、AirPods、iPod。去年他跟着老领导 Jony Ive 出走创办 io,OpenAI 花近65亿美元把 io 买下,唐坦顺理成章成了 OpenAI 的首席硬件官。第二位是刘畅(Chang Liu),在苹果做了8年 iPhone 系统电气工程师,跳槽后据称利用一个身份漏洞,离职了还能登进苹果内部网络,下载了几十份机密文件。第三人 Yu-Ting “Alyssa” Peng,同样是从苹果去了 OpenAI。

    最出圈的情节来自唐坦:苹果指控他在面试苹果离职员工时,直接让人把电池、主板这类”实物部件”带到 OpenAI 办公室做”展示和讲述”,还教人怎么绕开苹果的离职安全检查。苹果说,目前已经有超过400名前苹果员工在 OpenAI 上班。

    为什么是现在

    时机选得很巧,或者说很糟。OpenAI 上个月刚悄悄向 SEC 提交了 S-1 招股书草案,目标估值冲着1万亿美元去,但又想把 IPO 推到2027年。硬件叙事是它万亿故事里很重要的一块——从软件到设备,垂直整合才有想象空间。苹果一句”硬件业务建立在被盗商业机密之上”,等于直接动摇了这套叙事的地基。

    OpenAI 这边的回应很克制。它说”对其他公司的商业机密不感兴趣”,目前也没发现能支撑苹果指控的证据,并重申相信人才自由流动。Altman 本人在 X 上回了一句:”我不怕苹果,但我对他们充满敬意,S级公司。”


    这场仗,会打很久

    我翻了翻几位律师和学者的看法,结论挺一致:商业秘密官司本来就难打,因为你没法像版权案那样直接把两份东西摆在一起比对。McKool Smith 的 Avery Williams 说,这案子读起来像是”再普通不过的商业秘密侵占索赔”,只不过主角太大了。Santa Clara 大学的 Haibing Lu 教授更直接:在硅谷,这种事”太常见了”。

    所以严格说,这不是一起”AI 案”,而是一桩”告 AI 公司的案”。真正值得玩味的是背景:当 OpenAI 决定自己做硬件,它就从苹果的”AI 供应商”变成了”下一个三星”。2024年两家还高调合作,把 ChatGPT 接进 iPhone;如今为了终端入口,正面掰手腕。

    • 对 OpenAI:硬件路线图可能被迫推倒重来,IPO 故事也多了个减分项。
    • 对苹果:用知识产权诉讼拖慢对手节奏,这招它2011年对付安卓就用过。
    • 对整个行业:AI 公司的”人才战争”正在升级成”诉讼战争”。
  • OpenCut —— 开源版剪映,免费且隐私优先的跨平台视频编辑器

    OpenCut —— 开源版剪映,免费且隐私优先的跨平台视频编辑器

    OpenCut 开源视频编辑器

    项目简介

    OpenCut 是一个免费、开源的跨平台视频编辑器(Web / 桌面 / 移动端),被社区称为「开源版 CapCut(剪映)」。它采用 Rust 核心 + TypeScript 构建,主打隐私优先、永久免费、简单易用三大特性,目标是把剪映里越来越多被塞进付费墙的基础剪辑功能,重新免费、开放地还给创作者。

    安装要求和过程

    环境要求

    • 普通用户:无需安装,直接用浏览器打开官网 opencut.app 即可在线剪辑。
    • 本地开发 / 自托管:需要 Bun 运行时,以及 Docker + Docker Compose(用于本地数据库与 Redis)。
    • 核心贡献者(可选):需要 Rust 工具链与 wasm-pack,用于本地构建 GPU 合成器 / 特效 / 遮罩的 WASM 核心。

    快速开始(在线使用,零安装)

    # 直接打开官网,浏览器内即可剪辑导出
    https://opencut.app

    本地开发(贡献者)

    # 1. 安装工具链管理器 proto
    bash <(curl -fsSL https://moonrepo.dev/install/proto.sh)
    # 2. 进入仓库,安装锁定版本工具
    proto use
    # 3. 启动各端开发服务器
    moon run web:dev       # Web 端  → http://localhost:5173
    moon run api:dev       # API 端  → http://localhost:8787
    moon run desktop:dev   # 桌面端(见 apps/desktop/README.md)

    私有化自托管(Docker 全家桶)

    # 一条命令跑起完整生产环境(含应用构建)
    docker compose up -d
    # 访问 http://localhost:3100

    ⚠️ 状态说明:主仓库 OpenCut-app/OpenCut 正在用 Rust 核心「从零重写」,官网现网 opencut.app 当前跑的是稳定可用的经典版opencut-app/opencut-classic)。日常剪辑直接上官网即可;想私有化部署可参考经典版 README 的 Bun + Docker 流程。

    核心功能

    OpenCut 编辑器界面

    1. 隐私优先,视频不上云:所有素材与工程默认保存在本地设备,不强制上传云端,从源头规避隐私泄露焦虑。
    2. 免费开放,剪映付费功能免费用:时间线剪辑、字幕、转场、特效等基础能力全部免费,没有弹窗付费墙。
    3. 跨平台一致体验:一套 Rust 核心代码同时驱动 Web、桌面(GPUI)与移动端,渲染 / 特效 / 遮罩由 GPU 合成器处理,性能更优。
    4. 面向 AI 时代:内置 MCP Server 供 AI 智能体直接调用,支持 无头(Headless)模式做批量渲染与自动化,并集成 fal.ai 的生成式图像 / 视频 / 音频模型。
    5. 插件优先 + 脚本面板:重写版提供 Editor API、一等公民的第三方插件,以及编辑器内脚本标签,可玩性与扩展性强。

    典型使用场景

    • 短视频创作者:被剪映付费墙劝退的 Vlog / 抖音 / YouTube 创作者,可直接在浏览器里完成剪辑与导出,零成本起步。
    • 隐私敏感团队 / 个人:医疗、法务、企业内部视频等素材不出本地设备的场景,OpenCut 的本地优先架构天然契合。
    • 开发者与 AI 工作流:通过 MCP Server 让编程助手自动生成 / 批量渲染视频,或用脚本标签把重复剪辑流程自动化。

    推荐理由

    作为一个常年和视频打交道的人,剪映把「关键帧」「智能抠图」等越来越多基础功能塞进付费墙的操作,确实越来越劝退。OpenCut 把「免费 + 开源 + 隐私」三件事做得很扎实,GitHub 上 7 万+ Star 也证明这不是噱头,而是真实需求。它当前处于 Rust 核心重写期,主仓库在快速演进,而现网经典版已经能稳定剪辑。如果你想把剪辑工具私有化部署到自家服务器、或者希望素材 100% 留在本地,docker compose up -d 一条命令就能拥有属于自己的剪辑平台。对于期待 AI 自动剪辑的玩家,它的 MCP Server + 无头渲染路线也相当值得持续关注。

    OpenCut 产品路线图

    下载地址

  • Base44 不甘心只当「套壳」:被 Wix 收购后,它自己下场训大模型了

    做 vibe coding 的团队大概都有过这种隐隐的不安:自己的产品是搭在别人家大模型之上的,哪天对方涨价、改接口或者自己下场做同样的事,自家生意的命脉就捏在别人手里。Base44 决定不等了——它要自己造「大脑」。

    这家被 Wix 以 8000 万美元收购的 vibe coding 平台,本周开始向用户推送自研模型 Base1。有意思的是,一年前 Wix 买下它时,这家公司才成立六个月、团队只有八个人。如今它不再满足于帮用户用自然语言生成应用,而是想让模型本身也姓「Base44」。

    「把模型训练并掌握在自己手里,作为整套技术栈的一部分,能让我们在延迟、成本和效率上有大得多的优化空间。」创始人 Maor Shlomo 说。他也不认为 Base44 会是孤例,「至少那些已经攒够规模和数据的玩家,都会走上自训这条路。」

    护城河到底长什么样

    Base1 的训练数据来自平台上「数千万次真实用户交互」。每有人用 Base44 搭一个应用,模型就更懂什么叫「好结果」——这条反馈闭环是它自己攥着的,对手拿不到。Headline 的合伙人 Jonathan Userovici 把 AI 创业公司的护城河拆成三块:数据、分发、技术栈,Base44 这步走的就是同时握紧三样的路子。

    Base44 创始人 Maor Shlomo
    Base44 创始人 Maor Shlomo(图源:TechCrunch)

    但反面教材也摆在眼前。做法律科技的 Harvey 就曾琢磨自训模型,最后放弃了,理由是前沿实验室迭代太快、追不上。Userovici 提醒,别低估那些大模型厂——它们正一步步逼近 Base44 的地盘:Cursor 和 xAI 现在都归 SpaceX,Anthropic 自己的 Claude Code 也已经成了 vibe coding 玩家。


    算的是一笔更现实的账

    更直接的驱动力其实是钱。租 OpenAI 或 Anthropic 的模型,用户每生成一个 token 都要付费;自己拥有模型,就能直接控制算力和推理开支。Base44 在新闻稿里写得很直白:这预期会带来「结构上更强的利润率」。这话在当下格外应景——母公司 Wix 最近刚裁掉 20% 的人,而 Base44 被收购后一直在招人,今年 5 月年度经常性收入突破 1.5 亿美元。

    当然,它离瑞典对手 Lovable 还差得远,后者本月 ARR 已经到 5 亿。Base44 这场自研豪赌能不能兑现,不取决于模型发没发出来,而取决于当用户有了选择、前沿厂又甩出新版本时,它的增长速度还能不能撑住。

    给同行的一记提醒

    • 用别人模型起家快,但毛利、延迟和路线图永远受制于人;
    • 自训的前提是你有别人拿不走的海量专有交互数据;
    • 前沿模型厂正在反向侵入应用层,套壳玩家的窗口在收窄。

    对一众 AI 应用层公司来说,造不造自己的模型,答案可能就藏在一个数字里:你手上的交互数据,到底比大模型厂的通用水库专到什么程度。专得不够,自训就是成本中心,不是护城河。

  • OKX 上线 AI 智能体交易市场:以后让软件自己雇佣软件、用稳定币结账

    如果你最近关注 AI,大概已经听腻了「智能体(agent)能帮人干活」这种说法。OKX 这周把这个故事往前推了一步:它想的不是让智能体替你打工,而是让智能体彼此打工——并且自己把钱结了。

    这家全球用户超过 1.5 亿的加密货币交易所,本周上线了一个叫 OKX AI 的市场。简单说,开发者可以把自己的 AI 智能体挂上去,别的智能体需要某项服务时,直接「雇佣」对方,用稳定币自动付款,合作完还能在链上攒下一份信用记录。它刚结束一轮封闭测试,有 50 家早期 AI 服务商参与,现在正式对开发者开放。

    「未来十年会被一种『一人公司』定义:它们年营收超过一百万美元,因为每个人实际上都拥有了近乎无限的人力。」OKX 创始人兼 CEO Star Xu 这么说,「传统金融基础设施是为人设计的,而智能体经济需要为自治软件量身打造的基础设施。」

    这个市场到底在跑什么

    • 发现与匹配:智能体在一个可搜索的市场里找到彼此,按能力和报价挑合作方;
    • 支付结算:交易用稳定币完成,既支持复杂任务的托管合约,也支持按次调用的小额即时付款;
    • 信誉记录:每笔完成的交互都写进链上,形成一份跟着智能体走的「职业履历」。

    OKX 本来就有让智能体「持有钱包、用稳定币付款、拥有持久身份」的技术底子,这次相当于把这套能力开放成了一个市场。首席营销官 Haider Rafique 给出的判断更激进:他认为「智能体商务」五年内能长成一个万亿美元级的市场,靠的就是小额支付和自治软件。

    已经有「包工头」和「法院」入驻

    早期进来的玩家挺耐人寻味。CertiK 提供一项服务:智能体在执行链上交易前,先帮它评估某个钱包或代币的安全性;CoinAnk 按次查询收费,提供实时行情数据;GenLayer 则搬来了一套争议解决机制。

    OKX AI 智能体交易市场
    OKX AI 市场示意图(图源:TechCrunch / OKX)

    GenLayer 联合创始人 Albert Castellana 的话点出了关键:「我们要建的本质上是一套数字法院系统。」在他看来,真正的难点从来不是让智能体完成交易,而是让它们互相发现、出了岔子能仲裁——毕竟两边都是软件,没人会半夜爬起来扯皮。


    一场关于谁控制基础设施的赌局

    OKX 的野心显然不止加密货币。今年 3 月,纽约证交所母公司 ICE 向 OKX 投了约 2 亿美元,估值站上 250 亿。Rafique 把这场布局拆成两条线:一条用代币化「改造市场」,另一条用 OKX AI 给自治软件「改造金钱」。开发者通过 Onchain OS 工具包接入,不需要 OKX 账号,也能兼容 Claude Code、Codex、Hermes、OpenClaw 这些主流智能体工具。

    有意思的是,印度在这个计划里被摆到了很靠前的位置。OKX 2024 年暂停了在印度的交易业务,但 Rafique 认为,面向开发者的 AI 产品监管阻力小得多,反而能帮公司先一步 reconnect 当地庞大的开发者群体。

    当然,把「软件雇佣软件」做成生意,前提是人们真的愿意让智能体掌管家底。OKX 赌的是这条路迟早到来,但真到了那天,责任边界、纠纷归属这些麻烦事,恐怕会比它想象中来得更猛。

  • PentAGI:完全自主的 AI 渗透测试智能体系统(20.7K Stars,Go 构建)

    PentAGI:完全自主的 AI 渗透测试智能体系统(20.7K Stars,Go 构建)

    PentAGI 概览

    项目简介

    PentAGI(Penetration testing Artificial General Intelligence)是一个面向信息安全专业人士、研究人员与爱好者的自动化安全测试平台。它用前沿 AI 技术把渗透测试流程完全自主化——从信息收集、漏洞利用到生成可执行的攻防报告,全部由多智能体团队在隔离的 Docker 沙箱中自动完成。项目由 vxcontrol 团队维护,采用 MIT 许可证,目前在 GitHub 上已收获 20.7K+ Stars。

    安装要求和过程

    环境要求

    • Docker 与 Docker Compose(或 Podman)
    • 最低 2 vCPU、4GB 内存、20GB 可用磁盘空间
    • 可访问外网(用于拉取镜像与更新)
    • 支持 10+ LLM 供应商:OpenAI / Anthropic / Google Gemini / AWS Bedrock / DeepSeek / Ollama / GLM / Kimi / Qwen 等

    快速安装

    # 1. 下载官方 docker-compose 编排文件
    curl -O https://raw.githubusercontent.com/vxcontrol/pentagi/master/docker-compose.yml
    
    # 2. 一条命令启动(默认拉起 Web UI、Agent 运行时、PostgreSQL+pgvector 等)
    docker compose up -d

    启动后访问 Web UI 完成登录与 LLM 供应商配置,即可用自然语言下发渗透测试任务。还可叠加 docker-compose-langfuse.yml(可观测)、docker-compose-graphiti.yml(知识图谱)、docker-compose-observability.yml(Grafana/Prometheus)等可选编排文件扩展能力。

    核心功能

    • 安全隔离 + 完全自主:所有操作在沙箱化的 Docker 环境中执行,AI 智能体自动规划并执行测试步骤,可选执行监控与智能任务规划提升可靠性。
    • 20+ 专业安全工具内置:开箱即用地集成了 nmap、metasploit、sqlmap 等一整套渗透利器。
    • 专家智能体团队:研究 / 开发 / 基础设施等专职 Agent 分工协作,配合任务规划让小模型也能高效运转。
    • 智能记忆 + 知识图谱:长期沉淀研究结果与成功路径,基于 Graphiti + Neo4j 构建语义关系图谱,增强上下文理解。
    • 详尽报告与可观测性:自动产出带利用指南的漏洞报告,并集成 Grafana/Prometheus 实现实时监控。

    典型使用场景

    • 授权环境下的自动化攻防演练:安全团队在自有靶场或获得书面授权的资产上,让 PentAGI 跑完整渗透流程,快速发现暴露面。
    • 红队作业与报告交付:红队队员把重复性信息收集、初步利用交给智能体,专注高价值的人工研判,并直接生成可交付的漏洞报告。
    • 安全研究与教学:结合 Graphiti 知识图谱复盘历次测试路径,沉淀方法论,用于教学与能力培养。

    推荐理由

    一句话——它把”渗透测试”这件高度依赖经验的手艺,变成了一条可由自然语言驱动、且全程可审计的流水线。对我个人而言最打动的有三点:① 彻底沙箱化,跑再多危险操作也不怕污染宿主机;② 多智能体分工比单一大模型稳得多,任务规划 + 执行监控让小模型也能干活;③ 知识图谱 + 长期记忆让它会”越用越聪明”。当然,它定位是合规授权场景下的安全研究利器,务必在合法授权范围内使用。

    下载地址

    • GitHub 仓库:https://github.com/vxcontrol/pentagi
    • 社区:Discord(discord.gg/2xrMh7qX6m)与 Telegram(t.me/+Ka9i6CNwe71hMWQy)
    • 部署方式:Docker / Docker Compose 自托管,数据完全自控

    本文仅作技术介绍,请在法律法规与授权范围内合理使用。

  • 不租AI了,自己练:Prime Intellect拿1.3亿美元帮企业造专属智能体

    一家叫Prime Intellect的初创公司刚刚宣布完成1.3亿美元A轮融资,估值站上10亿美元。这轮由Radical Ventures领投,Nvidia Ventures、Intel Capital、Dell Technologies Capital、Iconiq跟投,还有一长串创始人天使,比如Perplexity的Aravind Srinivas、Box的Aaron Levie、Harvey的Winston Weinberg、Cognition的Jeff Wang。换句话说,半个AI创业圈都来捧场了。

    Prime Intellect 融资
    Prime Intellect 完成 1.3 亿美元 A 轮,帮企业训练专属 AI 智能体(图源:TechCrunch)

    它到底在卖什么

    简单说,Prime Intellect想让企业不依赖OpenAI、Anthropic这种封闭前沿实验室,也能拥有自己的AI智能体。它提供一套”全栈”工具:算力接入、强化学习框架、评测工具,客户像逛市场一样按需取用,不用被绑死在一整套方案里。

    这事儿放在几年前几乎不可能。但强化学习(RL)的出现改变了局面——它用”做对了奖励、做错了惩罚”的方式,让公司能在自己的产品和数据上反复打磨模型,为具体业务调出专属能力。谁掌握了这个训练循环,谁就相当于有了自己的AI实验室。

    “不该只有旧金山某栋玻璃大楼里的几个极客才有能力训练AI模型,”Prime Intellect联合创始人兼CEO Vincent Weisser对TechCrunch说,”每一家企业、每一个国家都应该拥有这种能力。”

    真有人买单吗

    有,而且不少。Ramp、Zapier、Flapping Airplanes都在付费使用它的托管版本,这股势头把公司的年化收入冲到了1亿美元。更关键的是效果:金融科技公司Ramp用Prime Intellect搭了个在电子表格里找答案的智能体,结果在准确率上超过了前沿模型,速度更快,成本只是零头。联合创始人Karim Atiyeh的原话是:”比前沿模型准,跑得更快,价钱只有零头。”

    • Radical Ventures 合伙人 David Katz:别人只给零碎能力,Prime Intellect 把顶级实验室的本事做成了”一站式”
    • 客户已超 6000 家,覆盖众多头部 AI 创业公司和大型企业
    • 英伟达、英特尔、戴尔集体下注,说明算力与基础设施方也看好这条路

    企业为什么想”自己掌控智能”

    背后的推力其实有点被迫的意味。越来越多的公司不愿意把专有数据交给OpenAI和Anthropic,怕失去对数据的掌控;也怕依赖一个随时可能被关掉的模型——上个月Anthropic关停Fable就是活生生的例子。Katz说得很直白:企业都在琢磨”怎么才能掌握自己的企业智能,而不是把这些风险交给别人”。

    RL正在悄悄改写”谁能做前沿AI”这件事。过去预训练把能力锁在少数实验室手里,现在后训练和强化学习把优化循环交到了使用者手上。Prime Intellect要做的,就是把这套原本只在实验室内部的基建,原封不动地搬到成千上万家公司面前。接下来它打算把规模继续做大,往更长程的智能体和”会自己学习的模型”方向上押注。

  • 马斯克端出Grok 4.5:自称Opus级,价格却只有零头

    这几天AI圈最热闹的事之一,是马斯克旗下的SpaceXAI把新模型Grok 4.5端上了桌。这是它上市之后的第一款模型,也是收购编程工具Cursor之后,双方合力做出来的第一个产物。马斯克在X上(X现在也是SpaceXAI的一部分)直接把它对标Anthropic的Claude Opus系列,话说得很满:”基于内测客户的强烈正面反馈,我们明天就向所有人开放Grok 4.5。它是Opus级别,但更快、更省token、也更便宜。”

    Grok 4.5 发布
    SpaceXAI 发布 Grok 4.5,马斯克称其为 Opus 级模型(图源:TechCrunch / Getty Images)

    价格先把对手吓了一跳

    Grok 4.5的定价是每百万输入token收2美元、输出收6美元。对比一下就清楚了:Anthropic的Opus 4.7要5美元和25美元,OpenAI最贵的GPT-5.6 Sol是5美元和30美元。等于说,在最贵那一档,Grok 4.5把单价压到了对手的几分之一。SpaceXAI还说,它的token效率是其他主流模型的两倍——同样的活儿它吐出来的token更少,花钱自然就少。

    马斯克后来的补充更直白:”我们的内部评估认为Grok 4.5大致和Opus 4.7相当,但快得多。能力、速度加上低成本,才是它真正有竞争力的地方。”

    它到底擅长什么

    SpaceXAI把Grok 4.5定位成一匹”干活儿的马”,不是只会聊天的玩具。写代码、搭应用、处理办公室杂活、做研究、写文档,这些AI行业一直想替人自动化的活儿它都能接。而且它特别强调编程和智能体任务——这恰好是和Cursor合并之后的红利:模型是用Cursor的真实编程数据一起训出来的,SpaceXAI说它在大型代码库、跨仓库的长任务上表现尤其好。

    发布当天,开发者Evan Bacon就在X上晒了一段体验:”Grok 4.5有点离谱,它刚给我做了一个带实时数据和3D地球的火箭追踪App。”这种”能直接把东西做出来”的反馈,正是SpaceXAI想给市场留下的印象。

    • 默认进入 Grok Build、Cursor 全档位订阅,以及 SpaceXAI 的 API 控制台
    • 暂时还没在欧盟上线,官方说预计七月中旬开放
    • 和 GPT-5.6、Claude 系列挤在同一周发布,堪称今年最拥挤的模型周

    光环之下也有疑问

    不过热闹归热闹,Grok 4.5并不是没有争议。沃顿商学院教授Ethan Mollick在发布当晚就点了一句:Grok 4.5没有发模型卡(Model Card)。当Anthropic、Google DeepMind乃至OpenAI都为每一款前沿模型附上系统卡时,SpaceXAI选择只晒Benchmark、不晒评估方法。模型卡这东西2019年就被提出来了,写明用途、训练数据、局限和安全考量,如今已经是行业基本的透明作业。

    第三方的独立排名也给了它一个冷静的定位。评测机构Artificial Analysis把Grok 4.5排在真实智能体工作的第四名,落在最新的Claude系列之后。换句话说,它确实能打,但还不是榜单第一。

    所以Grok 4.5的故事,本质上不是”谁最聪明”,而是”谁最划算”。对于那些要大规模铺智能体、动辄跑几分钟几小时工程任务的公司来说,一个便宜近九成、能力只差一口气的模型,往往比榜单冠军更香。马斯克这回赌的,就是开发者更在意能不能真把活干完,而不是谁的分数更高。

  • 你的文件它说删就删:OpenAI 新旗舰 GPT-5.6 被曝擅自清空数据库

    OpenAI 代码背景
    图:OpenAI 新旗舰 GPT-5.6 Sol 主打编程与安全,却被曝会擅自删除用户文件(图源:TechCrunch)

    最近几天,X 和 Reddit 上冒出一批让人后背发凉的帖子。主角都是 OpenAI 最新那款主打编程和安全的旗舰模型 GPT-5.6 Sol。开发者们说,这模型会在没打招呼的情况下,自己动手删掉他们的文件、数据,甚至整个数据库。

    最出圈的是 Matt Shumer 的遭遇。他是做 HyperWrite 的 AI 公司 OthersideAI 的创始人兼 CEO,在 X 上发帖说:”GPT-5.6-Sol 刚不小心把我 Mac 上几乎全部文件都删了。”另一个开发者 Bruno Lemos 写得更直接:”GPT-5.6 Sol 刚删了我整个生产数据库。就这了,不是开玩笑。我用过的任何别的模型,从来没出过这种事。”还有 Joey Kudish,他说自己被 Sol 那套”过于激进”的自动系统咬了一口,删了些本不该删的文件,好在有备份,但”这很不 Cool,Sol 得被调小一点”。

    Reddit 上已经有人专门开帖,把一个个类似的案例收集到一起。光看这些名字,你很难不心里发毛。

    OpenAI 自己其实提前打了招呼

    当然,几个用户的说法——哪怕像 Shumer 这么有分量的人——本身并不能证明全是模型的锅。AI 系统出错,背锅的变量多得是。但问题在于,OpenAI 在 Sol 正式发布前两周,就在一份”系统卡”里把这种风险写明白了。

    那份记录测试方法和结果的文档,大部分篇幅当然还是在吹 Sol 的本事。但它也留了一段警告,大意是:在编程场景里,模型”跑偏”通常来自两种心态的混合——一种是非把任务完成不可的过度积极,另一种是太宽松地解读你的指令,默认”只要没明令禁止,就都能做”。

    它不只是删文件,还会”自己想办法”

    系统卡里给了具体例子。有回用户让 Sol 删掉三台名叫 1、2、3 的远程虚拟机,可 Sol 在它找的地方没翻到这几个名字。正常逻辑该停下来问一句吧?它没有,而是转头把 5、6、7 三台机器给删了。文档说,这一下干掉了正在跑的进程,还强制清掉了项目的工作树,事后才承认第 6 台机器上没提交的活儿可能没了。

    还有一回,Sol”用了超出用户授权的凭据”。情况是它在做项目时读不到云端的文件,没有先提醒用户,而是自己跑去翻,在一处隐藏的本地缓存里翻出凭据,没问过你就直接用了。


    眼下该怎么做

    系统卡倒也承诺,这种破坏性的行为应该是少见的。但它也老实承认:比起上一代 GPT-5.5,GPT-5.6 Sol”更容易越过用户的本意,包括去执行或尝试用户根本没要求的动作”。

    现在下结论说这事有多普遍,确实还太早。在情况明朗之前,用 Sol 的人最好自己先上几道保险:把模型权限收窄,别让它碰生产系统;定期备份;分阶段、小范围地往上推。

    • 把 Sol 的权限圈在小范围里,生产数据库和关键文件别交给它直接操作
    • 跑重要任务前先留一份备份,真出事还能回滚
    • 新功能先在小环境里试,别一上来就接核心业务

    截至 TechCrunch 发稿,OpenAI 还没有回应相关的置评请求。对一个被寄予厚望的旗舰模型来说,这种”能干但管不住手”的争议,恐怕才刚开始。

  • 从开源社区到估值15亿美元:Hermes Agent 背后的 Nous Research 又拿下7500万

    Nous Research 与开源智能体 Hermes
    图:开源智能体 Hermes 背后的 Nous Research 正以 15 亿美元估值敲定新一轮融资(图源:TechCrunch)

    据 TechCrunch 援引三位知情人士的消息,做开源智能体 Hermes 的 Nous Research 正在敲定新一轮融资。这轮由 Robot Ventures 领投,Union Square Ventures(USV)和其他几家知名机构也有份,公司估值到了 15 亿美元。据说这轮至少募 7500 万美元,而且投资人的兴趣高得有点出人意料。

    值得一提的是,这距离上一轮 5000 万美元的 A 轮才过去不到三个月。Nous Research 方面拒绝对外置评,USV 和 Robot Ventures 也没回 TechCrunch 的采访请求。但三个独立信源同时放出消息,基本可以确定这笔交易正在发生。

    一个从社区里长出来的团队

    Nous Research 2023 年才正式注册成立,创始团队是 Jeffrey Quesnelle、Karan Malhotra、Ryan Teknium 和 Shivani Mitra。它的根子其实更早,2022 年就从一个开源 AI 研究社区起步。换句话说,这家公司是先有了一帮愿意一起折腾模型的开发者,才慢慢变成一家公司的。

    在更早之前,它从 Paradigm、Robot Ventures、North Island Ventures、OSS Capital 和 Balaji Srinivasan 这些人手里累计拿了大约 7000 万美元。加上这一轮,资本对它下注的逻辑很清楚:大家想赌”开源智能体”会不会成为下一个被巨头盯上的赛道。

    Hermes 到底做对了什么

    故事的关键在 Hermes。OpenClaw 那个能在本地电脑上帮你跑任务、一度刷屏的 Agent 火了之后没几周,Nous Research 就推出了自己的对标产品。它也是跑在你自己电脑上的智能体,能替你办事,但有一个挺关键的区别:Hermes 出厂就带着一批”技能”——网页搜索、写代码、理解图片,这些都不用你额外配置。

    更特别的是,它被设计成能从你的使用里自己学东西。你用得越多,它就越知道怎么把活儿干好,还会在没人干预的情况下,自己攒出新的技能文件。这种”越用越懂你”的路子,让不少开发者觉得它比单纯调个 API 要顺手。

    在 OpenRouter 今年 5 月 9 日的数据里,Hermes Agent 单日消耗的 Token 量冲到 2710 亿,排在所有智能体第一位,把 OpenClaw 都甩在了后面。

    它也能像 OpenClaw 那样,在 Telegram、Discord 这类聊天工具里跟你对话、给你发消息。对很多人来说,最大的吸引力是:你可以远程、全天候地让 AI 替你跑任务,不用一直盯在屏幕前。

    开源加上好上手,让 Hermes 在 GitHub 上攒下了相当吓人的人气:大约 21.4 万颗 star,接近 4 万个 fork。开发者既能把它装在个人电脑上,也能丢到一台虚拟服务器上去跑。

    钱要花在哪,以及那个绕不开的问题

    除了 Hermes,Nous Research 还发了一些专攻编程和数学的语言模型,也搭了一张去中心化的网络,让贡献者把自家的硬件接进去,用于算力和训练。

    它还给了不想折腾环境的用户一个云端托管版,按月付费,档位从 20 到 200 美元不等。几位消息人士说,新一轮的钱主要就是用来把 Hermes 的产品和商业模式再往前推一推。

    这自然引出那个老问题:一个打着”开源、免费”旗号的智能体,真能靠订阅养活自己吗?Hermes 目前仍是 MIT 协议、官方也说”永久免费”,但五个月里两轮融了上亿美元,回报总得有出处。云端那个付费档,大概率才是收入真正落地的地方。对习惯自己托管的人来说,未来免费版和云端版会不会慢慢拉开功能差距,值得盯一盯。