标签: AI

  • DeerFlow:字节跳动开源的超级智能体运行时,77.8K Stars 登顶 GitHub Trending

    DeerFlow:字节跳动开源的超级智能体运行时,77.8K Stars 登顶 GitHub Trending

    DeerFlow

    项目简介

    DeerFlow(Deep Exploration and Efficient Research Flow) 是字节跳动开源的一款「超级智能体运行时(Super Agent Harness)」——它把沙箱、记忆、工具、技能、子智能体和消息网关整合在一起,让 AI 智能体能够自主完成从几分钟到数小时不等的长程任务:研究、写代码、做报告、生成幻灯片,几乎无所不能。

    截至发稿,DeerFlow 在 GitHub 上已收获约 77,800+ Stars,并在 2026 年 2 月 DeerFlow 2.0 发布后一度登顶 GitHub Trending 榜首。

    环境要求与安装过程

    环境要求:Python 3.12+、Node.js 22+;推荐使用 Docker 部署(本地评估建议 4 核 8G,长期运行服务器建议 8 核 16G 起)。Linux + Docker 是推荐的生产部署环境,macOS/Windows 更适合作为开发评估环境。

    快速开始:

    # 1. 克隆仓库
    git clone https://github.com/bytedance/deer-flow.git
    cd deer-flow
    
    # 2. 运行安装向导(约 2 分钟,交互式选择 LLM 提供商、搜索引擎、沙箱等)
    make setup
    
    # 3. 用 Docker 启动(推荐)
    make docker-init    # 首次拉取沙箱镜像
    make docker-start   # 启动服务
    
    # 之后访问 http://localhost:2026
    

    随时可运行 make doctor 检查配置并获取修复建议。官方推荐搭配 Doubao-Seed-2.0-Code、DeepSeek v3.2 或 Kimi 2.5 等模型运行。

    DeerFlow 与姊妹项目 LLM Space
    配套桌面工具 LLM Space:可原型化智能体思路、逐步检查每一步、回放失败并做性能基准测试

    核心功能

    • 技能与工具(Skills & Tools):技能是让 DeerFlow「无所不能」的核心。每个技能是一个结构化的 Markdown 能力模块,内置研究、报告生成、幻灯片制作、网页、图像与视频生成等;技能按需渐进加载,保持上下文窗口精简,对 token 敏感的模型也很友好。
    • 子智能体(Sub-Agents):主智能体可即时派生子智能体,每个拥有独立作用域的上下文、工具与终止条件,尽可能并行执行并汇总结构化结果,最终由主智能体综合成连贯输出。
    • 沙箱与文件系统:沙箱感知的执行环境,让智能体安全地运行代码、读写文件,处理更复杂的多步任务。
    • 长期记忆:跨会话持久记住你的画像、偏好与积累的知识——写作风格、技术栈、常用工作流,用得越多越懂你。记忆本地存储,完全由你掌控。
    • 开放集成:基于 LangGraph 与 LangChain 构建,支持 MCP Server、多模型提供商、Claude Code / Codex CLI 集成、IM 渠道、飞书/Lark 集成以及 LangSmith / Langfuse 等可观测性追踪。

    典型使用场景

    • 深度研究报告:作为最初的 Deep Research 框架,DeerFlow 擅长针对复杂主题自动检索、爬取、交叉验证并输出结构化研究报告,甚至生成播客音频。
    • 内容与办公自动化:社区已用它构建数据管道、生成幻灯片、搭建仪表盘、自动化内容工作流——一个 harness 覆盖多类办公与创作任务。
    • 长程复杂任务编排:借助子智能体并行拆解、沙箱执行与长期记忆,适合需要数分钟到数小时、涉及多步骤和多工具协作的自动化流程。

    推荐理由

    DeerFlow 最打动我的地方,是它从「一个 Deep Research 框架」进化成了「开箱即用又高度可扩展的超级智能体运行时」。2.0 版本完全重写,把智能体真正落地干活所需的基础设施——文件系统、记忆、技能、沙箱、子智能体——全部内置。你既可以拿来即用,也可以拆开改造成自己的东西。加之字节跳动背书、MIT 许可、活跃维护和庞大社区,无论是想学习智能体架构,还是想搭一套自己的自动化工作台,DeerFlow 都非常值得一试。

    下载地址

    开源许可:MIT|主要语言:Python|Stars:约 77.8K

  • 英伟达GPU要上月球了:月球车用上Jetson芯片,先得熬过零下170度的月夜

    英伟达的GPU已经铺满了地球上的数据中心,现在它盯上了一个新地盘:月球。做太空机器人的初创公司Lunar Outpost上周四宣布,他们的下一台月球车将用英伟达Jetson芯片来驱动激光雷达系统。如果顺利落地,这大概率是第一块登上月球表面的GPU。

    Lunar Outpost月球车测试
    Lunar Outpost的月球车正在测试中,它将搭载英伟达Jetson芯片(图源:TechCrunch)

    Jetson:英伟达家不太出名却很关键的那块芯片

    说起英伟达大家想到的都是Blackwell、Vera Rubin这些数据中心里的算力猛兽,Jetson的名气小得多。但在物理AI的世界里,它是台柱子——体积小、功耗低,专门让机器人在本地实时处理传感器数据,不用把信息传回服务器再等指令。对一台在月球坑里爬行的月球车来说,这种“当场反应”的能力就是生死线。

    Lunar Outpost的CEO Justin Cyrus说:“五年前我们的自主系统还是纯确定性的,现在是确定性模型加物理AI的组合。两套并行跑,我们要做的就是搞清楚物理AI能在哪些环节帮我们做没人做过的事。”

    最大的敌人:月球的夜晚

    把GPU送上月球,难的不是发射,是活下来。目前太空里的GPU大多待在近地轨道,有地球磁场罩着,环境相对温和。月球就不一样了,宇宙辐射直接照脸,温度随月相剧烈摇摆。Cyrus的原话是:“你的系统必须熬过月夜,而且得用极低的功耗熬过去。”月夜长达14个地球日,温度能跌破零下170度,这对消费级架构的芯片是极限考验。

    值得一提的是,英伟达在月球的布局不止这一步。它还和Firefly Aerospace——第一家把机器人安全降落在月球上的私营公司——达成合作,让Jetson在绕月卫星上处理图像数据,一边帮科学家绘制月球地图,一边追踪月面上越来越多的机器人。

    从探索到定居,机器人先行

    这一切背后是NASA的大盘子:花钱请私营公司先去月球探路,为2028年前后宇航员重返月球做准备。Lunar Outpost这台月球车会搭乘Intuitive Machines的着陆器,钻进环形山这些轨道上看不清的地方;再下一次任务要去一个叫Reiner Gamma的区域,那里有个让科学家困惑多年的磁异常。两次任务都计划年内搭猎鹰9号升空。

    • 近期计划:多台小型自主月球车陆续发射,验证GPU在月面的生存能力;
    • 远期目标:大型载人月球车Pegasus,可以直接搭载宇航员;
    • 卡脖子环节:Pegasus在等贝索斯Blue Origin的火箭,但那枚火箭今夏出了事故,复飞时间未知。

    Cyrus把公司的终极问题概括成一句话:怎么从“探索月球”走到“常驻月球”。他的答案是确定性模型加物理AI组成的机器人劳动力——人类要在月球上住下来,得先让机器人把粗活干了。而无论是月面机器人军团还是更科幻的太空数据中心,眼下都卡在同一件事上:一枚足够大的火箭。

  • Monday.com裁掉600人还说“与AI无关”,这套说辞今年已经出现20多次了

    这周三,项目管理软件公司Monday.com向美国证监会提交了一份文件:裁员约20%,600多人要走。理由写得很官方——重组计划、精简运营,然后是那个熟悉的词组:继续投资“AI驱动的增长战略”。

    有意思的是联合创始人Eran Zinman在领英上给员工的解释。他说这次裁员“不是为了降本,也不是要用AI取代人”,而是为了配合公司一年前定下的“AI优先”愿景。这话你品品——不是AI替代了你,只是公司为了AI不再需要你,听起来好像也没好到哪去。

    AI与科技裁员潮
    2026年,“因为AI”成了科技公司裁员公告里的高频词(图源:TechCrunch)

    一年裁掉14万人,AI成了万能理由

    TechCrunch整理了一份清单,今年把裁员和AI扯上关系的科技公司已经有20多家。《金融时报》的统计更扎心:2026年以来美国科技公司裁员已接近14万人,光是亚马逊、甲骨文、Meta、微软四家就砍了近5万个岗位——与此同时,这几家往AI数据中心里砸的钱以千亿美元计。

    《金融时报》还发现一个反直觉的数据:把裁员归因于AI的公司,在公告后30个交易日内的股价表现平均跑输纳斯达克近10%。资本市场并不买“AI提效”这套叙事的账。

    清单上的案例一个比一个典型。甲骨文在年报里白纸黑字写着:“AI技术在运营中的采用和部署,已经导致并可能继续导致裁员。”这是少数把话说透的。Coinbase的CEO Brian Armstrong更直接:工程师用AI几天就能干完过去一个团队几周的活,所以砍掉700人。PayPal则计划未来两三年裁掉20%、超过4500人,还专门成立了一个“AI转型与简化”团队来执行。

    嘴上说“不是AI”,身体很诚实

    更多公司选择了微软式的表述。微软7月砍掉4800个岗位时强调,这些人“不是被AI取代的”,但紧接着补了一句“AI正在改变工作的完成方式”。Atlassian的CEO说得更绕:我们的思路不是AI取代人,但AI确实改变了我们需要的技能组合。翻译过来就是:你没被AI替代,你只是不再匹配AI时代的岗位画像。

    • Meta:裁8000人的同时,把7000人转岗到AI相关职位,据说员工怨声不小;
    • Cloudflare:一口气裁20%共1100人,CEO直言裁掉的大多是“度量者”——那些管理和统计别人干活的中层;
    • IBM:滚动裁员上万人,约200个HR岗位直接被AI接管,但声称AI和混合云的初级岗位招聘要翻三倍;
    • Block:Jack Dorsey砍掉近一半员工(4000人),说智能工具带来了“全新的工作方式”。

    回到Monday.com。这家公司预计为重组付出4500万到5500万美元的费用,但同时维持2026年营收增长最高20%的指引。裁员20%、增长20%,两个数字放在一起,其实已经把这个时代科技公司的算盘说明白了:营收可以涨,人不能多。至于这到底是AI真提效了,还是借AI之名行降本之实,恐怕只有财报会一季一季地给出答案。

  • 从盟友到对手:微软开始教销售怎么讲OpenAI和Claude的短板

    从盟友到对手,企业 AI 市场竞争正在升温(示意图)
    从盟友到对手,企业 AI 市场竞争正在升温(示意图)

    微软这回把矛头对准了几个老朋友。据 Bloomberg 报道,周二一场内部会议上,微软高管给销售团队定了个新调子:在客户面前,把 OpenAI、谷歌、Anthropic 这些公司的 AI 产品,跟自家产品做负面对比。这场会被包装成新财年的战略动员,核心就一句话——我们的自研模型更省钱、更高效。

    “别人卖的是零件,我们卖的是完整的端到端系统。这就是我们在 27 财年都得走出去讲的故事。”——微软执行副总裁 Jay Parikh

    曾经好得能穿一条裤子

    Copilot 业务的执行副总裁 Jacob Andreou 更直接,据说当场做了个演示,把 Copilot 和 Anthropic 的 Claude 摆一块儿比。他的说法是,在微软自家办公软件里跑,Claude”更慢、更不准,还缺合适的安全集成”。TechCrunch 说已经联系微软和 Anthropic 求证,有回应会更新。

    公司教销售怎么埋汰对手,这本身不新鲜。真正扎眼的是微软现在盯上的,正是它这些年一直靠着给自家产品供模型的那几家。要知道,微软和 OpenAI 曾经好得能穿一条裤子——微软出钱出算力,换来对 OpenAI 的 API 和模型的独家使用权。今年 4 月两家改了协议,独家条款没了,OpenAI 从此能自由地卖给微软的对手。

    醉翁之意不在模型

    这层关系一变,销售的新话术也就说得通了。而且这不是孤例。本月早些时候就有报道说,微软一直在把 OpenAI 和 Anthropic 的模型从 Word、Excel 这些王牌应用里换下来,塞进自家模型,图的就是省成本。

    说到底,企业客户买 AI,买的从来不只是一个 GPT 或 Claude 的接口。他们还要接数据、接权限、接 Office、接 Teams、接审计、接安全策略。微软最想讲的故事就是:单独的模型只是零件,Copilot 加上 Microsoft 365,再加上整套云和安全,才是企业真正需要的完整系统。

    OpenAI 和 Anthropic 的真实压力

    这也点破了模型公司面前那道坎。它们在开发者和早期用户心里分量很重,可大企业的预算不只看谁在社交媒体上更火。CIO 们真正在意的是身份权限、数据不出域、合规审计、服务等级和总拥有成本。过去一年微软股价被投资者用”AI 到底能不能赚钱”反复拷问,把产品竞争力讲响一点,多半也是想给这些疑虑吃颗定心丸。

    • 联盟没散,只是在商业化压力下重新分工:微软要证明自己的 AI 投入能变成可控的利润。
    • 企业 AI 的竞争重心,正从”谁的模型最强”,转向”谁能掌控整张账单”。
    • 模型公司若补不齐权限、合规、审计这些企业刚需,就容易被云和办公巨头压回单纯的供应商位置。

  • OpenAI 卖起了硬件:230美元的Codex键盘,重点其实不在键盘

    OpenAI 与 Work Louder 联名推出的 Codex Micro 键盘
    OpenAI 与 Work Louder 联名推出的 Codex Micro 键盘

    OpenAI 这回动真格进硬件圈了,第一件产品是一把会发光的键盘,售价 230 美元,专门配它的 AI 编程助手 Codex 用。这把键盘叫 Codex Micro,是跟小众键盘厂牌 Work Louder 联名做的,主打给那些手里同时跑着一堆 AI 编程智能体的 ChatGPT 用户。

    与其在手机或桌面 App 里一个个管你的智能体,不如把这把键盘当成”智能体工作的指挥中心”。

    这把键盘到底特别在哪

    它有一排会亮灯的”Agent 键”,用不同的灯光状态告诉你每个智能体现在在干嘛;还有一组可自定义的命令键,把常用的 Codex 操作设成快捷键;旁边配了个摇杆,用来一键启动常用工作流。最有意思的是那颗旋钮,拧一拧就能调节智能体的”推理强度”——说白了,就是让它在一个任务上多花点时间和算力,还是快点过一遍。所有设置都通过 ChatGPT 桌面端来调。

    OpenAI 跟 TechCrunch 说了句大实话:这是限量联名款。翻译一下就是,它更像个摆在桌上好看的新奇玩意儿,不是奔着走量去的大众产品。

    真正的大招是另一个设备

    就在键盘发布前一天,Bloomberg 抖了个更劲爆的料。OpenAI 还在憋一个没公布的设备,描述听着挺玄乎:便携、没有屏幕、像个智能音箱,还带着”能自己动的机械部件”。屏幕没有、能移动、还便携,这几个词凑一块儿到底会长成啥样,现在谁也说不清,OpenAI 自己也没松口。报道还提了一句,这东西没定型,随时可能改。

    这个新设备据说由几位前苹果工程师操刀,而苹果眼下正因为商业机密的事,把 OpenAI 告上了法庭。

    苹果上周起诉 OpenAI,指控对方高层有意套取自家机密信息,还说 OpenAI 把这些信息用在了自己的硬件开发上。OpenAI 矢口否认。所以这把小键盘看着热闹,背后其实缠着一场关于硬件路线的官司。

    为什么这事值得多看两眼

    抛开官司不谈,Codex Micro 自己不一定能成大生意,但它挺准地戳中了下一代生产力工具的痛点。AI 工具现在最头疼的不是”能不能做”,而是用户压根不知道它在后台干啥、什么时候该自己插手、怎么把好几个任务同时管起来。一颗告诉你智能体是开着、停着还是在等指令的灯,可能比翻软件后台的仪表盘直观多了。

    • 对开发者:AI 编程工具的竞争,正从比模型能力,扩展到比状态管理、工作流和人机协作界面。
    • 对企业:以后一个员工要同时调度好几个智能体,权限、审计、任务状态和人工确认会比”聊天框好不好用”更要紧。
    • 对普通用户:这不是非买不可的键盘,但它把 AI 工具从聊天软件走向”工作控制台”的方向,摆到了台面上。

  • OpenSpec:为 AI 编程助手打造的规格驱动开发框架,写代码前先对齐需求

    OpenSpec:为 AI 编程助手打造的规格驱动开发框架,写代码前先对齐需求

    OpenSpec - Spec-Driven Development for AI Coding Assistants
    OpenSpec:为 AI 编程助手打造的规格驱动开发框架

    一、项目简介

    OpenSpec 是 Fission AI 开源的一款「规格驱动开发(Spec-Driven Development, SDD)」框架,核心理念是:在写任何一行代码之前,先让你和 AI 就「要做什么」达成一致。它为 AI 编程助手补上了一层轻量的规格层(spec layer),把原本只存在于聊天记录里的模糊需求,沉淀成结构化、可评审、可复用的 Markdown 规格文档。截至目前项目已在 GitHub 收获 62,500+ Stars,是当前最受欢迎的规格框架之一。

    二、安装要求与快速上手

    环境要求:Node.js 20.19.0 或更高版本(同时兼容 pnpm、yarn、bun、nix)。

    全局安装:

    npm install -g @fission-ai/openspec@latest

    初始化项目:进入你的项目目录并初始化,OpenSpec 会自动为你的 AI 助手写入配置。

    cd your-project
    openspec init

    开始与 AI 对话:直接在支持的编程助手中使用斜杠命令。

    # 还没想清楚要做什么?先探索,让 AI 读代码、权衡方案、成型计划
    /opsx:explore
    
    # 已经明确需求?直接提出变更提案
    /opsx:propose add-dark-mode
    
    # 提案通过后,逐条实施任务
    /opsx:apply
    
    # 完成后归档,规格自动更新
    /opsx:archive

    升级只需 npm install -g @fission-ai/openspec@latest,再在各项目内运行 openspec update 刷新 AI 指令即可。

    三、核心功能

    • 规格先行、代码后行:每个变更都会生成独立文件夹,包含 proposal.md(为什么做/改什么)、specs/(需求与场景)、design.md(技术方案)、tasks.md(实施清单),人和 AI 先对齐再动手。
    • 纯 Markdown、零学习成本:规格就是带具体场景(WHEN/THEN)的普通 Markdown,无需学习任何专用语法,AI 负责撰写、你负责评审。
    • 流式而非瀑布:任何产物随时可改,没有僵硬的阶段闸门(phase gates),支持从探索到实现的自由迭代。
    • 广泛的工具兼容:通过斜杠命令支持 25+(并持续增长)主流 AI 编程助手,包括 Claude Code、Codex、Cursor 等,不锁定任何 IDE 或模型。
    • 团队级 Stores(Beta):把规划放进独立仓库,通过 git push 共享,实现跨仓库特性、共享需求、代码未动先立规划——为多团队协作提供单一事实来源。
    OpenSpec Dashboard
    OpenSpec 内置仪表盘:可视化查看规格与进行中的变更

    四、典型使用场景

    • 为老项目做增量特性开发(Brownfield):OpenSpec 明确定位「不只是绿地项目」。在成熟代码库里加新功能时,用 /opsx:explore 让 AI 先读懂现有代码结构,再权衡最干净的实现路径,避免 AI 凭空乱改。
    • 个人开发者约束 AI「别跑偏」:单人开发时,规格层能让你和 AI 在单仓库上保持诚实——先评审计划再写代码,杜绝「模糊 prompt → 不可预测结果」的困境。
    • 企业团队跨仓库协作:一个特性横跨 API 服务、Web 前端和共享库时,用 Stores 把「一个变更、一份计划」共享给三个仓库;平台团队维护规格,产品团队只读引用,让每个编程 Agent 都能读到同一份需求,告别到处漂移的 Wiki。

    五、推荐理由

    体验下来,OpenSpec 最打动我的是它对「轻量」的坚持。同类的 GitHub Spec Kit 更全面但偏重——僵硬的阶段闸门、大量 Markdown、还要配 Python 环境;AWS 的 Kiro 很强却把你锁死在它的 IDE 和 Claude 模型上。OpenSpec 则用一条 npm install 就接入你已经在用的工具链,规格全是能随手改的纯 Markdown,真正做到了「有预测性但不繁文缛节」。

    官方建议搭配高推理能力的模型(如 Codex、Opus 系列)效果最佳,并注意保持干净的上下文窗口——实施前清理上下文,能显著提升产出质量。对于厌倦了「AI 一顿乱写、结果全靠运气」的开发者,OpenSpec 是一个成本极低、收益明显的习惯升级。MIT 许可,可放心用于商业项目。

    六、下载地址


    项目信息:Stars 62,500+ | Forks 4,325 | 主语言 TypeScript | 许可证 MIT | 首次发布 2025-08

  • 会写代码还会开玩笑:Cognition收购Poke,AI的“性格”成了新护城河

    你有没有想过,跟AI打交道时最打动你的,可能不是它有多聪明,而是它够不够”有意思”?做AI编程工具的Cognition显然是这么想的——它刚刚把Poke给收购了。Poke是那款”你可以像发短信给朋友一样使唤”的AI助手,背后公司叫The Interaction Company of California,这笔交易的估值落在”低九位数美元”区间。

    这笔收购透露出一个越来越被认同的判断:AI助手怎么跟人打交道,正变得和它底层模型有多强一样值钱。

    Cognition 收购 Poke
    Poke 以像朋友聊天的方式与用户互动(图片来源:Poke / The Interaction Company of California)

    买的不是技术,是”性格”

    Poke最让普通用户上头的地方,在于它回应请求的方式。它不像一个工具,倒更像个熟人——聊天时会用网络热词、开玩笑,语气随和得像老朋友。Cognition要把这套交互模式和”人格”搬到自家编程助手Devin身上;作为交换,Poke能用上Cognition的模型和基础设施,跑得更快、更稳。

    “如果同事都有点性格,总比一群只会干活的机器人强吧。”Interaction Company联合创始人Marvin von Hagen在接受TechCrunch采访时这么说,他也顺便确认了交易价格,”当你的同事同时还是软件工程师,他们也能抖个包袱,你会觉得挺有意思、挺开心的。”

    让Devin别那么像软件

    Cognition的算盘很清楚:让Devin用起来少一点”软件味”,多一点”同事感”。联合创始人Scott Wu在博客里写道,Interaction团队做出了一个”用户真心喜欢的智能体:它主动、懂你、聊起来还挺有意思,而这正是我们希望用户和Devin协作时的感觉”。他还提到,自己和另一位联合创始人Walden Yan早就是Poke母公司的天使投资人。


    用户很多,钱却不好赚

    Poke在2026年3月首次亮相,用户可以通过自己惯用的消息平台跟它对话,iMessage、短信、Telegram,部分地区还支持WhatsApp。大家用它处理旅行、健康、理财、日程、学习等各种琐事,其中最常见的还是管邮件、设提醒、列待办这类效率活儿。过去三个月,Poke上的消息往来超过了1亿条。

    但热闹归热闹,von Hagen坦言,尽管用户数已经到了几十万级别,Poke运行成本一直很高,赚钱并不容易。今年6月,它成了首个获准跑在苹果”Messages for Business”平台上的AI智能体——这个平台让企业能在苹果消息应用里用统一的方式处理客户沟通。

    明年才是真正的融合期

    短期内Poke不会有什么变化,今年内照旧留在苹果平台上。真正的动作要等到明年:Poke会开始用Cognition最新的软件工程模型SWE-1.7来处理部分任务,两款产品彻底合并的可能性也没被排除。

    • Cognition以”低九位数美元”收购Poke母公司Interaction Company
    • 看中的是Poke像朋友般会开玩笑、有人格的交互方式
    • Poke的”性格”将注入编程助手Devin,Poke则用上Cognition算力
    • Poke三个月内消息量破1亿条,但运行成本高、盈利难
    • 明年Poke将启用SWE-1.7模型,未来或由它编排多个Devin会话

    von Hagen还给出了一个更长远的设想:Poke擅长统筹调度,未来完全可以让它去编排多个Devin会话。要知道,现在Devin一次只能处理一个PR(拉取请求),而Poke还能帮它记住跨会话的任务。用他的话说——”有个记性好、一直在线的同事,挺好的。”

  • Anthropic半年连推五代模型:Opus 5比自家旗舰更便宜、限制更少还更好用

    Anthropic又出手了。上周五,它悄悄上线了Opus 5——旗下那条主力重量级模型线的最新一代。有意思的是,Opus 5比自家旗舰Fable 5个头更小,但价格更便宜、限制也更少,多数场景下反而更好用。

    Opus 5在官方给出的多项基准测试里,成绩甚至反超了体量更大的旗舰Fable 5。

    Anthropic Opus 5 发布
    Anthropic 上线 Opus 5 模型(图片来源:TechCrunch)

    半年连推五代,节奏快得有点吓人

    这个更新速度值得说一句。Opus 5距离5月28日发布的Opus 4.8才过了两个月。再往前看,Mythos 5、Fable 5、Sonnet 5全挤在6月上线。算下来,整个5系列里现在只剩最轻量的Haiku还没跟上,其余全部完成了换代。对开发者来说,这意味着几乎每隔几周就得重新掂量一遍:手头的活儿到底该调用哪个模型最划算。

    更会”自己检查作业”

    Anthropic在发布博客里反复强调,Opus 5″更擅长核验自己的工作成果,会耐心地反复迭代直到把任务做成”。他们举了个例子:给它一段并不完整的提示,让它写一条计算机视觉处理流水线,Opus 5能自己把缺的部分补齐、跑通。这种”不满足于交个半成品、会自己回头查漏补缺”的特质,恰恰是过去大模型最让人头疼的短板。

    松绑:隐私党最在意的那条限制没了

    Opus 5另一个卖点是”限制更少”。它摆脱了一直缠着Fable的不少束缚,其中最关键的一点:它和前代一样,不受那条针对Fable、Mythos的30天数据留存政策约束。这条政策此前让不少注重隐私的用户心里犯嘀咕,如今Opus这边算是给了个交代。

    当然,安全护栏没有完全撤掉,尤其是网络安全相关的敏感操作。比如,Opus 5会拦住你去扫描一个软件二进制文件里的漏洞,但允许你在源代码里找漏洞——因为后者更可能是出于防御目的。Anthropic预计,这套安全分类器在Opus 5上被触发的频率,会比Fable 5低大约85%,算是给能力稍弱的模型松了松绑。


    被护栏挡住时,不再直接报错

    针对护栏偶尔”误伤”正常请求这件事,Anthropic还顺手上了个新功能。用户可以选择开启一个叫”Automatic Fallbacks(自动回退)”的测试版特性:当某个提示触发了安全分类器,系统会自动把请求转给一个能力较弱、但不受限的模型来处理。这样一来,开启该设置的API用户拿到的就是一条能用的回复,而不是冷冰冰的报错信息。

    • Opus 5比旗舰Fable 5更小,却更便宜、限制更少,多数场景更实用
    • 距上一代Opus 4.8仅两个月,5系列只剩Haiku未更新
    • 更擅长自我核验与迭代,能从残缺提示补全计算机视觉流水线
    • 不受30天数据留存政策约束,安全分类器触发率比Fable 5低约85%
    • 新增Automatic Fallbacks测试功能,触发护栏时自动改用弱模型回应
  • ego lite:为 AI 智能体打造的最快浏览器,你和 AI 并行工作互不打扰

    ego lite:为 AI 智能体打造的最快浏览器,你和 AI 并行工作互不打扰

    ego lite

    一、项目简介

    ego lite 是一个”人和 AI 智能体并行工作”的浏览器——你在前台正常浏览,你的 AI 智能体(Claude Code、Codex、Cursor 等)在后台各自独立的 Space 里跑网页自动化任务,两者互不抢标签、互不干扰,而且任务完成更快、消耗的 token 更少。

    与 browser-use、Vercel agent-browser 这类”浏览器自动化框架”不同,它们本身不带浏览器、需要另开一个浏览器来驱动,登录态往往带不过去;ego lite 则是一整个为”你和智能体共用”而设计的浏览器,无需额外配置,智能体通过 ego-browser 就能直接用上你真实的登录态和标签页。

    二、安装要求与快速上手

    环境要求:目前仅支持 macOS(Apple Silicon / Intel 均可),Windows 与 Linux 已在路线图中;需要一个支持 skills 的智能体 CLI(Claude Code、Codex、Cursor 或自定义)。

    三种安装方式(任选其一):

    1. 直接下载 macOS 应用:从官网下载 .dmg,打开安装即可。安装后会自动把 ego-browser 技能加到每个智能体的 skills 目录。
    2. 用 npx 只装技能
      npx skills add citrolabs/ego-lite

      首次运行浏览器任务时,会引导你完成 ego lite 应用的安装。

    3. 让智能体自己装:把仓库地址粘给智能体,让它读取 skills/ego-browser/references/install.md 按步骤安装。

    首次启动时它只问一个问题:是否迁移 Chrome 数据。选”是”,你的智能体就继承了现有登录态、Cookie、扩展和书签。运行第一个任务时,在智能体 CLI 里输入 /ego-browser 加空格,然后用自然语言描述需求即可:

    ego-browser follow @ego_agent on x.com for me

    三、核心功能

    • 代码驱动而非命令行驱动,复杂任务更快更省 token:能力以 JavaScript 函数暴露给智能体,让它一次写出完整的多步脚本,而不是”调两个命令→看结果→再调两个”地反复循环。官方称复杂工作流比传统 CLI 方式快达 2.5 倍,工具调用次数大幅减少。
    • 每个智能体独享一个 Space:完全隔离的工作区,你在前台浏览、智能体在后台干活,互不干扰;随时可以查看哪个 Space 正在运行、接管或停止它。
    • 同一浏览器内多 Space 并行:Claude Code 在 10 个并行 Space 里丰富 10 条线索、Codex 在另外 5 个 Space 里抓取 5 个竞品网站,彼此不冲突,也不会抢走你的鼠标和标签页。
    • 业界最强的页面 Snapshot:得益于内核级定制,能可靠处理深层嵌套 iframe 等其他方案常常翻车的场景,为文本模型提供高质量的”页面视觉”输入。
    • 任何智能体都能通过 ego-browser 驱动:它是连接层,把浏览器暴露成一组页面内 JavaScript 工具(snapshot、fill、click、wait、navigate、capture),智能体写一段片段即可一次执行。

    四、典型使用场景

    1. 批量线索丰富 / 数据抓取:让 Claude Code 在多个并行 Space 里同时处理几十条销售线索,或让 Codex 并行抓取多个竞品站点信息,全程不打断你手头的浏览。
    2. 需要登录态的网页操作:因为继承了 Chrome 的 Cookie 与登录,智能体可以直接在你已登录的 X、后台系统、SaaS 面板里执行操作,省去每次重新登录的摩擦。
    3. 日常自动化小任务:像”帮我在 x.com 上关注某账号””填个表单””等页面加载完再截图”这类零散操作,一句自然语言交给智能体后台完成。

    五、性能对比

    官方在四个复杂网页自动化任务上,把 ego lite 与 Vercel 的 agent-browser 做了对比:每个任务最快提速达 2.5 倍,token 消耗显著更低,且任务越难差距越大。

    ego lite 与 agent-browser 性能对比

    六、推荐理由

    市面上大多数工具都能”自动化一个浏览器”,真正的区别在于:智能体拿到的是什么浏览器、你能否同时继续工作、以及它是为你已有的智能体服务还是绑死一个内置智能体。ego lite 的巧妙之处在于把”日常浏览器”和”智能体自动化”合二为一——你不用为了让 AI 干活而牺牲自己的浏览体验,也不必再维护一套独立的自动化环境和登录态。对于已经在用 Claude Code / Codex / Cursor 的人来说,一条 npx skills add 就能接上,几乎零迁移成本。目前它是免费、开源(MIT)、数据本地存储的,隐私上也更让人放心;唯一的门槛是暂时仅支持 macOS,Windows/Linux 用户可以先关注路线图。

    七、下载地址


    项目数据(截至发布时):⭐ 3,387 Stars | 🍴 164 Forks | 语言 JavaScript | 许可证 MIT

  • 卡兰尼克带着17亿美元回来了,连赶走他的Uber都掏了钱

    特拉维斯·卡兰尼克又搞了个大动作。他的机器人公司Atoms刚完成一轮17亿美元融资,安德森·霍洛维茨基金(a16z)领投,本·霍洛维茨本人将加入董事会。贝恩资本、Fifth Wall等机构跟投。

    但这轮融资里最扎眼的名字,是Uber。

    Uber联合创始人特拉维斯·卡兰尼克
    Uber联合创始人特拉维斯·卡兰尼克 | 图源:Getty Images

    被赶走的创始人,等来了老东家的钱

    2017年,卡兰尼克因为公司内部性骚扰、歧视投诉和有毒的职场文化,被迫辞去Uber CEO。九年过去,当年把他赶下台的公司,如今掏钱投了他的新事业。这种和解方式,很硅谷。

    其实两边早有眉来眼去。去年就有消息说,卡兰尼克想在Uber的支持下收购中国自动驾驶公司小马智行的美国业务,虽然据The Information报道,那笔谈判今年3月已经告吹。

    Atoms到底是家什么公司

    说白了,Atoms是卡兰尼克把这些年的摊子重新打包后的控股公司。离开Uber后他一直在做幽灵厨房生意CloudKitchens,今年3月宣布改名Atoms时,还顺手收购了Pronto——一家做重工业自动化的公司,掌舵人是他在Uber的老同事、自动驾驶行业的传奇争议人物安东尼·莱万多夫斯基。

    他还放话要进军矿业,把Pronto在矿区车辆上的自动化能力再往外扩。至于Atoms具体要造什么,卡兰尼克没细说,只留下一个说法:要给机器人造「底盘」(wheelbase for robots)。

    「从很多层面看,这轮融资是一桩未竟之事。我们在Uber开启、在CloudKitchens延续的『从比特到原子』的故事,将在Atoms完成收官。」——卡兰尼克在X上写道

    他把自己的野心讲得更玄乎:16年前他开始尝试把物理世界数字化,用软件去理解、预测、控制物理世界;现在要造「基于原子的计算机」——制造业是CPU,房地产是存储,交通运输是网络。


    a16z赌的是人,不是产品

    本·霍洛维茨发帖只用了三个词:「Travis回来了」(Travis Is Back)。他的逻辑很直接:改造经济中那些老旧、笨重的部门,需要一种稀有的创业者——既有拼命的干劲,又能横跨软件架构到机械工程的多个领域。「Travis就是那个人。」

    霍洛维茨给Atoms定的方向是:让人们在物理世界里更有生产力,就像Uber之于交通、计算机之于数字世界那样。这轮钱据说很大一部分会花在招人上。

    几个值得留意的点:

    • 物理AI是当下最热的赛道之一,从人形机器人到工业自动化,资本正在集体下注。
    • Atoms手里有CloudKitchens的地产运营和Pronto的重工业自动化,路径和纯做机器人本体的公司完全不同。
    • 卡兰尼克的表达依旧中二感十足——他说建设者要对抗的「最终Boss」是大自然本身,以及它对变革的顽强抵抗。

    产品还没影子,17亿美元先到账。这个行情下,能靠个人履历融到这个数的创业者,全世界也没几个。至于「机器人底盘」到底是什么,恐怕得等他下一条推文了。

    📎 原文来源:Travis Kalanick’s robotics company raises $1.7B, led by a16z(TechCrunch, Sean O’Kane)