标签: AI

  • Cline:跑在 VS Code、JetBrains 和终端里的开源 AI 编程 Agent(6.3万+ Star)

    Cline:跑在 VS Code、JetBrains 和终端里的开源 AI 编程 Agent(6.3万+ Star)

    Cline

    项目简介

    Cline 是完全开源、支持自带模型的 AI 编程智能体:它能在 VS Code、JetBrains 乃至命令行里帮你读写代码、运行终端、连接 MCP,并且每一步改动都以可审阅的 diff 呈现,让你随时把关。截至 2026 年中,项目已突破 6.3 万 Star、VS Code 安装量超 150 万,是开源 AI 编程赛道增长最快的扩展之一。

    安装要求和过程

    环境要求

    • Node.js 18+(CLI / SDK 形态需要)
    • VS Code 1.84+ 或任意 JetBrains IDE(2023.3+)
    • 一个 LLM API Key(Anthropic / OpenAI / Gemini / Bedrock / Groq / Ollama 本地模型等任意 OpenAI 兼容端点)
    • 可选:Docker(用于浏览器自动化沙箱)

    快速安装

    # 方式一:VS Code 扩展市场搜索 "Cline"(扩展 ID:saoudrizwan.claude-dev)一键安装
    # 方式二:JetBrains 插件市场安装 Cline 插件(IntelliJ / PyCharm / WebStorm / GoLand ...)
    
    # 方式三:命令行(交互式或 CI 无头模式)
    npm i -g cline
    
    # 方式四:嵌入自己的程序 / 集成
    npm install @cline/sdk

    所有形态都跑在同一个 Agent 内核(@cline/sdk)之上,在编辑器里搭好的工作流可无缝迁移到 CLI 与 SDK。

    核心功能

    1. Plan / Act 双模式:先用 Plan 模式探索代码库、提出方案并经你确认,再切到 Act 执行。这是 Cline 对”自动 Agent 自信地做错二十个文件”这一经典失败模式的答案——先规划、再行动,给你一个可在破坏发生前喊停的检查点。
    2. 全程可审阅的 Diff 与检查点:每一次文件改动都落成可审查的 diff;每个步骤都有检查点,可一键回滚到任意历史节点,远比”只能靠 git 历史兜底”的终端工具更可靠。
    3. 自带模型、零加价:填入自己的 API Key(Anthropic / OpenAI / Gemini / Bedrock / Groq / Ollama / LM Studio 或任意 OpenAI 兼容端点),直接付费给模型方,无中间商加价,模型随意切换。
    4. 浏览器自动化 + 终端执行:能导航 URL、截图、验证 UI 改动;在终端运行命令并实时响应输出,边干边盯 linter 与编译器报错。
    5. 完整 MCP 支持与 .clinerules:可接入数据库、API、设计工具等 100+ 现成 MCP server 扩展能力;并通过 .clinerules 文件让 Agent 遵守你的项目约定,而不是自创规范。

    典型使用场景

    • 想用 Cursor 级 Agent 能力却不想被订阅锁死:Cline 扩展本身免费,只为 LLM token 付费,模型可在 Anthropic / OpenAI / 本地 Ollama 之间自由切换。
    • 隐私要求严格的团队:直接接入本地 Ollama 模型,代码与上下文不出内网,满足合规需求。
    • 全栈开发验证 UI 改动:让 Cline 改完前端代码后自动开浏览器、截图、核对界面效果,把”改完—运行—看结果”的循环自动化。

    推荐理由

    我把 Cline 当作“带审批闸门的结对工程师”来用。和纯自动 Agent 相比,它每一步都先让你看 diff、看终端命令,再决定是否放行——这种”人在回路(human-in-the-loop)”的设计,把 AI 幻觉的破坏面压到了最低。再叠加自带模型、成本完全透明,以及 MCP 生态带来的近乎无限的扩展能力,Cline 几乎是 VS Code 生态里最值得长期持有的开源编程 Agent。如果你想在零订阅成本下获得接近 Cursor 的 Agentic 体验,它是不二之选。

    下载地址

  • Meta 的 AI 绘图翻车了:默认拿你的公开照片乱改,遭抵制后紧急下线

    上线几天就翻车

    Meta 上周高调推出了一款叫 Muse Image 的 AI 绘图工具,由旗下的”超级智能实验室”打造,能在 Meta AI、Instagram 快拍和 WhatsApp 里免费用。功能本身不稀奇,能生成各种搞怪卡通图。真正惹众怒的是其中一个设定:只要对方的 Instagram 是公开账号,你在提示词里 @ 一下,就能直接拿对方的照片当素材去生成新图——而且 Meta 默认不会通知照片主人。

    Meta Muse Image 争议
    Muse Image 因默认调用公开照片引发隐私争议后,相关功能被紧急下线(图源:TechCrunch)

    “默认开启”的老毛病又犯了

    消息一出,用户和经纪公司(包括 CAA)立刻反弹。TechCrunch 还专门写了教程教大家怎么关掉这个功能。周五,Meta 自己发博客认错,说本意是提供好用的创作工具、让用户能控制自己的公开内容被怎么用,”但我们听到反馈,这个功能没达到预期,所以不再提供”。说白了,就是先默认全开、被骂了才下线。

    “我们的本意是提供一个有用的创作工具,并让人们能控制自己的公开内容是否被这样引用。我们听到了反馈,这个功能没达到预期,所以它不再可用。”——Meta 官方博客

    关掉开关,也不算真正干净

    更让人不舒服的是,即便你手动关掉”允许他人用我的内容生成 AI 图”的开关,它也只管以后,已经拿你照片生成出来的图并不会被删掉。想要彻底干净,只能把账号设成私密——可那是公开账号的人才会有的麻烦。AI 接入社交平台以来,拿名人的脸生成裸图的滥用就没停过,这次的争议不过是又一次提醒:把别人的照片默认当成免费素材,迟早要出事。

    • 争议点:公开照片被 @ 引用生成图,且照片主人收不到任何通知。
    • Meta 回应:功能”没达到预期”,已从 Instagram 移除。
    • 残留风险:已生成内容无法撤回,只能靠设私密账号规避未来使用。

  • OpenAI 首款硬件曝光:没有屏幕,但会自己”动”的 AI 伙伴

    一台没有屏幕的”音箱”

    OpenAI 一直说想做硬件,外界猜了很久,有人说它要出手机,有人说要做 AR 眼镜。结果彭博周二的一则报道把谜底揭开了:这家公司的第一款实体产品,可能是一台没有屏幕、还能自己动的智能音箱。它现在还在开发阶段,内部把它定位成”住在家里、像人一样的 AI 伙伴”,能跟 ChatGPT 同步,顺手帮你打理家里的各种 AI 服务。

    OpenAI 首款硬件概念
    据彭博报道,OpenAI 首款硬件是一台无屏、可移动的 AI 智能音箱(图源:TechCrunch)

    它不只是听话,还会”主动”

    跟我们熟悉的智能音箱不一样,这台设备被描述成有”性格”。它会随着时间慢慢了解主人,越用越懂你,提供的服务也越来越个性化。更特别的是,它还能接入你的数字生活——比如你的邮件。彭博在报道里专门提到,机器里塞了”能自己动的机械部件”,目的是让它”感觉像一个伙伴,成为 ChatGPT 的实体化身”。一台音箱满屋子自己挪位置,这画面确实有点科幻。

    “我们的新产品和苹果今天市场上的任何东西都有明显区别,不太可能侵犯苹果的商业机密。”——彭博援引知情人士称

    前苹果的人,和苹果的官司

    有意思的是,这款设备背后有不少来自苹果的老将,据说当年打造 iPhone 和 Mac 的工程师也参与了进来。可偏偏上周,苹果刚把 OpenAI 告了,指控它窃取商业机密,还放话称这不过是”冰山一角”。OpenAI 当然否认了。两种说法撞在一起,让这台还没露面的硬件多了几分戏剧性。

    • 无屏设计:把交互彻底交还给语音,主打更自然的对话体验。
    • 可移动:内置机械结构,能从”被动等待指令”变成”主动靠近你”。
    • 消费级 AI 硬件升温:Hark 这类公司五月就拿到了 7 亿美元融资,估值冲到 60 亿美元。

  • AstrBot:打通 15+ 聊天平台的开源全能 AI Agent 机器人框架

    AstrBot:打通 15+ 聊天平台的开源全能 AI Agent 机器人框架

    项目简介

    AstrBot 是一个开源的「全合一 AI Agent 聊天机器人平台」,把主流即时通讯(IM)应用、大语言模型(LLM)、插件与 Agent 能力打通,让你在自己常用的聊天软件里快速搭建可投产的 AI 应用——个人 AI 陪聊、智能客服、自动化助手、企业知识库都不在话下。它甚至被官方定位为 OpenClaw 的开源替代品。项目采用 Python 开发,基于 AGPL-3.0 协议完全开源,目前已收获 37.5K+ Stars

    安装要求和过程

    环境要求:Python 3.12+(推荐用 uv 管理环境)、Docker(可选,用于生产部署)、以及一台能联网的服务器或本机。AstrBot 本身跨平台,支持 macOS / Windows / Linux。

    快速安装(三种主流方式):

    • 一键部署(uv,最推荐):
      uv tool install astrbot --python 3.12
      astrbot init   # 首次运行初始化环境
      astrbot run
    • Docker 部署(生产推荐):官方提供 Docker / Docker Compose 方案,镜像为 soulter/astrbot,按文档挂载配置目录即可稳定运行。
    • 桌面端 / 面板部署:可使用 AstrBot App、AstrBot Launcher,或在宝塔 / 1Panel / CasaOS 等面板一键安装;Arch 用户还能通过 AUR:yay -S astrbot-git

    启动后打开 WebUI,绑定你的 LLM API Key(OpenAI / DeepSeek / Gemini / 通义 / 智谱等均可),并接入想用的 IM 平台适配器,即可开始对话。

    AstrBot 运行截图

    核心功能

    • 全平台 IM 接入:原生支持 QQ、企业微信、飞书、钉钉、微信公众号、Telegram、Slack、Discord、LINE 等 15+ 平台,官方与社区适配器持续扩展,几乎覆盖所有常用聊天场景。

      角色扮演与情感陪伴

    • 完整 Agent 能力栈:内置 LLM 对话、多模态、Agent、MCP、Skills、知识库、人设设置与自动上下文压缩,并可直接对接 Dify、阿里云百炼、Coze 等 Agent 平台。

      通用 Agent 能力

    • 主动 Agent(Proactive Agent):支持定时任务、订阅推送、事件触发的”主动出击”式智能体,而不只是被动应答。

      主动 Agent

    • 1000+ 社区插件:插件市场提供一键安装的上千款插件,从实用工具到娱乐玩法即装即用,轻松扩展机器人能力边界。

      1000+ 社区插件

    • 安全沙箱与 Web ChatUI:内置 Agent Sandbox 隔离执行代码与 Shell 调用,配合 Web ChatUI 与 Web 搜索,开箱即用地提供安全可控的对话体验;同时提供国际化(i18n)支持。

    典型使用场景

    1. 个人 AI 陪聊 / 情感陪伴:把 AstrBot 接入自己的 QQ 或 Telegram,设定专属人设与记忆,打造一个懂你、能长期陪伴的”数字伙伴”。
    2. 社群 / 社群运营智能助手:在 Discord、Slack 或 QQ 群里部署机器人,承担自动问答、公告推送、定时提醒,并借助 1000+ 插件实现抽奖、签到、信息查询等玩法。
    3. 企业知识库 / 智能客服:接入飞书、企业微信或钉钉,挂载内部知识库,让 AI 在员工聊天窗口里直接回答制度、流程、产品问题,降低人工客服压力。

    推荐理由

    我在几个社群里都用过 AstrBot,最直观的感受是“省心”:一个平台同时管着 QQ、Telegram、Discord,不用为每个渠道各写一套机器人;WebUI 配置直观,插件市场点一下就能装,非重度开发者也能在半小时内跑起来。它对国内生态(QQ、微信系、飞书、钉钉)的支持尤其到位,这是很多国外同类项目做不到的。Agent Sandbox 让”让 AI 跑代码”这件事变得可控,而不是裸奔执行命令。如果你正想给自己的社群或团队加一个 AI 入口,又不想被某个闭源 SaaS 绑定,AstrBot 是目前最成熟、社区最活跃的开源方案之一。

    下载地址

    * 本文数据基于 2026-07-22 抓取:Stars 37,590 / Forks 2,623 / 协议 AGPL-3.0 / 语言 Python / 最近更新当日。

  • 马斯克把Grok塞进Outlook:收件箱里多了个AI副驾

    马斯克旗下的 xAI(公司主体挂着 SpaceXAI 的名字)在 7 月 21 日又往前迈了一步。继给 Word、Excel、PowerPoint 都接上 Grok 之后,它正式把这款 AI 带到了 Outlook,发布了一款面向 Microsoft 365 的邮件插件 Grok for Outlook。所有付费的 X 和 SuperGrok 用户都能用,直接从 Microsoft Marketplace 装就行。对那批天天在邮箱里「打仗」的职场人来说,这相当于把 AI 直接按进了收件箱的最前线。

    它到底能帮你干嘛

    功能设计得很实在,全是围着「邮件效率」转。它能自动总结冗长的对话串,你不用再翻几十封往来邮件去拼前因后果;能按你自己的说话语气起草回复,让一键回邮不再千篇一律;还能干一件很多人最头疼的事——收件箱大扫除:归档已经聊完的对话、把噪音信息过滤掉、自动标出那些你真正得回的邮件。

    不止正文,连附件和外网都管

    除了处理邮件本身,这个插件还能读取附件里的内容,并且实时去搜网页和 X 平台的信息。关键是,所有这些动作都不用你跳出 Outlook 界面。当你需要确认邮件里提到的一个链接或者一组数据时,不用再开浏览器,在插件里就能顺手查完。这种「在哪做事就在哪给辅助」的嵌入感,恰恰是 xAI 在办公场景里想铺开的一条产品线。

    从文档、表格、演示到现在的邮件,Grok 正在一个一个吃掉微软 365 的核心应用。对用户来说,它不是多了一个新工具,而是在原有工作流里长出来的一层 AI。

    权限给得很大,但发出去前你说了算

    装插件时,你会看到一个 OAuth 授权界面,列出它要拿的权限范围:读邮件、写邮件、替你发邮件、读写日历等等。听起来权限不小,但 xAI 在这点上留了一道安全阀——所有 Grok 生成的邮件都先躺在「草稿箱」里,必须你亲手点发送才会真的出去,它不能自己替你群发。xAI 也表示不会拿你的邮件数据去训练模型。对企业来说,IT 管理员还能通过 Azure AD / Entra 后台集中管控这个插件,分阶段推给员工,不想要了也能一键收回权限。

    这步棋,图的是什么

    把视野拉开来想,Grok for Outlook 不是孤立的一个功能。它折射出 xAI 的一个清晰意图:把 AI 做成一层贴着现有办公软件走的「基础设施」,而不是另起炉灶做一个独立应用。谁的工作流先被它嵌进去,谁的切换成本就越高,后面越难被替代。在微软自家 Copilot 已经铺开的情况下,马斯克这一脚踩进来,Office 里的 AI 助手之争算是正式变成了多角战。

    • 这不是免费新功能,得先有 X Premium 或 SuperGrok 订阅,没有单独的 Outlook 收费。
    • 企业部署前最好先测一下数据防泄漏(DLP)和敏感标签的执行情况。
    • 对普通用户最大的甜头,是把「拒绝会议」「确认日程」「从 PDF 抽日期」这类重复活儿交给它。

    邮件可能是普通人每天接触 AI 最高频的入口。当 Grok、Copilot 们争先恐后钻进同一个收件箱,真正分高下的不会是「能不能写」,而是「放不放心让它看、让它动」。这一步,xAI 用草稿箱和权限回收留了退路,但信任这件事,终究要用户在真实邮件里一封一封攒出来。

    Grok for Outlook 插件概念图
    Grok for Outlook:嵌入收件箱的 AI 邮件助手(配图由 AI 生成)
  • 前Google Brain研究员用AI智能体替非英伟达芯片写底层代码

    上个月,Jeremy Nixon 悄悄把一家公司推到了台前。这家叫 Infinity 的初创公司刚宣布拿到 1500 万美元融资,估值 1 亿美元,投资方里除了 Touring Capital、Principal VC,还有来自 OpenAI 和 Anthropic 的研究员个人。Nixon 本人是个有意思的人——他曾在 Google Brain 做研究,也是黑客社区 AGI House 的创始人。真正让外界注意到他的,是他抛出的一个有点狂的念头:AI 系统本身,能不能成为一种「元技术」,自己发明新东西。

    从「自动发明算法」到「自动写芯片代码」

    早在做 Infinity 之前,Nixon 就捣鼓过一个叫 Omega 的机器学习算法。它的特别之处在于,能自己创造出新的机器学习算法,然后在一个反馈回路里自动评估好坏。那次成功让他开始琢磨:这套思路能不能挪到别的地方?他盯上了硬件——自动化系统或许也能生成那些让芯片跑得更高效的底层代码,比如内核(kernel)这一类东西。

    英伟达的护城河,一半是软件

    这里得先说清楚一件事。很多人以为英伟达厉害是因为芯片性能好,这当然没错,但另一半答案藏在 CUDA 里。CUDA 是英伟达的软件层,让原本为图形设计的 GPU 能当通用处理器用,PyTorch、TensorFlow 都建在它上面。开发者用 Python 写应用,默认就跑在英伟达的卡上。问题是,绝大多数应用层公司既没资源也没本事自己写内核、把应用移植到别的芯片上。

    Nixon 想做的,是把 CUDA 这套「让芯片好用」的活儿交给一个 AI 智能体来干,而且不挑芯片——SRAM、GPU、手机芯片、Systolic Array 统统能适配。

    一个会自己改自己代码的智能体

    Infinity 的核心产品叫 Ignition,是个 AI 研究智能体。它的任务很硬核:为那些想挑战英伟达的芯片写 AI 推理所需的底层代码。它会测试、调试,测量硬件在这套代码下跑得快不快,不行就自动重写,直到性能提上去。整个系统是自优化的,会持续学习、自我改进,而且能适应不同的芯片架构,不管对方是不是闭源的。

    不收授权费,只抽性能提升的成

    这种打法听起来很「AI 原生」。Nixon 说,客户里已经包括 AI 芯片公司 D-Matrix——一家立志挑战英伟达的玩家,同时 Infinity 还在和其他大芯片厂、云厂商谈。更妙的是它的收费模式:不收前置授权费,而是从性能提升和成本节省里抽成,衡量的指标很直接,就是每秒令牌数(tokens per second)的变化。在一个案例里,这个智能体把原本可能要花几年或几个月的过程,压缩到了几小时或几天。

    • Infinity 不是第一家想拆英伟达墙角的公司,但它走的是「逐产品蚕食」的软件路线,而不是去造另一块卡。
    • 人类并没有被踢出局,而是给智能体定大方向,繁琐的体力活交给它。
    • 公司目前只有 26 个人,分布在设计、运营和工程岗。

    把视角拉远一点,Infinity 其实是这一波「AI 基础设施去中心化」浪潮里的一朵浪花。当训练和推理不再被绑死在某一家厂商的软件栈上,更多芯片公司才有机会把货卖出去。这条路能不能走通,取决于 Ignition 真能在不同架构上稳定逼近 CUDA 的水平——这是个需要时间验证的承诺,不是今天就能盖棺的事。

    Infinity 创始人 Jeremy Nixon
    Infinity 创始人 Jeremy Nixon(图源:TechCrunch)
  • OpenAI 给小生意人递了把 AI 伙计:ChatGPT for Small Businesses 上线

    OpenAI 周二扔出一个叫 ChatGPT for Small Businesses 的计划,瞄准的是那种一个人顶五个岗位的小老板——既要当营销、又要做会计、还得管销售和战略。他们的想法很朴素:与其让这些人在工具面前抓瞎,不如把刚发布的 ChatGPT Work 智能体直接塞进他们的日常。

    不是卖工具,是手把手带

    这个计划里有一堆落地的东西:针对具体场景的线上 webinar、OpenAI Academy 牵头在各城市做的线下培训、可随时回看的图文指南,还有一票合作伙伴的插件集成。ChatGPT Work 是 7 月 9 日和 GPT-5.6 一起推出的,本质上是个住在 ChatGPT 里的智能体,能啃下分析预算、写营销物料、准备会议这类多步骤的活儿——前提是老板愿意给它读文件、接应用的权限。

    一个人、一支 lean 的团队、时间有限、资源匮乏,每个老板都被期待身兼数职。我们相信 AI 能改变这一点,它像放大器一样延伸个人的能力。 —— OpenAI 公告

    把活儿交给插件

    OpenAI 拉来了 Dropbox、Shopify、Intuit、Slack、Atlassian 这些老面孔做集成,把小企业常见的流程直接打包成可复用的智能体插件。去年那轮 AI Jam 里,78% 的参与者当天就搭出了能用的 AI 工作流,42% 的人每周省下五个小时以上——这组数字大概就是 OpenAI 现在想放大的。非营利机构 Community Solutions 的 Adam Ruege 就说,他现在每天用连着 Google Drive 和 Gmail 的参谋长智能体盯日程、备材料。

    • 线上 webinar 加城市线下培训加图文指南,手把手教
    • 打通 Dropbox、Shopify、Intuit、Slack 等常见工作流
    • 目标:把 9 亿免费用户里的更多小老板变成付费 AI 用户

    背后是一门生意账

    CFO Sarah Friar 一点没藏着对大企业客户的野心。OpenAI 现在估值 8520 亿美元、等着上市,可赚的仍比花的多;反观对手 Anthropic,二季度刚透出要首次盈利的信号。有意思的是,Friar 2024 年加入时说过,ChatGPT 每周 9 亿用户里 95% 一分钱不付,但来自企业的收入占比已经翻倍到大约 40%。把小老板们养成付费的 AI 重度用户,显然是这个缺口的解法之一。

    OpenAI ChatGPT for Small Businesses 计划
    OpenAI 用 ChatGPT Work 智能体帮小企业主把杂活交给 AI

  • Poolside 把 Laguna S 2.1 甩了出来:西方现在最能打的开放权重编程模型

    一家叫 Poolside 的旧金山小实验室,周二把新模型 Laguna S 2.1 端上了台面。这事有意思的地方不在于它有多大,而在于它小到能塞进一台桌面级机器,却把好几款数倍于己的闭源模型比了下去。

    九周造出来的小钢炮

    Laguna S 2.1 总参数 1180 亿,但每次推理只激活 80 亿,上下文窗口拉到了 100 万 token。Poolside 说它从 5 月 22 日才开始预训练,用 4096 张 H200,不到九周就发布了。在长周期编程基准 Terminal-Bench 2.1 上拿到 70.2%,比 1.6 万亿参数的 DeepSeek-V4-Pro-Max(64.0%)和 5500 亿参数的英伟达 Nemotron 3 Ultra(56.4%)都高;SWE-Bench Multilingual 上它拿到 78.5%,SWE-Bench Pro 公开集 59.4%。不到三个月,Poolside 从 M.1 一路连发三款模型,节奏快得不像一家小实验室。

    我们在这版模型上做的,不是堆更多智能,而是改进那些通向更强模型的行为:更多验证、更少想当然、不早早宣告胜利,也更持久。 —— Poolside 应用研究联合负责人 Pengming Wang

    把权重敞开给人看

    最关键的一点是,它是开放权重的,发布当天就挂在 Hugging Face 上,采用 OpenMDW-1.1 许可,连 BF16、FP8、INT4 各种量化版本都给了。模型小到能跑在单台英伟达 DGX Spark 上,也就是说企业可以把高频的编程智能体任务从按量计费的 API 搬到自己掌控的硬件里。

    • 1180 亿总参数、每次只激活 80 亿,上下文窗口 100 万 token
    • 开放权重,发布即上 Hugging Face,可本地跑在单台 DGX Spark
    • 西方近一年来首个有竞争力的开放权重编程模型

    西方的开源空窗

    Poolside 把这个发布摆进了一个更大的叙事里:过去一年,开发者明显转向能下载、能审查、能在自家基础设施上跑的开放权重系统,而这一类里能打的几乎都来自中国实验室——DeepSeek、通义千问、Kimi、智谱、MiniMax、腾讯混元。西方上一次放出开放权重,还是去年 8 月 OpenAI 的 gpt-oss-120b。联合 CEO Jason Warner 的话很直白:西方需要能信任、能运行、能在其上构建的开放权重模型。

    顺带一提,Poolside 把评测的完整轨迹也公开了,算是给开放二字加了点诚意。对政府、国防这类高度监管的客户来说,能自托管意味着敏感代码和数据不出自己的环境,这正是 Poolside 这门生意的根基。

    Poolside Laguna S 2.1 模型发布
    Poolside 发布的 Laguna S 2.1 开放权重编程模型

    📎 原文来源:Poolside 发布 Laguna S 2.1
  • Archon:把 AI 编码变成确定性工作流的开源 harness 构建器

    Archon:把 AI 编码变成确定性工作流的开源 harness 构建器

    Archon 封面

    Archon logo

    项目简介

    Archon 是首个开源的 AI 编码 harness(流程编排)构建器——用 YAML 把“规划→实现→校验→审查→提 PR”等开发流程固化下来,让 AI 编码智能体每次都按同一套确定性步骤执行,把“看模型心情”变成“可重复、可提交”的工程实践。

    如果说 Dockerfile 之于基础设施、GitHub Actions 之于 CI/CD,那么 Archon 之于 AI 编码工作流。可以把它理解为“面向软件开发的 n8n”。

    安装要求和过程

    环境要求

    • 运行时Bun(macOS/Linux/Windows 均支持)
    • AI 编码助手:Claude Code(默认),或 Codex、Pi
    • GitHub CLIgh):用于自动建分支、提 PR
    • 系统:macOS / Linux / WSL / Windows(PowerShell);数据库默认 SQLite,可切 PostgreSQL

    快速安装(30 秒,已有 Claude Code)

    # macOS / Linux
    curl -fsSL https://archon.diy/install | bash
    
    # Windows (PowerShell)
    irm https://archon.diy/install.ps1 | iex
    
    # 或 Homebrew
    brew install coleam00/archon/archon

    ⚠️ 编译版二进制不含 Claude Code,需单独安装并指定 CLAUDE_BIN_PATH;Docker 镜像则已自带。

    完整初始化(5 分钟,推荐)

    git clone https://github.com/coleam00/Archon
    cd Archon
    bun install
    claude          # 在 Claude Code 里说:“Set up Archon”

    引导向导会配置凭证、选择接入平台,并把 Archon skill 复制到你的目标仓库。之后在你的项目里直接对编码智能体说 “Use archon to fix issue #42” 即可。

    核心功能

    • 确定性、可重复:开发流程写成 YAML 工作流,固定阶段与校验门(validation gate),每次运行同一套顺序——计划、实现、校验、审查、PR,结果一致。
    • 隔离并行:每个工作流运行都在独立的 git worktree 中,可同时修 5 个 Bug 而互不冲突。
    • 发射后不管(Fire & forget):启动一个工作流就去忙别的,回来已经是一个带审查意见的成品 PR。
    • 确定性节点 + AI 节点可组合:bash 脚本、测试、git 操作等确定性步骤由机器精确执行;规划、代码生成、审查等只在 AI 真正增值的地方运行。
    • 随处可跑、全员共用:工作流定义在 .archon/workflows/,提交进仓库后,从 CLI、Web UI、Slack、Telegram 到 GitHub 表现完全一致;内置 19 个常用工作流,也可自定义。

    为什么需要 Archon

    典型使用场景

    场景一:自动修 GitHub Issue

    对智能体说 “Use archon to fix issue #42”,自动触发 archon-fix-github-issue 工作流:分类 → 调研/规划 → 实现 → 校验 → 提 PR → 智能审查 → 自我修复,全程无需你盯着。

    场景二:从想法到 PR(Idea-to-PR)

    archon-idea-to-pr 把“给设置页加暗黑模式”这类想法,自动走规划 → 循环实现(直到测试通过)→ 审查 → 提 PR → 5 个并行 reviewer → 自我修复,产出完整 Pull Request。

    场景三:团队远程异步协作

    接入 Slack / Telegram / GitHub / Discord 后,在群聊里丢一句话就能触发工作流;所有平台的活动汇聚到同一个 Web 仪表盘(Mission Control),实时查看进度与历史。

    Archon 工作原理

    推荐理由

    我自己最吃这一套的点在于“把流程的所有权拿回自己手里”。平时让 AI 智能体修 Bug,跑十次九个样:有时忘了跑测试、有时 PR 描述敷衍、并行修多个问题时还互相踩。Archon 用一份 YAML 把团队认可的工程纪律写死,AI 只在需要创造力的节点上发挥作用,其余交给确定性执行——稳定、可审计、可复现。它不绑定某家模型,Claude / Codex / Pi 随便换;Web 仪表盘 + 多平台接入也让“远程派活、回来收 PR”变得很顺。对想把 AI 编码真正纳入研发流程的团队,这是目前最像样的开源方案之一。

    下载地址

  • 谷歌一口气发三款Gemini,但最想要的Pro版,又鸽了

    谷歌 DeepMind 在周二丢出了三款新模型:Gemini 3.6 Flash、3.5 Flash-Lite,以及 3.5 Flash Cyber。光看名字像是在挤牙膏,但这次的重心很明确——不跟你卷参数,卷的是便宜、快、稳。

    先说当家花旦 3.6 Flash。谷歌管它叫“主力模型”,在写代码、知识工作和多模态上都有提升,关键是把 token 消耗量砍了最多 17%,比上一代 3.5 Flash 更省钱。3.5 Flash-Lite 则是这个档位里最划算的一个,主打一个“量大管饱还便宜”。

    谷歌说,这一波发布的核心,是给那些“大规模部署 AI 智能体”的客户,交付效率、延迟和可靠性。

    有一款,专门给搞安全的

    三款里最特别的,是 3.5 Flash Cyber。它是为找漏洞、修漏洞专门微调出来的模型,价格也压得不算离谱。但谷歌给它加了道门:这款只面向政府和“可信合作伙伴”,走限量试点,不公开随便用。把安全能力收在门槛后面,既说明了它的分量,也透着谷歌对这类敏感能力的谨慎。

    真正的大招,又没来

    这次发布的看点,一半在发的东西,一半在没发的。所有人都在等的旗舰 Gemini Pro,这次依然缺席。上一次 Pro 更新还是今年二月。这几个月里,对手可没闲着:OpenAI 出了 GPT-5.5,正在铺 GPT-5.6;Anthropic 连发 Claude Opus 4.8、Claude Sonnet 5,还把前沿的 Fable 5 放开了一部分。发布节奏一对比,压力给到了谷歌这边。

    其实谷歌五月就吊过胃口,说 Pro 版“已经在内部用上了,下个月就推”。结果上周彭博社报出来:3.5 Pro 因为达不到内部性能目标,发布被往后拖了。产品负责人 Logan Kilpatrick 周二在 X 上说,3.5 Pro 正在和合作伙伴一起测,“希望很快落地”,顺带还透露团队已经启动了迄今最雄心勃勃的 Gemini 4 预训练。

    谷歌 Gemini 模型
    谷歌这次发的是 Flash 系列,旗舰 Pro 仍缺席(图源:TechCrunch)
    • Gemini 3.6 Flash:主力模型,token 用量最多降 17%,比 3.5 Flash 更便宜
    • Gemini 3.5 Flash-Lite:同档最省,适合高吞吐场景
    • Gemini 3.5 Flash Cyber:专攻漏洞挖掘与修复,仅限政府及可信伙伴试点
    • 旗舰 Pro 继续缺席,3.5 Pro 因内部目标未达成而延期

    所以这一轮,谷歌交出的答卷是“把便宜好用的 Flash 做更便宜更好用”,而真正的王牌 Pro,还在打磨。在对手疯狂刷版本的当下,这种“先发辅料、压着主菜”的节奏,到底是无奈还是策略,可能要等 3.5 Pro 真正落地那天才有答案。