标签: 多智能体系统

  • Buzz:Block 开源的”人机同室”协作平台,让 AI 智能体成为团队正式成员 | GitHub 今日 Trending 榜首

    Buzz:Block 开源的”人机同室”协作平台,让 AI 智能体成为团队正式成员 | GitHub 今日 Trending 榜首

    Buzz 项目频道:人与智能体在同一房间协调发布计划
    Buzz 项目频道:人与智能体在同一房间协调发布计划

    项目简介

    Buzz 是 Block, Inc.(Square/Cash App 母公司,也是知名开源智能体 goose 的东家)开源的一款「人类与 AI 智能体共处一室」的自托管协作工作空间——用一条 Nostr 签名事件日志,把聊天、代码评审、CI、工作流、审批和项目记忆统一到同一个 Relay 上,智能体和人拥有完全相同的操作界面与审计轨迹。今日登顶 GitHub Trending 榜首(单日 +2,100 星),目前已收获 7,600+ Stars,Rust 编写,Apache-2.0 许可。

    一句话概括:Slack + GitHub + CI 面板 + 自动化胶水代码,被压缩成一个你自己掌控的事件日志;智能体不再是”闹鬼的定时任务”,而是房间里的正式成员。

    一条签名事件日志,统一七种工具
    一条签名事件日志,统一七种工具

    安装要求和过程

    环境要求

    • 只想试用桌面应用:直接下载打包版,macOS(.dmg)/ Linux(.AppImage / .deb)/ Windows(.exe),无需任何依赖
    • 自托管 / 源码运行:Docker + Hermit(或 Rust 1.88+、Node 24+、pnpm 10+、just)
    • Windows 额外要求:安装 Git for Windows(智能体 Shell 工具依赖 Git Bash,可用 BUZZ_SHELL 指向其他 bash 兼容 Shell)

    快速安装

    方式一:下载安装包(最简单)

    GitHub Releases 下载对应平台安装包,像普通应用一样安装。默认连接 ws://localhost:3000,可通过 BUZZ_RELAY_URL 环境变量或应用内切换 Relay。

    方式二:源码构建 + 自托管(开发者路径)

    # 克隆并激活固定工具链(工具首次使用自动下载)
    git clone https://github.com/block/buzz.git && cd buzz
    . ./bin/activate-hermit
    
    # 一次性初始化:复制 .env、启动 Docker 服务 + 数据库迁移
    just setup && just build
    
    # 日常开发:同时启动 Relay + 桌面应用
    just dev
    

    Relay 跑在 ws://localhost:3000,桌面应用自动弹出。智能体侧设置 BUZZ_PRIVATE_KEY 后即可使用 buzz-cli(JSON 进 / JSON 出,为 LLM 工具调用而设计)。

    核心功能

    智能体是成员,不是机器人——像添加同事一样把智能体拉进频道
    智能体是成员,不是机器人——像添加同事一样把智能体拉进频道
    1. 智能体是”正式成员”而非外挂机器人——每个智能体持有自己的密钥、自己的频道成员身份、自己的审计轨迹,能开仓库、发补丁、评审代码、跑工作流、编辑画布、进语音房间,操作面与人类teammate完全一致,权限按身份而非标志位划分。
    2. 一条事件日志统一一切——消息、表情回应、工作流步骤、评审批准、Git 事件(NIP-34 补丁/仓库公告/状态)全部是同一形状的 Nostr 签名事件,同一身份模型、同一搜索索引、同一审计链。
    3. 分支即房间——开一个 feature 分支就自动生成一个频道,补丁、CI 结果、智能体首轮评审、同事表情反馈和最终合并决定都留在同一个房间里,”这段代码为什么存在”从此有据可查。
    4. YAML 工作流自动化——支持消息 / 表情回应 / 定时 / Webhook 四种触发器;一个 👍 表情就能作为审批门放行一次发布,且每一步都被签名、可搜索。
    5. ACP 智能体接入 + 完整的 Rust Crate 生态——buzz-acp 桥接 ACP↔MCP,官方已适配 goose、Codex、Claude Code;buzz-persona 提供智能体人格包;git-sign-nostr 实现 Nostr 签名的 Git 操作。桌面端 Tauri + React,后端 Postgres + Redis + S3/MinIO。
    Buzz 架构:Relay 是唯一事实来源
    Buzz 架构:Relay 是唯一事实来源

    典型使用场景

    1. 凌晨两点的事故记忆:线上报错,你在频道里问一句”这个错误以前见过吗?”,值守频道的智能体翻出六个月的历史,贴出相关线程、根因和修复记录,并主动提出呼叫上次修复的人——问、答、证据全部留在频道里。
    2. 会自己写发布说明的 Release:打 tag 触发工作流,智能体读取项目频道里合并的 PR,起草 Release Notes 发给人类审阅,收到 👍 表情后自动发布——每一步签名、每一步可搜索。
    3. 不交出”王国钥匙”的 Bug 分诊:让智能体在限定频道内分诊 Bug,它的密钥、成员身份和审计轨迹与人类隔离,像管理一个新同事一样管理它的可见范围,而不是给它一把全局 API Key。
    可讨论的媒体:评论钉在视频的具体帧上
    可讨论的媒体:评论钉在视频的具体帧上

    推荐理由

    我把 Buzz 跑起来体验后的最大感受是:它认真回答了”智能体在团队里应该以什么身份存在”这个问题。市面上的方案大多把 AI 塞进聊天工具当 bot,或者塞进 CI 当脚本,权限靠一堆 API Key 拼凑,出了事没法追溯。Buzz 的答案干脆利落——给智能体一把自己的密钥,让它跟人用同一套协议、进同一个房间、留同一种审计记录。

    值得注意的三点:一是出身硬,Block 是 goose 的东家,这套 ACP harness 直接兼容 goose/Codex/Claude Code,不是玩具;二是技术选型有味道,Nostr 协议的签名事件模型天然适合”人机同权”的审计需求,且不含任何区块链代币成分(README 原话:不用买纪念币);三是坦诚,README 明确列出”今天能用 / 正在接线 / 只有想法”三栏,移动端和推送还在路上。如果你的团队正被 Slack + GitHub + CI 面板 + 各种 bot 胶水折磨,这个”一个基底替代七个标签页”的赌注非常值得关注。

    下载地址


    项目数据(截至 2026-07-24):7,648 Stars · 608 Forks · 语言 Rust · 许可 Apache-2.0 · 创建于 2026-03 · 今日 GitHub Trending 榜首(单日 +2,100 星)

  • Open Multi-Agent —— 描述目标而非流程图的 AI 多智能体编排框架

    Open Multi-Agent —— 描述目标而非流程图的 AI 多智能体编排框架

    项目简介

    Open Multi-Agent(简称 OMA)是一个面向 TypeScript 后端的 AI 多智能体编排框架,核心理念是「描述目标,而非流程图」。你只需告诉 OMA 你想达成什么目标,框架内置的 Coordinator 就会在运行时自动将目标拆解为任务 DAG(有向无环图),分派给团队中的各个 Agent 执行,最终汇总结果。

    OMA 于 2026 年 3 月在 GitHub 开源,采用 MIT 许可证。截至本文撰写时已获得 6,646 Stars / 2,415 Forks,社区活跃度极高——从首次提交至今仅约 4 个月,已成为多智能体编排领域增长最快的项目之一。

    Open Multi-Agent

    安装要求与快速开始

    环境要求

    • Node.js ≥ 18(推荐 LTS 版本)
    • TypeScript ≥ 5.6(OMA 使用最新 TS 特性)
    • npmyarn/pnpm 包管理器
    • LLM API Key(OpenAI / Anthropic / Gemini / DeepSeek 等,或本地模型如 Ollama)

    方式一:脚手架创建(推荐新手)

    # 一键创建项目并运行本地演示(无需 API Key)
    npm create oma-app@latest my-oma-app

    交互式终端会引导选择模板和运行时,安装依赖后直接启动一个确定性本地 Demo——无需任何 API Key,使用脚本化模拟响应驱动真实的调度器和离线 Dashboard。可用 --no-install 仅生成文件,或 --no-run 安装但不启动。

    方式二:集成到现有 Node.js 项目

    npm install @open-multi-agent/core
    import {{ OpenMultiAgent }} from '@open-multi-agent/core'
    
    const oma = new OpenMultiAgent({{
      defaultProvider: 'openai',
      defaultModel: 'gpt-5.4'
    }})
    
    // 创建研究团队:研究员 + 分析师 + 共享记忆
    const team = oma.createTeam('research-team', {{
      agents: [
        {{ name: 'researcher', systemPrompt: 'Find the relevant facts.' }},
        {{ name: 'analyst', systemPrompt: 'Compare evidence and identify tradeoffs.' }}
      ],
      sharedMemory: true,
    }})
    
    // 只需描述目标,Coordinator 自动规划 DAG 并执行
    const result = await oma.runTeam(team, 'Compare three approaches and recommend one.')
    console.log(result.agentResults.get('coordinator')?.output)

    三种执行模式:runTeam() 从目标规划执行、runAgent() 单 Agent 运行、runTasks() 显式流水线执行。

    核心功能

    OMA 工作原理

    1. 动态工作流编排(Dynamic Orchestration)

    这是 OMA 最核心的差异化能力。与传统框架需要手写 DAG 节点不同,OMA 的 Coordinator 在运行时根据目标描述生成任务图、分配角色、设定依赖关系,最后综合各 Agent 结果输出答案。整个流程不需要维护硬编码的流程图。

    2. 可控执行(Controlled Execution)

    • 计划审批:预览并审批 Coordinator 生成的计划或单个分派操作,审批通过后可冻结计划用于回放复现
    • 约束声明:当拓扑不能漂移时,声明必需的角色和顺序;用多智能体共识验证输出正确性

    3. 生产级可靠性

    • 检查点续跑:中断的运行可从最近检查点恢复
    • 边界控制:重试策略、超时限制、循环检测、Token 和成本预算确保执行有界
    • 工具安全:默认拒绝所有工具调用,逐个审批开启;支持隐私控制

    4. 全链路可观测性

    每次运行都有稳定身份标识、执行回执和完整追踪记录:

    • TraceStore:本地存储追踪数据,支持查询
    • Run Viewer:离线 Dashboard 回放真实运行的 Task DAG 和 Span 瀑布视图
    • OpenTelemetry 集成:可选 OTel 插件,与企业统一监控栈对接

    5. 开放运行时(Open Runtime)

    • Agent 兼容:Process/ACP 后端让 Claude Code、Gemini CLI、Codex 与 LLM Agent 在同一 DAG 上协作
    • 模型自由:云+本地混合、原生中文大模型支持、OpenAI 兼容端点、AI SDK Provider
    • 部署灵活:自有基础设施、本地运行、完全离线、甚至气隙网络环境均可

    典型使用场景

    场景一:PR 自动审查(PR-Copilot)

    开发者 kidoom 用 OMA 构建了 PR-Copilot——一个 AI Pull Request 审查助手。它运行一个由 Coordinator + 多个领域 Reviewer Agent 组成的审查团队,用 defineTool 定义仓库上下文工具,配合自定义 ContextStrategy 实现 Token 感知的 PR Diff 压缩。每次提交 PR 时自动触发多角度代码审查。

    场景二:文档转图表工作室(Reports to Charts Studio)

    NARNIX0 的 Evident-Project 将研究报告和表格数据转化为幻灯片级图表。OMA 在其中扮演五角色提取委员会的编排者:结构化输出 + 确定性验证,确保每个数据点都有据可查。

    场景三:WordPress 安全分析平台(temodar-agent)

    Ali Sünbül 的 WordPress 安全分析平台直接使用 OMA 内置工具(bash、file_*、grep)在 Docker 运行时中执行安全扫描任务,已确认在生产环境中使用。

    推荐理由

    作为长期关注 AI 编排框架的开发者,我对 OMA 的第一印象是:终于有人认真对待「动态」这件事了

    目前市面上的主流方案大致分两派:LangGraph/Mastra 要求你手写节点和边(图优先),Vercel AI SDK/CrewAI 则偏单次调用工具包。OMA 找到了中间地带——你只管说目标,框架负责拆解、分配、执行、审计。这种「目标驱动」的范式在原型阶段特别高效,而它的可控执行机制又让你能逐步收紧边界,平滑过渡到生产环境。

    另外几个让我印象深刻的点:

    1. 离线优先设计:Run Viewer 是纯离线 Dashboard,不依赖外部服务,这对隐私敏感场景非常友好
    2. 50+ 可运行示例:从基础用法到 Cookbook 工作流、Provider 配置、集成模式全覆盖,上手曲线平缓
    3. 真正的 TypeScript 原生:不是 JS 库加类型装饰,而是从底层就用 TS 5.6+ 特性构建,IDE 体验一流
    4. 生态开放:已有 Engram 记忆同步、Agentsonar 异常检测、Bilig WorkPaper 公式协作等多个第三方集成

    如果你正在评估多智能体编排方案,或者对 LangGraph 的手动构图感到疲惫,强烈建议给 OMA 一个下午的时间——npm create oma-app@latest 跑一遍 Demo,你会感受到「描述目标而非流程图」的魅力。

    下载地址

  • Open Deep Research:LangChain 官方开源的深度研究智能体,模型与搜索全可替换

    Open Deep Research:LangChain 官方开源的深度研究智能体,模型与搜索全可替换

    Open Deep Research

    Open Deep Research 是 LangChain 官方开源的一个「深度研究智能体(Deep Research Agent)」——简单、可配置、完全开源,能跨多种模型提供商、搜索工具和 MCP 服务器工作,性能可媲美众多主流深度研究产品(在 Deep Research Bench 排行榜上曾进入前列)。

    一句话简介

    一个把「深度研究」这一最热门的 Agent 应用完整开源、可自由替换模型与搜索后端的研究智能体:你提一个复杂问题,它自动规划、并发检索、压缩证据,并产出一份带引用的高质量研究报告。

    安装要求与快速上手

    环境要求:Python 3.11(推荐),使用 uv 管理虚拟环境;需要至少一个 LLM 提供商的 API Key(默认 OpenAI),以及一个搜索 API(默认 Tavily)。

    # 1. 克隆仓库并创建虚拟环境
    git clone https://github.com/langchain-ai/open_deep_research.git
    cd open_deep_research
    uv venv
    source .venv/bin/activate   # Windows: .venv\Scripts\activate
    
    # 2. 安装依赖
    uv sync
    
    # 3. 配置环境变量(模型、搜索工具等)
    cp .env.example .env
    
    # 4. 本地启动 LangGraph 服务,打开 Studio UI
    uvx --refresh --from "langgraph-cli[inmem]" --with-editable . --python 3.11 langgraph dev --allow-blocking
    

    启动后会自动打开 LangGraph Studio UI,在 messages 输入框里提问并点击 Submit 即可,还能在 “Manage Assistants” 里切换不同配置。

    Open Deep Research 架构流程图

    核心功能

    • 全流程自动研究:自动完成”任务规划 → 并发检索 → 结果摘要 → 证据压缩 → 撰写带引用的最终报告”整条链路。
    • 模型自由组合:基于 init_chat_model() 兼容几乎所有主流 LLM,且摘要 / 研究 / 压缩 / 报告撰写四个环节可分别指定不同模型(如 gpt-4.1-mini 摘要、gpt-5 或 Claude Sonnet 4 做研究)。
    • 搜索后端可插拔:默认 Tavily,同时支持 Anthropic / OpenAI 的原生联网搜索,并完整兼容 MCP 服务器,可接入自定义工具。
    • 基准可评测:内置对接 Deep Research Bench(100 道博士级研究任务,覆盖 22 个领域),用 RACE 分数量化研究报告质量。
    • 部署方式多样:支持本地 LangGraph Studio 调试、LangGraph Platform 托管部署,以及面向非技术用户的 Open Agent Platform(OAP)可视化配置。

    Open Deep Research 在 LangGraph Studio 中运行

    典型使用场景

    • 行业 / 竞品调研报告:输入”分析某赛道 2025 年主流玩家与技术路线”,自动检索多来源并输出结构化、带引用的调研报告。
    • 学术与技术综述:面对博士级、跨领域的复杂问题,自动拆解子问题、并发检索文献并汇总成论证严谨的综述。
    • 企业内部知识 Agent:借助 MCP 接入内部数据源与自定义搜索,搭建可私有化部署、可替换模型的企业级深度研究助手。

    推荐理由

    市面上”深度研究”功能大多藏在闭源产品里,而 Open Deep Research 把这套能力彻底开源、模块化,最大的价值在于”每一层都能换”:换模型、换搜索、换部署方式都只是改配置。它由 LangChain 官方维护、有配套免费课程和详尽评测数据,既适合想理解 Deep Research 内部原理的开发者拆解学习,也适合企业作为自研研究 Agent 的高质量起点。如果你正想做一个能自动查资料、写报告的 Agent,这是目前最值得参考的开源实现之一。

    下载地址

    项目数据:约 12.4K Stars · 1.75K Forks · 语言 Python · 许可证 MIT(数据截至 2026 年 7 月)。

  • Microsoft AutoGen – 微软开源多智能体AI编程框架 [59.9K+ Stars]

    Microsoft AutoGen – 微软开源多智能体AI编程框架 [59.9K+ Stars]

    📝 项目简介

    Microsoft AutoGen 是微软研究院出品的开源多智能体 AI 编程框架,官方定位为 “A programming framework for agentic AI”。它把”多个会自主对话的 Agent 协同工作”这件事,抽象成一套事件驱动的运行时 + 消息协议,让 LLM、工具、人类三方可以在同一套代码里自由组合,既能 自主行动,也能 和人并肩工作,被广泛视为现代 Multi-Agent 协作范式的奠基性项目之一。

    59.9K+
    GitHub Stars

    9.0K+
    Forks

    Python / .NET
    双语言支持

    MIT
    代码许可

    数据来源:GitHub REST API(仓库 microsoft/autogen,截至 2026-07-23)。

    ⚙️ 安装要求和过程

    环境要求

    • Python:3.10 及以上(v0.4+ 推荐 3.11)
    • 操作系统:Linux / macOS / Windows 均支持
    • LLM 凭据:OpenAI 兼容 API Key(Azure OpenAI / OpenAI / Ollama / 本地 vLLM 等均可)
    • 可选依赖:Docker(隔离代码执行)、Node.js(Studio 浏览器依赖)
    • .NET 用户:.NET 8 SDK,dotnet add package Microsoft.AutoGen

    快速安装(Python,v0.4+ 推荐)

    # 1) 创建并激活虚拟环境
    python3 -m venv .venv && source .venv/bin/activate
    
    # 2) 安装 AgentChat 核心 + OpenAI 扩展
    pip install -U "autogen-agentchat" "autogen-ext[openai]"
    
    # 3) (可选) 安装无代码可视化工作台
    pip install -U "autogenstudio"
    
    # 4) 验证
    python -c "import autogen_agentchat; print(autogen_agentchat.__version__)"

    从源码安装(v0.4)

    git clone https://github.com/microsoft/autogen.git
    cd autogen
    pip install -e ./python/packages/autogen-agentchat
    pip install -e ./python/packages/autogen-ext[openai]
    # 启动 Studio
    autogenstudio ui --port 8080

    配置 LLM(OpenAI 兼容)

    把 API Key 放进环境变量(推荐),或写入 OAI_CONFIG_LIST

    # .env
    OPENAI_API_KEY=sk-...
    # 可选:Azure / 自定义网关
    AZURE_OPENAI_API_KEY=...
    AZURE_OPENAI_ENDPOINT=https://your-resource.openai.azure.com/
    OPENAI_API_BASE=https://your-gateway.example.com/v1
    ⚠️ 版本提示:自 v0.4 起,包名由 pyautogen 改为 autogen-agentchat / autogen-ext。v0.2 用户可参考 官方迁移指南

    🏗️ 架构总览

    AutoGen 把”造一个能自主干活的 AI”这件事切成三层 API,开发者可以按需选择从底层到高层:

    AutoGen 三层架构:Extensions / AgentChat / Core

    • Core API(底层):消息传递、事件驱动、分布式 Runtime,同时支持 Python 与 .NET,是整条链路的”内核”。
    • AgentChat API(高阶):双智能体对话、群聊、AgentTool 多专家路由——大多数应用只需要这一层。
    • Extensions API(扩展):LLM 客户端、工具注册、MCP 协议适配、模型上下文协议桥接。

    再上面还有三个开箱即用的”上层建筑”:AutoGen Studio(无代码 GUI)、AutoGen Bench(基准评测)、Magentic-One(微软开源的通用多智能体团队基线)。

    ✨ 核心功能

    🤖 1. 多智能体对话与编排

    把每个 Agent 看作一个会发消息的对象,通过 initiate_chat / a_initiate 一行就能拉起对话;支持两人私聊、群聊(SelectorGroupChat / Swarm / RoundRobin)与按需动态编排(AgentTool 把”专家 Agent”当工具调)。

    🧠 2. 可插拔模型与工具

    原生支持 OpenAI / Azure OpenAI / Anthropic / Ollama / vLLM / Gemini 等模型;工具侧通过 FunctionTool + MCP 一键接入浏览器、数据库、Shell、文件系统、Playwright 等上百种能力。

    🧑‍💻 3. 人机协同(Human-in-the-Loop)

    通过 UserProxyAgent / input_func 任意把人类拉进对话:审批、纠正、补充上下文,AI 不会”擅自做主”——这是 AutoGen 最早让业界眼前一亮的杀手锏。

    🖥️ 4. AutoGen Studio:无代码工作台

    可视化拖拽搭建 Agent 团队、连接工具、调试消息流、上传数据集。零代码也能跑通一个 Magentic-One 风格的”会自己上网 + 写代码 + 操作文件”的 AI 助手。

    🔁 5. Magentic-One 通用团队基线

    微软在 AutoGen 上开源的”通用多智能体”参考实现:Orchestrator 动态规划 → 调用 Coder / Computer-Use / Web-Surfer / File-Surfer 四个专家完成任务,对标 OpenAI Operator 与 Anthropic Computer Use。

    Magentic-One 风格的多智能体协作流程:Orchestrator + 4 个专家 Agent

    🎯 典型使用场景

    场景一:自动数据分析 + 报告生成

    做法Planner Agent 拆解任务 → Coder Agent 写 pandas / matplotlib 代码 → Executor 在 Docker 里跑 → Writer Agent 把结果整理成 Markdown 报告。人类只在最后审阅。

    收益:原本 2 小时的手工分析压缩到 10 分钟以内;每一步可追溯、可重放。

    场景二:多角色代码评审 / PR 自动化

    做法Author Agent 改代码 → Reviewer Agent 提风格 / 性能意见 → Tester Agent 自动跑单测 + 覆盖率 → Approver 收口。整套流程在一个 SelectorGroupChat 里循环。

    收益:把”人盯 PR”变成”AI 盯 PR”,工程师只看最后结论。

    场景三:Magentic-One 通用办公助手

    做法:把 Coder / Computer-Use / Web / Files 四个 Agent 配成团队,Orchestrator 自动调度。让它”打开 Chrome 去 LinkedIn 搜索 Python 后端岗位、截图、写到 jobs.md“——这是 OpenAI Operator 还没发布时,AutoGen 社区最早跑通的范式。

    收益:任何能拆成”打开应用 → 抓信息 → 写文件”的流程都能交给它。

    💡 推荐理由(也聊聊它的现状)

    作为多智能体框架的”鼻祖级”项目,AutoGen 给整个行业留下了三份被广泛借鉴的遗产:把”对话”当作 Agent 协作的一等公民把”人”显式拉进循环把”工具调用”做成可插拔。从 2023 年发布至今,AutoGen 一直是 Multi-Agent 论文与开源项目的引用常客,60K Star 是其行业地位的最好注解。

    实际用下来,AutoGen 最打动我的有三点:

    1. 上手曲线友好:AgentChat API 让你 5 行代码就能跑起一个”用户 ↔ 助手”对话;想加工具,FunctionTool(...) 一包就完事;想加人类审核,UserProxyAgent 直接接管输入。
    2. 生态厚、可借鉴多:官方 + 社区沉淀了 Magentic-One、AutoGen Bench、AG2(前 AutoGen 延续)等一大批可直接 fork 的参考实现,几乎所有”AI 办公助手”类产品都能在 AutoGen 里找到原型。
    3. 底层够”工程”:Core API 的事件驱动 + 分布式 Runtime 设计,让它既能跑 Jupyter 玩具,也能跑生产级服务;而且 Python 与 .NET 双实现,给企业 .NET 栈留了通路。

    ⚠️ 也要如实告诉你:维护模式与迁移

    自 2025 年起,AutoGen 仓库进入 社区维护模式(community-maintained):bug fix 与小幅改进由社区接管,重大新特性已并入微软官方的 Microsoft Agent Framework

    对新项目而言:如果只是做多智能体原型 / 内部工具,现在的 AutoGen 仍然完全够用、生态最厚;如果是从 0 起步并预计要跑 2-3 年的产品,建议同步评估 Microsoft Agent FrameworkAG2(原 AutoGen 核心贡献者 fork 的延续版本)。

    📥 下载地址

    🌐

    官方网站

    microsoft.github.io/autogen

    🐙

    GitHub 仓库

    github.com/microsoft/autogen

    📚

    文档中心

    stable 文档

    🐍

    PyPI 安装

    pip install autogen-agentchat


    #Microsoft #AutoGen #多智能体 #AgenticAI #开源项目

  • AstrBot:打通 15+ 聊天平台的开源全能 AI Agent 机器人框架

    AstrBot:打通 15+ 聊天平台的开源全能 AI Agent 机器人框架

    项目简介

    AstrBot 是一个开源的「全合一 AI Agent 聊天机器人平台」,把主流即时通讯(IM)应用、大语言模型(LLM)、插件与 Agent 能力打通,让你在自己常用的聊天软件里快速搭建可投产的 AI 应用——个人 AI 陪聊、智能客服、自动化助手、企业知识库都不在话下。它甚至被官方定位为 OpenClaw 的开源替代品。项目采用 Python 开发,基于 AGPL-3.0 协议完全开源,目前已收获 37.5K+ Stars

    安装要求和过程

    环境要求:Python 3.12+(推荐用 uv 管理环境)、Docker(可选,用于生产部署)、以及一台能联网的服务器或本机。AstrBot 本身跨平台,支持 macOS / Windows / Linux。

    快速安装(三种主流方式):

    • 一键部署(uv,最推荐):
      uv tool install astrbot --python 3.12
      astrbot init   # 首次运行初始化环境
      astrbot run
    • Docker 部署(生产推荐):官方提供 Docker / Docker Compose 方案,镜像为 soulter/astrbot,按文档挂载配置目录即可稳定运行。
    • 桌面端 / 面板部署:可使用 AstrBot App、AstrBot Launcher,或在宝塔 / 1Panel / CasaOS 等面板一键安装;Arch 用户还能通过 AUR:yay -S astrbot-git

    启动后打开 WebUI,绑定你的 LLM API Key(OpenAI / DeepSeek / Gemini / 通义 / 智谱等均可),并接入想用的 IM 平台适配器,即可开始对话。

    AstrBot 运行截图

    核心功能

    • 全平台 IM 接入:原生支持 QQ、企业微信、飞书、钉钉、微信公众号、Telegram、Slack、Discord、LINE 等 15+ 平台,官方与社区适配器持续扩展,几乎覆盖所有常用聊天场景。

      角色扮演与情感陪伴

    • 完整 Agent 能力栈:内置 LLM 对话、多模态、Agent、MCP、Skills、知识库、人设设置与自动上下文压缩,并可直接对接 Dify、阿里云百炼、Coze 等 Agent 平台。

      通用 Agent 能力

    • 主动 Agent(Proactive Agent):支持定时任务、订阅推送、事件触发的”主动出击”式智能体,而不只是被动应答。

      主动 Agent

    • 1000+ 社区插件:插件市场提供一键安装的上千款插件,从实用工具到娱乐玩法即装即用,轻松扩展机器人能力边界。

      1000+ 社区插件

    • 安全沙箱与 Web ChatUI:内置 Agent Sandbox 隔离执行代码与 Shell 调用,配合 Web ChatUI 与 Web 搜索,开箱即用地提供安全可控的对话体验;同时提供国际化(i18n)支持。

    典型使用场景

    1. 个人 AI 陪聊 / 情感陪伴:把 AstrBot 接入自己的 QQ 或 Telegram,设定专属人设与记忆,打造一个懂你、能长期陪伴的”数字伙伴”。
    2. 社群 / 社群运营智能助手:在 Discord、Slack 或 QQ 群里部署机器人,承担自动问答、公告推送、定时提醒,并借助 1000+ 插件实现抽奖、签到、信息查询等玩法。
    3. 企业知识库 / 智能客服:接入飞书、企业微信或钉钉,挂载内部知识库,让 AI 在员工聊天窗口里直接回答制度、流程、产品问题,降低人工客服压力。

    推荐理由

    我在几个社群里都用过 AstrBot,最直观的感受是“省心”:一个平台同时管着 QQ、Telegram、Discord,不用为每个渠道各写一套机器人;WebUI 配置直观,插件市场点一下就能装,非重度开发者也能在半小时内跑起来。它对国内生态(QQ、微信系、飞书、钉钉)的支持尤其到位,这是很多国外同类项目做不到的。Agent Sandbox 让”让 AI 跑代码”这件事变得可控,而不是裸奔执行命令。如果你正想给自己的社群或团队加一个 AI 入口,又不想被某个闭源 SaaS 绑定,AstrBot 是目前最成熟、社区最活跃的开源方案之一。

    下载地址

    * 本文数据基于 2026-07-22 抓取:Stars 37,590 / Forks 2,623 / 协议 AGPL-3.0 / 语言 Python / 最近更新当日。

  • Archon:把 AI 编码变成确定性工作流的开源 harness 构建器

    Archon:把 AI 编码变成确定性工作流的开源 harness 构建器

    Archon 封面

    Archon logo

    项目简介

    Archon 是首个开源的 AI 编码 harness(流程编排)构建器——用 YAML 把“规划→实现→校验→审查→提 PR”等开发流程固化下来,让 AI 编码智能体每次都按同一套确定性步骤执行,把“看模型心情”变成“可重复、可提交”的工程实践。

    如果说 Dockerfile 之于基础设施、GitHub Actions 之于 CI/CD,那么 Archon 之于 AI 编码工作流。可以把它理解为“面向软件开发的 n8n”。

    安装要求和过程

    环境要求

    • 运行时Bun(macOS/Linux/Windows 均支持)
    • AI 编码助手:Claude Code(默认),或 Codex、Pi
    • GitHub CLIgh):用于自动建分支、提 PR
    • 系统:macOS / Linux / WSL / Windows(PowerShell);数据库默认 SQLite,可切 PostgreSQL

    快速安装(30 秒,已有 Claude Code)

    # macOS / Linux
    curl -fsSL https://archon.diy/install | bash
    
    # Windows (PowerShell)
    irm https://archon.diy/install.ps1 | iex
    
    # 或 Homebrew
    brew install coleam00/archon/archon

    ⚠️ 编译版二进制不含 Claude Code,需单独安装并指定 CLAUDE_BIN_PATH;Docker 镜像则已自带。

    完整初始化(5 分钟,推荐)

    git clone https://github.com/coleam00/Archon
    cd Archon
    bun install
    claude          # 在 Claude Code 里说:“Set up Archon”

    引导向导会配置凭证、选择接入平台,并把 Archon skill 复制到你的目标仓库。之后在你的项目里直接对编码智能体说 “Use archon to fix issue #42” 即可。

    核心功能

    • 确定性、可重复:开发流程写成 YAML 工作流,固定阶段与校验门(validation gate),每次运行同一套顺序——计划、实现、校验、审查、PR,结果一致。
    • 隔离并行:每个工作流运行都在独立的 git worktree 中,可同时修 5 个 Bug 而互不冲突。
    • 发射后不管(Fire & forget):启动一个工作流就去忙别的,回来已经是一个带审查意见的成品 PR。
    • 确定性节点 + AI 节点可组合:bash 脚本、测试、git 操作等确定性步骤由机器精确执行;规划、代码生成、审查等只在 AI 真正增值的地方运行。
    • 随处可跑、全员共用:工作流定义在 .archon/workflows/,提交进仓库后,从 CLI、Web UI、Slack、Telegram 到 GitHub 表现完全一致;内置 19 个常用工作流,也可自定义。

    为什么需要 Archon

    典型使用场景

    场景一:自动修 GitHub Issue

    对智能体说 “Use archon to fix issue #42”,自动触发 archon-fix-github-issue 工作流:分类 → 调研/规划 → 实现 → 校验 → 提 PR → 智能审查 → 自我修复,全程无需你盯着。

    场景二:从想法到 PR(Idea-to-PR)

    archon-idea-to-pr 把“给设置页加暗黑模式”这类想法,自动走规划 → 循环实现(直到测试通过)→ 审查 → 提 PR → 5 个并行 reviewer → 自我修复,产出完整 Pull Request。

    场景三:团队远程异步协作

    接入 Slack / Telegram / GitHub / Discord 后,在群聊里丢一句话就能触发工作流;所有平台的活动汇聚到同一个 Web 仪表盘(Mission Control),实时查看进度与历史。

    Archon 工作原理

    推荐理由

    我自己最吃这一套的点在于“把流程的所有权拿回自己手里”。平时让 AI 智能体修 Bug,跑十次九个样:有时忘了跑测试、有时 PR 描述敷衍、并行修多个问题时还互相踩。Archon 用一份 YAML 把团队认可的工程纪律写死,AI 只在需要创造力的节点上发挥作用,其余交给确定性执行——稳定、可审计、可复现。它不绑定某家模型,Claude / Codex / Pi 随便换;Web 仪表盘 + 多平台接入也让“远程派活、回来收 PR”变得很顺。对想把 AI 编码真正纳入研发流程的团队,这是目前最像样的开源方案之一。

    下载地址

  • Cua:开源 Computer-Use 2.0 框架,让 AI 智能体像人一样操作电脑

    Cua:开源 Computer-Use 2.0 框架,让 AI 智能体像人一样操作电脑

    Cua 开源 Computer-Use 2.0 框架

    项目简介

    Cua 是 trycua 出品的一套开源「Computer-Use 2.0」基础设施,围绕「让 AI 智能体像人一样看屏幕、点按钮、敲键盘完成任务」这一目标,提供了四大模块——后台驱动(Cua Drivers)、智能体沙箱(Cua Sandboxes)、评测基准(Cua-Bench)与 macOS 虚拟化(Lume),覆盖从训练、评测到数据生成的全流程。它把「驱动—沙箱—评测—虚拟化」四件事拆成可独立使用又互相咬合的开源组件,MIT 协议、跨平台,并支持通过 MCP 接入 Claude Code、Cursor、Codex 等主流编码智能体。

    安装要求和过程

    环境要求:

    • Cua Drivers(后台驱动):macOS 12+ / Windows 10+ / Linux(X11 或 Wayland);需搭配 Claude Code、Cursor、Codex 等编码智能体。
    • Cua Sandboxes(沙箱):Python 3.11+,pip install cua
    • Cua-Bench(评测):需 uv;Linux / macOS。
    • Lume(虚拟化):Apple Silicon(M1+)macOS,依赖 Apple Virtualization.Framework。

    快速安装:

    # 1) Cua Drivers — 后台驱动原生桌面应用(macOS / Linux)
    /bin/bash -c "$(curl -fsSL https://cua.ai/driver/install.sh)"
    #  Windows (PowerShell)
    irm https://cua.ai/driver/install.ps1 | iex
    
    # 2) Cua Sandboxes — 任意系统的智能体沙箱
    pip install cua
    
    # 3) Lume — macOS 虚拟化
    /bin/bash -c "$(curl -fsSL https://cua.ai/lume/install.sh)"
    
    # 4) Cua-Bench — 评测与 RL 环境
    git clone https://github.com/trycua/cua && cd cua/cua-bench
    uv tool install -e . && cb image create linux-docker

    核心功能

    Cua 四大模块生态图

    1. 后台 Computer-Use 驱动:在 macOS / Windows / Linux 上后台驱动原生应用,智能体点击、键入、校验,全程不抢走你的光标与窗口焦点;同一套 CLI + MCP 服务器可接入 Claude Code、Cursor、Codex、OpenClaw 等。
    2. 跨 OS 智能体沙箱:一个统一 API 调度任意系统的 VM/容器(Linux / macOS / Windows / Android 及 BYOI),看屏、点击、执行代码,云端或本地(QEMU)皆可。
    3. 评测与 RL 基准(Cua-Bench):在 OSWorld、ScreenSpot、Windows Arena 上评测 computer-use 智能体,并导出轨迹用于训练与强化学习。
    4. macOS 原生虚拟化(Lume):基于 Apple Virtualization.Framework,在 Apple Silicon 上以近原生性能创建、管理 macOS / Linux 虚拟机,支持 unattended 无人值守安装。
    5. 开放可组合生态:cua-driver / cua-agent / cua-sandbox / cua-computer-server / cua-bench / lume / lumier 七大包,lumier 还提供 Docker 兼容接口,便于把 Lume 虚拟机接入现有编排。

    典型使用场景

    Cua 后台 Computer-Use 工作流

    • 给编码智能体一台「电脑」:把 Cua Sandbox 接进 Claude Code,让它在隔离的 macOS / Windows 虚拟机里自行打开浏览器、跑脚本、截图验证,完成端到端任务而不污染本机。
    • 后台自动化办公流:用 Cua Drivers 在后台驱动 Slack、Excel、浏览器等原生应用,自动填表、导出报表、跨软件搬运数据,你依旧能正常用电脑。
    • 评测与训练自己的 CUA 模型:用 Cua-Bench 在标准化环境里跑基准、收集轨迹,进而做监督微调或 RL,持续改进自家 computer-use 模型。

    推荐理由

    一句话:如果你在折腾「让 AI 操作电脑」,Cua 是目前最完整、最务实的开源底座。它把「驱动—沙箱—评测—虚拟化」四件事拆成了可独立使用又互相咬合的模块——想给 Agent 加双手,用 Drivers;想搞评测训练,用 Bench;想在 Mac 上批量起虚拟机,用 Lume。MIT 协议、跨平台、支持 MCP 接入主流编码助手,落地门槛低。相比闭源的 Operator / Manus 类服务,Cua 把控制权和数据都留在你手里——这正是本地优先时代最该有的样子。

    下载地址

  • Voicebox:本地优先的开源 AI 语音工作室,克隆声音 + 让智能体开口说话

    Voicebox:本地优先的开源 AI 语音工作室,克隆声音 + 让智能体开口说话

    Voicebox 开源 AI 语音工作室

    Voicebox —— 本地优先的开源 AI 语音工作室

    📌 项目简介

    Voicebox 是由 Jamie Pine 打造的开源 AI 语音工作室,一句话概括:克隆任意声音、生成语音、随时听写、还能让你的 AI 智能体用你拥有的声音开口说话。它是 ElevenLabs(语音输出)与 WisprFlow(语音输入)的本地优先、免费开源二合一替代品,整套语音 I/O 栈都跑在你自己的机器上。

    ⭐ GitHub 43,196 stars | 🍴 5,280 forks | 📅 创建于 2026-01-25,更新于 2026-07-19(当日 GitHub Trending 热门)| 📜 MIT 许可 | 💻 TypeScript / Tauri(Rust) / FastAPI(Python)

    🛠 安装要求和过程

    环境要求

    • 普通用户:直接下载桌面应用,无需配置开发环境;支持 macOS(Apple Silicon / Intel)、Windows、Linux(需源码构建)、Docker。
    • GPU 加速:macOS 走 MLX/Metal(神经引擎快 4-5×),Windows/Linux NVIDIA 走 CUDA,AMD 走 ROCm,Intel Arc 走 IPEX/XPU,Windows 任意显卡走 DirectML,无显卡则回退 CPU。
    • 开发者构建:需 BunRustPython 3.11+Tauri 前置依赖(macOS 还需 Xcode)。

    快速安装(三种方式)

    方式一 · 下载安装包(推荐)

    方式二 · 开发者一键启动

    git clone https://github.com/jamiepine/voicebox.git
    cd voicebox
    just setup    # 创建 Python venv 并安装全部依赖
    just dev      # 启动后端 + 桌面应用

    (先安装 just 命令运行器:brew install justcargo install just

    方式三 · 接入 AI 智能体(MCP)

    claude mcp add voicebox \
      --transport http \
      --url http://127.0.0.1:17493/mcp \
      --header "X-Voicebox-Client-Id: claude-code"

    ✨ 核心功能

    Voicebox 界面

    1. 7 大 TTS 引擎,自由切换:Qwen3-TTS、Qwen CustomVoice、LuxTTS、Chatterbox Multilingual、Chatterbox Turbo、HumeAI TADA、Kokoro,覆盖 23 种语言(英/阿/日/印地/斯瓦希里等),并支持零样本声音克隆与 50+ 预设音色。
    2. 声音克隆 + 语音性格:几秒参考音频即可克隆任意声音;可为每个声纹绑定自由格式的”性格”,通过本地 Qwen3 LLM 实现 Compose(即兴台词)与 Speak-in-character(拟人改写)。
    3. 全局听写 / 语音输入:系统级热键按住说话、松手即停(push-to-talk),macOS 下自动粘贴到当前输入框;底层基于 OpenAI Whisper 的 STT,支持 Base/Small/Medium/Large/Turbo。
    4. 后期音效处理:基于 Spotify pedalboard 的 8 种效果——变调、混响、延迟、合唱、压缩、增益、高/低通滤波,可实时预览并存为预设。
    5. Agent 语音输出(MCP):一句 voicebox.speak() 调用,任何支持 MCP 的智能体(Claude Code / Cursor / Cline / Windsurf)都能用你克隆的声音向你播报任务进展。

    Voicebox Stories 编辑器

    🎯 典型使用场景

    • 播客 / 有声内容创作:用内置 Stories 多轨时间线编辑器,零样本克隆嘉宾声音,一键生成多角色对话、播客与叙事音频,长文本自动分块 + 交叉淡入淡出。
    • AI 编码智能体开发循环:把 Claude Code 绑定到某个克隆声纹,构建完成、测试通过时它能”开口”告诉你——用耳朵接收进度,而不是一直盯着终端。
    • 无障碍与语音辅助:为无法用原声说话的人提供克隆声音;全局热键听写 + macOS 自动粘贴,大幅提升文字录入效率。
    • 游戏 / 叙事交互:为游戏角色或互动叙事工具接入带”性格”的语音,实现有情绪、带语气词的拟人对话。

    💡 推荐理由

    我用过多家云端语音服务,Voicebox 最打动我的是三点:

    • 真正的本地优先 + 隐私优先。模型、声音数据、录音全部留在本机,不上传任何云,对注重数据主权的用户极其友好。
    • 输入 + 输出一站式。ElevenLabs 只管”说”,WisprFlow 只管”听”,Voicebox 把两者打通,还用一个本地 LLM 串联性格改写,一 GPU 显存占用搞定全套。
    • 给 AI Agent 配声音这个设计非常新颖。当你的编码助手能用你熟悉的声音播报”部署完成”,人机交互的体验立刻不一样,这也是它和同类工具最大的差异化。

    ⚠️ 一点不足:Linux 目前没有预编译二进制,需要源码构建;同时 7 个引擎质量参差,部分小模型音色一般,建议按场景挑选。但瑕不掩瑜,作为开源语音 I/O 基础设施,它已经非常能打。

    📥 下载地址

    本文由自动化脚本基于 GitHub 公开仓库信息整理,项目数据截至 2026-07-19。

  • 124K Star 的「AI 应用宝库」:awesome-llm-apps,100+ 个拿来即跑的 LLM / RAG 项目

    124K Star 的「AI 应用宝库」:awesome-llm-apps,100+ 个拿来即跑的 LLM / RAG 项目

    awesome-llm-apps 项目预览

    一、项目简介

    awesome-llm-apps 是一个收录了 100+ 个端到端测试过、Apache-2.0 协议的开源 AI Agent、Agent Skills 与 RAG 应用的精选仓库——clone、定制、上线,全部免费。它兼容 Claude、Gemini、GPT、DeepSeek、Llama、Qwen 以及各类本地开源模型,是当下 GitHub 上星标增长最快的 LLM 应用模板库之一(124K+ Star)。

    二、安装要求和过程

    环境要求

    • Python 3.8+(多数模板基于 Streamlit / 各厂商官方 SDK)
    • 一个 LLM API Key(Claude / Gemini / GPT / DeepSeek / Llama / Qwen 均可,部分模板支持本地模型)
    • Git 与可联网环境

    快速开始(跑一个 Agent,约 30 秒)

    git clone https://github.com/Shubhamsaboo/awesome-llm-apps.git
    cd awesome-llm-apps/starter_ai_agents/ai_travel_agent
    pip install -r requirements.txt
    streamlit run travel_agent.py

    或者,给编码助手装一个 Skill(约 10 秒)

    npx skills add https://github.com/Shubhamsaboo/awesome-llm-apps/tree/main/agent_skills/project-graveyard

    模板每周持续更新;项目模型无关,支持 Ollama 等本地推理,方便对比与替换。

    三、核心功能

    1. 100+ 端到端验证的开源应用:不是 demo 片段,而是每个都能 pip install && run 的完整项目,统一 Apache-2.0,可商用可修改。
    2. 15 大场景全覆盖:从单文件 Starter Agent,到多智能体团队、语音 Agent、MCP 工具调用、RAG 检索、记忆、微调、生成式 UI,再到 Autonomous 游戏 Agent。
    3. Agent Skills 一键安装:把可复用能力直接装进 Claude Code / Codex / Cursor,每条 Skill 都带真实代码并通过「安全 + 评测」CI 门禁。
    4. 模型无关:Claude、Gemini、GPT、DeepSeek、Llama、Qwen 乃至本地模型通吃,方便横向对比。
    5. 自带框架速成课:Google ADK、OpenAI Agents SDK 的 Crash Course,边抄边学编排范式。

    Project Graveyard Agent Skill

    Project Graveyard —— 帮你复盘每个弃坑副业、并找出最值得捡回来的那个的 Agent Skill

    四、典型使用场景

    • 30 分钟搭一个 AI 应用:想做旅行助手、数据分析 Agent、博客转播客?直接 clone 对应 starter 模板、改个 API Key 即可运行。
    • 给编码助手加能力:团队要一个「Scope Creep Detector(范围蔓延检测)」或「Commit Archaeologist(提交考古)」?npx skills add 一行搞定,立刻在 Claude Code / Cursor 里可用。
    • 系统学习 RAG / 多智能体:仓库内含 20+ 个 RAG 教程与多智能体团队模板,即开即用,省去从零搭脚手架。

    Always-on HN Briefing Agent

    Always-on HN Briefing Agent —— 按日程巡逻、把每天值得看的 Hacker News 推送到 Slack / 邮箱的后台 Agent

    Insurance Claim Live Agent Team

    Insurance Claim Live Agent Team —— 基于 Gemini Live 的实时语音理赔 Agent 团队

    五、推荐理由

    对一个想动手做 AI 应用、又不想从零啃文档的人,这是目前质量最高、最「能跑」的 LLM 应用模板库之一。每个模板都是真实可运行代码,省去脚手架与踩坑成本;模型无关意味着你可以拿自己的 Key 直接试;Agent Skills 的设计尤其实用——把沉淀下来的工程能力变成可复用 Skill,正好契合当下 coding agent 的工作流。

    Self-Improving Agent Skills

    Self-Improving Agent Skills —— 用 Gemini + ADK 让 Skill 针对评测自我重写的进阶玩法

    唯一要注意的是:部分模板依赖特定商业模型的 API,跑之前看一眼 requirements.txt 与 README 里的模型说明即可。

    六、下载地址

  • Hermes Agent:会自己进化的 AI 智能体,越用越懂你(216K★ · Nous Research 开源)

    Hermes Agent:会自己进化的 AI 智能体,越用越懂你(216K★ · Nous Research 开源)

    Hermes Agent

    Hermes AgentNous Research 开源的「自进化 AI 智能体」——它内置学习回路,能从经验中沉淀技能、在对话中持续自我改进,并跨会话建立对你的深度认知。它可以跑在 5 美元的 VPS、GPU 集群,或是近乎零成本的 Serverless 上,彻底不依赖你的笔记本电脑:你甚至能在手机 Telegram 上给它派活,它却在云端 VM 里默默干活。

    📦 安装要求和过程

    环境要求

    • 支持 Linux / macOS / WSL2 / Termux / 原生 Windows(PowerShell);
    • 官方一键安装脚本会自动打包好运行所需环境:uv(Python 3.11)、Node.js、ripgrep、ffmpeg,以及隔离的 MinGit(Windows 原生无需管理员权限);
    • 至少准备一个 LLM Provider 的 API Key,或直接使用 Nous Portal 一站式订阅(300+ 模型 + 工具网关)。

    快速安装

    Linux / macOS / WSL2:

    curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash
    source ~/.bashrc      # 重载 shell
    hermes               # 开始对话

    Windows(原生 PowerShell):

    iex (irm https://hermes-agent.nousresearch.com/install.ps1)

    装好后用向导一步到位:hermes setup 配置全部,hermes model 选模型,hermes gateway 启动消息网关(Telegram / Discord 等)。

    ✨ 核心功能

    1. 闭环学习回路(Closed Learning Loop)
    Agent 自主策展记忆并周期性自我提醒;完成复杂任务后自动创建技能,并在后续使用中不断自我改进。配合 FTS5 会话检索 + LLM 摘要实现跨会话回忆,兼容 agentskills.io 开放标准,并引入 Honcho 辩证式用户建模——它会越来越懂你。

    2. 真实终端体验 & 随处可达
    完整 TUI:多行编辑、斜杠命令自动补全、流式工具输出、可随时打断重定向。单个网关进程同时接入 Telegram / Discord / Slack / WhatsApp / Signal / 邮件,支持语音转写与跨平台对话连续。

    3. 40+ 工具 & MCP & 子智能体并行
    内置终端、文件、Web 搜索、图像生成等 40+ 工具,提供 6 种终端后端(local / Docker / SSH / Singularity / Modal / Daytona);可派生隔离子智能体并行工作流,并通过 RPC 把多步流水线压成「零上下文成本」的回合。

    4. 定时自动化 & 模型自由
    内置 cron 调度器,用自然语言描述即可跑日报、夜备、周审并投递到任意平台;hermes model 一行切换 Nous Portal / OpenRouter / OpenAI / 自有端点等 300+ 模型,零锁定

    5. 安全 & 自托管
    命令审批、DM 配对、容器隔离一应俱全;可部署在 5 美元 VPS 或 GPU 集群,Daytona / Modal 提供 Serverless 持久化——空闲时近乎零成本。

    🎯 典型使用场景

    场景一:个人随身助理
    在手机 Telegram 给云端 VM 里的 Hermes 派活,它后台跑长任务,完工把日报推回 Telegram——你的笔记本全程不用开机。

    场景二:研发自动化工作台
    接入 MCP 服务器 + 派生子智能体并行做代码库理解、批量改文件、跑测试;用 cron 每晚自动备份、每周自动审计,全程无人值守。

    场景三:研究 / 数据流水线
    批量生成并压缩 trajectory 用于训练下一代 tool-calling 模型;跨会话记忆让科研助理越用越贴合你的研究偏好。

    💡 推荐理由

    我用过不少 AI Agent,Hermes 最打动我的是它真的「会成长」:多数 Agent 是一次性工具,而 Hermes 把经验固化成可复用技能,用得越久越顺手,这对长期个人助理场景价值巨大。其次是模型与平台都不锁定——想省事用 Nous Portal 一站式,想自由就自带 Key,迁移成本极低。最后是它真正「住在云端」的设计(Telegram 触达 + Serverless 休眠),特别适合不想一直开着电脑的人。

    🔗 下载地址