标签: AI Agent

  • Cua:开源 Computer-Use 2.0 框架,让 AI 智能体像人一样操作电脑

    Cua:开源 Computer-Use 2.0 框架,让 AI 智能体像人一样操作电脑

    Cua 开源 Computer-Use 2.0 框架

    项目简介

    Cua 是 trycua 出品的一套开源「Computer-Use 2.0」基础设施,围绕「让 AI 智能体像人一样看屏幕、点按钮、敲键盘完成任务」这一目标,提供了四大模块——后台驱动(Cua Drivers)、智能体沙箱(Cua Sandboxes)、评测基准(Cua-Bench)与 macOS 虚拟化(Lume),覆盖从训练、评测到数据生成的全流程。它把「驱动—沙箱—评测—虚拟化」四件事拆成可独立使用又互相咬合的开源组件,MIT 协议、跨平台,并支持通过 MCP 接入 Claude Code、Cursor、Codex 等主流编码智能体。

    安装要求和过程

    环境要求:

    • Cua Drivers(后台驱动):macOS 12+ / Windows 10+ / Linux(X11 或 Wayland);需搭配 Claude Code、Cursor、Codex 等编码智能体。
    • Cua Sandboxes(沙箱):Python 3.11+,pip install cua
    • Cua-Bench(评测):需 uv;Linux / macOS。
    • Lume(虚拟化):Apple Silicon(M1+)macOS,依赖 Apple Virtualization.Framework。

    快速安装:

    # 1) Cua Drivers — 后台驱动原生桌面应用(macOS / Linux)
    /bin/bash -c "$(curl -fsSL https://cua.ai/driver/install.sh)"
    #  Windows (PowerShell)
    irm https://cua.ai/driver/install.ps1 | iex
    
    # 2) Cua Sandboxes — 任意系统的智能体沙箱
    pip install cua
    
    # 3) Lume — macOS 虚拟化
    /bin/bash -c "$(curl -fsSL https://cua.ai/lume/install.sh)"
    
    # 4) Cua-Bench — 评测与 RL 环境
    git clone https://github.com/trycua/cua && cd cua/cua-bench
    uv tool install -e . && cb image create linux-docker

    核心功能

    Cua 四大模块生态图

    1. 后台 Computer-Use 驱动:在 macOS / Windows / Linux 上后台驱动原生应用,智能体点击、键入、校验,全程不抢走你的光标与窗口焦点;同一套 CLI + MCP 服务器可接入 Claude Code、Cursor、Codex、OpenClaw 等。
    2. 跨 OS 智能体沙箱:一个统一 API 调度任意系统的 VM/容器(Linux / macOS / Windows / Android 及 BYOI),看屏、点击、执行代码,云端或本地(QEMU)皆可。
    3. 评测与 RL 基准(Cua-Bench):在 OSWorld、ScreenSpot、Windows Arena 上评测 computer-use 智能体,并导出轨迹用于训练与强化学习。
    4. macOS 原生虚拟化(Lume):基于 Apple Virtualization.Framework,在 Apple Silicon 上以近原生性能创建、管理 macOS / Linux 虚拟机,支持 unattended 无人值守安装。
    5. 开放可组合生态:cua-driver / cua-agent / cua-sandbox / cua-computer-server / cua-bench / lume / lumier 七大包,lumier 还提供 Docker 兼容接口,便于把 Lume 虚拟机接入现有编排。

    典型使用场景

    Cua 后台 Computer-Use 工作流

    • 给编码智能体一台「电脑」:把 Cua Sandbox 接进 Claude Code,让它在隔离的 macOS / Windows 虚拟机里自行打开浏览器、跑脚本、截图验证,完成端到端任务而不污染本机。
    • 后台自动化办公流:用 Cua Drivers 在后台驱动 Slack、Excel、浏览器等原生应用,自动填表、导出报表、跨软件搬运数据,你依旧能正常用电脑。
    • 评测与训练自己的 CUA 模型:用 Cua-Bench 在标准化环境里跑基准、收集轨迹,进而做监督微调或 RL,持续改进自家 computer-use 模型。

    推荐理由

    一句话:如果你在折腾「让 AI 操作电脑」,Cua 是目前最完整、最务实的开源底座。它把「驱动—沙箱—评测—虚拟化」四件事拆成了可独立使用又互相咬合的模块——想给 Agent 加双手,用 Drivers;想搞评测训练,用 Bench;想在 Mac 上批量起虚拟机,用 Lume。MIT 协议、跨平台、支持 MCP 接入主流编码助手,落地门槛低。相比闭源的 Operator / Manus 类服务,Cua 把控制权和数据都留在你手里——这正是本地优先时代最该有的样子。

    下载地址

  • Voicebox:本地优先的开源 AI 语音工作室,克隆声音 + 让智能体开口说话

    Voicebox:本地优先的开源 AI 语音工作室,克隆声音 + 让智能体开口说话

    Voicebox 开源 AI 语音工作室

    Voicebox —— 本地优先的开源 AI 语音工作室

    📌 项目简介

    Voicebox 是由 Jamie Pine 打造的开源 AI 语音工作室,一句话概括:克隆任意声音、生成语音、随时听写、还能让你的 AI 智能体用你拥有的声音开口说话。它是 ElevenLabs(语音输出)与 WisprFlow(语音输入)的本地优先、免费开源二合一替代品,整套语音 I/O 栈都跑在你自己的机器上。

    ⭐ GitHub 43,196 stars | 🍴 5,280 forks | 📅 创建于 2026-01-25,更新于 2026-07-19(当日 GitHub Trending 热门)| 📜 MIT 许可 | 💻 TypeScript / Tauri(Rust) / FastAPI(Python)

    🛠 安装要求和过程

    环境要求

    • 普通用户:直接下载桌面应用,无需配置开发环境;支持 macOS(Apple Silicon / Intel)、Windows、Linux(需源码构建)、Docker。
    • GPU 加速:macOS 走 MLX/Metal(神经引擎快 4-5×),Windows/Linux NVIDIA 走 CUDA,AMD 走 ROCm,Intel Arc 走 IPEX/XPU,Windows 任意显卡走 DirectML,无显卡则回退 CPU。
    • 开发者构建:需 BunRustPython 3.11+Tauri 前置依赖(macOS 还需 Xcode)。

    快速安装(三种方式)

    方式一 · 下载安装包(推荐)

    方式二 · 开发者一键启动

    git clone https://github.com/jamiepine/voicebox.git
    cd voicebox
    just setup    # 创建 Python venv 并安装全部依赖
    just dev      # 启动后端 + 桌面应用

    (先安装 just 命令运行器:brew install justcargo install just

    方式三 · 接入 AI 智能体(MCP)

    claude mcp add voicebox \
      --transport http \
      --url http://127.0.0.1:17493/mcp \
      --header "X-Voicebox-Client-Id: claude-code"

    ✨ 核心功能

    Voicebox 界面

    1. 7 大 TTS 引擎,自由切换:Qwen3-TTS、Qwen CustomVoice、LuxTTS、Chatterbox Multilingual、Chatterbox Turbo、HumeAI TADA、Kokoro,覆盖 23 种语言(英/阿/日/印地/斯瓦希里等),并支持零样本声音克隆与 50+ 预设音色。
    2. 声音克隆 + 语音性格:几秒参考音频即可克隆任意声音;可为每个声纹绑定自由格式的”性格”,通过本地 Qwen3 LLM 实现 Compose(即兴台词)与 Speak-in-character(拟人改写)。
    3. 全局听写 / 语音输入:系统级热键按住说话、松手即停(push-to-talk),macOS 下自动粘贴到当前输入框;底层基于 OpenAI Whisper 的 STT,支持 Base/Small/Medium/Large/Turbo。
    4. 后期音效处理:基于 Spotify pedalboard 的 8 种效果——变调、混响、延迟、合唱、压缩、增益、高/低通滤波,可实时预览并存为预设。
    5. Agent 语音输出(MCP):一句 voicebox.speak() 调用,任何支持 MCP 的智能体(Claude Code / Cursor / Cline / Windsurf)都能用你克隆的声音向你播报任务进展。

    Voicebox Stories 编辑器

    🎯 典型使用场景

    • 播客 / 有声内容创作:用内置 Stories 多轨时间线编辑器,零样本克隆嘉宾声音,一键生成多角色对话、播客与叙事音频,长文本自动分块 + 交叉淡入淡出。
    • AI 编码智能体开发循环:把 Claude Code 绑定到某个克隆声纹,构建完成、测试通过时它能”开口”告诉你——用耳朵接收进度,而不是一直盯着终端。
    • 无障碍与语音辅助:为无法用原声说话的人提供克隆声音;全局热键听写 + macOS 自动粘贴,大幅提升文字录入效率。
    • 游戏 / 叙事交互:为游戏角色或互动叙事工具接入带”性格”的语音,实现有情绪、带语气词的拟人对话。

    💡 推荐理由

    我用过多家云端语音服务,Voicebox 最打动我的是三点:

    • 真正的本地优先 + 隐私优先。模型、声音数据、录音全部留在本机,不上传任何云,对注重数据主权的用户极其友好。
    • 输入 + 输出一站式。ElevenLabs 只管”说”,WisprFlow 只管”听”,Voicebox 把两者打通,还用一个本地 LLM 串联性格改写,一 GPU 显存占用搞定全套。
    • 给 AI Agent 配声音这个设计非常新颖。当你的编码助手能用你熟悉的声音播报”部署完成”,人机交互的体验立刻不一样,这也是它和同类工具最大的差异化。

    ⚠️ 一点不足:Linux 目前没有预编译二进制,需要源码构建;同时 7 个引擎质量参差,部分小模型音色一般,建议按场景挑选。但瑕不掩瑜,作为开源语音 I/O 基础设施,它已经非常能打。

    📥 下载地址

    本文由自动化脚本基于 GitHub 公开仓库信息整理,项目数据截至 2026-07-19。

  • Open Design:开源版 Claude Design,把你的编码智能体变成设计引擎

    Open Design:开源版 Claude Design,把你的编码智能体变成设计引擎

    ⭐ 79.6K Stars  ·  Apache-2.0  ·  TypeScript  ·  本地优先桌面应用

    项目简介

    Open Design 是 Anthropic Claude Design 的开源替代方案——一个本地优先(local-first)的桌面应用,让你的 Claude Code / Codex / Cursor / Gemini 等编码智能体直接化身”设计引擎”,生成网页、桌面、移动端原型、实时仪表盘、演示文稿、图片与视频,并导出为 HTML / PDF / PPTX / MP4 真实文件。

    Open Design 工作台

    安装要求与过程

    环境要求

    • 桌面应用:macOS(Apple Silicon / Intel x64)、Windows(x64)、Linux(AppImage)——无需 Node / pnpm / 克隆仓库。
    • 自托管:Docker + Docker Compose;源码运行需 Node 24、pnpm 10.33.x。
    • 编码智能体:Claude Code、Codex、Cursor、Copilot、OpenClaw、Gemini、Hermes、Kimi、Trae、OpenCode 等 25+ 本地 CLI,或任意 OpenAI 兼容端点(BYOK)。

    快速安装

    1. 下载桌面应用(推荐,零配置):前往官网或 GitHub Releases 下载对应平台安装包;安装后自动检测 PATH 上的编码智能体,加载 100+ 功能技能、渲染模板目录与 151 套设计系统。
    2. 装进编码智能体(无界面)od mcp install <agent><agent> = claude | codex | cursor | copilot | gemini | hermes | kimi | trae | opencode …);或用托管脚本 curl -fsSL https://open-design.ai/install.sh | sh -s <agent>
    3. Docker 自托管
      git clone https://github.com/nexu-io/open-design.git
      cd open-design/deploy
      cp .env.example .env
      echo "OD_API_TOKEN=$(openssl rand -hex 32)" >> .env
      docker compose up -d
      # 打开 http://localhost:7456
    4. 源码运行
      git clone https://github.com/nexu-io/open-design.git
      cd open-design
      corepack enable && pnpm install
      pnpm tools-dev run web

    核心功能

    内置 151 套品牌级设计系统

    1. 智能体原生、模型无关:不绑定任何厂商 Agent,你 PATH 上已有的 claude / codex / cursor / copilot / hermes / kimi 就是设计引擎,一键切换;一条 od mcp install <agent> 把 MCP 服务器接入 25+ 编码智能体。
    2. 品牌级 DESIGN.md 设计系统:每一帧渲染都读取当前包的 DESIGN.md 作为品牌契约;仓库内置 151 套品牌级设计系统(Claude、Stripe、Figma、Apple、NVIDIA…),丢进文件夹即被识别。
    3. 多形态产物,单一项目:Studio 支持原型(web / desktop / mobile 单页)、实时仪表盘 / artifact、演示文稿(deck)、图片、视频与 HyperFrames 动态图形,统一导出 HTML / PDF / PPTX / MP4。
    4. 四层可组合:插件(可运行工作流)+ 功能技能(Agent 行为)+ 设计模板(渲染蓝图)+ 设计系统(品牌),全部用可移植、可版本化的目录,任何人都能创作与发布;官方 277 个插件 + 183 个可复用示例。
    5. 本地优先 + BYOK 隐私:原生桌面应用(macOS / Windows)+ Docker + Vercel;所有数据在你本机、团队服务器或部署项目里运行,BYOK 代理具备 SSRF 防护,沙箱 iframe 预览。

    Open Design 支持的 25 个编码智能体 CLI

    典型使用场景

    • 一句话生成落地页:在入口视图输入 brief,智能体结合 saas-landing 模板与 Linear 设计系统,流式生成带 hero / 特性 / 定价 / CTA 的可运行着陆页,直接导出 HTML 部署。
    • 实时数据仪表盘:用 dashboard 模板生成带侧边栏的管理 / 分析看板,作为 live artifact 实时刷新,而非静态截图。
    • 品牌统一的演示文稿:用 guizang-ppt / html-ppt 模板生成杂志风 Web PPT;或把现有 git 仓库 + DESIGN.md 交给智能体,自动把真实组件重构到品牌规范(含 Figma / Pencil → React / Next / Vue 迁移插件)。

    演示文稿 / Deck 产物

    插件与集成生态

    推荐理由

    作为天天和编码智能体打交道的人,最打动我的是它把”设计”从闭源付费的云端玩具,变成了你笔记本上的文件系统——你的 CLI 是引擎,笔记本是工作室,团队的 DESIGN.md 是品牌契约。相比 Claude Design 的封闭锁定,Open Design 的 agent-native + 模型无关 + Apache-2.0,让我可以随意换模型、自托管、调用 151 套现成设计系统,还能用 277 个插件把 Figma 工作流迁到 React。对想把”vibe coding”从代码延伸到 UI / 海报 / 演示的人来说,这是目前最完整、最开放的一个选择。

    下载地址

  • 124K Star 的「AI 应用宝库」:awesome-llm-apps,100+ 个拿来即跑的 LLM / RAG 项目

    124K Star 的「AI 应用宝库」:awesome-llm-apps,100+ 个拿来即跑的 LLM / RAG 项目

    awesome-llm-apps 项目预览

    一、项目简介

    awesome-llm-apps 是一个收录了 100+ 个端到端测试过、Apache-2.0 协议的开源 AI Agent、Agent Skills 与 RAG 应用的精选仓库——clone、定制、上线,全部免费。它兼容 Claude、Gemini、GPT、DeepSeek、Llama、Qwen 以及各类本地开源模型,是当下 GitHub 上星标增长最快的 LLM 应用模板库之一(124K+ Star)。

    二、安装要求和过程

    环境要求

    • Python 3.8+(多数模板基于 Streamlit / 各厂商官方 SDK)
    • 一个 LLM API Key(Claude / Gemini / GPT / DeepSeek / Llama / Qwen 均可,部分模板支持本地模型)
    • Git 与可联网环境

    快速开始(跑一个 Agent,约 30 秒)

    git clone https://github.com/Shubhamsaboo/awesome-llm-apps.git
    cd awesome-llm-apps/starter_ai_agents/ai_travel_agent
    pip install -r requirements.txt
    streamlit run travel_agent.py

    或者,给编码助手装一个 Skill(约 10 秒)

    npx skills add https://github.com/Shubhamsaboo/awesome-llm-apps/tree/main/agent_skills/project-graveyard

    模板每周持续更新;项目模型无关,支持 Ollama 等本地推理,方便对比与替换。

    三、核心功能

    1. 100+ 端到端验证的开源应用:不是 demo 片段,而是每个都能 pip install && run 的完整项目,统一 Apache-2.0,可商用可修改。
    2. 15 大场景全覆盖:从单文件 Starter Agent,到多智能体团队、语音 Agent、MCP 工具调用、RAG 检索、记忆、微调、生成式 UI,再到 Autonomous 游戏 Agent。
    3. Agent Skills 一键安装:把可复用能力直接装进 Claude Code / Codex / Cursor,每条 Skill 都带真实代码并通过「安全 + 评测」CI 门禁。
    4. 模型无关:Claude、Gemini、GPT、DeepSeek、Llama、Qwen 乃至本地模型通吃,方便横向对比。
    5. 自带框架速成课:Google ADK、OpenAI Agents SDK 的 Crash Course,边抄边学编排范式。

    Project Graveyard Agent Skill

    Project Graveyard —— 帮你复盘每个弃坑副业、并找出最值得捡回来的那个的 Agent Skill

    四、典型使用场景

    • 30 分钟搭一个 AI 应用:想做旅行助手、数据分析 Agent、博客转播客?直接 clone 对应 starter 模板、改个 API Key 即可运行。
    • 给编码助手加能力:团队要一个「Scope Creep Detector(范围蔓延检测)」或「Commit Archaeologist(提交考古)」?npx skills add 一行搞定,立刻在 Claude Code / Cursor 里可用。
    • 系统学习 RAG / 多智能体:仓库内含 20+ 个 RAG 教程与多智能体团队模板,即开即用,省去从零搭脚手架。

    Always-on HN Briefing Agent

    Always-on HN Briefing Agent —— 按日程巡逻、把每天值得看的 Hacker News 推送到 Slack / 邮箱的后台 Agent

    Insurance Claim Live Agent Team

    Insurance Claim Live Agent Team —— 基于 Gemini Live 的实时语音理赔 Agent 团队

    五、推荐理由

    对一个想动手做 AI 应用、又不想从零啃文档的人,这是目前质量最高、最「能跑」的 LLM 应用模板库之一。每个模板都是真实可运行代码,省去脚手架与踩坑成本;模型无关意味着你可以拿自己的 Key 直接试;Agent Skills 的设计尤其实用——把沉淀下来的工程能力变成可复用 Skill,正好契合当下 coding agent 的工作流。

    Self-Improving Agent Skills

    Self-Improving Agent Skills —— 用 Gemini + ADK 让 Skill 针对评测自我重写的进阶玩法

    唯一要注意的是:部分模板依赖特定商业模型的 API,跑之前看一眼 requirements.txt 与 README 里的模型说明即可。

    六、下载地址

  • 🔥 Firecrawl:为 AI 智能体而生的网页抓取与搜索 API(152.7K Stars)

    🔥 Firecrawl:为 AI 智能体而生的网页抓取与搜索 API(152.7K Stars)

    Firecrawl

    Firecrawl 是一个面向 AI 的开源网页数据 API——把”搜索、抓取、与网页交互”封装成一套可靠的服务,自动把任意网页转换成干净的 Markdown 或结构化 JSON,让大模型和智能体直接可用。

    一、项目简介

    一句话:Firecrawl 是”为 AI 而生的 Web 数据 API”。它覆盖 96% 的网页(含 JS 重度页面),P95 延迟仅 3.4s,把你从反爬、代理轮换、JS 渲染等脏活中彻底解放出来,专注业务本身。

    二、安装要求和过程

    环境要求

    • 一门开发语言运行时:Python 3.8+Node.js 18+
    • 一个 Firecrawl API Key(在 firecrawl.dev 免费注册即可获取,含免费额度)
    • 自托管可选:Docker + Docker Compose、Redis、用于渲染的 Playwright Key

    快速安装

    Python:

    pip install firecrawl-py

    Node.js:

    npm install firecrawl

    CLI(一行给 Agent 装好 Skill + 浏览器能力):

    npx -y firecrawl-cli@latest init --all --browser

    配置密钥后,三行代码即可抓取:

    from firecrawl import Firecrawl
    
    app = Firecrawl(api_key="fc-YOUR_API_KEY")
    doc = app.scrape("https://firecrawl.dev", formats=["markdown"])
    print(doc.markdown)

    自托管(数据完全自控):

    git clone https://github.com/firecrawl/firecrawl
    cd firecrawl && cp .env.example .env   # 填入 REDIS_URL、PLAYWRIGHT_KEY 等
    docker compose up -d

    三、核心功能

    • 一体化 Web API:Search / Scrape / Crawl / Map / Batch Scrape / Agent / Interact 七大端点,覆盖”找源 → 取内容 → 结构化”全链路。
    • LLM 就绪输出:自动输出干净 Markdown、带 Schema 的结构化 JSON、截图,省 token、少噪音。
    • 工业级可靠性:覆盖 96% 网页(含 JS 重度页面),P95 延迟 3.4s,自动处理反爬、代理轮换、限速与 JS 拦截。
    • Interact 交互式抓取:抓下页面后用 AI 提示词或代码”点击 / 滚动 / 输入 / 等待”,轻松拿下动态页面。
    • Agent 自治 + MCP/Skill 一行接入:用自然语言描述需求即可自动收集数据;一条命令接入 Claude Code、Cursor 等任意 MCP 客户端。

    四、典型使用场景

    • RAG 知识库构建:批量 Crawl 文档站转 Markdown,直接灌入向量库,告别手写爬虫。
    • AI 智能体联网:通过 MCP 让 Claude Code / Cursor 等 Agent 实时检索并读取网页,回答才有”活水”。
    • 竞品与市场研究:用 Agent 端点一句话拿到结构化竞品定价、功能对比,无需提前知道 URL。

    五、推荐理由

    做过 RAG 或 AI Agent 的人都懂:自己写爬虫要处理反爬、JS 渲染、代理池、限速……Firecrawl 把这些脏活全包了,输出直接是干净 Markdown,省下大量 token 和调试时间。免费额度对个人项目足够,MCP 接入极简,AGPL-3.0 协议还能自托管把数据攥在自己手里。如果你的应用”需要联网”,它几乎是第一选择。

    六、下载地址

  • Ponytail:让 AI 编码智能体像最懒的高级开发一样思考,代码量直降 54%

    Ponytail:让 AI 编码智能体像最懒的高级开发一样思考,代码量直降 54%

    Ponytail logo

    你肯定见过那种人:长马尾、圆框眼镜、在公司待得比版本控制系统还久。你给他看五十行代码,他看都不看,沉默两秒,用一行把它换掉——而且一次跑通。Ponytail 就是把这位”最懒的高级开发”塞进了你的 AI 编码智能体。

    它不是一个新模型,也不是一个新 IDE,而是一套规则集 / Skill:在动手写代码前,先逼 Agent 在”懒惰阶梯”上逐级确认——这东西真的需要存在吗?代码库里已经有了吗?标准库能解决吗?浏览器原生支持吗?……直到最后一步才允许写出”最小可用”的代码。结果是在真实 FastAPI + React 仓库上实测:代码量少 54%、成本降 20%、速度快 27%,安全性 100% 不打折

    一、项目简介

    Ponytail 是一个跨 20+ AI 编码智能体(Claude Code、Codex、Cursor、Windsurf、Cline、Gemini CLI、Copilot CLI、Aider、Kiro、Zed、Hermes Agent、OpenCode、Qoder 等)的”极简工程规则集”,教 Agent 像最懒的高级开发一样思考——能不写就不写,能复用就复用,用最小必要代码解决问题,同时永不削减安全、校验与可访问性护栏。

    二、安装要求与过程

    环境要求

    • Node.js:Claude Code / Codex 插件会运行两个轻量 Node.js 生命周期 hook,需要 node 在 PATH 上(nix/nvm 用户注意非交互 shell 的 PATH)。没有也没关系——Skill 照常工作,只是常驻激活会保持静默。
    • 任一支持的 AI 编码助手:覆盖 20+ 平台,无需统一环境。
    • 零配置:不需要任何配置文件;可选 ~/.config/ponytail/config.jsonPONYTAIL_DEFAULT_MODE 环境变量设置默认强度(lite/full/ultra/off,默认 full)。

    快速安装(以 Claude Code 为例)

    /plugin marketplace add DietrichGebert/ponytail
    /plugin install ponytail@ponytail

    ⚠️ 两条 /plugin 命令需分两次发送才能生效。

    其他平台的极简安装:

    • Codexcodex plugin install ponytail@ponytail
    • Cursor / Windsurf / Cline:复制仓库里的 .cursor/rules/ponytail.mdc(或对应 rules 文件)到项目
    • Gemini CLIgemini extensions install https://github.com/DietrichGebert/ponytail
    • OpenCode:在 opencode.json{"plugin":["@dietrichgebert/ponytail"]}
    • Hermes Agenthermes plugins install DietrichGebert/ponytail --enable
    • 更多(Kiro、Zed、Qoder、Pi、Devin、OpenClaw、Amp、Jules、Swival、CodeWhale…)见仓库 docs/agent-portability.md

    三、核心功能

    1. 七阶”懒惰阶梯”(Ladder of Laziness)

    在写代码前,Agent 会停在第一个成立的台阶上:

    1. 这东西需要存在吗?      → 不需要:跳过(YAGNI)
    2. 代码库里已经有了?      → 复用,别重写
    3. 标准库能搞定?          → 用它
    4. 平台原生能力?          → 用它(比如 <input type="date">)
    5. 已安装的依赖里有?      → 用它
    6. 一行能解决?            → 一行
    7. 只有到这步才:写最小可用

    关键是它在”理解问题之后”才跑这把梯子:先读被改动触碰的代码、追真实的调用流,再选台阶。对”怎么解”偷懒,但对”读懂”绝不懈怠。

    2. 四档强度 + 子代理注入

    /ponytail [lite|full|ultra|off] 切换力度,ultra 留给”这个代码库个人得罪了你”的时刻;规则集会自动注入通过 Agent 工具派生的每一个子代理(可用 PONYTAIL_SUBAGENT_MATCHER 正则按 agent 类型做白名单)。

    3. 六个专门命令(Skills)

    • /ponytail-review:审查当前 diff 的过度设计,直接给你一份”删除清单”
    • /ponytail-audit:不止看 diff,全仓审计过度工程
    • /ponytail-debt:把延后的 ponytail: 捷径汇总成账本,防止”以后再说”变”永远不做”
    • /ponytail-gain:展示 benchmark 实测的收益记分牌
    • /ponytail-help:命令速查

    4. 懒而不怠(Lazy, not negligent)

    信任边界校验、数据丢失处理、安全、可访问性,永远不在削减之列。这也是它和裸”写一行代码”提示最根本的区别——后者在基准测试里安全性从 100% 掉到了 95%。

    5. 极致的可移植性

    同一套规则用 20+ 平台的原生格式分发:Claude Code 插件、Codex 插件、Cursor rules、Windsurf rules、.clinerulesAGENTS.md.kiro/steering.qoder/rules、Gemini extension、OpenCode 插件、Hermes 插件、OpenClaw skills、Copilot instructions……你在不同工具间切换,规则无缝复用。

    四、典型使用场景

    场景 1:过度膨胀的日期选择器

    你只想要个日期选择。普通 Agent 会装 flatpickr、写 wrapper 组件、加样式表、顺带开一场关于时区的讨论。Ponytail 下:

    <!-- ponytail: 浏览器原生就有 -->
    <input type="date">

    实测:日期选择器从 404 行降到 23 行,颜色选择器 287 → 23——因为它伸手去够原生的 <input>,而不是搬一个组件库进来。

    场景 2:真实仓库的 feature 开发

    作者用无头 Claude Code 编辑真实 FastAPI + React 仓库(tiangolo 的全栈模板),跑 12 个真实工单,同一 Agent 开/关 Ponytail 各 n=4(Haiku 4.5)对比:

    对比项 代码量 Token 成本 耗时 安全
    Ponytail -54% -22% -20% -27% 100%
    裸”YAGNI+一行”提示 -33% -14% -21% -30% 95%

    Ponytail 是唯一一个每项指标都下降、且全程 100% 安全的方案。省下的成本和延迟只是”顺手”的副作用。

    场景 3:代码审查与技术债治理

    提 PR 前跑 /ponytail-review,让它帮你揪出过度工程化的代码并给出删除清单;/ponytail-audit 做整仓体检;/ponytail-debt 防止”以后再说”变成”永远不做”。这比人工 code review 更狠,也更不近人情——但代码更健康。

    五、推荐理由(个人心得)

    • 哲学站得住脚:它从没把”最少 token”当目标,目标是”只写任务真正需要的”。代码小是因为必要,不是因为炫技压缩。这点戳中了我——太多”极简”提示是以砍掉边界校验为代价的。
    • 数据诚实得罕见:作者主动承认早期单轮 benchmark 有基线水分,老老实实用 agentic 基线重测,给出均值 -54% 而不是挑最好看的数字。这种克制在开源圈不多见。
    • 跨平台分发太香:我同时在 Claude Code 和 Cursor 之间横跳,同一套规则零摩擦复用,不用维护两份 prompt。
    • 该狠的地方真狠:review / audit / debt 三个命令简直是”代码洁癖患者”的福音。

    当然也有边界:对已经极简的代码它收益趋近于零;在会”深思熟虑每一步”的 terse 推理模型(如 GPT-5.5)上,反而可能因思考 token 增加而变慢——所以它最擅长的是那些”爱过度构建”的 Agent。一句话:把 Ponytail 交给爱加戏的 Agent,把自由留给真正需要创造力的你。

    六、下载地址

    许可证:MIT | 语言:JavaScript | 当前 Star:85K+

  • Hermes Agent:会自己进化的 AI 智能体,越用越懂你(216K★ · Nous Research 开源)

    Hermes Agent:会自己进化的 AI 智能体,越用越懂你(216K★ · Nous Research 开源)

    Hermes Agent

    Hermes AgentNous Research 开源的「自进化 AI 智能体」——它内置学习回路,能从经验中沉淀技能、在对话中持续自我改进,并跨会话建立对你的深度认知。它可以跑在 5 美元的 VPS、GPU 集群,或是近乎零成本的 Serverless 上,彻底不依赖你的笔记本电脑:你甚至能在手机 Telegram 上给它派活,它却在云端 VM 里默默干活。

    📦 安装要求和过程

    环境要求

    • 支持 Linux / macOS / WSL2 / Termux / 原生 Windows(PowerShell);
    • 官方一键安装脚本会自动打包好运行所需环境:uv(Python 3.11)、Node.js、ripgrep、ffmpeg,以及隔离的 MinGit(Windows 原生无需管理员权限);
    • 至少准备一个 LLM Provider 的 API Key,或直接使用 Nous Portal 一站式订阅(300+ 模型 + 工具网关)。

    快速安装

    Linux / macOS / WSL2:

    curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash
    source ~/.bashrc      # 重载 shell
    hermes               # 开始对话

    Windows(原生 PowerShell):

    iex (irm https://hermes-agent.nousresearch.com/install.ps1)

    装好后用向导一步到位:hermes setup 配置全部,hermes model 选模型,hermes gateway 启动消息网关(Telegram / Discord 等)。

    ✨ 核心功能

    1. 闭环学习回路(Closed Learning Loop)
    Agent 自主策展记忆并周期性自我提醒;完成复杂任务后自动创建技能,并在后续使用中不断自我改进。配合 FTS5 会话检索 + LLM 摘要实现跨会话回忆,兼容 agentskills.io 开放标准,并引入 Honcho 辩证式用户建模——它会越来越懂你。

    2. 真实终端体验 & 随处可达
    完整 TUI:多行编辑、斜杠命令自动补全、流式工具输出、可随时打断重定向。单个网关进程同时接入 Telegram / Discord / Slack / WhatsApp / Signal / 邮件,支持语音转写与跨平台对话连续。

    3. 40+ 工具 & MCP & 子智能体并行
    内置终端、文件、Web 搜索、图像生成等 40+ 工具,提供 6 种终端后端(local / Docker / SSH / Singularity / Modal / Daytona);可派生隔离子智能体并行工作流,并通过 RPC 把多步流水线压成「零上下文成本」的回合。

    4. 定时自动化 & 模型自由
    内置 cron 调度器,用自然语言描述即可跑日报、夜备、周审并投递到任意平台;hermes model 一行切换 Nous Portal / OpenRouter / OpenAI / 自有端点等 300+ 模型,零锁定

    5. 安全 & 自托管
    命令审批、DM 配对、容器隔离一应俱全;可部署在 5 美元 VPS 或 GPU 集群,Daytona / Modal 提供 Serverless 持久化——空闲时近乎零成本。

    🎯 典型使用场景

    场景一:个人随身助理
    在手机 Telegram 给云端 VM 里的 Hermes 派活,它后台跑长任务,完工把日报推回 Telegram——你的笔记本全程不用开机。

    场景二:研发自动化工作台
    接入 MCP 服务器 + 派生子智能体并行做代码库理解、批量改文件、跑测试;用 cron 每晚自动备份、每周自动审计,全程无人值守。

    场景三:研究 / 数据流水线
    批量生成并压缩 trajectory 用于训练下一代 tool-calling 模型;跨会话记忆让科研助理越用越贴合你的研究偏好。

    💡 推荐理由

    我用过不少 AI Agent,Hermes 最打动我的是它真的「会成长」:多数 Agent 是一次性工具,而 Hermes 把经验固化成可复用技能,用得越久越顺手,这对长期个人助理场景价值巨大。其次是模型与平台都不锁定——想省事用 Nous Portal 一站式,想自由就自带 Key,迁移成本极低。最后是它真正「住在云端」的设计(Telegram 触达 + Serverless 休眠),特别适合不想一直开着电脑的人。

    🔗 下载地址

  • 花6880美元买个AI管家?Vertu这台奢侈手机实测有点尴尬

    英国奢侈手机品牌 Vertu 又出新品了。这台叫 Alphafold 的折叠屏,起售价 6880 美元,主打卖点是给高管当”AI 管家”。TechCrunch 拿到真机跑了一段时间,结论有点扎心:想法很大,执行差点意思。

    Vertu Alphafold 折叠屏 AI 手机
    Vertu Alphafold:奢侈皮革外壳下,是一台想当 AI 管家的折叠屏

    这台手机的核心是预装的 Hermes Agent,基于开源的 Hermes 项目做的。官方宣传它能分析文件、跨 App 自动执行任务、记住之前的对话,搞不定的时候还能转接真人礼宾。听起来像是给 CEO 量身定做的私人助理。

    先看看这钱花在哪

    6880 美元能买什么?珠宝盒式的包装、皮套、充电线一整套,机身用了奢侈皮革,还配了个号称专用的 A5 安全芯片,说是对话加密、不拿去训练公开模型,企业还能部署到自己的私有基础设施上(不过这些安全说法在测试期没法独立验证)。硬件这块,Vertu 承认是跟中兴/努比亚的供应链合作搞的,自己主要负责奢侈材料、软件体验和售后。作为参照,努比亚自家的 Fold 才卖 1100 美元。

    Alphafold 重达 264 克,而三星 Galaxy Z Fold 7 只有 215 克。价格贵了六倍,还没有无线充电。

    AI 管家实测:敢干活,但不一定干对

    最关键的还是那个 AI。评测把 Hermes 和三星上的 Google Gemini 摆在一起比。总体感觉是:Hermes 更愿意自作主张直接动手,Gemini 则喜欢先跟你确认细节。听着 Hermes 更”能干”,可结果往往是 Hermes 把流程走完了,Gemini 给出的答案却更准。

    举两个例子。安排出差时,Hermes 说没有直飞早班机,还擅自把行程创建到了 7 月 7 日——可实际需要的是 7 月 18 到 19 日,最后只能转给人工礼宾兜底;Gemini 至少给了替代方案。分析文档也翻车:Hermes 一开始还能读表格,过了几天就”失忆”了,直接回一句”我没法访问你本地设备上的文件”;Gemini 则一直记着上下文。


    更早的版本更离谱,连上传文件、分析图片、转接礼宾都做不到,Vertu 收到反馈后才推了个服务器端修复。这种”边卖边补”的状态,出现在一台近 7000 美元的手机上,确实让人犯嘀咕。

    • 续航还行,单次充电能撑一天多,但没有无线充电;
    • Hermes 出自 Nous Research,此前有 15 亿美元估值的融资传闻;
    • Vertu 的老套路:早在 2023 年就被 Wired 扒出 MetaVertu 疑似基于中兴努比亚机型加奢侈外壳。

    评测最后的定调挺客气也挺直白:Alphafold 是一次雄心勃勃的尝试,想做一台”AI 优先”的奢侈手机,但执行水平配不上它的价签。想当高管的贴身 AI 管家,光靠皮革和金属堆料是不够的,AI 得先靠谱起来。

  • Grok Build:xAI 开源的终端 AI 编码智能体(16.4K+ Stars)

    Grok Build:xAI 开源的终端 AI 编码智能体(16.4K+ Stars)

    Grok Build 终端 AI 编码智能体 TUI 界面

    项目简介

    Grok BuildxAI(SpaceXAI) 本周开源的一款终端型 AI 编码智能体(Coding Agent)。它以一个全屏 TUI 为载体,把代码库理解、文件编辑、Shell 执行、网络搜索、长任务管理整合在一个可扩展的 harness 里,并支持交互式、headless 脚本/CI 以及通过 ACP 嵌入编辑器三种运行模式。

    安装要求和过程

    环境要求

    • 使用预编译二进制:macOS / Linux / Windows 均可一键安装。
    • 从源码构建:需要 Rust 工具链(仓库中的 rust-toolchain.toml 会自动锁定版本)和 DotSlash(用于拉取 bin/protoc 等 hermetic 工具)。

    快速安装(推荐)

    macOS / Linux / Git Bash:

    curl -fsSL https://x.ai/cli/install.sh | bash
    grok --version

    Windows PowerShell:

    irm https://x.ai/cli/install.ps1 | iex

    从源码构建

    cargo install dotslash
    cargo build -p xai-grok-pager-bin --release

    构建产物为 target/release/xai-grok-pager,官方安装包会把它命名为 grok。首次启动会引导浏览器完成认证。

    核心功能

    • 全屏终端 TUI:类似编辑器体验的沉浸式界面,支持鼠标、快捷键、滚动历史与模态操作。
    • 代码库感知:自动索引项目文件,支持跨文件编辑、执行 Shell 命令、网络搜索与上下文召回。
    • 长任务管理:检查点、重试、会话保持,适合复杂重构、多步骤自动化与失败恢复。
    • ACP 协议支持:通过 Agent Client Protocol 把 grok 嵌入 VS Code、Cursor 或其他编辑器,保留现有工作流。
    • MCP 与 Skills:可接入 MCP 服务器、加载 Skills、插件与 hooks,扩展 Agent 的工具集。
    • 三模运行:交互式 TUI、headless 脚本/CI、嵌入式编辑器,覆盖从日常开发到自动化的全场景。

    Grok Build 核心功能

    典型使用场景

    场景一:大型代码重构

    在 TUI 中描述“把同步数据库调用改为异步”,Grok Build 会自动跨文件改代码、跑 cargo test、处理失败重试,并生成可审查的 diff;用户只需确认或拒绝,不会丢失当前会话。

    场景二:CI 自动修复流水线

    在 headless 模式下接入 GitHub Actions/GitLab CI,当测试失败时自动拉取日志、定位根因、提交补丁,让 Agent 在 CI 中承担“修复工程师”角色。

    场景三:编辑器增强

    通过 ACP 在 VS Code 或 Cursor 中直接调用 grok,既保留现有 IDE 的快捷键和文件树,又能随时让 Agent 接管复杂任务。

    推荐理由

    • xAI 官方出品:仓库与 SpaceXAI 内部 monorepo 周期性同步,代码质量和更新频率有保障。
    • 终端原住民的体验:全屏 TUI 比聊天框更贴近开发者终端习惯,鼠标交互也降低了学习成本。
    • 架构清晰、可扩展:Rust 实现,crate 拆分明确(TUI / shell / tools / workspace / MCP 等),便于二次开发。
    • 热度极高:开源 4 天内斩获 16,428+ Stars、3,000+ Forks,是近期 GitHub Trending 上增长最快的 AI 编码项目之一。

    下载地址

    如果你已经习惯 Claude Code、Codex CLI 或 Cursor Agent,Grok Build 提供了一个更“终端原生”且可扩展的替代方案,值得一试。

  • OpenWiki:让 AI 智能体为你的代码库自动写「活文档」的 CLI 工具

    OpenWiki:让 AI 智能体为你的代码库自动写「活文档」的 CLI 工具

    OpenWiki

    项目简介

    OpenWiki 是 LangChain 开源的命令行工具,专为 AI 智能体(Agent)设计,能自动为你的代码库或个人知识源生成并持续维护一份本地 Wiki(知识库)。它把分散在代码、邮件、笔记、社交动态里的信息,用 LLM 合成结构化、可检索、可被编码助手直接引用的文档。

    安装要求和过程

    环境要求

    • Node.js 运行环境(推荐用 npmpnpm 安装)。Windows 上建议避开 bun——它安装时需要本地编译 better-sqlite3 原生依赖,需先装 Visual Studio Build Tools(桌面开发 with C++ 工作负载)。
    • 至少一个 LLM 提供商的 API Key:开箱支持 OpenAI / Anthropic / Gemini / Vertex AI / AWS Bedrock / OpenRouter / Fireworks / NVIDIA NIM 等,默认模型 gpt-5.6-terra

    快速安装

    # 全局安装
    npm install -g openwiki
    # 或
    pnpm add -g openwiki

    快速开始

    # 代码模式:初始化并配置模型/Key,自动为当前仓库生成文档
    openwiki --init
    
    # 进入交互式 CLI,开始生成仓库 Wiki
    openwiki
    
    # 带初始指令一次性运行
    openwiki "Please generate documentation for this repository"
    
    # 更新文档(可放进 CI 定时跑)
    openwiki --update
    
    # 个人大脑模式:从 Gmail/Notion/X 等构建本地知识库
    openwiki personal --init

    OpenWiki 提供 两种模式Code 模式为当前代码库在 openwiki/ 生成仓库文档;Personal 模式从配置的本地仓库、Gmail、Notion、Web Search、Hacker News、X/Twitter 在 ~/.openwiki/wiki 构建”个人大脑”。配置与密钥保存在本地 ~/.openwiki/.env

    核心功能

    1. 双模式 Wiki:代码库 & 个人大脑

    代码模式下,OpenWiki 不仅生成 openwiki/ 目录的仓库文档,还会在仓库根目录维护 AGENTS.mdCLAUDE.md;个人模式则把 Git / Notion / Gmail / X / Hacker News / Web 统一 ingested 成一份本地可问答的知识库。

    2. 为 Agent 而生:把 Wiki 焊进编码助手

    OpenWiki 用 <!-- OPENWIKI:START -->…<!-- OPENWIKI:END --> 注释块向 AGENTS.md / CLAUDE.md 注入指引,且只改写自己的区块、不动你写的内容。结果是 Claude Code、Codex、Cursor 等编码智能体在检索上下文时会直接引用这份 Wiki,而不用把整页代码塞进上下文窗口,显著节省 token。

    3. 多连接器 Ingestion

    内置 git-repo / gmail / notion / x(Twitter) / web-search(Tavily) / hackernews 连接器,同一连接器可配置多个实例(如 web-search-1web-search-2),用 openwiki auth <provider> 完成 OAuth 登录。

    4. 全模型供应商兼容

    开箱支持 OpenAI(含 ChatGPT 订阅登录,免 API 计费)、Anthropic、Gemini(AI Studio)、Gemini Enterprise(Vertex AI)、AWS Bedrock(IAM 凭证)、OpenRouter、Fireworks、Baseten、NVIDIA NIM、以及任意 OpenAI 兼容端点;甚至支持自托管/代理网关的 ANTHROPIC_BASE_URLOPENAI_COMPATIBLE_BASE_URL

    5. CI 自动化 + 隐私友好

    提供 GitHub Actions / GitLab CI / Bitbucket 流水线模板,定时自动开 PR 更新文档;数据全部存于本地(本地优先),匿名遥测可一键关闭(OPENWIKI_TELEMETRY_DISABLED=1DO_NOT_TRACK=1)。

    典型使用场景

    场景一:团队代码库”活文档”

    openwiki-update.yml 放进 GitHub Actions,每次定时运行自动生成/更新仓库 Wiki 并开 PR。新成员和 AI 编码助手都能秒懂项目结构、模块职责与历史决策,告别”文档写完就过期”。

    场景二:个人知识大脑

    连接 Gmail、Notion、X、Hacker News 与本地 Git 仓库,OpenWiki 把它们合成一份可问答的本地 Wiki。想回顾某段技术讨论或某封邮件结论时,直接对话即可,知识不再散落各处。

    场景三:给编码 Agent 减负

    OpenWiki 把 Wiki 注入 AGENTS.md / CLAUDE.md 后,Claude Code 等智能体在动手改代码前会先读 Wiki,避免重复探索、显著降低上下文 token 消耗——这正是”代码库语义化”落地的关键一环。

    推荐理由(个人使用心得)

    “代码库语义化”是 2026 年 Agent 基础设施里最实在的刚需之一。OpenWiki 的巧思在于:它不只是一个文档生成器,而是把生成的 Wiki 直接焊进 AGENTS.md / CLAUDE.md——这是 Claude Code、Codex、Cursor 都会主动读取的文件。换句话说,它让 AI 编码助手在每次开工前自动带上项目上下文,而不是靠把整页源码塞进上下文窗口。

    TypeScript 写的单 CLI、MIT 协议、本地优先、数据不出机器,对个人开发者和注重隐私的团队都很友好;LangChain 出品也意味着模型兼容性与工程质量有保障。唯一的小门槛是需要自备 LLM Key,以及 Windows 上用 bun 装要额外编译原生依赖——用 npm/pnpm 则毫无障碍。如果你已经被”AI 改代码却不懂项目全貌”折磨过,值得一试。

    下载地址