标签: MCP

  • AOS Community Edition:开源智能体操作系统,让 AI Agent 拥有自己的 OS

    AOS Community Edition:开源智能体操作系统,让 AI Agent 拥有自己的 OS

    AOS 核心亮点

    项目简介

    AOS Community Edition 是 Unicity 团队开源的「智能体操作系统」(Agent Operating System),为需要可检视、可组合环境的 AI 智能体提供完整的运行时基础设施。它包含 aos CLI 命令行、HTTP API、21 个官方 Capsule 组件、MCP 边缘入口以及 Unicity Audit 安全审计能力,全部以 Rust 编写并采用 MIT/Apache-2.0 双许可发布。

    安装要求与快速开始

    AOS 支持主流 Unix 系统(macOS / Linux)和 Windows。安装只需两步:

    # 1. 安装 aos CLI(含固定运行时和 21 个 CE capsule)
    curl --proto '=https' --tlsv1.2 -fsSL https://aos.unicity.ai/install.sh | sh
    
    # 2. 初始化工作区(从本地版本化资产置备 ~/.aos)
    aos init

    安装器会自动下载并锁定精确的运行时版本。每次发布附带校验和、Sigstore 签名包和 GitHub 构建溯源证明,签名前一律 fail-closed——未经验证的版本绝不会进入 stable 通道。

    升级同样简单:

    aos update          # 协调式产品升级(Homebrew 安装亦可)

    核心功能

    aos 命令速览
    • 统一的 aos CLI 与 HTTP API:一条命令管理一切——init / status / update / daemon / mcp / capsule build / doctor。命令边界清晰,产品自有实现与底层运行时无缝衔接。
    • 21 个官方 Capsule 组件:开箱即用的用户态构件,可被自由编排成 harness、meta-harness、connector 或服务。每个 capsule 以最小权限组合,能力粒度精细可控。
    • 一等公民的 MCP 支持aos mcp serve 是 Codex、Claude、Grok 共享的产品边缘入口。本地决策面在 macOS 提供 AppKit、Windows 提供原生对话框、Linux 使用 Pinentry——绝不收集密码与 URL
    • Forge 操作系统级构建工具:新智能体能检视运行中的系统、学习 capsule 模型、识别真实能力缺口,并用 Forge 构建验证最小权限 capsule。内置 meta-harness 技能教会智能体如何治理自己的世界。
    • 供应链安全与可验证发布:Sigstore 签名包 + GitHub 构建溯源证明 + runtime-compatibility.toml 锁定运行时/WIT 提交,fail-closed 策略确保只有经过完整验证的版本才能发布。

    典型使用场景

    场景一:多模型编码智能体的统一运行时

    你的团队同时使用 Codex、Claude Code 和 Grok 作为编程助手。通过 AOS 的 aos mcp serve,三个客户端共享同一套 MCP 工具链和审批策略,无需重复配置。每个智能体在隔离的 principal 下运行,操作员身份与目标环境分离——aos --principal operator init --target-principal alice 即可完成多租户置备。

    场景二:企业级智能体安全部署

    企业环境要求所有 AI 操作可审计、可回溯。AOS 的 Unicity Audit 能力配合 Sigstore 签名和 GitHub 构建溯源,让每个 capsule 的来源、权限边界、执行记录完全透明。aos doctor 可随时诊断运行态健康度,aos status --json 输出机器可读状态供 SIEM 集成。

    场景三:智能体自主扩展能力

    当现有 capsules 无法满足新需求时,智能体可以主动调用 Forge:检视当前系统 → 识别缺口 → 构建 capsule → 验证最小权限 → 注册到 harness。这形成了一个自进化的智能体操作系统——meta-harness 技能让智能体学会如何改进自己的世界模型。

    推荐理由

    AOS 解决了一个真正痛点:智能体缺乏像传统软件那样的操作系统级抽象。目前大多数 AI Agent 框架要么是 SDK 库(如 LangChain),要么是编排层(如 CrewAI),但它们都没有提供「进程管理、权限隔离、组件注册、供应链安全」这些 OS 级别的基础设施。

    AOS 用 Rust 从零构建了这套基础设施,Capsule 模型比 Docker 容器更轻量、比 npm 包更结构化。MCP 一等公民支持让它天然适配当前最热的 AI 互操作标准。加上 fail-closed 发布策略和 Unicity Audit,这在开源 AI 项目中是罕见的安全意识

    如果你正在构建生产级智能体系统,或者对 AI Agent 的工程化治理感兴趣,AOS 值得花一个周末深入体验。

    下载地址

  • aisuite:吴恩达开源的统一大模型调用库,一行代码切换 10+ 厂商

    aisuite:吴恩达开源的统一大模型调用库,一行代码切换 10+ 厂商

    aisuite 项目封面

    做 AI 应用的同学大概率都踩过同一个坑:今天想用 GPT-4o,明天想换 Claude,后天又想试试 Gemini,每换一家就得重写一整套 SDK 调用、参数映射、错误处理。吴恩达(Andrew Ng)团队开源的 aisuite,就是把这件事彻底变简单的那把钥匙——一套统一接口,调遍十余家大模型。

    项目简介

    aisuite 是一个轻量级 Python 库,提供两层能力:底层是跨厂商统一的 Chat Completions API,上层是带工具与 MCP 的 Agents API。它同时是桌面 AI 同事 OpenWorker 的底层基座。一句话概括:用一套 OpenAI 风格的接口,调用 OpenAI、Anthropic、Google 等所有主流大模型。

    安装要求和过程

    环境要求

    • Python 3.10 及以上
    • pip 包管理器
    • 对应厂商的 API Key(或本地运行 Ollama 免 Key)

    快速安装

    基础包(不含任何厂商 SDK):

    pip install aisuite

    按需安装指定厂商 SDK,或一次性装全:

    pip install 'aisuite[anthropic]'   # 仅 Anthropic SDK
    pip install 'aisuite[all]'         # 所有厂商 SDK

    配置 API Key(以环境变量为例):

    export OPENAI_API_KEY=sk-...
    export ANTHROPIC_API_KEY=sk-...

    一行调用示例——切换模型只改字符串:

    import aisuite as ai
    client = ai.Client()
    
    models = ["openai:gpt-4o", "anthropic:claude-3-5-sonnet-20240620"]
    messages = [
        {"role": "system", "content": "用海盗英语回答。"},
        {"role": "user", "content": "讲个笑话。"},
    ]
    for model in models:
        resp = client.chat.completions.create(
            model=model, messages=messages, temperature=0.75)
        print(resp.choices[0].message.content)

    核心功能

    aisuite 核心能力

    1. 统一 Chat Completions API:provider-agnostic 的 OpenAI 风格接口,模型名采用 <provider>:<model-name> 格式,aisuite 自动路由到正确的厂商与参数,切换模型只需改一个字符串。
    2. Agents API + Toolkits:把普通 Python 函数直接当工具,自动生成 schema、执行调用并回传结果;内置 files / git / shell 沙箱工具包;提供工具策略(审批、黑白名单)与状态持久化(内存 / 文件 / Postgres)。
    3. 原生 MCP 支持pip install 'aisuite[mcp]' 后,任意 MCP Server 的工具都能直接交给模型,无需胶水代码。
    4. 流式与异步stream=True 跨厂商统一分块输出,acreate 提供异步变体,工具调用同样可流式处理。
    5. 可扩展 Provider 适配器:按命名约定实现 <provider>_provider.py + <Provider>Provider 类即可被自动发现加载,轻松接入新厂商。

    支持的模型厂商

    aisuite 支持的模型厂商

    典型使用场景

    1. 多模型横向对比 / A/B 评测:同一段业务逻辑只改 model 字符串,就能对比 GPT-4o、Claude、Gemini 的输出质量与成本,非常适合做模型选型与回归测试。
    2. 本地优先 + 多云的 Agent 应用:aisuite 是 OpenWorker 的基座,可接入 Ollama 完全本地运行(数据不出本机),也能在云端多厂商间灵活切换,兼顾合规与弹性。
    3. 快速挂载 MCP 工具做文件 / 代码操作:一行声明 filesystem MCP,即可让模型列举目录、读写文件、执行 git 命令,省去繁琐的适配代码。

    推荐理由

    我个人非常看重 aisuite 解决的一个真实痛点:厂商锁定。在真实项目里,模型能力此消彼长,今天这家强、明天那家反超,aisuite 让你把”换模型”从”改一堆 SDK 代码”降级成”改一个字符串”,产品的可移植性直接拉满。

    它不只是简单的接口封装:Agents API 把工具调用、MCP、工具策略、状态持久化收敛到一套统一范式里,意味着你写一次 Agent,就能在多家模型间稳健落地;底层还能私有化(Ollama)满足数据合规需求。MIT 协议商用友好,对创业团队和个人开发者都很友好,强烈建议作为 AI 应用的默认底座。

    下载地址

    项目数据:★16.1K · 1.7K Fork · Python · MIT · 创建于 2024-06,最近更新 2026-07。

  • OpenWorker:吴恩达开源的本地优先 AI 同事,交付「已完成的工作」而非聊天

    OpenWorker:吴恩达开源的本地优先 AI 同事,交付「已完成的工作」而非聊天

    OpenWorker 品牌图

    OpenWorker 是深度学习之父吴恩达(Andrew Ng)开源的一款”本地优先”的 AI 同事(AI coworker)桌面应用。它不只想跟你聊天,而是要跨文件、终端和 25+ 应用连接器,真正把一件日常任务做完——交付一份排版好的文档、一条带数据的 Slack 回复、一份更新好的日历,或一个分诊完毕的收件箱。它运行在你的机器上,不锁定任何模型,用自己的 API Key(OpenAI / Anthropic / Google / 开源权重)或本地 Ollama 即可驱动。

    🖼️ 它是怎么工作的

    OpenWorker 工作原理

    桌面应用外壳(原生 GUI + Tauri)之下,是一套本地运行的 Python Agent 服务:引擎、工具、连接器都构建在吴恩达自己的 aisuite 之上;你的文件、终端、25+ 连接器与任意模型提供商,全部在你的机器上、用你的密钥运转。

    📦 安装要求和过程

    方式一:直接下载安装包(推荐)

    • macOS(Apple Silicon,12+):已签名公证、自动更新 → download.openworker.com/mac
    • Windows 10/11(x64):构建尚未代码签名,SmartScreen 会警告(签名进行中)→ download.openworker.com/windows
    • 打开应用 → 添加模型 Key(或指向 Ollama)→ 直接提出一个真实需求即可。

    方式二:从源码构建

    前置环境:Python 3.10+Node 20+,以及(桌面壳)通过 rustup 安装的 Rust 工具链。

    git clone https://github.com/andrewyng/openworker
    cd openworker
    
    # 1. 一次性引导,创建 Python venv(Windows 用 Git Bash / WSL)
    bash packaging/setup_dev_env.sh
    
    # 2. 启动本地 Agent 服务
    .venv/bin/openworker-server --cwd ~/some/project --port 8765
    #    Windows: .venv\Scripts\openworker-server.exe
    
    # 3. 另一个终端启动 UI
    cd surfaces/gui
    npm install
    npm run dev        # 浏览器 UI(Vite 端口)
    
    # 想跑完整桌面应用: npm run tauri dev

    ✨ 核心功能

    OpenWorker 核心亮点

    • 交付真实成果:文档、表格、报告、网页直接落地为可打开、可分享的文件,而不是一堆待办清单。
    • 25+ 应用连接器:GitHub、Slack、Jira、Notion、Linear、HubSpot、Outlook、monday.com、Gmail、Google Calendar,加上你的终端与本地文件;任何可通过 MCP 接入的工具都能插进来,并按工具粒度授权。
    • 自带模型密钥(BYOK):OpenAI、Anthropic、Gemini、Inkling、GLM、DeepSeek、Kimi、Qwen、MiniMax、Mistral、Grok,以及通过 Together / Fireworks 的开源权重模型,和 Ollama 本地模型;自带经工具调用验证的推荐清单。
    • 行动前先确认:写文件、发消息、执行命令都走审批门控;无人值守运行会把待办”问询”暂存到收件箱,绝不擅自行动。隐私本地优先——agent 循环、对话、连接器令牌、模型 Key 都留在本地密钥库。
    • 定时自动化:晨报、周报、频道值守等周期性任务按计划运行,结果带完整转录落回应用。

    🎯 典型使用场景

    1. Slack 里 @OpenWorker:在频道提及它,桌面自动开一个会话,用你的工具把活干完,答案作为线程回复回到频道。
    2. “准备一份客户简报””理清我的日历””跨 Jira 和 GitHub 看看发布进展到哪了”——它把任务拆成步骤,跨桌面、文件和已连接应用推进,重要动作前先与你确认。
    3. 定时晨报 / 周报:把重复性工作面交给自动化,每天/每周固定产出带完整记录的交付物。

    💡 推荐理由

    吴恩达出品,天然带着”让 AI 真正替你把事做完“的产品哲学。最打动我的是三点:一是本地优先 + 自带模型密钥,数据只通过你选定的模型和集成离开本机,隐私可控;二是“行动前确认”的克制设计,把 AI 代理从”话痨”拉回到”靠谱同事”;三是底层基于他自己的 aisuite(统一多模型 + Agent/MCP 层),想自己搭 Agent harness 的人也能拿它当参考实现。目前处于开放 Beta:可用、会自动更新、社区活跃,适合想把日常办公流程交给 AI 自动化、又不想把数据锁进某家云端的朋友尝鲜。

    🔗 下载地址

  • LiveKit Agents:用 Python 构建实时语音 AI 智能体的开源框架

    LiveKit Agents:用 Python 构建实时语音 AI 智能体的开源框架

    在语音助手、AI 客服、实时翻译早已不是新鲜事的今天,真正难的是:如何用一个干净、可编排、可私有部署的框架,把 STT、LLM、TTS 串成一次低延迟、不打断、能“看见”的实时对话。LiveKit Agents 正是为这件事而生。

    📌 项目简介

    LiveKit Agents 是一个用于构建实时、可编程的多模态语音 AI 智能体的开源框架,运行在服务器端,让智能体具备“看、听、理解”的能力。它把语音识别(STT)、大模型(LLM)、语音合成(TTS)以及实时模型(Realtime API)抽象成可自由替换的组件,并提供任务调度、工具调用、测试框架等一整套生产级能力。

    💻 安装要求与过程

    环境要求

    • Python 3.9+
    • 一个 LiveKit 服务器:可用 LiveKit Cloud,也可用开源的 livekit 自托管
    • 至少一家模型服务商的密钥:如 Deepgram(STT)、OpenAI / Google(LLM)、Cartesia(TTS)等
    • 如需电话接入,可启用 LiveKit 的 SIP / 电话栈

    快速安装

    pip install "livekit-agents[openai,deepgram,cartesia]"

    三种运行模式

    # 终端本地测试:无需外部服务器,直接验证交互
    python myagent.py console
    
    # 开发模式:连接 LiveKit 云/自托管,支持热重载
    python myagent.py dev
    
    # 生产部署:生产级优化
    python myagent.py start

    开发 / 生产模式需配置环境变量:LIVEKIT_URLLIVEKIT_API_KEYLIVEKIT_API_SECRET(以及对应模型服务商的 Key)。也可用 Agents Playground 快速体验。

    ✨ 核心功能

    • 灵活集成:完整的插件生态,自由混搭最合适的 STT、LLM、TTS 与 Realtime API。
    • 内置任务调度:通过 Dispatch API 自动做任务分配与分发,把终端用户连接到对应智能体。
    • 语义轮流检测(Turn Detection):用 Transformer 模型判断用户是否说完,显著降低误打断。
    • 原生 MCP 支持:一行代码即可把 MCP 服务器提供的工具接入智能体。
    • 内置测试框架:用断言(expect)配合 LLM 评判(judge)编写测试,对抗 LLM 的非确定性。
    • 全平台 WebRTC 客户端 + 电话集成:覆盖浏览器、iOS、Android、Flutter 等,并可拨打 / 接听电话。

    🎯 典型使用场景

    • 语音客服 / 订餐机器人:内置 restaurant_agent 范例,可处理来电订餐与预约,直接对接电话线路。
    • 外呼电话机器人:Outbound Caller 范例可自动批量拨打电话、播报与收集信息。
    • 多智能体接力(Handoff):多个 Agent 按流程交接(如先收集信息、再切换讲故事 Agent),适合工单分流、复杂客服。
    • 视频数字人:通过 Tavus、Bithuman、LemonSlice 等接入 AI 虚拟形象,做出“能说话的脸”。
    • 实时视觉 Agent:结合 Gemini Live 等,做出能“看见”环境并对话的助手(含 iOS 端范例)。

    💡 推荐理由

    我自己折腾过不少语音 Agent 方案,LiveKit Agents 最打动我的是它的“把复杂留给自己、把简单交给开发者”:一个 AgentSession 把你想要的 STT/LLM/TTS 一行声明完,多智能体切换、工具调用、打断检测都有官方最佳实践兜底;更关键的是整套栈可私有化——连媒体服务器都是开源的,数据不出自己的机房,对企业场景非常友好。再加上官方提供的 LiveKit Docs MCPAgent Skill,用 AI 编程助手来搭语音应用也顺手很多。如果你打算认真做一个“能听会说”的产品,它值得作为底座首选。

    🔗 下载地址

    LiveKit Agents 核心亮点

  • OpenWiki —— LangChain 出品的自我维护 Wiki CLI,让 Agent 为你写文档

    OpenWiki —— LangChain 出品的自我维护 Wiki CLI,让 Agent 为你写文档

    项目简介

    OpenWikiLangChain 团队开源的「自我维护 Wiki CLI」——一个命令行工具,让 AI Agent 自动为你的代码库或个人知识库撰写并持续维护 Markdown 文档。它内置 Deep Agents 文档智能体,读取源码后合成带链接的 Wiki,每次代码变更都能自动更新;同时提供交互式可视化节点图,让你像浏览思维导图一样探索整个知识体系。

    一句话总结:「为 Agent 写的文档,给人读的 Wiki。」

    OpenWiki
    OpenWiki — 自我维护的 Wiki

    安装要求与快速上手

    环境要求

    • Node.js ≥ 18(推荐 LTS 版本)
    • npm / pnpm 包管理器
    • 任一 LLM 提供商 API Key(首次运行时引导配置)

    安装步骤

    # 全局安装 CLI
    npm install -g openwiki
    
    # 初始化代码库文档(交互式选择模型提供商)
    openwiki --init
    
    # 一键更新文档
    openwiki --update
    
    # 启动可视化浏览器
    openwiki visualize

    个人知识库模式

    # 初始化个人大脑模式
    openwiki personal --init
    
    # 认证数据源连接器
    openwiki auth notion      # Notion OAuth
    openwiki auth gmail       # Gmail OAuth
    openwiki auth x           # X/Twitter OAuth
    
    # 执行全量数据摄取并生成 Wiki
    openwiki ingest all

    核心功能

    OpenWiki 核心速览

    1. Agent 驱动的自动文档生成

    基于 LangChain Deep Agents 框架的文档专用智能体,自动分析源码结构、模块依赖、函数签名和业务逻辑,生成结构化 Markdown 文档。支持 .openwikiignore 规则排除敏感路径(类似 .gitignore),确保私有信息不泄露。

    2. 双模式:Code Wiki + Personal Brain

    • Code 模式(默认):扫描当前仓库,输出到 openwiki/ 目录,同时维护根目录的 AGENTS.mdCLAUDE.md 引导文件。
    • Personal 模式:接入 Notion、Gmail、X/Twitter、Hacker News、Web Search 等数据源,将碎片化知识合成为本地 Wiki(存储在 ~/.openwiki/wiki/)。

    3. 12+ 模型提供商开箱即用

    默认 OpenAI(gpt-5.6-terra),同时支持 Anthropic Claude、Google Gemini、AWS Bedrock、GitHub Copilot、OpenRouter、Nebius/Fireworks/Baseten/NVIDIA NIM,以及任何 OpenAI 兼容端点(Ollama、LM Studio、LiteLLM 网关等)。Copilot 用户可直接复用现有订阅,无需额外购买 API Key。

    4. 交互式可视化浏览器

    运行 openwiki visualize 即可启动本地 Web 服务,将 Wiki 渲染为交互式节点图 + 实时 Markdown 阅读器。左侧树形目录导航,右侧图谱展示概念关系,点击节点即时查看内容。编辑文件后自动热重载。

    OpenWiki 可视化界面

    5. CI/CD 自动文档流水线

    通过 GitHub Actions / GitLab CI / Bitbucket Pipelines 定时触发文档更新,每次提交自动生成 Docs PR。零成本无变更运行——OpenWiki 会快照对比,只有实际变化才记录元数据,避免 CI 积分浪费。

    6. OKF 开放知识格式 & Mermaid 图表

    输出符合 Google Open Knowledge Format (OKF) v0.1 标准,可移植到任何 OKF 兼容工具。自动在合适位置插入 Mermaid 图表(序列图、ER 图、状态机、流程图),且每次更新都验证图表有效性,损坏的图表会降级为纯文本并在下次修复。

    典型使用场景

    场景一:大型项目新人 Onboarding

    一个拥有 200+ 微服务的后端仓库,新工程师通常需要两周才能理清架构。部署 OpenWiki 后,CI 在每次合并主分支时自动更新架构文档、模块关系图和 API 速查表。新人 clone 下来后 openwiki visualize 一眼看到全局,配合 AGENTS.md 让 AI 编码助手也能精准理解上下文。

    场景二:个人知识中台

    技术负责人的知识散落在 Notion 笔记、Gmail 重要邮件、Twitter 收藏的技术讨论和 HN 热帖中。OpenWiki Personal 模式一次性接入所有源,定期 ingest all 同步,自动去重、关联、归纳成带链接的知识网络。需要回忆某个技术决策时,可视化图中一眼定位。

    场景三:Agent 记忆层

    团队使用 Claude Code 或 Codex 做日常开发,但 Agent 的上下文窗口有限,无法容纳整个代码库历史。OpenWiki 生成的 AGENTS.md 作为持久记忆层,每次 Agent 启动时自动加载 Wiki 摘要,理解架构后再动手写代码,减少幻觉和无效重构。

    推荐理由

    作为 LangChain 官方出品,OpenWiki 解决了一个非常实际的问题:文档总是过时。传统方案要么靠人肉维护(没人愿意做),要么用静态文档生成器(只管骨架不管灵魂)。OpenWiki 的思路很聪明——把「写文档」这件事交给最懂代码的 Agent,同时保留人类对文档的所有权(纯 Markdown,版本控制)。

    我个人最喜欢的三个设计:
    Copilot 复用——如果你已经有 GitHub Copilot 订阅,直接拿来跑推理,不用再掏钱买 API Key;
    .openwikiignore——安全意识很好,从根源上防止密钥泄露进文档;
    可视化节点图——不是花哨功能,对于理解陌生代码库真的有用,比翻几十个 README 快十倍。

    13K+ Stars、日增上千的趋势也说明社区对这个方向的认可。如果你正在维护一个中等规模以上的项目,或者想让 AI 编程助手更懂你的代码库,OpenWiki 值得一试。

    下载地址

  • HTML Anything:让本地 AI 智能体一键生成可发布的 HTML(8K+ Stars)

    HTML Anything:让本地 AI 智能体一键生成可发布的 HTML(8K+ Stars)

    HTML Anythingnexu-io 开源的本地优先(local-first)AI HTML 编辑器:你只需提供 Markdown、CSV、Excel、JSON 或零散笔记,按下 ⌘+Enter,本地已登录的编码智能体就会把内容渲染成可直接发布的单文件 HTML。

    HTML Anything — 智能体时代的 HTML 编辑器
    HTML Anything — 智能体时代的 HTML 编辑器

    项目简介

    它不做模型、不卖 API,而是把你已经装好的 Claude Code、Cursor Agent、Codex、Gemini CLI、GitHub Copilot CLI、OpenCode、Qwen Coder、Aider、IBM Bob 等 9 款编码智能体 CLI 当作后端,通过 75 个可组合技能模板,输出 9 种常见“交付形态”:杂志文章、演示文稿、简历、海报、小红书卡片、推文卡片、网页原型、数据报告、Hyperframes 视频帧。生成结果支持一键粘贴到微信公众号、知乎、X / 微博 / 小红书,或下载 .html / .png。

    核心亮点速览:9 CLI / 75 技能 / 9 交付形态 / 零 API Key / 一键导出
    核心亮点速览:9 CLI / 75 技能 / 9 交付形态 / 零 API Key / 一键导出

    安装要求与快速开始

    环境要求

    • Node.js ≥ 18,推荐安装 pnpm
    • 任意一款已登录的编码智能体 CLI(如 claude / cursor-agent / codex / gemini / copilot 等)
    • 不需要额外 API Key,复用你已登录的会话

    快速安装

    git clone https://github.com/nexu-io/html-anything
    cd html-anything
    pnpm install
    pnpm -F @html-anything/next dev
    # → http://localhost:3000
    

    启动后浏览器会自动扫描 PATH(包括 ~/.local/bin/opt/homebrew/bin 等 GUI 应用常忽略的目录),并在顶部工具栏列出可识别的 CLI。选一个模板、贴入内容、⌘+Enter 即可。

    主界面:左侧编辑器 / 中间模板选择器 / 右侧实时 iframe 预览
    主界面:左侧编辑器 / 中间模板选择器 / 右侧实时 iframe 预览

    核心功能

    • 零 API Key:复用本地已登录的编码智能体会话,边际成本为 0。
    • 9 大智能体自动检测:Claude Code、Cursor、Codex、Gemini、Copilot、OpenCode、Qwen、Aider、IBM Bob,顶部一键切换。
    • 75 个技能模板:覆盖 prototype / deck / frame / social / office / doc / mockup / vfx 等模式,从 SaaS 落地页到财务报告、从瑞士国际主义幻灯片到 Hyperframes 视频帧都有现成模板。
    • 9 种交付形态:杂志文章、演示文稿、简历、海报、小红书卡片、推文卡片、网页原型、数据报告、Hyperframes 视频帧。
    • 实时 SSE 流式渲染:智能体输出 JSON-line,服务端转成 Server-Sent Events,浏览器实时追加到 iframe srcdoc,像看 AI 打字一样看网页生成。
    • 沙箱预览:用户 HTML 运行在 <iframe sandbox> 中,脚本仍可执行,但 cookies/localStorage 与宿主隔离。
    • 一键导出:juice 内联 CSS → 微信公众号 / 知乎;modern-screenshot 2× PNG → X / 微博 / 小红书;另可下载单文件 .html 或 .png。
    一键导出:微信公众号 · X/微博 · 知乎 · 小红书 · HTML · PNG
    一键导出:微信公众号 · X/微博 · 知乎 · 小红书 · HTML · PNG

    典型使用场景

    场景 1:公众号长文排版

    写好 Markdown 初稿,选择 article-magazinedoc-kami-parchment 技能,智能体会自动套用 CJK 优先字体栈、8px 基线网格、对比度 ≥4.5 的配色,生成可直接粘贴到公众号编辑器的 HTML,无需二次调样式。

    场景 2:小红书 / X 卡片

    把一段金句或数据结论贴进去,选择 card-xiaohongshusocial-x-post-card 模板,即可生成 1080×1080 或 1600×900 的高清 PNG,复制后直接进入小红书 / X 发布界面,避免手动修图。

    场景 3:投资人路演 PPT

    输入产品要点,选择 deck-pitchdeck-swiss-internationaldeck-open-slide-canvas,自动产出 1920×1080 的横向幻灯片,支持键盘左右翻页、演讲者备注和 PDF 导出。

    幻灯片模式:内置 20 套主题,可直接导出或路演
    幻灯片模式:内置 20 套主题,可直接导出或路演

    推荐理由

    它是目前把“本地 AI 智能体”和“中文内容创作”结合得最顺手的开源工具之一:不绑 API、不抢隐私,复用你已经付费订阅的 Claude / Cursor / Copilot;针对微信公众号、知乎、小红书等中文平台做了专门适配,解决了 Markdown 转公众号格式崩坏、转小红书要手动修图的老大难问题;技能模板基于 SKILL.md 协议,新增模板只需复制一个文件夹、改一段 frontmatter,社区扩展门槛低。如果你平时需要大量产出图文、PPT、产品原型,把它接进工作流能省不少时间。

    下载与资源

  • GitHub Copilot SDK:一套 Agent 运行时,六种语言官方 SDK

    GitHub Copilot SDK:一套 Agent 运行时,六种语言官方 SDK

    GitHub Copilot SDK

    项目简介

    GitHub Copilot SDK 是 GitHub 官方发布的多平台 Agent 运行时 SDK,让你在自己的应用中嵌入 Copilot CLI 的完整智能体引擎。支持 TypeScript、Python、Go、.NET(C#)、Java、Rust 六种语言,通过 JSON-RPC 与 Copilot CLI server 模式通信,SDK 自动管理进程生命周期——你只需定义 Agent 行为,Copilot 负责规划、工具调用和文件编辑。

    一句话:把 Copilot CLI 的 Agent 能力,以 SDK 形式嵌入任何应用。

    六语言SDK速览

    安装要求与过程

    环境要求

    • Node.js / TypeScript:Node.js ^20.19.0 或 ≥22.12.0
    • Python:Python 3.11+
    • .NET:.NET 8+ SDK
    • Go / Rust / Java:对应语言工具链 + 需额外安装 Copilot CLI
    • 认证:GitHub Copilot 订阅,或 BYOK 自带模型 API Key

    快速安装

    # Node.js / TypeScript
    npm install @github/copilot-sdk
    
    # Python
    pip install github-copilot-sdk
    python -m copilot download-runtime   # 下载运行时二进制
    
    # .NET
    dotnet add package GitHub.Copilot.SDK
    
    # Go
    go get github.com/github/copilot-sdk/go
    
    # Rust
    cargo add github-copilot-sdk
    
    # Java (Maven)
    <dependency>
      <groupId>com.github</groupId>
      <artifactId>copilot-sdk-java</artifactId>
    </dependency>

    Python 快速上手示例

    import asyncio
    from copilot import CopilotClient
    from copilot.session_events import AssistantMessageData, SessionIdleData
    from copilot.session import PermissionHandler
    
    async def main():
        async with CopilotClient() as client:
            async with await client.create_session(
                on_permission_request=PermissionHandler.approve_all,
                model="gpt-5",
            ) as session:
                done = asyncio.Event()
                def on_event(event):
                    match event.data:
                        case AssistantMessageData() as data:
                            print(data.content)
                        case SessionIdleData():
                            done.set()
                session.on(on_event)
                await session.send("What is 2+2?")
                await done.wait()
    
    asyncio.run(main())

    核心功能

    1. 六语言官方 SDK:TypeScript/Python/Go/.NET/Java/Rust 全部由 GitHub 官方维护,统一 API 设计,语义化版本管理(GA 状态)。
    2. Agent Loop 完整循环:内置完整的工具调用循环(Tool Use Loop),自动处理回合(Turn)与完成信号,无需自建编排层。
    3. Hooks 拦截机制:可在工具调用前后拦截、改写结果、处理错误——实现权限控制、日志审计、输出过滤等中间件逻辑。
    4. Custom Agents + Fleet Mode:定义带独立工具集和指令的子智能体;Fleet Mode 支持并行派发多个子智能体处理大型独立任务流。
    5. MCP Servers 集成:原生接入 Model Context Protocol 服务器,扩展外部工具能力;同时支持 Skills 提示词模块与 Plugin Directories 插件打包。
    6. 40+ Streaming Events:实时订阅会话事件流(assistant.message、tool.call、session.idle 等),构建响应式 UI。
    架构与核心能力

    典型使用场景

    场景一:IDE 插件内嵌 AI 编程助手

    在 VS Code / JetBrains 插件中集成 Copilot Agent,用户选中代码后调用 SDK 发起对话,Agent 自动读取文件上下文、执行重构建议、直接编辑文件。相比自己对接 LLM API + 构建工具链,SDK 已封装好文件读写、终端命令、Git 操作等全套工具。

    场景二:CI/CD 流水线中的自动化 Review Bot

    在 GitHub Actions 中用 Python SDK 启动 Copilot Session,将 PR diff 作为输入发送给 Agent,让它分析变更影响、生成 review 评论。通过 Hooks 可限制 Agent 只读不写,确保安全可控。

    场景三:SaaS 产品中的 AI 功能模块

    在 Web 后端通过 TypeScript SDK 创建带预算限制的 Session(Session Limits),为每个用户分配 AI Credits 配额。结合 Remote Sessions 功能,让用户在浏览器中实时看到 Agent 工作过程。BYOK 模式下可使用自有模型 Key,降低运营成本。

    推荐理由

    作为 GitHub 官方出品,Copilot SDK 的最大优势是「不用重复造轮子」。过去要在应用里嵌入 AI Agent 能力,你需要自己处理模型选择、提示词模板、工具定义、权限控制、错误恢复……现在这些全部由 Copilot CLI 引擎托管,SDK 只暴露简洁的 Session API。

    六种语言的覆盖面也令人印象深刻——从脚本到企业级后端,从前端到系统编程,几乎覆盖了主流开发栈。特别是 Python 和 TypeScript SDK 内置了 CLI 二进制,开箱即用体验非常顺滑。

    当然,它需要 Copilot 订阅或 BYOK 配置,不是完全免费的方案。但考虑到它提供的生产级 Agent 运行时能力,这个成本是合理的。如果你正在评估「如何在产品中加入 AI Agent 能力」,Copilot SDK 值得作为首选方案之一认真试用。

    下载地址

  • OpenWork:开源版 Claude Cowork,让 AI 工作流一次创建、处处复用

    OpenWork:开源版 Claude Cowork,让 AI 工作流一次创建、处处复用

    OpenWork 开源 AI 工作流平台

    OpenWork 是 different-ai 开源的一款免费桌面应用,定位为 Claude Cowork / Codex 的开源替代。它提供跨 macOS、Windows、Linux 的统一 AI 工作区,把技能(Skills)、MCP 连接、插件和常用 SaaS 服务打包成可复用的「能力」,通过同一个远程 MCP 服务器接入 Claude Code、Cursor、Codex、OpenCode 等主流 Agent,实现「一次创建、处处复用」。

    安装要求和过程

    环境要求

    • 桌面端:macOS、Windows 或 Linux,支持 Apple Silicon 与 x86_64。
    • 开发环境:Node.js 24(仓库使用 .nvmrc 锁定),包管理器 pnpm 11.4.0,monorepo 使用 Turborepo。
    • 服务器 / 团队版:Docker + Kubernetes 可部署 OpenWork Den 控制平面(文档提供 AWS EKS、Azure AKS、GCP GKE 示例)。

    快速安装

    • 用户安装(推荐):下载安装脚本并执行 openwork-bootstrap CLI。
    curl -fsSLo /tmp/openwork-install.sh https://openworklabs.com/install.sh
    less /tmp/openwork-install.sh
    sh /tmp/openwork-install.sh
    • 安装桌面端
    openwork-bootstrap install app --manifest https://openworklabs.com/install-manifest.json --json
    openwork-bootstrap doctor --app --json
    • 从源码开发
    git clone https://github.com/different-ai/openwork.git
    cd openwork
    pnpm install
    pnpm dev  # 启动 Electron 桌面端

    或者直接访问官网 Download OpenWork 下载对应系统安装包。

    核心功能

    OpenWork 能力架构
    1. 统一能力市场
      把常用的工具、API、提示词和 MCP 封装为「技能」与「插件」,个人或团队发布到市场后即可在任意接入的 Agent 中复用。
    2. OpenWork MCP 远程接入
      只需一行命令即可把 OpenWork 接入 Claude Code、Cursor、Codex、OpenCode 等支持 MCP 的客户端,暴露 search_capabilitiesexecute_capability 两个工具。
    3. 跨端 Electron 桌面应用
      提供本地专属工作区,离线/在线混合运行,内置 opencode 智能体运行时,支持技能编排与记忆管理。
    4. OpenWork Den 组织控制平面
      管理模型供应商配额、团队权限、桌面策略、应用版本限制,并支持 Google Workspace、Microsoft 365 等 SaaS 集成。
    5. Agent-first 安装流程
      用户可以直接让现有 AI 助手执行安装、创建工作区、打开桌面端,甚至连接 OpenWork MCP,无需手动翻阅文档。

    典型使用场景

    1. 多 Agent 共享同一套工具链

    个人开发者把常用的 Supabase、Vercel、GitHub、Slack MCP 封装进 OpenWork,配置一次后,Claude Code 写后端、Cursor 改前端、Codex 跑脚本时都能调用同一组连接和凭证,避免每个客户端重复配置。

    OpenWork 桌面应用

    2. 团队统一 AI 工作区

    技术负责人通过 OpenWork Den 发布内部技能(如「生成发布说明」「数据库迁移脚本」),分配给特定团队;同时限制可用模型、控制 token 预算、审计执行记录,实现 AI 工具在组织层面的治理。

    OpenWork Den 组织控制平面

    3. 开源替代方案落地

    对数据主权敏感或预算受限的团队,可用 OpenWork 替代 Claude Cowork / Codex:Electron 桌面端本地化运行,代码可审计,团队版可自托管,避免把核心工作流绑定到单一闭源平台。

    推荐理由

    OpenWork 的最大价值在于把「AI 工作流」从工具孤岛中解放出来。它不像传统 IDE 插件那样只服务单个编辑器,而是通过标准化 MCP 让能力在多个 Agent 之间流动。对于已经混用 Claude Code、Cursor、Codex 的开发者来说,这种「一次配置、多端复用」的体验非常解渴。

    项目本身工程化程度很高:pnpm + Turborepo 管理多包,Electron 桌面端与远程 MCP 服务器分离,Den 控制平面提供企业级治理接口,文档覆盖 K8s 部署、Google Workspace OAuth、Microsoft Entra SSO 等。GitHub 18K+ Stars 且保持高频迭代(v0.18.12 于 2026-07-30 发布),说明社区认可度不错。

    需要注意:仓库 /ee 目录为 Fair Source License,其他主体代码自定义商业许可,商用前建议阅读 LICENSE。

    下载地址

  • Voicebox:47.5K Stars 的开源 AI 语音工作室,克隆声音、全局听写、让 AI 智能体开口说话

    Voicebox:47.5K Stars 的开源 AI 语音工作室,克隆声音、全局听写、让 AI 智能体开口说话

    Voicebox 应用界面截图

    项目简介

    Voicebox 是一款本地优先的开源 AI 语音工作室——相当于把 ElevenLabs(语音合成)+ WisprFlow(语音听写) 两大云服务装进同一个免费开源的桌面应用:几秒参考音频即可克隆任意声音、7 大 TTS 引擎覆盖 23 种语言、全局热键把语音听写进系统任意输入框,还能通过 MCP 让 Claude Code / Cursor 等 AI 智能体用你克隆的声音「开口说话」。全部模型与数据均在本机运行,目前已收获 47.5K Stars,MIT 许可。

    安装要求和过程

    环境要求

    • macOS:Apple Silicon(MLX/Metal 加速)或 Intel
    • Windows:支持 NVIDIA CUDA 加速
    • Linux:暂无预编译包,需源码构建;另支持 AMD ROCm、Intel Arc
    • Docker:任意平台一行命令部署
    • 轻量引擎 LuxTTS 仅需 ~1GB 显存,CPU 也能 150 倍实时速度推理

    快速安装

    # 方式一:直接下载安装包(推荐)
    # macOS (Apple Silicon): https://voicebox.sh/download/mac-arm
    # macOS (Intel):         https://voicebox.sh/download/mac-intel
    # Windows (MSI):         https://voicebox.sh/download/windows
    
    # 方式二:Docker 一键启动
    git clone https://github.com/jamiepine/voicebox.git
    cd voicebox
    docker compose up
    

    首次启动时应用会引导下载所需模型;macOS 上还有权限向导,一步步带你完成「辅助功能」「输入监控」授权,用于全局听写自动粘贴。

    核心功能

    • 多引擎语音克隆:内置 Qwen3-TTS、Qwen CustomVoice、LuxTTS、Chatterbox Multilingual/Turbo、HumeAI TADA、Kokoro 共 7 大 TTS 引擎,零样本克隆 + 50 多个精选预置声音,覆盖 23 种语言,可逐次生成切换引擎。
    • 全局语音听写:按住热键在系统任意位置说话,松开即把转写文本粘贴进当前输入框(macOS 经辅助功能校验注入,且自动保存/恢复剪贴板);内置 Whisper 全系列模型(Turbo 版比 Large 快约 8 倍),可选本地 LLM 自动清理「嗯、啊」等口头语。
    • 给 AI 智能体一个声音:自带 MCP 服务器与 REST API,Claude Code、Cursor、Cline 等任意支持 MCP 的智能体只需调用 voicebox.speak 工具,就能用你克隆的声音向你「汇报工作」。
    • 专业级生产能力:不限长度生成(自动分句 + 交叉淡化拼接,最长 5 万字符)、多轨 Stories 时间线编辑器(做播客/对话/有声书)、8 种后期效果(变调/混响/延迟/压缩等,基于 Spotify pedalboard),生成版本全程可溯源。
    • 完全本地、隐私优先:模型、声音数据、录音捕获全部留在本机,永不上传;应用基于 Tauri(Rust)构建而非 Electron,原生性能,安装包小、内存占用低。

    典型使用场景

    1. 内容创作者做配音/播客:用自己的几秒录音克隆声音,把文章、剧本、章节直接批量转成音频;Stories 编辑器多轨拖拽即可编排双人对话播客,再叠加混响、电台音效等预设,全流程零云端费用。
    2. 开发者的「会说话的」编码智能体:给 Claude Code / Cursor 接上 Voicebox 的 MCP 服务器,长任务跑完后智能体用你指定的声音口头播报结果;配合全局听写热键,动口不动手地写 prompt,形成完整的语音 I/O 闭环。
    3. 注重隐私的日常语音输入:会议纪要、日记、即时消息全部用本地 Whisper 听写,敏感内容不经过任何第三方服务器;Captures 标签页保留每段原始音频 + 转写文本,可随时重转写、改写或升级为克隆样本。

    推荐理由

    试用下来最打动我的是「输入 + 输出一体」的产品思路:市面上克隆声音要买 ElevenLabs,语音听写要买 WisprFlow,而 Voicebox 把两半闭环装进一个 MIT 开源应用,还用本地 LLM 把两端串了起来。工程质量也远超一般开源项目——Tauri 原生应用不卡顿,生成队列异步不阻塞,甚至连 macOS 剪贴板保护、崩溃恢复这类细节都做了。对开发者来说,一行 MCP 配置就能让编码智能体开口说话,这个体验相当新奇实用。如果你需要一套不上云、不订阅的完整语音方案,这个项目值得马上装上试试。

    下载地址

  • Headroom:让 AI 智能体少花 90% Token 的上下文压缩层

    Headroom:让 AI 智能体少花 90% Token 的上下文压缩层

    项目简介

    Headroom 是一个为 AI 智能体(AI Agent)打造的上下文压缩层。它在提示词、工具输出、日志、RAG 检索片段、文件和对话历史到达大模型之前进行压缩,让你在获得相同答案的同时, Token 成本大幅下降。官方实测:JSON 类数据可减少 60–95% 的 Token,编码类智能体可减少 15–20%。

    核心功能

    • 多种部署形态:Python/TypeScript 内联库、headroom proxy 零代码代理、headroom wrap 一键包装 Claude/Codex/Cursor/Aider/Cline 等主流 Agent,以及原生 MCP Server。
    • 内容感知压缩SmartCrusher 专攻 JSON,CodeCompressor 基于 AST 压缩代码,Kompress-v2-base 用自研 HuggingFace 模型处理自然语言。
    • 可逆压缩(CCR):原始内容本地缓存,LLM 可通过 headroom_retrieve 按需取回,绝不丢失信息。
    • 跨 Agent 记忆:同一台机器上 Claude、Codex、Grok、Gemini 等工具可共享记忆库并自动去重。
    • 输出 Token 优化:通过 Verbosity steering 和 Effort routing,自动削减模型废话、重复代码和过度思考,进一步降低输出侧成本。
    • headroom learn:自动挖掘失败会话,把纠偏规则写入 CLAUDE.local.mdAGENTS.mdGEMINI.md,让 Agent 越用越聪明。

    安装要求和过程

    环境要求:Python 3.10+。推荐用 uvpip 安装;TypeScript 开发者也可用 npm 安装 SDK(仅库,无 CLI)。

    # 推荐:uv 全局工具安装(隔离环境)
    uv tool install --python 3.13 "headroom-ai[all]"
    
    # 或者 pip
    pip install "headroom-ai[all]"
    
    # TypeScript SDK(仅库)
    npm install headroom-ai
    

    启动方式三选一:

    # 一键部署 + 自动配置 Agent
    headroom deploy
    
    # 包装 Claude Code(自动启动本地代理并注入配置)
    headroom wrap claude
    
    # 零代码 drop-in 代理
    headroom proxy --port 8787
    

    验证:

    headroom doctor    # 健康检查
    headroom perf      # 性能报告
    headroom dashboard # 实时节省看板
    

    典型使用场景

    Headroom 工作原理

    场景 1:AI 编码助手降本增效
    你每天用 Claude Code、Cursor 或 Codex 处理大型代码库。代码搜索结果、RAG 片段、测试日志动辄几万 Token。Headroom 自动压缩输入内容,代码搜索场景可减少 92% Token,而答案质量不变。配合 headroom learn,它还能把常见误操作自动写入项目本地规则文件。

    场景 2:SRE 事故排查
    排查线上事故时,需要把大量日志、监控输出、GitHub Issue、运行时报错塞进上下文。Headroom 对日志和结构化数据压缩率极高,65k Token 的排查材料可压缩到 5k 左右,让智能体在上下文窗口内“看完全部证据”,而不是被截断。

    场景 3:多 Agent 共享记忆
    你在同一项目里混用 Claude Code、Codex、Grok CLI 和 Aider。Headroom 提供跨 Agent 的共享记忆存储,避免每个工具重复读取文件、重复建立上下文,真正实现“一次理解,处处可用”。

    Headroom 压缩效果

    推荐理由

    Headroom 最让我喜欢的一点是“不绑架你的工作流”。它既可以是库,也可以是代理,还可以一键 wrap 你已有的 Agent,不需要重写 prompt 或迁移模型。而且它是本地优先的,原始内容不会离开你的机器,企业敏感代码也能放心使用。

    更难得的是,它在省钱的同时还做了“可逆压缩”和“失败学习”:前者保证信息不丢,后者让 Agent 越用越准。对于已经在用 Claude Code、Cursor、Codex 等工具的开发者来说,Headroom 几乎是“装完就能省钱”的基础设施。

    下载地址

    Headroom 采用 Apache 2.0 协议开源,当前 Stars 约 63.2K,主要语言为 Python。