标签: LLM

  • Archon:把 AI 编码变成确定性工作流的开源 harness 构建器

    Archon:把 AI 编码变成确定性工作流的开源 harness 构建器

    Archon 封面

    Archon logo

    项目简介

    Archon 是首个开源的 AI 编码 harness(流程编排)构建器——用 YAML 把“规划→实现→校验→审查→提 PR”等开发流程固化下来,让 AI 编码智能体每次都按同一套确定性步骤执行,把“看模型心情”变成“可重复、可提交”的工程实践。

    如果说 Dockerfile 之于基础设施、GitHub Actions 之于 CI/CD,那么 Archon 之于 AI 编码工作流。可以把它理解为“面向软件开发的 n8n”。

    安装要求和过程

    环境要求

    • 运行时Bun(macOS/Linux/Windows 均支持)
    • AI 编码助手:Claude Code(默认),或 Codex、Pi
    • GitHub CLIgh):用于自动建分支、提 PR
    • 系统:macOS / Linux / WSL / Windows(PowerShell);数据库默认 SQLite,可切 PostgreSQL

    快速安装(30 秒,已有 Claude Code)

    # macOS / Linux
    curl -fsSL https://archon.diy/install | bash
    
    # Windows (PowerShell)
    irm https://archon.diy/install.ps1 | iex
    
    # 或 Homebrew
    brew install coleam00/archon/archon

    ⚠️ 编译版二进制不含 Claude Code,需单独安装并指定 CLAUDE_BIN_PATH;Docker 镜像则已自带。

    完整初始化(5 分钟,推荐)

    git clone https://github.com/coleam00/Archon
    cd Archon
    bun install
    claude          # 在 Claude Code 里说:“Set up Archon”

    引导向导会配置凭证、选择接入平台,并把 Archon skill 复制到你的目标仓库。之后在你的项目里直接对编码智能体说 “Use archon to fix issue #42” 即可。

    核心功能

    • 确定性、可重复:开发流程写成 YAML 工作流,固定阶段与校验门(validation gate),每次运行同一套顺序——计划、实现、校验、审查、PR,结果一致。
    • 隔离并行:每个工作流运行都在独立的 git worktree 中,可同时修 5 个 Bug 而互不冲突。
    • 发射后不管(Fire & forget):启动一个工作流就去忙别的,回来已经是一个带审查意见的成品 PR。
    • 确定性节点 + AI 节点可组合:bash 脚本、测试、git 操作等确定性步骤由机器精确执行;规划、代码生成、审查等只在 AI 真正增值的地方运行。
    • 随处可跑、全员共用:工作流定义在 .archon/workflows/,提交进仓库后,从 CLI、Web UI、Slack、Telegram 到 GitHub 表现完全一致;内置 19 个常用工作流,也可自定义。

    为什么需要 Archon

    典型使用场景

    场景一:自动修 GitHub Issue

    对智能体说 “Use archon to fix issue #42”,自动触发 archon-fix-github-issue 工作流:分类 → 调研/规划 → 实现 → 校验 → 提 PR → 智能审查 → 自我修复,全程无需你盯着。

    场景二:从想法到 PR(Idea-to-PR)

    archon-idea-to-pr 把“给设置页加暗黑模式”这类想法,自动走规划 → 循环实现(直到测试通过)→ 审查 → 提 PR → 5 个并行 reviewer → 自我修复,产出完整 Pull Request。

    场景三:团队远程异步协作

    接入 Slack / Telegram / GitHub / Discord 后,在群聊里丢一句话就能触发工作流;所有平台的活动汇聚到同一个 Web 仪表盘(Mission Control),实时查看进度与历史。

    Archon 工作原理

    推荐理由

    我自己最吃这一套的点在于“把流程的所有权拿回自己手里”。平时让 AI 智能体修 Bug,跑十次九个样:有时忘了跑测试、有时 PR 描述敷衍、并行修多个问题时还互相踩。Archon 用一份 YAML 把团队认可的工程纪律写死,AI 只在需要创造力的节点上发挥作用,其余交给确定性执行——稳定、可审计、可复现。它不绑定某家模型,Claude / Codex / Pi 随便换;Web 仪表盘 + 多平台接入也让“远程派活、回来收 PR”变得很顺。对想把 AI 编码真正纳入研发流程的团队,这是目前最像样的开源方案之一。

    下载地址

  • Wigolo:给 AI 编程智能体装上本地优先的「上网」引擎(开源 MCP)

    Wigolo:给 AI 编程智能体装上本地优先的「上网」引擎(开源 MCP)

    Wigolo 演示

    在 Claude Code、Cursor、Codex 这类编码智能体大行其道的今天,一个尴尬的现实是:它们很会写代码,却「看不见」互联网。想查一份报错、一份 API 文档、一个竞品定价,往往得开发者自己复制粘贴喂给模型。Wigolo 要做的,就是给 AI 智能体装上一双「眼睛和手」——一个本地优先、无需 API Key、按查询 0 计费的统一「上网」引擎。

    🦉 项目简介

    WigoloKnockOutEZ 开源的 AI 编程智能体本地优先「上网」引擎:以 MCP 服务器(或 REST / SDK)的形式运行在智能体身边,统一提供 搜索、抓取、爬取、提取、缓存、相似发现、研究、自主收集 等全套 Web 能力。核心理念是 no keys, no cloud, no metered bill——核心工具无需任何 API Key,所有数据留在本地 ~/.wigolo/,用得越多账单也不会涨。

    💻 安装要求与过程

    环境要求:Node.js ≥ 20,约 1.5 GB 空闲磁盘(首次运行会下载浏览器引擎等本地组件)。核心搜索 / 抓取 / 爬取无需任何外部 Key 即可使用;如需 researchagent 等高级研究能力,可选择性配置一个 LLM Provider(如 Gemini)。

    快速安装:

    # 初始化本地引擎(任意系统)
    npx wigolo init
    
    # 初始化并一键接入日常 agent(如 Claude Code + Cursor)
    npx wigolo init --agents=claude-code,cursor
    
    # 以 Docker 方式作为 stdio MCP 服务运行
    docker run -i --rm -v wigolo-data:/data ghcr.io/knockoutez/wigolo
    
    # 在自托管 box 上暴露 HTTP 服务(默认 127.0.0.1:3333)
    wigolo serve
    
    # 在你的应用里用 SDK 嵌入
    npm install wigolo-sdk     # TypeScript
    pip install wigolo         # Python

    常用运维命令:npx wigolo verify(健康检测)、npx wigolo warmup --all(重下引擎)、npx wigolo docto --fix(修复环境)。

    ⚙️ 核心功能

    Wigolo 核心工具全景

    1. 🔍 多引擎搜索 search:内置 18 个直连适配器,ML 重排 + 可解释评分,让智能体拿到「为什么是这条结果」。
    2. 🔗 抓取 & 爬取 fetch / crawl:分层路由获取单页并清洗为 markdown(含 PDF / 鉴权页处理);BFS / DFS / sitemap 多页爬取并自带限流保护。
    3. 🧩 提取 & 缓存 & 相似 extract / cache / find_similar:从页面抽取表格 / JSON-LD / Schema 等结构化数据;本地缓存已见内容,二次查询毫秒即回;关键词 + 语义 + 实时发现相似页面。
    4. 🤖 自主研究 research / agent:把一个问题自动分解成子查询、扇出检索、综合成报告;agent 工具则跑 search→fetch→extract→synthesize 的自主收集循环。
    5. 🔔 变更追踪 diff / watch:检测页面变化并推送 webhook,把「定时盯网页」变成可编排的事件。

    🚀 典型使用场景

    • 场景一 · 编码时实时联网:在 Claude Code / Cursor 里改代码时,智能体直接调用 search / fetch 查文档、查报错、查第三方 API,开发者不再手动复制粘贴;所有命中缓存在 ~/.wigolo/,隐私不出本机。
    • 场景二 · 自托管 Agent 的「联网大脑」:在自托管服务器上 wigolo serve 暴露 REST / MCP 端点,LangChain、CrewAI、n8n 等编排框架或任意 MCP client 统一调用,把分散在各处的抓取逻辑收敛成一个服务。
    • 场景三 · 持续竞品 / 文档监控:用 watch 盯住竞品定价页或文档页,diff 出变化并推 webhook 到飞书 / Slack / 自有系统,第一时间感知变更。

    💡 推荐理由

    我特别看好 Wigolo 的一点,是它真正把「本地优先」做到了极致:零 API Key、零按量账单,直接戳中「想让 agent 上网,却要为每家搜索引擎单独接 key、还要担心账单爆掉」的痛点。统一的 MCP 接口对 Claude Code / Cursor / Codex / Gemini CLI / VS Code / Zed 通吃,接入几乎零心智负担;数据默认留在本地,对重视隐私的开发者很友好;AGPL-3.0 开源、可完全自托管。如果你正想给自己的 coding agent 装上一双「眼睛和手」,Wigolo 是目前最省心的一站式方案。

    Wigolo 四种接入方式与差异化

    🔗 下载地址

  • Kimi Code CLI:终端里的下一代 AI 编程智能体(4.3K★,月之暗面开源)

    Kimi Code CLI:终端里的下一代 AI 编程智能体(4.3K★,月之暗面开源)

    Kimi Code CLI 封面

    Kimi Code CLI 是月之暗面(MoonshotAI)开源的终端 AI 编程智能体——它能在命令行里读改代码、执行 shell 命令、搜索文件、抓取网页,并依据反馈自主决定下一步;开箱即用 Kimi 大模型,也可配置接入其它兼容模型。

    一、项目简介

    一个跑在终端里的”AI 同事”。Kimi Code CLI 把代码读写、命令执行、文件检索、网页抓取与多步自主规划统一进一个轻量 TUI,口号是 “The Starting Point for Next-Gen Agents”(下一代智能体的起点)。它脱胎于此前广受关注的 Kimi CLI,把运行时收敛为单文件二进制,启动几乎无感,对 Kimi 大模型用户尤其友好。

    二、安装要求和过程

    环境要求

    • 普通用户无需 Node.js:官方脚本一条命令装好单文件二进制,无 PATH 烦恼、无全局模块冲突;
    • Windows 需先装 Git for Windows:Kimi Code CLI 用内置 Git Bash 作为 shell 环境;若 Git 装在自定义路径,设置环境变量 KIMI_SHELL_PATH 指向 bash.exe 绝对路径;
    • 账号:首次使用需 Kimi 账号(OAuth)或 Moonshot AI 开放平台 API Key;
    • 从源码开发需 Node.js ≥ 24.15.0 + pnpm 10.33.0。

    快速安装

    macOS / Linux:

    curl -fsSL https://code.kimi.com/kimi-code/install.sh | bash

    Windows(PowerShell):

    irm https://code.kimi.com/kimi-code/install.ps1 | iex

    快速开始

    cd your-project
    kimi            # 启动交互式 TUI
    kimi --version  # 验证安装

    首次在会话里执行 /login,选择 Kimi Code OAuth 或 API Key 登录,然后试着让它”看看这个项目,解释下主要目录“。

    三、核心功能

    Kimi Code CLI 核心能力

    1. 单文件分发:一条命令安装,无 Node.js、无 PATH 困扰、无全局模块冲突。
    2. 毫秒级启动:TUI 毫秒就绪,开启会话毫无负担,长时间 Agent 会话也不卡。
    3. 视频输入:把录屏 / 演示片段直接丢进聊天,Agent 逐帧”看懂”画面——把参考片转成 LUT、长视频剪成短片、屏幕录屏变成可运行代码。
    4. AI 原生 MCP:用 /mcp-config 对话式增删与鉴权 Model Context Protocol 服务器,免手改 JSON。
    5. 子智能体并行:内置 coder / explore / plan 子智能体在隔离上下文并行干活,主线对话保持清爽。
    6. ACP 编辑器集成kimi acp 接入 Zed、JetBrains 等任意 Agent Client Protocol 客户端,IDE 里直接驱动。

    四、典型使用场景

    Kimi Code CLI 工作流

    • 日常终端编程搭子:在任意项目目录敲 kimi,让它读代码、跑命令、搜文件、抓网页并自规划下一步,省去来回切窗口。
    • IDE 里的 Agent:在 Zed / JetBrains 配置 kimi acp,用熟悉的编辑器驱动 Agent,一次登录处处可用,开发流不断档。
    • 视频驱动开发:把产品录屏或参考片段丢给 Agent,让它”看懂”后落地为可运行代码或素材(例如把一段参考片转成调色 LUT)。

    五、推荐理由

    Kimi Code CLI 给我最大的惊喜是”“。作为 Kimi CLI 的演进版,它把运行时收敛成单文件二进制,启动几乎无感,TUI 也比不少同类更耐看;视频输入/mcp-config 对话式配置是真正能提升日常效率的巧思,而不是噱头。如果你已经在用 Kimi 大模型、又想要一个不折腾环境、能直接塞进终端和 IDE 的编码 Agent,它非常值得一试。MIT 协议、社区活跃(4.3K+ Stars、当日仍在高频更新),长期主义玩家可以放心上车。

    六、下载地址

  • Browser Use:让 AI 像人一样操作浏览器的开源智能体(10.5万+ Star)

    Browser Use:让 AI 像人一样操作浏览器的开源智能体(10.5万+ Star)

    Browser Use 自动填写表单演示

    Browser Use 是一个让 AI 像人一样操作浏览器的开源智能体框架——你用自然语言描述任务,它便自动打开网页、点击按钮、输入文字、填写表单,一站式完成多步骤的网页操作。

    一、项目简介

    🌐 Make websites accessible for AI agents. Automate tasks online with ease.

    Browser Use 把”浏览器”变成 AI Agent 可直接操控的环境。它目前拥有 10.5 万+ Star(Python 编写,MIT 许可),并在 Odyssey 长程网页任务榜上以 87.4% 的平均成功率排名第一,超越了 OpenAI、Anthropic、Google、Microsoft 各自的 computer-use 方案。它既是给现有编码 Agent(Claude Code / Codex / Cursor 等)即插即用的”浏览器技能”,也是可规模化调用的 Python 库。

    二、安装要求与过程

    环境要求:

    • Python ≥ 3.11(官方推荐 3.12,可用 uv 管理)
    • 本地无需额外安装 Chromium,Browser Use 会按需驱动 Playwright 浏览器
    • 一个 LLM API Key(Browser Use 云、OpenAI、Anthropic、Google,或本地 Ollama 模型均可)

    快速安装:

    1. 安装库:
      pip install browser-use  (或 uv add browser-use
    2. .env 中配置 Key:
      BROWSER_USE_API_KEY=your-key  或  ANTHROPIC_API_KEY=... / GOOGLE_API_KEY=...
    3. 运行你的第一个 Agent:
    import asyncio
    from browser_use import Agent, ChatBrowserUse
    
    async def main():
        agent = Agent(
            task="Find the number of stars of the browser-use repo",
            llm=ChatBrowserUse(model="openai/gpt-5.5"),
        )
        history = await agent.run()
    
    asyncio.run(main())

    若你已在使用 Claude Code / Codex / Cursor 等编码 Agent,只需让 Agent 执行一次 browser-use skill install,即可把浏览器能力挂载到现有工作流中,无需自己写代码。

    三、核心功能

    • 自然语言驱动浏览器:自动打开页面、点击、输入、填表、翻页,把”多步骤网页操作”压缩成一句话指令。
    • 双形态接入:CLI 模式配合已有 Agent 即装即用;Python 库模式支持定时、并行、嵌入自有产品,细粒度控制浏览器。
    • 多模型统一接入:ChatBrowserUseprovider/model 前缀即可切换 OpenAI / Anthropic / Google,或走本地 Ollama 模型,一个 Key 通吃。
    • 强扩展能力:支持自定义 Tools、MCP 协议,云端版更提供 1000+ 集成(Gmail、Slack、Notion 等)与持久化记忆。
    • SOTA 级表现:Odyssey 200 项长程网页任务榜第一(87.4%),官方基准在 100 个真实任务上开源可复现。

    四、典型使用场景

    1. 自动填表与办事
    让 Agent 带着你的简历信息自动填写并投递职位申请、注册账号、提交各类在线表单。

    2. 网页数据采集
    从任意网站抽取结构化数据并导出为 CSV,例如”抓取我关注者的资料并整理成表格”。

    Browser Use 网站 QA 自动化演示

    3. 网站 QA 自动化
    对本地站点做可用性、视觉一致性与 Bug 巡检,自动产出测试报告,替代部分人工回归测试。

    五、推荐理由

    作为重度网页操作用户,我对 Browser Use 最大的感受是”把重复劳动还给机器“——订票比价、表单填报、定点抓取这类机械活,原来要人守着点半小时,现在一句话交代清楚就能后台跑。

    它开源免费、本地可控,隐私敏感的任务完全可以在本机跑;遇到强反爬、验证码场景再切到云端(代理轮换 + 隐身指纹 + 验证码破解)。对开发者而言,Python 库 + 自定义 Tools + MCP 的扩展性,让它不只是玩具,而是能真正嵌进产品的浏览器自动化底座。如果你已经在用 Cursor / Claude Code,强烈建议装一下它的 skill 体验。

    六、下载地址

    (本文配图来自项目官方 README,版权归 Browser Use 团队所有。)

  • mattpocock/skills:把顶级工程师的经验,打包成 AI 编码智能体的「技能库」

    mattpocock/skills:把顶级工程师的经验,打包成 AI 编码智能体的「技能库」

    mattpocock/skills 项目封面

    mattpocock/skills 是 TypeScript 布道师 Matt Pocock 日常使用的「AI 编码智能体技能库」——它不教你写 prompt,而是把数十年的工程经验浓缩成一组小而可组合、跨模型通用/skills 指令,专门修复 Claude Code、Codex 等编码智能体最常犯的四种失败模式。目前已在 GitHub 收获 17.8 万+ Stars,是近期最火的 AI 工程化开源项目之一。

    一、安装要求和过程

    环境要求

    • Node.js 18+(用于 skills.sh 安装器,npx 一行搞定)
    • 一个支持 skills 的编码智能体:Claude Code / Codex / 任意 Agent-Skills 标准 harness
    • 可选:GitHub 或 Linear 账号(/triage 技能需要对接 issue 追踪器)

    方式一 · 可改副本(推荐,想魔改就选它)

    npx skills@latest add mattpocock/skills

    选择要安装的技能与目标 agent,务必勾选 /setup-matt-pocock-skills;随后在 agent 中运行一次该命令完成仓库配置(选择 issue 追踪器、triage 标签、文档存放位置)。

    方式二 · Claude Code 原生插件(只读、常新、省心)

    /plugin marketplace add mattpocock/skills
    /plugin install mattpocock-skills@mattpocock

    装好后再跑一次 /setup-matt-pocock-skills。两种哲学:skills.sh 把技能复制进项目任你改;插件把它们作为只读束订阅更新

    二、核心功能

    整套技能围绕「软件工程基本功」展开,把对齐、TDD、架构、评审变成 Agent 拿来即用的小工具:

    四个失败模式对应技能

    • 对齐优先/grill-me/grill-with-docs——动手前先让 Agent 把你「拷问」一遍,并用 CONTEXT.md 沉淀项目共享语言,从根上消除需求歧义与啰嗦。
    • 测试驱动与诊断/tdd(红-绿-重构循环)、/diagnosing-bugs(复现→最小化→假设→插桩→修复→回归),让 Agent 真正跑起「代码运行反馈」闭环。
    • 架构纪律/to-spec/improve-codebase-architecture/codebase-design——对抗「一坨烂泥」,鼓励深模块、小接口。
    • 流程编排/implement/code-review/research/wayfinder/triage——把需求拆成可追溯的工单与规格,并以并行子智能体做「规范 + 标准」两轴评审。
    • 可组合、跨模型:所有技能与具体模型解耦,Claude Code / Codex / 其他 Agent 都能用;用户主动触发(User-invoked)与 Agent 自动调用(Model-invoked)两类技能分工清晰。

    User-invoked 与 Model-invoked 技能分类

    三、典型使用场景

    • 接手新项目前的「对齐会话」:用 /grill-with-docs 先和 Agent 把需求与领域术语聊透,生成 CONTEXT.md;后续每次对话都更省 token、更精准,变量/函数命名也跟着统一。
    • 写带测试的新功能:用 /implement 驱动 /tdd,先写失败测试再实现,最后 /code-review 把关——提交前质量稳,回归风险低。
    • 拯救腐烂的代码库:定期跑 /improve-codebase-architecture,扫描可深化的模块并生成可视化 HTML 报告,按图索骥重构,避免软件熵增失控。

    四、推荐理由

    这不是又一个「流程框架」(GSD/BMAD/Spec-Kit 那类会把过程控制权收走),而是把工程基本功变成 Agent 拿来即用的小工具——轻量、可改、不绑架你。最让我惊艳的是 CONTEXT.md 共享语言:用一句话把「section 里的 lesson 被 materialize」说清,代码命名、导航、token 消耗全跟着受益。两种安装方式恰好对应两种心态:想魔改就 fork 副本,想省心就装插件订阅更新。17.8 万 Stars、MIT 协议、几乎零上手成本,强烈建议所有用 Claude Code / Codex 的开发者装一套。

    五、下载地址

    许可:MIT | 语言:Shell/Markdown | Stars:178.9K+ | 创建于 2026-02,持续高频更新

  • Kimi CLI:月之暗面开源的终端 AI 编程智能体(10K+ Stars)

    Kimi CLI:月之暗面开源的终端 AI 编程智能体(10K+ Stars)

    Kimi CLI 在 VS Code 中的集成效果

    Kimi CLI 是月之暗面(MoonshotAI)开源的终端 AI 编程智能体——直接在命令行里读改代码、执行命令、联网检索,并自主规划与调整动作,把 Kimi 大模型搬进了你的 shell 与编辑器。

    一、项目简介

    Kimi CLI 是一个运行在终端里的 AI Agent,主打软件工程与命令行操作两大类任务。它不只是聊天机器人,而是能真正读取/编辑代码、执行 shell 命令、检索与抓取网页,并在执行过程中自主规划、动态修正路线。项目由 MoonshotAI 维护,采用 Apache-2.0 协议,当前已在 GitHub 收获 10K+ Stars。值得留意的是,官方已宣布 Kimi CLI 正演进为下一代 Kimi Code CLI,安装新版本会自动迁移配置与会话,但现有文档与安装方式依旧可用。

    二、安装要求与过程

    环境要求:

    • Python ≥ 3.12(PyPI 包已发布,最新版 1.49.0)
    • 一个 Kimi 账号(登录后使用)或有效的 API Key
    • 可选:Node.js(用于运行 npx 类 MCP 服务,如 chrome-devtools-mcp);Zsh(如需 shell 插件)

    快速安装:

    # 方式一:pip 安装(推荐)
    pip install kimi-cli
    
    # 方式二:pipx 隔离安装
    pipx install kimi-cli
    
    # 启动并登录
    kimi          # 进入交互界面后输入 /login 完成登录
    

    登录后即可在终端直接与 Kimi 对话、让它改代码、跑命令;配置与历史会话会保存在本地,跨项目复用。

    三、核心功能

    • 终端即 Shell(Ctrl-X 切换):Kimi CLI 本身就是一个 shell,按 Ctrl-X 即可在不退出智能体的情况下直接运行 shell 命令,把对话与执行无缝融合。
    • VS Code 扩展:通过官方 Kimi Code 扩展 在编辑器侧边栏开启 Agent 面板,直接基于当前工程上下文协作(见上方截图)。
    • ACP 协议接入主流 IDE:原生支持 Agent Client Protocol,可作为 ACP Agent Server 接入 Zed、JetBrains 等任意兼容编辑器,命令为 kimi acp
    • 原生 MCP 支持:内置 kimi mcp 子命令组,支持 HTTP / stdio / OAuth 多种传输方式,一行即可增删与授权 MCP Server(如 Context7、Linear、chrome-devtools)。
    • Zsh 深度集成:配合 zsh-kimi-cli 插件,把 AI Agent 能力直接带进你的 shell,Ctrl-X 一键切到智能体模式。

    四、典型使用场景

    • 终端里的全栈开发:在服务器或本地终端直接让 Kimi 读懂整个代码库、定位 Bug、生成补丁并执行测试,无需切换到图形界面 IDE。
    • IDE 内结对编程:在 VS Code / Zed / JetBrains 中以 Agent 面板形式调用 Kimi,基于当前文件与工程上下文做重构、加功能、写测试,改动实时落盘。
    • 可扩展的自动化工作流:通过 MCP 接入 Linear、Context7、Chrome DevTools 等工具,让 Kimi CLI 自动查需求、查文档、跑端到端浏览器验证,组成稳定的开发自动化流水线。

    五、推荐理由

    作为一款国产大模型厂商出品的命令行智能体,Kimi CLI 最大的亮点是「终端原生」——它不强迫你离开 shell,Ctrl-X 即可在「智能体」与「命令模式」间无缝切换,对远程服务器、无界面环境极其友好。同时它对 ACP / MCP 双协议的原生支持,意味着你既能把它嵌入 VS Code、Zed、JetBrains,也能通过 MCP 无限扩展工具边界,灵活度很高。Apache-2.0 协议可商用、配置本地化,隐私与可玩性兼顾。虽项目正平滑演进为 Kimi Code CLI,但当前版本已足够稳定,是体验「Kimi 版 Claude Code」最轻量直接的入口。

    六、下载地址

    (注:Kimi CLI 正演进为 Kimi Code CLI,新版本会自动迁移配置与会话,建议关注官方仓库获取最新动态。)

  • KTransformers:让消费级显卡跑起 DeepSeek 的异构推理引擎

    KTransformers:让消费级显卡跑起 DeepSeek 的异构推理引擎

    KTransformers

    项目简介

    KTransformers 是清华大学 MADSys 实验室联合 Approaching.AI 等团队开源的大模型异构推理与微调框架。它最出圈的能力,是让一块 24GB 显存的消费级显卡(如 RTX 4090)也能流畅运行 DeepSeek-V3 / R1 这类数百 GB 的巨型 MoE 模型——把”热专家”放在 GPU、”冷专家”卸载到 CPU/内存,配合 INT4/INT8/FP8 量化与 AMX/AVX 指令集优化,在本地把推理速度做到可用甚至惊艳。

    安装要求和过程

    环境要求:

    • Python 3.10 / 3.11 / 3.12(官方预编译 wheel 支持这三个版本)
    • Linux x86-64(manylinux_2_17),CPU 需支持 AVX2(Intel Haswell 2013+ / AMD Zen+ 及以上)
    • 可选 NVIDIA GPU,计算能力 8.0+(Ampere / Ada / Hopper,如 A100、RTX 3090/4090、H100);无需安装 CUDA toolkit,静态 CUDA 运行时已内置
    • 运行超大规模 MoE(如 DeepSeek-V3/R1)时,建议 64GB~382GB 内存用于专家卸载

    快速安装(PyPI,推荐大多数用户):

    pip install kt-kernel

    一行命令即装好含自动 CPU 检测、多指令集变体与 CUDA 加速的推理内核,无需编译。验证安装:

    kt version          # 查看 CLI 版本与检测到的 CPU 变体
    python -c "from kt_kernel import KTMoEWrapper; print('ok')"

    从源码编译(需要自定义 / AMD BLIS / ARM KML 后端):

    git clone https://github.com/kvcache-ai/ktransformers.git
    cd ktransformers/kt-kernel
    git submodule update --init --recursive
    ./install.sh        # 自动检测 CPU 并 -march=native 编译

    一条命令跑起来(自动适配硬件):

    kt run m2           # 启动模型推理服务(自动优化参数)
    kt chat             # 另开终端开始对话

    核心功能

    • CPU-GPU 异构推理(expert offload):把 Mixture-of-Experts 中高频访问的”热专家”留在 GPU,低频”冷专家”卸载到 CPU 与内存,显存占用从数十 GB 降到单卡 24GB 即可跑 DeepSeek-R1/V3。
    • 多指令集深度优化内核:内置 AMX(Intel Sapphire Rapids+)、AVX512(含 BF16/VNNI/VBMI)、AVX2 等多套 CPU 内核变体,运行时按 CPU 自动选择,并支持原生 FP8/BF16/INT4 精度。
    • 量化与长上下文:支持 CPU 侧 INT4/INT8 量化权重与 GPU 侧 GPTQ,配合 unsloth 1.58/2.51bit 与 IQ1_S/FP8 混合权重;可在 24GB 显存下放飞 139K+ 长上下文。
    • 微调(SFT)× LLaMA-Factory:支持在有限显存上对 DeepSeek-V3/R1、Qwen3-MoE 等超大 MoE 做 LoRA 微调,官方称比 ZeRO-Offload 快 6~12 倍、CPU 内存减半。
    • 生产级集成:提供干净的 Python API,可无缝接入 SGLang 做生产部署,实现”热专家 GPU / 冷专家 CPU”的异构服务。

    KTransformers × LLaMA-Factory 超大 MoE 微调

    图:KTransformers × LLaMA-Factory 在有限显存上微调超大 MoE 模型

    典型使用场景

    • 本地私有化跑 DeepSeek 满血版:开发者用一台配 24GB 显卡 + 大内存的主机,本地部署 DeepSeek-R1/V3 做代码助手、知识库问答,数据不出机器。
    • 高并发推理服务:在 8×L20 + Xeon 的服务器上,官方实测 DeepSeek-R1-0528(FP8)总吞吐 227.85 tokens/s、8 路并发输出 87.58 tokens/s,适合中小团队自建推理网关。
    • 超大模型低成本微调:用 4×RTX 4090 对 DeepSeek-V3 做 LoRA 微调(约 80GB 显存、3.7 it/s),或用单张 4090 微调 Qwen3-30B-A3B(8+ it/s),把训练成本打到消费级。

    推荐理由

    大模型推理的门槛,过去被”显存”死死卡住——想本地跑 DeepSeek 满血版,要么堆 H100 要么云上烧钱。KTransformers 的价值正在于此:它不跟你拼硬件,而是用异构调度 + 量化 + CPU 指令集优化把”不可能”变成”在家就能跑”。对预算有限的个人开发者、想做私有化部署的小团队、以及研究 MoE 推理优化的工程师来说,它是目前最务实的本地推理方案之一。

    工程上它也很”乖”:从 pip install kt-kernelkt run 一条命令起服务,内置 CPU 变体自动检测、NUMA 感知线程池,连 CUDA toolkit 都不用装。唯一的代价是——它目前主要面向 Linux x86-64,且吃内存(专家卸载越多越吃),上 Windows 原生或低内存机器要谨慎。但瑕不掩瑜,如果你想体验”把大模型装进自己电脑”,KTransformers 值得第一个试。

    下载地址

    许可:Apache-2.0 | 语言:Python / C++ | 维护:清华大学 MADSys 实验室、Approaching.AI、9#AISoft 及社区

  • Cua:开源 Computer-Use 2.0 框架,让 AI 智能体像人一样操作电脑

    Cua:开源 Computer-Use 2.0 框架,让 AI 智能体像人一样操作电脑

    Cua 开源 Computer-Use 2.0 框架

    项目简介

    Cua 是 trycua 出品的一套开源「Computer-Use 2.0」基础设施,围绕「让 AI 智能体像人一样看屏幕、点按钮、敲键盘完成任务」这一目标,提供了四大模块——后台驱动(Cua Drivers)、智能体沙箱(Cua Sandboxes)、评测基准(Cua-Bench)与 macOS 虚拟化(Lume),覆盖从训练、评测到数据生成的全流程。它把「驱动—沙箱—评测—虚拟化」四件事拆成可独立使用又互相咬合的开源组件,MIT 协议、跨平台,并支持通过 MCP 接入 Claude Code、Cursor、Codex 等主流编码智能体。

    安装要求和过程

    环境要求:

    • Cua Drivers(后台驱动):macOS 12+ / Windows 10+ / Linux(X11 或 Wayland);需搭配 Claude Code、Cursor、Codex 等编码智能体。
    • Cua Sandboxes(沙箱):Python 3.11+,pip install cua
    • Cua-Bench(评测):需 uv;Linux / macOS。
    • Lume(虚拟化):Apple Silicon(M1+)macOS,依赖 Apple Virtualization.Framework。

    快速安装:

    # 1) Cua Drivers — 后台驱动原生桌面应用(macOS / Linux)
    /bin/bash -c "$(curl -fsSL https://cua.ai/driver/install.sh)"
    #  Windows (PowerShell)
    irm https://cua.ai/driver/install.ps1 | iex
    
    # 2) Cua Sandboxes — 任意系统的智能体沙箱
    pip install cua
    
    # 3) Lume — macOS 虚拟化
    /bin/bash -c "$(curl -fsSL https://cua.ai/lume/install.sh)"
    
    # 4) Cua-Bench — 评测与 RL 环境
    git clone https://github.com/trycua/cua && cd cua/cua-bench
    uv tool install -e . && cb image create linux-docker

    核心功能

    Cua 四大模块生态图

    1. 后台 Computer-Use 驱动:在 macOS / Windows / Linux 上后台驱动原生应用,智能体点击、键入、校验,全程不抢走你的光标与窗口焦点;同一套 CLI + MCP 服务器可接入 Claude Code、Cursor、Codex、OpenClaw 等。
    2. 跨 OS 智能体沙箱:一个统一 API 调度任意系统的 VM/容器(Linux / macOS / Windows / Android 及 BYOI),看屏、点击、执行代码,云端或本地(QEMU)皆可。
    3. 评测与 RL 基准(Cua-Bench):在 OSWorld、ScreenSpot、Windows Arena 上评测 computer-use 智能体,并导出轨迹用于训练与强化学习。
    4. macOS 原生虚拟化(Lume):基于 Apple Virtualization.Framework,在 Apple Silicon 上以近原生性能创建、管理 macOS / Linux 虚拟机,支持 unattended 无人值守安装。
    5. 开放可组合生态:cua-driver / cua-agent / cua-sandbox / cua-computer-server / cua-bench / lume / lumier 七大包,lumier 还提供 Docker 兼容接口,便于把 Lume 虚拟机接入现有编排。

    典型使用场景

    Cua 后台 Computer-Use 工作流

    • 给编码智能体一台「电脑」:把 Cua Sandbox 接进 Claude Code,让它在隔离的 macOS / Windows 虚拟机里自行打开浏览器、跑脚本、截图验证,完成端到端任务而不污染本机。
    • 后台自动化办公流:用 Cua Drivers 在后台驱动 Slack、Excel、浏览器等原生应用,自动填表、导出报表、跨软件搬运数据,你依旧能正常用电脑。
    • 评测与训练自己的 CUA 模型:用 Cua-Bench 在标准化环境里跑基准、收集轨迹,进而做监督微调或 RL,持续改进自家 computer-use 模型。

    推荐理由

    一句话:如果你在折腾「让 AI 操作电脑」,Cua 是目前最完整、最务实的开源底座。它把「驱动—沙箱—评测—虚拟化」四件事拆成了可独立使用又互相咬合的模块——想给 Agent 加双手,用 Drivers;想搞评测训练,用 Bench;想在 Mac 上批量起虚拟机,用 Lume。MIT 协议、跨平台、支持 MCP 接入主流编码助手,落地门槛低。相比闭源的 Operator / Manus 类服务,Cua 把控制权和数据都留在你手里——这正是本地优先时代最该有的样子。

    下载地址

  • Voicebox:本地优先的开源 AI 语音工作室,克隆声音 + 让智能体开口说话

    Voicebox:本地优先的开源 AI 语音工作室,克隆声音 + 让智能体开口说话

    Voicebox 开源 AI 语音工作室

    Voicebox —— 本地优先的开源 AI 语音工作室

    📌 项目简介

    Voicebox 是由 Jamie Pine 打造的开源 AI 语音工作室,一句话概括:克隆任意声音、生成语音、随时听写、还能让你的 AI 智能体用你拥有的声音开口说话。它是 ElevenLabs(语音输出)与 WisprFlow(语音输入)的本地优先、免费开源二合一替代品,整套语音 I/O 栈都跑在你自己的机器上。

    ⭐ GitHub 43,196 stars | 🍴 5,280 forks | 📅 创建于 2026-01-25,更新于 2026-07-19(当日 GitHub Trending 热门)| 📜 MIT 许可 | 💻 TypeScript / Tauri(Rust) / FastAPI(Python)

    🛠 安装要求和过程

    环境要求

    • 普通用户:直接下载桌面应用,无需配置开发环境;支持 macOS(Apple Silicon / Intel)、Windows、Linux(需源码构建)、Docker。
    • GPU 加速:macOS 走 MLX/Metal(神经引擎快 4-5×),Windows/Linux NVIDIA 走 CUDA,AMD 走 ROCm,Intel Arc 走 IPEX/XPU,Windows 任意显卡走 DirectML,无显卡则回退 CPU。
    • 开发者构建:需 BunRustPython 3.11+Tauri 前置依赖(macOS 还需 Xcode)。

    快速安装(三种方式)

    方式一 · 下载安装包(推荐)

    方式二 · 开发者一键启动

    git clone https://github.com/jamiepine/voicebox.git
    cd voicebox
    just setup    # 创建 Python venv 并安装全部依赖
    just dev      # 启动后端 + 桌面应用

    (先安装 just 命令运行器:brew install justcargo install just

    方式三 · 接入 AI 智能体(MCP)

    claude mcp add voicebox \
      --transport http \
      --url http://127.0.0.1:17493/mcp \
      --header "X-Voicebox-Client-Id: claude-code"

    ✨ 核心功能

    Voicebox 界面

    1. 7 大 TTS 引擎,自由切换:Qwen3-TTS、Qwen CustomVoice、LuxTTS、Chatterbox Multilingual、Chatterbox Turbo、HumeAI TADA、Kokoro,覆盖 23 种语言(英/阿/日/印地/斯瓦希里等),并支持零样本声音克隆与 50+ 预设音色。
    2. 声音克隆 + 语音性格:几秒参考音频即可克隆任意声音;可为每个声纹绑定自由格式的”性格”,通过本地 Qwen3 LLM 实现 Compose(即兴台词)与 Speak-in-character(拟人改写)。
    3. 全局听写 / 语音输入:系统级热键按住说话、松手即停(push-to-talk),macOS 下自动粘贴到当前输入框;底层基于 OpenAI Whisper 的 STT,支持 Base/Small/Medium/Large/Turbo。
    4. 后期音效处理:基于 Spotify pedalboard 的 8 种效果——变调、混响、延迟、合唱、压缩、增益、高/低通滤波,可实时预览并存为预设。
    5. Agent 语音输出(MCP):一句 voicebox.speak() 调用,任何支持 MCP 的智能体(Claude Code / Cursor / Cline / Windsurf)都能用你克隆的声音向你播报任务进展。

    Voicebox Stories 编辑器

    🎯 典型使用场景

    • 播客 / 有声内容创作:用内置 Stories 多轨时间线编辑器,零样本克隆嘉宾声音,一键生成多角色对话、播客与叙事音频,长文本自动分块 + 交叉淡入淡出。
    • AI 编码智能体开发循环:把 Claude Code 绑定到某个克隆声纹,构建完成、测试通过时它能”开口”告诉你——用耳朵接收进度,而不是一直盯着终端。
    • 无障碍与语音辅助:为无法用原声说话的人提供克隆声音;全局热键听写 + macOS 自动粘贴,大幅提升文字录入效率。
    • 游戏 / 叙事交互:为游戏角色或互动叙事工具接入带”性格”的语音,实现有情绪、带语气词的拟人对话。

    💡 推荐理由

    我用过多家云端语音服务,Voicebox 最打动我的是三点:

    • 真正的本地优先 + 隐私优先。模型、声音数据、录音全部留在本机,不上传任何云,对注重数据主权的用户极其友好。
    • 输入 + 输出一站式。ElevenLabs 只管”说”,WisprFlow 只管”听”,Voicebox 把两者打通,还用一个本地 LLM 串联性格改写,一 GPU 显存占用搞定全套。
    • 给 AI Agent 配声音这个设计非常新颖。当你的编码助手能用你熟悉的声音播报”部署完成”,人机交互的体验立刻不一样,这也是它和同类工具最大的差异化。

    ⚠️ 一点不足:Linux 目前没有预编译二进制,需要源码构建;同时 7 个引擎质量参差,部分小模型音色一般,建议按场景挑选。但瑕不掩瑜,作为开源语音 I/O 基础设施,它已经非常能打。

    📥 下载地址

    本文由自动化脚本基于 GitHub 公开仓库信息整理,项目数据截至 2026-07-19。

  • Open Design:开源版 Claude Design,把你的编码智能体变成设计引擎

    Open Design:开源版 Claude Design,把你的编码智能体变成设计引擎

    ⭐ 79.6K Stars  ·  Apache-2.0  ·  TypeScript  ·  本地优先桌面应用

    项目简介

    Open Design 是 Anthropic Claude Design 的开源替代方案——一个本地优先(local-first)的桌面应用,让你的 Claude Code / Codex / Cursor / Gemini 等编码智能体直接化身”设计引擎”,生成网页、桌面、移动端原型、实时仪表盘、演示文稿、图片与视频,并导出为 HTML / PDF / PPTX / MP4 真实文件。

    Open Design 工作台

    安装要求与过程

    环境要求

    • 桌面应用:macOS(Apple Silicon / Intel x64)、Windows(x64)、Linux(AppImage)——无需 Node / pnpm / 克隆仓库。
    • 自托管:Docker + Docker Compose;源码运行需 Node 24、pnpm 10.33.x。
    • 编码智能体:Claude Code、Codex、Cursor、Copilot、OpenClaw、Gemini、Hermes、Kimi、Trae、OpenCode 等 25+ 本地 CLI,或任意 OpenAI 兼容端点(BYOK)。

    快速安装

    1. 下载桌面应用(推荐,零配置):前往官网或 GitHub Releases 下载对应平台安装包;安装后自动检测 PATH 上的编码智能体,加载 100+ 功能技能、渲染模板目录与 151 套设计系统。
    2. 装进编码智能体(无界面)od mcp install <agent><agent> = claude | codex | cursor | copilot | gemini | hermes | kimi | trae | opencode …);或用托管脚本 curl -fsSL https://open-design.ai/install.sh | sh -s <agent>
    3. Docker 自托管
      git clone https://github.com/nexu-io/open-design.git
      cd open-design/deploy
      cp .env.example .env
      echo "OD_API_TOKEN=$(openssl rand -hex 32)" >> .env
      docker compose up -d
      # 打开 http://localhost:7456
    4. 源码运行
      git clone https://github.com/nexu-io/open-design.git
      cd open-design
      corepack enable && pnpm install
      pnpm tools-dev run web

    核心功能

    内置 151 套品牌级设计系统

    1. 智能体原生、模型无关:不绑定任何厂商 Agent,你 PATH 上已有的 claude / codex / cursor / copilot / hermes / kimi 就是设计引擎,一键切换;一条 od mcp install <agent> 把 MCP 服务器接入 25+ 编码智能体。
    2. 品牌级 DESIGN.md 设计系统:每一帧渲染都读取当前包的 DESIGN.md 作为品牌契约;仓库内置 151 套品牌级设计系统(Claude、Stripe、Figma、Apple、NVIDIA…),丢进文件夹即被识别。
    3. 多形态产物,单一项目:Studio 支持原型(web / desktop / mobile 单页)、实时仪表盘 / artifact、演示文稿(deck)、图片、视频与 HyperFrames 动态图形,统一导出 HTML / PDF / PPTX / MP4。
    4. 四层可组合:插件(可运行工作流)+ 功能技能(Agent 行为)+ 设计模板(渲染蓝图)+ 设计系统(品牌),全部用可移植、可版本化的目录,任何人都能创作与发布;官方 277 个插件 + 183 个可复用示例。
    5. 本地优先 + BYOK 隐私:原生桌面应用(macOS / Windows)+ Docker + Vercel;所有数据在你本机、团队服务器或部署项目里运行,BYOK 代理具备 SSRF 防护,沙箱 iframe 预览。

    Open Design 支持的 25 个编码智能体 CLI

    典型使用场景

    • 一句话生成落地页:在入口视图输入 brief,智能体结合 saas-landing 模板与 Linear 设计系统,流式生成带 hero / 特性 / 定价 / CTA 的可运行着陆页,直接导出 HTML 部署。
    • 实时数据仪表盘:用 dashboard 模板生成带侧边栏的管理 / 分析看板,作为 live artifact 实时刷新,而非静态截图。
    • 品牌统一的演示文稿:用 guizang-ppt / html-ppt 模板生成杂志风 Web PPT;或把现有 git 仓库 + DESIGN.md 交给智能体,自动把真实组件重构到品牌规范(含 Figma / Pencil → React / Next / Vue 迁移插件)。

    演示文稿 / Deck 产物

    插件与集成生态

    推荐理由

    作为天天和编码智能体打交道的人,最打动我的是它把”设计”从闭源付费的云端玩具,变成了你笔记本上的文件系统——你的 CLI 是引擎,笔记本是工作室,团队的 DESIGN.md 是品牌契约。相比 Claude Design 的封闭锁定,Open Design 的 agent-native + 模型无关 + Apache-2.0,让我可以随意换模型、自托管、调用 151 套现成设计系统,还能用 277 个插件把 Figma 工作流迁到 React。对想把”vibe coding”从代码延伸到 UI / 海报 / 演示的人来说,这是目前最完整、最开放的一个选择。

    下载地址