标签: 本地优先

  • Cua:开源 Computer-Use 2.0 框架,让 AI 智能体像人一样操作电脑

    Cua:开源 Computer-Use 2.0 框架,让 AI 智能体像人一样操作电脑

    Cua 开源 Computer-Use 2.0 框架

    项目简介

    Cua 是 trycua 出品的一套开源「Computer-Use 2.0」基础设施,围绕「让 AI 智能体像人一样看屏幕、点按钮、敲键盘完成任务」这一目标,提供了四大模块——后台驱动(Cua Drivers)、智能体沙箱(Cua Sandboxes)、评测基准(Cua-Bench)与 macOS 虚拟化(Lume),覆盖从训练、评测到数据生成的全流程。它把「驱动—沙箱—评测—虚拟化」四件事拆成可独立使用又互相咬合的开源组件,MIT 协议、跨平台,并支持通过 MCP 接入 Claude Code、Cursor、Codex 等主流编码智能体。

    安装要求和过程

    环境要求:

    • Cua Drivers(后台驱动):macOS 12+ / Windows 10+ / Linux(X11 或 Wayland);需搭配 Claude Code、Cursor、Codex 等编码智能体。
    • Cua Sandboxes(沙箱):Python 3.11+,pip install cua
    • Cua-Bench(评测):需 uv;Linux / macOS。
    • Lume(虚拟化):Apple Silicon(M1+)macOS,依赖 Apple Virtualization.Framework。

    快速安装:

    # 1) Cua Drivers — 后台驱动原生桌面应用(macOS / Linux)
    /bin/bash -c "$(curl -fsSL https://cua.ai/driver/install.sh)"
    #  Windows (PowerShell)
    irm https://cua.ai/driver/install.ps1 | iex
    
    # 2) Cua Sandboxes — 任意系统的智能体沙箱
    pip install cua
    
    # 3) Lume — macOS 虚拟化
    /bin/bash -c "$(curl -fsSL https://cua.ai/lume/install.sh)"
    
    # 4) Cua-Bench — 评测与 RL 环境
    git clone https://github.com/trycua/cua && cd cua/cua-bench
    uv tool install -e . && cb image create linux-docker

    核心功能

    Cua 四大模块生态图

    1. 后台 Computer-Use 驱动:在 macOS / Windows / Linux 上后台驱动原生应用,智能体点击、键入、校验,全程不抢走你的光标与窗口焦点;同一套 CLI + MCP 服务器可接入 Claude Code、Cursor、Codex、OpenClaw 等。
    2. 跨 OS 智能体沙箱:一个统一 API 调度任意系统的 VM/容器(Linux / macOS / Windows / Android 及 BYOI),看屏、点击、执行代码,云端或本地(QEMU)皆可。
    3. 评测与 RL 基准(Cua-Bench):在 OSWorld、ScreenSpot、Windows Arena 上评测 computer-use 智能体,并导出轨迹用于训练与强化学习。
    4. macOS 原生虚拟化(Lume):基于 Apple Virtualization.Framework,在 Apple Silicon 上以近原生性能创建、管理 macOS / Linux 虚拟机,支持 unattended 无人值守安装。
    5. 开放可组合生态:cua-driver / cua-agent / cua-sandbox / cua-computer-server / cua-bench / lume / lumier 七大包,lumier 还提供 Docker 兼容接口,便于把 Lume 虚拟机接入现有编排。

    典型使用场景

    Cua 后台 Computer-Use 工作流

    • 给编码智能体一台「电脑」:把 Cua Sandbox 接进 Claude Code,让它在隔离的 macOS / Windows 虚拟机里自行打开浏览器、跑脚本、截图验证,完成端到端任务而不污染本机。
    • 后台自动化办公流:用 Cua Drivers 在后台驱动 Slack、Excel、浏览器等原生应用,自动填表、导出报表、跨软件搬运数据,你依旧能正常用电脑。
    • 评测与训练自己的 CUA 模型:用 Cua-Bench 在标准化环境里跑基准、收集轨迹,进而做监督微调或 RL,持续改进自家 computer-use 模型。

    推荐理由

    一句话:如果你在折腾「让 AI 操作电脑」,Cua 是目前最完整、最务实的开源底座。它把「驱动—沙箱—评测—虚拟化」四件事拆成了可独立使用又互相咬合的模块——想给 Agent 加双手,用 Drivers;想搞评测训练,用 Bench;想在 Mac 上批量起虚拟机,用 Lume。MIT 协议、跨平台、支持 MCP 接入主流编码助手,落地门槛低。相比闭源的 Operator / Manus 类服务,Cua 把控制权和数据都留在你手里——这正是本地优先时代最该有的样子。

    下载地址

  • Voicebox:本地优先的开源 AI 语音工作室,克隆声音 + 让智能体开口说话

    Voicebox:本地优先的开源 AI 语音工作室,克隆声音 + 让智能体开口说话

    Voicebox 开源 AI 语音工作室

    Voicebox —— 本地优先的开源 AI 语音工作室

    📌 项目简介

    Voicebox 是由 Jamie Pine 打造的开源 AI 语音工作室,一句话概括:克隆任意声音、生成语音、随时听写、还能让你的 AI 智能体用你拥有的声音开口说话。它是 ElevenLabs(语音输出)与 WisprFlow(语音输入)的本地优先、免费开源二合一替代品,整套语音 I/O 栈都跑在你自己的机器上。

    ⭐ GitHub 43,196 stars | 🍴 5,280 forks | 📅 创建于 2026-01-25,更新于 2026-07-19(当日 GitHub Trending 热门)| 📜 MIT 许可 | 💻 TypeScript / Tauri(Rust) / FastAPI(Python)

    🛠 安装要求和过程

    环境要求

    • 普通用户:直接下载桌面应用,无需配置开发环境;支持 macOS(Apple Silicon / Intel)、Windows、Linux(需源码构建)、Docker。
    • GPU 加速:macOS 走 MLX/Metal(神经引擎快 4-5×),Windows/Linux NVIDIA 走 CUDA,AMD 走 ROCm,Intel Arc 走 IPEX/XPU,Windows 任意显卡走 DirectML,无显卡则回退 CPU。
    • 开发者构建:需 BunRustPython 3.11+Tauri 前置依赖(macOS 还需 Xcode)。

    快速安装(三种方式)

    方式一 · 下载安装包(推荐)

    方式二 · 开发者一键启动

    git clone https://github.com/jamiepine/voicebox.git
    cd voicebox
    just setup    # 创建 Python venv 并安装全部依赖
    just dev      # 启动后端 + 桌面应用

    (先安装 just 命令运行器:brew install justcargo install just

    方式三 · 接入 AI 智能体(MCP)

    claude mcp add voicebox \
      --transport http \
      --url http://127.0.0.1:17493/mcp \
      --header "X-Voicebox-Client-Id: claude-code"

    ✨ 核心功能

    Voicebox 界面

    1. 7 大 TTS 引擎,自由切换:Qwen3-TTS、Qwen CustomVoice、LuxTTS、Chatterbox Multilingual、Chatterbox Turbo、HumeAI TADA、Kokoro,覆盖 23 种语言(英/阿/日/印地/斯瓦希里等),并支持零样本声音克隆与 50+ 预设音色。
    2. 声音克隆 + 语音性格:几秒参考音频即可克隆任意声音;可为每个声纹绑定自由格式的”性格”,通过本地 Qwen3 LLM 实现 Compose(即兴台词)与 Speak-in-character(拟人改写)。
    3. 全局听写 / 语音输入:系统级热键按住说话、松手即停(push-to-talk),macOS 下自动粘贴到当前输入框;底层基于 OpenAI Whisper 的 STT,支持 Base/Small/Medium/Large/Turbo。
    4. 后期音效处理:基于 Spotify pedalboard 的 8 种效果——变调、混响、延迟、合唱、压缩、增益、高/低通滤波,可实时预览并存为预设。
    5. Agent 语音输出(MCP):一句 voicebox.speak() 调用,任何支持 MCP 的智能体(Claude Code / Cursor / Cline / Windsurf)都能用你克隆的声音向你播报任务进展。

    Voicebox Stories 编辑器

    🎯 典型使用场景

    • 播客 / 有声内容创作:用内置 Stories 多轨时间线编辑器,零样本克隆嘉宾声音,一键生成多角色对话、播客与叙事音频,长文本自动分块 + 交叉淡入淡出。
    • AI 编码智能体开发循环:把 Claude Code 绑定到某个克隆声纹,构建完成、测试通过时它能”开口”告诉你——用耳朵接收进度,而不是一直盯着终端。
    • 无障碍与语音辅助:为无法用原声说话的人提供克隆声音;全局热键听写 + macOS 自动粘贴,大幅提升文字录入效率。
    • 游戏 / 叙事交互:为游戏角色或互动叙事工具接入带”性格”的语音,实现有情绪、带语气词的拟人对话。

    💡 推荐理由

    我用过多家云端语音服务,Voicebox 最打动我的是三点:

    • 真正的本地优先 + 隐私优先。模型、声音数据、录音全部留在本机,不上传任何云,对注重数据主权的用户极其友好。
    • 输入 + 输出一站式。ElevenLabs 只管”说”,WisprFlow 只管”听”,Voicebox 把两者打通,还用一个本地 LLM 串联性格改写,一 GPU 显存占用搞定全套。
    • 给 AI Agent 配声音这个设计非常新颖。当你的编码助手能用你熟悉的声音播报”部署完成”,人机交互的体验立刻不一样,这也是它和同类工具最大的差异化。

    ⚠️ 一点不足:Linux 目前没有预编译二进制,需要源码构建;同时 7 个引擎质量参差,部分小模型音色一般,建议按场景挑选。但瑕不掩瑜,作为开源语音 I/O 基础设施,它已经非常能打。

    📥 下载地址

    本文由自动化脚本基于 GitHub 公开仓库信息整理,项目数据截至 2026-07-19。

  • Open Design:开源版 Claude Design,把你的编码智能体变成设计引擎

    Open Design:开源版 Claude Design,把你的编码智能体变成设计引擎

    ⭐ 79.6K Stars  ·  Apache-2.0  ·  TypeScript  ·  本地优先桌面应用

    项目简介

    Open Design 是 Anthropic Claude Design 的开源替代方案——一个本地优先(local-first)的桌面应用,让你的 Claude Code / Codex / Cursor / Gemini 等编码智能体直接化身”设计引擎”,生成网页、桌面、移动端原型、实时仪表盘、演示文稿、图片与视频,并导出为 HTML / PDF / PPTX / MP4 真实文件。

    Open Design 工作台

    安装要求与过程

    环境要求

    • 桌面应用:macOS(Apple Silicon / Intel x64)、Windows(x64)、Linux(AppImage)——无需 Node / pnpm / 克隆仓库。
    • 自托管:Docker + Docker Compose;源码运行需 Node 24、pnpm 10.33.x。
    • 编码智能体:Claude Code、Codex、Cursor、Copilot、OpenClaw、Gemini、Hermes、Kimi、Trae、OpenCode 等 25+ 本地 CLI,或任意 OpenAI 兼容端点(BYOK)。

    快速安装

    1. 下载桌面应用(推荐,零配置):前往官网或 GitHub Releases 下载对应平台安装包;安装后自动检测 PATH 上的编码智能体,加载 100+ 功能技能、渲染模板目录与 151 套设计系统。
    2. 装进编码智能体(无界面)od mcp install <agent><agent> = claude | codex | cursor | copilot | gemini | hermes | kimi | trae | opencode …);或用托管脚本 curl -fsSL https://open-design.ai/install.sh | sh -s <agent>
    3. Docker 自托管
      git clone https://github.com/nexu-io/open-design.git
      cd open-design/deploy
      cp .env.example .env
      echo "OD_API_TOKEN=$(openssl rand -hex 32)" >> .env
      docker compose up -d
      # 打开 http://localhost:7456
    4. 源码运行
      git clone https://github.com/nexu-io/open-design.git
      cd open-design
      corepack enable && pnpm install
      pnpm tools-dev run web

    核心功能

    内置 151 套品牌级设计系统

    1. 智能体原生、模型无关:不绑定任何厂商 Agent,你 PATH 上已有的 claude / codex / cursor / copilot / hermes / kimi 就是设计引擎,一键切换;一条 od mcp install <agent> 把 MCP 服务器接入 25+ 编码智能体。
    2. 品牌级 DESIGN.md 设计系统:每一帧渲染都读取当前包的 DESIGN.md 作为品牌契约;仓库内置 151 套品牌级设计系统(Claude、Stripe、Figma、Apple、NVIDIA…),丢进文件夹即被识别。
    3. 多形态产物,单一项目:Studio 支持原型(web / desktop / mobile 单页)、实时仪表盘 / artifact、演示文稿(deck)、图片、视频与 HyperFrames 动态图形,统一导出 HTML / PDF / PPTX / MP4。
    4. 四层可组合:插件(可运行工作流)+ 功能技能(Agent 行为)+ 设计模板(渲染蓝图)+ 设计系统(品牌),全部用可移植、可版本化的目录,任何人都能创作与发布;官方 277 个插件 + 183 个可复用示例。
    5. 本地优先 + BYOK 隐私:原生桌面应用(macOS / Windows)+ Docker + Vercel;所有数据在你本机、团队服务器或部署项目里运行,BYOK 代理具备 SSRF 防护,沙箱 iframe 预览。

    Open Design 支持的 25 个编码智能体 CLI

    典型使用场景

    • 一句话生成落地页:在入口视图输入 brief,智能体结合 saas-landing 模板与 Linear 设计系统,流式生成带 hero / 特性 / 定价 / CTA 的可运行着陆页,直接导出 HTML 部署。
    • 实时数据仪表盘:用 dashboard 模板生成带侧边栏的管理 / 分析看板,作为 live artifact 实时刷新,而非静态截图。
    • 品牌统一的演示文稿:用 guizang-ppt / html-ppt 模板生成杂志风 Web PPT;或把现有 git 仓库 + DESIGN.md 交给智能体,自动把真实组件重构到品牌规范(含 Figma / Pencil → React / Next / Vue 迁移插件)。

    演示文稿 / Deck 产物

    插件与集成生态

    推荐理由

    作为天天和编码智能体打交道的人,最打动我的是它把”设计”从闭源付费的云端玩具,变成了你笔记本上的文件系统——你的 CLI 是引擎,笔记本是工作室,团队的 DESIGN.md 是品牌契约。相比 Claude Design 的封闭锁定,Open Design 的 agent-native + 模型无关 + Apache-2.0,让我可以随意换模型、自托管、调用 151 套现成设计系统,还能用 277 个插件把 Figma 工作流迁到 React。对想把”vibe coding”从代码延伸到 UI / 海报 / 演示的人来说,这是目前最完整、最开放的一个选择。

    下载地址

  • code-review-graph:让 AI 编码助手只读「该读的代码」,省下 82 倍 Token

    code-review-graph:让 AI 编码助手只读「该读的代码」,省下 82 倍 Token

    code-review-graph:Token 缩减对比

    code-review-graph(简称 CRG)是一款本地优先(local-first)的代码智能图谱工具:它用 Tree-sitter 把整个代码库解析成结构化的函数 / 类 / 调用关系图谱,再通过 MCP 协议喂给 Claude Code、Cursor、Codex 等 AI 编码助手——让它们在做代码评审、改 Bug、理解大型仓库时,只读取真正相关的文件,而不是把整个仓库灌进上下文里烧 Token。

    一、安装要求和过程

    环境要求:

    • Python 3.10+
    • 推荐安装 uv(可选,MCP 配置会自动优先用 uvx 调用);
    • 支持 Git / SVN 仓库;Windows / macOS / Linux 全平台可用。

    三步极速安装:

    pip install code-review-graph          # 或:pipx install code-review-graph
    code-review-graph install             # 自动检测并配置所有已安装的 AI 编码平台
    code-review-graph build               # 解析代码库,构建结构图谱

    一行命令搞定:install 会自动识别你装了哪些 AI 编码工具(Codex、Claude Code、Cursor、Windsurf、Zed、Continue、CodeBuddy Code、Gemini CLI、Qwen、Kiro、GitHub Copilot 等 14+ 平台),为它们写入正确的 MCP 配置,并注入”图谱感知”的指令。重启编辑器即可生效。也可以只针对单个平台:code-review-graph install --platform cursor

    一次安装,适配所有平台

    二、核心功能

    1. 增量更新 < 2 秒
    文件保存或提交时通过 hook / watch 模式触发增量解析,2900 文件的项目重新索引不到 2 秒,几乎无感。

    从仓库到最小评审集的处理管线

    2. 爆炸半径(Blast-radius)分析
    当某个文件被改动,图谱会追踪所有”调用方、依赖方、相关测试”,算出这次改动的影响半径。AI 只读这些”受影响”的文件,而不是全仓扫描。

    改动 login() 后影响半径的传递过程

    3. 本地优先 + 零遥测
    图谱以 SQLite 存在本地 .code-review-graph/ 目录,核心存储不依赖任何外部数据库或云服务;可选的向量嵌入(sentence-transformers / Gemini / OpenAI 兼容端点)也完全本地可控,默认不开云。

    AI 助手如何通过 MCP 使用图谱

    4. 30 个 MCP 工具 + 5 套工作流模板
    涵盖最小上下文、影响半径、架构总览、知识缺口、重构建议等,图谱构建完成后 AI 助手自动调用;内置 review_changes / architecture_map / debug_issue / onboard_developer / pre_merge_check 五套提示词模板。

    5. CI 风险评分 PR 审查
    可作为 GitHub Action 在每次 PR 贴出带风险评分的审查评论(原地更新),并支持 fail-on-risk 合并门禁,全程在 CI runner 本地完成,源码不出域。

    三、典型使用场景

    ① 日常代码评审
    在 Claude Code / Cursor 里问”评审这次改动”,AI 先查图谱拿到最小必要文件集合。实测 fastapi 仓库从 95 万 token 降到 2169 token(约 528 倍),评审又快又准。

    6 个真实仓库的基准测试

    ② 啃大型单体仓库(monorepo)
    CRG 自身仓库 20 万+ 源码 token 经图谱漏斗后只回传约 2495 token(约 93 倍),在巨型仓库里把噪音一刀切断——这正是 Token 浪费最痛的地方。

    ③ PR 自动化审查 + 新人 onboarding
    GitHub Action 在每次 push 原地更新带风险评分的 sticky 评论;onboard_developer MCP 工作流利用社区结构帮新人快速摸清架构边界与热点模块。

    四、推荐理由

    我(以及不少 AI 编码重度用户)最大的痛点就是:让 Agent 去”看一眼这个改动影响哪些地方”,它往往会把大半个仓库重新读一遍——Token 烧得飞起,还容易跑偏。CRG 的思路很妙:它不跟 LSP / RAG 抢饭碗,而是补上”结构化的多跳关系”这一层——调用方、依赖方、测试、影响半径,全用 AST 静态分析算出来,确定性、可复现、零云端依赖。

    官方在 6 个真实仓库上的基准测试显示,每问一次的中位数约 82 倍 token 缩减(最大 528 倍),增量更新几乎无感。对于一个”想让 AI 编码助手更省、更准、更本地”的团队来说,这是目前最省心的一站式接入方案——pip install + install 两条命令,所有平台一次配齐。

    五、下载地址

  • Hermes Agent:会自己进化的 AI 智能体,越用越懂你(216K★ · Nous Research 开源)

    Hermes Agent:会自己进化的 AI 智能体,越用越懂你(216K★ · Nous Research 开源)

    Hermes Agent

    Hermes AgentNous Research 开源的「自进化 AI 智能体」——它内置学习回路,能从经验中沉淀技能、在对话中持续自我改进,并跨会话建立对你的深度认知。它可以跑在 5 美元的 VPS、GPU 集群,或是近乎零成本的 Serverless 上,彻底不依赖你的笔记本电脑:你甚至能在手机 Telegram 上给它派活,它却在云端 VM 里默默干活。

    📦 安装要求和过程

    环境要求

    • 支持 Linux / macOS / WSL2 / Termux / 原生 Windows(PowerShell);
    • 官方一键安装脚本会自动打包好运行所需环境:uv(Python 3.11)、Node.js、ripgrep、ffmpeg,以及隔离的 MinGit(Windows 原生无需管理员权限);
    • 至少准备一个 LLM Provider 的 API Key,或直接使用 Nous Portal 一站式订阅(300+ 模型 + 工具网关)。

    快速安装

    Linux / macOS / WSL2:

    curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash
    source ~/.bashrc      # 重载 shell
    hermes               # 开始对话

    Windows(原生 PowerShell):

    iex (irm https://hermes-agent.nousresearch.com/install.ps1)

    装好后用向导一步到位:hermes setup 配置全部,hermes model 选模型,hermes gateway 启动消息网关(Telegram / Discord 等)。

    ✨ 核心功能

    1. 闭环学习回路(Closed Learning Loop)
    Agent 自主策展记忆并周期性自我提醒;完成复杂任务后自动创建技能,并在后续使用中不断自我改进。配合 FTS5 会话检索 + LLM 摘要实现跨会话回忆,兼容 agentskills.io 开放标准,并引入 Honcho 辩证式用户建模——它会越来越懂你。

    2. 真实终端体验 & 随处可达
    完整 TUI:多行编辑、斜杠命令自动补全、流式工具输出、可随时打断重定向。单个网关进程同时接入 Telegram / Discord / Slack / WhatsApp / Signal / 邮件,支持语音转写与跨平台对话连续。

    3. 40+ 工具 & MCP & 子智能体并行
    内置终端、文件、Web 搜索、图像生成等 40+ 工具,提供 6 种终端后端(local / Docker / SSH / Singularity / Modal / Daytona);可派生隔离子智能体并行工作流,并通过 RPC 把多步流水线压成「零上下文成本」的回合。

    4. 定时自动化 & 模型自由
    内置 cron 调度器,用自然语言描述即可跑日报、夜备、周审并投递到任意平台;hermes model 一行切换 Nous Portal / OpenRouter / OpenAI / 自有端点等 300+ 模型,零锁定

    5. 安全 & 自托管
    命令审批、DM 配对、容器隔离一应俱全;可部署在 5 美元 VPS 或 GPU 集群,Daytona / Modal 提供 Serverless 持久化——空闲时近乎零成本。

    🎯 典型使用场景

    场景一:个人随身助理
    在手机 Telegram 给云端 VM 里的 Hermes 派活,它后台跑长任务,完工把日报推回 Telegram——你的笔记本全程不用开机。

    场景二:研发自动化工作台
    接入 MCP 服务器 + 派生子智能体并行做代码库理解、批量改文件、跑测试;用 cron 每晚自动备份、每周自动审计,全程无人值守。

    场景三:研究 / 数据流水线
    批量生成并压缩 trajectory 用于训练下一代 tool-calling 模型;跨会话记忆让科研助理越用越贴合你的研究偏好。

    💡 推荐理由

    我用过不少 AI Agent,Hermes 最打动我的是它真的「会成长」:多数 Agent 是一次性工具,而 Hermes 把经验固化成可复用技能,用得越久越顺手,这对长期个人助理场景价值巨大。其次是模型与平台都不锁定——想省事用 Nous Portal 一站式,想自由就自带 Key,迁移成本极低。最后是它真正「住在云端」的设计(Telegram 触达 + Serverless 休眠),特别适合不想一直开着电脑的人。

    🔗 下载地址

  • OpenWiki:让 AI 智能体为你的代码库自动写「活文档」的 CLI 工具

    OpenWiki:让 AI 智能体为你的代码库自动写「活文档」的 CLI 工具

    OpenWiki

    项目简介

    OpenWiki 是 LangChain 开源的命令行工具,专为 AI 智能体(Agent)设计,能自动为你的代码库或个人知识源生成并持续维护一份本地 Wiki(知识库)。它把分散在代码、邮件、笔记、社交动态里的信息,用 LLM 合成结构化、可检索、可被编码助手直接引用的文档。

    安装要求和过程

    环境要求

    • Node.js 运行环境(推荐用 npmpnpm 安装)。Windows 上建议避开 bun——它安装时需要本地编译 better-sqlite3 原生依赖,需先装 Visual Studio Build Tools(桌面开发 with C++ 工作负载)。
    • 至少一个 LLM 提供商的 API Key:开箱支持 OpenAI / Anthropic / Gemini / Vertex AI / AWS Bedrock / OpenRouter / Fireworks / NVIDIA NIM 等,默认模型 gpt-5.6-terra

    快速安装

    # 全局安装
    npm install -g openwiki
    # 或
    pnpm add -g openwiki

    快速开始

    # 代码模式:初始化并配置模型/Key,自动为当前仓库生成文档
    openwiki --init
    
    # 进入交互式 CLI,开始生成仓库 Wiki
    openwiki
    
    # 带初始指令一次性运行
    openwiki "Please generate documentation for this repository"
    
    # 更新文档(可放进 CI 定时跑)
    openwiki --update
    
    # 个人大脑模式:从 Gmail/Notion/X 等构建本地知识库
    openwiki personal --init

    OpenWiki 提供 两种模式Code 模式为当前代码库在 openwiki/ 生成仓库文档;Personal 模式从配置的本地仓库、Gmail、Notion、Web Search、Hacker News、X/Twitter 在 ~/.openwiki/wiki 构建”个人大脑”。配置与密钥保存在本地 ~/.openwiki/.env

    核心功能

    1. 双模式 Wiki:代码库 & 个人大脑

    代码模式下,OpenWiki 不仅生成 openwiki/ 目录的仓库文档,还会在仓库根目录维护 AGENTS.mdCLAUDE.md;个人模式则把 Git / Notion / Gmail / X / Hacker News / Web 统一 ingested 成一份本地可问答的知识库。

    2. 为 Agent 而生:把 Wiki 焊进编码助手

    OpenWiki 用 <!-- OPENWIKI:START -->…<!-- OPENWIKI:END --> 注释块向 AGENTS.md / CLAUDE.md 注入指引,且只改写自己的区块、不动你写的内容。结果是 Claude Code、Codex、Cursor 等编码智能体在检索上下文时会直接引用这份 Wiki,而不用把整页代码塞进上下文窗口,显著节省 token。

    3. 多连接器 Ingestion

    内置 git-repo / gmail / notion / x(Twitter) / web-search(Tavily) / hackernews 连接器,同一连接器可配置多个实例(如 web-search-1web-search-2),用 openwiki auth <provider> 完成 OAuth 登录。

    4. 全模型供应商兼容

    开箱支持 OpenAI(含 ChatGPT 订阅登录,免 API 计费)、Anthropic、Gemini(AI Studio)、Gemini Enterprise(Vertex AI)、AWS Bedrock(IAM 凭证)、OpenRouter、Fireworks、Baseten、NVIDIA NIM、以及任意 OpenAI 兼容端点;甚至支持自托管/代理网关的 ANTHROPIC_BASE_URLOPENAI_COMPATIBLE_BASE_URL

    5. CI 自动化 + 隐私友好

    提供 GitHub Actions / GitLab CI / Bitbucket 流水线模板,定时自动开 PR 更新文档;数据全部存于本地(本地优先),匿名遥测可一键关闭(OPENWIKI_TELEMETRY_DISABLED=1DO_NOT_TRACK=1)。

    典型使用场景

    场景一:团队代码库”活文档”

    openwiki-update.yml 放进 GitHub Actions,每次定时运行自动生成/更新仓库 Wiki 并开 PR。新成员和 AI 编码助手都能秒懂项目结构、模块职责与历史决策,告别”文档写完就过期”。

    场景二:个人知识大脑

    连接 Gmail、Notion、X、Hacker News 与本地 Git 仓库,OpenWiki 把它们合成一份可问答的本地 Wiki。想回顾某段技术讨论或某封邮件结论时,直接对话即可,知识不再散落各处。

    场景三:给编码 Agent 减负

    OpenWiki 把 Wiki 注入 AGENTS.md / CLAUDE.md 后,Claude Code 等智能体在动手改代码前会先读 Wiki,避免重复探索、显著降低上下文 token 消耗——这正是”代码库语义化”落地的关键一环。

    推荐理由(个人使用心得)

    “代码库语义化”是 2026 年 Agent 基础设施里最实在的刚需之一。OpenWiki 的巧思在于:它不只是一个文档生成器,而是把生成的 Wiki 直接焊进 AGENTS.md / CLAUDE.md——这是 Claude Code、Codex、Cursor 都会主动读取的文件。换句话说,它让 AI 编码助手在每次开工前自动带上项目上下文,而不是靠把整页源码塞进上下文窗口。

    TypeScript 写的单 CLI、MIT 协议、本地优先、数据不出机器,对个人开发者和注重隐私的团队都很友好;LangChain 出品也意味着模型兼容性与工程质量有保障。唯一的小门槛是需要自备 LLM Key,以及 Windows 上用 bun 装要额外编译原生依赖——用 npm/pnpm 则毫无障碍。如果你已经被”AI 改代码却不懂项目全貌”折磨过,值得一试。

    下载地址

  • DeepTutor:把 AI 变成陪伴你终身的专属私教(HKUDS 开源)

    DeepTutor:把 AI 变成陪伴你终身的专属私教(HKUDS 开源)

    在 AI 辅导工具层出不穷的今天,大多数产品要么只做”问答”,要么只做”出题”,上下文在每次对话后便归零。香港大学数据科学团队 HKUDS(LightRAG、Vibe-Trading、nanobot 同门)开源的 DeepTutor,想解决的是更本质的问题——如何让 AI 真正”认识”你,并陪你长期、系统地学习。

    一、项目简介

    DeepTutor 是一个智能体原生(agent-native)的终身学习工作台:它将辅导对话、解题、出题测验、文献研究、可视化与掌握度训练整合进同一个可扩展系统,并用一套三层可审计记忆把”个性化”变得可见、可编辑、可追溯。

    DeepTutor Chat 工作台
    Chat 是默认入口:单条对话即可调用工具、挂载知识库、生成图片、咨询子智能体,并在多轮间保持同一上下文。

    二、安装要求与过程

    环境要求:Python 3.11+、Node.js 20+(PyPI 安装方式),或 Node.js 22 LTS(源码方式);Docker 方式无需本地 Python/Node。需要自备一个 LLM 提供商的 API Key,也支持 Ollama / LM Studio / vLLM / llama.cpp 等本地模型。

    官方提供 4 种安装路径,最推荐的是 PyPI 一键安装(完整本地 Web 应用 + CLI,无需克隆仓库):

    mkdir -p my-deeptutor && cd my-deeptutor
    pip install -U deeptutor
    deeptutor init     # 交互式设置端口、LLM 提供商与可选 embedding
    deeptutor start    # 启动后端+前端,默认访问 http://127.0.0.1:3782

    想要一条命令跑起来,也可以用官方 Docker 镜像(仅需暴露 3782 端口):

    docker run --rm --name deeptutor \
      -p 127.0.0.1:3782:3782 \
      -v deeptutor-data:/app/data \
      ghcr.io/hkuds/deeptutor:latest

    此外还有”源码安装(便于二次开发)”与”仅 CLI(无界面)”两种路径,且均可从同一工作区平滑升级到完整 Web 应用。配置全部以 JSON/YAML 形式存放在 data/user/settings/ 下,浏览器里的 Settings 页面即推荐编辑器。

    三、核心功能

    • 一个运行时,覆盖所有学习模式:Chat、Quiz、Research、Visualize、Solve、Mastery Path 共用同一个 Agent Loop,切换的是目标而非引擎,学习上下文始终跟随你。
    • 可连接的学习上下文:知识库、书籍、Co-Writer 草稿、笔记本、题库、人格(Persona)与记忆在各类工作流间共享,不再散落在彼此孤立的工具里。
    • 子智能体与 Partner 伙伴:可在任意对话中实时调用本地 Claude Code / Codex,或导入它们过往的对话记录;也能运行常驻 IM 伙伴(飞书、Telegram、Slack、Discord、钉钉、QQ、企业微信、WhatsApp、Matrix 等)。
    • 多引擎知识库(RAG):可选 LlamaIndex、PageIndex、GraphRAG、LightRAG,或直接挂载 Obsidian vault;文档解析引擎可切换(MinerU / Docling / markitdown 等),并支持版本化、可回滚的索引。
    • 可检视的三层记忆:L1 原始轨迹、L2 表层摘要、L3 跨面综合,层层引用溯源;配套的”记忆图谱”让任何一条个性化结论都能追溯到背后的原始依据。
    DeepTutor 知识中心
    知识中心支持多种检索引擎,每个知识库可独立选择引擎并版本化管理。
    DeepTutor 活书 Book
    Book 把资料一键编译成带测验卡、时间线、交互模块乃至 Manim 动画的”活书”。
    DeepTutor 伙伴 Partner
    Partner 是”有性格、有联系方式”的常驻伙伴,共享同一套大脑与记忆工具。

    四、典型使用场景

    1. 学生个性化辅导:把教材 PDF 建为知识库,让 DeepTutor 按”同伴 / 助教 / 老师”不同人格讲解难点,自动出测验题并给出带解析的参考答案;错题与偏好会沉淀进三层记忆,越用越懂你。

    2. 研究者 / 工程师的文献与写作助手:用 Research 生成带引用的综述,用 Co-Writer 做”选择即改写”的精准编辑(每次改动都是可接受的 diff),用 Book 把资料编译成带交互模块与动画的”活书”。

    3. 团队 / 班级的共享知识中枢:开启多用户鉴权后,一个 data 目录即可托管管理员工作区、彼此隔离的每用户工作区与伙伴工作区;管理员统一分配模型、知识库与技能,普通用户只看到被授权的只读选项,不暴露原始 API Key。

    五、推荐理由(个人使用心得)

    我最看重 DeepTutor 的,是它把”个性化”从一句营销话术变成了可看见、可审计、可编辑的东西。大多数 AI tutor 的记忆是个黑盒,而 DeepTutor 的三层记忆 + 记忆图谱让你能清楚看到”它为什么这么认为你”。对自学者来说,知识库多引擎可选 + 本地模型支持意味着敏感资料不必出网;对开发者来说,MCP、子智能体、CLI 与 EduHub 技能社区又留下了充足的二次创作空间。它不是一个”开箱即用的玩具”,而是一套能陪你长期生长的”学习操作系统”。

    六、下载地址

  • nanobot:可完全自托管的轻量级个人 AI 智能体运行时

    nanobot:可完全自托管的轻量级个人 AI 智能体运行时

    nanobot 封面

    nanobot 是一个开源、超轻量的个人 AI 智能体运行时(agent runtime),把 WebUI、聊天渠道、工具、记忆、MCP、模型路由、自动化与部署打包在一个可读的小内核里,让你真正”拥有”自己的智能体,而不是被某个大平台锁定。

    ⭐ Stars 45,688+ 🍴 Forks 8,059
    💻 语言 Python 📜 协议 MIT
    🏢 团队 HKUDS(香港大学数据科学团队,LightRAG / Vibe-Trading 同门)

    📦 安装要求和过程

    环境要求

    • Python 3.11 及以上(必须)
    • Git:仅源码安装时需要
    • bun 或 npm:从源码构建 WebUI 时需要(PyPI/uv 安装包已内置 WebUI,无需额外构建)
    • 支持 macOS / Linux / Windows;零技术背景用户可走官方”无技术背景起步”向导

    快速安装(任选其一)

    ① 一键安装(macOS / Linux)

    curl -fsSL https://raw.githubusercontent.com/HKUDS/nanobot/main/scripts/install.sh | sh

    ② Windows PowerShell

    irm https://raw.githubusercontent.com/HKUDS/nanobot/main/scripts/install.ps1 | iex

    ③ 使用 uv(推荐,干净隔离)

    uv tool install nanobot-ai

    ④ pip 安装

    python -m pip install nanobot-ai

    ⑤ 从源码安装

    git clone https://github.com/HKUDS/nanobot.git
    cd nanobot
    python -m pip install .

    快速开始

    nanobot onboard        # 交互式初始化(生成 ~/.nanobot/config.json 与 workspace)
    nanobot gateway        # 启动网关,浏览器访问 http://127.0.0.1:8765
    nanobot agent -m "Hello!"   # 或直接在终端发一条消息测试

    配置只需在 ~/.nanobot/config.json 里填好 providers(API Key / 端点)与 modelPresets(模型预设)两块即可,支持 OpenAI 兼容接口、本地 LLM 与 fallback 模型路由。

    ✨ 核心功能

    • 轻量可读的小内核:核心只是一个 agent loop——消息进来,LLM 决定何时调用工具,记忆/Skill 仅作为上下文按需注入,不做臃肿的编排层,源码小而好改。
    • 聊天原生触达:内置 WebUI + OpenAI 兼容 API,并可接入 Telegram、Discord、Slack、微信、飞书、邮件、Mattermost、Teams 等渠道,把智能体开到你常用的聊天里。
    • 模型自由:兼容 OpenAI 兼容 API、本地 LLM(Ollama / vLLM)、图像生成与 Web 搜索,支持多模型预设与 fallback 路由,不被单一厂商绑定。
    • 工具与自动化:内置文件、Shell、Web 搜索、网页抓取、MCP、cron、图像生成、子智能体等工具;配合长期记忆(Dream)与定时自动化,可跑长周期任务。
    • 可拥有、可扩展:提供 Python SDK 与 OpenAI 兼容 API,可作为长期运行的本地 / 服务端 Agent 网关自托管, inspect、定制、扩展全部在自己手里。

    🌐 WebUI 与架构

    nanobot WebUI

    nanobot 内置 WebUI:聊天、工作区、Apps、Skills、Automations 与设置的统一工作台

    nanobot 架构

    围绕一个小 agent loop 的轻量架构:渠道进消息 → LLM 调度工具 → 按需拉入记忆/Skill

    🎯 典型使用场景

    • 24/7 实时市场 / 趋势分析:连接数据源与 Web 搜索,让智能体持续追踪行情与热点,自动产出洞察与简报。
    • 全栈软件工程助手:借助文件 / Shell / 代码工具,完成开发、部署与迭代;也可作为 Coding Agent 嵌入工作流。
    • 个人知识助理 + 日程自动化:用长期记忆(Dream)沉淀上下文,做随身知识库;用 cron 自动化管理日常例行任务。

    💡 推荐理由

    我用过不少 Agent 框架,nanobot 最打动我的是”“和”归你所有“这两点。它没有把整个系统做成一个庞大的编排黑盒,而是把核心收敛到一个可读的 agent loop,工具、记忆、Skill 都是按需挂上去的——这意味着你看得懂、改得动,也更容易排查问题。

    对隐私敏感、想自托管的人来说,它几乎是把”个人 AI 助手”这件事做对了的范本:本地优先、模型自由(连本地 Ollama/vLLM 都能用)、聊天渠道随便接,还能用 Python SDK / 兼容 API 嵌进自己的系统。相比被某个云端大平台锁死,nanobot 让你真正拥有自己的智能体。MIT 协议、来自 HKUDS(LightRAG 同门)团队,活跃度与文档完整度都很高,值得一试。

    🔗 下载地址

    ⚠️ 本文仅作技术介绍,使用本项目请遵循其 MIT 许可与当地法律法规。

  • AIRI:自托管 AI 数字伴侣,能实时语音聊天、陪你打 Minecraft(42K+ Stars)

    AIRI:自托管 AI 数字伴侣,能实时语音聊天、陪你打 Minecraft(42K+ Stars)

    AIRI 数字生命形象

    项目简介

    AIRI 是由 moeru-ai 团队开源的「自托管、你专属拥有」的 AI 数字生命(AI Companion)项目。它把大语言模型、实时语音交互与 VRM / Live2D 虚拟形象结合在一起,让你在 Web、桌面与移动端拥有一位能说话、能陪玩、有「身体」的赛博伴侣,目标是达到 AI 虚拟主播 Neuro-sama 那样的水平。整个项目基于 WebGPU / WebAudio / WebAssembly 等现代 Web 技术构建,强调本地优先与隐私保护。

    安装要求和过程

    环境要求

    • 运行时:Node.js 24+(项目已提升到 24.13.0),包管理使用 pnpm(monorepo 结构)。
    • 桌面端:默认可调用原生 NVIDIA CUDA / Apple Metal(通过 candle 项目),无需复杂依赖。
    • 移动端:使用 Capacitor(需 iOS 设备 / 模拟器)。
    • 浏览器:任意现代浏览器即可体验(PWA,已支持移动设备)。

    快速安装(普通用户)

    # Windows (winget)
    winget install MoeruAI.AIRI
    
    # 或 Scoop
    scoop bucket add airi https://github.com/moeru-ai/airi
    scoop install airi/airi
    
    # macOS (Homebrew)
    brew install --cask airi
    
    # Linux (Nix,需启用 flakes)
    nix run github:moeru-ai/airi
    
    # 不想安装?直接浏览器打开在线版
    # https://airi.moeru.ai

    AIRI 跨平台下载方式

    开发者从源码运行

    git clone https://github.com/moeru-ai/airi
    cd airi && pnpm i
    pnpm dev             # Web 版
    pnpm dev:tamagotchi # 桌面版

    核心功能

    • 实时语音交互(耳朵 + 嘴巴):客户端语音识别 + 说话人检测(VAD),配合 ElevenLabs / Azure Speech / OpenAI TTS / 阿里云 / 本地 Kokoro 等多供应商语音合成,对话延迟低、可离线运行。
    • 虚拟形象驱动(身体):支持 VRM 3D 模型与 Live2D 模型,自动眨眼、视线追踪、空闲眼动等动画,让 AI「活」在屏幕上。
    • 本地优先推理:基于 WebGPU 的浏览器内本地 LLM 推理,无需把数据发往外部服务器,隐私更有保障。
    • 游戏与记忆能力:可操控 Minecraft 游玩,Factorio 支持开发中(已有 PoC);内置 DuckDB WASM / pglite 浏览器内数据库与记忆系统(Alaya,开发中),让伴侣「记得你」。
    • 跨平台与集成:Web / 桌面(Win / macOS / Linux,桌面端走原生 CUDA / Metal 加速)/ 移动 PWA 全覆盖;支持 Telegram、Discord 聊天接入。

    典型使用场景

    1. 虚拟主播(VTuber):实时语音聊天、玩游戏、与观众互动,灵感直接来自 Neuro-sama,可作为直播 / 互动娱乐的数字人。
    2. 随身赛博伴侣:在手机、桌面、浏览器上随时拥有一个有形象、能聊天的专属电子宠物 / AI 朋友。
    3. 本地隐私 AI 助手:借助 WebGPU 本地推理在完全离线环境下运行 LLM,适合对数据隐私敏感的用户。

    推荐理由

    AIRI 是目前开源领域把「LLM + 实时语音 + 虚拟形象 + 游戏能力」整合得最完整、也最「有生命力」的项目之一。它完全自托管、可本地运行,技术栈现代(WebGPU / VRM / Live2D),跨平台覆盖到位,社区活跃(42K+ Stars、4.2K+ Forks,MIT 许可)。如果你一直好奇 Neuro-sama 是怎么「炼成」的,或者想拥有一个真正属于自己的、能聊天能陪玩的数字人,AIRI 值得一试。

    下载地址

  • OpenCut —— 开源版剪映,免费且隐私优先的跨平台视频编辑器

    OpenCut —— 开源版剪映,免费且隐私优先的跨平台视频编辑器

    OpenCut 开源视频编辑器

    项目简介

    OpenCut 是一个免费、开源的跨平台视频编辑器(Web / 桌面 / 移动端),被社区称为「开源版 CapCut(剪映)」。它采用 Rust 核心 + TypeScript 构建,主打隐私优先、永久免费、简单易用三大特性,目标是把剪映里越来越多被塞进付费墙的基础剪辑功能,重新免费、开放地还给创作者。

    安装要求和过程

    环境要求

    • 普通用户:无需安装,直接用浏览器打开官网 opencut.app 即可在线剪辑。
    • 本地开发 / 自托管:需要 Bun 运行时,以及 Docker + Docker Compose(用于本地数据库与 Redis)。
    • 核心贡献者(可选):需要 Rust 工具链与 wasm-pack,用于本地构建 GPU 合成器 / 特效 / 遮罩的 WASM 核心。

    快速开始(在线使用,零安装)

    # 直接打开官网,浏览器内即可剪辑导出
    https://opencut.app

    本地开发(贡献者)

    # 1. 安装工具链管理器 proto
    bash <(curl -fsSL https://moonrepo.dev/install/proto.sh)
    # 2. 进入仓库,安装锁定版本工具
    proto use
    # 3. 启动各端开发服务器
    moon run web:dev       # Web 端  → http://localhost:5173
    moon run api:dev       # API 端  → http://localhost:8787
    moon run desktop:dev   # 桌面端(见 apps/desktop/README.md)

    私有化自托管(Docker 全家桶)

    # 一条命令跑起完整生产环境(含应用构建)
    docker compose up -d
    # 访问 http://localhost:3100

    ⚠️ 状态说明:主仓库 OpenCut-app/OpenCut 正在用 Rust 核心「从零重写」,官网现网 opencut.app 当前跑的是稳定可用的经典版opencut-app/opencut-classic)。日常剪辑直接上官网即可;想私有化部署可参考经典版 README 的 Bun + Docker 流程。

    核心功能

    OpenCut 编辑器界面

    1. 隐私优先,视频不上云:所有素材与工程默认保存在本地设备,不强制上传云端,从源头规避隐私泄露焦虑。
    2. 免费开放,剪映付费功能免费用:时间线剪辑、字幕、转场、特效等基础能力全部免费,没有弹窗付费墙。
    3. 跨平台一致体验:一套 Rust 核心代码同时驱动 Web、桌面(GPUI)与移动端,渲染 / 特效 / 遮罩由 GPU 合成器处理,性能更优。
    4. 面向 AI 时代:内置 MCP Server 供 AI 智能体直接调用,支持 无头(Headless)模式做批量渲染与自动化,并集成 fal.ai 的生成式图像 / 视频 / 音频模型。
    5. 插件优先 + 脚本面板:重写版提供 Editor API、一等公民的第三方插件,以及编辑器内脚本标签,可玩性与扩展性强。

    典型使用场景

    • 短视频创作者:被剪映付费墙劝退的 Vlog / 抖音 / YouTube 创作者,可直接在浏览器里完成剪辑与导出,零成本起步。
    • 隐私敏感团队 / 个人:医疗、法务、企业内部视频等素材不出本地设备的场景,OpenCut 的本地优先架构天然契合。
    • 开发者与 AI 工作流:通过 MCP Server 让编程助手自动生成 / 批量渲染视频,或用脚本标签把重复剪辑流程自动化。

    推荐理由

    作为一个常年和视频打交道的人,剪映把「关键帧」「智能抠图」等越来越多基础功能塞进付费墙的操作,确实越来越劝退。OpenCut 把「免费 + 开源 + 隐私」三件事做得很扎实,GitHub 上 7 万+ Star 也证明这不是噱头,而是真实需求。它当前处于 Rust 核心重写期,主仓库在快速演进,而现网经典版已经能稳定剪辑。如果你想把剪辑工具私有化部署到自家服务器、或者希望素材 100% 留在本地,docker compose up -d 一条命令就能拥有属于自己的剪辑平台。对于期待 AI 自动剪辑的玩家,它的 MCP Server + 无头渲染路线也相当值得持续关注。

    OpenCut 产品路线图

    下载地址