分类: 开源项目

专注盘点全网热门人工智能开源项目,涵盖大模型、智能应用、视觉算法、工具插件等领域,搭建教程与优化思路,助力开发者低成本学习实践。

  • Graphify:把整个代码库变成 AI 可推理的知识图谱

    Graphify:把整个代码库变成 AI 可推理的知识图谱

    📌 项目简介

    Graphify 是一个开源的 AI 编程助手技能(Skill),用一条命令把你手头的代码库、SQL schema、论文 PDF、文档、截图甚至白板照片,全部解析成一张可查询的知识图谱。你的 AI 助手(Claude Code / Cursor / Codex / Gemini CLI / Aider 等 17 种)不再靠 grep 或模糊检索”猜”答案,而是沿着图谱里的真实路径推理——而且每条关系都可溯源、可审计。

    💻 安装要求和过程

    环境要求

    • Python 3.10+(解析与存储完全本地运行,无需任何服务器)
    • 任意一个支持的 AI 编程助手:Claude Code、Cursor、GitHub Copilot、OpenAI Codex、Gemini CLI、Aider 等(共 17 种),或任意 MCP 客户端
    • 联网(仅用于把文件送给你自己配置的模型,如 Claude / Ollama;代码本身不出本机)

    快速安装

    PyPI 上的包名暂时叫 graphifyy(两个 y),但命令与技能名仍然是 graphify

    pip install graphifyy
    graphify install        # 把技能注入你的 AI 助手

    然后在任意目录下打开你的 AI 助手,输入:

    /graphify .            # 对当前目录建图,代码 / 笔记 / 论文通吃

    Windows 若提示找不到命令,把 %APPDATA%\Python\Python3xx\Scripts 加入 PATH,或直接用 pipx install graphifyy;macOS 若报 externally-managed 错误同样改用 pipx 即可。

    ✨ 核心功能

    1. 全模态建图:万物皆可成节点

    支持代码(Python / TS / Go / Rust / Java / C++ 等 36 种 tree-sitter 语法)、文档(md / txt / rst)、论文 PDF,以及截图 / 流程图 / 白板照片 / 多语言文字图片(借助 Claude 视觉能力)。App 代码、数据库 schema、基础设施被统一进同一张图。

    2. 本地优先、零云端、零遥测

    解析在本地跑,图谱就是磁盘上的一个文件(graph.json),没有任何服务器在环、没有任何遥测上报。代码永远不会离开你的机器——对重视隐私和合规的团队尤其关键。

    3. 可审计的溯源:每条边都标明”怎么知道的”

    图谱里每一条关系都被打上 EXTRACTED(源码里实锤)、INFERRED(由结构与命名推理,通常靠谱但值得复核)、AMBIGUOUS(证据指向多于一方)三种标签。AI 回答时引用的是它走过的真实路径,而不是”凭感觉”。

    4. 17 个 AI 助手 + 自带 MCP Server

    一个技能可装进 17 种助手,并额外提供 MCP server:既可 stdio 单机服务,也能 HTTP 给整个团队共享。还附带 graphify prs 终端 PR 看板(CI 状态 / AI 分诊 / 合并冲突风险)。

    5. 自动同步:图谱跟着代码长

    --watch 后台实时重建(代码保存即时、文档 / 图片变化提醒你跑 --update);graphify hook install 还能装一个 git post-commit 钩子,每次提交后自动重建图谱,多 Agent 并行写码时图谱始终保持最新。

    Graphify 知识图谱可视化
    Graphify 将代码库映射为可交互知识图谱:节点=符号,颜色=自动识别的模块社区,大节点=God Node

    🎯 典型使用场景

    场景一:接手一个陌生代码库

    不用硬读 100 个文件——直接查 “god nodes”(连接度最高的符号,改动影响面最大),几分钟摸清架构与模块边界,新成员上手速度拉满。

    场景二:团队共享”谁负责什么”

    把 graph.json 提交进仓库,或用 graphify.serve 走 HTTP。新人问 “谁负责 billing?”,得到的是穿过真实代码的两条跳路径,而不是一周前的 Slack 聊天记录。

    场景三:给 AI 编程助手装”记忆”,省下海量 token

    官方基准:在 Karpathy 仓库 + 论文 + 图片的混合语料上,相比逐文件读取原始文件,每次查询 token 减少 71.5 倍;社区实测在 49.6 万 token 的代码库上省 79 倍,且零向量数据库。NOTE / WHY / HACK 注释还会变成可追查的图谱节点。

    💡 推荐理由

    我最早是被”用图谱替代 grep”这个点打动的。实际用下来,最戳我的是可审计——现在太多 RAG / 向量库方案给的是个不透明的相似度分数,你根本不知道 AI 为什么这么答;Graphify 把每条边都标了出处,你能直接点开源码第几行去验证。再加上纯本地、MIT、零账号零卡片,安全感拉满。它不算”重”的工具,装一个 skill、跑一条命令,就能让手头的 AI 编程助手从”猜”变成”走查”。如果你也受够了助手读不全代码、答非所问,值得一试。

    🔗 下载地址

  • Open WebUI:自托管、可离线运行的 AI 聊天与智能体平台

    Open WebUI:自托管、可离线运行的 AI 聊天与智能体平台

    Open WebUI 界面演示

    项目简介

    Open WebUI 是一个功能丰富、可完全离线运行的自托管 AI 平台,支持 Ollama 本地模型与 OpenAI 兼容 API,内置 RAG 检索增强、多模型对话、语音/视频通话、智能体与插件生态,是把任意大模型变成”私有 ChatGPT”的一站式前端。(GitHub ⭐ 145K+,Python,Open WebUI License)

    安装要求和过程

    环境要求:Python 3.11(pip 方式);或 Docker 20.10+(容器方式);可搭配 Ollama 本地推理,或任意 OpenAI 兼容 API Key。

    方式一 · pip 安装(最简):

    pip install open-webui
    open-webui serve   # 访问 http://localhost:8080

    方式二 · Docker 一条命令(自带 Ollama,CPU):

    docker run -d -p 3000:8080   -v ollama:/root/.ollama -v open-webui:/app/backend/data   --name open-webui --restart always   ghcr.io/open-webui/open-webui:ollama

    方式三 · 仅用 OpenAI API:

    docker run -d -p 3000:8080   -e OPENAI_API_KEY=your_secret_key   -v open-webui:/app/backend/data   --name open-webui --restart always   ghcr.io/open-webui/open-webui:main

    部署后访问 http://localhost:3000 即可使用;也支持 Docker Compose、Kubernetes(Helm/Kustomize)与 uv 安装。

    核心功能

    • 广泛的模型与 API 接入:本地 Ollama + 任意 OpenAI 兼容后端(LM Studio、Groq、OpenRouter、vLLM、Mistral 等),支持多模型并行对话、各取所长。
    • 本地 RAG 知识库:支持 9 种向量数据库与多种文档解析引擎(Tika、Docling、Mistral OCR 等),混合检索(BM25+向量)+ 重排,用 # 命令把文档/网页直接拉进对话。
    • 智能体与插件生态:Filters / Actions / Pipes / Tools / Skills 插件机制,可接 MCP、OpenAPI 工具服务器,把任意基础模型包装成专属 Agent。
    • 语音/视频通话与多模态:本地 Whisper 等 STT + 多种 TTS 引擎,内置 DALL·E / Gemini / ComfyUI 图像生成与编辑,支持网页浏览与联网搜索。
    • 企业级管理与安全:细粒度 RBAC 与用户组、LDAP / SSO / SCIM 自动配置、PostgreSQL 持久化、横向扩展与 OpenTelemetry 可观测性。

    典型使用场景

    • 个人本地 AI 助手:用 Ollama 在笔记本上跑 Llama / Mistral,全程离线、数据不出本机,配合 RAG 问答私人文档。
    • 团队自托管 AI 中台:公司内部署,接入 OpenAI 或自建 vLLM,统一账号、权限与用量审计,替代公网 SaaS,守住数据隐私。
    • 知识库问答与自动化:把 Confluence / Notion / 本地文件建索引,用智能体 + 定时自动化做日报生成、资料检索与多模型 A/B 评估。

    推荐理由

    我把 Open WebUI 当作”私有 ChatGPT 的标杆”。它最打动我的是真正的离线优先与自托管能力——所有聊天与文档数据都留在自己的机器或服务器,不依赖任何云。RAG 开箱即用,多模型对比、语音通话、插件生态一应俱全,Docker 一条命令就能跑起来,对不想把对话记录交给第三方的用户极其友好。社区极其活跃、更新频繁,是个人和中小团队落地 AI 的最低门槛选择。

    下载地址

  • Meetily:把会议转录和 AI 摘要锁在本地的隐私优先助手(24.4K Star)

    Meetily:把会议转录和 AI 摘要锁在本地的隐私优先助手(24.4K Star)

    每次开完会,最烦的不是写纪要,而是「这录音到底传去哪了」。云端会议助手很方便,但你的商业机密、病人信息、法律磋商,全进了别人家的服务器。最近在 GitHub 上刷到一个星标冲到 2.4 万+ 的项目 Meetily,它的卖点就一句话:转录和摘要 100% 在你自己电脑上跑,数据不出本机。今天把它拆给你看。

    📌 项目简介

    Meetily 是一个隐私优先的本地 AI 会议助手:实时录音转写、说话人分离、AI 生成会议纪要,全部在本地完成,零云端依赖。基于 Rust + Tauri 打包成单一桌面应用,macOS / Windows / Linux 通吃,采用 MIT 协议开源。

    Meetily 隐私优先 AI 会议助手
    Meetily:Privacy-First AI Meeting Assistant

    💻 安装要求和过程

    环境要求

    • 桌面端(推荐):macOS(Apple Silicon / Intel)、Windows 10+、Linux;无需自备 GPU,有则加速。
    • 本地 AI 模型:Whisper 或 NVIDIA Parakeet 做转写(Parakeet 官方称快 4 倍);摘要默认用本地 Ollama,也支持 Claude / Groq / OpenRouter / 任意 OpenAI 兼容端点。
    • 开发者构建:需安装 Rust 工具链 + Node.js(建议 18+) + pnpm。
    • GPU 加速:macOS 走 Metal/CoreML,Windows/Linux 走 NVIDIA CUDA 或 AMD/Intel Vulkan,构建时自动启用。

    快速安装

    Windows:到 Releases 下载最新 x64-setup.exe,双击安装即可。

    macOS:下载 meetily_0.4.0_aarch64.dmg,拖进「应用程序」文件夹后打开。

    Linux:建议从源码构建:

    git clone https://github.com/Zackriya-Solutions/meeting-minutes
    cd meeting-minutes/frontend
    pnpm install
    ./build-gpu.sh

    开发者本地跑:装好 Rust + Node 后,前端用 pnpm install && pnpm dev,后端由 Tauri 统一拉起。

    ✨ 核心功能

    1. 本地优先 / 隐私优先

    所有录音、转写文本、摘要都只存在你本机。不联云、不上传、无厂商锁定,企业可以把敏感会议完全留在自己的基础设施里。

    Meetily 本地存储与隐私设置
    所有数据留在本地,转录模型与记录均本机存储

    2. 实时转写 + 说话人分离

    用 Whisper 或 Parakeet 模型在设备端实时出稿,会议进行中就能看到逐字稿;支持说话人分离(speaker diarization),谁说了什么一目了然。

    Meetily 本地实时转写界面
    本地实时转写界面

    3. AI 驱动的会议摘要

    转写完成后一键生成摘要,AI Provider 可自选:本地 Ollama(推荐,零费用零外流)、或接入 Claude / Groq / OpenRouter / 自建 OpenAI 兼容端点。还支持导入已有录音文件重新转写。

    Meetily AI 会议摘要
    AI 生成的会议摘要

    4. 专业音频混音

    麦克风与系统声音同时采集,带智能闪避(ducking)和防削波,远端会议声音也能干净录下来,不用再担心「对方声音没录上」。

    Meetily 专业音频混音
    麦克风 + 系统音频同时采集,防削波

    5. 跨平台 + GPU 加速的轻量单包

    基于 Tauri(Rust 后端 + Next.js 前端)打包成单文件桌面应用,比 Electron 轻得多;三大桌面系统原生支持,GPU 加速开箱即用。

    🎯 典型使用场景

    • 合规敏感型企业会议:法律、医疗、军工、金融等行业,把会议内容留在内网,规避 GDPR / 数据泄露风险,满足审计与合规要求。
    • 团队与个人纪要自动化:日常站会、客户访谈、脑暴会,开完即出转写稿 + 摘要,省下整理时间,且全程不花任何 API 调用费。
    • 私有化部署的团队协同:用自建 OpenAI 兼容端点做摘要,把 Meetily 跑在公司服务器上,团队成员共享同一套本地推理基础设施。

    💡 推荐理由

    我用过一阵子,最打动我的是它的「零心理负担」:开会前不用先纠结「这段话能不能让第三方听见」。单一桌面应用安装即用,Tauri 打包体积小、启动快,Rust 后端也让人放心。转写质量在本地模型里属于第一梯队,Parakeet 确实快;摘要接 Ollama 本地跑,等于白嫖还不出户。当然它也有边界——Community 版靠本地模型,精度和高级导出、自动入会这类能力在付费 PRO 里;但社区版承诺永久免费开源,核心的本地转写 + 摘要完全够日常用。如果你在意数据主权、又想要一个不像「玩具」的会议助手,Meetily 值得放进收藏夹。

    📥 下载地址

    注:项目原名 meeting-minutes,发布与下载请认准 meeting-minutes 的 Releases 路径;仓库现已重命名为 meetily。

  • Orca:把一整支 AI 编程舰队装进一个 IDE(并行 Agent 开发环境 ADE)

    Orca:把一整支 AI 编程舰队装进一个 IDE(并行 Agent 开发环境 ADE)

    Orca 并行 worktree 界面

    如果你已经离不开 Claude Code、Codex 这类编码智能体,却苦于在一堆终端窗口里来回切换、分支互相打架,Orca 就是为这种痛而生的。它自称 “The AI Orchestrator for 100x builders”,是一个开源(MIT)的 ADE(Agent Development Environment,智能体开发环境)——和传统 IDE 不同,Orca 不是给你一个人用的,而是给你和你的”一舰队”智能体一起用的。

    项目简介

    Orca 是一款跨桌面(macOS / Windows / Linux)与移动端(iOS / Android)的 Agent IDE,让你把 Claude Code、Codex、OpenCode、Cursor、Copilot、Gemini 等任意 CLI 智能体并排运行在各自独立的 git worktree 中,统一编排、跟踪与合并,还配了一个能在手机上远程监控和发指令的伴侣 App。

    安装要求和过程

    环境要求:

    • 桌面端:macOS 11+ / Windows 10+ / 主流 Linux 发行版;
    • 需自行准备至少一个编码智能体的订阅(Claude Code、Codex、OpenCode 等任一即可);
    • 移动伴侣:iOS 16+ 或 Android 8+;
    • 无头服务器场景可选:Linux 服务器 + orca serve

    快速安装:

    1. 桌面端直接下载安装包(或用包管理器):
    # macOS (Homebrew)
    brew install --cask stablyai/orca/orca
    
    # Arch Linux (AUR)
    yay -S stably-orca-bin
    
    # 或前往 https://onorca.dev/download 下载 dmg / exe / AppImage
    
    1. 打开 Orca,登录你的智能体订阅账号,新建 Workspace;
    2. (可选)手机安装 Orca 伴侣 App,扫码与桌面端配对;
    3. (可选)无头服务器:orca serve 启动远程 worktree 服务。

    核心功能

    • 并行 Worktrees:一条提示可扇出到 5 个智能体,各自在隔离的 git worktree 中独立干活,互不干扰,你只需对比结果、合并最优解——告别 stash 与分支打架。
    • 终端分屏:内置 Ghostty 级终端,WebGL 渲染、无限分屏、重启后滚动历史不丢,还支持全文搜索。
    • 设计模式(Design Mode):每个 worktree 附带真实 Chromium 窗口,点击任意 UI 元素即可把它的 HTML、CSS 和裁剪截图直接送进智能体提示,做前端迭代超顺手。
    • GitHub & Linear 原生集成:应用内浏览 PR、issue 和项目看板,从任务直接开 worktree 审查、合并,无需切上下文。
    • 移动伴侣:手机端实时看智能体状态、查用量、切换账号,智能体跑完推送通知,离开工位也能续命。

    Orca 终端分屏

    Orca Design Mode

    典型使用场景

    • 同一需求多智能体赛马:把”修复登录竞态”同时丢给 Claude Code 和 Codex,各自在独立 worktree 实现,再挑实现更干净的合并,质量与速度双增。
    • 远程算力 + 本地轻量:在强劲的云服务器上跑 orca serve,本地笔记本只做轻量操作,SSH worktree 自动重连、端口转发,CI 跑挂了也能随时续。
    • 通勤中远程续命:智能体在桌面端跑长任务,你在地铁上用手机伴侣看进度、发现走偏了直接发一句纠正指令,到家正好收工。

    推荐理由

    我自己的体感是:当你的工作流里同时养了 2 个以上编码智能体,纯终端 + tmux 的管理成本会指数上升——分支冲突、上下文丢失、账号切换最磨人。Orca 把”并行隔离 + 统一编排 + 移动可观测”这三件事打包成一个干净的应用,而且开源 MIT、自带 Ghostty 级终端和真实浏览器,比那些只包一层终端的 wrapper 完整太多。它不绑定任何一家模型厂商, bring-your-own-subscription 的思路也让成本可控。唯一门槛是它更偏”重环境”,轻度用户用终端就够了;但只要你开始”以舰队为单位”写代码,Orca 几乎是必装。

    下载地址

  • herdr:住在终端里的 AI 智能体复用器,像 tmux 一样并行调度多个编程 Agent

    herdr:住在终端里的 AI 智能体复用器,像 tmux 一样并行调度多个编程 Agent

    herdr 终端演示

    herdr 是一个「住在你终端里的智能体复用器(agent multiplexer)」——它让你像 tmux 管理多窗口那样,在同一个终端里同时监督、调度和并行运行 Claude Code、Codex、Copilot、Gemini CLI 等多个 AI 编程智能体,全部以真实终端视图呈现,随时脱离(detach)与重新接入(reattach)。

    项目简介

    herdr 是用 Rust 写的单文件二进制工具,定位是「AI 编程智能体的终端调度台」。当你的工作流里同时跑着好几个编码 Agent,herdr 帮你把它们收进一个分屏会话里统一管理:谁在干活、谁卡住了、谁完成了,一眼看清;你离开后智能体继续跑,回来在任意终端(甚至 ssh)重新接入就能接着看。

    安装要求和过程

    环境要求

    • 任意现代终端(macOS / Linux 已稳定,Windows 为 beta 版);
    • 无需运行时依赖,单个 Rust 二进制,无 Electron,不占内存;
    • 可选:Homebrew、mise 等包管理器;源码编译需 Rust 工具链(cargo)。

    快速安装

    一行安装脚本(推荐):

    curl -fsSL https://herdr.dev/install.sh | sh

    其他安装方式:

    # Homebrew
    brew install herdr
    
    # mise
    mise use -g herdr
    
    # Windows (beta)
    powershell -ExecutionPolicy Bypass -c "irm https://herdr.dev/install.ps1 | iex"
    
    # 源码编译
    git clone https://github.com/ogulcancelik/herdr
    cd herdr
    cargo build --release

    在代码目录直接启动:

    herdr          # 启动,在代码所在目录运行
    ctrl+b q       # 脱离会话(agents 继续跑)
    herdr          # 任意终端重新接入

    核心功能

    1. 一眼掌控所有智能体:每个 Agent 的状态(blocked / working / done)一目了然,呈现的是真实终端视图,而不是被二次包装过的「解读」。
    2. 脱离后智能体继续跑:会话 detach 后进程不中断,可在任意终端或 ssh 上重新接入,甚至终端/机器重启后会话依然存活。
    3. 智能体也能用 herdr:提供纯 socket API,Agent 可以自己创建 pane、读取输出、互相等待,官方还给了 agent skill,让多智能体流水线成为可能。
    4. 键鼠都是一等公民:既支持 tmux 式前缀键(ctrl+b),也支持鼠标点击、拖拽、分屏,按当下场景自由切换,不被工具绑架。
    5. 插件可扩展:通过插件扩展 pane 与工作流,官方有插件市场,可按需装配能力。
    6. 单 Rust 二进制、无 Electron:跑在你已有的终端里,启动飞快、资源占用极低。

    典型使用场景

    1. 并行跑多个编程智能体
    同时开 Claude Code、Codex、Gemini CLI,分屏对照各自进度,省去在多个窗口之间反复切换、对不上上下文的麻烦。

    2. 远程 / 无人值守跑长任务
    在本地 detach,ssh 到服务器后执行 herdr 重新接入看结果,CI 长任务、 overnight 构建不占用本地终端,进程也不怕断线。

    3. 智能体互相编排
    让一个 Agent 通过 socket API 拉起子 Agent、等它产出再继续,把多智能体协作沉淀成可复用的流水线,而不是手动粘贴上下文。

    推荐理由

    现在工程师同时用两三个 AI 编程助手已是常态,但窗口一多就乱、上下文对不上、离开后任务状态无从追踪。herdr 把「多智能体并行调度」做成了一个趁手的终端工具——不像套壳 IDE 那样笨重,Rust 单二进制启动飞快,detach/reattach + ssh 重新接入这个能力对经常远程看进度的人尤其实用。项目 AGPL-3.0 开源、文档齐全(quick start / concepts / agents / plugins / socket api 一应俱全),如果你已经在 tmux 和多个编码 Agent 之间反复横跳,值得一试。

    下载地址

  • Next AI Draw.io:用自然语言一句话生成 draw.io 架构图的 AI 绘图神器

    Next AI Draw.io:用自然语言一句话生成 draw.io 架构图的 AI 绘图神器

    还在为画架构图、流程图熬夜对峙 draw.io?Next AI Draw.io 让你用一句话描述需求,AI 就直接生成、修改并渲染出标准的 draw.io 图表——支持 RAG 架构、云架构(AWS/Azure/GCP)、认证流程、甚至”会动的” Transformer 连接线。

    📌 项目简介

    Next AI Draw.io 是一个基于 Next.js 的开源 Web 应用,把大语言模型(LLM)与 draw.io 深度结合,让你通过自然语言命令创建、修改和增强专业图表——”Chat, Draw, Visualize” 三者合一。

    🖼️ 效果一览(原项目示例)

    下面是项目 README 中的真实生成效果,输入只是几句提示词:

    RAG 架构图示例
    提示词:为聊天应用生成 RAG 架构图,数据入采用连通图
    React + AWS 认证架构图
    提示词:用 React + AWS(Serverless)生成认证流程
    Transformer 架构动画连线
    提示词:用动画连线展示 Transformer 架构

    ⚙️ 安装要求与过程

    环境要求

    • Node.js 18+(项目基于 Next.js 16.x / React 19.x)
    • 包管理器:npm(或 pnpm/yarn)
    • 大模型 API Key:默认走 AWS Bedrock,也支持 OpenAI / Anthropic / Google / DeepSeek / Ollama 等 15+ .provider;可自带 Key,也可由管理员配置服务端模型
    • 推荐模型:Claude Sonnet 4.5、GPT-5.1、Gemini 3 Pro、DeepSeek V3.2/R1(需强长文本+严格格式能力来生成 draw.io XML)

    快速安装(本地开发)

    # 1. 克隆仓库
    git clone https://github.com/DayuanJiang/next-ai-draw-io
    cd next-ai-draw-io
    
    # 2. 安装依赖并配置环境变量
    npm install
    cp env.example .env.local
    
    # 3. 启动开发服务器
    npm run dev
    
    # 4. 浏览器打开 http://localhost:6002

    不想装?直接访问官方在线 Demo next-ai-drawio.jiang.jp,或下载 Windows / macOS / Linux 桌面端(Releases 页),也能一键部署到 EdgeOne Pages / Vercel / Cloudflare Workers。

    ✨ 核心功能

    • 自然语言生成与编辑:用中文/英文命令直接创建、修改 draw.io 图表,AI 输出标准 XML 并实时渲染。
    • 图片 / PDF / 文本复用:上传已有草图、截图、PDF 或文档,AI 自动”仿绘+增强”成规范图表。
    • 云架构图专精:内置 AWS、Azure、GCP 等云厂商图标,生成云原生/Serverless 架构图尤其拿手(Claude 系列对云图标训练充分)。
    • AI 推理过程可见 + 版本历史:可查看模型思考链路,并对每次编辑前的版本做版本控制、随时回滚。
    • 动画连线 & MCP 服务:支持”会动”的连接线提升表达力;并提供 MCP Server,让 Claude Desktop / Cursor / VS Code 等 Agent 也能调用它画图。

    🎯 典型使用场景

    1. 技术方案评审 & 架构设计:架构师口述”用 React + AWS 做认证流程”,秒出 Serverless 架构图,评审会直接拿去讨论,省去手拖元件的半天。
    2. 知识沉淀与教学:把 Henry Chesbrough 开放式创新模型、RAG 数据流等抽象概念,用一句提示词变成可读可视化的示意图,写文档、做 PPT 事半功倍。
    3. AI Agent 自动化出图:在 Claude Code / Cursor 里装好 MCP,让编码 Agent 边写代码边自动产出”用户登录 + MFA + 会话管理”流程图,图直接实时出现在浏览器。

    💡 推荐理由

    我自己最吃它的”零摩擦”:打开网页、打一句话,图就出来了——对不擅长画图、或只想快点把脑子里的结构固定下来的人太友好了。它不像某些”AI 画图”只给不可编辑的图片,Next AI Draw.io 产出的是标准 draw.io XML,可继续在 draw.io 里精修,这点对工程场景很重要。多 Provider 支持 + 可自带 Key + 服务端模型配置,部署灵活;搭配 MCP 还能塞进 Agent 工作流。缺点是要出高质量云架构图对模型有要求(建议 Claude/GPT-5/Gemini 档位),弱模型偶尔 XML 会错位。总体 33K+ Star、Apache-2.0 协议,值得一试。

    📥 下载地址

  • Matt Pocock’s Skills:给真工程师用的 AI 编程 Skill 合集(167K★,MIT)

    Matt Pocock’s Skills:给真工程师用的 AI 编程 Skill 合集(167K★,MIT)

    Matt Pocock Skills

    AI 编程助手很强,但常常「生成很强、理解很弱」——需求没对齐就开干、跑不通就乱试、代码越写越乱。Matt Pocock’s Skills 是 Total TypeScript 作者、TypeScript 圈大佬 Matt Pocock 把自己 .claude 目录里每天在用的工程技能开源出来的合集:不接管你的流程,而是把真实工程纪律封装成一组足够小、可改造、可组合的 Skill。

    一、项目简介

    Matt Pocock’s Skills 是一套面向「真工程师」的 AI 编程 Agent 技能库(Skills for Real Engineers),源自作者每天都在用的 .claude 配置,用几十个可组合的小技能把需求对齐、TDD、结构化调试、架构治理等工程纪律固化下来,而不是像 GSD/BMAD/Spec-Kit 那样「接管整个开发流程」。

    二、安装要求和过程

    环境要求

    • 任意支持 Agent Skills 标准的编程智能体:Claude Code、Codex、Gemini CLI、Cursor 等(skills.sh 安装器可覆盖 70+ Agent)
    • Node.js 环境(用于 npx 一键安装)
    • 零运行时依赖:纯 Markdown + Shell 技能,MIT 协议

    快速安装

    # 一行安装(从 skills.sh 拉取并按提示选择技能)
    npx skills@latest add mattpocock/skills
    
    # 或在 Claude Code 中使用 plugin marketplace 添加
    # 安装后即可用 /ask-matt 跳转开始

    三、核心功能

    1. 小而可组合的设计哲学:每个 Skill 都小到能读懂、能改、能删;不接管流程,把决策权留给人,避免重型框架的“流程自身出 bug 难查”。
    2. Grilling 柚问式访谈:动手前先对齐需求(/grill-me/grill-with-docs 会更新 CONTEXT.md 与 ADR),根治“Agent 没做你想要的事”。
    3. TDD + 结构化调试:把红绿重构和诊断纪律封装成可复用技能(/tdd/diagnose),让代码做出来就能跑。
    4. 共享语言与架构治理:通过 CONTEXT.md / ADR 建立团队共享术语,/improve-codebase-architecture 生成可视化 HTML 架构报告。
    5. 标准化、跨工具:遵循开放的 Agent Skills 标准,技能按调用方式分为 User-invoked(人工触发)与 Model-invoked(Agent 自动调用),通用于各编程智能体。

    四、典型使用场景

    • 新功能前需求对齐:用 /grill-me 把模糊想法柚问成清晰需求,再用 /to-issues 拆成工单、/to-prd 产出产品需氛文档,防止 Agent 跑偏。
    • 遇到诡异 Bug:不让 Agent 乱试,用 /diagnose 走结构化调试法,逐步定位根因。
    • 持续保持代码健康:编码时让 Agent 自动调用 /tdd 保持测试驱动,随时用 /improve-codebase-architecture 给代码层做体检并生成可视化报告。

    五、推荐理由

    我个人非常吃这套“真工程”路线。现在大量 Agent 框架走的是“接管流程”,一上来就把你的控制权收走,流程本身出了 bug 还难查。mattpocock/skills 反道而行:技能够小、够透明,你能读懂、能改、能删,把理解的过程交还给人和 Agent 之间的对话。对于已经有本地 Skill 体系的团队,它最适合的定位不是“替换”,而是“增强”。尤其推荐给被 Vibe Coding 耗到的同学——它是真正的 Real Engineering 和随便写代码之间的分野。

    六、下载地址

    文章配图来源:项目官方仓库 / Total TypeScript Cloudinary。本文由自动化任务采集整理,转载请注明出处。

  • codebase-memory-mcp:给 AI 编程助手装上「代码记忆」的知识图谱引擎(30.7K Star)

    codebase-memory-mcp:给 AI 编程助手装上「代码记忆」的知识图谱引擎(30.7K Star)

    codebase-memory-mcp 3D 知识图谱可视化

    项目简介

    codebase-memory-mcp 是 DeusData 开源的高性能「代码智能」MCP 服务器。它把整个代码库预先解析成一张持久化的知识图谱,让 Claude Code、Cursor、Codex 等 AI 编程智能体通过结构化查询(而非逐文件读取)来理解代码——平均仓库毫秒级建图、查询亚毫秒返回,官方论文实测可节省约 99% 的 token 消耗。纯 C 实现、单静态二进制、零运行时依赖、100% 本地运行。

    安装要求和过程

    环境要求

    • 操作系统:macOS(Apple Silicon / Intel)、Linux(x86_64 / ARM64)、Windows(x86_64)
    • 无需 Docker、无需运行时、无需 API Key
    • 零依赖:单静态二进制,运行时无任何外部依赖,下载即可运行
    • 可选的 3D 可视化 UI 需浏览器访问 localhost:9749

    快速安装

    macOS / Linux 一行安装(默认无 UI):

    curl -fsSL https://raw.githubusercontent.com/DeusData/codebase-memory-mcp/main/install.sh | bash

    带 3D 可视化界面:

    curl -fsSL https://raw.githubusercontent.com/DeusData/codebase-memory-mcp/main/install.sh | bash -s -- --ui

    Windows(PowerShell):下载 install.ps1 后执行 Unblock-File .\install.ps1 再运行 .\install.ps1

    也可通过 npm / PyPI / Homebrew / Scoop / Winget / Chocolatey / AUR 安装。安装脚本会自动探测并写入 11 种 AI Agent 的 MCP 配置(Claude Code、Codex、Gemini CLI、Zed、Cursor、VS Code、Aider、Kiro 等),重启 Agent 即生效。

    核心功能

    1. 毫秒级代码建图

    采用 RAM 优先管道(LZ4 压缩 + 内存 SQLite),平均仓库毫秒级全量索引,Linux 内核(2800 万行 / 7.5 万文件)仅需 3 分钟,索引完成后释放内存,不长期占用资源。

    2. 158 种语言 + Hybrid LSP 语义解析

    内置 tree-sitter 语法覆盖 158 种语言,并对 Python / TypeScript / Go / Rust / C# / Java 等 11 种语言叠加 Hybrid LSP 语义类型解析,生成函数、类、调用链、HTTP 路由、跨服务链接等实体与关系组成的知识图谱。

    3. 14 个 MCP 工具

    涵盖索引类(index_repository / list_projects / delete_project / index_status)与查询分析类(search_graph / trace_path / query_graph / get_architecture / detect_changes / search_code / manage_adr 等),覆盖搜索、调用链追踪、架构概览、改动影响面分析、死代码检测。

    4. 节省约 99% token

    5 次结构化查询约 3,400 token,而逐文件搜索约 412,000 token,省下约 120 倍;一次图查询即可替代数十次 grep / read 循环,大幅缓解大仓库的上下文窗口焦虑。

    5. 11 种 Agent 一键接入 + 3D 图可视化

    install 自动探测配置 Claude Code / Codex / Gemini CLI / Zed / Cursor / VS Code / Aider / Kiro 等 11 种 Agent;可选 UI 变体在 localhost:9749 提供交互式 3D 知识图谱浏览,直观查看调用关系与代码结构。

    典型使用场景

    1. 大型代码库”秒懂”

    在 5 万行以上的项目上,让 Claude Code 通过 get_architecture 一次拿到语言 / 包 / 路由 / 热点概览;问”谁调用了 ProcessOrder?”,由 trace_path 直接返回完整调用链,无需反复读取文件。

    2. 改动影响面分析

    提交前运行 detect_changes,把 git diff 映射到具体符号并做风险分级,提前知道”改这个函数会波及哪些模块”,避免误删、误改导致线上故障。

    3. 团队共享代码记忆

    .codebase-memory/graph.db.zst 压缩快照提交到 git,团队成员 clone 后免重复索引;新人也能立刻获得全局结构认知,降低上手成本。

    推荐理由

    作为重度使用 Claude Code 的开发者,这个项目最打动我的是“把上下文探索从每次重新读文件,变成查询持久化图谱”的思路。在 2800 万行的 Linux 内核上 3 分钟建完索引、查询亚毫秒返回,意味着 AI 助手不再因为上下文窗口焦虑而反复 grep、read,token 成本直接砍掉 99%。纯 C 单二进制、零依赖、100% 本地运行(代码不出机器)也是加分项,对个人隐私和多语言大型仓库非常友好。

    一点小提醒:目前纯 C 实现对新语言的语义解析仍有分级(函数式语言如 OCaml / Haskell 解析度 <75%),且安装后需要重启 Agent 才能生效配置;但它已经是 AI 编程工作流里”装上就不想卸”的基础设施级工具。

    下载地址

  • Strix:让 AI 当黑客,自动找出并修复你应用的真实漏洞(40.8K Stars)

    Strix:让 AI 当黑客,自动找出并修复你应用的真实漏洞(40.8K Stars)

    Strix 封面

    一句话先说清楚:Strix 是一个开源的自主 AI 渗透测试智能体(Autonomous AI Pentesting Agents)。它不像传统扫描器那样丢给你一堆“可能存在风险”的噪音告警,而是真的会动态跑起你的代码、模拟攻击者思维去打、再用可验证的 PoC 证明漏洞确实存在——最后还顺手把补丁和报告给你写了。

    项目简介

    usestrix/strix,Apache-2.0 协议,纯 Python 写就,目前在 GitHub 上已经 4 万+ Stars,连续多周霸榜 Trending。它的定位很直白:把“请安全公司做一次渗透测试”这件事,从“几万块、等几周”,变成“一条命令、几分钟”。它支持本地代码库、GitHub 仓库、线上应用三种目标模式,也能多目标并行扫描。

    安装要求和过程

    Strix 的依赖极其克制,你只需要两样东西:

    • 一个正在运行的 Docker(首次运行自动拉取沙箱镜像,把攻击行为关在隔离环境里);
    • 一个任意主流 LLM 的 API Key(OpenAI / Anthropic / Google 都行,底层走 LiteLLM)。

    安装就一行:

    curl -sSL https://strix.ai/install | bash

    配置好供应商和目标,开跑:

    export STRIX_LLM="openai/gpt-5.4"
    export LLM_API_KEY="your-api-key"
    strix --target ./app-directory

    首次运行会自动拉取沙箱 Docker 镜像,结果全部落进 strix_runs/<run-name>。如果你是 Windows,注意它本质是个 Python 包 + Docker,建议走 WSL2,别在原生 CMD 里硬刚。

    核心功能

    1. 真实漏洞验证,拒绝误报——这是它和传统扫描器最大的区别。Strix 会实际构造攻击载荷、命中、再生成可复现的 PoC 代码,只报“已被验证”的漏洞。传统工具 60-80% 的误报率,在这里被砍掉了。

    2. 多智能体协同的“红队”——侦察 Agent 画攻击面地图,注入测试 Agent 专攻 SQL/命令注入,权限提升 Agent 测越权与认证绕过,前端 Agent 查 XSS/CSRF。它们并行工作、互相共享线索,像一支真实的安全团队。

    3. 覆盖 OWASP Top 10 全栈——越权、注入、服务端/客户端攻击、业务逻辑缺陷、认证与会话、基础设施/云、API 安全,一锅端。

    4. 自动修复 + 合规报告——不光告诉你哪儿漏了,还生成补丁和合规报告。开发者优先的 CLI,每条发现都带修复指导。

    5. 代理式工具箱——内置 HTTP 拦截代理(Caido)、浏览器利用、Shell 执行、自定义利用运行时、侦察/OSINT、静态/动态分析、漏洞知识库。

    典型使用场景

    场景一:开发流程里的“安全卡点”
    把 Strix 接进 CI/CD。每次 PR 合并前跑一遍 strix -n --target ./ --scan-mode quick,上线前自动兜底。这是它最实用的姿势——让安全从“上线后救火”变成“开发时拦截”,修复成本直接降一个数量级。

    Strix 演示截图

    场景二:Bug Bounty 自动化
    独立安全研究员用它批量扫目标、自动出 PoC。配合 --target-list ./targets.txt 多目标并行,把重复劳动交给 AI,自己专注高价值的逻辑漏洞挖掘。

    场景三:黑盒 Web 应用快速体检
    strix --target https://your-app.com,通过 --instruction 给自然语言指令(比如“用 user:pass 做认证测试”),AI 会像红队一样从外往里打,几分钟出一份带证据的安全评估。

    推荐理由

    我挺吃 Strix 这套“用 AI 模拟真实黑客”的思路。过去做安全,要么花钱请人、要么自己扛一堆误报告警大海捞针。Strix 把“验证”这件事做在了前面——它不拿签名库糊弄你,而是真跑、真打、真证明。多智能体架构也比单 Agent 更像人,侦察-利用-后利用的链条能自动衔接。

    当然,也得泼盆冷水:它目前还很“Alpha”,社区里有资深安全研究员指出它的提示模板还偏基础,跟顶级商业工具比仍有差距;AI 的扫描结果必须人工复核,且绝对不能拿去打未授权目标。但作为开发自测、CI 卡点和学习红队思维的开源玩具,它已经足够香,而且免费、可商用(Apache-2.0)。

    ⚠️ 安全声明:Strix 仅可用于你拥有授权的目标。运行前务必隔离环境,防止模型抽风导致密钥或数据泄露。

    下载地址

  • OpenMontage:把 AI 编程助手变成「全自动视频制片厂」的开源智能体系统(37.4K★)

    OpenMontage:把 AI 编程助手变成「全自动视频制片厂」的开源智能体系统(37.4K★)

    OpenMontage 是全球首个开源的「智能体驱动(agentic)视频生产系统」,用 12 条生产流水线、52 个工具和 500+ 智能体技能,把 Claude Code / Cursor / Copilot 等 AI 编程助手直接变成一间完整的视频制片厂。

    项目简介

    一句话:把你的 AI 编程助手变成一间全自动视频制片厂。你只需用自然语言描述想法,OpenMontage 的流水线就会自动完成联网调研、脚本撰写、素材检索/生成、剪辑合成与质量自检,端到端产出成片。零付费 API Key 也能跑通完整链路。

    安装要求和过程

    环境要求

    • Python 3.10+(python.org 下载)
    • Node.js 18+(nodejs.org 下载)
    • 系统安装 FFmpeg(brew install ffmpeg / sudo apt install ffmpeg)
    • 一个能读取文件并运行代码的 AI 编程助手:Claude Code、Cursor、Copilot、Windsurf 或 Codex 任一即可
    • 可选 GPU:用于本地免费视频生成(make install-gpu,支持 wan2.1-1.3b 等模型)
    • API Key 全部可选:不付费也能出片,付费图像/视频商仅用于更高画质

    快速安装

    标准流程(需 make):

    git clone https://github.com/calesthio/OpenMontage.git
    cd OpenMontage
    make setup

    随后在 AI 编程助手中打开项目,输入需求即可,例如:

    "Make a 60-second animated explainer about how neural networks learn"

    无 make 环境可手动建虚拟环境(README 提供 macOS/Linux 与 Windows PowerShell 两套命令):

    python3 -m venv .venv
    source .venv/bin/activate
    pip install -r requirements.txt
    cd remotion-composer && npm install && cd ..
    pip install piper-tts
    cp .env.example .env

    make setup 后已自带 Piper 本地 TTS、Archive.org / NASA / Wikimedia 开放素材、Pexels / Unsplash / Pixabay、Remotion、HyperFrames、FFmpeg 与内置字幕。

    核心功能

    1. 端到端生产流水线:12 条预置流水线(科普解说、口播、纪录片混剪等),统一走 research → proposal → script → scene_plan → assets → edit → compose 七个阶段。
    2. 真实素材纪录片制作:无需付费视频模型,从 Archive.org / NASA / Wikimedia 等开放素材库语义检索并剪辑成片,而非仅仅把静态图做成动画。
    3. 参考驱动创作:贴一个你喜欢的视频,智能体会分析其节奏与钩子,生成差异化的制作方案(保留手法、替换主题)。
    4. 内置实时联网调研:写脚本前自动跑 15–25+ 次跨 YouTube / Reddit / 新闻 / 学术源的搜索,用真实数据支撑内容。
    5. 生产级质量门禁与预算治理:人工审批门、预合成验证、渲染后自检(ffprobe 抽帧 + 音频分析)、7 维打分选商、成本预估与上限(默认总预算 $10)。

    Backlot 制作工作台

    OpenMontage 内置 Backlot 可视化工作台,覆盖实时看板、故事板与素材库,让自然语言需求落到可逐帧审阅的制作流程:

    Backlot 实时制作看板(board-live)
    Backlot 实时制作看板(board-live)
    Backlot 故事板(storyboard)
    Backlot 故事板(storyboard)
    Backlot 素材库(library)
    Backlot 素材库(library)

    典型使用场景

    • 零 Key 科普 / 教学短片:一句 "Make a 45-second animated explainer about why the sky is blue" 即可生成带解说与字幕的动画片。
    • 免费真实素材纪录片:如 "Make a 90-second documentary montage about what a city feels like at 4am. Use real footage only",直接调用开放素材库剪辑,零成本成片。
    • 商业预告片(配置图像/视频商后约 $1–$3):科幻概念预告片、产品发布 Teaser 等;已展示案例成本最低 $0.02、最高数美元(如 Kling v3 成片 $1.33)。

    推荐理由

    OpenMontage 最打动我的是它把「做视频」从专业软件的高门槛,解放成一句自然语言需求。三点尤其值得一试:

    • 零 Key 也能跑通全链路:本地 Piper TTS + 开放素材 + Remotion 合成,对想低成本试水 AI 视频的人极友好。
    • 架构清爽、可扩展tools/ + pipeline_defs/ + skills/ 三层知识架构,可以自己加技能 / 工具;AGPL-3.0 开源、可自托管。
    • 内容有真实出处:「参考驱动 + 联网调研」让脚本不像纯生成那样空洞,预算门禁也让人敢放心把任务交给智能体跑。

    个人体会:第一次用 "Make a 60-second animated explainer about how neural networks learn" 跑通时,最惊艳的是它真的会先去查资料再写脚本——出来的东西有依据、有节奏,而不是随机拼接的炫技片段。

    下载地址