标签: AI开源项目

  • OpenMontage:把 AI 编程助手变成「全自动视频制片厂」的开源智能体系统(37.4K★)

    OpenMontage:把 AI 编程助手变成「全自动视频制片厂」的开源智能体系统(37.4K★)

    OpenMontage 是全球首个开源的「智能体驱动(agentic)视频生产系统」,用 12 条生产流水线、52 个工具和 500+ 智能体技能,把 Claude Code / Cursor / Copilot 等 AI 编程助手直接变成一间完整的视频制片厂。

    项目简介

    一句话:把你的 AI 编程助手变成一间全自动视频制片厂。你只需用自然语言描述想法,OpenMontage 的流水线就会自动完成联网调研、脚本撰写、素材检索/生成、剪辑合成与质量自检,端到端产出成片。零付费 API Key 也能跑通完整链路。

    安装要求和过程

    环境要求

    • Python 3.10+(python.org 下载)
    • Node.js 18+(nodejs.org 下载)
    • 系统安装 FFmpeg(brew install ffmpeg / sudo apt install ffmpeg)
    • 一个能读取文件并运行代码的 AI 编程助手:Claude Code、Cursor、Copilot、Windsurf 或 Codex 任一即可
    • 可选 GPU:用于本地免费视频生成(make install-gpu,支持 wan2.1-1.3b 等模型)
    • API Key 全部可选:不付费也能出片,付费图像/视频商仅用于更高画质

    快速安装

    标准流程(需 make):

    git clone https://github.com/calesthio/OpenMontage.git
    cd OpenMontage
    make setup

    随后在 AI 编程助手中打开项目,输入需求即可,例如:

    "Make a 60-second animated explainer about how neural networks learn"

    无 make 环境可手动建虚拟环境(README 提供 macOS/Linux 与 Windows PowerShell 两套命令):

    python3 -m venv .venv
    source .venv/bin/activate
    pip install -r requirements.txt
    cd remotion-composer && npm install && cd ..
    pip install piper-tts
    cp .env.example .env

    make setup 后已自带 Piper 本地 TTS、Archive.org / NASA / Wikimedia 开放素材、Pexels / Unsplash / Pixabay、Remotion、HyperFrames、FFmpeg 与内置字幕。

    核心功能

    1. 端到端生产流水线:12 条预置流水线(科普解说、口播、纪录片混剪等),统一走 research → proposal → script → scene_plan → assets → edit → compose 七个阶段。
    2. 真实素材纪录片制作:无需付费视频模型,从 Archive.org / NASA / Wikimedia 等开放素材库语义检索并剪辑成片,而非仅仅把静态图做成动画。
    3. 参考驱动创作:贴一个你喜欢的视频,智能体会分析其节奏与钩子,生成差异化的制作方案(保留手法、替换主题)。
    4. 内置实时联网调研:写脚本前自动跑 15–25+ 次跨 YouTube / Reddit / 新闻 / 学术源的搜索,用真实数据支撑内容。
    5. 生产级质量门禁与预算治理:人工审批门、预合成验证、渲染后自检(ffprobe 抽帧 + 音频分析)、7 维打分选商、成本预估与上限(默认总预算 $10)。

    Backlot 制作工作台

    OpenMontage 内置 Backlot 可视化工作台,覆盖实时看板、故事板与素材库,让自然语言需求落到可逐帧审阅的制作流程:

    Backlot 实时制作看板(board-live)
    Backlot 实时制作看板(board-live)
    Backlot 故事板(storyboard)
    Backlot 故事板(storyboard)
    Backlot 素材库(library)
    Backlot 素材库(library)

    典型使用场景

    • 零 Key 科普 / 教学短片:一句 "Make a 45-second animated explainer about why the sky is blue" 即可生成带解说与字幕的动画片。
    • 免费真实素材纪录片:如 "Make a 90-second documentary montage about what a city feels like at 4am. Use real footage only",直接调用开放素材库剪辑,零成本成片。
    • 商业预告片(配置图像/视频商后约 $1–$3):科幻概念预告片、产品发布 Teaser 等;已展示案例成本最低 $0.02、最高数美元(如 Kling v3 成片 $1.33)。

    推荐理由

    OpenMontage 最打动我的是它把「做视频」从专业软件的高门槛,解放成一句自然语言需求。三点尤其值得一试:

    • 零 Key 也能跑通全链路:本地 Piper TTS + 开放素材 + Remotion 合成,对想低成本试水 AI 视频的人极友好。
    • 架构清爽、可扩展tools/ + pipeline_defs/ + skills/ 三层知识架构,可以自己加技能 / 工具;AGPL-3.0 开源、可自托管。
    • 内容有真实出处:「参考驱动 + 联网调研」让脚本不像纯生成那样空洞,预算门禁也让人敢放心把任务交给智能体跑。

    个人体会:第一次用 "Make a 60-second animated explainer about how neural networks learn" 跑通时,最惊艳的是它真的会先去查资料再写脚本——出来的东西有依据、有节奏,而不是随机拼接的炫技片段。

    下载地址

  • AI Job Search:跑在你机器上的 AI 求职申请框架,让 Claude 帮你写简历、求职信、备战面试(21.2K⭐)

    AI Job Search:跑在你机器上的 AI 求职申请框架,让 Claude 帮你写简历、求职信、备战面试(21.2K⭐)

    AI Job Search

    AI Job Search 是一个完全跑在你自己机器上的 AI 求职申请框架,基于 Claude Code 构建。Fork 仓库、填好个人资料,Claude 就能帮你评估职位匹配度、定制简历、撰写求职信、准备面试——把最耗时的求职苦差事彻底工程化。

    📌 项目简介

    「The job search that runs on your machine.」作者 Mads Lorentzen 把 Claude Code 变成了一位全栈求职助理:核心工作流(自我画像 → 适配度评估 → 起草-评审申请管道)与语言、国家无关;内置的招聘门户搜索技能默认面向丹麦市场(Jobindex / Jobnet / Akademikernes Jobbank 等),但模式可被替换成你本地的招聘网站。项目没有任何加密货币、代币或付费赞助,仅通过 Ko-fi 捐赠支持,隐私与安全取向明确。

    💻 安装要求与过程

    环境要求

    • Claude Code CLI(需订阅 Anthropic)
    • Python 3.10+(薪资基准等脚本)
    • Bun(用于职位搜索 CLI 工具,bun.sh
    • LaTeX 发行版,需含 lualatexxelatex:TeX Live / MacTeX / TinyTeX / MiKTeX(简历用 lualatex 编译,求职信用 xelatex 编译)
    • 可选:pdftotext(来自 poppler)——用于 /apply 的 ATS 文本层校验;缺失时自动降级为视觉检查

    快速安装

    ① Fork 并克隆

    gh repo fork MadsLorentzen/ai-job-search --clone
    cd ai-job-search

    ② 安装职位搜索 CLI 工具(Bash / zsh / Git Bash)

    for tool in jobbank-search jobdanmark-search jobindex-search jobnet-search linkedin-search freehire-search; do
      cd .agents/skills/$tool/cli && bun install && cd ../../../..
    done

    ③ 进入 Claude Code 填写个人资料

    claude
    # 在 Claude Code 内执行:
    /setup

    ④ 搜索职位

    /scrape

    ⑤ 申请职位

    /apply https://jobindex.dk/job/1234567
    # 或粘贴完整 JD:
    /apply <粘贴完整职位描述>

    ⚡ 核心功能

    • 本地运行、可分叉自有:框架在你的机器上跑,Fork 后填入资料即可,无外部服务绑定,求职数据完全私有。
    • Drafter-Reviewer 双代理申请流:起草者用 LaTeX 写草稿,再由一个带全新上下文的独立 reviewer 代理调研公司、批判草稿,最后修订——避免单遍生成留下的套话与遗漏。
    • PDF 编译与视觉校验循环:自动把简历编译成精确的 2 页、求职信 1 页,并读取渲染页迭代修复版式错误(孤行标题、字体回退、溢页等),每次申请自动执行。
    • ATS 文本层校验:用 pdftotext 抽取简历文本层,按 ATS 解析器视角验证联系方式、阅读顺序与关键词覆盖;诚实规则——简历不支持的关键词绝不硬塞。
    • 相关性加权裁切 + 丰富命令生态:超页时按「与目标职位的相关度 / 文档内独特性 / 求职信依赖度」打分裁线,而非机械删旧;提供 /setup /scrape /apply /rank /interview /outcome /expand /upskill /add-template /add-portal /reset 等 10+ 命令。

    🎯 典型使用场景

    • 主动靶向申请/scrape 抓取丹麦/跨国职位板 → /rank 批量打分排序 → 选定目标 /apply <url> 一键产出定制简历与求职信。
    • 面试准备:某个申请进入面试后,对其归档记录跑 /interview,基于「面试官实际读到的简历/求职信 + 往轮反馈」生成阶段化准备包与模拟面试。
    • 职业差距规划:两次投递之间用 /upskill <URL>/upskill 分析个人画像与职位的差距,输出优先学习热图与带时间估计的学习计划。

    💡 推荐理由(个人心得)

    市面上「AI 帮你写简历」的工具不少,但大多只做一次性文本生成,排版一塌糊涂。AI Job Search 最打动我的是它把求职这件事当成一个严肃的软件工程问题:双代理互相挑刺、强制 PDF 编译校验、ATS 文本层检查,几乎杜绝了「.tex 看起来没问题、渲染出来全崩」的经典翻车。而且它真正跑在本地、Fork 即拥有,可深度定制(自定义 LaTeX 模板、自定义招聘门户 /add-portal),隐私与可控性拉满。

    当然也有门槛:依赖 LaTeX 环境 + Claude Code 订阅,初次搭建略繁琐;默认招聘门户偏丹麦市场(但 linkedin-search / freehire-search 是跨国、零依赖的,开箱即用)。如果你正在换工作、且本就有 Claude Code,这个项目能实打实省下大量写简历、改求职信的周日。

    📥 下载地址

    标签:AI · 开源 · AI Agent · Claude Code · 求职助手 · 简历优化 · 职业规划|许可证:MIT|语言:TypeScript / Python / LaTeX

  • Page Agent:阿里巴巴开源的“住在网页里的”GUI 智能体,一行脚本让网页自己动起来

    Page Agent:阿里巴巴开源的“住在网页里的”GUI 智能体,一行脚本让网页自己动起来

    Page Agent 项目横幅

    项目简介

    Page Agent 是阿里巴巴开源的一个运行在网页内部的 JavaScript GUI 智能体。只需一行脚本,就能让任意网页拥有自己的 AI 代理,用自然语言直接控制 Web 界面——点击按钮、填写表单、跳转页面,全部交给 AI 完成。项目当前已收获约 2.6 万 Star,采用 MIT 协议,主要使用 TypeScript 编写,运行时以纯前端 JavaScript 注入。

    “The GUI Agent Living in Your Webpage. One script gives any web page its own AI agent.”

    安装要求和过程

    环境要求

    • 任意支持 <script> 标签或 npm 的网页环境即可;
    • 无需浏览器扩展、Python 或无头浏览器,纯前端运行;
    • 如需自托管大模型,需一个可访问的模型 API(如通义千问 Qwen、本地模型等);
    • 使用 npm 安装 / 二次构建时需要 Node.js 环境。

    快速安装(三种方式)

    方式一:CDN 一行接入

    <script
        src="https://cdn.jsdelivr.net/npm/page-agent@1.12.1/dist/iife/page-agent.demo.js"
        crossorigin="anonymous"
    ></script>

    国内镜像:https://registry.npmmirror.com/page-agent/1.12.1/files/dist/iife/page-agent.demo.js

    方式二:NPM 安装

    npm install page-agent
    import { PageAgent } from 'page-agent'
    
    const agent = new PageAgent({
        model: 'qwen3.5-plus',
        baseURL: 'https://dashscope.aliyuncs.com/compatible-mode/v1',
        apiKey: 'YOUR_API_KEY',
        language: 'en-US',
    })
    
    await agent.execute('Click the login button')

    方式三:Chrome 扩展 —— 从 Chrome 网上应用店安装 Page Agent 扩展,用于跨多标签页的多页面任务。

    核心功能

    • 🎯 极简集成:纯页面内 JavaScript,不需要浏览器扩展、Python 或无头浏览器,几行代码即可嵌入。
    • 📖 基于文本的 DOM 操作:无需截图、不依赖多模态大模型或特殊权限,通过结构化 DOM 文本理解页面并执行操作。
    • 🧠 自带 LLM(BYO):支持绝大多数主流模型(含本地部署),模型选择完全自由。
    • 🐙 可选 Chrome 扩展:支持跨标签页的多页面任务编排。
    • 🔌 MCP Server(Beta):允许外部 Agent 客户端(如 Claude Code / Cursor)从外部控制你的浏览器。

    典型使用场景

    • SaaS AI Copilot:几行代码为自家产品嵌入 AI 助手,无需重写后端,立刻获得“对话式操作界面”能力。
    • 智能表单填充:把原本需要 20 步点击的流程压缩成一句话,特别适合 ERP / CRM / 后台管理系统等高频重复操作。
    • 无障碍访问:通过自然语言让任何 Web 应用变得可操作,配合语音 / 读屏为行动不便的用户打开大门。
    • 多页面自动化 / MCP 控制:借助 Chrome 扩展或 MCP Server,让 AI 跨页面完成复杂工作流(如比价、数据搬运)。

    推荐理由

    我第一次看到 Page Agent 时最直接的感受是:它把“浏览器自动化”这件事做得太轻了。传统方案(如 Playwright / Puppeteer 脚本、或无头浏览器方案)要么要写一堆选择器、要么要吃截图走多模态,门槛和成本都不低。Page Agent 反其道而行——它就活在页面里,用文本化的 DOM 理解来“读懂”界面,再用自然语言驱动操作,心智负担几乎为零。

    对前端 / 产品同学尤其友好:你想给后台加个“AI 帮我导这份报表”的入口,挂一段脚本就行,不用动架构。再加上它支持 BYO 模型、可接本地大模型,数据不出内网也能玩。如果你正琢磨怎么给产品接一个“会自己点页面”的 AI,Page Agent 是目前最省心、最贴近生产的选择之一。

    下载地址

  • Superpowers:让 AI 编程智能体「先想清楚再做」的开源方法论

    Superpowers:让 AI 编程智能体「先想清楚再做」的开源方法论

    Superpowers 是一套面向 AI 编程智能体(Claude Code、Cursor、Codex、Copilot CLI 等)的开源「方法论 + 技能框架」。它不写业务代码,而是把资深工程师的开发纪律——先脑暴、出设计、写计划,再以测试驱动与代码评审推进——固化成一组「强制触发」的技能(skills),让 Agent 不跳过任何关键步骤。一句话:它给 AI 编程助手外挂了一套工程纪律

    安装要求和过程

    环境要求

    • 任意支持「插件市场」的 AI 编程客户端:Claude Code、Cursor、Codex App/CLI、GitHub Copilot CLI、Kimi Code、OpenCode 等;
    • 无需额外运行时依赖——技能本身是纯 Markdown,零代码、零安装负担;
    • 最新版本 v6.1.1(2026-07-03),MIT 协议,可商用。

    快速安装

    以最常用的 Claude Code 为例,一条命令装好:

    plugin install superpowers@claude-plugins-official

    其他宿主的安装入口:

    • Cursor:在 Agent 聊天里执行 /add-plugin superpowers
    • Codex CLI/plugins 搜索 superpowers 安装;
    • Copilot CLI:注册市场后 copilot plugin install superpowers@superpowers-marketplace
    • OpenCode:读取并执行 https://raw.githubusercontent.com/obra/superpowers/refs/heads/main/.opencode/INSTALL.md

    装好后,正常对话提需求即可——智能体会自动激活内置技能链,无需你手动调用。

    核心功能

    • 自动触发的技能库:20+ 技能覆盖测试(TDD 红-绿-重构)、调试(系统化排查、完成前验证)、协作(脑暴、写计划、派发并行 Agent、请求/接收代码评审)等,全部「强制工作流」而非可选建议。
    • 「先想后做」工作流:脑暴出规格 → Git worktree 隔离 → 设计文档 → 细粒度实施计划 → 子智能体并行开发 → TDD → 代码评审 → 收尾分支,每一步都有验证门禁。
    • 跨宿主通用:一套技能同时兼容 Claude Code、Cursor、Codex、Copilot CLI、Kimi Code、OpenCode 等,换工具不丢方法论。
    • 子智能体驱动开发(Subagent-driven Development):把任务拆给并行子 Agent,主 Agent 只做编排与评审,效率和质量双升。
    • 可扩展元技能writing-skills 让你把自己的工作流封装成新技能,using-superpowers 教 Agent 怎么用这套框架——团队规范可沉淀复用。

    典型使用场景

    • 从一句话需求到可运行功能:让 Agent 先脑暴出规格文档、确认后再生成计划,最后自主开发并自测,避免「上来就写代码」导致的返工灾难。
    • 大型功能并行开发:用 worktree 隔离 + 派发多个子 Agent 同时推进不同模块,主 Agent 汇总与评审,单人也能扛起一个小组的吞吐。
    • 团队统一研发规范:把团队最佳实践写成技能,所有人(和人)用同一套流程,新人也能稳定产出老手质量的代码。

    推荐理由

    用过一堆「vibe coding」工具后,我的结论很朴素:最大的问题不是模型不够聪明,而是 Agent 没有纪律——直接上手写、不写测试、不评审。Superpowers 把「工程纪律」外挂给 Agent,强制它先脑暴、再计划、再 TDD,质量肉眼可见地提升。它不替你做判断,只是不让 Agent 跳过关键步骤。25 万+ star、今天还挂在 GitHub 热榜第一,MIT 协议,值得每个用 AI 写代码的人装一下。

    下载地址

  • Claude Cookbooks:Anthropic 官方出品的 Claude 使用范例集,47.8K stars 让 AI 开发少走弯路

    Claude Cookbooks:Anthropic 官方出品的 Claude 使用范例集,47.8K stars 让 AI 开发少走弯路

    Claude Cookbooks

    Claude Cookbooks 是 Anthropic 官方维护的一组 Claude 使用范例/配方集(Jupyter Notebooks),用可直接复制、可运行的代码片段教会开发者如何用好 Claude API。它覆盖了文本分类、RAG、摘要、工具调用、多模态视觉、子代理、自动评估、JSON 模式、提示缓存等核心场景。截至 2026 年 7 月,仓库已收获 47.8K+ Stars、5.6K+ Forks,是学习和参考 Claude 官方最佳实践的必读项目。

    一、项目简介

    Claude Cookbooks 的定位非常清晰:它不是框架,也不是 SDK,而是一本「官方菜谱」。每个 Notebook 都围绕一个真实开发问题展开,例如「怎么用 Claude 做 RAG」「怎么让 Claude 调用外部工具」「怎么处理 PDF 与图片」「怎么自动评估生成结果」。你可以直接复制代码到自己的项目里,也可以把它当成学习 Claude API 的教程。

    二、安装要求和过程

    环境要求:

    • Python 3.10+(示例代码以 Python 为主);
    • 一个 Claude API Key(可在 Anthropic 官网 免费注册);
    • 仓库使用 uv 管理依赖,建议安装 uv(pip install uvcurl -LsSf https://astral.sh/uv/install.sh | sh);
    • 运行 Jupyter Notebook 需要浏览器或 VS Code Jupyter 插件。

    快速安装:

    # 1. 克隆仓库
    git clone https://github.com/anthropics/claude-cookbooks.git
    cd claude-cookbooks
    
    # 2. 用 uv 安装依赖
    uv sync
    
    # 3. 设置环境变量
    export ANTHROPIC_API_KEY="sk-ant-api03-..."
    
    # 4. 启动 Jupyter 浏览示例
    jupyter notebook

    如果你不想安装 uv,也可以直接用 pip:pip install anthropic jupyter,然后逐本运行 Notebook。

    三、核心功能

    • 覆盖 Claude 全能力的实战 Notebook:从基础的文本分类、摘要、RAG,到高级的工具调用(Tool Use)、JSON 模式、子代理(Sub-agents)、自动评估(Evals)和提示缓存,几乎囊括了 Claude 的所有核心能力。
    • 官方出品、持续更新:Anthropic 工程团队直接维护,Notebook 会跟随 Claude 3.5 / 3.7 / 4 系列模型和新 API 特性同步更新,避免你学到过时的写法。
    • 可复制、可扩展的代码片段:每个配方都提供最小可运行示例,代码结构清晰,方便你替换成自己的数据、提示词或业务逻辑。
    • 多模态与文档理解:包含视觉理解、图表解析、PDF 内容提取、表单识别等示例,适合需要处理非结构化数据的项目。
    • 评估与可观测性:提供自动评估 Cookbook 和 Agent 搜索基准复现(DeepSearchQA / BrowseComp),帮助你建立「改提示 → 跑评估 → 看指标」的迭代闭环。

    四、典型使用场景

    1. 快速上手 Claude API:如果你是第一次用 Claude API,直接打开 getting_started 或基础能力 Notebook,五分钟就能把第一条请求跑起来。
    2. 构建 RAG 与文档问答应用:参考 RAG 配方,把自有文档切分、嵌入、检索后交给 Claude 生成答案;也可以看多模态示例,直接让 Claude 读取 PDF 或图片并回答。
    3. 开发工具型 Agent:学习如何让 Claude 调用计算器、数据库、搜索引擎等外部工具,并进一步组合成多 Agent 协作系统(Coordinator + Sub-agents)。

    五、推荐理由

    Claude Cookbooks 给我的最大价值是「少走弯路」。网上关于 Claude 的教程很多,但官方示例在 Prompt 写法、参数选择、错误处理和成本控制上往往最贴近生产实践。特别是工具调用、JSON 模式和提示缓存这几个容易踩坑的场景,官方代码把最佳实践写得非常清楚。而且它完全开源(MIT),Notebook 形式读起来没有框架源码那么重,适合一边看一边改。

    六、下载地址

  • chrome-devtools-mcp:Chrome 官方出品,让 AI 编程助手直接操控与调试浏览器

    chrome-devtools-mcp:Chrome 官方出品,让 AI 编程助手直接操控与调试浏览器

    Chrome DevTools MCP

    chrome-devtools-mcp 是 Chrome DevTools 官方团队推出的一个 MCP(Model Context Protocol)服务器,它把整个 Chrome 开发者工具的能力开放给 AI 编程助手——让 Claude、Cursor、Copilot、Gemini CLI 等智能体能够直接控制并检视一个真实运行的 Chrome 浏览器,实现可靠的自动化、深度调试和性能分析。截至目前该项目在 GitHub 已收获约 46,700+ Stars

    项目简介

    一句话说明:chrome-devtools-mcp 让你的 AI 编程助手拥有一双”眼睛”和一双”手”,可以打开网页、点击操作、查看网络请求与控制台报错、录制性能 trace,从而真正”看见”自己写的代码在浏览器里跑成什么样。它基于 Puppeteer 驱动 Chrome,并会自动等待操作结果,让智能体的浏览器操作变得稳定可靠。

    安装要求和过程

    环境要求

    • Node.js —— LTS 版本
    • Chrome —— 当前稳定版或更新版本
    • npm

    快速安装

    无需手动安装,直接在 MCP 客户端配置中通过 npx 拉起即可。以标准配置为例,在客户端的 MCP 配置文件中加入:

    {
      "mcpServers": {
        "chrome-devtools": {
          "command": "npx",
          "args": ["-y", "chrome-devtools-mcp@latest"]
        }
      }
    }

    使用 Claude Code CLI 的用户可以一行命令完成添加:

    claude mcp add chrome-devtools --scope user npx chrome-devtools-mcp@latest

    如果只需要基础的导航、执行脚本与截图,可以用精简 + 无头模式降低开销:

    "args": ["-y", "chrome-devtools-mcp@latest", "--slim", "--headless"]

    核心功能

    • 性能洞察:调用 Chrome DevTools 录制性能 trace,并提取可执行的优化建议(如”检查 https://developers.chrome.com 的性能”)。
    • 高级浏览器调试:分析网络请求、抓取截图、读取控制台消息,并附带经过 source map 还原的堆栈信息。
    • 可靠自动化:底层由 Puppeteer 驱动,自动等待动作完成,避免因时序问题导致的操作失败。
    • 丰富的工具集:涵盖输入自动化、页面导航、设备模拟、性能、网络、调试、内存、扩展等 10 大类共 50 余个工具。
    • 灵活的连接方式:支持无头/有头、隔离实例、指定 Chrome 通道,还能通过 --autoConnect / --browser-url 连接已经在运行的 Chrome,与人工共享登录状态。

    典型使用场景

    • 前端性能诊断:让 AI 助手打开你的站点自动录制性能 trace,指出 LCP、长任务、渲染阻塞等瓶颈并给出改进方案,把”性能优化”从玄学变成可量化的闭环。
    • 自动化调 Bug:当页面报错或接口异常时,智能体可直接查看控制台报错和网络请求详情(含还原后的堆栈),定位问题后再改代码,减少来回复制粘贴。
    • 沙箱内安全调试:在沙箱里运行 MCP,连接沙箱外带远程调试端口的 Chrome,既保证隔离又能复用真实浏览器环境,适合 Agent 产品集成浏览器能力。

    推荐理由

    用下来最大的感受是:它补齐了 AI 编程助手最缺的一环——“看得见运行结果”。过去让 AI 改前端,它只能凭代码想象效果;接入之后,它能真正打开页面、看到报错、量到性能数据,再回头改代码,闭环体验明显更靠谱。作为 Chrome DevTools 官方出品的项目,工具设计规范、更新及时,且用 npx 零安装接入、Apache-2.0 开源,几乎没有上手门槛。如果你已经在用 Claude Code、Cursor 或 Copilot 做前端开发,非常值得加上这一个 MCP。

    下载地址

    项目信息:ChromeDevTools 官方出品 · TypeScript 开发 · Apache-2.0 许可 · 约 46,700+ GitHub Stars。

  • addyosmani/agent-skills:给 AI 编程助手装上 24 套「资深工程师技能」的开源技能库(76.9K⭐)

    addyosmani/agent-skills:给 AI 编程助手装上 24 套「资深工程师技能」的开源技能库(76.9K⭐)

    Addy's Agent Skills

    agent-skills 是 Google Chrome 团队工程师 Addy Osmani 维护的一套「生产级工程技能库」——把资深工程师在定义、规划、构建、验证、评审、发布软件时遵循的工作流、质量门禁与最佳实践,封装成 AI 编程 Agent 可以直接调用的结构化技能(Skills)。目前 76.9K Stars、MIT 许可,是当下 GitHub 上最热门的 AI 工程实践项目之一。

    一、安装要求和过程

    环境要求:

    • 任意支持 Skills / 系统提示 / 指令文件的 AI 编程客户端(Claude Code、Cursor、Codex、Copilot、Cline、Gemini CLI、Windsurf、Kiro、OpenCode 等 70+ 款);
    • 一键安装需 Node.js(提供 npx skills 命令);
    • 本地克隆方式需 Git。

    快速安装:

    方式一:skills CLI 一行装全部(推荐,覆盖 70+ Agent)

    npx skills add addyosmani/agent-skills            # 安装全部 24 套技能
    npx skills add addyosmani/agent-skills --list     # 安装前先浏览
    npx skills add addyosmani/agent-skills --skill test-driven-development  # 只装单个技能

    方式二:Claude Code 原生插件市场

    /plugin marketplace add addyosmani/agent-skills
    /plugin install agent-skills@addy-agent-skills

    方式三:本地克隆后挂载

    git clone https://github.com/addyosmani/agent-skills.git
    claude --plugin-dir /path/to/agent-skills

    二、核心功能

    • 8 条贯穿开发生命周期的斜杠命令:/spec(定规格)、/plan(拆任务)、/build(增量实现)、/test(验证)、/review(评审)、/webperf(性能)、/code-simplify(简化)、/ship(发布),每条命令自动激活对应技能。
    • 24 套覆盖全流程的工程技能:interview-me(需求澄清)、spec-driven-development(写 PRD),到 test-driven-developmentcode-review-and-quality(五轴评审)、security-and-hardening(OWASP 防护)、shipping-and-launch(上线清单)。
    • 技能即结构化工作流:每个 Skill 都带步骤、验证门禁(verification gates)和「反合理化」对照表,让 Agent 跨任务稳定遵守同一套标准,而不是凭心情发挥。
    • 上下文自动触发:设计 API 自动触发 api-and-interface-design,写 UI 自动触发 frontend-ui-engineering,无需手动指定。
    • /build auto 半自治模式:审批一次计划后,Agent 自动逐任务实现、测试驱动、单独提交,遇出错或高风险步骤自动暂停。

    三、典型使用场景

    1. 新功能从 0 到上线:/spec 先写规格、/plan 拆任务、/build 增量实现、/test 验证、/review 评审、/ship 发布——把「想到哪写到哪」变成可重复的流水线。
    2. 代码评审质量门禁:合并前调用 code-review-and-quality 做五轴评审(可读性 / 正确性 / 复杂度 / 测试 / 安全),以「Staff Engineer 会不会 merge」为标准,避免 AI 生成的 PR 带病合并。
    3. 安全敏感改动:涉及用户输入、鉴权、外部集成时触发 security-and-hardening,按 OWASP Top 10 检查、管理密钥、审计依赖,降低生产事故概率。

    四、推荐理由

    我自己的使用感受:这套技能库最打动人的地方,是它把「资深工程师的肌肉记忆」显式化了。平时让 AI 写代码,最容易翻车的是「需求没问清就开干」「改完不写测试」「PR 质量没把关」。agent-skills 用 /spec/test/review 把这些容易偷懒的环节变成默认流程,相当于给 Agent 配了个不会疲倦的 Tech Lead。它是纯 Markdown、零运行时依赖,装到任何 Agent 里都不增加包袱,值得每个用 AI 写代码的人试一试。

    五、下载地址

  • ComfyUI-Manager:ComfyUI 必备的插件管家,15.3K+ Stars 让节点安装一键搞定

    ComfyUI-Manager:ComfyUI 必备的插件管家,15.3K+ Stars 让节点安装一键搞定

    ComfyUI-Manager 主菜单

    项目简介

    ComfyUI-Manager 是 ComfyUI 生态的官方扩展「插件管家」,让你在图形界面里一键安装、更新、禁用、启用上千个自定义节点与模型,是每位 ComfyUI 用户都离不开的「应用商店」。项目由社区发起,现由 Comfy-Org 官方维护,已接入 registry.comfy.org 官方节点仓库,累计 15.3K+ Stars、2.3K+ Forks,采用 GPL-3.0 许可。

    安装要求和过程

    环境要求:已安装 ComfyUI;系统具备 Python 3Git 即可(无需额外依赖,纯 Python 实现)。

    方式一 · 通用安装(推荐)

    # 进入 ComfyUI 的自定义节点目录
    cd ComfyUI/custom_nodes
    git clone https://github.com/Comfy-Org/ComfyUI-Manager comfyui-manager
    # 重启 ComfyUI 即可在菜单看到 Manager 按钮

    方式二 · Windows 便携版:下载 install-manager-for-portable-version.bat 放入 ComfyUI_windows_portable 目录,右键「另存为」后双击运行。

    方式三 · comfy-cli 一并安装(最省心)

    python -m venv venv
    venv\Scripts\activate      # Linux/macOS 用 . venv/bin/activate
    pip install comfy-cli
    comfy install            # 同时装好 ComfyUI + ComfyUI-Manager

    方式四 · Linux + venv 脚本:下载 install-comfyui-venv-linux.sh 赋可执行权限后运行,自动完成 ComfyUI 与 Manager 的 venv 部署。

    核心功能

    • 一键管理自定义节点:内置 2000+ 节点库,图形界面中搜索、安装、更新、禁用、启用、卸载全部点点鼠标完成,告别手动 git clone + pip install
    • 模型一键下载与管理:集成模型库,直接在界面拉取常用模型权重,并可通过 extra_model_paths.yaml 统一管理模型路径。
    • 快照(Snapshot)管理:一键保存当前「节点 + 模型 + 配置」的完整状态,随时还原,是应对环境崩坏、多机一致的「救命功能」。
    • 缺失节点自动识别:导入他人工作流时,自动列出缺失的自定义节点并一键补齐,彻底解决「换个机器工作流就跑不起来」的问题。
    • 工作流分享 + 命令行 + 安全策略:支持分享到 comfyworkflows / OpenArt 等平台;提供 cm-cli 供高级用户脱离界面使用;security_level 与独立安装开关保障公共部署安全(V3.38 已迁移到受保护系统路径)。

    ComfyUI-Manager 安装对话框

    典型使用场景

    1. 新手快速搭建 AI 绘画工作流:刚装好 ComfyUI 不知道装什么?打开 Manager 搜索 ControlNet、AnimateDiff、IP-Adapter 等热门节点,一键安装即可开始出图。
    2. 团队 / 多机环境一致性:在一台机器调好所有节点后用快照保存,其他机器直接还原,杜绝「在我电脑上能跑」的玄学问题。
    3. 复现他人分享的工作流:从社区下载 .json 工作流,Manager 自动检测并安装其中缺失的节点,秒级复现大佬的节点组合。

    ComfyUI-Manager 模型安装

    推荐理由

    如果你用过 ComfyUI,一定体会过「满屏红字找不到节点」的痛苦。ComfyUI-Manager 把原本繁琐的命令行操作全部收敛为一个图形化面板,安装、更新、回滚一条龙,极大降低了 AI 绘画的入门门槛。个人最离不开的是它的快照功能——折腾节点把环境搞崩后,一个还原就能满血复活;而「缺失节点自动安装」让复现别人的工作流从半小时缩短到几秒钟。如今项目归入 Comfy-Org 官方维护、接入官方节点仓库,并更新了安全补丁,稳定性与可信度都上了一个台阶。一句话:装 ComfyUI 不装 Manager,等于买了手机不装应用商店。

    下载地址

  • Dify:开源 LLM 应用开发平台,148K Stars 把 AI 工作流从原型秒送生产

    Dify:开源 LLM 应用开发平台,148K Stars 把 AI 工作流从原型秒送生产

    Dify 一览

    在 AI 应用落地的草莽时代,几乎每个团队都在重复造轮子:接模型要写一遍适配、做检索要搭一套向量库、上生产还要自己补日志和监控。把这套东西拼起来,往往比业务本身还费劲。Dify 的出现,就是要把这件事彻底标准化。

    一、项目简介

    Dify 是一个开源的 LLM 应用开发平台,用一张可视化画布把 AI 工作流、RAG 检索增强、Agent 能力、模型管理与可观测性打包在一起,让你从原型到生产只差一次部署。目前 GitHub 已收获 148.4K Stars、23K+ Fork,是开源 LLM 应用开发领域当之无愧的头部项目。

    二、安装要求和过程

    环境要求:

    • CPU ≥ 2 核
    • 内存(RAM)≥ 4 GiB
    • 已安装 DockerDocker Compose
    • 操作系统:Linux / macOS / Windows(WSL2)

    快速安装(Docker Compose,官方最推荐方式):

    git clone https://github.com/langgenius/dify.git
    cd dify/docker
    cp .env.example .env
    docker compose up -d

    启动完成后,浏览器访问 http://localhost/install 即可进入初始化向导。如果你需要高可用部署,官方文档还提供了 Helm Chart、Terraform(Azure / GCP)、AWS CDK 以及阿里云计算巢等多种方案。

    三、核心功能

    1. 可视化工作流画布(Workflow)
    在画布上拖拽编排 AI 流程,节点可调试、可分支、可回放,复杂逻辑一目了然。

    2. 全面的模型支持
    无缝接入数百个闭源 / 开源大模型(GPT、Mistral、Llama3 及所有 OpenAI 兼容模型),覆盖几十家推理服务商与自托管方案,切换模型无需改代码。

    3. 开箱即用的 RAG 管线
    从文档摄入到检索全链路覆盖,原生支持 PDF、PPT 等常见格式的智能提取,几步就能搭出带引用来源的问答助手。

    4. 强大的 Agent 能力
    基于 Function Calling 或 ReAct 定义智能体,内置 50+ 工具(Google 搜索、DALL·E、Stable Diffusion、WolframAlpha 等),也可接入自定义工具。

    5. LLMOps 与 Backend-as-a-Service
    应用日志与性能可监控、可迭代;所有能力均提供对应 API,轻松把 AI 能力嵌入自有业务系统。

    四、典型使用场景

    1. 企业知识库问答 / 智能客服
    导入内部文档构建 RAG,几步搭出带引用来源、可溯源的客服助手,替代翻手册式的重复答疑。

    2. 可视化 Agent 工作流自动化
    把“检索 → 生成 → 调用工具 → 校验”串成一张画布,用可视化的方式替代脆弱的脚本编排。

    3. 快速原型 + API 集成
    先用 Dify 低成本验证想法,再通过 BaaS API 把打磨好的 AI 能力无缝嵌入现有产品。

    五、推荐理由

    个人使用下来,Dify 最打动我的是“把复杂度收敛到一个画布上”。它不要求你先成为向量数据库专家或 Prompt 工程师,普通开发者也能在半小时内跑通一个带 RAG 的可用应用;而当项目要上生产时,LLMOps 的日志、评估与 API 化能力又刚好补上团队最缺的那一环。对于想认真做 AI 产品的团队,它是目前最省心的一站式底座——既能自建私有化守住数据,也能平滑对接云端大模型。

    六、下载地址

    许可证:Dify Open Source License(基于 Apache 2.0,附加部分条款)。本文数据截至 2026-07-11,Stars 约 148.4K。

  • Desktop Commander MCP:让 AI 直接掌控你的终端与文件系统

    Desktop Commander MCP:让 AI 直接掌控你的终端与文件系统

    Desktop Commander MCP

    一、项目简介

    Desktop Commander MCP 是一个为 Claude、Cursor、VS Code、Claude Code 等 AI 编程客户端提供「终端控制 + 文件系统搜索 + 差异文件编辑」能力的 MCP(Model Context Protocol)服务器。它让你的 AI 助手不再只会「动嘴」,而是能在你的本地电脑上真正「动手」——开终端、搜文件、改代码、跑命令、看结果,一条龙闭环。

    项目由 wonderwhy-er 维护,目前 GitHub 收获 6,700+ Stars、882 Forks,采用 MIT 协议开源,底层用 TypeScript 实现,跨 Windows / macOS / Linux 全平台可用。

    二、安装要求与过程

    环境要求

    • Node.js(推荐 18+;或改用 Docker 方式,无需安装 Node);
    • 一个支持 MCP 的客户端:Claude Desktop / Cursor / VS Code / Claude Code / Codex / Gemini CLI / Windsurf 等;
    • 操作系统:Windows、macOS、Linux 均可。

    快速安装(以 Claude Desktop 为例,npx 自动更新)

    npx @wonderwhy-er/desktop-commander@latest setup

    或手动在 claude_desktop_config.json 中添加:

    {
      "mcpServers": {
        "desktop-commander": {
          "command": "npx",
          "args": ["-y", "@wonderwhy-er/desktop-commander@latest"]
        }
      }
    }

    其他客户端一句话安装

    # Claude Code
    claude mcp add --scope user desktop-commander -- npx -y @wonderwhy-er/desktop-commander@latest
    
    # Codex
    codex mcp add desktop-commander -- npx -y @wonderwhy-er/desktop-commander@latest
    
    # Qwen Code
    qwen mcp add desktop-commander -- npx -y @wonderwhy-er/desktop-commander@latest

    不想装 Node?直接用 Docker 一键脚本(install-docker.sh / install-docker.ps1)启动;也可以通过 Smithery、Cursor 的 MCP 安装链接等图形化方式添加。

    三、核心功能

    1. 增强型终端控制:运行长时间命令、管理交互式进程(start_process / interact_with_process / read_process_output / force_terminate)、会话管理,并支持指定 bash / zsh 等 shell。
    2. 完整文件系统操作:读 / 写 / 移动 / 递归列目录、按文件名与内容搜索(基于 vscode-ripgrep 的递归搜索)、读取文件元数据、负偏移 tail 读取超大日志。
    3. 差异文件编辑(edit_block):精准 SEARCH/REPLACE 替换、模糊回退、字符级 diff、多文件与正则模式替换,像资深工程师一样做「外科手术式」修改,而不是整文件重写。
    4. 即时数据分析与办公文档:在内存中直接跑 Python / Node / R 代码;原生读写 Excel(.xlsx/.xls/.xlsm)、PDF、DOCX;直接分析 CSV / JSON,数据不出本机。
    5. 企业级安全与可观测:符号链接遍历防护、命令黑名单、Docker 隔离、全面审计日志(10MB 轮转)、动态配置无需重启。

    四、典型使用场景

    • 大型代码库重构:让 Claude 用 ripgrep 递归搜出所有调用某函数的地方,逐文件用 edit_block 做差异修改。社区里有用户用它一次性修完 23 个文件、76 个错误的 Svelte 5 项目,速度远超传统 AI 编码体验。
    • 本地数据分析:把 Downloads 里的 CSV 丢给 Agent,它直接在内存里跑 Python 做清洗、统计、画图,全程不离开本机,隐私可控。
    • 自动化日常办公:自动按文件类型整理 Downloads、找出重复照片、把 Excel 报表转成图表或 Markdown,把重复的体力活交给 AI。

    五、推荐理由

    一句话总结:这是目前我用过「最像把 AI 变成真同事」的 MCP 工具。它不只是一个文件服务器,而是把「读代码 → 改代码 → 跑命令 → 看结果」的闭环搬进了对话框。

    最香的是差异编辑(edit_block)——AI 不再整文件重写,而是精准打补丁,token 消耗更低、上下文更稳,长时间对话也不容易「翻车」。配合 Claude Code / Cursor,几乎可以取代一部分 IDE 操作,Vibe Coding 体验拉满。

    唯一要留意的是权限边界:它默认能跑任意终端命令,建议在配置里用 allowedDirectories 限定工作目录,并保持审计日志开启。整体来说,开源 MIT、跨平台、一行命令装好,强烈推荐给所有做 AI 编程的人。

    六、下载地址