标签: MIT许可

  • ego lite:为 AI 智能体打造的最快浏览器,你和 AI 并行工作互不打扰

    ego lite:为 AI 智能体打造的最快浏览器,你和 AI 并行工作互不打扰

    ego lite

    一、项目简介

    ego lite 是一个”人和 AI 智能体并行工作”的浏览器——你在前台正常浏览,你的 AI 智能体(Claude Code、Codex、Cursor 等)在后台各自独立的 Space 里跑网页自动化任务,两者互不抢标签、互不干扰,而且任务完成更快、消耗的 token 更少。

    与 browser-use、Vercel agent-browser 这类”浏览器自动化框架”不同,它们本身不带浏览器、需要另开一个浏览器来驱动,登录态往往带不过去;ego lite 则是一整个为”你和智能体共用”而设计的浏览器,无需额外配置,智能体通过 ego-browser 就能直接用上你真实的登录态和标签页。

    二、安装要求与快速上手

    环境要求:目前仅支持 macOS(Apple Silicon / Intel 均可),Windows 与 Linux 已在路线图中;需要一个支持 skills 的智能体 CLI(Claude Code、Codex、Cursor 或自定义)。

    三种安装方式(任选其一):

    1. 直接下载 macOS 应用:从官网下载 .dmg,打开安装即可。安装后会自动把 ego-browser 技能加到每个智能体的 skills 目录。
    2. 用 npx 只装技能
      npx skills add citrolabs/ego-lite

      首次运行浏览器任务时,会引导你完成 ego lite 应用的安装。

    3. 让智能体自己装:把仓库地址粘给智能体,让它读取 skills/ego-browser/references/install.md 按步骤安装。

    首次启动时它只问一个问题:是否迁移 Chrome 数据。选”是”,你的智能体就继承了现有登录态、Cookie、扩展和书签。运行第一个任务时,在智能体 CLI 里输入 /ego-browser 加空格,然后用自然语言描述需求即可:

    ego-browser follow @ego_agent on x.com for me

    三、核心功能

    • 代码驱动而非命令行驱动,复杂任务更快更省 token:能力以 JavaScript 函数暴露给智能体,让它一次写出完整的多步脚本,而不是”调两个命令→看结果→再调两个”地反复循环。官方称复杂工作流比传统 CLI 方式快达 2.5 倍,工具调用次数大幅减少。
    • 每个智能体独享一个 Space:完全隔离的工作区,你在前台浏览、智能体在后台干活,互不干扰;随时可以查看哪个 Space 正在运行、接管或停止它。
    • 同一浏览器内多 Space 并行:Claude Code 在 10 个并行 Space 里丰富 10 条线索、Codex 在另外 5 个 Space 里抓取 5 个竞品网站,彼此不冲突,也不会抢走你的鼠标和标签页。
    • 业界最强的页面 Snapshot:得益于内核级定制,能可靠处理深层嵌套 iframe 等其他方案常常翻车的场景,为文本模型提供高质量的”页面视觉”输入。
    • 任何智能体都能通过 ego-browser 驱动:它是连接层,把浏览器暴露成一组页面内 JavaScript 工具(snapshot、fill、click、wait、navigate、capture),智能体写一段片段即可一次执行。

    四、典型使用场景

    1. 批量线索丰富 / 数据抓取:让 Claude Code 在多个并行 Space 里同时处理几十条销售线索,或让 Codex 并行抓取多个竞品站点信息,全程不打断你手头的浏览。
    2. 需要登录态的网页操作:因为继承了 Chrome 的 Cookie 与登录,智能体可以直接在你已登录的 X、后台系统、SaaS 面板里执行操作,省去每次重新登录的摩擦。
    3. 日常自动化小任务:像”帮我在 x.com 上关注某账号””填个表单””等页面加载完再截图”这类零散操作,一句自然语言交给智能体后台完成。

    五、性能对比

    官方在四个复杂网页自动化任务上,把 ego lite 与 Vercel 的 agent-browser 做了对比:每个任务最快提速达 2.5 倍,token 消耗显著更低,且任务越难差距越大。

    ego lite 与 agent-browser 性能对比

    六、推荐理由

    市面上大多数工具都能”自动化一个浏览器”,真正的区别在于:智能体拿到的是什么浏览器、你能否同时继续工作、以及它是为你已有的智能体服务还是绑死一个内置智能体。ego lite 的巧妙之处在于把”日常浏览器”和”智能体自动化”合二为一——你不用为了让 AI 干活而牺牲自己的浏览体验,也不必再维护一套独立的自动化环境和登录态。对于已经在用 Claude Code / Codex / Cursor 的人来说,一条 npx skills add 就能接上,几乎零迁移成本。目前它是免费、开源(MIT)、数据本地存储的,隐私上也更让人放心;唯一的门槛是暂时仅支持 macOS,Windows/Linux 用户可以先关注路线图。

    七、下载地址


    项目数据(截至发布时):⭐ 3,387 Stars | 🍴 164 Forks | 语言 JavaScript | 许可证 MIT

  • Kronos:首个金融K线开源基础模型,45+交易所数据预训练,33.5K Stars(AAAI 2026)

    Kronos:首个金融K线开源基础模型,45+交易所数据预训练,33.5K Stars(AAAI 2026)

    Kronos 两阶段框架总览

    项目简介

    Kronos首个面向金融 K 线(蜡烛图)的开源基础模型——由清华大学团队开源,在全球 45+ 家交易所的行情数据上预训练,把 OHLCV 序列当作”金融市场的语言”来建模,一个模型通吃价格预测、波动率估计等多种量化任务。论文已被 AAAI 2026 录用,GitHub 上已收获 33,000+ Stars,是今日 GitHub Trending 上最亮眼的 AI × 金融项目。

    与通用时间序列基础模型(TSFM)不同,Kronos 专门针对金融数据高噪声、多维联动的特性设计了两阶段框架:

    1. 分层离散化 Tokenizer:把连续的多维 K 线数据(开高低收 + 量额)量化为分层离散 token;
    2. 自回归 Transformer:decoder-only 架构在海量 token 序列上预训练,像 GPT “续写文本”一样”续写行情”。

    安装要求和过程

    环境要求

    • Python 3.10+
    • PyTorch(GPU 可选,CPU 也能跑小模型推理)
    • 微调需要 NVIDIA GPU(支持 torchrun 多卡)+ 可选 Qlib 数据环境

    快速安装

    # 1. 克隆仓库
    git clone https://github.com/shiyu-coder/Kronos.git
    cd Kronos
    
    # 2. 安装依赖
    pip install -r requirements.txt

    三行代码开始预测

    from model import Kronos, KronosTokenizer, KronosPredictor
    
    # 从 Hugging Face Hub 加载预训练模型
    tokenizer = KronosTokenizer.from_pretrained("NeoQuasar/Kronos-Tokenizer-base")
    model = Kronos.from_pretrained("NeoQuasar/Kronos-small")
    predictor = KronosPredictor(model, tokenizer, max_context=512)
    
    # df 为含 open/high/low/close(/volume/amount) 的 DataFrame
    pred_df = predictor.predict(df=x_df, x_timestamp=x_timestamp,
                                y_timestamp=y_timestamp, pred_len=120,
                                T=1.0, top_p=0.9, sample_count=1)

    KronosPredictor 封装了数据预处理、归一化、预测与反归一化全流程,返回未来 OHLCV 的完整 DataFrame;还提供 predict_batch 批量并行预测多个标的。

    Kronos 预测结果与真实行情对比

    核心功能

    • 金融专用基础模型家族:开源 Kronos-mini(4.1M 参数、2048 上下文)、Kronos-small(24.7M)、Kronos-base(102.3M)三档模型,全部可在 Hugging Face(NeoQuasar)直接下载,按算力自由选择;
    • 两阶段”金融语言”建模:分层离散化 Tokenizer 把高噪声 OHLCV 压成 token,自回归 Transformer 统一建模,一个模型服务多种量化任务;
    • 概率化采样预测:支持温度 T、top-p 核采样、sample_count 多路径平均,不只给单点预测,还能刻画行情的不确定性;
    • 完整微调管线:官方提供基于 Qlib 的 A 股微调全流程脚本——数据预处理 → Tokenizer 微调 → Predictor 微调(torchrun 多卡)→ Top-K 策略回测,一条龙跑通;
    • 在线 Live Demo:官方部署了 BTC/USDT 未来 24 小时预测的可视化演示页,无需安装即可直观感受模型效果。

    A股微调后回测累计收益曲线示例

    典型使用场景

    1. 量化研究信号生成:把 Kronos 的预测价格变动作为原始 alpha 信号,接入组合优化与风险中性化流程,用于选股/择时研究——官方 A 股示例展示了从 Qlib 数据到 Top-K 策略回测的完整路径;
    2. 加密货币/外汇短线预测:对 BTC/USDT 等 7×24 交易品种做未来数小时至一天的 K 线走势与波动区间预测(官方 Live Demo 场景),辅助仓位与风控决策;
    3. 自有市场数据微调:券商、私募或个人研究者用自己的分钟线/日线数据微调 Tokenizer + Predictor,让基础模型适配特定市场微观结构,替代从零训练的高昂成本。

    推荐理由

    时间序列基础模型不少,但真正”懂金融”的开源模型 Kronos 是第一个。我实际体验下来有三点印象很深:

    一是门槛低得惊人——pip install -r requirements.txt 加几行 Python 就能跑通预测,KronosPredictor 把归一化、截断、反归一化这些脏活全包了,量化新手也能十分钟上手;二是学术与工程兼备——AAAI 2026 论文背书、45+ 交易所数据预训练,同时给足了 torchrun 多卡微调和 Qlib 回测的工程脚本,不是只发权重不管落地的”论文模型”;三是诚实——README 明确提醒示例回测只是演示,生产级策略还需要组合优化、风险因子中性化、交易成本建模,这种不吹牛的态度在 AI × 金融领域难能可贵。

    需要注意:模型输出是概率性预测而非投资建议,直接拿裸信号实盘风险很高;Kronos-large(499M)暂未开源,开源版本上下文长度上限 512(mini 为 2048)。适合量化研究者、金融工程学生和对”AI 预测行情”认真感兴趣的开发者。

    下载地址

    许可证:MIT | 语言:Python | Stars:33.5K+ | 数据截至 2026-07-25

  • Open Multi-Agent —— 描述目标而非流程图的 AI 多智能体编排框架

    Open Multi-Agent —— 描述目标而非流程图的 AI 多智能体编排框架

    项目简介

    Open Multi-Agent(简称 OMA)是一个面向 TypeScript 后端的 AI 多智能体编排框架,核心理念是「描述目标,而非流程图」。你只需告诉 OMA 你想达成什么目标,框架内置的 Coordinator 就会在运行时自动将目标拆解为任务 DAG(有向无环图),分派给团队中的各个 Agent 执行,最终汇总结果。

    OMA 于 2026 年 3 月在 GitHub 开源,采用 MIT 许可证。截至本文撰写时已获得 6,646 Stars / 2,415 Forks,社区活跃度极高——从首次提交至今仅约 4 个月,已成为多智能体编排领域增长最快的项目之一。

    Open Multi-Agent

    安装要求与快速开始

    环境要求

    • Node.js ≥ 18(推荐 LTS 版本)
    • TypeScript ≥ 5.6(OMA 使用最新 TS 特性)
    • npmyarn/pnpm 包管理器
    • LLM API Key(OpenAI / Anthropic / Gemini / DeepSeek 等,或本地模型如 Ollama)

    方式一:脚手架创建(推荐新手)

    # 一键创建项目并运行本地演示(无需 API Key)
    npm create oma-app@latest my-oma-app

    交互式终端会引导选择模板和运行时,安装依赖后直接启动一个确定性本地 Demo——无需任何 API Key,使用脚本化模拟响应驱动真实的调度器和离线 Dashboard。可用 --no-install 仅生成文件,或 --no-run 安装但不启动。

    方式二:集成到现有 Node.js 项目

    npm install @open-multi-agent/core
    import {{ OpenMultiAgent }} from '@open-multi-agent/core'
    
    const oma = new OpenMultiAgent({{
      defaultProvider: 'openai',
      defaultModel: 'gpt-5.4'
    }})
    
    // 创建研究团队:研究员 + 分析师 + 共享记忆
    const team = oma.createTeam('research-team', {{
      agents: [
        {{ name: 'researcher', systemPrompt: 'Find the relevant facts.' }},
        {{ name: 'analyst', systemPrompt: 'Compare evidence and identify tradeoffs.' }}
      ],
      sharedMemory: true,
    }})
    
    // 只需描述目标,Coordinator 自动规划 DAG 并执行
    const result = await oma.runTeam(team, 'Compare three approaches and recommend one.')
    console.log(result.agentResults.get('coordinator')?.output)

    三种执行模式:runTeam() 从目标规划执行、runAgent() 单 Agent 运行、runTasks() 显式流水线执行。

    核心功能

    OMA 工作原理

    1. 动态工作流编排(Dynamic Orchestration)

    这是 OMA 最核心的差异化能力。与传统框架需要手写 DAG 节点不同,OMA 的 Coordinator 在运行时根据目标描述生成任务图、分配角色、设定依赖关系,最后综合各 Agent 结果输出答案。整个流程不需要维护硬编码的流程图。

    2. 可控执行(Controlled Execution)

    • 计划审批:预览并审批 Coordinator 生成的计划或单个分派操作,审批通过后可冻结计划用于回放复现
    • 约束声明:当拓扑不能漂移时,声明必需的角色和顺序;用多智能体共识验证输出正确性

    3. 生产级可靠性

    • 检查点续跑:中断的运行可从最近检查点恢复
    • 边界控制:重试策略、超时限制、循环检测、Token 和成本预算确保执行有界
    • 工具安全:默认拒绝所有工具调用,逐个审批开启;支持隐私控制

    4. 全链路可观测性

    每次运行都有稳定身份标识、执行回执和完整追踪记录:

    • TraceStore:本地存储追踪数据,支持查询
    • Run Viewer:离线 Dashboard 回放真实运行的 Task DAG 和 Span 瀑布视图
    • OpenTelemetry 集成:可选 OTel 插件,与企业统一监控栈对接

    5. 开放运行时(Open Runtime)

    • Agent 兼容:Process/ACP 后端让 Claude Code、Gemini CLI、Codex 与 LLM Agent 在同一 DAG 上协作
    • 模型自由:云+本地混合、原生中文大模型支持、OpenAI 兼容端点、AI SDK Provider
    • 部署灵活:自有基础设施、本地运行、完全离线、甚至气隙网络环境均可

    典型使用场景

    场景一:PR 自动审查(PR-Copilot)

    开发者 kidoom 用 OMA 构建了 PR-Copilot——一个 AI Pull Request 审查助手。它运行一个由 Coordinator + 多个领域 Reviewer Agent 组成的审查团队,用 defineTool 定义仓库上下文工具,配合自定义 ContextStrategy 实现 Token 感知的 PR Diff 压缩。每次提交 PR 时自动触发多角度代码审查。

    场景二:文档转图表工作室(Reports to Charts Studio)

    NARNIX0 的 Evident-Project 将研究报告和表格数据转化为幻灯片级图表。OMA 在其中扮演五角色提取委员会的编排者:结构化输出 + 确定性验证,确保每个数据点都有据可查。

    场景三:WordPress 安全分析平台(temodar-agent)

    Ali Sünbül 的 WordPress 安全分析平台直接使用 OMA 内置工具(bash、file_*、grep)在 Docker 运行时中执行安全扫描任务,已确认在生产环境中使用。

    推荐理由

    作为长期关注 AI 编排框架的开发者,我对 OMA 的第一印象是:终于有人认真对待「动态」这件事了

    目前市面上的主流方案大致分两派:LangGraph/Mastra 要求你手写节点和边(图优先),Vercel AI SDK/CrewAI 则偏单次调用工具包。OMA 找到了中间地带——你只管说目标,框架负责拆解、分配、执行、审计。这种「目标驱动」的范式在原型阶段特别高效,而它的可控执行机制又让你能逐步收紧边界,平滑过渡到生产环境。

    另外几个让我印象深刻的点:

    1. 离线优先设计:Run Viewer 是纯离线 Dashboard,不依赖外部服务,这对隐私敏感场景非常友好
    2. 50+ 可运行示例:从基础用法到 Cookbook 工作流、Provider 配置、集成模式全覆盖,上手曲线平缓
    3. 真正的 TypeScript 原生:不是 JS 库加类型装饰,而是从底层就用 TS 5.6+ 特性构建,IDE 体验一流
    4. 生态开放:已有 Engram 记忆同步、Agentsonar 异常检测、Bilig WorkPaper 公式协作等多个第三方集成

    如果你正在评估多智能体编排方案,或者对 LangGraph 的手动构图感到疲惫,强烈建议给 OMA 一个下午的时间——npm create oma-app@latest 跑一遍 Demo,你会感受到「描述目标而非流程图」的魅力。

    下载地址

  • Open Deep Research:LangChain 官方开源的深度研究智能体,模型与搜索全可替换

    Open Deep Research:LangChain 官方开源的深度研究智能体,模型与搜索全可替换

    Open Deep Research

    Open Deep Research 是 LangChain 官方开源的一个「深度研究智能体(Deep Research Agent)」——简单、可配置、完全开源,能跨多种模型提供商、搜索工具和 MCP 服务器工作,性能可媲美众多主流深度研究产品(在 Deep Research Bench 排行榜上曾进入前列)。

    一句话简介

    一个把「深度研究」这一最热门的 Agent 应用完整开源、可自由替换模型与搜索后端的研究智能体:你提一个复杂问题,它自动规划、并发检索、压缩证据,并产出一份带引用的高质量研究报告。

    安装要求与快速上手

    环境要求:Python 3.11(推荐),使用 uv 管理虚拟环境;需要至少一个 LLM 提供商的 API Key(默认 OpenAI),以及一个搜索 API(默认 Tavily)。

    # 1. 克隆仓库并创建虚拟环境
    git clone https://github.com/langchain-ai/open_deep_research.git
    cd open_deep_research
    uv venv
    source .venv/bin/activate   # Windows: .venv\Scripts\activate
    
    # 2. 安装依赖
    uv sync
    
    # 3. 配置环境变量(模型、搜索工具等)
    cp .env.example .env
    
    # 4. 本地启动 LangGraph 服务,打开 Studio UI
    uvx --refresh --from "langgraph-cli[inmem]" --with-editable . --python 3.11 langgraph dev --allow-blocking
    

    启动后会自动打开 LangGraph Studio UI,在 messages 输入框里提问并点击 Submit 即可,还能在 “Manage Assistants” 里切换不同配置。

    Open Deep Research 架构流程图

    核心功能

    • 全流程自动研究:自动完成”任务规划 → 并发检索 → 结果摘要 → 证据压缩 → 撰写带引用的最终报告”整条链路。
    • 模型自由组合:基于 init_chat_model() 兼容几乎所有主流 LLM,且摘要 / 研究 / 压缩 / 报告撰写四个环节可分别指定不同模型(如 gpt-4.1-mini 摘要、gpt-5 或 Claude Sonnet 4 做研究)。
    • 搜索后端可插拔:默认 Tavily,同时支持 Anthropic / OpenAI 的原生联网搜索,并完整兼容 MCP 服务器,可接入自定义工具。
    • 基准可评测:内置对接 Deep Research Bench(100 道博士级研究任务,覆盖 22 个领域),用 RACE 分数量化研究报告质量。
    • 部署方式多样:支持本地 LangGraph Studio 调试、LangGraph Platform 托管部署,以及面向非技术用户的 Open Agent Platform(OAP)可视化配置。

    Open Deep Research 在 LangGraph Studio 中运行

    典型使用场景

    • 行业 / 竞品调研报告:输入”分析某赛道 2025 年主流玩家与技术路线”,自动检索多来源并输出结构化、带引用的调研报告。
    • 学术与技术综述:面对博士级、跨领域的复杂问题,自动拆解子问题、并发检索文献并汇总成论证严谨的综述。
    • 企业内部知识 Agent:借助 MCP 接入内部数据源与自定义搜索,搭建可私有化部署、可替换模型的企业级深度研究助手。

    推荐理由

    市面上”深度研究”功能大多藏在闭源产品里,而 Open Deep Research 把这套能力彻底开源、模块化,最大的价值在于”每一层都能换”:换模型、换搜索、换部署方式都只是改配置。它由 LangChain 官方维护、有配套免费课程和详尽评测数据,既适合想理解 Deep Research 内部原理的开发者拆解学习,也适合企业作为自研研究 Agent 的高质量起点。如果你正想做一个能自动查资料、写报告的 Agent,这是目前最值得参考的开源实现之一。

    下载地址

    项目数据:约 12.4K Stars · 1.75K Forks · 语言 Python · 许可证 MIT(数据截至 2026 年 7 月)。

  • Microsoft AutoGen – 微软开源多智能体AI编程框架 [59.9K+ Stars]

    Microsoft AutoGen – 微软开源多智能体AI编程框架 [59.9K+ Stars]

    📝 项目简介

    Microsoft AutoGen 是微软研究院出品的开源多智能体 AI 编程框架,官方定位为 “A programming framework for agentic AI”。它把”多个会自主对话的 Agent 协同工作”这件事,抽象成一套事件驱动的运行时 + 消息协议,让 LLM、工具、人类三方可以在同一套代码里自由组合,既能 自主行动,也能 和人并肩工作,被广泛视为现代 Multi-Agent 协作范式的奠基性项目之一。

    59.9K+
    GitHub Stars

    9.0K+
    Forks

    Python / .NET
    双语言支持

    MIT
    代码许可

    数据来源:GitHub REST API(仓库 microsoft/autogen,截至 2026-07-23)。

    ⚙️ 安装要求和过程

    环境要求

    • Python:3.10 及以上(v0.4+ 推荐 3.11)
    • 操作系统:Linux / macOS / Windows 均支持
    • LLM 凭据:OpenAI 兼容 API Key(Azure OpenAI / OpenAI / Ollama / 本地 vLLM 等均可)
    • 可选依赖:Docker(隔离代码执行)、Node.js(Studio 浏览器依赖)
    • .NET 用户:.NET 8 SDK,dotnet add package Microsoft.AutoGen

    快速安装(Python,v0.4+ 推荐)

    # 1) 创建并激活虚拟环境
    python3 -m venv .venv && source .venv/bin/activate
    
    # 2) 安装 AgentChat 核心 + OpenAI 扩展
    pip install -U "autogen-agentchat" "autogen-ext[openai]"
    
    # 3) (可选) 安装无代码可视化工作台
    pip install -U "autogenstudio"
    
    # 4) 验证
    python -c "import autogen_agentchat; print(autogen_agentchat.__version__)"

    从源码安装(v0.4)

    git clone https://github.com/microsoft/autogen.git
    cd autogen
    pip install -e ./python/packages/autogen-agentchat
    pip install -e ./python/packages/autogen-ext[openai]
    # 启动 Studio
    autogenstudio ui --port 8080

    配置 LLM(OpenAI 兼容)

    把 API Key 放进环境变量(推荐),或写入 OAI_CONFIG_LIST

    # .env
    OPENAI_API_KEY=sk-...
    # 可选:Azure / 自定义网关
    AZURE_OPENAI_API_KEY=...
    AZURE_OPENAI_ENDPOINT=https://your-resource.openai.azure.com/
    OPENAI_API_BASE=https://your-gateway.example.com/v1
    ⚠️ 版本提示:自 v0.4 起,包名由 pyautogen 改为 autogen-agentchat / autogen-ext。v0.2 用户可参考 官方迁移指南

    🏗️ 架构总览

    AutoGen 把”造一个能自主干活的 AI”这件事切成三层 API,开发者可以按需选择从底层到高层:

    AutoGen 三层架构:Extensions / AgentChat / Core

    • Core API(底层):消息传递、事件驱动、分布式 Runtime,同时支持 Python 与 .NET,是整条链路的”内核”。
    • AgentChat API(高阶):双智能体对话、群聊、AgentTool 多专家路由——大多数应用只需要这一层。
    • Extensions API(扩展):LLM 客户端、工具注册、MCP 协议适配、模型上下文协议桥接。

    再上面还有三个开箱即用的”上层建筑”:AutoGen Studio(无代码 GUI)、AutoGen Bench(基准评测)、Magentic-One(微软开源的通用多智能体团队基线)。

    ✨ 核心功能

    🤖 1. 多智能体对话与编排

    把每个 Agent 看作一个会发消息的对象,通过 initiate_chat / a_initiate 一行就能拉起对话;支持两人私聊、群聊(SelectorGroupChat / Swarm / RoundRobin)与按需动态编排(AgentTool 把”专家 Agent”当工具调)。

    🧠 2. 可插拔模型与工具

    原生支持 OpenAI / Azure OpenAI / Anthropic / Ollama / vLLM / Gemini 等模型;工具侧通过 FunctionTool + MCP 一键接入浏览器、数据库、Shell、文件系统、Playwright 等上百种能力。

    🧑‍💻 3. 人机协同(Human-in-the-Loop)

    通过 UserProxyAgent / input_func 任意把人类拉进对话:审批、纠正、补充上下文,AI 不会”擅自做主”——这是 AutoGen 最早让业界眼前一亮的杀手锏。

    🖥️ 4. AutoGen Studio:无代码工作台

    可视化拖拽搭建 Agent 团队、连接工具、调试消息流、上传数据集。零代码也能跑通一个 Magentic-One 风格的”会自己上网 + 写代码 + 操作文件”的 AI 助手。

    🔁 5. Magentic-One 通用团队基线

    微软在 AutoGen 上开源的”通用多智能体”参考实现:Orchestrator 动态规划 → 调用 Coder / Computer-Use / Web-Surfer / File-Surfer 四个专家完成任务,对标 OpenAI Operator 与 Anthropic Computer Use。

    Magentic-One 风格的多智能体协作流程:Orchestrator + 4 个专家 Agent

    🎯 典型使用场景

    场景一:自动数据分析 + 报告生成

    做法Planner Agent 拆解任务 → Coder Agent 写 pandas / matplotlib 代码 → Executor 在 Docker 里跑 → Writer Agent 把结果整理成 Markdown 报告。人类只在最后审阅。

    收益:原本 2 小时的手工分析压缩到 10 分钟以内;每一步可追溯、可重放。

    场景二:多角色代码评审 / PR 自动化

    做法Author Agent 改代码 → Reviewer Agent 提风格 / 性能意见 → Tester Agent 自动跑单测 + 覆盖率 → Approver 收口。整套流程在一个 SelectorGroupChat 里循环。

    收益:把”人盯 PR”变成”AI 盯 PR”,工程师只看最后结论。

    场景三:Magentic-One 通用办公助手

    做法:把 Coder / Computer-Use / Web / Files 四个 Agent 配成团队,Orchestrator 自动调度。让它”打开 Chrome 去 LinkedIn 搜索 Python 后端岗位、截图、写到 jobs.md“——这是 OpenAI Operator 还没发布时,AutoGen 社区最早跑通的范式。

    收益:任何能拆成”打开应用 → 抓信息 → 写文件”的流程都能交给它。

    💡 推荐理由(也聊聊它的现状)

    作为多智能体框架的”鼻祖级”项目,AutoGen 给整个行业留下了三份被广泛借鉴的遗产:把”对话”当作 Agent 协作的一等公民把”人”显式拉进循环把”工具调用”做成可插拔。从 2023 年发布至今,AutoGen 一直是 Multi-Agent 论文与开源项目的引用常客,60K Star 是其行业地位的最好注解。

    实际用下来,AutoGen 最打动我的有三点:

    1. 上手曲线友好:AgentChat API 让你 5 行代码就能跑起一个”用户 ↔ 助手”对话;想加工具,FunctionTool(...) 一包就完事;想加人类审核,UserProxyAgent 直接接管输入。
    2. 生态厚、可借鉴多:官方 + 社区沉淀了 Magentic-One、AutoGen Bench、AG2(前 AutoGen 延续)等一大批可直接 fork 的参考实现,几乎所有”AI 办公助手”类产品都能在 AutoGen 里找到原型。
    3. 底层够”工程”:Core API 的事件驱动 + 分布式 Runtime 设计,让它既能跑 Jupyter 玩具,也能跑生产级服务;而且 Python 与 .NET 双实现,给企业 .NET 栈留了通路。

    ⚠️ 也要如实告诉你:维护模式与迁移

    自 2025 年起,AutoGen 仓库进入 社区维护模式(community-maintained):bug fix 与小幅改进由社区接管,重大新特性已并入微软官方的 Microsoft Agent Framework

    对新项目而言:如果只是做多智能体原型 / 内部工具,现在的 AutoGen 仍然完全够用、生态最厚;如果是从 0 起步并预计要跑 2-3 年的产品,建议同步评估 Microsoft Agent FrameworkAG2(原 AutoGen 核心贡献者 fork 的延续版本)。

    📥 下载地址

    🌐

    官方网站

    microsoft.github.io/autogen

    🐙

    GitHub 仓库

    github.com/microsoft/autogen

    📚

    文档中心

    stable 文档

    🐍

    PyPI 安装

    pip install autogen-agentchat


    #Microsoft #AutoGen #多智能体 #AgenticAI #开源项目

  • Ponytail:让 AI 编码智能体像最懒的高级开发一样思考,代码量直降 54%

    Ponytail:让 AI 编码智能体像最懒的高级开发一样思考,代码量直降 54%

    Ponytail logo

    你肯定见过那种人:长马尾、圆框眼镜、在公司待得比版本控制系统还久。你给他看五十行代码,他看都不看,沉默两秒,用一行把它换掉——而且一次跑通。Ponytail 就是把这位”最懒的高级开发”塞进了你的 AI 编码智能体。

    它不是一个新模型,也不是一个新 IDE,而是一套规则集 / Skill:在动手写代码前,先逼 Agent 在”懒惰阶梯”上逐级确认——这东西真的需要存在吗?代码库里已经有了吗?标准库能解决吗?浏览器原生支持吗?……直到最后一步才允许写出”最小可用”的代码。结果是在真实 FastAPI + React 仓库上实测:代码量少 54%、成本降 20%、速度快 27%,安全性 100% 不打折

    一、项目简介

    Ponytail 是一个跨 20+ AI 编码智能体(Claude Code、Codex、Cursor、Windsurf、Cline、Gemini CLI、Copilot CLI、Aider、Kiro、Zed、Hermes Agent、OpenCode、Qoder 等)的”极简工程规则集”,教 Agent 像最懒的高级开发一样思考——能不写就不写,能复用就复用,用最小必要代码解决问题,同时永不削减安全、校验与可访问性护栏。

    二、安装要求与过程

    环境要求

    • Node.js:Claude Code / Codex 插件会运行两个轻量 Node.js 生命周期 hook,需要 node 在 PATH 上(nix/nvm 用户注意非交互 shell 的 PATH)。没有也没关系——Skill 照常工作,只是常驻激活会保持静默。
    • 任一支持的 AI 编码助手:覆盖 20+ 平台,无需统一环境。
    • 零配置:不需要任何配置文件;可选 ~/.config/ponytail/config.jsonPONYTAIL_DEFAULT_MODE 环境变量设置默认强度(lite/full/ultra/off,默认 full)。

    快速安装(以 Claude Code 为例)

    /plugin marketplace add DietrichGebert/ponytail
    /plugin install ponytail@ponytail

    ⚠️ 两条 /plugin 命令需分两次发送才能生效。

    其他平台的极简安装:

    • Codexcodex plugin install ponytail@ponytail
    • Cursor / Windsurf / Cline:复制仓库里的 .cursor/rules/ponytail.mdc(或对应 rules 文件)到项目
    • Gemini CLIgemini extensions install https://github.com/DietrichGebert/ponytail
    • OpenCode:在 opencode.json{"plugin":["@dietrichgebert/ponytail"]}
    • Hermes Agenthermes plugins install DietrichGebert/ponytail --enable
    • 更多(Kiro、Zed、Qoder、Pi、Devin、OpenClaw、Amp、Jules、Swival、CodeWhale…)见仓库 docs/agent-portability.md

    三、核心功能

    1. 七阶”懒惰阶梯”(Ladder of Laziness)

    在写代码前,Agent 会停在第一个成立的台阶上:

    1. 这东西需要存在吗?      → 不需要:跳过(YAGNI)
    2. 代码库里已经有了?      → 复用,别重写
    3. 标准库能搞定?          → 用它
    4. 平台原生能力?          → 用它(比如 <input type="date">)
    5. 已安装的依赖里有?      → 用它
    6. 一行能解决?            → 一行
    7. 只有到这步才:写最小可用

    关键是它在”理解问题之后”才跑这把梯子:先读被改动触碰的代码、追真实的调用流,再选台阶。对”怎么解”偷懒,但对”读懂”绝不懈怠。

    2. 四档强度 + 子代理注入

    /ponytail [lite|full|ultra|off] 切换力度,ultra 留给”这个代码库个人得罪了你”的时刻;规则集会自动注入通过 Agent 工具派生的每一个子代理(可用 PONYTAIL_SUBAGENT_MATCHER 正则按 agent 类型做白名单)。

    3. 六个专门命令(Skills)

    • /ponytail-review:审查当前 diff 的过度设计,直接给你一份”删除清单”
    • /ponytail-audit:不止看 diff,全仓审计过度工程
    • /ponytail-debt:把延后的 ponytail: 捷径汇总成账本,防止”以后再说”变”永远不做”
    • /ponytail-gain:展示 benchmark 实测的收益记分牌
    • /ponytail-help:命令速查

    4. 懒而不怠(Lazy, not negligent)

    信任边界校验、数据丢失处理、安全、可访问性,永远不在削减之列。这也是它和裸”写一行代码”提示最根本的区别——后者在基准测试里安全性从 100% 掉到了 95%。

    5. 极致的可移植性

    同一套规则用 20+ 平台的原生格式分发:Claude Code 插件、Codex 插件、Cursor rules、Windsurf rules、.clinerulesAGENTS.md.kiro/steering.qoder/rules、Gemini extension、OpenCode 插件、Hermes 插件、OpenClaw skills、Copilot instructions……你在不同工具间切换,规则无缝复用。

    四、典型使用场景

    场景 1:过度膨胀的日期选择器

    你只想要个日期选择。普通 Agent 会装 flatpickr、写 wrapper 组件、加样式表、顺带开一场关于时区的讨论。Ponytail 下:

    <!-- ponytail: 浏览器原生就有 -->
    <input type="date">

    实测:日期选择器从 404 行降到 23 行,颜色选择器 287 → 23——因为它伸手去够原生的 <input>,而不是搬一个组件库进来。

    场景 2:真实仓库的 feature 开发

    作者用无头 Claude Code 编辑真实 FastAPI + React 仓库(tiangolo 的全栈模板),跑 12 个真实工单,同一 Agent 开/关 Ponytail 各 n=4(Haiku 4.5)对比:

    对比项 代码量 Token 成本 耗时 安全
    Ponytail -54% -22% -20% -27% 100%
    裸”YAGNI+一行”提示 -33% -14% -21% -30% 95%

    Ponytail 是唯一一个每项指标都下降、且全程 100% 安全的方案。省下的成本和延迟只是”顺手”的副作用。

    场景 3:代码审查与技术债治理

    提 PR 前跑 /ponytail-review,让它帮你揪出过度工程化的代码并给出删除清单;/ponytail-audit 做整仓体检;/ponytail-debt 防止”以后再说”变成”永远不做”。这比人工 code review 更狠,也更不近人情——但代码更健康。

    五、推荐理由(个人心得)

    • 哲学站得住脚:它从没把”最少 token”当目标,目标是”只写任务真正需要的”。代码小是因为必要,不是因为炫技压缩。这点戳中了我——太多”极简”提示是以砍掉边界校验为代价的。
    • 数据诚实得罕见:作者主动承认早期单轮 benchmark 有基线水分,老老实实用 agentic 基线重测,给出均值 -54% 而不是挑最好看的数字。这种克制在开源圈不多见。
    • 跨平台分发太香:我同时在 Claude Code 和 Cursor 之间横跳,同一套规则零摩擦复用,不用维护两份 prompt。
    • 该狠的地方真狠:review / audit / debt 三个命令简直是”代码洁癖患者”的福音。

    当然也有边界:对已经极简的代码它收益趋近于零;在会”深思熟虑每一步”的 terse 推理模型(如 GPT-5.5)上,反而可能因思考 token 增加而变慢——所以它最擅长的是那些”爱过度构建”的 Agent。一句话:把 Ponytail 交给爱加戏的 Agent,把自由留给真正需要创造力的你。

    六、下载地址

    许可证:MIT | 语言:JavaScript | 当前 Star:85K+

  • Hallmark:一个”拒绝 AI 味”的设计技能,让 Claude Code / Cursor / Codex 产出不像模板套出来的页面

    Hallmark:一个”拒绝 AI 味”的设计技能,让 Claude Code / Cursor / Codex 产出不像模板套出来的页面

    Bubble 酸面团 App 首页,由 Hallmark 生成

    一、项目简介

    Hallmark 是由 Together AI 开源的一个「设计技能(Skill)」,专门给 Claude Code、Cursor、Codex 这类 AI 编程助手注入一套反”AI 味”(Anti-AI-slop)的设计规则:它会为目标自主挑选宏观结构、从 20 套主题中”着装”、跑 57 道”烂大街”检测闸门加一遍自检,让产出的页面彼此像不同的网站,而不是同一套模板换色。

    二、安装要求和过程

    环境要求:Node.js(用于 npx)、并安装 Claude Code / Cursor / Codex 中的任一 AI 编码助手;也可以纯拷贝文件手动安装,无需额外依赖。

    快速安装(推荐):

    npx skills add nutlope/hallmark

    随时重新运行即可更新到最新版本。若不想走 npx,也可手动把仓库里的 SKILL.md + references/ 拷贝到对应目录:

    • Claude Code~/.claude/skills/hallmark/
    • Cursor.cursor/rules/hallmark.mdc(取 SKILL.md 正文,无需 frontmatter)
    • Codex~/.codex/skills/hallmark/(个人)或 .codex/skills/hallmark/(项目级)

    三、核心功能

    1. 四大”动词”工作流:默认直接构建新 UI;audit 给现有代码打分挑刺(只列清单不改代码);redesign 推倒结构、保留文案/信息架构/品牌后重塑;study 从你欣赏的设计里提取”DNA”(宏观结构、字体配对、色彩锚点),并明确拒绝像素级抄袭与付费模板,可输出可移植的 design.md
    2. 57 道反 AI-slop 检测闸门 + 发布前自检:拒绝每个 LLM 都被训练进的”分布内默认项”——渐变紫、玻璃拟态、千篇一律的圆角卡片网格。
    3. 20 套主题 + 宏观结构引擎:针对每个 brief 自主挑选主题、结构与工艺,不同需求产出截然不同的页面形态,而非同一模板的换色。
    4. Custom 自定主题(新增):当创意意图超出目录主题时,切换为 Custom 从零设计——量身配色、字体与排版,同样受 57 道闸门约束,底层无模板。
    5. 自包含产物 + 可移植:每个页面都是独立的 HTML + CSS,并在 CSS 注释中盖戳宏观结构;study 还能导出 design.md 交给其他 AI 工具接力。

    Distil 内容抽取 API 首页Cold Snap 唱片厂牌 EP 首页

    左:Distil 内容抽取 API | 右:Cold Snap 唱片厂牌 —— 不同 brief,完全不同的气质

    四、典型使用场景

    1. 给新产品做落地页 / 官网原型:输入一句 brief(如”一个酸面团 App 的首页”),Hallmark 直接产出有独特气质的 hero 页,而不是 ChatGPT 默认那种蓝色渐变卡片。
    2. 给”AI 味”过重的现有页面做体检与改造:audit 给老页面打分列出顽疾清单,再用 redesign 保留文案与品牌、推翻结构重做,得到截然不同的”指纹”。
    3. 向优秀设计”借 DNA”而不抄袭:把竞品或灵感图的截图 / URL 喂给 study,提取其结构、字体与配色锚点用于自己的项目,且明确拒绝像素克隆与付费模板。

    五、推荐理由(个人使用心得)

    做 AI 辅助前端最破防的就是”一眼 AI 生成”——紫渐变、玻璃卡片、无限圆角。Hallmark 把资深设计师的”反套路直觉”固化成可复用的规则集,等于给编码助手配了个审美总监。它最妙的地方是”同样的指令、不同的 brief,产出像不同站点”,这对想快速产出有辨识度原型的独立开发者 / 小团队太香了。MIT 许可、一键 npx 安装、可移植 design.md,几乎零门槛。

    注意:它是”设计技能”而非独立 App,需要搭配 Claude Code / Cursor / Codex 使用;审美风格偏编辑 / 杂志 / 独立品牌感,若你要的是中规中矩的企业后台风,它可能”太有性格”。

    Cinder AI 推理工具首页

    六、下载地址

  • AIRI:自托管 AI 数字伴侣,能实时语音聊天、陪你打 Minecraft(42K+ Stars)

    AIRI:自托管 AI 数字伴侣,能实时语音聊天、陪你打 Minecraft(42K+ Stars)

    AIRI 数字生命形象

    项目简介

    AIRI 是由 moeru-ai 团队开源的「自托管、你专属拥有」的 AI 数字生命(AI Companion)项目。它把大语言模型、实时语音交互与 VRM / Live2D 虚拟形象结合在一起,让你在 Web、桌面与移动端拥有一位能说话、能陪玩、有「身体」的赛博伴侣,目标是达到 AI 虚拟主播 Neuro-sama 那样的水平。整个项目基于 WebGPU / WebAudio / WebAssembly 等现代 Web 技术构建,强调本地优先与隐私保护。

    安装要求和过程

    环境要求

    • 运行时:Node.js 24+(项目已提升到 24.13.0),包管理使用 pnpm(monorepo 结构)。
    • 桌面端:默认可调用原生 NVIDIA CUDA / Apple Metal(通过 candle 项目),无需复杂依赖。
    • 移动端:使用 Capacitor(需 iOS 设备 / 模拟器)。
    • 浏览器:任意现代浏览器即可体验(PWA,已支持移动设备)。

    快速安装(普通用户)

    # Windows (winget)
    winget install MoeruAI.AIRI
    
    # 或 Scoop
    scoop bucket add airi https://github.com/moeru-ai/airi
    scoop install airi/airi
    
    # macOS (Homebrew)
    brew install --cask airi
    
    # Linux (Nix,需启用 flakes)
    nix run github:moeru-ai/airi
    
    # 不想安装?直接浏览器打开在线版
    # https://airi.moeru.ai

    AIRI 跨平台下载方式

    开发者从源码运行

    git clone https://github.com/moeru-ai/airi
    cd airi && pnpm i
    pnpm dev             # Web 版
    pnpm dev:tamagotchi # 桌面版

    核心功能

    • 实时语音交互(耳朵 + 嘴巴):客户端语音识别 + 说话人检测(VAD),配合 ElevenLabs / Azure Speech / OpenAI TTS / 阿里云 / 本地 Kokoro 等多供应商语音合成,对话延迟低、可离线运行。
    • 虚拟形象驱动(身体):支持 VRM 3D 模型与 Live2D 模型,自动眨眼、视线追踪、空闲眼动等动画,让 AI「活」在屏幕上。
    • 本地优先推理:基于 WebGPU 的浏览器内本地 LLM 推理,无需把数据发往外部服务器,隐私更有保障。
    • 游戏与记忆能力:可操控 Minecraft 游玩,Factorio 支持开发中(已有 PoC);内置 DuckDB WASM / pglite 浏览器内数据库与记忆系统(Alaya,开发中),让伴侣「记得你」。
    • 跨平台与集成:Web / 桌面(Win / macOS / Linux,桌面端走原生 CUDA / Metal 加速)/ 移动 PWA 全覆盖;支持 Telegram、Discord 聊天接入。

    典型使用场景

    1. 虚拟主播(VTuber):实时语音聊天、玩游戏、与观众互动,灵感直接来自 Neuro-sama,可作为直播 / 互动娱乐的数字人。
    2. 随身赛博伴侣:在手机、桌面、浏览器上随时拥有一个有形象、能聊天的专属电子宠物 / AI 朋友。
    3. 本地隐私 AI 助手:借助 WebGPU 本地推理在完全离线环境下运行 LLM,适合对数据隐私敏感的用户。

    推荐理由

    AIRI 是目前开源领域把「LLM + 实时语音 + 虚拟形象 + 游戏能力」整合得最完整、也最「有生命力」的项目之一。它完全自托管、可本地运行,技术栈现代(WebGPU / VRM / Live2D),跨平台覆盖到位,社区活跃(42K+ Stars、4.2K+ Forks,MIT 许可)。如果你一直好奇 Neuro-sama 是怎么「炼成」的,或者想拥有一个真正属于自己的、能聊天能陪玩的数字人,AIRI 值得一试。

    下载地址

  • OpenCut —— 开源版剪映,免费且隐私优先的跨平台视频编辑器

    OpenCut —— 开源版剪映,免费且隐私优先的跨平台视频编辑器

    OpenCut 开源视频编辑器

    项目简介

    OpenCut 是一个免费、开源的跨平台视频编辑器(Web / 桌面 / 移动端),被社区称为「开源版 CapCut(剪映)」。它采用 Rust 核心 + TypeScript 构建,主打隐私优先、永久免费、简单易用三大特性,目标是把剪映里越来越多被塞进付费墙的基础剪辑功能,重新免费、开放地还给创作者。

    安装要求和过程

    环境要求

    • 普通用户:无需安装,直接用浏览器打开官网 opencut.app 即可在线剪辑。
    • 本地开发 / 自托管:需要 Bun 运行时,以及 Docker + Docker Compose(用于本地数据库与 Redis)。
    • 核心贡献者(可选):需要 Rust 工具链与 wasm-pack,用于本地构建 GPU 合成器 / 特效 / 遮罩的 WASM 核心。

    快速开始(在线使用,零安装)

    # 直接打开官网,浏览器内即可剪辑导出
    https://opencut.app

    本地开发(贡献者)

    # 1. 安装工具链管理器 proto
    bash <(curl -fsSL https://moonrepo.dev/install/proto.sh)
    # 2. 进入仓库,安装锁定版本工具
    proto use
    # 3. 启动各端开发服务器
    moon run web:dev       # Web 端  → http://localhost:5173
    moon run api:dev       # API 端  → http://localhost:8787
    moon run desktop:dev   # 桌面端(见 apps/desktop/README.md)

    私有化自托管(Docker 全家桶)

    # 一条命令跑起完整生产环境(含应用构建)
    docker compose up -d
    # 访问 http://localhost:3100

    ⚠️ 状态说明:主仓库 OpenCut-app/OpenCut 正在用 Rust 核心「从零重写」,官网现网 opencut.app 当前跑的是稳定可用的经典版opencut-app/opencut-classic)。日常剪辑直接上官网即可;想私有化部署可参考经典版 README 的 Bun + Docker 流程。

    核心功能

    OpenCut 编辑器界面

    1. 隐私优先,视频不上云:所有素材与工程默认保存在本地设备,不强制上传云端,从源头规避隐私泄露焦虑。
    2. 免费开放,剪映付费功能免费用:时间线剪辑、字幕、转场、特效等基础能力全部免费,没有弹窗付费墙。
    3. 跨平台一致体验:一套 Rust 核心代码同时驱动 Web、桌面(GPUI)与移动端,渲染 / 特效 / 遮罩由 GPU 合成器处理,性能更优。
    4. 面向 AI 时代:内置 MCP Server 供 AI 智能体直接调用,支持 无头(Headless)模式做批量渲染与自动化,并集成 fal.ai 的生成式图像 / 视频 / 音频模型。
    5. 插件优先 + 脚本面板:重写版提供 Editor API、一等公民的第三方插件,以及编辑器内脚本标签,可玩性与扩展性强。

    典型使用场景

    • 短视频创作者:被剪映付费墙劝退的 Vlog / 抖音 / YouTube 创作者,可直接在浏览器里完成剪辑与导出,零成本起步。
    • 隐私敏感团队 / 个人:医疗、法务、企业内部视频等素材不出本地设备的场景,OpenCut 的本地优先架构天然契合。
    • 开发者与 AI 工作流:通过 MCP Server 让编程助手自动生成 / 批量渲染视频,或用脚本标签把重复剪辑流程自动化。

    推荐理由

    作为一个常年和视频打交道的人,剪映把「关键帧」「智能抠图」等越来越多基础功能塞进付费墙的操作,确实越来越劝退。OpenCut 把「免费 + 开源 + 隐私」三件事做得很扎实,GitHub 上 7 万+ Star 也证明这不是噱头,而是真实需求。它当前处于 Rust 核心重写期,主仓库在快速演进,而现网经典版已经能稳定剪辑。如果你想把剪辑工具私有化部署到自家服务器、或者希望素材 100% 留在本地,docker compose up -d 一条命令就能拥有属于自己的剪辑平台。对于期待 AI 自动剪辑的玩家,它的 MCP Server + 无头渲染路线也相当值得持续关注。

    OpenCut 产品路线图

    下载地址

  • Matt Pocock’s Skills:给真工程师用的 AI 编程 Skill 合集(167K★,MIT)

    Matt Pocock’s Skills:给真工程师用的 AI 编程 Skill 合集(167K★,MIT)

    Matt Pocock Skills

    AI 编程助手很强,但常常「生成很强、理解很弱」——需求没对齐就开干、跑不通就乱试、代码越写越乱。Matt Pocock’s Skills 是 Total TypeScript 作者、TypeScript 圈大佬 Matt Pocock 把自己 .claude 目录里每天在用的工程技能开源出来的合集:不接管你的流程,而是把真实工程纪律封装成一组足够小、可改造、可组合的 Skill。

    一、项目简介

    Matt Pocock’s Skills 是一套面向「真工程师」的 AI 编程 Agent 技能库(Skills for Real Engineers),源自作者每天都在用的 .claude 配置,用几十个可组合的小技能把需求对齐、TDD、结构化调试、架构治理等工程纪律固化下来,而不是像 GSD/BMAD/Spec-Kit 那样「接管整个开发流程」。

    二、安装要求和过程

    环境要求

    • 任意支持 Agent Skills 标准的编程智能体:Claude Code、Codex、Gemini CLI、Cursor 等(skills.sh 安装器可覆盖 70+ Agent)
    • Node.js 环境(用于 npx 一键安装)
    • 零运行时依赖:纯 Markdown + Shell 技能,MIT 协议

    快速安装

    # 一行安装(从 skills.sh 拉取并按提示选择技能)
    npx skills@latest add mattpocock/skills
    
    # 或在 Claude Code 中使用 plugin marketplace 添加
    # 安装后即可用 /ask-matt 跳转开始

    三、核心功能

    1. 小而可组合的设计哲学:每个 Skill 都小到能读懂、能改、能删;不接管流程,把决策权留给人,避免重型框架的“流程自身出 bug 难查”。
    2. Grilling 柚问式访谈:动手前先对齐需求(/grill-me/grill-with-docs 会更新 CONTEXT.md 与 ADR),根治“Agent 没做你想要的事”。
    3. TDD + 结构化调试:把红绿重构和诊断纪律封装成可复用技能(/tdd/diagnose),让代码做出来就能跑。
    4. 共享语言与架构治理:通过 CONTEXT.md / ADR 建立团队共享术语,/improve-codebase-architecture 生成可视化 HTML 架构报告。
    5. 标准化、跨工具:遵循开放的 Agent Skills 标准,技能按调用方式分为 User-invoked(人工触发)与 Model-invoked(Agent 自动调用),通用于各编程智能体。

    四、典型使用场景

    • 新功能前需求对齐:用 /grill-me 把模糊想法柚问成清晰需求,再用 /to-issues 拆成工单、/to-prd 产出产品需氛文档,防止 Agent 跑偏。
    • 遇到诡异 Bug:不让 Agent 乱试,用 /diagnose 走结构化调试法,逐步定位根因。
    • 持续保持代码健康:编码时让 Agent 自动调用 /tdd 保持测试驱动,随时用 /improve-codebase-architecture 给代码层做体检并生成可视化报告。

    五、推荐理由

    我个人非常吃这套“真工程”路线。现在大量 Agent 框架走的是“接管流程”,一上来就把你的控制权收走,流程本身出了 bug 还难查。mattpocock/skills 反道而行:技能够小、够透明,你能读懂、能改、能删,把理解的过程交还给人和 Agent 之间的对话。对于已经有本地 Skill 体系的团队,它最适合的定位不是“替换”,而是“增强”。尤其推荐给被 Vibe Coding 耗到的同学——它是真正的 Real Engineering 和随便写代码之间的分野。

    六、下载地址

    文章配图来源:项目官方仓库 / Total TypeScript Cloudinary。本文由自动化任务采集整理,转载请注明出处。