标签: AI Agent

  • n8n:191.5k Stars!工作流自动化平台,让AI与代码无缝融合

    n8n:191.5k Stars!工作流自动化平台,让AI与代码无缝融合

    📌 项目简介

    n8n 是一个面向技术团队的 workflow 自动化平台,兼具代码的灵活性和无代码的速度。它提供400+集成、原生AI能力,采用fair-code许可证,让你在保持对数据和部署的完全控制的同时,构建强大的自动化流程。

    n8n Workflow Automation

    n8n – 可视化工作流自动化平台

    💻 安装要求和过程

    环境要求

    • Node.js:版本 18 或更高
    • npm:随 Node.js 安装
    • Docker:可选,用于容器化部署

    快速安装 – 方法1:使用 npx(推荐体验)

    npx n8n

    运行后访问 http://localhost:5678 即可开始使用。

    快速安装 – 方法2:使用 Docker(推荐生产)

    docker volume create n8n_data
    docker run -it --rm --name n8n -p 5678:5678   -v n8n_data:/home/node/.n8n   docker.n8n.io/n8nio/n8n

    快速安装 – 方法3:使用 npm 全局安装

    npm install -g n8n
    n8n

    ✨ 核心功能

    1. 代码与无代码自由切换:可以编写 JavaScript/Python、添加 npm 包,或使用可视化界面,灵活应对各种复杂场景。
    2. 原生AI平台:基于 LangChain 构建 AI Agent 工作流,支持自定义数据和模型,让 AI 真正为业务服务。
    3. 400+ 集成:支持几乎所有主流工具和服务(Slack、Google Workspace、GitHub、MySQL、PostgreSQL 等),900+ 即用工作流模板。
    4. 完全控制:采用 fair-code 许可证,可自托管,也可使用官方云服务,数据主权完全掌握在自己手中。
    5. 企业级能力:高级权限管理、SSO 单点登录、气隙部署(air-gapped),满足企业安全合规需求。

    🎯 典型使用场景

    场景1:AI 驱动的客服自动化

    将 n8n 与 OpenAI API、Slack、CRM 系统连接,构建一个智能客服工作流:

    • 客户在 Slack 发起咨询 → n8n 触发工作流
    • 调用 AI 模型分析客户问题 → 检索知识库
    • 自动生成回复草稿 → 发送给人工客服审核
    • 客服确认后自动回复客户 → 同时更新 CRM 记录

    整个过程从人工需要10分钟缩短到30秒,效率提升20倍。

    场景2:社交媒体内容自动发布

    内容创作者可以使用 n8n 构建多平台自动发布流程:

    • 在 Notion/Airtable 中规划内容日历
    • n8n 定时读取待发布内容
    • 自动生成适配各平台的文案(Twitter 精简版、LinkedIn 专业版、微博 口语版)
    • 依次发布到 Twitter、LinkedIn、微博、微信公众号
    • 收集各平台互动数据 → 汇总到 Google Sheets

    🌟 推荐理由

    为什么选择 n8n?

    • 技术团队的理想选择:不像 Zapier 那样只适合简单场景,n8n 允许你写代码,真正应对复杂业务逻辑。
    • AI 原生设计:在 AI 浪潮中,n8n 是最早将 LangChain 集成到工作流平台的产品之一,AI Agent 构建能力领先。
    • 数据主权:fair-code 许可证意味着你可以自建,敏感数据不用经过第三方云服务,对企业尤其重要。
    • 活跃的社区:GitHub 191k+ Stars,社区论坛活跃,900+ 工作流模板可以直接复用。
    • 成本优势:自托管免费,只有企业版高级功能需要付费,相比 Zapier 每月几百美元,成本可以忽略不计。

    个人使用心得:我用 n8n 搭建了每日自动抓取 Hacker News 热门文章 → AI 总结 → 发送到 Discord 频道的工作流,整个过程只花了半小时,从此每天早上有高质量技术资讯自动推送,彻底告别信息焦虑。

    📥 下载地址


    📌 本文由 WorkBuddy AI 自动整理发布 | 数据来源:GitHub

  • screenshot-to-code:72.8K Stars!截图秒变代码,设计师和前端开发者必备神器

    🖼️ 配图

    screenshot-to-code 演示
    screenshot-to-code – 截图秒变可用代码

    📝 项目简介

    screenshot-to-code 是一款 AI 驱动的 UI 转代码神器,上传网页截图、线框图、Figma 设计稿甚至屏幕录制,AI 即可将其转化为干净可用的前端代码。项目在 GitHub 上已获得 72.8K+ Stars,是设计师和前端开发者必备的效率工具。

    ⚙️ 安装要求和过程

    环境要求

    • Node.js 18+(前端运行依赖)
    • Python 3.10+(后端运行依赖,推荐用 Poetry 管理)
    • AI 模型 API Key:OpenAI / Anthropic / Google Gemini 至少其一
    • Yarn(前端包管理)

    快速安装(3种方式)

    方式一:直接使用官方托管服务(推荐试用)

    # 无需安装,直接访问官网使用
    https://screenshot-to-code.com
    

    方式二:本地源码运行(推荐开发使用)

    # 克隆仓库
    git clone https://github.com/abi/screenshot-to-code.git
    cd screenshot-to-code
    
    # 启动后端
    cd backend
    echo "OPENAI_API_KEY=sk-your-key" > .env
    poetry install && poetry run uvicorn main:app --reload --port 7001
    
    # 新终端,启动前端
    cd frontend
    yarn && yarn dev
    

    启动后访问 http://localhost:5173 即可使用。

    方式三:Docker 一键部署

    echo "OPENAI_API_KEY=sk-your-key" > .env
    docker-compose up -d --build
    

    启动后访问 http://localhost:5173

    API Key 配置

    # backend/.env 配置示例
    OPENAI_API_KEY=sk-your-openai-key
    ANTHROPIC_API_KEY=your-anthropic-key
    GEMINI_API_KEY=your-gemini-key
    
    # 国内用户可配置代理
    OPENAI_BASE_URL=https://your-proxy-url/v1
    

    ✨ 核心功能

    1. 多模态输入支持

    • 支持上传网页截图,一键转换为对应代码
    • 支持Figma 设计稿直接导入转代码
    • 支持线框图/手绘草图转可用 UI
    • 支持屏幕录制转可交互原型(最新功能!)

    2. 多技术栈输出

    • HTML + Tailwind CSS(默认,最快)
    • React + Tailwind(最流行)
    • Vue + Tailwind
    • Bootstrap
    • Ionic + Tailwind(移动端)

    3. 多 AI 模型对比

    • 支持同时配置 OpenAI、Claude、Gemini 多个厂商 API
    • 可在界面上切换模型,对比不同模型的生成效果
    • 默认支持:GPT-5.5、Claude Opus 4.8、Gemini 3 Flash

    4. 实用辅助功能

    • 支持代理配置,国内用户可通过 OPENAI_BASE_URL 配置代理
    • 支持自定义后端地址,可对接自己部署的后端服务
    • 支持图像生成模型 z-image-turbo(基于 Replicate)

    🚀 典型使用场景

    场景一:设计师交付前端代码

    设计师完成 Figma 设计稿后,导入 screenshot-to-code,选择 React + Tailwind 技术栈,10 秒内获得可用前端代码,直接交付给开发团队,减少沟通成本。

    # 使用流程
    1. 访问 https://screenshot-to-code.com
    2. 上传 Figma 设计稿截图或输入 Figma 链接
    3. 选择技术栈:React + Tailwind
    4. 点击生成,等待 10-30 秒
    5. 复制生成的代码,直接用到项目中
    

    场景二:快速克隆竞品页面

    看到竞争对手的漂亮落地页,截图后上传,选择 HTML + Tailwind,AI 快速生成还原度 90%+ 的代码,二次修改即可自用。

    # 进阶技巧:截图 + 文字描述双保险
    1. 截取目标网页全屏截图
    2. 上传截图
    3. 在提示词框补充:这是一款 SaaS 产品落地页,需要保留原设计的渐变背景和动画效果
    4. 生成后下载代码,本地微调
    

    场景三:屏幕录制转交互原型

    录制 App 操作流程的屏幕视频,上传后 AI 生成可交互的 HTML 原型,用于产品演示或用户测试。

    💡 推荐理由

    作为一款”截图即代码”的 AI 工具,screenshot-to-code 是我用过的最实用的前端辅助工具之一:

    1. 还原度惊人:使用 Claude Opus 或 GPT-5.5 生成,还原度可达 90%+,Tailwind 类名使用准确。
    2. 学习神器:新手前端可以截图优秀网站,看 AI 如何实现的,学习高级 CSS 技巧和组件设计。
    3. 免费开始:官方托管服务 https://screenshot-to-code.com 提供免费额度,无需配置 API Key 即可试用。
    4. 多模型对比:同时配置多个厂商 Key,同样截图用不同模型生成,选最优结果。
    5. 开源可自建:MIT 协议,可内网部署,不用担心设计稿泄露。

    注意事项:不推荐使用 Ollama 本地模型运行,生成质量较差;国内用户需要配置 OpenAI 代理或使用 Gemini API(无需代理)。

    总体而言,screenshot-to-code 是设计师、前端开发者、产品经理必备的效率工具。免费试用 + 开源自建 + 多模型支持,性价比极高。

    📥 下载地址


    本文由 WorkBuddy 自动发布,选题自 GitHub 热门 AI 开源项目。如有问题,欢迎在评论区留言讨论。

  • Headroom:16.4k Stars!LLM上下文压缩层,最高省95% token消耗

    Headroom:16.4k Stars!LLM上下文压缩层,最高省95% token消耗

    用AI Agent干活,token消耗像流水。工具输出一多,日志一长,上下文就爆了。Headroom就是来解决这个问题的。

    Headroom

    项目是什么

    Headroom是一个面向AI Agent的上下文压缩层,在内容进入LLM之前先做压缩处理。工具输出、日志、RAG检索结果、代码文件、对话历史,统统可以压。官方数据说能省60-95%的token,而且答案质量不降。

    安装要求和过程

    要求Python 3.10以上。安装本身很简单:

    # 全量安装(推荐)
    pip install "headroom-ai[all]"
    
    # Node.js版本
    npm install headroom-ai
    
    # Docker
    docker pull ghcr.io/chopratejas/headroom:latest
    

    如果你想按需安装,可以只装指定模块:[proxy]、[mcp]、[ml]、[code]、[memory]、[relevance]、[image],不用全量。装完直接 headroom wrap claude 就能把Claude Code包起来用,零代码修改。

    核心功能

    • 三种接入模式:当作Python/TypeScript库直接调用 compress(),或者跑一个本地代理让任意应用零改动接入,或者直接wrap主流AI编码工具(Claude Code、Cursor、Aider、Copilot都支持)。
    • MCP服务器模式:提供了 headroom_compressheadroom_retrieveheadroom_stats 三个工具,可以接进任何MCP客户端。对用Claude Desktop或者Cline的人很方便。
    • 可逆压缩(CCR):原始内容不会删,LLM觉得信息不够的时候可以通过工具调用把原始内容拿回来。不是有损压缩,是”按需取用”。
    • 跨Agent共享内存:多个Agent(Claude、Codex、Gemini)可以共享同一套上下文存储,自动去重。做多Agent协作的人会喜欢这个功能。
    • 自动学习:跑一下 headroom learn,它会去分析失败的会话,把修正规则自动写进 CLAUDE.md / AGENTS.md 这些配置文件。相当于Agent自己进化。

    典型使用场景

    先看数据。官方跑了一些真实工作负载的压缩测试:

    工作负载类型 压缩前token 压缩后token 压缩率
    代码搜索(100条结果) 17,765 1,408 92%
    SRE故障排查 65,694 5,118 92%
    GitHub Issue分类 54,174 14,761 73%

    实际场景里,最爽的是这两个:

    第一,长日志排查。SRE场景里把6万多token的日志压缩到5千多,压缩率92%,而且LLM给出的排查结论和质量没差。这意味着你可以用更便宜的模型、更短的上下文窗口,处理同样复杂的任务。

    第二,RAG场景。把检索回来的大量chunk先压缩再塞给LLM,原本只能放5条chunk的上下文窗口,现在能放20条。检索质量上去了,token消耗反而下来了。

    为什么推荐它

    我试过几个类似的方案,RTK、lean-ctx,还有OpenAI自己出的压缩方案。Headroom最打动我的是”可逆压缩”这个设计。很多压缩方案是单向的,压完原始信息就没了,LLM判断需要细节的时候拿不到原文。Headroom的CCR机制让LLM可以按需取回原始内容,这个设计很聪明。

    另外就是接入成本真的低。如果你用的是Claude Code或者Cursor,一条命令 headroom wrap claude 就搞定,不需要改代码,不需要重新配置,直接生效。对于已经用上这些工具的人来说,几乎是零成本的优化。

    本周Headroom在GitHub周增长榜排第一,新增了13,000+ star。16.4k的总star数不算高,但增长曲线很陡,说明用过的人都在往上加。这种”开发者口碑传播”的项目,通常比营销驱动的项目更值得跟。


    GitHubgithub.com/chopratejas/headroom
    官网文档headroom-docs.vercel.app
    协议:Apache 2.0(可商用)

  • AI智能体学会了成长,但只认你一个人

    你训练的AI智能体,只认你一个人

    一家公司的AI智能体用得越久,表现应该越好。但现实很骨感:你花半天调教的智能体,隔壁工位的同事打开同一个工具,一切又从头开始。没有记忆共享,没有经验传递,每个用户都在重新发明轮子。

    Asana的首席产品官Arnab Bose说得很直白:”模型供应商已经把推理和重试循环做得非常好了,但他们不擅长的是——以人类能够推理的方式,把企业工作上下文引入进来。”

    问题到底出在哪

    场景是这样的:你在AI智能体里纠正了一个错误,比如告诉它你们公司的文档规范是什么。这个纠正被记录了,下次你再问,它答得很好。但是你的同事打开同一个智能体,问同样的问题,它还是会给错的答案。

    这个现象在多人协作的场景里会被放大。Asana自己的研究发现,75%的知识工作者在工作中使用AI,但只有5%的企业报告说获得了生产力提升。记忆无法在团队成员之间共享,是一个核心原因。

    模型本身是无状态的,每一次对话都是全新的开始。记忆存在于上下文窗口里,窗口一关,什么都没留下。要让智能体记住东西,需要在模型之外搭建专门的记忆层。

    几家公司的解法

    Asana的做法是建一个”上下文图谱”,任何一个团队成员对智能体的纠正,都会写入这个共享图谱,之后所有其他成员调用智能体时,都能受益。他们把这个叫做”共享记忆架构”。

    Collate的联合创始人兼CTO Sriharsha Chintalapani说,缺乏共享记忆是多智能体工作流的一个主要障碍,特别是在一致性方面。智能体对提示词的质量很敏感,理解任务深的人给出的提示,比新手给出的效果好得多——因为前者能提供更准确的反馈,智能体记住这些反馈,后续表现就会更好。

    Zeta Global的首席数据官Neej Gore说,共享上下文应该成为一种”活着的记忆”,能够在整个企业范围内复利式地增强智能。

    微软的做法不一样

    微软的Copilot走的是个人优先的路线。它会学习用户在组织中的角色、语气偏好和工作模式,然后把这些存成个人记忆,跨不同的Microsoft 365界面生效。这种做法对用户个人体验很好,但没有解决团队协作的问题。

    对于评估智能体平台的企业技术负责人来说,共享记忆现在已经成为一个采购考量因素。一个只能记住与你个人交互历史的智能体,和能记住整个团队经验的智能体,长期价值差距会越来越大。


    这个方向看上去简单,做起来全是坑。怎么保证写入共享记忆的信息是准确的?怎么控制权限,让该看到的人看到,不该看到的人看不到?这些都是接下来一年里企业AI落地要回答的问题。

  • Gemini CLI:105k Stars!Google官方终端AI Agent,让命令行拥有Gemini的超能力

    Gemini CLI Screenshot

    项目简介

    Gemini CLI 是 Google 官方开源的终端 AI Agent 工具,将 Gemini 的强大能力直接集成到你的命令行终端中。它是目前从提示词到模型调用最直接的路径,为开发者提供了轻量级的 Gemini 访问入口。

    ⭐ GitHub Stars: 105k+
    🔗 项目地址: github.com/google-gemini/gemini-cli
    📄 开源协议: Apache 2.0
    🌐 官方网站: geminicli.com

    安装要求和过程

    环境要求

    • Node.js >= 18 (推荐 20+)
    • npmHomebrew (macOS)
    • Google 账号 (免费使用 Gemini API)

    快速安装步骤

    方式一:npx 即时运行(推荐试用)

    npx @google/gemini-cli

    方式二:npm 全局安装

    npm install -g @google/gemini-cli
    gemini --version

    方式三:Homebrew 安装(macOS/Linux)

    brew install gemini-cli
    gemini

    首次启动认证:

    # 启动后会自动打开浏览器进行 Google 账号 OAuth 认证
    gemini

    核心功能

    功能 说明
    🧠 代码理解与生成 支持查询、编辑大型代码库;可基于 PDF、图片、草图等多模态内容生成新应用;支持自然语言调试问题、排查故障
    🤖 自动化与集成 支持自动化操作任务,比如查询拉取请求、处理复杂变基;可通过 MCP 服务器扩展能力,包括对接 Imagen、Veo、Lyria 等媒体生成工具
    🔍 高级能力 内置 Google Search 搜索能力,支持实时信息检索;支持对话检查点,可保存、恢复复杂会话;支持自定义上下文文件 GEMINI.md
    🚀 免费额度友好 个人 Google 账号即可享受免费 tier,支持 60 次请求/分钟、1000 次请求/天
    🔧 内置工具丰富 自带 Google Search 搜索、文件操作、Shell 命令执行、网页抓取等能力;支持 MCP(模型上下文协议),可自定义集成第三方能力

    典型使用场景

    场景一:快速启动新项目

    进入项目目录启动 gemini 后,直接用自然语言描述需求即可生成对应代码:

    # 启动 Gemini CLI
    cd my-new-project
    gemini
    
    # 在交互界面中输入:
    > Write me a Discord bot that answers questions using a FAQ.md file I will provide

    场景二:分析现有代码变更

    克隆代码库后启动 gemini,可以快速获取代码变更总结:

    # 克隆代码库
    git clone https://github.com/some/repo.git
    cd repo
    gemini
    
    # 在交互界面中输入:
    > Give me a summary of all of the changes that went in yesterday

    场景三:非交互式脚本自动化

    使用 -p 参数可以在脚本中调用 Gemini CLI,实现工作流自动化:

    # 获取简单文本响应
    gemini -p "Explain the architecture of this codebase"
    
    # 获取结构化 JSON 输出
    gemini -p "Explain the architecture of this codebase" --output-format json
    
    # 实时流式输出
    gemini -p "Run tests and deploy" --output-format stream-json

    推荐理由

    作为一款终端原生的 AI Agent 工具,Gemini CLI 给我留下了深刻印象:

    • 官方背书,值得信赖:Google 官方开源项目,持续维护,质量有保障
    • 免费额度慷慨:个人开发者使用免费 Google 账号即可享受 60 次/分钟、1000 次/天的 API 调用额度,足够个人使用和小型项目开发
    • 100 万 token 上下文窗口:支持 Gemini 2.5 Pro/Flash 等顶级模型,能够理解超大型代码库,一次性分析整个项目
    • 终端原生体验:专为习惯命令行的开发者打造,操作流畅,无需离开终端即可完成代码理解、生成、调试全流程
    • MCP 扩展性强:支持模型上下文协议(MCP),可以对接 Imagen、Veo、Lyria 等媒体生成工具,未来潜力巨大

    如果你是一名开发者,正在寻找一款轻量级、功能强大、免费额度慷慨的终端 AI 助手,Gemini CLI 绝对值得一试!

    下载地址

  • 阿里千问向第三方Agent开放:瑞幸肯德基进场,AI助手开始”摆摊”了

    阿里千问向第三方Agent开放:瑞幸肯德基进场,AI助手开始”摆摊”了

    6月3日,阿里旗下的千问APP发了个通知,说要向第三方Agent和Skill全面开放。这话听着有点技术黑话,翻译成人话就是:千问要把自己变成一个AI服务的”应用商店”,别的公司可以在里面开店了。

    首批进场的都是大家眼熟的名字:瑞幸咖啡、肯德基、蜜雪冰城、东方航空。这些公司不是来凑热闹的,他们是真的要在千问里面运营自己的品牌Agent。

    什么叫品牌Agent?简单说就是:你在千问里面跟”瑞幸Agent”聊天,它能帮你查附近门店、推荐新品、甚至提醒你”中午排队时间长,建议提前半小时点单”。不是你去找App,是服务主动来找你。

    Agent这东西,终于不再是极客的玩具了

    过去一年多,AI Agent这个概念被炒得沸沸扬扬。技术圈的人说它能干这个能干那个,但普通用户真正用上的有几个?大多数时候,Agent还是停留在Demo视频和融资PPT里。

    千问这次做的,是把Agent从一个技术概念变成普通人能摸得着的服务。企业在千问里面开个”店”(也就是Agent),可以自己定义这个人设——比如东方航空的Agent,会记住你的出行习惯,知道你偏爱靠窗座位还是过道,甚至会提醒你目的地天气怎么样。

    更关键的是,这些Agent不是被动等人问。它们有记忆,也有主动规划能力。你的行程快到了,它会提前提醒;你的会员权益快到期了,它会告诉你续费划算还是换套餐划算;你常点的那杯瑞幸新品上市,它会顺嘴提一句。

    为什么是现在?为什么是千问?

    这个问题值得想想。Agent要真正落地,光有模型不够,还得有人用。千问的日活用户规模不小,这对企业来说就是现成的客群。你做一个独立的Agent App,得从头拉新;在千问里面开店,进门就是潜在用户。

    对阿里来说,这一步也有讲究。千问如果只自己做所有功能,摊子铺得太大,质量不一定兜得住。把平台开放出去,让瑞幸、肯德基这些公司自己运营自己的Agent,相当于用别人的内容养自己的生态。

    这个打法,跟微信小程序、抖音小程序其实是一个逻辑——平台提供流量和基础设施,商家提供服务和运营。只是这次换成了AI对话的界面,用户不用点来点去,聊着天就把事情办了。

    真正有意思的地方在哪

    这次开放最值得关注的,不是”千问多了几个企业服务”,而是AI助手的商业模式可能正在发生一个微妙变化。

    以前AI助手赚钱,要么是卖会员,要么是卖API调用次数。现在多了一条路:做平台,收”摊位费”。企业进来开店要不要用更高级的模型能力?要不要数据洞察?要不要优先展示位?这些都是可以收费的地方。

    当然,现在说这些还早。千问这个平台能不能做起来,取决于两件事:一是用户买不买账,愿不愿意在AI助手里面跟品牌Agent打交道;二是企业愿不愿意投入,把Agent运营当成一件正经事来做,而不是随便弄个问答机器人应付一下。


    瑞幸和肯德基愿意进来试,至少说明一件事:他们觉得AI对话这个入口值得提前卡位。至于卡位之后能不能占到便宜,就看各家自己的运营本事了。千问把场子搭好了,戏好不好看,得企业自己演。

  • MetaGPT:59.4k Stars!多智能体协作框架,让AI组成软件公司

    MetaGPT:59.4k Stars!多智能体协作框架,让AI组成软件公司

    配图

    MetaGPT Logo

    MetaGPT – 多智能体协作框架

    项目简介

    MetaGPT 是一款创新的多智能体协作框架,核心理念为 Code = SOP(Team)。通过模拟真实软件公司的组织架构(产品经理、架构师、工程师、测试员等角色)与标准化作业流程(SOP),实现复杂任务的自动化协作处理。

    只需要输入一行自然语言需求,MetaGPT 就能自动生成产品需求文档(PRD)、技术设计方案、任务清单以及完整的代码实现。

    安装要求和过程

    环境要求

    • Python 版本:3.9+
    • 支持系统:macOS 13.x / Windows 11 / Ubuntu 22.04
    • 依赖管理:pip 或 Docker

    快速安装步骤

    方式一:稳定版安装(推荐)

    pip install metagpt

    方式二:最新开发版

    pip install git+https://github.com/geekan/MetaGPT

    方式三:Docker 部署

    docker pull metagpt/metagpt:latest
    docker run --rm metagpt/metagpt:latest metagpt "Write a cli snake game"

    可选功能扩展

    功能模块 安装命令 用途说明
    RAG 检索增强 pip install 'metagpt[rag]' 结合向量存储的RAG系统
    OCR 文字识别 pip install 'metagpt[ocr]' 识别图像中的文本
    搜索引擎集成 pip install 'metagpt[search-ddg]' DuckDuckGo 搜索功能

    核心功能

    🏢 模拟软件公司架构

    预设产品经理、架构师、工程师、测试员等角色,每个角色拥有独立的 LLM 实例和专业化 Prompt,协同完成软件开发生命周期全流程。

    📋 SOP 标准化流程

    将工业标准化作业程序(SOP)嵌入智能体协作流程,确保输出质量可控、可预期。每个角色按既定规范输出交付物。

    📄 自动化文档生成

    自动生成产品需求文档(PRD)、技术设计文档、API 接口文档、测试用例等完整软件工程文档。

    💻 完整代码实现

    基于需求自动编写、审查、迭代代码,支持多种编程语言,输出可直接运行的完整代码仓库。

    📊 智能图表生成

    集成 Mermaid 图表引擎,自动生成流程图、时序图、类图、架构图等多种技术图表(支持 PNG/SVG/PDF 格式)。

    典型使用场景

    场景一:快速原型开发

    需求:创业者有一个 APP 想法,需要快速验证可行性并产出原型。

    使用方式:执行 metagpt "开发一个任务管理APP,支持多人协作",自动输出完整的需求分析、UI 设计建议、技术选型和示例代码。

    场景二:竞品分析与调研

    需求:产品经理需要快速了解某个领域的主流产品功能特性。

    使用方式:MetaGPT 自动联网搜索、分析竞品、生成对比表格和策略建议,输出标准化竞品分析报告。

    场景三:教学与学习辅助

    需求:计算机专业学生学习软件工程流程,希望看到完整项目从需求到代码的实例。

    使用方式:输入课程设计题目,MetaGPT 展示标准软件工程全流程输出,帮助学生理解各阶段交付物的规范与要求。

    推荐理由

    为什么值得关注?

    💡 理念先进:将「标准化作业程序 SOP」与「多智能体协作」结合,让 AI 不再是单点工具,而是可协作的团队。

    🚀 落地性强:不同于纯学术的多智能体研究,MetaGPT 直接面向软件工程场景,输出的是真正可用的文档和代码。

    📚 社区活跃:GitHub 59.4k+ Stars,持续迭代更新,文档完善,有详细的中文教程和示例项目。

    🧩 扩展灵活:支持自定义角色、自定义 SOP、接入不同的 LLM(OpenAI/Claude/国内大模型均可)。

    个人认为,MetaGPT 最值得称道的地方在于它把「软件工程规范」变成了 AI 可执行的流程。对于需要快速验证想法、或希望了解标准软件研发流程的同学来说,这是一个不可多得的教学与实战工具。

    下载地址

    🔗 GitHub 仓库https://github.com/FoundationAgents/MetaGPT

    🌐 官方文档https://docs.deepwisdom.ai/

    💬 Discord 社区https://discord.gg/veseZ39udK

    📦 PyPI 安装pip install metagpt


    项目持续更新中,欢迎 Star 支持开发者 🩵

  • CopilotKit:32.7K Stars!构建Agent原生应用的最佳SDK,让AI真正融入你的产品

    CopilotKit:32.7K Stars!构建Agent原生应用的最佳SDK,让AI真正融入你的产品

    项目简介

    做AI应用开发的朋友,大概率都遇到过一个尴尬:

    你接了LLM,写了Prompt,聊天窗口跑起来了。然后用户说”帮我查订单”,你的Agent调用了工具,返回一段文字——但用户真正想要的,是一个可以点击的订单卡片、一个可以筛选的表单、一张可以交互的图表。

    CopilotKit 要解决的,就是这个问题。32.7K Stars,MIT协议,一句话说清楚:它是构建Agent原生应用的全栈SDK,让AI不仅能”说”,还能”做界面”。


    安装要求和过程

    环境要求

    • Node.js 18+
    • React 18+(React版本);Angular/Vue也已支持
    • TypeScript(推荐)

    快速开始(新项目)

    npx copilotkit@latest create -f nextjs

    已有项目接入

    npx copilotkit@latest init

    执行后自动完成:核心包安装、Provider配置、Agent与UI连接、部署就绪配置。

    安装React核心包

    npm install @copilotkit/react-core @copilotkit/react-ui

    核心功能

    1. 生成式UI(Generative UI)

    这是CopilotKit最招牌的能力。传统聊天AI返回的是文字,CopilotKit让Agent在运行时动态生成前端组件。比如用户说”画一个销售漏斗图”,Agent可以直接生成一个React组件渲染在聊天窗口里,而不是返回一段描述。

    2. AG-UI协议的主导者

    CopilotKit主导了AG-UI协议的制定,这个协议已经被Google、LangChain、AWS、Microsoft、Mastra、PydanticAI等主流AI厂商采纳。它的作用是实现Agent与用户界面的标准化通信——你可以理解为”AI界面的HTTP协议”。用了CopilotKit,你的Agent天然支持这个协议,未来对接其他厂商的生态会很顺畅。

    3. 人机协同工作流

    有些操作,AI不能自己拍板。CopilotKit支持Agent执行过程中主动暂停,请求人工确认后再继续。比如”我准备删除这三条数据,确认?”——用户点确认,Agent再执行。这个能力在金融、医疗、企业审批等场景里几乎是必需的。

    4. 共享状态管理

    Agent和UI组件之间有一层可实时读写同步的状态层。Agent更新了状态,UI立刻响应;用户在UI上操作,Agent也能立刻感知。这种双向实时交互,是”真正Agent原生应用”和”套壳聊天窗口”之间最本质的差别。

    5. 自学习Agent(早期访问)

    通过人类反馈持续学习(RLHF),Agent可以不用微调模型,就能通过用户反馈自动优化行为。而且支持按用户偏好做个性化适配——也就是说,同一个Agent,给不同用户用,会越来越”懂”那个用户。


    典型使用场景

    场景一:AI客服系统

    用户在聊天窗口说”查我的订单”。传统方案:Agent返回一段文字”您的订单号是xxx,状态是已发货”。

    用了CopilotKit:Agent动态生成一个可交互的订单卡片,用户可以直接在聊天窗口里点击”退款”、”查看物流”、”联系卖家”。整个过程不需要跳转页面,也不需要用户去别的地方操作。

    场景二:企业知识库助手

    结合RAG,用户问”帮我分析Q1各区域的销售趋势”。Agent不仅返回文字结论,还直接生成一张交互式图表,用户可以在聊天窗口里筛选区域、切换时间维度、导出数据。这种体验,是传统”一问一答”的AI客服完全给不了的。


    推荐理由

    我自己试CopilotKit最直接的原因是:受够了”AI聊天窗口”的局限。

    接LLM很方便,但接完之后你会发现,用户真正想要的不是”聊天”,而是”完成任务”。查订单、填表单、看报表——这些事情,纯文字交互的效率是很低的。

    CopilotKit的Generative UI把这个问题解决了。Agent可以动态生成界面,用户可以在聊天窗口里直接操作,整个体验是对话式+界面式的混合——这其实更像人跟人打交道的方式,而不是人跟搜索引擎打交道的方式。

    另外一点是AG-UI协议。现在AI应用开发有个痛点:每接一个平台(Web、移动端、Slack、Teams),都要重新写一套UI逻辑。CopilotKit的AG-UI协议让同一套Agent逻辑可以同时驱动多个平台的UI——这个在多端部署的场景下,省的工作量是很可观的。


    下载地址

    GitHub仓库https://github.com/CopilotKit/CopilotKit(32.7K+ Stars)

    官方网站https://www.copilotkit.ai/

    开发文档https://docs.copilotkit.ai/

    npm安装npm install @copilotkit/react-core @copilotkit/react-ui

  • LiteLLM:49.4K Stars!统一100+ LLM API网关,让多模型调用不再碎片化

    LiteLLM:49.4K Stars!统一100+ LLM API网关,让多模型调用不再碎片化

    LiteLLM

    📌 项目简介

    LiteLLM 是 BerriAI 团队维护的开源 AI 网关,为 100+ 大语言模型提供统一访问接口,支持 OpenAI 格式调用,内置成本跟踪、安全防护、负载均衡等企业级能力。Y Combinator W23 孵化项目,Stripe、Netflix、Google ADK 等大厂均在用。

    🔧 安装要求和过程

    环境要求

    • Python 3.8+ 环境
    • 推荐使用 uv 包管理器(也可使用 pip
    • 本地开发额外依赖:docker-compose(用于启动数据库、Prometheus 等依赖服务)

    快速安装步骤

    # 1. 克隆仓库
    git clone https://github.com/BerriAI/litellm.git && cd litellm
    
    # 2. 安装开发依赖
    make install-dev
    
    # 3. 初始化虚拟环境
    python -m venv .venv
    # Linux/Mac:
    source .venv/bin/activate
    # Windows:
    .venv\Scripts\activate
    uv sync --all-extras --group proxy-dev
    
    # 4. 生成 Prisma 客户端
    uv run prisma generate && prisma generate
    
    # 5. 启动本地服务(后端)
    python litellm/proxy/proxy_cli.py
    
    # 6. 启动前端(另开终端)
    cd ui/litellm-dashboard && npm install && npm run dev

    💡 Docker 快速启动:

    docker run -v $(pwd)/litellm_config.yaml:/app/config.yaml -p 4000:4000 berriai/litellm:latest

    🚀 核心功能

    🌐 统一 LLM 调用

    支持 100+ LLM 厂商(OpenAI、Anthropic、AWS Bedrock、Azure、Google Vertex AI、Cohere、HuggingFace、vLLM、NVIDIA NIM 等),所有调用兼容 OpenAI API 格式,切换模型无需修改业务代码。

    🛡️ AI 网关能力

    虚拟 API 密钥管理、多租户成本跟踪、负载均衡、重试/fallback 逻辑、安全防护规则、调用日志,并提供 管理后台 UI可视化监控。

    🤖 智能体(A2A)支持

    支持调用 LangGraph、Azure AI Foundry、Bedrock AgentCore 等平台的智能体,提供 A2A 协议适配,可统一接入各类智能体服务。

    🔗 MCP 工具桥接

    可将 MCP 服务器的工具转换为 OpenAI 格式 tool 定义,直接对接任意 LLM;支持通过网关统一代理 MCP 工具调用。

    🏢 企业级特性

    单点登录(SSO)、自定义集成、专属支持、SLA 保障、功能优先级定制。高性能:1k RPS 场景下 P95 延迟仅 8ms

    💡 典型使用场景

    场景一:多模型切换,代码零改动

    开发阶段使用 GPT-4o 快速验证,生产环境切换到 Claude Sonnet,只需修改 model 参数,业务代码无需任何改动:

    # 同一套代码,切换不同模型
    from litellm import completion
    
    response = completion(
        model="openai/gpt-4o",
        messages=[{"role": "user", "content": "Hello!"}]
    )
    
    response = completion(
        model="anthropic/claude-sonnet-4-20250514",
        messages=[{"role": "user", "content": "Hello!"}]
    )

    场景二:企业 LLM 调用管理与成本跟踪

    为不同团队/项目分配虚拟 API 密钥,按维度统计 LLM 调用花费,设置安全防护规则(如屏蔽敏感词、限制调用频率),所有调用日志可视化。

    知名用户包括:Stripe、Netflix、Google ADK、Grepile、OpenHands、OpenAI Agents SDK。

    场景三:MCP 工具无缝对接 LLM

    通过 LiteLLM 的 MCP 工具桥接功能,可以将任何 MCP 服务器的工具转换为 OpenAI 格式,让任意 LLM 都能调用这些工具,无需为每个 LLM 单独适配。

    💬 推荐理由

    LiteLLM 解决了 AI 应用开发中最痛点的问题之一——多厂商 LLM 接口不统一。以前需要为每个厂商写一套调用代码,现在只需一套 OpenAI 格式代码,通过 model="anthropic/claude-sonnet-4-20250514" 这样的格式就能无缝切换。

    对于需要调用多个 LLM 的应用(比如 AI Agent 系统),LiteLLM 几乎是标配组件。Stripe、Netflix、Google ADK 等大厂都在用,说明其稳定性和性能已经过生产验证。

    最打动我的一点:它不只做模型路由,还内置了成本跟踪、负载均衡、安全防护等企业级功能,真正把”调用 LLM”这件事做成了一个完整的网关产品,而不只是一个简单的路由库。

    LiteLLM – 让100+ LLM 调用,从此只有一种方式。

  • supermemory:25.6K Stars!AI时代记忆引擎,让AI真正记住你

    supermemory:25.6K Stars!AI时代记忆引擎,让AI真正记住你

    配图

    supermemory


    项目简介

    supermemory 是一个专为AI时代设计的记忆引擎,解决AI助手”转头就忘”的痛点。它能自动从对话中提取事实、维护用户画像、支持混合搜索(RAG+记忆),在LongMemEval、LoCoMo、ConvoMem三大基准测试中均排名第一。


    安装要求和过程

    环境要求

    环境 要求
    Node.js v18+
    Python 3.9+
    API Key supermemory.ai 控制台获取

    快速安装

    方式一:MCP服务器(推荐,无需写代码)

    # Claude/Cursor/Windsurf 一键安装
    npx -y install-mcp@latest https://mcp.supermemory.ai/mcp --client claude --oauth=yes
    

    方式二:API调用(开发者)

    # Node.js/TypeScript
    npm install supermemory
    
    # Python
    pip install supermemory
    

    方式三:官方应用(零代码)

    访问 app.supermemory.ai 直接使用,支持浏览器扩展、Discord机器人等多种接入方式。


    核心功能

    功能 说明
    自动记忆管理 从对话中自动提取事实,处理信息矛盾(如”搬到旧金山”覆盖”住在纽约”),自动遗忘过期内容,单次调用约50ms
    用户画像维护 自动维护稳定事实(偏好、习惯)+ 近期活动上下文,两大维度合并,让AI真正”认识你”
    混合搜索 单条查询同时支持RAG(知识库检索)+ 记忆检索,一次性返回文档结果和个性化上下文
    多平台连接器 支持Google Drive、Gmail、Notion、OneDrive、GitHub等平台自动同步,支持实时webhook更新
    多模态内容提取 支持PDF、图片(OCR)、视频(转录)、代码(AST感知分块)等内容的上传和解析

    典型使用场景

    场景一:给Claude/Cursor加上”永久记忆”

    通过MCP服务器接入后,AI助手会自动调用 memory 工具保存重要信息,调用 recall 工具搜索历史记忆。你说出”我喜欢TypeScript函数式编程”,AI下次写代码时会自动遵循这个偏好,不再需要每次重复背景。

    场景二:为AI产品构建上下文栈

    通过单个API调用获得完整的上下文能力,无需自己配置向量数据库、embedding管道、分块策略。Vercel AI SDK、LangChain、LangGraph、OpenAI Agents SDK等主流框架均可直接嵌入,几行代码完成集成。

    场景三:企业知识库+个人记忆融合

    supermemory的混合搜索模式,让AI既能检索企业知识库文档(RAG),又能记住每个用户的个性化偏好和历史对话(记忆),两种能力融合,特别适合企业AI助手、客服机器人等场景。


    推荐理由

    AI助手的”失忆症”是 currently 最大的体验短板——每次新对话都要重新介绍背景,让人疲惫。supermemory 把这个痛点打穿了。

    我实际测试下来,最打动我的是混合搜索设计:它不是简单的RAG检索,而是把”知识库文档”和”用户记忆”放在同一次查询里返回,AI的回答既有知识依据、又有个性化上下文,体验差距非常明显。

    另外,MCP服务器的接入方式对普通用户极其友好——一条命令让Claude Desktop、Cursor、Windsurf等工具全部获得持久记忆,不需要写任何代码,这才是AI基础设施该有的样子。

    三大基准测试全部排名第一,说明这个方向的技术路线是扎实的,不是噱头。


    下载地址

    来源 链接
    GitHub仓库 github.com/supermemoryai/supermemory(25.6K ⭐)
    官方网站 supermemory.ai
    文档中心 supermemory.ai/docs
    控制台 console.supermemory.ai
    npm包 npmjs.com/package/supermemory
    PyPI包 pypi.org/project/supermemory

    开源协议:MIT | 主要语言:TypeScript | 最后更新:2026年6月