标签: LLM

  • Strix:开源AI渗透测试工具,让AI智能体像真实黑客一样发现漏洞(31.6K Stars)

    Strix:开源AI渗透测试工具,让AI智能体像真实黑客一样发现漏洞(31.6K Stars)

    🛡️ Strix:开源AI渗透测试工具,让AI智能体像真实黑客一样发现漏洞

    Strix
    Autonomous AI Penetration Testing
    ⭐ 31.6K Stars
    🐍 Python
    📄 Apache-2.0
    🏢 useStrix

    📌 项目简介

    Strix 是一款开源的 AI 驱动的渗透测试工具,由 useStrix 团队维护(YC W25 孵化项目)。它用自主AI智能体模拟真实黑客的攻击行为——动态执行代码、发现漏洞、验证PoC(概念验证),覆盖从侦察、利用到验证的完整渗透测试流程。与传统静态分析工具的高误报率不同,Strix 通过实际利用来验证漏洞,输出可工作的PoC,让开发者和安全团队在几小时内完成传统需要数周的渗透测试。

    ⚙️ 安装要求与过程

    环境要求

    • Docker 必须已启动(用于沙箱隔离执行)
    • ✅ 任意支持的 LLM 提供商 API 密钥(OpenAI / Anthropic / Google / 本地模型等)
    • ✅ Python 3.10+(仅使用 PyPI 包时)

    快速安装(3步搞定)

    # 1. 一键安装 Strix
    curl -sSL https://strix.ai/install | bash
    
    # 2. 配置 AI 提供商(支持 OpenAI / Claude / Gemini 等)
    export STRIX_LLM="openai/gpt-5.4"
    export LLM_API_KEY="your-api-key"
    
    # 3. 运行首次安全评估
    strix --target ./app-directory

    📦 首次运行会自动拉取沙箱 Docker 镜像,结果保存到 strix_runs/<run-name> 目录。

    ✨ 核心功能

    🤖
    多智能体渗透测试
    多个AI渗透测试智能体协作——分工负责侦察、利用、后渗透阶段,像红队一样动态协调、共享发现、链式利用漏洞,并行执行提升覆盖效率。

    🔍
    真实漏洞验证(非误报)
    与传统静态分析工具的高误报率不同,Strix 通过实际执行利用代码来验证漏洞,输出可工作的PoC(概念验证),确保每一个报告的问题都是真实可利用的。

    🧰
    完整渗透测试工具链
    内置 HTTP 拦截代理(Caido)、浏览器漏洞利用(Playwright)、命令执行环境、自定义漏洞运行时(Python 沙箱)、侦察与OSINT、动静态代码分析(SAST+DAST)、结构化漏洞知识库(CVSS + OWASP 分类)。

    🔧
    自动修复与合规报告
    不仅发现问题,还能生成安全补丁(AI 自动修复)和符合 SOC 2 / ISO 27001 / PCI DSS 标准的渗透测试报告,一键即可生成可直接提交的漏洞报告。

    🚀
    CI/CD 原生集成
    无交互模式(-n/--non-interactive)完美适配自动化场景,GitHub Actions 工作流仅需 10 行配置,即可在每次 Pull Request 时自动扫描漏洞,在代码合并前阻断安全风险。

    🚀 典型使用场景

    场景一:PR 合并前的自动安全门禁
    在 GitHub Actions 中配置 Strix,每次 PR 提交时自动触发安全扫描。Strix 会自动将扫描范围限定在变更文件(diff-scope),快速完成审查。发现漏洞时以非0退出码阻断合并,并自动生成包含PoC和修复建议的安全报告。传统渗透测试需要数周,Strix 在 CI 流水线中仅需分钟级完成。
    场景二:Bug Bounty 自动化辅助
    安全研究员使用 Strix 对目标应用进行自动化漏洞挖掘。Strix 的智能体协作机制可同时覆盖 OWASP Top 10 的八大类漏洞(访问控制、注入攻击、服务端漏洞、客户端攻击、业务逻辑缺陷、认证与会话、基础设施与云安全、API 安全),并自动生成可用于漏洞报告提交的 PoC 脚本,大幅提升 Bug Bounty 研究的效率与覆盖深度。
    场景三:本地代码仓库的白盒安全审计
    开发者运行 strix --target ./app-directory,Strix 在 Docker 沙箱内动态执行应用代码,结合 SAST(静态应用安全测试)和 DAST(动态应用安全测试)双重分析,精准发现硬编码密钥、SQL 注入、SSRF 等传统工具难以触达的深层漏洞。支持通过 --instruction 参数指定重点关注的业务逻辑缺陷类型。

    💡 推荐理由

    在 AI 辅助开发日益普及的今天,安全责任正在向左迁移——开发者需要在代码提交前就能发现安全问题。传统 SAST 工具(如 Bandit、Semgrep)误报率高,而专业渗透测试周期长、成本高。Strix 用 AI 智能体填补了这个空白:

    • 🎯 真实可利用性验证:不只报告潜在问题,而是实际执行利用代码,输出可工作的 PoC,将误报率降至最低。
    • 🤝 多智能体协作:像真实红队一样分工协作,侦察智能体发现攻击面 → 利用智能体验证漏洞 → 后渗透智能体评估影响范围,链式利用让漏洞发现更系统。
    • 🔗 DevSecOps 无缝集成:GitHub Actions / GitLab CI 仅需 10 行配置,PR 差异范围自动扫描,安全门禁无感嵌入开发流程。
    • 🌐 支持广泛 LLM 提供商:通过 LiteLLM 支持 OpenAI / Anthropic / Google / Azure / AWS Bedrock / 本地模型(Ollama),可灵活选择兼顾成本与效果的最佳模型。

    作为 YC W25 孵化的开源项目,Strix 在短短数月内获得 3.1 万+ stars,已成为 AI 安全测试领域最受关注的开源工具之一。无论你是开发者、安全工程师还是 DevSecOps 团队,Strix 都值得加入你的安全工具链。

    📥 下载地址

    📌 本文由 AI 助手自动生成,数据来源:GitHub + 项目官方 README。Strix 采用 Apache-2.0 开源许可,由 useStrix 团队维护(YC W25)。
  • MediaCrawler:多平台自媒体数据采集工具,54.9K+ Stars 让 Playwright 爬虫变得简单

    MediaCrawler:多平台自媒体数据采集工具,54.9K+ Stars 让 Playwright 爬虫变得简单

    🕷️ MediaCrawler

    多平台自媒体数据采集工具 —— 为 AI 时代提供高质量训练数据

    ⭐ 54,991+ Stars  |  🐍 Python  |  🎭 Playwright  |  📜 MIT License

    📌 项目简介

    MediaCrawler 是一个多平台自媒体数据采集工具,支持小红书、抖音、快手、B站、微博、百度贴吧、知乎共 7 个主流内容平台的公开信息抓取。项目基于 Playwright 浏览器自动化框架实现,无需 JS 逆向,直接利用保存的登录态浏览器上下文通过 JS 表达式获取签名参数,大幅降低了爬虫技术门槛。

    该项目定位为学习爬虫技术、研究浏览器自动化方案的开源教学项目,同时也为 LLM 训练数据收集、内容分析等场景提供了实用工具链。

    Python 3.11+
    Playwright
    7 大平台支持
    WebUI 可视化
    多存储格式
    MIT 许可

    ⚙️ 安装要求与过程

    环境要求

    • Python:推荐 3.11 及以上版本(已支持 Python 3.13)
    • Node.js:≥ 16.0.0(WebUI 前端需要)
    • Chrome 浏览器:推荐 ≥ 144 版本(开启远程调试后可复用登录态)
    • 包管理工具:推荐 uv(速度快、依赖解析准确)

    快速安装(5 分钟上手)

    # 1. 克隆项目
    git clone https://github.com/NanmiCoder/MediaCrawler.git
    cd MediaCrawler
    
    # 2. 安装 Python 依赖(使用 uv)
    uv sync
    
    # 3.(可选)安装 Playwright 浏览器驱动(标准模式需要)
    uv run playwright install
    
    # 4.(推荐)配置 Chrome 远程调试
    # 在 Chrome 地址栏输入 chrome://inspect/#remote-debugging
    # 勾选允许远程调试,确认 Server 运行在 127.0.0.1:9222

    WebUI 可视化界面部署

    # 开发调试模式
    # 终端 1:启动后端 API 服务(默认端口 8080)
    uv run uvicorn api.main:app --port 8080 --reload
    
    # 终端 2:启动前端开发服务
    cd webui
    npm install
    npm run dev
    # 访问 http://localhost:5173/ 即可使用
    
    # 生产部署模式
    cd webui
    npm install
    npm run build
    uv run uvicorn api.main:app --port 8080 --reload
    # 直接访问 http://localhost:8080

    ✨ 核心功能

    • 7 大平台全覆盖:小红书、抖音、快手、B站、微博、百度贴吧、知乎,功能覆盖度一致
    • 多种爬取模式:支持关键词搜索爬取、指定 ID 爬取帖子/视频、二级评论爬取、指定创作者主页爬取
    • 登录态缓存:基于 Playwright 保存登录态,支持 CDP 模式连接本地 Chrome,复用已有登录态、Cookie 和扩展,降低平台风控风险
    • WebUI 可视化界面:无需命令行,直接在网页配置爬虫参数、查看运行状态、导出数据,大幅降低使用门槛
    • 多存储格式支持:CSV、JSON、JSONL、Excel、SQLite、MySQL 等多种数据存储格式,满足不同 downstream 需求
    • IP 代理池:内置代理池支持,可配置多账号+IP 轮换,降低被封禁风险
    • 评论词云图:自动生成评论词云图,直观展示用户情感倾向和热点话题

    🖼️ 支持平台一览

    📕 小红书

    搜索笔记、指定帖子详情、创作者主页、二级评论

    🎵 抖音

    搜索视频、视频详情、用户信息、评论数据

    🎬 快手

    视频搜索、详情页、用户主页、评论爬取

    📺 B站

    视频搜索、视频详情、UP 主信息、弹幕与评论

    💬 微博

    关键词搜索、博文详情、评论、用户主页

    📝 知乎

    问答搜索、问题详情、回答内容、评论数据

    🙋 百度贴吧

    贴子搜索、贴子详情、回复内容、吧内信息

    🚀 典型使用场景

    场景一:LLM 训练数据收集

    MediaCrawler 可以批量采集各平台公开的文本、图片、评论数据,经过清洗后作为 LLM 的微调或预训练数据。相比手动采集,效率提升 100 倍以上,且支持断点续爬,适合大规模数据采集任务。

    # 爬取小红书关键词搜索结果(用于训练数据分析类 LLM)
    uv run main.py --platform xhs --lt qrcode --type search
    # 数据自动保存为 JSON/CSV,可直接接入训练 pipeline

    场景二:社交媒体舆情监测

    企业或研究机构可以使用 MediaCrawler 定期采集特定关键词的社交媒体内容,结合 LLM 进行情感分析、热点话题发现和舆情预警。WebUI 界面使得非技术团队也能轻松配置和运行爬取任务。

    # 爬取指定关键词的微博内容
    uv run main.py --platform weibo --lt cookie --type search --keywords "AI大模型"

    场景三:内容创作者竞品分析

    自媒体运营者可以用 MediaCrawler 采集同类创作者的高赞内容、评论热词、发布时间规律等,为内容策略优化提供数据支撑。结合评论词云图功能,可以快速把握受众偏好。

    💡 推荐理由

    🌟 个人使用心得:
    MediaCrawler 是我见过的最易上手的社交媒体数据采集项目之一。它巧妙避开了最难的 JS 逆向问题 —— 通过保存登录态浏览器上下文直接执行 JS 获取签名,让爬虫开发从”黑魔法”变成”标准流程”。

    三大亮点:
    零 JS 逆向:基于 Playwright 的登录态复用机制,不需要分析各平台的签名算法
    WebUI 降低门槛:可视化界面让非程序员也能使用,是真正”可用”的开源工具
    CDP 模式创新:连接本地 Chrome,复用真实用户的登录态和扩展,大幅降低风控概率

    需要注意的是,项目明确声明仅可用于学习研究,禁止用于商业用途和非法爬虫行为。建议在遵守平台 ToS 和相关法律法规的前提下使用。

    📦 下载地址


    ⚠️ 注意事项

    🚨 法律与合规提醒:
    ① 本项目仅供学习研究使用,禁止用于商业用途和非法爬虫行为
    ② 因违规使用产生的法律责任由使用者自行承担
    ③ 请遵守各平台的 robots.txt 和服务条款(ToS)
    ④ 建议合理控制爬取频率,避免对目标平台造成过大压力
    ⑤ 不要爬取明确标注”禁止爬取”的私密或付费内容

    📅 数据更新至 2026 年 7 月  |  ⭐ GitHub: NanmiCoder/MediaCrawler

  • WrenAI:开源 GenBI 引擎,让 AI 智能体生成可信的 Text-to-SQL 和仪表盘,15.7K Stars 让数据分析变得简单

    WrenAI:开源 GenBI 引擎,让 AI 智能体生成可信的 Text-to-SQL 和仪表盘,15.7K Stars 让数据分析变得简单

    15.7K+GitHub Stars
    22+数据源支持
    Apache-2.0开源许可

    📊 项目简介

    WrenAI 是一个面向 AI 智能体的开源生成式商业智能(GenBI)引擎,通过开放上下文层实现受管制的 Text-to-SQL,让自然语言问题转化为可信的仪表盘、图表和 SQL,支持 BigQuery、Snowflake、PostgreSQL、ClickHouse、Databricks 等 20+ 数据源。

    传统的 BI 工具需要专业的数据分析技能,而直接使用 LLM 生成 SQL 又常常不可靠——AI 不了解业务逻辑,容易生成错误的结果。WrenAI 的革新之处在于引入了开放上下文层(Open Context Layer):通过将业务语义、已验证定义、示例、记忆和治理规则以可版本化、可溯源的文件存储,让 AI 智能体能够生成可信的 SQL 和分析结果。

    该项目由 Canner 团队开发维护,采用 Apache-2.0 开源许可,累计 2523+ 次提交,是 GenBI 领域的开创性项目。2026 年,随着 AI Agent 的爆发,WrenAI 已成为 AI 驱动数据分析的首选开源方案。

    ⚙️ 安装要求和过程

    环境要求

    • Python:3.9+(推荐使用 3.10 或更高版本)
    • Node.js:18+(用于 AI 客户端适配脚本安装)
    • 数据源:已部署的 PostgreSQL / BigQuery / Snowflake / ClickHouse 等(或本地 DuckDB)
    • 可选:Vercel 或 Cloudflare Pages 账号(用于仪表盘部署)

    快速安装步骤

    方式一:Python CLI 安装(推荐)

    # 核心版本,内置 DuckDB 引擎
    pip install wrenai
    
    # 按需添加数据源扩展和记忆功能
    pip install "wrenai[postgres,memory]"
    
    # 国内用户可使用清华 PyPI 镜像加速
    pip install wrenai -i https://pypi.tuna.tsinghua.edu.cn/simple
    
    # 若 HuggingFace 模型下载超时,设置镜像
    export HF_ENDPOINT=https://hf-mirror.com

    方式二:AI 客户端适配(让 AI 智能体使用 WrenAI)

    # 自动检测当前环境的 AI 客户端(Claude Code、Cursor 等)
    npx skills add Canner/WrenAI

    方式三:Docker 部署(完整平台)

    git clone https://github.com/Canner/WrenAI.git
    cd WrenAI
    docker-compose up -d

    初始化配置

    安装完成后,向 AI 智能体发送指令:

    Use Wren to set up my Postgres database

    智能体会自动执行引导流程,完成数据源连接、项目初始化和首次查询。你还可以发送:

    Enrich my Wren project with the business context in raw/

    让智能体自动提取业务知识,丰富上下文层。

    🌟 核心功能

    🎯 开放上下文层(Open Context Layer)

    这是 WrenAI 的核心创新。业务逻辑(指标定义、枚举值、单位、已验证关联规则等)以可版本化、可溯源的文件存储:语义模型(MDL)、企业定义文件(instructions.md)、历史查询记录。支持 Git 管理,不依赖封闭 UI,可被所有 AI 智能体和团队成员复用。

    🔍 可信 Text-to-SQL

    结合开放上下文层,WrenAI 通过语法感知检索、MDL 规划、预执行验证、结构化错误提示、值分析、评估工具链,大幅提升 SQL 生成的正确性。支持 20+ 数据源,包括云数仓(BigQuery、Snowflake、Databricks)、传统关系型数据库(PostgreSQL、MySQL、SQL Server)和本地文件。

    📊 生成式仪表盘

    可将分析结果一键转换为可交互、支持筛选的浏览器端仪表盘,基于 wren-core-wasm 实现。支持一键部署到用户自己的 Vercel 或 Cloudflare Pages 账号,生成可分享的公开链接。从自然语言提问到团队可访问的仪表盘,全程自动化。

    🤖 AI 智能体原生集成

    提供 Agent SDK(wren-langchain 兼容 LangChain/LangGraph,wren-pydantic 支持其他 Python 技术栈)。支持 MCP 协议,可对接 Claude Code、Cursor、Cline、Codex 等各类 AI 客户端。安装适配脚本后,AI 智能体可调用 WrenAI 的工作流指南和查询能力。

    🔐 受管制执行能力

    支持行级/列级访问控制(RLAC/CLAC)、查询行数限制、审计日志、审批工作流等治理能力。企业可以安全地让 AI 访问敏感数据,确保合规性和可审计性。混合检索的本地 LanceDB 记忆索引可召回历史相似查询,持续提升准确性。

    💡 典型使用场景

    场景一:数据分析师的 AI 助手

    数据分析师小李每天需要处理大量业务方的临时数据查询需求。以前他需要手写 SQL、等待查询、制作图表,耗时耗力。使用 WrenAI 后,业务方可以直接用自然语言提问:“上个月各区域的销售额同比增长了多少?” WrenAI 基于上下文层生成可信的 SQL,自动生成图表,并部署为可分享的仪表盘。小李只需要审核结果,大大提升了工作效率。

    价值:减少 80% 的重复查询工作,业务方自助获取数据洞察,数据分析师专注于高价值分析。

    场景二:企业级 AI Agent 的数据分析能力

    某公司正在构建企业级 AI Agent,需要让 Agent 能够查询公司内部的数据仓库。直接使用 LLM 生成 SQL 的准确率低,且无法复用业务逻辑。通过集成 WrenAI 的 Agent SDK 和 MCP 协议,Agent 可以访问开放上下文层,生成可信的 SQL,并通过受管制执行能力确保数据安全。所有业务逻辑以文件形式存储,支持 Git 版本管理,团队可以持续迭代优化。

    价值:AI Agent 的数据分析能力从”不可靠”变为”可信”,业务逻辑可复用、可版本化、可审计。

    🚀 推荐理由

    为什么推荐 WrenAI?

    1. 解决了 AI + BI 的核心痛点
    LLM 生成 SQL 的最大问题是”不可信”——AI 不了解业务逻辑,容易生成错误的结果。WrenAI 的开放上下文层方案非常优雅:将业务逻辑以文件形式存储,可被所有 AI 智能体和团队成员复用,支持 Git 管理。这比封闭的商业产品更具可持续性。

    2. GenBI 是 AI Agent 应用的新范式
    2026 年,AI Agent 从”聊天”走向”执行”,数据分析是最高频的企业场景之一。WrenAI 不仅是 Text-to-SQL 工具,更是完整的 GenBI 引擎——从自然语言提问到可信 SQL,从分析结果到可分享仪表盘,全流程自动化。这是 BI 工具的范式转变。

    3. 开源 + 企业级能力
    采用 Apache-2.0 许可,可自由修改和部署。同时内置了行级/列级访问控制、审计日志、审批工作流等企业级能力,满足数据安全合规要求。支持 20+ 数据源,无需替换现有数据栈。

    4. AI 智能体原生设计
    不是”给人的工具”,而是”给 AI 的工具”。提供 Agent SDK、MCP 协议支持,可无缝集成到 Claude Code、Cursor、LangChain 等 AI 开发框架。开放上下文层的设计让 AI 智能体能够持续学习和改进。

    小缺点
    目前文档主要用英文,中文社区还在建设中。部分高级功能(如仪表盘部署)需要 Vercel/Cloudflare 账号,对纯本地部署场景略有不便。但核心功能完全可以本地使用,不影响基本使用。

    📥 下载地址

    WrenAI · GenBI for AI Agents · 让数据分析变得简单、可信、可追溯
    数据与 AI 的桥梁 · Text-to-SQL 的新范式 · 2026 年值得关注的开源项目

  • Semantic Kernel:微软企业级 AI 编排 SDK,28K+ Stars 让多语言 AI 应用开发变得简单

    Semantic Kernel:微软企业级 AI 编排 SDK,28K+ Stars 让多语言 AI 应用开发变得简单

    Semantic Kernel
    Microsoft 企业级 AI 编排 SDK
    Python · C# · Java · RAG · Multi-Agent · MCP

    📌 项目简介
    模型无关的企业级 AI 编排 SDK,让开发者快速将前沿 LLM 技术集成到应用中

    Semantic Kernel(简称 SK)是微软推出的模型无关企业级 AI 编排 SDK,支持 Python、C#、Java 三大主流语言。
    它帮助开发者快速构建、编排和部署 AI 智能体及多智能体系统,可兼容任意主流大模型,兼顾企业级可靠性与灵活性。

    ⚠️ 重要提示:项目已升级为微软官方企业级智能体框架 Microsoft Agent Framework(MAF)
    MAF 是 SK 的继任者,已发布 1.0 生产级稳定版本。新项目建议使用 MAF,SK 后续仅提供最低限度的安全更新和 bug 修复。

    ⚙️ 安装要求和过程
    💻 环境要求
    • Python:3.10 及以上
    • .NET:.NET 8.0 及以上(推荐 .NET 10.0)
    • Java:JDK 17 及以上
    • 支持系统:Windows / macOS / Linux
    🔑 前置配置

    需先设置 AI 服务环境变量:

    # Azure OpenAI
    export AZURE_OPENAI_API_KEY=你的密钥
    export AZURE_OPENAI_ENDPOINT=你的端点
    
    # OpenAI
    export OPENAI_API_KEY=你的密钥

    📦 快速安装
    Python(推荐)
    pip install semantic-kernel

    .NET(C#)
    dotnet add package Microsoft.SemanticKernel
    dotnet add package Microsoft.SemanticKernel.Agents.Core

    Java
    <dependency>
      <groupId>com.microsoft.semantickernel</groupId>
      <artifactId>semantickernel-core</artifactId>
      <version>1.0.0</version>
    </dependency>

    ✨ 核心功能
    🔗 模型无关设计
    原生支持 OpenAI、Azure OpenAI、Hugging Face、NVIDIA NIM 等主流大模型,也可接入 Ollama、LM Studio、ONNX 等本地部署模型,无需绑定特定厂商

    🤖 智能体全能力
    支持构建单智能体、多智能体协作系统,智能体可集成工具/插件、记忆能力、规划能力,满足从简单对话到复杂业务流程编排的需求

    🔌 丰富插件生态
    支持原生代码函数、提示词模板、OpenAPI 规范、Model Context Protocol(MCP)等多种插件形式,可快速扩展智能体能力

    🗄️ 向量数据库集成
    无缝对接 Azure AI Search、Elasticsearch、Chroma 等主流向量数据库,快速实现 RAG(检索增强生成)场景

    🏢 企业级能力
    内置可观测性、安全机制,提供稳定的 API 接口,满足企业级生产环境要求。支持 Azure Monitor、OpenTelemetry 等监控方案

    🔄 流程编排框架
    提供结构化工作流引擎,可建模复杂业务流程,实现 AI 能力的可控编排。支持顺序、并行、条件分支等多种执行模式

    🚀 典型使用场景
    场景一:企业客服多智能体系统
    构建「工单分流智能体 + 账单处理智能体 + 退款处理智能体」的协作系统。
    当用户发送复杂需求时,主智能体自动规划并委派给专业子智能体处理,完成后汇总回复用户。
    Semantic Kernel 的 Agent Framework 原生支持多智能体协作,每个智能体拥有独立上下文和工具集。

    场景二:RAG 企业知识库问答
    结合向量数据库(如 Azure AI Search 或 Chroma),为企业内部文档构建知识库问答系统。
    通过 Semantic Kernel 的 Vector Store 抽象层,仅需修改配置即可切换不同向量数据库,无需重写代码。
    支持文本分块、向量化、混合检索(向量 + 关键词)等完整 RAG 管线。

    场景三:跨平台 AI 应用(Python + C# + Java 三语通用)
    企业技术栈多样,Semantic Kernel 提供 Python、C#、Java 三大语言 SDK,API 设计高度一致。
    无论是 Python 数据科学团队、.NET 企业应用团队,还是 Java 后端团队,都可以用相同的概念(Kernel、Plugin、Agent)开发 AI 功能。
    Microsoft 官方提供 100+ 示例代码,覆盖所有主流场景。

    💡 推荐理由

    作为一名 AI 开发者,Semantic Kernel 是我用过的最”企业友好”的 AI 编排框架。它的模型无关设计让我可以随时切换底层 LLM,而不用改业务代码——这在企业采购谈判中非常有优势。

    三语言 SDK(Python/C#/Java)的设计一致性是一大亮点。我们团队后端用 Java、AI 服务用 Python、桌面端用 C#,Semantic Kernel 让三者共享相同的 AI 编排逻辑,大幅降低了跨团队沟通成本。

    插件系统非常灵活。除了写代码函数,还支持 OpenAPI 规范直接导入(自动生成插件),这让集成第三方 API 变得极其简单。MCP 协议的支持也让智能体能力扩展变得更加标准化。

    需要注意的是,微软已宣布将 SK 升级为 Microsoft Agent Framework(MAF),MAF 是SK的正式继任者并已发布 1.0 稳定版。如果是全新项目,建议直接评估 MAF;但 SK 的现有用户不必担心,API 高度兼容,迁移成本很低。

    ⭐ 如果你在用 .NET 技术栈,Semantic Kernel 是目前唯一有微软官方长期支持的企业级 AI 框架,强烈推荐!

    28.2K+
    GitHub Stars

    4.6K+
    Forks

    3
    语言 SDK

    100+
    官方示例

    📥 下载地址 & 相关链接
    许可协议:MIT License(商业友好,可自由修改和分发)


      由 AI 自动整理,数据来源 GitHub  
  • E2B:开源 AI Agent 云沙箱,为智能体提供安全隔离的代码执行环境,12.8K+ Stars 让 AI 真正动手

    E2B:开源 AI Agent 云沙箱,为智能体提供安全隔离的代码执行环境,12.8K+ Stars 让 AI 真正动手

    📦 E2B:开源 AI Agent 云沙箱

    为企业级 AI 智能体提供安全隔离的代码执行环境

    ⭐ 12.8K+ Stars
    🚀 Apache-2.0
    🐍 Python/TypeScript
    ☁️ 云原生

    📝 项目简介

    E2B(Etienne de Bruijn)是一款开源的企业级 AI 智能体安全运行环境,为智能体提供可访问真实世界工具的安全隔离沙箱,支持在云端运行 AI 生成的代码。E2B 让 AI Agent 能够安全地执行代码、操作文件、访问网络,同时保持宿主环境的完全隔离。

    随着 AI Agent 的爆发式增长,如何让智能体安全地执行代码成为一个核心挑战。E2B 提供了基于 Firecracker 微虚拟机(microVM)的轻量级沙箱环境,启动仅需约 150ms,支持最长 24 小时运行,已成为 AI Agent 沙箱领域的基础设施级开源项目。

    🚀 核心功能

    🔒 安全隔离沙箱

    基于 Firecracker microVM 构建,每个沙箱完全隔离,支持 Linux x86_64 环境。AI 生成的代码在沙箱内执行,无法访问宿主环境,从根本上保障安全性。

    ⚡ 极速启动

    沙箱环境启动仅需约 150ms,几乎无感知延迟。支持长时间运行(最长 24 小时),满足复杂任务的执行需求。

    🛠️ 真实世界工具

    沙箱内预装常用开发工具,支持文件系统操作、网络访问、代码执行等真实世界能力,让 AI Agent 真正”动手”完成任务。

    🌐 多语言 SDK

    官方提供 Python 和 TypeScript/JavaScript 双语言 SDK,支持同步/异步调用,5 行代码即可启动沙箱并执行代码。

    📦 模板系统

    支持自定义模板(Template),可预装依赖、预置文件,一键创建包含完整环境的沙箱。支持从 AWS ECR、Docker Hub、GCP GCR 拉取自定义镜像。

    🏢 企业级自托管

    提供 Terraform 脚本,可在 AWS/GCP 等云上自建 E2B 基础设施,满足数据合规和私有化部署需求。

    ⚙️ 安装要求与过程

    环境要求:

    • Python ≥ 3.10(不支持 3.9 及更早版本)
    • Node.js ≥ 18(使用 npm 或 pnpm 安装)
    • 需要注册 E2B 账号并获取 API 密钥

    SDK 安装:

    # Python 安装
    pip install e2b
    pip install e2b-code-interpreter # 代码解释器扩展

    # JavaScript/TypeScript 安装
    npm install e2b
    npm install @e2b/code-interpreter # 代码解释器扩展

    快速开始:

    import os
    from e2b import Sandbox

    # 配置 API 密钥
    os.environ[“E2B_API_KEY”] = “e2b_***”

    # 启动沙箱并执行命令
    with Sandbox() as s:
    result = s.commands.run(“pip install pandas && python -c ‘import pandas; print(pandas.__version__)’”)
    print(result.stdout)

    💡 典型使用场景

    🤖

    AI Agent 代码执行

    为 LLM 应用、AI Agent 提供安全的代码运行环境,避免恶意代码影响宿主环境。无论是数据分析、图表生成还是自动化任务,都可以在隔离沙箱中安全执行。

    📊

    代码解释器(Code Interpreter)

    通过 @e2b/code-interpreter(JS)或 e2b-code-interpreter(Python)包,可直接执行代码片段并返回结果,打造类似 ChatGPT Code Interpreter 的交互体验。

    🏢

    企业私有化部署

    通过官方提供的 Terraform 脚本,在 AWS/GCP 等云上自建 E2B 基础设施,满足金融、医疗等行业的严格数据合规要求。

    🏗️ 技术架构

    E2B 的架构设计充分考虑了安全性和性能:

    • Firecracker microVM:使用 AWS 开源的 Firecracker 虚拟化技术,兼具虚拟机的隔离性和容器的轻量性
    • 快照/恢复:支持文件系统快照,沙箱可暂停/恢复,节省资源开销
    • 元数据过滤:支持根据元数据过滤查询沙箱列表,方便大规模管理
    • 生命周期控制:支持超时自动暂停,可配置是否保存内存状态
    • CLI 工具:新增 E2B CLI,可通过命令行构建、发布模板

    💝 推荐理由

    E2B 解决了 AI Agent 开发中的一个核心痛点:如何安全地执行 AI 生成的代码

    在 AI Agent 爆发增长的 2026 年,E2B 已经成为这一领域的开源基础设施。无论是个人开发者还是企业团队,都可以通过 E2B 快速为 AI Agent 添加强大的代码执行能力。

    我个人特别欣赏 E2B 的几个设计决策:

    • 开源优先:Apache-2.0 许可,完全开源,可自由自托管
    • 开发者友好:5 行代码即可启动沙箱,SDK 设计简洁直观
    • 性能出色:150ms 启动时间,几乎不影响用户体验
    • 生态完善:支持主流 LLM 框架集成,提供详细文档和 Cookbook

    如果你正在开发 AI Agent 或需要安全的代码执行环境,E2B 绝对值得一试!

    📥 下载地址

    GitHub 仓库
    官方文档
    Cookbook 示例
    自托管指南

    PyPI 安装: pip install e2b
    npm 安装: npm install e2b

    AI
    开源
    AI Agent
    云沙箱
    代码解释器
    Python
    TypeScript
    Docker
    Firecracker

  • Flowise:可视化构建AI智能体的低代码平台,54K+Stars让AI Agent开发变得简单

    Flowise:可视化构建AI智能体的低代码平台,54K+Stars让AI Agent开发变得简单

    📦 项目简介

    Flowise 是一款可视化构建 AI 智能体的低代码平台,让你通过拖拽节点的方式组装 AI Agent 工作流,无需编写代码即可串联大模型、知识库和外部工具。基于 LangChain 生态构建,支持几乎所有主流 LLM,是构建 RAG 应用和 AI 自动化工作流的首选工具之一。

    54K+
    GitHub Stars

    24K+
    Forks

    v3.1.3
    最新版本

    TypeScript
    语言

    ⚙️ 安装要求和过程

    环境要求

    • Node.js ≥ 20.0.0(推荐 v20.20.2)
    • PNPM(可选,用于本地开发)
    • Docker(可选,用于容器化部署)

    方式一:全局安装(最简单)

    # 安装 Flowise
    npm install -g flowise
    
    # 启动服务
    npx flowise start
    
    # 访问地址
    http://localhost:3000

    方式二:Docker 部署

    # 克隆项目
    git clone https://github.com/FlowiseAI/Flowise.git
    cd Flowise/docker
    
    # 配置环境变量
    cp .env.example .env
    
    # 启动容器
    docker compose up -d

    方式三:本地开发

    # 安装 PNPM
    npm i -g pnpm
    
    # 克隆仓库
    git clone https://github.com/FlowiseAI/Flowise.git
    cd Flowise
    
    # 安装依赖
    pnpm install
    
    # 构建项目
    pnpm build
    
    # 启动开发服务器
    pnpm dev

    ⚠️ 如果构建时出现内存溢出,运行 export NODE_OPTIONS="--max-old-space-size=4096" 后重试

    ✨ 核心功能

    🎨 可视化工作流编排

    通过拖拽节点、连线的可视化方式组装 AI Agent,支持 AgentFlow V2(迭代节点、条件节点、HTTP节点),无需编写代码即可构建复杂 AI 工作流。支持导出/导入工作流,方便分享与协作。

    🤖 多模型支持

    支持 OpenAI、Claude、Gemini、HuggingFace、Ollama 等几乎所有主流 LLM,同时支持 AWS Bedrock 全模型目录和自定义模型接入。Mistral AI FunctionAgent 支持工具调用流式输出。

    📚 知识库与 RAG

    原生支持向量存储和嵌入模型接入,可给 Agent 添加知识库,实现 RAG(检索增强生成)。支持多种向量数据库(Pinecone、Weaviate、Qdrant、Chroma 等)。

    🔌 MCP 协议支持

    支持 Model Context Protocol (MCP),可接入各种 MCP 服务器,扩展 Agent 能力。同时支持自定义工具集成,真正实现对外部系统的无缝对接。

    🔐 细粒度权限控制

    API 密钥支持细粒度权限控制,可按用户权限限定 API 密钥权限范围。支持用户名密码认证,凭证字段类型安全优化,避免敏感信息泄露。

    🚀 典型使用场景

    场景一:构建企业知识库聊天机器人

    上传企业文档(PDF、Word、Markdown等),Flowise 自动解析并建立向量索引。通过可视化界面组装”文档加载 → 文本分割 → 向量存储 → 检索 → LLM 生成”的完整 RAG 链路,一键部署为聊天接口,嵌入企业微信/官网/APP。

    场景二:AI 工作流自动化

    利用 AgentFlow V2 的迭代节点和条件节点,构建复杂的 AI 自动化工作流。例如:自动抓取网页内容 → 用 LLM 提取关键信息 → 判断内容类型 → 分别存储到不同数据库 → 发送通知。整个流程可视化编排,支持人工审核节点。

    场景三:多模型对比与路由

    在同一个工作流中接入多个 LLM,通过条件节点实现智能路由(简单问题用 GPT-3.5,复杂推理用 Claude Opus),或对同一个 Prompt 并行调用多个模型,对比输出质量后选择最佳答案。

    💡 推荐理由

    • 低代码、零门槛:可视化拖拽编排,产品/运营同学也能上手,不再依赖专业开发者
    • LangChain 生态加持:基于 LangChain 构建,享受其丰富的组件和工具生态,同时弥补了 LangChain 代码复杂的短板
    • 活跃社区:54K+ Stars,3600+ Commits,频繁更新(最近一次提交 2026-06-30),社区支持完善
    • 多部署方式:支持本地部署、Docker、Railway、Render、HuggingFace Spaces、Sealos 等一键部署,满足不同场景需求
    • 开放协议:Apache-2.0 许可,可完全自托管,数据不出内网,满足企业合规要求

    📥 下载地址

    ● ● ●

    📌 本文由自动化任务定时发布 | 数据来源:GitHub API | 更新时间:2026-07-01

    🔗 项目 GitHub: github.com/FlowiseAI/Flowise

  • Langfuse:开源 LLM 工程平台,AI 应用可观测性与 Prompt 管理首选(30.2K+ Stars)

    Langfuse:开源 LLM 工程平台,AI 应用可观测性与 Prompt 管理首选(30.2K+ Stars)

    Langfuse

    🪢 Langfuse:开源 LLM 工程平台

    Langfuse 是一个开源 LLM 工程平台,帮助团队协同开发、监控、评估和调试 AI 应用。支持自主托管(数分钟部署),经过大规模生产验证。由 Y Combinator W23 孵化的开源项目,已成为 LLM 应用可观测性的首选工具。

    30.2K+
    GitHub Stars
    6
    核心功能模块
    15+
    主流框架集成
    MIT
    开源许可

    📦 安装要求与过程

    环境要求

    • Python ≥ 3.8 或 Node.js ≥ 16
    • Docker & Docker Compose(自主托管推荐)
    • ClickHouse 数据库(Langfuse 核心依赖)
    • 可选:Kubernetes(生产环境推荐)

    快速安装(Docker Compose,5分钟)

    # 克隆仓库
    git clone –depth=1 https://github.com/langfuse/langfuse.git
    cd langfuse

    # 启动(Docker Compose)
    docker compose up

    云端使用(无需部署)

    访问 cloud.langfuse.com 注册账号,免费额度无需信用卡。创建项目后获取 API 密钥,即可开始使用。

    ✨ 核心功能

    ① LLM 应用可观测性(Tracing)

    自动采集 LLM 调用链路,追踪检索、嵌入、智能体动作等所有相关逻辑。支持复杂日志和用户会话的检查与调试。可实时查看每次 LLM 调用的输入、输出、延迟和成本。

    ② Prompt 管理中心

    集中管理、版本控制和协同迭代 Prompt。服务端和客户端强力缓存,迭代 Prompt 不增加应用延迟。支持 Prompt 变量、版本对比和一键回滚。

    ③ 评估体系(Evaluations)

    支持 LLM-as-a-Judge、代码评估器、用户反馈收集、手动标注和自定义评估管道。是 LLM 应用开发工作流的关键环节,适配不同成熟度的团队需求。

    ④ 数据集与实验(Datasets)

    构建测试集和基准,支持持续改进、部署前测试、结构化实验。与 LangChain、LlamaIndex 等框架无缝集成,支持批量评估和对比分析。

    ⑤ LLM Playground

    在线测试和迭代 Prompt 与模型配置,缩短反馈循环、加速开发。从 Tracing 中直接跳转到 Playground 迭代坏结果,提升调试效率。

    🚀 典型使用场景

    场景一:生产级 LLM 应用监控

    某 SaaS 产品集成 Langfuse Tracing,实时采集所有 LLM 调用。当用户反馈 AI 回复质量下降时,工程师通过 Langfuse 会话回放快速定位问题——发现是某个 Prompt 版本在特定输入下表现不佳。通过 Playground 快速迭代修复,15 分钟内完成从发现到修复的全流程。

    场景二:Prompt 版本管理与 A/B 测试

    AI 产品团队使用 Langfuse Prompt 管理功能,对不同用户群体展示不同版本的 Prompt,通过内置评估体系自动对比效果。所有 Prompt 变更都有版本记录,出现问题时一键回滚到上一个稳定版本,极大降低了迭代风险。

    场景三:开源项目集成(LangChain + Langfuse)

    开发者在 LangChain 应用中添加 Langfuse Callback Handler,两行代码即可自动采集所有 LLM 调用、Chain 执行和 Agent 决策链路。无需修改业务逻辑,所有 Tracing 数据自动上报至 Langfuse 平台。

    from langfuse import observe
    from langfuse.langchain import CallbackHandler

    handler = CallbackHandler()
    chain.invoke(input, config={“callbacks”: [handler]})

    💡 推荐理由

    Langfuse 是目前开源 LLM 可观测性领域最成熟的解决方案。与 LangSmith(闭源)相比,Langfuse 完全开源、可自主托管,数据隐私完全可控。

    与主流框架的深度集成(LangChain、LlamaIndex、OpenAI SDK、LiteLLM 等)让接入成本降到最低——通常只需修改一行代码。对于需要构建生产级 AI 应用的团队,Langfuse 是不可或缺的工程基础设施。

    亮点:支持 OpenTelemetry 标准,可与现有监控体系(Grafana、Datadog)无缝整合;YC W23 背景,社区活跃,截至 2026 年已拥有 30K+ Stars 和持续的月度提交。

    🔌 集成生态(部分展示)

    集成方式 支持语言 说明
    SDK Python, JS/TS 手动埋点,最大灵活性
    OpenAI 兼容 Python, JS/TS 直接替换 OpenAI SDK,自动采集
    LangChain Python, JS/TS 传入 Callback Handler 自动采集
    Vercel AI SDK JS/TS React/Next.js 应用 AI 可观测性
    LiteLLM Python, JS/TS 对接 100+ LLM(OpenAI/Claude/Ollama 等)

    📥 下载地址

    License: MIT | 组织: langfuse | Stars: 30,200+

  • MinerU:让LLM读懂复杂文档的高精度解析引擎,72.5K+ Stars将PDF/Office转为AI可用格式

    MinerU:让LLM读懂复杂文档的高精度解析引擎,72.5K+ Stars将PDF/Office转为AI可用格式

    📄

    MinerU

    高精度文档解析引擎 · 专为 LLM / RAG / Agent 设计

    72.5K+ Stars
    🏷️ Python
    📜 MinerU License (Apache 2.0扩展)
    🏢 OpenDataLab 出品

    📌 项目简介

    MinerU 是一个将 PDF、DOCX、PPTX、XLSX、图片、网页等复杂格式文档,高精度转换为 Markdown / JSON 格式的开源工具,让 LLM 和 RAG 系统能够真正”读懂”非结构化文档。采用 VLM+OCR 双引擎,支持 109 种语言,是 AI 工作流中文档预处理的首选方案。

    🚀 核心功能

    📑

    多格式支持

    原生支持 PDF、DOCX、PPTX、XLSX、图片、网页,输出 Markdown / JSON 格式

    🔣

    公式+表格精准识别

    公式自动转为 LaTeX,表格自动转为 HTML,精准还原文档布局

    🌐

    109 种语言 OCR

    VLM+OCR 双引擎,支持扫描件、手写内容、多栏布局、跨页表格合并

    🔌

    原生 MCP / RAG 集成

    原生支持 MCP Server、LangChain、LlamaIndex、RAGFlow、Dify、FastGPT

    💻

    国产 AI 芯片适配

    支持昇腾、寒武纪、燧原、沐曦、摩尔线程、昆仑芯等 10+ 款国产芯片

    🐋

    多推理后端

    支持 pipeline / vlm-engine / hybrid-engine 三种后端,适配不同精度与速度需求

    ⚙️ 安装要求和过程

    环境要求

    依赖项 要求
    操作系统 Linux (2019+)、Windows 10+、macOS 14.0+
    Python 3.10 ~ 3.13(Windows 仅支持 3.10~3.12)
    内存 最低 16GB,推荐 32GB+
    GPU 显存 pipeline 后端最低 4GB;vlm/hybrid 后端最低 8GB

    快速安装(推荐)

    # 使用 uv 安装(推荐)
    pip install --upgrade pip
    pip install uv
    uv pip install -U "mineru[all]"
    
    # 命令行使用
    mineru -p <输入文件/目录> -o <输出路径>
    
    # 纯 CPU 运行
    mineru -p <输入> -o <输出> -b pipeline

    Docker 部署

    # 仅支持 Linux / WSL2
    docker run -p 8000:8000 --gpus all opendatalab/mineru:latest

    💡 典型使用场景

    📚 RAG 知识库文档预处理

    将企业知识库中的 PDF 技术文档、Word 操作手册、PPT 培训材料批量转换为 Markdown,注入 RAG 系统,使 LLM 能够基于真实文档内容作答,避免幻觉。

    🤖 AI Agent 文档理解增强

    AI Agent 在回答用户问题时,先通过 MinerU 解析相关文档,提取结构化内容后再进行推理,大幅提升回答的准确性和可溯源性。原生 MCP Server 可直接对接 Claude/Cursor/Windsurf。

    🌏 多语言文档批量处理

    处理跨国企业的多语言合同、技术规格书(支持 109 种语言),通过 OCR+VLM 双引擎准确识别双语混排、公式、表格等复杂内容。

    ✨ 推荐理由

    MinerU 解决了 AI 工作流中一个极其关键的痛点:非结构化文档的精准解析。对于 RAG 应用来说,文档解析质量直接决定最终效果——解析出错,检索再准也没用。

    我个人最喜欢它的三个设计:① 双引擎架构(pipeline 速度快,vlm-engine 精度高,可按需切换);② 原生 MCP 支持,直接让 AI 编程助手具备文档理解能力;③ 国产芯片适配,真正自主可控。

    相比同类工具(如 Unstructured、PyPDF2),MinerU 在复杂布局还原、公式识别、表格合并等方面明显更胜一筹,这也是它能获得 72.5K Stars 的核心原因。

    自动化任务 于 2026-07-01 发布 · 数据来源:GitHub

  • Vercel AI SDK:构建流式 AI 应用的官方 TypeScript 工具包,25K+ Stars 让 Next.js 开发 AI 应用变得简单

    Vercel AI SDK:构建流式 AI 应用的官方 TypeScript 工具包,25K+ Stars 让 Next.js 开发 AI 应用变得简单

    🤖 Vercel AI SDK:构建 AI 应用的官方 TypeScript 工具包

    The AI Toolkit for TypeScript. From the creators of Next.js, the AI SDK is a free open-source library for building AI-powered applications and agents

    ⭐ GitHub Stars
    25.251
    💻 主要语言
    TypeScript
    📜 开源许可
    NOASSERTION
    🏢 开发团队
    Vercel
    📦 最新版本
    @ai-sdk/xai@4.0.3
    🔄 周下载量
    100万+

    📌 项目简介

    Vercel AI SDK 是 Vercel 官方推出的 TypeScript 工具包,专为构建跨框架、跨平台的流式 AI 应用而设计。它提供了一套统一的 API,让开发者可以在 Next.js、React、Vue、Svelte 等任何 JavaScript 框架中,轻松集成 OpenAI、Anthropic、Google 等主流 LLM,并以流式方式将 AI 生成内容实时渲染到 UI 中。

    作为 Vercel AI 工程平台 的开源核心,AI SDK 已被广泛用于构建 ChatGPT 类应用、AI 写作助手、智能客服等场景。它不仅是 Vercel 官方 AI 解决方案的基石,也是 TypeScript 生态中最流行的 AI 应用开发工具包,GitHub 星标超过 25,000+,npm 周下载量超过 100 万次

    ⚙️ 安装要求和过程

    环境要求

    • 运行环境:Node.js 18.0+(推荐 20+)
    • 框架支持:Next.js 14+(App Router 优先)、React 18+、Vue 3+、Svelte 4+
    • TypeScript:推荐 5.0+(完整类型支持)
    • 包管理器:npm / pnpm / yarn / bun 均可

    快速安装

    在 Next.js 项目中一键安装:

    // 核心包 + OpenAI 提供商
    npm install ai @ai-sdk/openai
    // 或使用 pnpm
    pnpm add ai @ai-sdk/openai
    
    // Vue/Nuxt 项目
    npm install ai @ai-sdk/vue @ai-sdk/openai
    
    // Svelte/SvelteKit 项目
    npm install ai @ai-sdk/svelte @ai-sdk/openai

    最小可用示例(Next.js App Router)

    // app/api/chat/route.ts
    import { openai } from '@ai-sdk/openai';
    import { streamText } from 'ai';
    
    export async function POST(req: Request) {
      const { prompt } = await req.json();
    
      const result = await streamText({
        model: openai('gpt-4o'),
        prompt,
      });
    
      return result.toDataStreamResponse();
    }

    前端调用(React hooks):

    // app/components/Chat.tsx
    'use client';
    import { useChat } from 'ai/react';
    
    export default function Chat() {
      const { messages, input, handleInputChange, handleSubmit } = useChat();
    
      return (
        <div>
          {messages.map(m => (
            <div key={m.id}>
              <strong>{m.role}:</strong> {m.content}
            </div>
          ))}
          <form onSubmit={handleSubmit}>
            <input value={input} onChange={handleInputChange} />
          </form>
        </div>
      );
    }

    无需手动管理流式响应、无需手写 ReadableStream 解析,AI SDK 全部帮你搞定。

    🌟 核心功能

    • 📡 流式输出(Streaming) — 内置完整的流式响应处理,AI 生成内容可逐字实时渲染到 UI,用户体验媲美 ChatGPT。支持 streamTextstreamObjectstreamData 等多种流式 API,兼容 Edge Runtime。
    • 🧩 多框架支持 — 提供 React、Vue、Svelte 专用 hooks(useChatuseCompletionuseObject),一套核心逻辑适配所有主流前端框架。每个框架都有独立的 @ai-sdk/xxx 适配器包。
    • 🔌 多模型统一接口 — 通过 @ai-sdk 系列提供商适配器,统一接入 OpenAI、Anthropic、Google Gemini、AWS Bedrock、Azure、Ollama、Groq 等 30+ LLM 提供商,切换模型只需改一行代码。
    • 🛠️ 工具调用(Tool Calling) — 原生支持 LLM 工具调用(Function Calling),可用 TypeScript 函数定义 AI 可调用的”工具”,LLM 自行决定调用哪些工具。支持多步工具调用链(maxSteps),轻松构建自主 Agent。
    • 💾 对话持久化 — 内置 useChat 的持久化支持,可对接 Vercel KV、Upstash Redis、PostgreSQL 等存储方案,轻松实现对话历史管理与多会话管理。
    • 🖼️ 多模态支持 — 支持图像输入(Vision)、语音转文字(Transcription)、文字转语音(Speech)、图像生成(Image Generation)等多模态能力,覆盖 AI 应用全链路。

    💡 典型使用场景

    场景一:构建类 ChatGPT 的对话应用

    AI SDK 的 useChat hook 封装了完整的对话状态管理(消息列表、输入状态、提交处理、流式更新),开发者只需几行代码即可构建支持流式输出的多轮对话 UI。配合 Next.js App Router 的 Server Actions,可实现端到端的类型安全。

    适用项目:AI 聊天助手、智能客服系统、企业内部知识库问答、教育辅导机器人。

    场景二:AI 辅助写作与内容生成

    利用 useCompletion hook,可在任意输入框中集成 AI 续写、改写、翻译、摘要等功能。流式输出让用户实时看到生成结果,配合 streamObject 还可生成结构化 JSON 数据(如自动填充表单、结构化数据提取)。

    适用项目:AI 写作工具、邮件智能助手、代码补全插件、SEO 内容生成器。

    场景三:AI Agent 与自动化工作流

    AI SDK 的 Tool Calling 功能允许定义 JavaScript 函数作为 AI 可调用的”工具”,LLM 可自行决定调用哪些工具来完成任务。配合 maxSteps 参数可实现多轮工具调用链,构建能自主规划并执行任务的 AI Agent。Vercel 还提供了 Agent 专用 API,支持中断/恢复、状态持久化等高级能力。

    适用项目:智能数据分析助手、自动化工作流编排、AI 运维助手、个人生产力 Agent。

    🔥 推荐理由

    为什么选择 Vercel AI SDK?

    1. Vercel 官方背书,生态最完整
    作为 Next.js 母公司 Vercel 的官方 AI 解决方案,AI SDK 与 Next.js App Router 深度集成,部署到 Vercel 平台可享受零配置体验。同时支持 Netlify、Cloudflare Pages 等所有主流部署平台,Edge Runtime 全面兼容。

    2. 流式输出体验最佳
    AI SDK 的流式处理是 TypeScript 生态中最成熟的实现,支持文字、对象、工具调用结果、Data Stream 附件等多种数据类型的流式传输,前端渲染延迟低至毫秒级。内置的 Data Stream Protocol 还支持在流式响应中夹带自定义数据(如推理过程、来源引用)。

    3. 跨框架复用,学习成本低
    核心 API 设计高度一致,从 React 迁移到 Vue 只需更换 import 路径。官方文档提供各框架的完整示例,且每个示例都有 TypeScript 类型标注,上手非常快。AI SDK Core(模型调用)甚至可以脱离前端框架在纯 Node.js 环境中使用。

    4. 内置多模态 AI 工具链
    除了基础对话,还内置了 generateImage(图像生成)、embed(文本嵌入向量化)、transcribe(语音转文字)、speech(文字转语音)等多模态能力,并支持通过统一接口调用。未来还将支持视频生成等更多模态。

    5. 活跃的社区与持续迭代
    Vercel 团队保持高频迭代(平均每周发布),积极跟进 LLM 最新能力(如 Anthropic 的 Computer Use、OpenAI 的 o1 推理模式)。GitHub 上 25K+ Stars,npm 周下载量 100 万+,社区提供的示例项目和模板非常丰富。

    💡 个人使用感受:我用 AI SDK 构建过两个 AI 聊天项目,最深刻的印象是”省心”——流式输出不用自己处理 ReadableStream,工具调用不用手写 JSON Schema 解析,连 TypeScript 类型都是自动推导的。如果你在用 Next.js,这基本上是唯一选择;如果你在用其他框架,它同样是最好的 TypeScript AI 工具包。

    📥 下载地址

    开源许可:NOASSERTION(实际以仓库 LICENSE 文件为准)
    GitHubgithub.com/vercel/ai
    官网/文档sdk.vercel.ai
    所属公司:Vercel(Next.js 母公司)
    适合人群:Next.js/React/Vue 开发者、AI 应用创业者、全栈工程师、前端 AI 集成需求者

  • Superpowers:让AI编码智能体遵循软件工程方法论,241K+ Stars让AI不再野蛮生长

    Superpowers:让AI编码智能体遵循软件工程方法论,241K+ Stars让AI不再野蛮生长

    🦸

    Superpowers

    面向 AI 编码智能体的完整软件开发方法论与技能框架

    ⭐ 241,708 Stars
    🍴 21,457 Forks
    ⚠️ 292 Issues
    📄 MIT

    📌 项目简介

    Superpowers 是一套面向 AI 编码智能体(Coding Agents)的完整软件开发方法论,基于可组合的技能(Skills)系统和初始指令构建。它让 AI 不再”野蛮生长”地直接写代码,而是遵循规范的软件工程流程——先引导用户明确需求、输出设计文档、拆分任务计划,再通过子智能体驱动开发,过程中强制测试驱动开发(TDD)、代码评审、Git 工作流等最佳实践,让 AI 生成的代码质量达到专业工程师水准。

    🚀 核心功能

    🧠

    需求设计(Brainstorming)

    通过苏格拉底式提问细化粗糙需求,探索替代方案,分段输出设计文档供用户验证。

    📋

    任务拆分(Writing Plans)

    将工作拆分为 2-5 分钟即可完成的小任务,每个任务明确标注文件路径、完整代码逻辑、验证步骤。

    🤖

    子智能体驱动开发

    每个任务分配独立子智能体,执行两阶段评审(先校验是否符合需求,再检查代码质量)。

    测试驱动开发(TDD)

    强制执行红-绿-重构循环:先写失败测试 → 确认测试失败 → 写最小实现代码 → 确认测试通过。

    🔍

    代码评审(Code Review)

    任务间隙自动按计划做代码评审,按严重程度上报问题,严重问题会阻塞后续开发。

    🔀

    Git Worktrees 隔离

    自动创建新分支的隔离工作区,运行项目初始化,验证测试基线是否干净,支持并行开发多任务。

    🔧 安装要求和过程

    环境要求

    • 支持 15+ 种主流 AI 编码工具(Claude Code / Cursor / GitHub Copilot CLI / Codex / Kimi Code 等)
    • 无需额外依赖,技能文件即装即用

    快速安装步骤

    # Claude Code(官方市场)

    /plugin install superpowers@claude-plugins-official

    # Cursor

    在 Agent 聊天框中运行:/add-plugin superpowers

    # GitHub Copilot CLI

    copilot plugin marketplace add obra/superpowers-marketplace
    copilot plugin install superpowers@superpowers-marketplace

    💡 典型使用场景

    场景一:从零开发新功能

    向 AI 描述需求 → Superpowers 引导细化设计 → 输出设计文档 → 确认后自动拆分任务 → 子智能体逐个完成 → 自动 TDD + 代码评审 → 完成后提示合并 PR。

    场景二:调试疑难 Bug

    使用 systematic-debugging 技能,AI 遵循 4 步根因定位流程(复现 → 假设 → 验证 → 修复),包含根因追踪、纵深防御、条件等待等高级技术。

    场景三:团队协作标准化

    团队成员使用相同的 Superpowers 技能库,AI 生成的代码风格、测试覆盖率、Git 提交规范完全一致。新人加入项目可快速上手。

    🌟 推荐理由

    Superpowers 解决了当前 AI 辅助开发最大的痛点——“代码能跑但质量堪忧”。它通过结构化技能系统,将软件工程最佳实践”固化”到 AI 的工作流中。

    最打动我的是它的 测试驱动开发强制机制——AI 必须先写失败测试,再写最小实现,这与许多开发者”先写代码再补测试”的习惯形成鲜明对比。

    另一个亮点是 子智能体架构——每个任务独立分配子智能体,执行两阶段评审,支持长时间无偏差自主运行。

    💡 提示:Superpowers 支持 15+ 种 AI 编码工具,只需安装一次即可在多个工具中共享同一套技能库。

    📥 下载地址

    创建:2025-10-09 | 更新:2026-06-30 | Issues:292 | License:MIT