标签: MIT许可

  • Supervision:Roboflow 开源计算机视觉工具库,46.3K+ Stars 让 CV 开发不再重复造轮子

    Supervision:Roboflow 开源计算机视觉工具库,46.3K+ Stars 让 CV 开发不再重复造轮子

    🔍 Supervision

    Roboflow 开源计算机视觉工具库

    ⭐ 46.3K+ Stars
    🍴 4.1K+ Forks
    🐍 Python
    📜 MIT 许可

    📌 项目简介

    Supervision 是 Roboflow 团队开发的开源 Python 计算机视觉工具库,提供模型无关的检测、跟踪、标注和数据集处理能力。它让你专注于业务场景,而不是重复编写基础 CV 工具函数。

    ✨ 核心特色

    🔗 模型无关设计

    内置 Ultralytics (YOLO)、Transformers、MMDetection、RF-DETR 等主流库的连接器,统一输出 sv.Detections 格式,换模型不改代码。

    🎨 丰富可视化标注

    提供 BoxAnnotator、MaskAnnotator、EllipseAnnotator、LabelAnnotator 等多种标注器,高度可定制,一行代码完成结果可视化。

    📦 数据集处理

    支持 COCO、YOLO、Pascal VOC、YOLOv8 Oriented Bounding Box 等格式的加载、拆分、合并、格式转换,一站式数据集管理。

    📹 视频分析工具

    内置目标跟踪(ByteTrack/Norfair)、区域计数、速度估计、驻留时间分析等常见 CV 任务的配套工具,开箱即用。

    ⚙️ 安装要求和过程

    环境要求

    • Python ≥ 3.10
    • 操作系统:Windows / macOS / Linux 全平台支持
    • 可选依赖:根据使用的模型后端选择安装(ultralytics / transformers / mmdet 等)

    快速安装

    # 使用 pip 安装(推荐)
    pip install supervision
    
    # 使用 conda 安装
    conda install -c conda-forge supervision
    
    # 从源码安装最新版
    pip install git+https://github.com/roboflow/supervision.git

    💡 安装后可在 Google Colab 中在线体验,或访问 HuggingFace Spaces 体验标注器效果。

    🚀 典型使用场景

    场景一:目标检测 + 可视化标注

    使用 YOLO 或 RF-DETR 模型进行目标检测,并用 Supervision 的标注器一键可视化结果:

    import cv2
    import supervision as sv
    from rfdetr import RFDETRSmall
    
    # 加载模型
    model = RFDETRSmall()
    image = cv2.imread("image.jpg")
    
    # 推理
    detections = model.predict(image, threshold=0.5)
    
    # 可视化
    box_annotator = sv.BoxAnnotator()
    label_annotator = sv.LabelAnnotator()
    
    annotated = box_annotator.annotate(
        scene=image.copy(), detections=detections
    )
    annotated = label_annotator.annotate(
        scene=annotated, detections=detections
    )
    
    cv2.imwrite("result.jpg", annotated)

    场景二:视频目标跟踪与区域计数

    对视频中的目标进行跨帧跟踪,并统计穿越特定区域的目标数量:

    import supervision as sv
    
    # 定义感兴趣区域(多边形)
    ZONE = sv.PolygonZone(
        polygon=sv.Polygon.from_file("zone.json")
    )
    
    tracker = sv.ByteTrack()
    
    for frame in sv.get_video_frames_generator("video.mp4"):
        detections = model.predict(frame)
        detections = tracker.update(detections)
        
        # 统计区域内的目标
        zone_count = ZONE.trigger(detections)
        print(f"区域内目标数: {zone_count}")

    场景三:数据集格式转换

    在不同标注格式之间自由转换,方便切换训练框架:

    import supervision as sv
    
    # 从 COCO 格式加载
    dataset = sv.DetectionDataset.from_coco(
        images_directory_path="data/train/images",
        annotations_path="data/train/_annotations.coco.json",
    )
    
    # 拆分为训练集和验证集
    train_ds, val_ds = dataset.split(split_ratio=0.8)
    
    # 保存为 YOLO 格式
    train_ds.as_yolo(
        images_directory_path="data/yolo/images/train",
        annotations_directory_path="data/yolo/labels/train",
    )

    💡 推荐理由

    计算机视觉开发者最头疼的事情之一,就是每次用新的检测模型都要重新写一遍数据预处理、结果解析、可视化标注、数据集转换的代码。Supervision 把这个痛点彻底解决了。

    它的 模型无关设计 是一大亮点——不管你用 YOLOv8、YOLO11、RT-DETR、SAM 还是 Grounding DINO,Supervision 都能以统一的 sv.Detections 格式输出结果,让你的下游代码完全不用改。

    另一个让人惊喜的地方是数据集处理工具。以前 COCO 转 YOLO 要写几十行脚本,现在几行代码就搞定。格式拆分、合并、统计类别分布,全都内置了。

    Roboflow 作为计算机视觉领域的头部公司,维护质量和文档完善度都非常高。PyPI 月下载量超百万,社区活跃,Discord 里提问基本当天就有回复。不管是做学术研究还是工业落地,这都是必备工具库。

    📊 项目信息

    GitHub Stars ⭐ 46,329+
    Forks 🍴 4,106+
    语言 🐍 Python
    许可 📜 MIT License
    最新版本 v0.29.0(要求 Python ≥ 3.10)
    创建时间 2022-11-28
    维护方 Roboflow 团队

    🤖 本文由 AI 自动生成 · 数据来源:GitHub – roboflow/supervision

  • CodeGeeX4:清华大学出品的9B全能代码模型,性能超越70B级大模型

    CodeGeeX4:清华大学出品的9B全能代码模型,性能超越70B级大模型

    CodeGeeX4
    清华大学 KEG 实验室 × 智谱 AI 联合出品
    ALL-9B 全能模型 · 代码生成 · Function Call · 仓库级理解
    ⭐ 最新一代
    🚀 9B 超越 70B
    🏆 BigCodeBench SOTA

    📝 项目简介

    CodeGeeX4 是清华大学 KEG 实验室与智谱 AI 联合推出的第四代多语言代码生成模型,基于 GLM-4-9B 持续训练,在代码生成、代码解释、Web 搜索、Function Call、仓库级 Q&A 等全场景软件开发生命周期中均提供卓越表现。仅 9B 参数即超越 Llama3-70B、DeepSeekCoder-33B 等超大模型,是当前 10B 以下参数规模中综合性能最强的代码模型。

    9B
    模型参数

    82.3%
    HumanEval Pass@1

    128K
    上下文长度

    ⭐ 30K+
    GitHub Stars

    ⚙️ 安装要求和过程

    💻 环境要求

    • Python 3.10+(推荐 3.11)
    • CUDA 12.1+(GPU 推理)
    • PyTorch 2.0+ 或 vLLM 0.5.1+
    • 内存:FP16 推理约 18GB,INT4 量化约 6GB
    • 操作系统:Windows / macOS / Linux 全平台支持

    🚀 快速安装(Ollama — 最简单)

    # 安装 Ollama(需 0.2+ 版本)
    # macOS/Linux:
    curl -fsSL https://ollama.com/install.sh | sh
    
    # Windows: 从 https://ollama.com/download 下载安装
    
    # 一键运行 CodeGeeX4
    ollama run codegeex4

    🐍 使用 transformers 推理

    pip install transformers==4.40.0 torch
    
    from transformers import AutoTokenizer, AutoModelForCausalLM
    import torch
    
    model = AutoModelForCausalLM.from_pretrained(
        "THUDM/codegeex4-all-9b",
        torch_dtype=torch.bfloat16,
        trust_remote_code=True
    ).cuda().eval()
    tokenizer = AutoTokenizer.from_pretrained(
        "THUDM/codegeex4-all-9b",
        trust_remote_code=True
    )
    
    # 对话格式
    prompt = [{"role":"user","content":"写一个快速排序"}]
    inputs = tokenizer.apply_chat_template(prompt, add_generation_prompt=True, return_tensors="pt").cuda()
    outputs = model.generate(inputs, max_new_tokens=256)
    print(tokenizer.decode(outputs[0], skip_special_tokens=True))

    ⚡ vLLM 高性能部署

    pip install vllm==0.5.1
    
    # 启动 OpenAI 兼容 API 服务
    python -m vllm.entrypoints.openai.api_server     --model THUDM/codegeex4-all-9b     --trust-remote-code     --tensor-parallel-size 1
    
    # 然后即可用 OpenAI SDK 调用
    # pip install openai
    # client = OpenAI(base_url="http://localhost:8000/v1", api_key="dummy")

    ✨ 核心功能

    💬 全场景代码助手
    支持代码补全、代码生成、代码解释、代码翻译、文档生成、Bug 修复等全场景,基于 ChatGLM2/GLM-4 架构,中英文理解能力优异。

    🔧 Function Call 原生支持
    唯一原生支持 Function Call 的代码模型,Function Call 执行成功率甚至超越 GPT-4。可无缝接入 AI Agent 工具调用链路。

    📦 仓库级代码理解
    支持 128K 超长上下文,可理解整个代码仓库。支持仓库级 Q&A、跨文件代码补全、自动 commit 等高级功能。

    🌐 多平台部署
    支持 Ollama / vLLM / transformers / Rust-candle 多种推理后端;支持 VS Code、JetBrains 全系列 IDE 插件;支持本地 / 云端双模式。

    🏆 性能全面领先(10B 以下模型)
    HumanEval 82.3% · MBPP 75.7% · NaturalCodeBench 40.4% · BigCodeBench 48.9%(complete)/ 40.4%(instruct)· CRUXEval-O 47.1%。在代码推理、代码理解、代码执行等全方位评测中均取得 10B 以下模型最佳成绩。

    🎯 典型使用场景

    场景一:IDE 智能编程助手(最适合日常使用)

    在 VS Code 或 JetBrains IDE 中安装 CodeGeeX 插件,即可体验:

    • 代码补全:根据上下文自动补全下一行 / 下一个函数
    • 上下文补全:基于仓库内其他文件提供跨文件补全建议
    • Ask CodeGeeX:中英文对话解决编程问题,支持代码解释、翻译、纠错
    • 本地模式:连接本地 Ollama 运行的 CodeGeeX4,数据完全不出本地

    💡 支持超过 100 种编程语言!

    场景二:AI Agent Function Call 工具

    CodeGeeX4 原生支持 Function Call,可以:

    • 作为 AI Agent 的代码生成工具,解析自然语言需求生成代码
    • 接入 OpenAI 兼容 API,与 LangChain / AutoGen 等 Agent 框架无缝集成
    • 支持仓库级代码操作(增删改文件),实现 AI 自动 commit
    • 结合 vLLM 部署,支持多并发、高吞吐的生产环境调用

    场景三:本地私有化部署(数据安全敏感场景)

    对于数据隐私有严格要求的企业 / 个人,CodeGeeX4 提供完善的本地部署方案:

    • 通过 Ollama 一行命令启动,INT4 量化仅需 6GB 显存
    • 支持连接 VS Code / JetBrains 插件,体验与云端一致
    • 支持昇腾 / NVIDIA 全系列硬件,包括国产 AI 芯片
    • 代码和数据完全不离开本地,满足企业合规要求

    💡 推荐理由

    作为 AI 编程工具的深度用户,我试用过 GitHub Copilot、Claude Code、Cursor 等各类产品,CodeGeeX4 给我留下了极其深刻的印象:

    ① 性价比无敌:9B 参数的小模型,性能直接干翻 70B 的 Llama3 和 33B 的 DeepSeekCoder。这意味着你用消费级显卡(甚至 6GB 显存的 RTX 3060)就能跑一个世界级代码模型。

    ② Function Call 是杀手锏:在 AI Agent 时代,代码模型不能只做补全,还要能调用工具。CodeGeeX4 是唯一原生支持 Function Call 的开源代码模型,而且执行成功率比 GPT-4 还高。这对构建 AI 编程 Agent 来说是个游戏规则改变者。

    ③ 清华大学 + 智谱 AI 双背书:KEG 实验室(唐杰教授团队)在 NLP 和代码生成领域深耕多年,CodeGeeX 系列从 2022 年做到 2026 年,四代演进,成熟度远超同类竞品。智谱 AI 的 GLM 架构也在持续迭代优化。

    ④ 真正可用的 IDE 插件:很多开源模型只提供权重,没有好的用户体验。CodeGeeX 的 VS Code / JetBrains 插件做得相当完善,上下文补全、跨文件理解、Ask CodeGeeX 对话,体验不输商业产品。

    如果你在找一个能本地部署、性能好、中文友好的 AI 编程助手,CodeGeeX4 是目前唯一的最优解

    📊 性能对比(10B 以下模型)

    模型 参数 HumanEval MBPP NCB Function Call
    CodeGeeX4-ALL-9B 9B 82.3% 75.7% 40.4% ✅ 超越GPT-4
    Llama3-70B-Instruct 70B 77.4% 82.3% 37.0%
    DeepSeekCoder-33B 33B 81.1% 80.4% 39.3%
    Codestral-22B 22B 81.1% 78.2% 46.0%

    数据来源:CodeGeeX4 官方 README,NCB = NaturalCodeBench

    📚 CodeGeeX 系列演进

    CodeGeeX(第一代,2022)
    13B 参数,基于华为昇腾芯片训练,在 20+ 编程语言上预训练。配套开源 HumanEval-X 多语言评测基准。Apache-2.0 开源。

    CodeGeeX2(第二代,2023)
    基于 ChatGLM2-6B,6B 参数即超越 15B 的 StarCoder。支持 8192 序列长度,量化后仅需 6GB 显存。HumanEval-X 全面提升(+57%~+321%)。

    CodeGeeX4(第四代,2024)
    基于 GLM-4-9B,9B 参数全能模型。支持 Function Call、仓库级 Q&A、128K 上下文。BigCodeBench / NaturalCodeBench / CRUXEval 全基准 SOTA。Apache-2.0 开源。

    由自动化任务发布 · GitHub 热门 AI 开源项目系列 · 清华大学 KEG 实验室 × 智谱 AI
  • MediaCrawler:多平台自媒体数据采集工具,54.9K+ Stars 让 Playwright 爬虫变得简单

    MediaCrawler:多平台自媒体数据采集工具,54.9K+ Stars 让 Playwright 爬虫变得简单

    🕷️ MediaCrawler

    多平台自媒体数据采集工具 —— 为 AI 时代提供高质量训练数据

    ⭐ 54,991+ Stars  |  🐍 Python  |  🎭 Playwright  |  📜 MIT License

    📌 项目简介

    MediaCrawler 是一个多平台自媒体数据采集工具,支持小红书、抖音、快手、B站、微博、百度贴吧、知乎共 7 个主流内容平台的公开信息抓取。项目基于 Playwright 浏览器自动化框架实现,无需 JS 逆向,直接利用保存的登录态浏览器上下文通过 JS 表达式获取签名参数,大幅降低了爬虫技术门槛。

    该项目定位为学习爬虫技术、研究浏览器自动化方案的开源教学项目,同时也为 LLM 训练数据收集、内容分析等场景提供了实用工具链。

    Python 3.11+
    Playwright
    7 大平台支持
    WebUI 可视化
    多存储格式
    MIT 许可

    ⚙️ 安装要求与过程

    环境要求

    • Python:推荐 3.11 及以上版本(已支持 Python 3.13)
    • Node.js:≥ 16.0.0(WebUI 前端需要)
    • Chrome 浏览器:推荐 ≥ 144 版本(开启远程调试后可复用登录态)
    • 包管理工具:推荐 uv(速度快、依赖解析准确)

    快速安装(5 分钟上手)

    # 1. 克隆项目
    git clone https://github.com/NanmiCoder/MediaCrawler.git
    cd MediaCrawler
    
    # 2. 安装 Python 依赖(使用 uv)
    uv sync
    
    # 3.(可选)安装 Playwright 浏览器驱动(标准模式需要)
    uv run playwright install
    
    # 4.(推荐)配置 Chrome 远程调试
    # 在 Chrome 地址栏输入 chrome://inspect/#remote-debugging
    # 勾选允许远程调试,确认 Server 运行在 127.0.0.1:9222

    WebUI 可视化界面部署

    # 开发调试模式
    # 终端 1:启动后端 API 服务(默认端口 8080)
    uv run uvicorn api.main:app --port 8080 --reload
    
    # 终端 2:启动前端开发服务
    cd webui
    npm install
    npm run dev
    # 访问 http://localhost:5173/ 即可使用
    
    # 生产部署模式
    cd webui
    npm install
    npm run build
    uv run uvicorn api.main:app --port 8080 --reload
    # 直接访问 http://localhost:8080

    ✨ 核心功能

    • 7 大平台全覆盖:小红书、抖音、快手、B站、微博、百度贴吧、知乎,功能覆盖度一致
    • 多种爬取模式:支持关键词搜索爬取、指定 ID 爬取帖子/视频、二级评论爬取、指定创作者主页爬取
    • 登录态缓存:基于 Playwright 保存登录态,支持 CDP 模式连接本地 Chrome,复用已有登录态、Cookie 和扩展,降低平台风控风险
    • WebUI 可视化界面:无需命令行,直接在网页配置爬虫参数、查看运行状态、导出数据,大幅降低使用门槛
    • 多存储格式支持:CSV、JSON、JSONL、Excel、SQLite、MySQL 等多种数据存储格式,满足不同 downstream 需求
    • IP 代理池:内置代理池支持,可配置多账号+IP 轮换,降低被封禁风险
    • 评论词云图:自动生成评论词云图,直观展示用户情感倾向和热点话题

    🖼️ 支持平台一览

    📕 小红书

    搜索笔记、指定帖子详情、创作者主页、二级评论

    🎵 抖音

    搜索视频、视频详情、用户信息、评论数据

    🎬 快手

    视频搜索、详情页、用户主页、评论爬取

    📺 B站

    视频搜索、视频详情、UP 主信息、弹幕与评论

    💬 微博

    关键词搜索、博文详情、评论、用户主页

    📝 知乎

    问答搜索、问题详情、回答内容、评论数据

    🙋 百度贴吧

    贴子搜索、贴子详情、回复内容、吧内信息

    🚀 典型使用场景

    场景一:LLM 训练数据收集

    MediaCrawler 可以批量采集各平台公开的文本、图片、评论数据,经过清洗后作为 LLM 的微调或预训练数据。相比手动采集,效率提升 100 倍以上,且支持断点续爬,适合大规模数据采集任务。

    # 爬取小红书关键词搜索结果(用于训练数据分析类 LLM)
    uv run main.py --platform xhs --lt qrcode --type search
    # 数据自动保存为 JSON/CSV,可直接接入训练 pipeline

    场景二:社交媒体舆情监测

    企业或研究机构可以使用 MediaCrawler 定期采集特定关键词的社交媒体内容,结合 LLM 进行情感分析、热点话题发现和舆情预警。WebUI 界面使得非技术团队也能轻松配置和运行爬取任务。

    # 爬取指定关键词的微博内容
    uv run main.py --platform weibo --lt cookie --type search --keywords "AI大模型"

    场景三:内容创作者竞品分析

    自媒体运营者可以用 MediaCrawler 采集同类创作者的高赞内容、评论热词、发布时间规律等,为内容策略优化提供数据支撑。结合评论词云图功能,可以快速把握受众偏好。

    💡 推荐理由

    🌟 个人使用心得:
    MediaCrawler 是我见过的最易上手的社交媒体数据采集项目之一。它巧妙避开了最难的 JS 逆向问题 —— 通过保存登录态浏览器上下文直接执行 JS 获取签名,让爬虫开发从”黑魔法”变成”标准流程”。

    三大亮点:
    零 JS 逆向:基于 Playwright 的登录态复用机制,不需要分析各平台的签名算法
    WebUI 降低门槛:可视化界面让非程序员也能使用,是真正”可用”的开源工具
    CDP 模式创新:连接本地 Chrome,复用真实用户的登录态和扩展,大幅降低风控概率

    需要注意的是,项目明确声明仅可用于学习研究,禁止用于商业用途和非法爬虫行为。建议在遵守平台 ToS 和相关法律法规的前提下使用。

    📦 下载地址


    ⚠️ 注意事项

    🚨 法律与合规提醒:
    ① 本项目仅供学习研究使用,禁止用于商业用途和非法爬虫行为
    ② 因违规使用产生的法律责任由使用者自行承担
    ③ 请遵守各平台的 robots.txt 和服务条款(ToS)
    ④ 建议合理控制爬取频率,避免对目标平台造成过大压力
    ⑤ 不要爬取明确标注”禁止爬取”的私密或付费内容

    📅 数据更新至 2026 年 7 月  |  ⭐ GitHub: NanmiCoder/MediaCrawler

  • Semantic Kernel:微软企业级 AI 编排 SDK,28K+ Stars 让多语言 AI 应用开发变得简单

    Semantic Kernel:微软企业级 AI 编排 SDK,28K+ Stars 让多语言 AI 应用开发变得简单

    Semantic Kernel
    Microsoft 企业级 AI 编排 SDK
    Python · C# · Java · RAG · Multi-Agent · MCP

    📌 项目简介
    模型无关的企业级 AI 编排 SDK,让开发者快速将前沿 LLM 技术集成到应用中

    Semantic Kernel(简称 SK)是微软推出的模型无关企业级 AI 编排 SDK,支持 Python、C#、Java 三大主流语言。
    它帮助开发者快速构建、编排和部署 AI 智能体及多智能体系统,可兼容任意主流大模型,兼顾企业级可靠性与灵活性。

    ⚠️ 重要提示:项目已升级为微软官方企业级智能体框架 Microsoft Agent Framework(MAF)
    MAF 是 SK 的继任者,已发布 1.0 生产级稳定版本。新项目建议使用 MAF,SK 后续仅提供最低限度的安全更新和 bug 修复。

    ⚙️ 安装要求和过程
    💻 环境要求
    • Python:3.10 及以上
    • .NET:.NET 8.0 及以上(推荐 .NET 10.0)
    • Java:JDK 17 及以上
    • 支持系统:Windows / macOS / Linux
    🔑 前置配置

    需先设置 AI 服务环境变量:

    # Azure OpenAI
    export AZURE_OPENAI_API_KEY=你的密钥
    export AZURE_OPENAI_ENDPOINT=你的端点
    
    # OpenAI
    export OPENAI_API_KEY=你的密钥

    📦 快速安装
    Python(推荐)
    pip install semantic-kernel

    .NET(C#)
    dotnet add package Microsoft.SemanticKernel
    dotnet add package Microsoft.SemanticKernel.Agents.Core

    Java
    <dependency>
      <groupId>com.microsoft.semantickernel</groupId>
      <artifactId>semantickernel-core</artifactId>
      <version>1.0.0</version>
    </dependency>

    ✨ 核心功能
    🔗 模型无关设计
    原生支持 OpenAI、Azure OpenAI、Hugging Face、NVIDIA NIM 等主流大模型,也可接入 Ollama、LM Studio、ONNX 等本地部署模型,无需绑定特定厂商

    🤖 智能体全能力
    支持构建单智能体、多智能体协作系统,智能体可集成工具/插件、记忆能力、规划能力,满足从简单对话到复杂业务流程编排的需求

    🔌 丰富插件生态
    支持原生代码函数、提示词模板、OpenAPI 规范、Model Context Protocol(MCP)等多种插件形式,可快速扩展智能体能力

    🗄️ 向量数据库集成
    无缝对接 Azure AI Search、Elasticsearch、Chroma 等主流向量数据库,快速实现 RAG(检索增强生成)场景

    🏢 企业级能力
    内置可观测性、安全机制,提供稳定的 API 接口,满足企业级生产环境要求。支持 Azure Monitor、OpenTelemetry 等监控方案

    🔄 流程编排框架
    提供结构化工作流引擎,可建模复杂业务流程,实现 AI 能力的可控编排。支持顺序、并行、条件分支等多种执行模式

    🚀 典型使用场景
    场景一:企业客服多智能体系统
    构建「工单分流智能体 + 账单处理智能体 + 退款处理智能体」的协作系统。
    当用户发送复杂需求时,主智能体自动规划并委派给专业子智能体处理,完成后汇总回复用户。
    Semantic Kernel 的 Agent Framework 原生支持多智能体协作,每个智能体拥有独立上下文和工具集。

    场景二:RAG 企业知识库问答
    结合向量数据库(如 Azure AI Search 或 Chroma),为企业内部文档构建知识库问答系统。
    通过 Semantic Kernel 的 Vector Store 抽象层,仅需修改配置即可切换不同向量数据库,无需重写代码。
    支持文本分块、向量化、混合检索(向量 + 关键词)等完整 RAG 管线。

    场景三:跨平台 AI 应用(Python + C# + Java 三语通用)
    企业技术栈多样,Semantic Kernel 提供 Python、C#、Java 三大语言 SDK,API 设计高度一致。
    无论是 Python 数据科学团队、.NET 企业应用团队,还是 Java 后端团队,都可以用相同的概念(Kernel、Plugin、Agent)开发 AI 功能。
    Microsoft 官方提供 100+ 示例代码,覆盖所有主流场景。

    💡 推荐理由

    作为一名 AI 开发者,Semantic Kernel 是我用过的最”企业友好”的 AI 编排框架。它的模型无关设计让我可以随时切换底层 LLM,而不用改业务代码——这在企业采购谈判中非常有优势。

    三语言 SDK(Python/C#/Java)的设计一致性是一大亮点。我们团队后端用 Java、AI 服务用 Python、桌面端用 C#,Semantic Kernel 让三者共享相同的 AI 编排逻辑,大幅降低了跨团队沟通成本。

    插件系统非常灵活。除了写代码函数,还支持 OpenAPI 规范直接导入(自动生成插件),这让集成第三方 API 变得极其简单。MCP 协议的支持也让智能体能力扩展变得更加标准化。

    需要注意的是,微软已宣布将 SK 升级为 Microsoft Agent Framework(MAF),MAF 是SK的正式继任者并已发布 1.0 稳定版。如果是全新项目,建议直接评估 MAF;但 SK 的现有用户不必担心,API 高度兼容,迁移成本很低。

    ⭐ 如果你在用 .NET 技术栈,Semantic Kernel 是目前唯一有微软官方长期支持的企业级 AI 框架,强烈推荐!

    28.2K+
    GitHub Stars

    4.6K+
    Forks

    3
    语言 SDK

    100+
    官方示例

    📥 下载地址 & 相关链接
    许可协议:MIT License(商业友好,可自由修改和分发)


      由 AI 自动整理,数据来源 GitHub  
  • openpilot:开源机器人操作系统,让300+款车型升级智能驾驶辅助,62.9K+ Stars让自动驾驶触手可及

    openpilot:开源机器人操作系统,让300+款车型升级智能驾驶辅助,62.9K+ Stars让自动驾驶触手可及

    openpilot

    COMMA.AI 开源 · MIT许可 · 62.9K+ STARS

    🚗 项目简介

    openpilot 是由 comma.ai 开发的开源机器人操作系统,目前主要功能是升级 300+ 款支持车型的驾驶辅助系统。作为目前最成熟的开源自动驾驶辅助系统,openpilot 让用户能够以极低的成本将普通车辆升级为具备 Lane Keep Assist(车道保持)、Adaptive Cruise Control(自适应巡航)等高级辅助驾驶功能的智能汽车。

    ⚠️ 注意 openpilot 是 Alpha 级别的研究软件,仅供研究用途,并非商业产品。使用需遵守当地法律法规。

    62.9K+
    GitHub Stars
    300+
    支持车型
    11K+
    Fork 数量
    2016
    创立年份

    安装要求和过程

    📦 硬件要求

    • 支持的设备:comma four(官方推荐),也可在其他硬件上运行
    • 车辆兼容性:确认你的车型在 300+ 支持车型列表
    • 车辆线束:需要购买 comma 车辆线束 连接 comma four 和车辆

    ⚡ 快速安装

    1. 购买设备:在 comma.ai/shop 购买 comma four
    2. 安装线束:按照 官方安装指南 安装车辆线束和设备
    3. 安装软件:在 comma four 设置中输入自定义软件 URL:openpilot.comma.ai 即可安装稳定版
    4. 快速启动(开发环境):bash <(curl -fsSL openpilot.comma.ai)

    🔀 分支选择

    设备分支 URL 说明
    release-mici openpilot.comma.ai 稳定发布分支(推荐)
    release-mici-staging openpilot-test.comma.ai 预发布版本,提前体验新功能
    nightly openpilot-nightly.comma.ai 开发前沿分支,稳定性不保证

    ✨ 核心功能

    🚙
    广泛的车型支持
    覆盖 300+ 款主流车型,可直接升级原厂驾驶辅助系统,让更多车主享受智能驾驶体验。
    🛡️
    安全合规
    遵循 ISO 26262 功能安全标准,安全模型代码由 C 语言编写,经过多轮严格测试验证。
    🧪
    完善的测试体系
    每次提交运行软件在环测试;panda 模块包含 SIL/Safety 测试;10 台设备持续复现行驶路线测试。
    🤖
    机器人操作系统
    openpilot 定位为机器人操作系统,不仅限于汽车,未来可扩展至更多机器人应用场景。
    📊
    灵活的数据管理
    默认上传驾驶数据用于模型训练,用户可自主关闭数据收集;仅驾驶员摄像头和麦克风需主动开启才会记录。
    🌐
    活跃的开源社区
    MIT 协议开源,11K+ Forks;Discord 社区活跃;comma 提供 赏金计划 激励外部贡献者。

    🎯 典型使用场景

    场景一:升级现有车辆的驾驶辅助系统
    如果你拥有一辆支持的车(如本田、丰田、现代等主流品牌),购买 comma four 和设备线束后,即可将车辆升级为具备 Lane Keep Assist(车道保持)和 Adaptive Cruise Control(自适应巡航)功能的半自动驾驶汽车,体验媲美原厂高级辅助驾驶系统的能力。
    场景二:AI 与自动驾驶研发学习
    openpilot 是学习 自动驾驶技术 的绝佳开源项目。代码架构清晰,包含完整的感知、规划、控制链路;遵循 ISO 26262 安全标准;提供丰富的 开发工具;研究者可以在真实车辆数据上验证自己的算法。
    场景三:机器人操作系统研究
    openpilot 的定位是 机器人操作系统,其架构设计具有通用性。研究者可以基于 openpilot 的感知-决策-控制框架,扩展到其他机器人应用场景,如无人配送车、农业机器人等,探索通用机器人 OS 的可能性。

    💡 推荐理由

    我推荐 openpilot 的原因有以下几点:

    • 真实可用的自动驾驶开源系统:不同于许多停留在论文或仿真层面的项目,openpilot 是真正能在真实车辆上运行的自动驾驶辅助系统,已有数万用户日常使用。
    • 门槛极低:只需要购买 comma four(约 $400)和车辆线束,即可让你的车具备高级辅助驾驶能力,成本远低于更换新车。
    • MIT 协议完全开源:代码完全透明,社区活跃,11K+ Forks 意味着丰富的二次开发生态。
    • 持续迭代:comma.ai 全职团队持续维护,每天都有新的提交,Github 最近更新是今天(2026-07-01),项目非常活跃。
    • 数据驱动:默认收集匿名驾驶数据用于模型训练,这意味着 openpilot 的模型会随着使用人数增加而越来越好,形成正向循环。

    个人建议:如果你对自动驾驶技术感兴趣,或者希望以极低成本体验高级辅助驾驶功能,openpilot 是目前唯一成熟的开源选择。不过请记住,这只是 Alpha 级别的研究软件,使用时务必保持注意力,随时准备接管车辆。

    🔬 技术架构亮点

    🧠 感知模块
    基于神经网络的车道线检测、前车识别、交通标志识别等感知任务,运行在 comma four 的骁龙处理器上。
    📡 CAN 总线接口
    通过 panda 板(CAN 转 USB)与车辆 CAN 总线通信,读取车辆状态并发送控制指令,代码经 ISO 26262 安全认证。
    🎯 规划与控制
    基于模型预测控制(MPC)的路径规划和车辆控制算法,在保证安全的前提下实现平滑的横向和纵向控制。
    📱 comma connect
    用户可通过 comma connect 平台查看驾驶数据、管理设备、下载行车记录,形成完整的数据闭环。

    📥 下载地址

    comma.ai 官方商店:https://comma.ai/shop

    快速安装命令:bash <(curl -fsSL openpilot.comma.ai)

    📌 本文由 AI 自动整理,信息来自 GitHub 开源仓库,最新动态请关注官方仓库。

    MIT许可
    Python
    自动驾驶
    机器人

  • NextChat:轻量快速的跨平台 AI 助手,88K+ Stars 让部署专属 ChatGPT 变得简单

    NextChat:轻量快速的跨平台 AI 助手,88K+ Stars 让部署专属 ChatGPT 变得简单

    💬 NextChat

    轻量快速的跨平台 AI 助手,一键部署专属 ChatGPT 替代品

    ⭐ 88,330+ Stars | Fork 59,509+ | MIT 许可

    一句话介绍:NextChat(原 ChatGPT-Next-Web)是一款轻量、快速的跨平台 AI 助手,支持 Web、iOS、macOS、Android、Linux、Windows 全平台,兼容几乎所有主流大模型 API,是部署私人 AI 聊天服务的首选开源方案。

    📦 安装要求与过程

    环境要求

    • Node.js ≥ 18(本地开发)
    • Docker ≥ 20(容器部署)
    • Vercel / Zeabur / Gitpod 账号(一键部署)
    • Tauri 运行时(桌面客户端)

    方式一:Vercel 一键部署(推荐)

    1. 访问 NextChat GitHub 仓库,点击 README 中的 Vercel 部署按钮
    2. 在 Vercel 中配置环境变量:OPENAI_API_KEY(必填)、CODE(访问密码,选填)
    3. 点击部署,约 1 分钟内完成,获得专属域名

    方式二:Docker 部署

    docker run -d -p 3000:3000 \
      -e OPENAI_API_KEY=sk-xxxx \
      -e CODE=your-password \
      yidadaa/chatgpt-next-web

    如需开启 MCP 功能,添加 -e ENABLE_MCP=true

    方式三:直接下载客户端(无需部署)

    • 网页端直接使用:app.nextchat.club
    • 桌面端下载:GitHub Releases(Windows/macOS/Linux,约 5MB)
    • iOS App:在 App Store 搜索 “NextChat AI” 下载

    🚀 核心功能

    🌐
    全平台支持
    Web、iOS、macOS、Android、Linux、Windows 六端全覆盖,Tauri 桌面端仅约 5MB,PWA 网页端无需安装

    🔌
    多模型兼容
    支持 OpenAI、Azure、Google Gemini、Anthropic Claude、百度、阿里云、DeepSeek、智谱 ChatGLM 等数十家厂商 API

    🔒
    隐私优先
    所有数据默认存储在浏览器本地,桌面端 Tauri 版本支持直接调用 API,避免前端暴露密钥

    🧩
    MCP & 插件扩展
    支持 Model Context Protocol(需开启 ENABLE_MCP),支持插件系统扩展网络搜索、计算器、第三方 API 等能力

    🎨
    Artifacts 内容预览
    支持 Artifacts & Stable Diffusion,可单独窗口预览、复制、分享生成的内容/网页,支持实时对话

    极致性能优化
    首屏仅约 100KB,支持流式响应,自动压缩聊天历史以节省 Token,支持长对话

    💡 典型使用场景

    场景一:个人私有 AI 聊天服务

    通过 Vercel 一键部署,绑定自己的域名,接入 OpenAI / DeepSeek / Claude 等 API,为个人或团队提供专属 AI 聊天界面。相比官方 ChatGPT,无地域限制、支持多模型切换、聊天记录完全私有。

    场景二:企业内网 AI 助手(私有化部署)

    通过 Docker 或企业服务器部署,接入企业内部知识库,配合 MCP 协议连接企业数据源。NextChat 提供企业定制版,支持品牌定制、权限管控、安全审计、私有化部署,满足企业合规需求。

    场景三:多模型对比与 Prompt 调试

    利用 Prompt 模板(Mask)功能,创建、分享和调试自定义聊天工具。在同一界面中切换不同模型对比输出质量,配合 Artifacts 功能实时预览生成的网页或内容,大幅提升 AI 辅助开发效率。

    ✨ 推荐理由

    NextChat 是我用过的最流畅的开源 AI 聊天界面。相比其他同类项目,它的核心优势在于 “轻量”和”快速”——首屏仅约 100KB,Tauri 桌面端不到 5MB,从打开到开始对话只需几秒。

    对于个人用户,Vercel 一键部署真的做到了”1分钟上线”;对于企业用户,MIT 许可 + 私有化部署 + MCP 支持,让它可以无缝融入企业 AI 基础设施。支持 14 种语言(含简体中文),对国内用户非常友好。

    如果你在寻找一个 ChatGPT 的开源替代品,或者需要为团队搭建私有 AI 聊天服务,NextChat 是目前 GitHub 上 Star 最多、最活跃的选择之一,88K+ Stars 和 59K+ Forks 的数据足以证明其实力。

    本文由 AI 自动整理,信息来自 GitHub 仓库,最新版本请以官方为准。

  • FunASR:阿里达摩院出品的工业级语音识别工具包,18.6K+ Stars 让中文语音识别又快又准

    FunASR:阿里达摩院出品的工业级语音识别工具包,18.6K+ Stars 让中文语音识别又快又准

    ASR

    FunASR:阿里达摩院出品的工业级端到端语音识别工具包

    ModelScope(阿里达摩院) 出品 · 18.6K+ Stars · 1.9K+ Forks · MIT 许可

    FunASR 是阿里达摩院 ModelScope 团队开发的工业级端到端语音识别工具包
    支持 170 倍实时识别速度、50+ 语言、内置说话人日志与情感检测,并提供兼容 OpenAI 的 API 接口。
    相比 Whisper,FunASR 在中文和方言识别上准确率更高,CPU 场景运行速度更快,是开源语音识别领域最实用的生产级工具包。

    18.6K+
    GitHub Stars

    50+
    支持语言

    170x
    实时识别速度

    MIT
    开源许可

    ⚙️ 安装要求和过程

    环境要求

    • Python ≥ 3.8
    • 需先安装 PyTorch 和 torchaudio
    • GPU 可选(CPU 场景亦可运行,SenseVoice 模型可达 17 倍实时)
    • 可选:vLLM(加速推理)、Docker(容器部署)

    快速安装

    # 从 PyPI 安装(推荐)
    pip install funasr
    pip install funasr[cli]      # 包含 CLI 命令行工具
    
    # 从源码安装
    git clone https://github.com/modelscope/FunASR.git
    cd FunASR
    pip install -e ./
    
    # Docker 一键部署 API 服务
    docker run -p 8000:8000 funasr/funasr-server:latest

    🚀 核心功能

    170倍实时识别速度

    旗舰模型 Fun-ASR-Nano 配合 vLLM 加速可达 340 倍实时,比 Whisper 快 26 倍;CPU 场景下 SenseVoice 模型可达 17 倍实时

    🌍

    50+ 语言支持

    Qwen3-ASR 支持 52 种语言,Fun-ASR-Nano 支持 31 种语言,覆盖全球主流语种,适合国际化应用

    🎯

    内置多任务能力

    单模型调用即可完成 VAD 分段、语音识别、说话人分离、标点恢复、时间戳、情感/音频事件识别,无需额外模型

    🔄

    流式实时识别

    支持音频流逐块输入,适合实时字幕、语音实时转写场景,支持逐字/逐句流式输出

    🔌

    OpenAI 兼容 API

    提供兼容 OpenAI 语音识别 API 的接口,可对接 LangChain、Dify、AutoGen 等 AI 框架;提供 MCP Server 可接入 Claude Code、Cursor 等智能体

    💡 典型使用场景

    🎤 本地音频快速转录

    无需 GPU 即可使用,单条命令完成音频转录,支持输出纯文本、JSON、SRT 字幕等格式

    funasr audio.wav
    funasr audio.wav --output-format json
    funasr audio.wav --output-format srt --output-dir ./subs

    👥 会议长音频处理

    单模型调用同时完成 VAD 分段、语音识别、说话人分离,适合会议、访谈等长音频场景

    from funasr import AutoModel
    
    model = AutoModel(
        model="iic/SenseVoiceSmall",
        vad_model="fsmn-vad",
        spk_model="cam++",
        device="cuda"
    )
    result = model.generate(
        input="meeting_record.wav",
        batch_size_s=300,
    )

    🚀 生产级 API 部署

    一键启动兼容 OpenAI 的 API 服务,可对接现有基于 OpenAI API 的应用,无需修改代码

    # 启动服务
    funasr-server --device cuda
    
    # 调用(兼容 OpenAI API)
    curl http://localhost:8000/v1/audio/transcriptions \
      -F file=@sample.wav -F model=sensevoice

    🌟 推荐理由

    FunASR 是开源语音识别领域最实用的工业级工具包。相比 Whisper,它在中文和方言识别上准确率更高,CPU 场景运行速度更快(17 倍实时),且内置了说话人分离、情感检测等额外能力,无需像 Whisper 那样集成多个模型。

    最让我惊喜的是它的 OpenAI 兼容 API——只需改一行代码,就能把基于 Whisper 的应用无缝迁移到 FunASR,且中文识别准确率显著提升。此外,它还提供 MCP Server,可直接接入 Claude Code、Cursor 等 AI 编程助手,让语音识别能力融入 AI 工作流。

    MIT 许可允许商用,且支持边缘设备无 Python 运行时部署(llama.cpp/GGUF),真正做到了全场景覆盖。如果你在做语音相关的 AI 应用,FunASR 是目前最好的开源选择。

    📥 下载地址

    ⭐ 如果你觉得这篇文章有用,欢迎在 GitHub 上给 FunASR 点个 Star!
  • OpenAI Agents SDK:OpenAI官方多智能体框架,27K+ Stars让Agentic AI开发变得简单

    OpenAI Agents SDK:OpenAI官方多智能体框架,27K+ Stars让Agentic AI开发变得简单

    OpenAI Agents SDK 架构图

    OpenAI Agents SDK 多智能体编排架构示意图(图片来源:OpenAI 官方文档)

    项目简介

    OpenAI Agents SDK 是 OpenAI 官方出品的轻量级、强大的多智能体工作流编排框架,2025年3月开源,至今已获得 27,470+ Stars 和 4,227 Forks。一句话概括:让你用极简的 Python 代码,构建生产级的多智能体 AI 应用

    与 LangChain、AutoGen 等第三方框架不同,Agents SDK 是 OpenAI 官方原生维护,与 OpenAI API 深度集成,同时支持 100+ 其他 LLM(通过 LiteLLM),真正做到了 provider-agnostic(提供商无关)。

    🌟 核心定位:不是另一个 AI 框架,而是 OpenAI 对「如何构建 Agentic AI 应用」的官方最佳实践。如果你在用 GPT/Claude 构建智能体应用,这是目前最权威的参考实现。

    安装要求和过程

    环境要求

    • Python:3.10 及以上版本
    • 依赖:Pydantic v2、httpx、mcp-python-sdk
    • API Key:OpenAI API Key(或兼容的其它 LLM)

    快速安装

    # 使用 pip(推荐)
    pip install openai-agents
    
    # 使用 uv(更快)
    uv add openai-agents
    
    # 语音功能支持(可选)
    pip install 'openai-agents[voice]'
    
    # Redis 会话支持(可选)
    pip install 'openai-agents[redis]'
    

    最小可运行示例

    import os
    from agents import Agent, Runner
    
    # 设置 API Key(支持任何兼容 OpenAI API 的服务)
    os.environ["OPENAI_API_KEY"] = "your-api-key"
    
    agent = Agent(
        name="Assistant",
        instructions="你是一个有帮助的助手。",
    )
    
    result = Runner.run_sync(agent, "用一句话解释什么是 MCP?")
    print(result.final_output)
    

    核心功能

    🤖 1. Agents — 智能体定义

    通过声明式 API 定义智能体:配置指令(instructions)、工具(tools)、安全护栏(guardrails)和交接策略(handoffs)。每个 Agent 是一个独立的 LLM 调用上下文。

    🔄 2. Handoffs — 智能体交接

    一个智能体可以将对话「交接」给另一个智能体,实现专业分工。例如: triage Agent → 路由到 billing Agent / technical Agent,是构建多智能体系统的核心机制。

    🛡️ 3. Guardrails — 输入/输出安全护栏

    可配置的安全检查,在 Agent 执行前后验证输入和输出。支持自定义 guardrail 函数,实现内容审核、敏感信息过滤、输出格式校验等。

    🔧 4. Tools + MCP — 工具与协议扩展

    支持函数工具(function tools)、MCP 服务器工具、托管工具(web search / file search / computer use)。MCP 协议原生支持,可接入 1000+ 工具生态。

    📊 5. Tracing — 内置可观测性

    所有 Agent 运行自动记录追踪信息,可在 OpenAI Traces Dashboard 查看、调试和优化工作流。无需额外配置,开箱即用。

    📦 6. Sandbox Agents — 容器化工作空间

    v0.14.0 新增功能。Agent 可以在隔离的容器环境中执行真实工作(读写文件、运行命令、应用补丁),支持长时间跨会话的任务。可用于代码审查、自动修复等场景。

    🎙️ 7. Realtime Agents — 语音智能体

    基于 gpt-realtime-2 模型构建语音智能体,支持实时语音对话,完整集成 Agent 所有功能(工具调用、handoffs、guardrails)。可用于构建 AI 客服、语音助手等。

    💬 8. Sessions — 会话历史管理

    自动管理跨多次运行的对话历史,开发者无需手动维护上下文。支持 Redis 持久化,适合生产环境。

    典型使用场景

    场景一:客户服务多智能体系统

    构建一个客服系统,用户消息首先进入 Triage Agent,根据问题类型自动交接给:

    • Billing Agent:处理账单、退款、付费问题
    • Technical Agent:处理技术故障、错误排查
    • Escalation Agent:复杂问题升级人工处理(Human-in-the-loop)

    每个专业 Agent 有自己的指令、工具和知识库,Handoffs 实现无缝切换。Guardrails 确保用户输入和 Agent 输出符合安全规范。

    场景二:AI 编程助手(代码审查+自动修复)

    利用 Sandbox Agents 在隔离环境中运行 AI 编程助手:

    • Agent 克隆代码仓库到沙箱
    • 阅读代码、分析 Issue
    • 生成修复方案并执行测试
    • 自动提交 PR

    整个过程在沙箱中完成,不影响生产环境。支持跨长时间任务(分钟级到小时级)。

    场景三:语音 AI 助手(Realtime Agent)

    基于 Realtime Agents 构建语音助手:

    • 用户通过语音提问
    • gpt-realtime-2 实时理解并响应
    • Agent 调用工具(查天气、搜信息、控制智能家居)
    • 支持中断、插话、多轮对话

    可用于 AI 客服热线、语音笔记助手、语言学习陪练等场景。

    推荐理由

    作为一个深度使用过 LangChain、AutoGen、CrewAI 等框架的开发者,OpenAI Agents SDK 是目前我最推荐的入门和生产级多智能体框架,原因如下:

    1. 官方背书,长期维护有保障:由 OpenAI 官方团队维护,与 OpenAI API 深度集成,未来能力(如 Realtime API、Computer Use)会第一时间支持。不用担心框架突然停更。
    2. 设计极简,学习曲线平缓:核心概念只有 Agents / Handoffs / Tools / Guardrails / Tracing 五个,API 设计直观。相比 LangChain 的复杂抽象,Agents SDK 让你专注于业务逻辑。
    3. Provider-agnostic,不绑定 OpenAI:虽然由 OpenAI 维护,但通过 LiteLLM 支持 100+ LLM(Anthropic / Gemini / DeepSeek / 本地 Ollama 等)。你可以在开发时用 GPT-4o,生产时切换到更便宜的模型。
    4. 内置 Tracing,调试不再抓瞎:所有 Agent 运行自动记录到 OpenAI Platform,可以查看每次 LLM 调用、工具执行、handoff 传递的完整链路。这是其他框架需要自己搭建的可观测性系统。
    5. 生产级特性齐全:Guardrails(安全护栏)、Human-in-the-loop(人工介入)、Sessions(会话管理)、沙箱隔离,这些都是生产环境必需但很多框架忽视的特性。

    ⚠️ 注意事项:Agents SDK 是 Python-first 框架,如果你需要 JS/TS 版本,可以查看 openai-agents-js。另外,Tracing 功能默认将数据传输到 OpenAI Platform,如数据隐私有要求,可以配置自定义 tracing processor。

    项目数据一览

    指标 数据
    GitHub Stars 27,470+ ⭐
    Forks 4,227
    主要功能 多智能体编排、Handoffs、Guardrails、Tracing、MCP、Sandbox Agents、Realtime
    编程语言 Python(也支持 JS/TS)
    开源许可 MIT License
    维护方 OpenAI 官方
    创建时间 2025年3月11日
    最后更新 2026年6月27日(非常活跃 🔥)

    下载地址

    🚀 OpenAI Agents SDK 让构建生产级多智能体应用变得简单而强大。如果你正在做 AI Agent 项目,这应该是你的首选框架。

  • Haystack:构建生产级 LLM 应用的首选 AI 编排框架,25K+ Stars 让 RAG 和 Agent 工作流完全透明可控

    Haystack:构建生产级 LLM 应用的首选 AI 编排框架,25K+ Stars 让 RAG 和 Agent 工作流完全透明可控

    Haystack Banner

    Haystack 是由 deepset 团队(已被 Cohere 收购)开发的开源 AI 编排框架,专为构建生产级 LLM 应用而设计。它让开发者以显式控制的方式设计模块化 Pipeline 和 Agent 工作流,覆盖 RAG、多模态、语义搜索、问答系统和自主智能体等场景。

    📦 安装要求和过程

    环境要求

    • Python >= 3.9(推荐 3.10+)
    • pip 包管理器
    • 可选:Docker(用于容器化部署)
    • 可选:GPU(用于本地模型推理加速)

    快速安装

    # 安装稳定版
    pip install haystack-ai

    # 安装 nightly 预览版(尝鲜最新功能)
    pip install –pre haystack-ai

    # 验证安装
    python -c “import haystack; print(haystack.__version__)”

    💡 可选依赖:pip install haystack-ai[openai,anthropic,mistral] 可一次性安装主流模型提供商支持。

    🚀 核心功能

    🧠

    上下文工程优先

    显式控制信息检索、排序、过滤、组合、结构化和路由的全流程。Pipeline 和 Agent 工作流完全透明、可追踪。

    🔄

    模型与厂商无关

    集成 OpenAI、Mistral、Anthropic、Cohere、HuggingFace、Azure、AWS Bedrock、本地模型等。切换模型或基础设施无需重写系统。

    🧩

    模块化与可定制

    内置检索、索引、工具调用、记忆、评估等组件,也可自定义。支持循环、分支和条件逻辑,精确控制上下文流转。

    🌐

    可扩展生态系统

    通过统一接口构建和共享自定义组件,社区和第三方可轻松扩展 Haystack。支持 Hayhooks 将 Pipeline 包装为 REST API 或 MCP 服务器。

    💡 典型使用场景

    1

    企业级 RAG 知识库系统

    某德国联邦部委使用 Haystack 构建了面向公众的语义搜索系统,支持多语言文档检索和精准问答。通过 Haystack 的混合检索(稠密+稀疏向量)和重排序功能,实现了比传统关键词搜索高出 3 倍的准确率。系统部署在私有云上,数据完全合规。

    2

    多模态 AI 客服助手

    某欧洲航空公司使用 Haystack 构建了支持文本+图片输入的客服 Agent,客户可以上传行李损坏照片,Agent 自动检索相关政策文档并生成处理建议。Haystack 的多模态 Pipeline 设计让文本和视觉信息在统一框架下协同工作,大幅缩短了投诉处理周期。

    🌟 推荐理由

    💬 笔者心得

    在尝试了 LangChain、LlamaIndex 等多个 LLM 应用框架后,Haystack 给我留下的印象是「透明」和「可控」。与 LangChain 的「黑盒」链式调用不同,Haystack 的 Pipeline 是显式定义的——每个组件的输入输出、数据流向都一目了然,调试起来非常直观。

    特别值得一提的是 Haystack 对上下文工程(Context Engineering)的重视。在 RAG 系统中,如何精准控制检索策略、如何组合多路召回结果、如何设计记忆机制,这些才是决定效果的关键。Haystack 把这些控制权交给了开发者,而不是封装成不可见的「魔法」。

    另外,Haystack 的企业级基因也很突出——它诞生于 deepset 的商业化实践,从第一天就考虑了生产部署、可观测性、访问控制等现实需求。现在 deepset 被 Cohere 收购,Haystack 企业版(Haystack Enterprise Platform)更是提供了托管化生产 setup,对的企业用户来说是很好的选择。

    📥 下载地址

    🌐 官方网站

    haystack.deepset.ai

    🐙 GitHub 仓库

    github.com/deepset-ai/haystack

    25,730+ Stars · 2,884+ Forks

    📚 官方文档

    docs.haystack.deepset.ai

    💬 Discord 社区

    discord.gg/qZxjM4bAHU

    🐍 PyPI 安装

    pip install haystack-ai

    🍳 Cookbook 食谱

    haystack.deepset.ai/cookbook

    📊 项目速览
    ⭐ Stars:25,730+
    🍴 Forks:2,884+
    📅 创建时间:2019-11
    🔄 最近更新:2026-06-26
    📝 开源许可:Apache-2.0
    💻 主要语言:Python
    🏢 维护团队:deepset(Cohere 旗下)
    🌟 用户案例:Apple、Meta、NVIDIA、Netflix、Airbus 等

  • deer-flow:ByteDance 开源超级智能体框架,74K+ Stars 让 AI 处理小时级复杂任务

    deer-flow:ByteDance 开源超级智能体框架,74K+ Stars 让 AI 处理小时级复杂任务

    2026年2月,ByteDance(科技公司)开源了其内部打磨多时的超级智能体框架 deer-flow 2.0,发布当天即登顶 GitHub Trending 榜首,目前已收获 74,000+ Stars。这不仅仅是一个”AI聊天机器人”,而是一个能够处理分钟级到小时级复杂任务的长周期智能体框架——从深度研究、代码编写,到内容创作、幻灯片制作,deer-flow 都能自主规划并执行。

    🦌 项目简介

    deer-flow(鹿流)是 ByteDance 开源的长周期超级智能体框架(Super Agent Harness),由初代 Deep Research 框架完全重构而来。它支持研究、编码、内容创作等复杂任务,通过沙箱隔离、持久化记忆、工具调用、子智能体协作等能力,处理从几分钟到数小时的各类任务。2.0 版本为完全重构版本,架构更清晰、扩展性更强。

    deer-flow GitHub OpenGraph 图片
    deer-flow 2.0 – ByteDance 开源超级智能体框架

    🛠 安装要求和过程

    环境要求

    • Python:3.12+(推荐使用 uv 管理依赖)
    • Node.js:22+(前端界面需要)
    • pnpm:前端包管理工具
    • Docker:推荐部署方式(可选,用于沙箱隔离)
    • 操作系统:macOS / Linux / Windows(WSL2)

    快速安装(3分钟上手)

    # 1. 克隆仓库
    git clone https://github.com/bytedance/deer-flow.git
    cd deer-flow
    
    # 2. 运行交互式配置向导(2分钟完成,生成 config.yaml 和 .env)
    make setup
    
    # 3. 安装依赖(本地开发模式)
    make install
    
    # 4. 启动本地服务
    make dev
    # 访问地址:http://localhost:2026
    

    配置向导会引导你设置 LLM 提供商(支持 OpenAI / DeepSeek / MiniMax / Qwen / 本地 vLLM 等)、网页搜索提供商(Tavily / Brave / Exa 等),无需手动编辑配置文件。配置完成后可随时运行 make doctor 验证配置是否正确。

    Docker 部署(推荐生产环境)

    # 开发模式(支持热重载)
    make docker-init    # 仅首次或沙箱镜像更新时运行
    make docker-start   # 启动服务
    
    # 生产模式
    make up             # 构建镜像并启动所有生产服务
    make down            # 停止并删除容器
    

    🎯 核心功能

    • 🧠 子智能体调度:主智能体可按需创建子智能体,每个子智能体拥有独立上下文、工具和终止条件;子智能体支持并行执行,执行结果结构化返回,主智能体最终汇总输出。长任务可拆分为多个子步骤,支持分钟到小时级别的复杂任务处理。
    • 📦 沙箱与文件系统隔离:每个任务拥有独立执行环境,支持文件读写、编辑、图像查看;支持多种沙箱模式:本地执行、Docker 隔离容器执行、Kubernetes Pod 执行。沙箱内文件路径 /mnt/user-data/ 下包含 uploads/(用户上传文件)、workspace/(智能体工作目录)、outputs/(最终交付物)。
    • 🧩 技能与工具扩展:内置研究、报告生成、幻灯片制作、网页生成、图像/视频生成等开箱即用技能;支持自定义技能、MCP 服务器扩展、Python 函数自定义工具;技能按需加载,避免上下文窗口过度占用;支持通过 /skill-name 前缀手动激活单轮技能。
    • 💾 长期记忆:跨会话持久化存储用户偏好、技术栈、常用工作流等信息;自动跳过重复记忆条目,避免记忆无限膨胀;记忆本地存储,用户完全可控。让智能体”记得”你之前的项目背景和编码习惯。
    • 🔌 IM 渠道集成:支持接入 Telegram、Slack、飞书、企业微信、钉钉、微信等 IM 渠道,无需公网 IP 即可接收任务。在聊天工具中直接使用 /new/status/models/memory 等命令管理对话和智能体。
    • 📊 可观测性:内置 LangSmith、Langfuse 可观测性集成,支持全链路 LLM 调用、智能体运行、工具执行追踪。生产和调试时都能清晰了解智能体的决策过程。

    💡 典型使用场景

    场景一:深度研究报告自动生成

    输入”研究 Transformer 架构的演进历程,输出一份 5000 字的技术报告,包含关键论文引用和架构对比图”,deer-flow 会自动规划研究步骤:搜索相关资料 → 阅读并提取关键信息 → 对比不同架构差异 → 生成结构化报告 → 输出为 PDF/Markdown。整个过程无需人工干预,耗时约 10-30 分钟。

    场景二:代码项目从零搭建

    输入”帮我搭建一个基于 FastAPI + Redis 的短链接服务,包含单元测试和 Docker 部署配置”,deer-flow 会创建子智能体分别处理:API 路由设计、Redis 缓存逻辑、测试用例编写、Dockerfile 生成。最终在 outputs/ 目录下产出完整项目代码,可直接运行。

    场景三:内容创作与多语言本地化

    deer-flow 内置内容创作技能,支持文章撰写、幻灯片制作、网页生成。结合 IM 渠道集成,可以将已有视频/文章自动翻译为多种语言并生成配音版本,实现内容的多语言分发。适合自媒体运营者和内容创作者使用。

    🌟 推荐理由

    deer-flow 2.0 是目前开源超级智能体框架中最接近”生产可用”的项目之一。与 LangChain、CrewAI 等框架相比,deer-flow 的最大特点是长周期任务处理能力——通过子智能体调度和上下文管理,它可以处理耗时数小时的复杂任务而不超出上下文窗口。这是很多同类框架做不到的。

    几个让我印象深刻的细节:

  • 上下文工程做得很到位:子智能体上下文隔离 + 自动摘要已完成子任务 + 中间结果卸载到文件系统,这套组合拳让长任务不 OOM。如果你用过其他框架处理长任务,就知道这个有多重要。
  • 沙箱设计务实:支持本地 / Docker / K8s 三种沙箱模式,开发时可以用本地模式快速迭代,生产时切到 Docker 隔离。不用一上来就搞复杂的 K8s 部署。
  • ByteDance 背书:这不是个人业余项目,是 ByteDance 内部打磨后开源的框架,2.0 版本完全重构,代码质量和文档都相当不错。74K+ stars 和 GitHub Trending 第一也证明了社区认可度。
  • IM 渠道集成很实用:无需公网 IP 就能通过飞书/企微接收任务,对国内用户非常友好。想象一下在企业微信群里 @ 一下你的 AI 智能体,它就去后台帮你跑一个深度研究任务,完成后通知你——这个体验很丝滑。

当然也有一些注意事项:项目默认设计为本地可信环境部署,不可信环境需要额外配置认证网关;生产环境扩容需要通过提升单 worker 资源配置或拆分数据库、沙箱到独立节点实现,不能直接增加 worker 数量。部署前建议仔细阅读安全文档。

📦 下载地址

  • GitHubhttps://github.com/bytedance/deer-flow(74K+ Stars,2.3K+ Commits)
  • 官方网站https://deerflow.tech(在线体验 + 完整文档)
  • 文档中心https://deerflow.tech/docs(支持英文、中文、日文、法文、俄文)
  • 在线体验https://deerflow.tech/playground(无需安装,直接试用)
  • License:MIT License(商业友好,可自由修改和分发)
  • 支持的 LLM:OpenAI / DeepSeek / MiniMax / Qwen / 本地 vLLM / 豆包 Doubao(推荐 Seed-2.0-Code)等
  • 如果你正在寻找一个能处理复杂长任务的 AI 智能体框架,或者想了解 ByteDance 级别的工程团队是如何设计超级智能体的,deer-flow 绝对值得深入研究。74K+ 社区星标不会骗你。