标签: Python

  • Supervision:Roboflow 开源计算机视觉工具库,46.3K+ Stars 让 CV 开发不再重复造轮子

    Supervision:Roboflow 开源计算机视觉工具库,46.3K+ Stars 让 CV 开发不再重复造轮子

    🔍 Supervision

    Roboflow 开源计算机视觉工具库

    ⭐ 46.3K+ Stars
    🍴 4.1K+ Forks
    🐍 Python
    📜 MIT 许可

    📌 项目简介

    Supervision 是 Roboflow 团队开发的开源 Python 计算机视觉工具库,提供模型无关的检测、跟踪、标注和数据集处理能力。它让你专注于业务场景,而不是重复编写基础 CV 工具函数。

    ✨ 核心特色

    🔗 模型无关设计

    内置 Ultralytics (YOLO)、Transformers、MMDetection、RF-DETR 等主流库的连接器,统一输出 sv.Detections 格式,换模型不改代码。

    🎨 丰富可视化标注

    提供 BoxAnnotator、MaskAnnotator、EllipseAnnotator、LabelAnnotator 等多种标注器,高度可定制,一行代码完成结果可视化。

    📦 数据集处理

    支持 COCO、YOLO、Pascal VOC、YOLOv8 Oriented Bounding Box 等格式的加载、拆分、合并、格式转换,一站式数据集管理。

    📹 视频分析工具

    内置目标跟踪(ByteTrack/Norfair)、区域计数、速度估计、驻留时间分析等常见 CV 任务的配套工具,开箱即用。

    ⚙️ 安装要求和过程

    环境要求

    • Python ≥ 3.10
    • 操作系统:Windows / macOS / Linux 全平台支持
    • 可选依赖:根据使用的模型后端选择安装(ultralytics / transformers / mmdet 等)

    快速安装

    # 使用 pip 安装(推荐)
    pip install supervision
    
    # 使用 conda 安装
    conda install -c conda-forge supervision
    
    # 从源码安装最新版
    pip install git+https://github.com/roboflow/supervision.git

    💡 安装后可在 Google Colab 中在线体验,或访问 HuggingFace Spaces 体验标注器效果。

    🚀 典型使用场景

    场景一:目标检测 + 可视化标注

    使用 YOLO 或 RF-DETR 模型进行目标检测,并用 Supervision 的标注器一键可视化结果:

    import cv2
    import supervision as sv
    from rfdetr import RFDETRSmall
    
    # 加载模型
    model = RFDETRSmall()
    image = cv2.imread("image.jpg")
    
    # 推理
    detections = model.predict(image, threshold=0.5)
    
    # 可视化
    box_annotator = sv.BoxAnnotator()
    label_annotator = sv.LabelAnnotator()
    
    annotated = box_annotator.annotate(
        scene=image.copy(), detections=detections
    )
    annotated = label_annotator.annotate(
        scene=annotated, detections=detections
    )
    
    cv2.imwrite("result.jpg", annotated)

    场景二:视频目标跟踪与区域计数

    对视频中的目标进行跨帧跟踪,并统计穿越特定区域的目标数量:

    import supervision as sv
    
    # 定义感兴趣区域(多边形)
    ZONE = sv.PolygonZone(
        polygon=sv.Polygon.from_file("zone.json")
    )
    
    tracker = sv.ByteTrack()
    
    for frame in sv.get_video_frames_generator("video.mp4"):
        detections = model.predict(frame)
        detections = tracker.update(detections)
        
        # 统计区域内的目标
        zone_count = ZONE.trigger(detections)
        print(f"区域内目标数: {zone_count}")

    场景三:数据集格式转换

    在不同标注格式之间自由转换,方便切换训练框架:

    import supervision as sv
    
    # 从 COCO 格式加载
    dataset = sv.DetectionDataset.from_coco(
        images_directory_path="data/train/images",
        annotations_path="data/train/_annotations.coco.json",
    )
    
    # 拆分为训练集和验证集
    train_ds, val_ds = dataset.split(split_ratio=0.8)
    
    # 保存为 YOLO 格式
    train_ds.as_yolo(
        images_directory_path="data/yolo/images/train",
        annotations_directory_path="data/yolo/labels/train",
    )

    💡 推荐理由

    计算机视觉开发者最头疼的事情之一,就是每次用新的检测模型都要重新写一遍数据预处理、结果解析、可视化标注、数据集转换的代码。Supervision 把这个痛点彻底解决了。

    它的 模型无关设计 是一大亮点——不管你用 YOLOv8、YOLO11、RT-DETR、SAM 还是 Grounding DINO,Supervision 都能以统一的 sv.Detections 格式输出结果,让你的下游代码完全不用改。

    另一个让人惊喜的地方是数据集处理工具。以前 COCO 转 YOLO 要写几十行脚本,现在几行代码就搞定。格式拆分、合并、统计类别分布,全都内置了。

    Roboflow 作为计算机视觉领域的头部公司,维护质量和文档完善度都非常高。PyPI 月下载量超百万,社区活跃,Discord 里提问基本当天就有回复。不管是做学术研究还是工业落地,这都是必备工具库。

    📊 项目信息

    GitHub Stars ⭐ 46,329+
    Forks 🍴 4,106+
    语言 🐍 Python
    许可 📜 MIT License
    最新版本 v0.29.0(要求 Python ≥ 3.10)
    创建时间 2022-11-28
    维护方 Roboflow 团队

    🤖 本文由 AI 自动生成 · 数据来源:GitHub – roboflow/supervision

  • CodeGeeX4:清华大学出品的9B全能代码模型,性能超越70B级大模型

    CodeGeeX4:清华大学出品的9B全能代码模型,性能超越70B级大模型

    CodeGeeX4
    清华大学 KEG 实验室 × 智谱 AI 联合出品
    ALL-9B 全能模型 · 代码生成 · Function Call · 仓库级理解
    ⭐ 最新一代
    🚀 9B 超越 70B
    🏆 BigCodeBench SOTA

    📝 项目简介

    CodeGeeX4 是清华大学 KEG 实验室与智谱 AI 联合推出的第四代多语言代码生成模型,基于 GLM-4-9B 持续训练,在代码生成、代码解释、Web 搜索、Function Call、仓库级 Q&A 等全场景软件开发生命周期中均提供卓越表现。仅 9B 参数即超越 Llama3-70B、DeepSeekCoder-33B 等超大模型,是当前 10B 以下参数规模中综合性能最强的代码模型。

    9B
    模型参数

    82.3%
    HumanEval Pass@1

    128K
    上下文长度

    ⭐ 30K+
    GitHub Stars

    ⚙️ 安装要求和过程

    💻 环境要求

    • Python 3.10+(推荐 3.11)
    • CUDA 12.1+(GPU 推理)
    • PyTorch 2.0+ 或 vLLM 0.5.1+
    • 内存:FP16 推理约 18GB,INT4 量化约 6GB
    • 操作系统:Windows / macOS / Linux 全平台支持

    🚀 快速安装(Ollama — 最简单)

    # 安装 Ollama(需 0.2+ 版本)
    # macOS/Linux:
    curl -fsSL https://ollama.com/install.sh | sh
    
    # Windows: 从 https://ollama.com/download 下载安装
    
    # 一键运行 CodeGeeX4
    ollama run codegeex4

    🐍 使用 transformers 推理

    pip install transformers==4.40.0 torch
    
    from transformers import AutoTokenizer, AutoModelForCausalLM
    import torch
    
    model = AutoModelForCausalLM.from_pretrained(
        "THUDM/codegeex4-all-9b",
        torch_dtype=torch.bfloat16,
        trust_remote_code=True
    ).cuda().eval()
    tokenizer = AutoTokenizer.from_pretrained(
        "THUDM/codegeex4-all-9b",
        trust_remote_code=True
    )
    
    # 对话格式
    prompt = [{"role":"user","content":"写一个快速排序"}]
    inputs = tokenizer.apply_chat_template(prompt, add_generation_prompt=True, return_tensors="pt").cuda()
    outputs = model.generate(inputs, max_new_tokens=256)
    print(tokenizer.decode(outputs[0], skip_special_tokens=True))

    ⚡ vLLM 高性能部署

    pip install vllm==0.5.1
    
    # 启动 OpenAI 兼容 API 服务
    python -m vllm.entrypoints.openai.api_server     --model THUDM/codegeex4-all-9b     --trust-remote-code     --tensor-parallel-size 1
    
    # 然后即可用 OpenAI SDK 调用
    # pip install openai
    # client = OpenAI(base_url="http://localhost:8000/v1", api_key="dummy")

    ✨ 核心功能

    💬 全场景代码助手
    支持代码补全、代码生成、代码解释、代码翻译、文档生成、Bug 修复等全场景,基于 ChatGLM2/GLM-4 架构,中英文理解能力优异。

    🔧 Function Call 原生支持
    唯一原生支持 Function Call 的代码模型,Function Call 执行成功率甚至超越 GPT-4。可无缝接入 AI Agent 工具调用链路。

    📦 仓库级代码理解
    支持 128K 超长上下文,可理解整个代码仓库。支持仓库级 Q&A、跨文件代码补全、自动 commit 等高级功能。

    🌐 多平台部署
    支持 Ollama / vLLM / transformers / Rust-candle 多种推理后端;支持 VS Code、JetBrains 全系列 IDE 插件;支持本地 / 云端双模式。

    🏆 性能全面领先(10B 以下模型)
    HumanEval 82.3% · MBPP 75.7% · NaturalCodeBench 40.4% · BigCodeBench 48.9%(complete)/ 40.4%(instruct)· CRUXEval-O 47.1%。在代码推理、代码理解、代码执行等全方位评测中均取得 10B 以下模型最佳成绩。

    🎯 典型使用场景

    场景一:IDE 智能编程助手(最适合日常使用)

    在 VS Code 或 JetBrains IDE 中安装 CodeGeeX 插件,即可体验:

    • 代码补全:根据上下文自动补全下一行 / 下一个函数
    • 上下文补全:基于仓库内其他文件提供跨文件补全建议
    • Ask CodeGeeX:中英文对话解决编程问题,支持代码解释、翻译、纠错
    • 本地模式:连接本地 Ollama 运行的 CodeGeeX4,数据完全不出本地

    💡 支持超过 100 种编程语言!

    场景二:AI Agent Function Call 工具

    CodeGeeX4 原生支持 Function Call,可以:

    • 作为 AI Agent 的代码生成工具,解析自然语言需求生成代码
    • 接入 OpenAI 兼容 API,与 LangChain / AutoGen 等 Agent 框架无缝集成
    • 支持仓库级代码操作(增删改文件),实现 AI 自动 commit
    • 结合 vLLM 部署,支持多并发、高吞吐的生产环境调用

    场景三:本地私有化部署(数据安全敏感场景)

    对于数据隐私有严格要求的企业 / 个人,CodeGeeX4 提供完善的本地部署方案:

    • 通过 Ollama 一行命令启动,INT4 量化仅需 6GB 显存
    • 支持连接 VS Code / JetBrains 插件,体验与云端一致
    • 支持昇腾 / NVIDIA 全系列硬件,包括国产 AI 芯片
    • 代码和数据完全不离开本地,满足企业合规要求

    💡 推荐理由

    作为 AI 编程工具的深度用户,我试用过 GitHub Copilot、Claude Code、Cursor 等各类产品,CodeGeeX4 给我留下了极其深刻的印象:

    ① 性价比无敌:9B 参数的小模型,性能直接干翻 70B 的 Llama3 和 33B 的 DeepSeekCoder。这意味着你用消费级显卡(甚至 6GB 显存的 RTX 3060)就能跑一个世界级代码模型。

    ② Function Call 是杀手锏:在 AI Agent 时代,代码模型不能只做补全,还要能调用工具。CodeGeeX4 是唯一原生支持 Function Call 的开源代码模型,而且执行成功率比 GPT-4 还高。这对构建 AI 编程 Agent 来说是个游戏规则改变者。

    ③ 清华大学 + 智谱 AI 双背书:KEG 实验室(唐杰教授团队)在 NLP 和代码生成领域深耕多年,CodeGeeX 系列从 2022 年做到 2026 年,四代演进,成熟度远超同类竞品。智谱 AI 的 GLM 架构也在持续迭代优化。

    ④ 真正可用的 IDE 插件:很多开源模型只提供权重,没有好的用户体验。CodeGeeX 的 VS Code / JetBrains 插件做得相当完善,上下文补全、跨文件理解、Ask CodeGeeX 对话,体验不输商业产品。

    如果你在找一个能本地部署、性能好、中文友好的 AI 编程助手,CodeGeeX4 是目前唯一的最优解

    📊 性能对比(10B 以下模型)

    模型 参数 HumanEval MBPP NCB Function Call
    CodeGeeX4-ALL-9B 9B 82.3% 75.7% 40.4% ✅ 超越GPT-4
    Llama3-70B-Instruct 70B 77.4% 82.3% 37.0%
    DeepSeekCoder-33B 33B 81.1% 80.4% 39.3%
    Codestral-22B 22B 81.1% 78.2% 46.0%

    数据来源:CodeGeeX4 官方 README,NCB = NaturalCodeBench

    📚 CodeGeeX 系列演进

    CodeGeeX(第一代,2022)
    13B 参数,基于华为昇腾芯片训练,在 20+ 编程语言上预训练。配套开源 HumanEval-X 多语言评测基准。Apache-2.0 开源。

    CodeGeeX2(第二代,2023)
    基于 ChatGLM2-6B,6B 参数即超越 15B 的 StarCoder。支持 8192 序列长度,量化后仅需 6GB 显存。HumanEval-X 全面提升(+57%~+321%)。

    CodeGeeX4(第四代,2024)
    基于 GLM-4-9B,9B 参数全能模型。支持 Function Call、仓库级 Q&A、128K 上下文。BigCodeBench / NaturalCodeBench / CRUXEval 全基准 SOTA。Apache-2.0 开源。

    由自动化任务发布 · GitHub 热门 AI 开源项目系列 · 清华大学 KEG 实验室 × 智谱 AI
  • Strix:开源AI渗透测试工具,让AI智能体像真实黑客一样发现漏洞(31.6K Stars)

    Strix:开源AI渗透测试工具,让AI智能体像真实黑客一样发现漏洞(31.6K Stars)

    🛡️ Strix:开源AI渗透测试工具,让AI智能体像真实黑客一样发现漏洞

    Strix
    Autonomous AI Penetration Testing
    ⭐ 31.6K Stars
    🐍 Python
    📄 Apache-2.0
    🏢 useStrix

    📌 项目简介

    Strix 是一款开源的 AI 驱动的渗透测试工具,由 useStrix 团队维护(YC W25 孵化项目)。它用自主AI智能体模拟真实黑客的攻击行为——动态执行代码、发现漏洞、验证PoC(概念验证),覆盖从侦察、利用到验证的完整渗透测试流程。与传统静态分析工具的高误报率不同,Strix 通过实际利用来验证漏洞,输出可工作的PoC,让开发者和安全团队在几小时内完成传统需要数周的渗透测试。

    ⚙️ 安装要求与过程

    环境要求

    • Docker 必须已启动(用于沙箱隔离执行)
    • ✅ 任意支持的 LLM 提供商 API 密钥(OpenAI / Anthropic / Google / 本地模型等)
    • ✅ Python 3.10+(仅使用 PyPI 包时)

    快速安装(3步搞定)

    # 1. 一键安装 Strix
    curl -sSL https://strix.ai/install | bash
    
    # 2. 配置 AI 提供商(支持 OpenAI / Claude / Gemini 等)
    export STRIX_LLM="openai/gpt-5.4"
    export LLM_API_KEY="your-api-key"
    
    # 3. 运行首次安全评估
    strix --target ./app-directory

    📦 首次运行会自动拉取沙箱 Docker 镜像,结果保存到 strix_runs/<run-name> 目录。

    ✨ 核心功能

    🤖
    多智能体渗透测试
    多个AI渗透测试智能体协作——分工负责侦察、利用、后渗透阶段,像红队一样动态协调、共享发现、链式利用漏洞,并行执行提升覆盖效率。

    🔍
    真实漏洞验证(非误报)
    与传统静态分析工具的高误报率不同,Strix 通过实际执行利用代码来验证漏洞,输出可工作的PoC(概念验证),确保每一个报告的问题都是真实可利用的。

    🧰
    完整渗透测试工具链
    内置 HTTP 拦截代理(Caido)、浏览器漏洞利用(Playwright)、命令执行环境、自定义漏洞运行时(Python 沙箱)、侦察与OSINT、动静态代码分析(SAST+DAST)、结构化漏洞知识库(CVSS + OWASP 分类)。

    🔧
    自动修复与合规报告
    不仅发现问题,还能生成安全补丁(AI 自动修复)和符合 SOC 2 / ISO 27001 / PCI DSS 标准的渗透测试报告,一键即可生成可直接提交的漏洞报告。

    🚀
    CI/CD 原生集成
    无交互模式(-n/--non-interactive)完美适配自动化场景,GitHub Actions 工作流仅需 10 行配置,即可在每次 Pull Request 时自动扫描漏洞,在代码合并前阻断安全风险。

    🚀 典型使用场景

    场景一:PR 合并前的自动安全门禁
    在 GitHub Actions 中配置 Strix,每次 PR 提交时自动触发安全扫描。Strix 会自动将扫描范围限定在变更文件(diff-scope),快速完成审查。发现漏洞时以非0退出码阻断合并,并自动生成包含PoC和修复建议的安全报告。传统渗透测试需要数周,Strix 在 CI 流水线中仅需分钟级完成。
    场景二:Bug Bounty 自动化辅助
    安全研究员使用 Strix 对目标应用进行自动化漏洞挖掘。Strix 的智能体协作机制可同时覆盖 OWASP Top 10 的八大类漏洞(访问控制、注入攻击、服务端漏洞、客户端攻击、业务逻辑缺陷、认证与会话、基础设施与云安全、API 安全),并自动生成可用于漏洞报告提交的 PoC 脚本,大幅提升 Bug Bounty 研究的效率与覆盖深度。
    场景三:本地代码仓库的白盒安全审计
    开发者运行 strix --target ./app-directory,Strix 在 Docker 沙箱内动态执行应用代码,结合 SAST(静态应用安全测试)和 DAST(动态应用安全测试)双重分析,精准发现硬编码密钥、SQL 注入、SSRF 等传统工具难以触达的深层漏洞。支持通过 --instruction 参数指定重点关注的业务逻辑缺陷类型。

    💡 推荐理由

    在 AI 辅助开发日益普及的今天,安全责任正在向左迁移——开发者需要在代码提交前就能发现安全问题。传统 SAST 工具(如 Bandit、Semgrep)误报率高,而专业渗透测试周期长、成本高。Strix 用 AI 智能体填补了这个空白:

    • 🎯 真实可利用性验证:不只报告潜在问题,而是实际执行利用代码,输出可工作的 PoC,将误报率降至最低。
    • 🤝 多智能体协作:像真实红队一样分工协作,侦察智能体发现攻击面 → 利用智能体验证漏洞 → 后渗透智能体评估影响范围,链式利用让漏洞发现更系统。
    • 🔗 DevSecOps 无缝集成:GitHub Actions / GitLab CI 仅需 10 行配置,PR 差异范围自动扫描,安全门禁无感嵌入开发流程。
    • 🌐 支持广泛 LLM 提供商:通过 LiteLLM 支持 OpenAI / Anthropic / Google / Azure / AWS Bedrock / 本地模型(Ollama),可灵活选择兼顾成本与效果的最佳模型。

    作为 YC W25 孵化的开源项目,Strix 在短短数月内获得 3.1 万+ stars,已成为 AI 安全测试领域最受关注的开源工具之一。无论你是开发者、安全工程师还是 DevSecOps 团队,Strix 都值得加入你的安全工具链。

    📥 下载地址

    📌 本文由 AI 助手自动生成,数据来源:GitHub + 项目官方 README。Strix 采用 Apache-2.0 开源许可,由 useStrix 团队维护(YC W25)。
  • MediaCrawler:多平台自媒体数据采集工具,54.9K+ Stars 让 Playwright 爬虫变得简单

    MediaCrawler:多平台自媒体数据采集工具,54.9K+ Stars 让 Playwright 爬虫变得简单

    🕷️ MediaCrawler

    多平台自媒体数据采集工具 —— 为 AI 时代提供高质量训练数据

    ⭐ 54,991+ Stars  |  🐍 Python  |  🎭 Playwright  |  📜 MIT License

    📌 项目简介

    MediaCrawler 是一个多平台自媒体数据采集工具,支持小红书、抖音、快手、B站、微博、百度贴吧、知乎共 7 个主流内容平台的公开信息抓取。项目基于 Playwright 浏览器自动化框架实现,无需 JS 逆向,直接利用保存的登录态浏览器上下文通过 JS 表达式获取签名参数,大幅降低了爬虫技术门槛。

    该项目定位为学习爬虫技术、研究浏览器自动化方案的开源教学项目,同时也为 LLM 训练数据收集、内容分析等场景提供了实用工具链。

    Python 3.11+
    Playwright
    7 大平台支持
    WebUI 可视化
    多存储格式
    MIT 许可

    ⚙️ 安装要求与过程

    环境要求

    • Python:推荐 3.11 及以上版本(已支持 Python 3.13)
    • Node.js:≥ 16.0.0(WebUI 前端需要)
    • Chrome 浏览器:推荐 ≥ 144 版本(开启远程调试后可复用登录态)
    • 包管理工具:推荐 uv(速度快、依赖解析准确)

    快速安装(5 分钟上手)

    # 1. 克隆项目
    git clone https://github.com/NanmiCoder/MediaCrawler.git
    cd MediaCrawler
    
    # 2. 安装 Python 依赖(使用 uv)
    uv sync
    
    # 3.(可选)安装 Playwright 浏览器驱动(标准模式需要)
    uv run playwright install
    
    # 4.(推荐)配置 Chrome 远程调试
    # 在 Chrome 地址栏输入 chrome://inspect/#remote-debugging
    # 勾选允许远程调试,确认 Server 运行在 127.0.0.1:9222

    WebUI 可视化界面部署

    # 开发调试模式
    # 终端 1:启动后端 API 服务(默认端口 8080)
    uv run uvicorn api.main:app --port 8080 --reload
    
    # 终端 2:启动前端开发服务
    cd webui
    npm install
    npm run dev
    # 访问 http://localhost:5173/ 即可使用
    
    # 生产部署模式
    cd webui
    npm install
    npm run build
    uv run uvicorn api.main:app --port 8080 --reload
    # 直接访问 http://localhost:8080

    ✨ 核心功能

    • 7 大平台全覆盖:小红书、抖音、快手、B站、微博、百度贴吧、知乎,功能覆盖度一致
    • 多种爬取模式:支持关键词搜索爬取、指定 ID 爬取帖子/视频、二级评论爬取、指定创作者主页爬取
    • 登录态缓存:基于 Playwright 保存登录态,支持 CDP 模式连接本地 Chrome,复用已有登录态、Cookie 和扩展,降低平台风控风险
    • WebUI 可视化界面:无需命令行,直接在网页配置爬虫参数、查看运行状态、导出数据,大幅降低使用门槛
    • 多存储格式支持:CSV、JSON、JSONL、Excel、SQLite、MySQL 等多种数据存储格式,满足不同 downstream 需求
    • IP 代理池:内置代理池支持,可配置多账号+IP 轮换,降低被封禁风险
    • 评论词云图:自动生成评论词云图,直观展示用户情感倾向和热点话题

    🖼️ 支持平台一览

    📕 小红书

    搜索笔记、指定帖子详情、创作者主页、二级评论

    🎵 抖音

    搜索视频、视频详情、用户信息、评论数据

    🎬 快手

    视频搜索、详情页、用户主页、评论爬取

    📺 B站

    视频搜索、视频详情、UP 主信息、弹幕与评论

    💬 微博

    关键词搜索、博文详情、评论、用户主页

    📝 知乎

    问答搜索、问题详情、回答内容、评论数据

    🙋 百度贴吧

    贴子搜索、贴子详情、回复内容、吧内信息

    🚀 典型使用场景

    场景一:LLM 训练数据收集

    MediaCrawler 可以批量采集各平台公开的文本、图片、评论数据,经过清洗后作为 LLM 的微调或预训练数据。相比手动采集,效率提升 100 倍以上,且支持断点续爬,适合大规模数据采集任务。

    # 爬取小红书关键词搜索结果(用于训练数据分析类 LLM)
    uv run main.py --platform xhs --lt qrcode --type search
    # 数据自动保存为 JSON/CSV,可直接接入训练 pipeline

    场景二:社交媒体舆情监测

    企业或研究机构可以使用 MediaCrawler 定期采集特定关键词的社交媒体内容,结合 LLM 进行情感分析、热点话题发现和舆情预警。WebUI 界面使得非技术团队也能轻松配置和运行爬取任务。

    # 爬取指定关键词的微博内容
    uv run main.py --platform weibo --lt cookie --type search --keywords "AI大模型"

    场景三:内容创作者竞品分析

    自媒体运营者可以用 MediaCrawler 采集同类创作者的高赞内容、评论热词、发布时间规律等,为内容策略优化提供数据支撑。结合评论词云图功能,可以快速把握受众偏好。

    💡 推荐理由

    🌟 个人使用心得:
    MediaCrawler 是我见过的最易上手的社交媒体数据采集项目之一。它巧妙避开了最难的 JS 逆向问题 —— 通过保存登录态浏览器上下文直接执行 JS 获取签名,让爬虫开发从”黑魔法”变成”标准流程”。

    三大亮点:
    零 JS 逆向:基于 Playwright 的登录态复用机制,不需要分析各平台的签名算法
    WebUI 降低门槛:可视化界面让非程序员也能使用,是真正”可用”的开源工具
    CDP 模式创新:连接本地 Chrome,复用真实用户的登录态和扩展,大幅降低风控概率

    需要注意的是,项目明确声明仅可用于学习研究,禁止用于商业用途和非法爬虫行为。建议在遵守平台 ToS 和相关法律法规的前提下使用。

    📦 下载地址


    ⚠️ 注意事项

    🚨 法律与合规提醒:
    ① 本项目仅供学习研究使用,禁止用于商业用途和非法爬虫行为
    ② 因违规使用产生的法律责任由使用者自行承担
    ③ 请遵守各平台的 robots.txt 和服务条款(ToS)
    ④ 建议合理控制爬取频率,避免对目标平台造成过大压力
    ⑤ 不要爬取明确标注”禁止爬取”的私密或付费内容

    📅 数据更新至 2026 年 7 月  |  ⭐ GitHub: NanmiCoder/MediaCrawler

  • WrenAI:开源 GenBI 引擎,让 AI 智能体生成可信的 Text-to-SQL 和仪表盘,15.7K Stars 让数据分析变得简单

    WrenAI:开源 GenBI 引擎,让 AI 智能体生成可信的 Text-to-SQL 和仪表盘,15.7K Stars 让数据分析变得简单

    15.7K+GitHub Stars
    22+数据源支持
    Apache-2.0开源许可

    📊 项目简介

    WrenAI 是一个面向 AI 智能体的开源生成式商业智能(GenBI)引擎,通过开放上下文层实现受管制的 Text-to-SQL,让自然语言问题转化为可信的仪表盘、图表和 SQL,支持 BigQuery、Snowflake、PostgreSQL、ClickHouse、Databricks 等 20+ 数据源。

    传统的 BI 工具需要专业的数据分析技能,而直接使用 LLM 生成 SQL 又常常不可靠——AI 不了解业务逻辑,容易生成错误的结果。WrenAI 的革新之处在于引入了开放上下文层(Open Context Layer):通过将业务语义、已验证定义、示例、记忆和治理规则以可版本化、可溯源的文件存储,让 AI 智能体能够生成可信的 SQL 和分析结果。

    该项目由 Canner 团队开发维护,采用 Apache-2.0 开源许可,累计 2523+ 次提交,是 GenBI 领域的开创性项目。2026 年,随着 AI Agent 的爆发,WrenAI 已成为 AI 驱动数据分析的首选开源方案。

    ⚙️ 安装要求和过程

    环境要求

    • Python:3.9+(推荐使用 3.10 或更高版本)
    • Node.js:18+(用于 AI 客户端适配脚本安装)
    • 数据源:已部署的 PostgreSQL / BigQuery / Snowflake / ClickHouse 等(或本地 DuckDB)
    • 可选:Vercel 或 Cloudflare Pages 账号(用于仪表盘部署)

    快速安装步骤

    方式一:Python CLI 安装(推荐)

    # 核心版本,内置 DuckDB 引擎
    pip install wrenai
    
    # 按需添加数据源扩展和记忆功能
    pip install "wrenai[postgres,memory]"
    
    # 国内用户可使用清华 PyPI 镜像加速
    pip install wrenai -i https://pypi.tuna.tsinghua.edu.cn/simple
    
    # 若 HuggingFace 模型下载超时,设置镜像
    export HF_ENDPOINT=https://hf-mirror.com

    方式二:AI 客户端适配(让 AI 智能体使用 WrenAI)

    # 自动检测当前环境的 AI 客户端(Claude Code、Cursor 等)
    npx skills add Canner/WrenAI

    方式三:Docker 部署(完整平台)

    git clone https://github.com/Canner/WrenAI.git
    cd WrenAI
    docker-compose up -d

    初始化配置

    安装完成后,向 AI 智能体发送指令:

    Use Wren to set up my Postgres database

    智能体会自动执行引导流程,完成数据源连接、项目初始化和首次查询。你还可以发送:

    Enrich my Wren project with the business context in raw/

    让智能体自动提取业务知识,丰富上下文层。

    🌟 核心功能

    🎯 开放上下文层(Open Context Layer)

    这是 WrenAI 的核心创新。业务逻辑(指标定义、枚举值、单位、已验证关联规则等)以可版本化、可溯源的文件存储:语义模型(MDL)、企业定义文件(instructions.md)、历史查询记录。支持 Git 管理,不依赖封闭 UI,可被所有 AI 智能体和团队成员复用。

    🔍 可信 Text-to-SQL

    结合开放上下文层,WrenAI 通过语法感知检索、MDL 规划、预执行验证、结构化错误提示、值分析、评估工具链,大幅提升 SQL 生成的正确性。支持 20+ 数据源,包括云数仓(BigQuery、Snowflake、Databricks)、传统关系型数据库(PostgreSQL、MySQL、SQL Server)和本地文件。

    📊 生成式仪表盘

    可将分析结果一键转换为可交互、支持筛选的浏览器端仪表盘,基于 wren-core-wasm 实现。支持一键部署到用户自己的 Vercel 或 Cloudflare Pages 账号,生成可分享的公开链接。从自然语言提问到团队可访问的仪表盘,全程自动化。

    🤖 AI 智能体原生集成

    提供 Agent SDK(wren-langchain 兼容 LangChain/LangGraph,wren-pydantic 支持其他 Python 技术栈)。支持 MCP 协议,可对接 Claude Code、Cursor、Cline、Codex 等各类 AI 客户端。安装适配脚本后,AI 智能体可调用 WrenAI 的工作流指南和查询能力。

    🔐 受管制执行能力

    支持行级/列级访问控制(RLAC/CLAC)、查询行数限制、审计日志、审批工作流等治理能力。企业可以安全地让 AI 访问敏感数据,确保合规性和可审计性。混合检索的本地 LanceDB 记忆索引可召回历史相似查询,持续提升准确性。

    💡 典型使用场景

    场景一:数据分析师的 AI 助手

    数据分析师小李每天需要处理大量业务方的临时数据查询需求。以前他需要手写 SQL、等待查询、制作图表,耗时耗力。使用 WrenAI 后,业务方可以直接用自然语言提问:“上个月各区域的销售额同比增长了多少?” WrenAI 基于上下文层生成可信的 SQL,自动生成图表,并部署为可分享的仪表盘。小李只需要审核结果,大大提升了工作效率。

    价值:减少 80% 的重复查询工作,业务方自助获取数据洞察,数据分析师专注于高价值分析。

    场景二:企业级 AI Agent 的数据分析能力

    某公司正在构建企业级 AI Agent,需要让 Agent 能够查询公司内部的数据仓库。直接使用 LLM 生成 SQL 的准确率低,且无法复用业务逻辑。通过集成 WrenAI 的 Agent SDK 和 MCP 协议,Agent 可以访问开放上下文层,生成可信的 SQL,并通过受管制执行能力确保数据安全。所有业务逻辑以文件形式存储,支持 Git 版本管理,团队可以持续迭代优化。

    价值:AI Agent 的数据分析能力从”不可靠”变为”可信”,业务逻辑可复用、可版本化、可审计。

    🚀 推荐理由

    为什么推荐 WrenAI?

    1. 解决了 AI + BI 的核心痛点
    LLM 生成 SQL 的最大问题是”不可信”——AI 不了解业务逻辑,容易生成错误的结果。WrenAI 的开放上下文层方案非常优雅:将业务逻辑以文件形式存储,可被所有 AI 智能体和团队成员复用,支持 Git 管理。这比封闭的商业产品更具可持续性。

    2. GenBI 是 AI Agent 应用的新范式
    2026 年,AI Agent 从”聊天”走向”执行”,数据分析是最高频的企业场景之一。WrenAI 不仅是 Text-to-SQL 工具,更是完整的 GenBI 引擎——从自然语言提问到可信 SQL,从分析结果到可分享仪表盘,全流程自动化。这是 BI 工具的范式转变。

    3. 开源 + 企业级能力
    采用 Apache-2.0 许可,可自由修改和部署。同时内置了行级/列级访问控制、审计日志、审批工作流等企业级能力,满足数据安全合规要求。支持 20+ 数据源,无需替换现有数据栈。

    4. AI 智能体原生设计
    不是”给人的工具”,而是”给 AI 的工具”。提供 Agent SDK、MCP 协议支持,可无缝集成到 Claude Code、Cursor、LangChain 等 AI 开发框架。开放上下文层的设计让 AI 智能体能够持续学习和改进。

    小缺点
    目前文档主要用英文,中文社区还在建设中。部分高级功能(如仪表盘部署)需要 Vercel/Cloudflare 账号,对纯本地部署场景略有不便。但核心功能完全可以本地使用,不影响基本使用。

    📥 下载地址

    WrenAI · GenBI for AI Agents · 让数据分析变得简单、可信、可追溯
    数据与 AI 的桥梁 · Text-to-SQL 的新范式 · 2026 年值得关注的开源项目

  • Semantic Kernel:微软企业级 AI 编排 SDK,28K+ Stars 让多语言 AI 应用开发变得简单

    Semantic Kernel:微软企业级 AI 编排 SDK,28K+ Stars 让多语言 AI 应用开发变得简单

    Semantic Kernel
    Microsoft 企业级 AI 编排 SDK
    Python · C# · Java · RAG · Multi-Agent · MCP

    📌 项目简介
    模型无关的企业级 AI 编排 SDK,让开发者快速将前沿 LLM 技术集成到应用中

    Semantic Kernel(简称 SK)是微软推出的模型无关企业级 AI 编排 SDK,支持 Python、C#、Java 三大主流语言。
    它帮助开发者快速构建、编排和部署 AI 智能体及多智能体系统,可兼容任意主流大模型,兼顾企业级可靠性与灵活性。

    ⚠️ 重要提示:项目已升级为微软官方企业级智能体框架 Microsoft Agent Framework(MAF)
    MAF 是 SK 的继任者,已发布 1.0 生产级稳定版本。新项目建议使用 MAF,SK 后续仅提供最低限度的安全更新和 bug 修复。

    ⚙️ 安装要求和过程
    💻 环境要求
    • Python:3.10 及以上
    • .NET:.NET 8.0 及以上(推荐 .NET 10.0)
    • Java:JDK 17 及以上
    • 支持系统:Windows / macOS / Linux
    🔑 前置配置

    需先设置 AI 服务环境变量:

    # Azure OpenAI
    export AZURE_OPENAI_API_KEY=你的密钥
    export AZURE_OPENAI_ENDPOINT=你的端点
    
    # OpenAI
    export OPENAI_API_KEY=你的密钥

    📦 快速安装
    Python(推荐)
    pip install semantic-kernel

    .NET(C#)
    dotnet add package Microsoft.SemanticKernel
    dotnet add package Microsoft.SemanticKernel.Agents.Core

    Java
    <dependency>
      <groupId>com.microsoft.semantickernel</groupId>
      <artifactId>semantickernel-core</artifactId>
      <version>1.0.0</version>
    </dependency>

    ✨ 核心功能
    🔗 模型无关设计
    原生支持 OpenAI、Azure OpenAI、Hugging Face、NVIDIA NIM 等主流大模型,也可接入 Ollama、LM Studio、ONNX 等本地部署模型,无需绑定特定厂商

    🤖 智能体全能力
    支持构建单智能体、多智能体协作系统,智能体可集成工具/插件、记忆能力、规划能力,满足从简单对话到复杂业务流程编排的需求

    🔌 丰富插件生态
    支持原生代码函数、提示词模板、OpenAPI 规范、Model Context Protocol(MCP)等多种插件形式,可快速扩展智能体能力

    🗄️ 向量数据库集成
    无缝对接 Azure AI Search、Elasticsearch、Chroma 等主流向量数据库,快速实现 RAG(检索增强生成)场景

    🏢 企业级能力
    内置可观测性、安全机制,提供稳定的 API 接口,满足企业级生产环境要求。支持 Azure Monitor、OpenTelemetry 等监控方案

    🔄 流程编排框架
    提供结构化工作流引擎,可建模复杂业务流程,实现 AI 能力的可控编排。支持顺序、并行、条件分支等多种执行模式

    🚀 典型使用场景
    场景一:企业客服多智能体系统
    构建「工单分流智能体 + 账单处理智能体 + 退款处理智能体」的协作系统。
    当用户发送复杂需求时,主智能体自动规划并委派给专业子智能体处理,完成后汇总回复用户。
    Semantic Kernel 的 Agent Framework 原生支持多智能体协作,每个智能体拥有独立上下文和工具集。

    场景二:RAG 企业知识库问答
    结合向量数据库(如 Azure AI Search 或 Chroma),为企业内部文档构建知识库问答系统。
    通过 Semantic Kernel 的 Vector Store 抽象层,仅需修改配置即可切换不同向量数据库,无需重写代码。
    支持文本分块、向量化、混合检索(向量 + 关键词)等完整 RAG 管线。

    场景三:跨平台 AI 应用(Python + C# + Java 三语通用)
    企业技术栈多样,Semantic Kernel 提供 Python、C#、Java 三大语言 SDK,API 设计高度一致。
    无论是 Python 数据科学团队、.NET 企业应用团队,还是 Java 后端团队,都可以用相同的概念(Kernel、Plugin、Agent)开发 AI 功能。
    Microsoft 官方提供 100+ 示例代码,覆盖所有主流场景。

    💡 推荐理由

    作为一名 AI 开发者,Semantic Kernel 是我用过的最”企业友好”的 AI 编排框架。它的模型无关设计让我可以随时切换底层 LLM,而不用改业务代码——这在企业采购谈判中非常有优势。

    三语言 SDK(Python/C#/Java)的设计一致性是一大亮点。我们团队后端用 Java、AI 服务用 Python、桌面端用 C#,Semantic Kernel 让三者共享相同的 AI 编排逻辑,大幅降低了跨团队沟通成本。

    插件系统非常灵活。除了写代码函数,还支持 OpenAPI 规范直接导入(自动生成插件),这让集成第三方 API 变得极其简单。MCP 协议的支持也让智能体能力扩展变得更加标准化。

    需要注意的是,微软已宣布将 SK 升级为 Microsoft Agent Framework(MAF),MAF 是SK的正式继任者并已发布 1.0 稳定版。如果是全新项目,建议直接评估 MAF;但 SK 的现有用户不必担心,API 高度兼容,迁移成本很低。

    ⭐ 如果你在用 .NET 技术栈,Semantic Kernel 是目前唯一有微软官方长期支持的企业级 AI 框架,强烈推荐!

    28.2K+
    GitHub Stars

    4.6K+
    Forks

    3
    语言 SDK

    100+
    官方示例

    📥 下载地址 & 相关链接
    许可协议:MIT License(商业友好,可自由修改和分发)


      由 AI 自动整理,数据来源 GitHub  
  • E2B:开源 AI Agent 云沙箱,为智能体提供安全隔离的代码执行环境,12.8K+ Stars 让 AI 真正动手

    E2B:开源 AI Agent 云沙箱,为智能体提供安全隔离的代码执行环境,12.8K+ Stars 让 AI 真正动手

    📦 E2B:开源 AI Agent 云沙箱

    为企业级 AI 智能体提供安全隔离的代码执行环境

    ⭐ 12.8K+ Stars
    🚀 Apache-2.0
    🐍 Python/TypeScript
    ☁️ 云原生

    📝 项目简介

    E2B(Etienne de Bruijn)是一款开源的企业级 AI 智能体安全运行环境,为智能体提供可访问真实世界工具的安全隔离沙箱,支持在云端运行 AI 生成的代码。E2B 让 AI Agent 能够安全地执行代码、操作文件、访问网络,同时保持宿主环境的完全隔离。

    随着 AI Agent 的爆发式增长,如何让智能体安全地执行代码成为一个核心挑战。E2B 提供了基于 Firecracker 微虚拟机(microVM)的轻量级沙箱环境,启动仅需约 150ms,支持最长 24 小时运行,已成为 AI Agent 沙箱领域的基础设施级开源项目。

    🚀 核心功能

    🔒 安全隔离沙箱

    基于 Firecracker microVM 构建,每个沙箱完全隔离,支持 Linux x86_64 环境。AI 生成的代码在沙箱内执行,无法访问宿主环境,从根本上保障安全性。

    ⚡ 极速启动

    沙箱环境启动仅需约 150ms,几乎无感知延迟。支持长时间运行(最长 24 小时),满足复杂任务的执行需求。

    🛠️ 真实世界工具

    沙箱内预装常用开发工具,支持文件系统操作、网络访问、代码执行等真实世界能力,让 AI Agent 真正”动手”完成任务。

    🌐 多语言 SDK

    官方提供 Python 和 TypeScript/JavaScript 双语言 SDK,支持同步/异步调用,5 行代码即可启动沙箱并执行代码。

    📦 模板系统

    支持自定义模板(Template),可预装依赖、预置文件,一键创建包含完整环境的沙箱。支持从 AWS ECR、Docker Hub、GCP GCR 拉取自定义镜像。

    🏢 企业级自托管

    提供 Terraform 脚本,可在 AWS/GCP 等云上自建 E2B 基础设施,满足数据合规和私有化部署需求。

    ⚙️ 安装要求与过程

    环境要求:

    • Python ≥ 3.10(不支持 3.9 及更早版本)
    • Node.js ≥ 18(使用 npm 或 pnpm 安装)
    • 需要注册 E2B 账号并获取 API 密钥

    SDK 安装:

    # Python 安装
    pip install e2b
    pip install e2b-code-interpreter # 代码解释器扩展

    # JavaScript/TypeScript 安装
    npm install e2b
    npm install @e2b/code-interpreter # 代码解释器扩展

    快速开始:

    import os
    from e2b import Sandbox

    # 配置 API 密钥
    os.environ[“E2B_API_KEY”] = “e2b_***”

    # 启动沙箱并执行命令
    with Sandbox() as s:
    result = s.commands.run(“pip install pandas && python -c ‘import pandas; print(pandas.__version__)’”)
    print(result.stdout)

    💡 典型使用场景

    🤖

    AI Agent 代码执行

    为 LLM 应用、AI Agent 提供安全的代码运行环境,避免恶意代码影响宿主环境。无论是数据分析、图表生成还是自动化任务,都可以在隔离沙箱中安全执行。

    📊

    代码解释器(Code Interpreter)

    通过 @e2b/code-interpreter(JS)或 e2b-code-interpreter(Python)包,可直接执行代码片段并返回结果,打造类似 ChatGPT Code Interpreter 的交互体验。

    🏢

    企业私有化部署

    通过官方提供的 Terraform 脚本,在 AWS/GCP 等云上自建 E2B 基础设施,满足金融、医疗等行业的严格数据合规要求。

    🏗️ 技术架构

    E2B 的架构设计充分考虑了安全性和性能:

    • Firecracker microVM:使用 AWS 开源的 Firecracker 虚拟化技术,兼具虚拟机的隔离性和容器的轻量性
    • 快照/恢复:支持文件系统快照,沙箱可暂停/恢复,节省资源开销
    • 元数据过滤:支持根据元数据过滤查询沙箱列表,方便大规模管理
    • 生命周期控制:支持超时自动暂停,可配置是否保存内存状态
    • CLI 工具:新增 E2B CLI,可通过命令行构建、发布模板

    💝 推荐理由

    E2B 解决了 AI Agent 开发中的一个核心痛点:如何安全地执行 AI 生成的代码

    在 AI Agent 爆发增长的 2026 年,E2B 已经成为这一领域的开源基础设施。无论是个人开发者还是企业团队,都可以通过 E2B 快速为 AI Agent 添加强大的代码执行能力。

    我个人特别欣赏 E2B 的几个设计决策:

    • 开源优先:Apache-2.0 许可,完全开源,可自由自托管
    • 开发者友好:5 行代码即可启动沙箱,SDK 设计简洁直观
    • 性能出色:150ms 启动时间,几乎不影响用户体验
    • 生态完善:支持主流 LLM 框架集成,提供详细文档和 Cookbook

    如果你正在开发 AI Agent 或需要安全的代码执行环境,E2B 绝对值得一试!

    📥 下载地址

    GitHub 仓库
    官方文档
    Cookbook 示例
    自托管指南

    PyPI 安装: pip install e2b
    npm 安装: npm install e2b

    AI
    开源
    AI Agent
    云沙箱
    代码解释器
    Python
    TypeScript
    Docker
    Firecracker

  • openpilot:开源机器人操作系统,让300+款车型升级智能驾驶辅助,62.9K+ Stars让自动驾驶触手可及

    openpilot:开源机器人操作系统,让300+款车型升级智能驾驶辅助,62.9K+ Stars让自动驾驶触手可及

    openpilot

    COMMA.AI 开源 · MIT许可 · 62.9K+ STARS

    🚗 项目简介

    openpilot 是由 comma.ai 开发的开源机器人操作系统,目前主要功能是升级 300+ 款支持车型的驾驶辅助系统。作为目前最成熟的开源自动驾驶辅助系统,openpilot 让用户能够以极低的成本将普通车辆升级为具备 Lane Keep Assist(车道保持)、Adaptive Cruise Control(自适应巡航)等高级辅助驾驶功能的智能汽车。

    ⚠️ 注意 openpilot 是 Alpha 级别的研究软件,仅供研究用途,并非商业产品。使用需遵守当地法律法规。

    62.9K+
    GitHub Stars
    300+
    支持车型
    11K+
    Fork 数量
    2016
    创立年份

    安装要求和过程

    📦 硬件要求

    • 支持的设备:comma four(官方推荐),也可在其他硬件上运行
    • 车辆兼容性:确认你的车型在 300+ 支持车型列表
    • 车辆线束:需要购买 comma 车辆线束 连接 comma four 和车辆

    ⚡ 快速安装

    1. 购买设备:在 comma.ai/shop 购买 comma four
    2. 安装线束:按照 官方安装指南 安装车辆线束和设备
    3. 安装软件:在 comma four 设置中输入自定义软件 URL:openpilot.comma.ai 即可安装稳定版
    4. 快速启动(开发环境):bash <(curl -fsSL openpilot.comma.ai)

    🔀 分支选择

    设备分支 URL 说明
    release-mici openpilot.comma.ai 稳定发布分支(推荐)
    release-mici-staging openpilot-test.comma.ai 预发布版本,提前体验新功能
    nightly openpilot-nightly.comma.ai 开发前沿分支,稳定性不保证

    ✨ 核心功能

    🚙
    广泛的车型支持
    覆盖 300+ 款主流车型,可直接升级原厂驾驶辅助系统,让更多车主享受智能驾驶体验。
    🛡️
    安全合规
    遵循 ISO 26262 功能安全标准,安全模型代码由 C 语言编写,经过多轮严格测试验证。
    🧪
    完善的测试体系
    每次提交运行软件在环测试;panda 模块包含 SIL/Safety 测试;10 台设备持续复现行驶路线测试。
    🤖
    机器人操作系统
    openpilot 定位为机器人操作系统,不仅限于汽车,未来可扩展至更多机器人应用场景。
    📊
    灵活的数据管理
    默认上传驾驶数据用于模型训练,用户可自主关闭数据收集;仅驾驶员摄像头和麦克风需主动开启才会记录。
    🌐
    活跃的开源社区
    MIT 协议开源,11K+ Forks;Discord 社区活跃;comma 提供 赏金计划 激励外部贡献者。

    🎯 典型使用场景

    场景一:升级现有车辆的驾驶辅助系统
    如果你拥有一辆支持的车(如本田、丰田、现代等主流品牌),购买 comma four 和设备线束后,即可将车辆升级为具备 Lane Keep Assist(车道保持)和 Adaptive Cruise Control(自适应巡航)功能的半自动驾驶汽车,体验媲美原厂高级辅助驾驶系统的能力。
    场景二:AI 与自动驾驶研发学习
    openpilot 是学习 自动驾驶技术 的绝佳开源项目。代码架构清晰,包含完整的感知、规划、控制链路;遵循 ISO 26262 安全标准;提供丰富的 开发工具;研究者可以在真实车辆数据上验证自己的算法。
    场景三:机器人操作系统研究
    openpilot 的定位是 机器人操作系统,其架构设计具有通用性。研究者可以基于 openpilot 的感知-决策-控制框架,扩展到其他机器人应用场景,如无人配送车、农业机器人等,探索通用机器人 OS 的可能性。

    💡 推荐理由

    我推荐 openpilot 的原因有以下几点:

    • 真实可用的自动驾驶开源系统:不同于许多停留在论文或仿真层面的项目,openpilot 是真正能在真实车辆上运行的自动驾驶辅助系统,已有数万用户日常使用。
    • 门槛极低:只需要购买 comma four(约 $400)和车辆线束,即可让你的车具备高级辅助驾驶能力,成本远低于更换新车。
    • MIT 协议完全开源:代码完全透明,社区活跃,11K+ Forks 意味着丰富的二次开发生态。
    • 持续迭代:comma.ai 全职团队持续维护,每天都有新的提交,Github 最近更新是今天(2026-07-01),项目非常活跃。
    • 数据驱动:默认收集匿名驾驶数据用于模型训练,这意味着 openpilot 的模型会随着使用人数增加而越来越好,形成正向循环。

    个人建议:如果你对自动驾驶技术感兴趣,或者希望以极低成本体验高级辅助驾驶功能,openpilot 是目前唯一成熟的开源选择。不过请记住,这只是 Alpha 级别的研究软件,使用时务必保持注意力,随时准备接管车辆。

    🔬 技术架构亮点

    🧠 感知模块
    基于神经网络的车道线检测、前车识别、交通标志识别等感知任务,运行在 comma four 的骁龙处理器上。
    📡 CAN 总线接口
    通过 panda 板(CAN 转 USB)与车辆 CAN 总线通信,读取车辆状态并发送控制指令,代码经 ISO 26262 安全认证。
    🎯 规划与控制
    基于模型预测控制(MPC)的路径规划和车辆控制算法,在保证安全的前提下实现平滑的横向和纵向控制。
    📱 comma connect
    用户可通过 comma connect 平台查看驾驶数据、管理设备、下载行车记录,形成完整的数据闭环。

    📥 下载地址

    comma.ai 官方商店:https://comma.ai/shop

    快速安装命令:bash <(curl -fsSL openpilot.comma.ai)

    📌 本文由 AI 自动整理,信息来自 GitHub 开源仓库,最新动态请关注官方仓库。

    MIT许可
    Python
    自动驾驶
    机器人

  • MinerU:让LLM读懂复杂文档的高精度解析引擎,72.5K+ Stars将PDF/Office转为AI可用格式

    MinerU:让LLM读懂复杂文档的高精度解析引擎,72.5K+ Stars将PDF/Office转为AI可用格式

    📄

    MinerU

    高精度文档解析引擎 · 专为 LLM / RAG / Agent 设计

    72.5K+ Stars
    🏷️ Python
    📜 MinerU License (Apache 2.0扩展)
    🏢 OpenDataLab 出品

    📌 项目简介

    MinerU 是一个将 PDF、DOCX、PPTX、XLSX、图片、网页等复杂格式文档,高精度转换为 Markdown / JSON 格式的开源工具,让 LLM 和 RAG 系统能够真正”读懂”非结构化文档。采用 VLM+OCR 双引擎,支持 109 种语言,是 AI 工作流中文档预处理的首选方案。

    🚀 核心功能

    📑

    多格式支持

    原生支持 PDF、DOCX、PPTX、XLSX、图片、网页,输出 Markdown / JSON 格式

    🔣

    公式+表格精准识别

    公式自动转为 LaTeX,表格自动转为 HTML,精准还原文档布局

    🌐

    109 种语言 OCR

    VLM+OCR 双引擎,支持扫描件、手写内容、多栏布局、跨页表格合并

    🔌

    原生 MCP / RAG 集成

    原生支持 MCP Server、LangChain、LlamaIndex、RAGFlow、Dify、FastGPT

    💻

    国产 AI 芯片适配

    支持昇腾、寒武纪、燧原、沐曦、摩尔线程、昆仑芯等 10+ 款国产芯片

    🐋

    多推理后端

    支持 pipeline / vlm-engine / hybrid-engine 三种后端,适配不同精度与速度需求

    ⚙️ 安装要求和过程

    环境要求

    依赖项 要求
    操作系统 Linux (2019+)、Windows 10+、macOS 14.0+
    Python 3.10 ~ 3.13(Windows 仅支持 3.10~3.12)
    内存 最低 16GB,推荐 32GB+
    GPU 显存 pipeline 后端最低 4GB;vlm/hybrid 后端最低 8GB

    快速安装(推荐)

    # 使用 uv 安装(推荐)
    pip install --upgrade pip
    pip install uv
    uv pip install -U "mineru[all]"
    
    # 命令行使用
    mineru -p <输入文件/目录> -o <输出路径>
    
    # 纯 CPU 运行
    mineru -p <输入> -o <输出> -b pipeline

    Docker 部署

    # 仅支持 Linux / WSL2
    docker run -p 8000:8000 --gpus all opendatalab/mineru:latest

    💡 典型使用场景

    📚 RAG 知识库文档预处理

    将企业知识库中的 PDF 技术文档、Word 操作手册、PPT 培训材料批量转换为 Markdown,注入 RAG 系统,使 LLM 能够基于真实文档内容作答,避免幻觉。

    🤖 AI Agent 文档理解增强

    AI Agent 在回答用户问题时,先通过 MinerU 解析相关文档,提取结构化内容后再进行推理,大幅提升回答的准确性和可溯源性。原生 MCP Server 可直接对接 Claude/Cursor/Windsurf。

    🌏 多语言文档批量处理

    处理跨国企业的多语言合同、技术规格书(支持 109 种语言),通过 OCR+VLM 双引擎准确识别双语混排、公式、表格等复杂内容。

    ✨ 推荐理由

    MinerU 解决了 AI 工作流中一个极其关键的痛点:非结构化文档的精准解析。对于 RAG 应用来说,文档解析质量直接决定最终效果——解析出错,检索再准也没用。

    我个人最喜欢它的三个设计:① 双引擎架构(pipeline 速度快,vlm-engine 精度高,可按需切换);② 原生 MCP 支持,直接让 AI 编程助手具备文档理解能力;③ 国产芯片适配,真正自主可控。

    相比同类工具(如 Unstructured、PyPDF2),MinerU 在复杂布局还原、公式识别、表格合并等方面明显更胜一筹,这也是它能获得 72.5K Stars 的核心原因。

    自动化任务 于 2026-07-01 发布 · 数据来源:GitHub

  • LangExtract:Google 出品的 LLM 结构化信息提取利器,精准溯源让 AI 抽取结果可验证

    LangExtract:Google 出品的 LLM 结构化信息提取利器,精准溯源让 AI 抽取结果可验证

    LangExtract Logo

    📌 项目简介

    LangExtract 是 Google 开源的 Python 库,基于大语言模型从非结构化文本中精准提取结构化信息,并映射到原文精确位置,让 LLM 的信息抽取结果可验证、可溯源。

    ⭐ 36.8K+ Stars
    📝 Apache 2.0
    🐍 Python
    🏢 Google 出品

    ⚙️ 安装要求与过程

    📦 环境要求

    • Python:3.10 及以上版本
    • 依赖:自动安装(pydantic, tenacity, tqdm 等)
    • API 密钥:使用 Gemini 需配置 LANGEXTRACT_API_KEY 环境变量
    • 本地模型:可选,需提前安装 Ollama

    🚀 快速安装(3种方式)

    方式一:PyPI 安装(推荐)

    pip install langextract

    方式二:虚拟环境安装(避免依赖冲突)

    python -m venv langextract_env
    # Linux/Mac:
    source langextract_env/bin/activate
    # Windows:
    langextract_env\Scriptsctivate
    pip install langextract

    方式三:Docker 部署

    docker build -t langextract .
    docker run –rm -e LANGEXTRACT_API_KEY=”你的API密钥” langextract

    🎯 核心功能

    🔍 1. 精准溯源 — 提取结果可验证

    所有提取结果都会映射到源文本中的精确字符位置,支持可视化高亮展示。你可以直观看到每个提取实体在原文中的具体出处,彻底解决 LLM 幻觉问题。

    📐 2. 稳定的结构化输出

    基于用户提供的少样本示例(Few-shot Examples)强制执行输出格式,在 Gemini 等支持约束生成的模型中可保证输出格式 100% 合规,无需繁琐的 Prompt 调试。

    📚 3. 长文档优化 — 解决”大海捞针”

    通过文本分块 + 并行处理 + 多轮抽取的组合策略,有效解决长文档中关键信息难以完整抽取的痛点,大幅提升召回率。支持直接从 URL 读取长文本。

    🖥️ 4. 交互式 HTML 可视化

    自动生成自包含的交互式 HTML 文件,可在浏览器中直观查看数千个提取实体在原文中的高亮上下文,支持点击跳转,让审核效率倍增。

    🌐 5. 多模型支持 — 云端 + 本地全覆盖

    原生支持 Gemini 系列(默认)、OpenAI 系列(需额外安装)、Ollama 本地模型(无需 API 密钥),并通过插件系统支持任意自定义模型后端,真正模型无关。


    💡 典型使用场景

    🏥 场景一:医疗文本结构化

    从自由书写的临床笔记、出院小结中精准提取药物名称、剂量、频次、诊断结果等结构化信息,并溯源到原文位置,辅助医疗信息化系统建设。(注:医疗场景需遵守 Google Health AI Developer Foundations 使用条款)

    📄 场景二:长文档知识抽取

    处理数千页的研究论文、法律合同、财报,自动提取关键实体、关系、事件,生成可交互的 HTML 报告。多轮抽取 + 并行处理让长文档召回率大幅提升。

    🔒 场景三:本地隐私数据提取

    通过 Ollama 接入本地开源模型(如 Gemma 2),在完全离线环境下对敏感文本(法律、金融、个人数据)进行结构化提取,数据不出本地,满足严苛的隐私合规要求。


    🌟 推荐理由

    为什么值得关注?

    作为 Google 官方开源项目,LangExtract 解决了 LLM 信息抽取领域最痛的两个问题:结果不可验证格式不稳定

    它的设计哲学非常务实:

    • 🎯 精准溯源让每次提取都可验证,这在医疗、法律等高风险场景中是刚需
    • 📐 少样本示例驱动,无需微调模型,换个领域只需改示例,极大降低适配成本
    • 🖥️ 交互式 HTML 可视化是杀手级功能,让非技术用户也能直观审核抽取结果
    • 🌐 模型无关设计,从 Gemini 到 Ollama 随意切换,不被任何厂商锁定

    相比同类工具(如原生 LLM API 直接抽取),LangExtract 在准确性、可解释性、工程化落地三个维度都有明显优势。如果你正在做 RAG、知识图谱构建、文档智能处理,LangExtract 应该成为你的标配工具。

    ⭐ 推荐指数:5/5


    📥 下载地址

    📌 许可证:Apache 2.0 | 开发语言:Python | 维护方:Google