标签: Go

  • GitHub Copilot SDK:一套 Agent 运行时,六种语言官方 SDK

    GitHub Copilot SDK:一套 Agent 运行时,六种语言官方 SDK

    GitHub Copilot SDK

    项目简介

    GitHub Copilot SDK 是 GitHub 官方发布的多平台 Agent 运行时 SDK,让你在自己的应用中嵌入 Copilot CLI 的完整智能体引擎。支持 TypeScript、Python、Go、.NET(C#)、Java、Rust 六种语言,通过 JSON-RPC 与 Copilot CLI server 模式通信,SDK 自动管理进程生命周期——你只需定义 Agent 行为,Copilot 负责规划、工具调用和文件编辑。

    一句话:把 Copilot CLI 的 Agent 能力,以 SDK 形式嵌入任何应用。

    六语言SDK速览

    安装要求与过程

    环境要求

    • Node.js / TypeScript:Node.js ^20.19.0 或 ≥22.12.0
    • Python:Python 3.11+
    • .NET:.NET 8+ SDK
    • Go / Rust / Java:对应语言工具链 + 需额外安装 Copilot CLI
    • 认证:GitHub Copilot 订阅,或 BYOK 自带模型 API Key

    快速安装

    # Node.js / TypeScript
    npm install @github/copilot-sdk
    
    # Python
    pip install github-copilot-sdk
    python -m copilot download-runtime   # 下载运行时二进制
    
    # .NET
    dotnet add package GitHub.Copilot.SDK
    
    # Go
    go get github.com/github/copilot-sdk/go
    
    # Rust
    cargo add github-copilot-sdk
    
    # Java (Maven)
    <dependency>
      <groupId>com.github</groupId>
      <artifactId>copilot-sdk-java</artifactId>
    </dependency>

    Python 快速上手示例

    import asyncio
    from copilot import CopilotClient
    from copilot.session_events import AssistantMessageData, SessionIdleData
    from copilot.session import PermissionHandler
    
    async def main():
        async with CopilotClient() as client:
            async with await client.create_session(
                on_permission_request=PermissionHandler.approve_all,
                model="gpt-5",
            ) as session:
                done = asyncio.Event()
                def on_event(event):
                    match event.data:
                        case AssistantMessageData() as data:
                            print(data.content)
                        case SessionIdleData():
                            done.set()
                session.on(on_event)
                await session.send("What is 2+2?")
                await done.wait()
    
    asyncio.run(main())

    核心功能

    1. 六语言官方 SDK:TypeScript/Python/Go/.NET/Java/Rust 全部由 GitHub 官方维护,统一 API 设计,语义化版本管理(GA 状态)。
    2. Agent Loop 完整循环:内置完整的工具调用循环(Tool Use Loop),自动处理回合(Turn)与完成信号,无需自建编排层。
    3. Hooks 拦截机制:可在工具调用前后拦截、改写结果、处理错误——实现权限控制、日志审计、输出过滤等中间件逻辑。
    4. Custom Agents + Fleet Mode:定义带独立工具集和指令的子智能体;Fleet Mode 支持并行派发多个子智能体处理大型独立任务流。
    5. MCP Servers 集成:原生接入 Model Context Protocol 服务器,扩展外部工具能力;同时支持 Skills 提示词模块与 Plugin Directories 插件打包。
    6. 40+ Streaming Events:实时订阅会话事件流(assistant.message、tool.call、session.idle 等),构建响应式 UI。
    架构与核心能力

    典型使用场景

    场景一:IDE 插件内嵌 AI 编程助手

    在 VS Code / JetBrains 插件中集成 Copilot Agent,用户选中代码后调用 SDK 发起对话,Agent 自动读取文件上下文、执行重构建议、直接编辑文件。相比自己对接 LLM API + 构建工具链,SDK 已封装好文件读写、终端命令、Git 操作等全套工具。

    场景二:CI/CD 流水线中的自动化 Review Bot

    在 GitHub Actions 中用 Python SDK 启动 Copilot Session,将 PR diff 作为输入发送给 Agent,让它分析变更影响、生成 review 评论。通过 Hooks 可限制 Agent 只读不写,确保安全可控。

    场景三:SaaS 产品中的 AI 功能模块

    在 Web 后端通过 TypeScript SDK 创建带预算限制的 Session(Session Limits),为每个用户分配 AI Credits 配额。结合 Remote Sessions 功能,让用户在浏览器中实时看到 Agent 工作过程。BYOK 模式下可使用自有模型 Key,降低运营成本。

    推荐理由

    作为 GitHub 官方出品,Copilot SDK 的最大优势是「不用重复造轮子」。过去要在应用里嵌入 AI Agent 能力,你需要自己处理模型选择、提示词模板、工具定义、权限控制、错误恢复……现在这些全部由 Copilot CLI 引擎托管,SDK 只暴露简洁的 Session API。

    六种语言的覆盖面也令人印象深刻——从脚本到企业级后端,从前端到系统编程,几乎覆盖了主流开发栈。特别是 Python 和 TypeScript SDK 内置了 CLI 二进制,开箱即用体验非常顺滑。

    当然,它需要 Copilot 订阅或 BYOK 配置,不是完全免费的方案。但考虑到它提供的生产级 Agent 运行时能力,这个成本是合理的。如果你正在评估「如何在产品中加入 AI Agent 能力」,Copilot SDK 值得作为首选方案之一认真试用。

    下载地址

  • Open Code Review:阿里巴巴开源的 AI 代码评审 CLI,Token 只用 1/9 却更精准

    Open Code Review:阿里巴巴开源的 AI 代码评审 CLI,Token 只用 1/9 却更精准

    如果你用过 Claude Code 之类的通用 Agent 做代码评审,大概率遇到过这些坑:改动一多就”偷工减料”只看部分文件、报出来的问题行号对不上、换个提示词质量就飘。Open Code Review(OCR) 是阿里巴巴刚开源的一款 AI 代码评审命令行工具,它把”确定性工程”和”Agent 动态决策”拧在一起,专门解决这些问题。项目上线不久便冲上 GitHub Trending,目前已收获约 12.2K Stars

    Open Code Review 功能亮点
    Open Code Review 功能亮点(图片来源:项目 README)

    一句话简介

    Open Code Review 是阿里巴巴开源的 AI 代码评审 CLI 工具——读取 Git diff,交给可配置的大模型 Agent 进行带工具调用的深度评审,产出行级精准的结构化评审意见。它源自阿里内部使用两年、服务数万开发者、累计发现数百万代码缺陷的官方评审助手,经大规模验证后开源。

    安装要求与快速上手

    环境要求

    • Git ≥ 2.41:OCR 依赖 Git 生成 diff、检索代码与仓库操作。
    • 支持 Windows / macOS / Linux 三大平台;需要配置一个大模型接口(OpenAI / Anthropic 兼容即可),或使用”委托模式”无需配模型。

    安装(npm 全局安装)

    npm install -g @alibaba-group/open-code-review

    安装完成后,全局即可使用 ocr 命令。也支持安装脚本、GitHub Release 二进制、源码编译等方式。

    配置模型

    # 选择内置服务商或添加自定义服务商
    ocr config provider
    # 为当前服务商选择模型
    ocr config model

    交互式界面会引导你完成服务商选择、API Key 填写与模型配置,并自动测试连通性。

    模型配置界面
    交互式模型配置界面(图片来源:项目 README)

    开始评审

    cd your-project
    
    # 工作区模式:评审所有暂存/未暂存/未跟踪的改动
    ocr review
    
    # 分支范围:对比两个 ref
    ocr review --from main --to feature-branch
    
    # 单个 commit
    ocr review --commit abc123
    
    # 整文件扫描:不看 diff,直接审阅整个仓库或指定目录
    ocr scan
    ocr scan --path internal/agent

    核心功能

    • 确定性工程 × Agent 混合架构:对”绝不能出错”的评审步骤(选文件、匹配规则、定位行号)用工程逻辑硬约束保证正确,把动态决策与上下文检索交给 Agent,各司其职。
    • 精准选文件 + 智能打包:明确判定哪些文件需评审、哪些应过滤;把关联文件(如中英两份 message 属性文件)打包为一个评审单元,每包作为隔离上下文的子 Agent 并发运行,在超大改动集上依然稳定。
    • 行级精准定位 + 反思模块:独立的评论定位与评论反思模块,系统性提升 AI 反馈的位置准确度与内容准确度,避免”行号漂移”。
    • diff 评审 + 整文件扫描ocr review 审阅改动,ocr scan 审阅整份文件——适合审计陌生代码库或没有有意义 diff 的目录。
    • 丰富集成能力:内置 MCP Server 扩展工具、CI/CD 集成(GitHub Actions / GitLab CI / Gerrit 等),并可作为 Skill 或插件接入 Claude Code、Codex、Cursor;浏览器端 Session Viewer 可回放评审过程。

    性能基准

    官方基于 50 个热门开源仓库、200 个真实 PR、10 种编程语言构建了真实世界评审基准,由 80+ 资深工程师交叉标注出 1505 个基准问题。结果显示:在同一底座模型下,OCR 的 准确率(Precision)与 F1 显著更高,而 Token 消耗仅约通用 Agent 的 1/9、评审更快;召回率略低,是”以精度换噪声”的有意取舍。

    性能基准对比
    在同一底座模型下的基准表现概览

    典型使用场景

    • 提交前自检:在本地 ocr review 一把,把行级问题在推送前就修掉,减少来回改 PR 的成本。
    • CI 流水线自动评审:接入 GitHub Actions / GitLab CI,对每个 PR 自动评审并留下行级评论,低 Token 成本让团队大规模跑得起。
    • 审计陌生代码库:接手老项目或第三方代码时用 ocr scan 整文件扫描,快速摸清 NPE、线程安全、XSS、SQL 注入等隐患。

    推荐理由

    市面上”给 Agent 套个 Skill 就当代码评审”的方案不少,但真正在工程上把稳定性做扎实的不多。OCR 最打动我的一点,是它没有一味迷信大模型,而是把”该确定的地方交给工程、该灵活的地方交给 Agent”这条边界划得很清楚——这正是它能在阿里内部大规模跑两年、且在基准上只花约 1/9 Token 就拿到更高精度的原因。对追求 CI 成本可控、又不想被误报刷屏的团队来说,这是个值得一试的选择。它还内置了针对 NPE、线程安全、XSS、SQL 注入等常见缺陷的微调规则集,开箱即用。

    下载地址

  • PentAGI:完全自主的 AI 渗透测试智能体系统(20.7K Stars,Go 构建)

    PentAGI:完全自主的 AI 渗透测试智能体系统(20.7K Stars,Go 构建)

    PentAGI 概览

    项目简介

    PentAGI(Penetration testing Artificial General Intelligence)是一个面向信息安全专业人士、研究人员与爱好者的自动化安全测试平台。它用前沿 AI 技术把渗透测试流程完全自主化——从信息收集、漏洞利用到生成可执行的攻防报告,全部由多智能体团队在隔离的 Docker 沙箱中自动完成。项目由 vxcontrol 团队维护,采用 MIT 许可证,目前在 GitHub 上已收获 20.7K+ Stars。

    安装要求和过程

    环境要求

    • Docker 与 Docker Compose(或 Podman)
    • 最低 2 vCPU、4GB 内存、20GB 可用磁盘空间
    • 可访问外网(用于拉取镜像与更新)
    • 支持 10+ LLM 供应商:OpenAI / Anthropic / Google Gemini / AWS Bedrock / DeepSeek / Ollama / GLM / Kimi / Qwen 等

    快速安装

    # 1. 下载官方 docker-compose 编排文件
    curl -O https://raw.githubusercontent.com/vxcontrol/pentagi/master/docker-compose.yml
    
    # 2. 一条命令启动(默认拉起 Web UI、Agent 运行时、PostgreSQL+pgvector 等)
    docker compose up -d

    启动后访问 Web UI 完成登录与 LLM 供应商配置,即可用自然语言下发渗透测试任务。还可叠加 docker-compose-langfuse.yml(可观测)、docker-compose-graphiti.yml(知识图谱)、docker-compose-observability.yml(Grafana/Prometheus)等可选编排文件扩展能力。

    核心功能

    • 安全隔离 + 完全自主:所有操作在沙箱化的 Docker 环境中执行,AI 智能体自动规划并执行测试步骤,可选执行监控与智能任务规划提升可靠性。
    • 20+ 专业安全工具内置:开箱即用地集成了 nmap、metasploit、sqlmap 等一整套渗透利器。
    • 专家智能体团队:研究 / 开发 / 基础设施等专职 Agent 分工协作,配合任务规划让小模型也能高效运转。
    • 智能记忆 + 知识图谱:长期沉淀研究结果与成功路径,基于 Graphiti + Neo4j 构建语义关系图谱,增强上下文理解。
    • 详尽报告与可观测性:自动产出带利用指南的漏洞报告,并集成 Grafana/Prometheus 实现实时监控。

    典型使用场景

    • 授权环境下的自动化攻防演练:安全团队在自有靶场或获得书面授权的资产上,让 PentAGI 跑完整渗透流程,快速发现暴露面。
    • 红队作业与报告交付:红队队员把重复性信息收集、初步利用交给智能体,专注高价值的人工研判,并直接生成可交付的漏洞报告。
    • 安全研究与教学:结合 Graphiti 知识图谱复盘历次测试路径,沉淀方法论,用于教学与能力培养。

    推荐理由

    一句话——它把”渗透测试”这件高度依赖经验的手艺,变成了一条可由自然语言驱动、且全程可审计的流水线。对我个人而言最打动的有三点:① 彻底沙箱化,跑再多危险操作也不怕污染宿主机;② 多智能体分工比单一大模型稳得多,任务规划 + 执行监控让小模型也能干活;③ 知识图谱 + 长期记忆让它会”越用越聪明”。当然,它定位是合规授权场景下的安全研究利器,务必在合法授权范围内使用。

    下载地址

    • GitHub 仓库:https://github.com/vxcontrol/pentagi
    • 社区:Discord(discord.gg/2xrMh7qX6m)与 Telegram(t.me/+Ka9i6CNwe71hMWQy)
    • 部署方式:Docker / Docker Compose 自托管,数据完全自控

    本文仅作技术介绍,请在法律法规与授权范围内合理使用。

  • LocalAI:免费开源OpenAI替代方案,在本地硬件上运行全模态AI模型,47K+ Stars让AI彻底私有化

    LocalAI:免费开源OpenAI替代方案,在本地硬件上运行全模态AI模型,47K+ Stars让AI彻底私有化

    今天介绍一个让AI彻底私有化的开源神器——LocalAI。它被誉为”免费的开源OpenAI替代方案”,可以在任意硬件上运行各类AI模型(LLM、视觉、语音、图像、视频),无需GPU,数据完全本地化。

    项目简介

    LocalAI 是开源AI引擎,可作为OpenAI/Anthropic API的直接替代品。它采用”小核心+按需加载后端”的可组合架构,支持在消费级硬件上运行大语言模型、图像生成、语音识别、语音合成等各类AI模型,数据完全留在本地,无需云服务。

    LocalAI Logo
    LocalAI – 免费开源AI引擎

    安装要求和过程

    环境要求

    • 操作系统:macOS、Linux、Windows
    • GPU:无需GPU!支持NVIDIA、AMD、Intel、Apple Silicon、Vulkan、纯CPU
    • 内存:8GB+ RAM(运行小模型);16GB+(运行中大模型)
    • 存储:至少10GB可用空间(模型文件较大)

    快速安装(Docker推荐)

    # CPU环境(最常用)
    docker run -ti --name local-ai -p 8080:8080 localai/localai:latest
    
    # NVIDIA GPU环境(CUDA 12)
    docker run -ti --name local-ai -p 8080:8080 --gpus all \
      localai/localai:latest-gpu-nvidia-cuda-12
    
    # macOS(下载DMG直接安装)
    # 从 GitHub Releases 下载 LocalAI.dmg
    

    快速开始

    # 启动LocalAI
    docker run -p 8080:8080 -ti localai/localai:latest
    
    # 在另一个终端,运行模型
    local-ai run llama-3.2-1b-instruct:q4_k_m
    
    # 启动交互式聊天
    local-ai chat --model llama-3.2-1b-instruct:q4_k_m
    
    # 从HuggingFace加载模型
    local-ai run huggingface://TheBloke/phi-2-GGUF/phi-2.Q8_0.gguf
    
    # 从Ollama仓库加载
    local-ai run ollama://gemma:2b
    

    核心功能

    1. OpenAI API完全兼容:可作为OpenAI API的直接替代品,现有应用和库无需修改即可迁移。支持文本生成、嵌入、图像处理、语音识别、语音合成等全套API。
    2. 无需GPU,消费级硬件即可运行:优化后的推理引擎(llama.cpp等)可在CPU上高效运行,无需昂贵GPU。支持Intel/AMD/Apple Silicon等各平台。
    3. 支持全模态AI模型:不仅支持LLM,还支持图像生成(Stable Diffusion)、语音识别(Whisper)、语音合成(TTS)、音乐生成(MusicGen)、目标检测等,真正的”全模态AI引擎”。
    4. 内置AI智能体:集成LocalAGI(自主智能体平台),支持工具调用、RAG、MCP协议、技能扩展。内置Agent Hub社区,可分享和下载智能体配置。
    5. 企业级功能:支持多用户、API密钥认证、用户配额、基于角色的访问控制(RBAC)。支持分布式模式(通过PostgreSQL+NATS实现水平扩展),适合企业生产环境。
    LocalAI Demo
    LocalAI 项目导览演示

    典型使用场景

    • 私有化AI助手部署:企业内部需要AI助手但担心数据泄露?LocalAI让你在内网部署完全私有的AI服务,支持OpenAI API兼容,现有应用无缝迁移。可用于代码辅助、文档问答、知识库检索等场景。
    • 替代云API降低成本:OpenAI API按调用次数收费,长期使用成本高昂。LocalAI让你在本地硬件上运行开源模型,一次部署无限使用,特别适合高频调用场景(如客服机器人、内容生成流水线)。

    推荐理由

    LocalAI 是我见过的最完整的本地AI部署解决方案。与Ollama相比,LocalAI支持更多模态(图像、语音、视频);与vLLM相比,LocalAI无需GPU且更易用;与text-generation-webui相比,LocalAI有完整的API兼容性和企业级功能。

    我最喜欢的设计是“小核心+按需加载后端”的架构。核心只有很小的基础功能,每个后端(llama.cpp、vLLM、whisper.cpp、stable-diffusion等)都是独立的OCI镜像,仅在需要时才拉取。这意味着你不会安装任何用不到的组件,资源占用极小。

    另外,MCP协议支持让LocalAI可以无缝对接各类AI智能体工具,而分布式模式则让它能够水平扩展,处理大规模并发请求。对于需要私有化部署AI服务的企业来说,LocalAI是目前最好的选择。

    下载地址

    许可协议:MIT License(完全开源,可自由使用、修改、分发)

    支持后端:llama.cpp、vLLM、whisper.cpp、stable-diffusion、MLX、TensorRT等60+推理后端


    如果你喜欢本地部署AI,LocalAI绝对值得一试。它让”私有化AI”变得简单可行,再也不用担心数据泄露和API费用了。

  • Weaviate:AI 开发者最爱的开源向量数据库,语义搜索与 RAG 的首选数据底座

    Weaviate:AI 开发者最爱的开源向量数据库,语义搜索与 RAG 的首选数据底座

    📦 项目简介

    Weaviate 是一款开源、云原生的向量数据库,同时存储对象和向量,支持大规模语义搜索。它将向量相似度搜索、关键词过滤、检索增强生成(RAG)和重排序功能整合到单个查询接口中,是构建 AI 应用的理想数据底座。

    Weaviate Logo

    ⚙️ 安装要求和过程

    环境要求

    • Docker 20.10+(推荐方式)
    • 内存:最低 4GB RAM,生产环境建议 8GB+
    • 客户端:Python 3.8+、Node.js 16+、Java 11+、Go 1.18+

    快速安装(Docker 本地部署)

    第一步:创建 docker-compose.yml

    services:
      weaviate:
        image: cr.weaviate.io/semitechnologies/weaviate:1.36.0
        ports:
          - "8080:8080"
          - "50051:50051"
        environment:
          ENABLE_MODULES: text2vec-model2vec
          MODEL2VEC_INFERENCE_API: http://text2vec-model2vec:8080
      text2vec-model2vec:
        image: cr.weaviate.io/semitechnologies/model2vec-inference:minishlab-potion-base-32M
    

    第二步:启动 & 安装客户端

    docker compose up -d
    pip install -U weaviate-client
    

    也可使用 Weaviate Cloud 免费试用,或部署到 Kubernetes/AWS/GCP。

    🚀 核心功能

    ⚡ 毫秒级十亿向量搜索

    基于 Go 构建,HNSW 索引,十亿级向量语义搜索毫秒返回。

    🔀 混合检索(向量+关键词+过滤)

    单接口同时支持语义搜索、BM25 关键词搜索、图像搜索,内置 hybrid 查询自动融合分数。

    🤖 内置 RAG & 重排序

    无需额外工具,直接支持生成式搜索(RAG)和重排序,快速构建 Q&A、聊天机器人。

    📈 生产级可扩展性

    支持水平扩展、多租户隔离、副本、RBAC 权限控制,Kubernetes 原生编排。

    💾 向量压缩 & TTL

    内置标量/二进制/产品量化,大幅降低内存占用;支持对象 TTL 自动清理过期数据。

    💡 典型使用场景

    场景一:RAG 检索增强生成系统

    将企业文档导入 Weaviate,结合 LLM 构建精准问答系统,大幅降低幻觉率。

    import weaviate
    from weaviate.classes.query import Filter
    
    client = weaviate.connect_to_local()
    results = client.collections.get("Document").query.near_text(
        query="如何申请退款?", limit=5,
        filters=Filter.by_property("category").equal("help")
    )
    for obj in results.objects:
        print(obj.properties["content"])
    

    场景二:语义搜索 & 推荐引擎

    电商/内容平台实现”理解意图”的搜索,支持多模态(文本+图像)检索。

    📌 推荐理由

    • 生态最完整:Python/JS/Java/Go/C# 五大官方 SDK
    • AI Agent 集成:官方提供 Agent Skills,支持 Claude Code/Cursor
    • 商业友好:BSD-3-Clause 许可,可自由修改和分发
    • 云原生架构:存储计算分离,Kubernetes 原生,水平扩展无忧

    📥 下载地址 & 相关链接

    ✝️ BSD 3-Clause License | Go | 2016年发布

  • Weaviate:AI 开发者最爱的开源向量数据库,语义搜索与 RAG 的首选数据底座

    Weaviate:AI 开发者最爱的开源向量数据库,语义搜索与 RAG 的首选数据底座

    📦 项目简介

    Weaviate 是一款开源、云原生的向量数据库,同时存储对象和向量,支持大规模语义搜索。它将向量相似度搜索、关键词过滤、检索增强生成(RAG)和重排序功能整合到单个查询接口中,是构建 AI 应用的理想数据底座。

    Weaviate Logo

    Weaviate —— AI 开发者最爱的开源向量数据库

    ⚙️ 安装要求和过程

    环境要求

    • Docker 20.10+(推荐方式)
    • 内存:最低 4GB RAM,生产环境建议 8GB+
    • 存储:持久化卷(可选,用于数据持久化)
    • 客户端:Python 3.8+、Node.js 16+、Java 11+、Go 1.18+ 可选

    快速安装(Docker 本地部署)

    第一步:创建 docker-compose.yml 配置文件:

    services:
      weaviate:
        image: cr.weaviate.io/semitechnologies/weaviate:1.36.0
        ports:
          - "8080:8080"
          - "50051:50051"
        environment:
          ENABLE_MODULES: text2vec-model2vec
          MODEL2VEC_INFERENCE_API: http://text2vec-model2vec:8080
    
      # 轻量级嵌入模型,导入数据时会自动生成向量
      text2vec-model2vec:
        image: cr.weaviate.io/semitechnologies/model2vec-inference:minishlab-potion-base-32M
    

    第二步:启动服务

    docker compose up -d
    

    第三步:安装 Python 客户端

    pip install -U weaviate-client
    

    也可以使用 Weaviate Cloud 托管服务(免费试用),或部署到 Kubernetes、AWS、GCP 等云平台。

    🚀 核心功能

    ⚡ 毫秒级十亿向量搜索

    基于 Go 构建,高负载下响应稳定。采用 HNSW(Hierarchical Navigable Small World)索引算法,支持 ANN 基准测试领先性能,十亿级向量复杂语义搜索毫秒级返回。

    🔀 混合检索(向量 + 关键词 + 过滤)

    单接口同时支持语义搜索传统关键词(BM25)搜索图像搜索,支持高级过滤,可灵活组合获得最优结果。内置 hybrid 查询类型,自动融合向量相似度与关键词相关性分数。

    🤖 内置 RAG & 重排序

    无需额外工具,直接支持生成式搜索(RAG)重排序(Reranking)能力。可快速构建 Q&A 系统、聊天机器人、摘要工具。集成 Cohere、OpenAI、Voyage 等主流 Reranker 模型。

    📈 生产级可扩展性

    支持水平扩展多租户隔离副本细粒度 RBAC 权限控制,适配从原型到大规模生产场景。存储计算分离架构,支持 Kubernetes 原生编排。

    💾 低成本运维 & 向量压缩

    内置向量压缩能力(标量量化、二进制量化、产品量化),通过向量量化、多向量编码降低内存占用,对搜索性能影响极小。支持对象 TTL 机制,按集合配置数据过期时间,自动清理过期数据。

    💡 典型使用场景

    场景一:RAG(检索增强生成)系统

    将企业文档、知识库导入 Weaviate,结合 LLM 构建精准问答系统。Weaviate 负责语义检索召回相关段落,LLM 负责生成最终答案,大幅降低幻觉率。

    import weaviate
    from weaviate.classes.query import Filter
    
    client = weaviate.connect_to_local()
    
    # 语义搜索 + 元数据过滤
    results = client.collections.get("Document").query.near_text(
        query="如何申请退款?",
        limit=5,
        filters=Filter.by_property("category").equal("help")
    )
    for obj in results.objects:
        print(obj.properties["content"])
    

    场景二:语义搜索 & 推荐引擎

    电商、内容平台可用 Weaviate 实现”理解意图”的搜索体验。用户输入自然语言查询,系统返回语义最匹配的商品或内容,而非简单的关键词匹配。

    Weaviate 也支持多模态搜索(文本 + 图像),用户可用图片搜索相似商品,或用文本描述搜索相关图片。

    📦 Python 快速上手

    import weaviate
    from weaviate.classes.config import Configure, DataType, Property
    
    # 连接本地 Weaviate 服务
    client = weaviate.connect_to_local()
    
    # 创建集合(类似关系数据库的表)
    client.collections.create(
        name="Article",
        properties=[Property(name="content", data_type=DataType.TEXT)],
        # 使用 Model2Vec 向量化器,导入时自动生成向量
        vector_config=Configure.Vectors.text2vec_model2vec(),
    )
    
    # 插入数据并自动生成向量
    articles = client.collections.get("Article")
    articles.data.insert_many([
        {"content": "Vector databases enable semantic search"},
        {"content": "Machine learning models generate embeddings"},
        {"content": "Weaviate supports hybrid search capabilities"},
    ])
    
    # 执行语义搜索
    results = articles.query.near_text(query="Search objects by meaning", limit=1)
    print(results.objects[0].properties["content"])
    
    client.close()
    

    📌 推荐理由

    Weaviate 是我推荐的向量数据库首选之一,尤其适合以下场景:

    • 与已发布的同类项目对比:Qdrant(Rust,极致性能)、Milvus(分布式,大规模)、Chroma(轻量,快速上手)—— Weaviate 则胜在生态最完整集成最丰富
    • AI Agent 生态集成:Weaviate 积极拥抱 AI Agent 生态,官方提供 Agent Skills,支持 Claude Code、Cursor 等 AI 编码工具直接操作
    • 多语言 SDK 覆盖最全:Python、JavaScript/TypeScript、Java、Go、C#/.NET 五大官方 SDK,社区还有 Rust、PHP、Ruby 等扩展
    • BSD-3-Clause 许可:商业友好,可自由修改和分发,适合企业内嵌使用

    如果你正在构建 RAG 系统、语义搜索功能,或任何需要”理解语义”的 AI 应用,Weaviate 值得作为向量数据库的第一选择进行评估。

    📥 下载地址 & 相关链接

    ✝️ 开源协议:BSD 3-Clause License | 开发语言:Go | 2016年发布,持续维护至今

  • Milvus:高性能云原生向量数据库,为AI应用打造的神经记忆中枢(44.9K Stars)

    Milvus:高性能云原生向量数据库,为AI应用打造的神经记忆中枢(44.9K Stars)

    Milvus Logo

    Milvus:高性能云原生向量数据库,为AI应用打造的神经记忆中枢

    44,934+ ⭐ · Go + C++ · Apache 2.0 · LF AI & Data 基金会托管

    📌 项目简介

    Milvus 是由 Zilliz 开发、LF AI & Data 基金会托管的开源向量数据库,专为 AI 应用的大规模非结构化数据检索而设计。底层使用 Go 和 C++ 编写,支持 CPU/GPU 硬件加速,可在十亿级向量规模下实现毫秒级检索延迟,是 RAG、推荐系统、多模态搜索等 AI 应用的首选向量存储引擎。最新稳定版:v2.5.13(2026年6月)。

    44.9K
    GitHub Stars

    4,089
    Forks

    10亿+
    向量规模

    5种
    SDK语言

    ⚙️ 安装要求和过程

    💻 环境要求
    • CPU:4核以上(生产推荐16核+)
    • 内存:16GB以上(十亿级向量推荐128GB+)
    • 存储:SSD推荐,冷数据可归档至S3/GCS(成本降低10倍)
    • Docker:Standalone模式需Docker 19.03+(最简方式)
    • Kubernetes:分布式部署需K8s 1.20+
    • Python:3.8~3.12(pymilvus SDK支持)
    🐳 快速安装(Docker Standalone,生产推荐
    # 下载 docker-compose.yml(含 etcd + MinIO 依赖)
    wget https://github.com/milvus-io/milvus/releases/download/v2.5.13/milvus-standalone-docker-compose.yml -O docker-compose.yml
    
    # 启动 Milvus
    docker compose up -d
    
    # 验证(看到三个容器均为 healthy 即成功)
    docker compose ps

    🐍 Python SDK 安装(最常用
    # 标准安装(连接远程Milvus服务)
    pip install -U pymilvus
    
    # 包含 Milvus Lite(嵌入式,pip install即可运行,无需Docker)
    pip install "pymilvus[milvus-lite]"
    
    # 验证
    python -c "from pymilvus import MilvusClient; print('Milvus OK')"

    ☁️ 零配置托管(Zilliz Cloud)

    不想自建服务?试用 Zilliz Cloud,提供 Serverless(按量付费)、Dedicated(专属集群)、BYOC(自带云)三种模式,免费额度足够个人开发使用。与 AWS Bedrock、Azure OpenAI 深度集成。

    ✨ 核心功能

    ⚡ 十亿级高性能检索

    存储计算分离架构,支持 HNSW / IVF / SCANN / DiskANN 等全部主流索引。GPU 加速兼容 NVIDIA CAGRA,十亿级向量下毫秒级延迟,QPS 可达数万次/秒。在 官方性能基准中处于行业第一梯队。

    🔀 混合检索(稠密+稀疏向量)

    原生支持 BM25 全文检索和学习的稀疏嵌入(SPLADE、BGE-M3),同一集合可同时存储稠密和稀疏向量,自定义重排策略合并多路结果,RAG 召回率提升 30%+。这是 Milvus 相比其他向量数据库的显著优势。

    🏢 企业级多租户与安全

    支持数据库/集合/分区/分区键四级隔离,单集群可承载数百万租户。强制用户认证、TLS 加密、RBAC 细粒度权限控制,满足 SOC 2 合规要求。适合 SaaS 平台多客户场景。

    💾 冷热存储分离

    热数据存内存/SSD,冷数据自动归档至 S3/GCS,存储成本降低 10 倍。支持对象存储原生架构,无需额外 ETL 即可直接读取云存储中的向量数据。Collection 级别的 Fork(写时复制)功能,大幅提升实验迭代效率。

    🌐 多语言 SDK + 丰富 AI 生态集成

    官方 SDK 覆盖 Python(pymilvus)、Java、Go、Node.js、Restful API 五种语言。原生集成 LangChain、LlamaIndex、OpenAI、HuggingFace、AutoGPT 等主流 AI 框架,可作为 RAG 应用的即插即用向量存储。Attu 提供图形化管理界面,Prometheus/Grafana 支持监控告警。

    🏗️ 架构设计

    Milvus 采用存储与计算分离、无状态微服务的分布式架构,所有组件以容器化方式部署,可充分利用 Kubernetes 的调度和自愈能力。

    ┌───────────────────────────────────────────────┐
    │            API Service Layer                 │
    │    gRPC / REST / Python / Java / Go SDK   │
    └──────────────┬──────────────────────────────┘
                    │
    ┌───────────────▼──────────────────────────────┐
    │         Coordinator Service (元数据)            │
    │   Root Coord  │  Query Coord  │  Data Coord  │
    └────┬──────────┴─────────────┴──────────────┘
          │          │              │
          ▼          ▼              ▼
    ┌──────────┐┌──────────┐  ┌──────────┐
    │ Query    ││ Data     │  │ Index    │  ← 可独立扩缩容
    │ Node     ││ Node     │  │ Node     │
    │(读密集) ││(写密集) │  │(索引构建)│
    └───┬──────┘└───┬──────┘  └───┬──────┘
         │          │            │
    ┌─────▼──────────▼────────────▼─────────┐
    │      Object Storage (S3 / GCS / MinIO)  │
    │       + Hot Cache (内存 / SSD)           │
    └──────────────────────────────────────────┘

    所有协调服务支持多副本部署,单节点故障秒级恢复。存储与计算解耦,可按业务特征独立调整查询/写入容量。

    🎯 典型使用场景

    场景一:RAG(检索增强生成)应用

    将企业知识库文档向量化存入 Milvus,用户提问时检索最相关的 Top-K 片段,注入 LLM 上下文窗口,显著提升回答准确性并减少幻觉。混合检索(向量+全文)可进一步提升召回率。官方 RAG 教程 30分钟可跑通 Demo。

    场景二:多模态语义搜索引擎

    利用 CLIP 等多模态模型将图片、音频、视频转为向量存入 Milvus,实现”以文搜图”、”以图搜图”、”视频片段检索”等功能。支持动态字段存储原始元数据,检索结果可直接返回图片 URL 或视频时间戳。图像检索实战教程 可直接参考。

    场景三:实时推荐系统

    将用户行为特征和物品特征向量化后存入 Milvus,通过近似最近邻搜索实时找相似用户或相似物品,实现个性化推荐。支持流式数据实时更新,新用户行为可在秒级反映到推荐结果中。官方电影推荐系统教程 可直接参考。

    💡 推荐理由

    在向量数据库赛道中,Milvus 是最成熟、生产案例最多的开源选择之一。与 Chroma(轻量级,适合原型)和 Qdrant(Rust 性能优异)相比,Milvus 的独特优势在于:

    • 云原生分布式架构:K8s 原生支持,可独立扩展查询/数据/索引节点,真正适合生产环境大规模部署(Chroma 无分布式,Qdrant 分布式为企业版功能)
    • 混合检索能力:稠密+稀疏向量一体化,RAG 场景召回率显著优于单一向量检索(多数竞品仅支持稠密向量)
    • LF AI & Data 基金会托管:开源治理规范,Apache 2.0 永久开源,不会突然变更许可协议
    • Milvus Lite 零配置:pip install 即可运行嵌入式版本,本地开发、单元测试、CI/CD 均无需 Docker

    如果你正在构建 RAG 应用或语义搜索功能,Milvus 值得作为向量存储的首选方案进行评估。根据 官方性能基准,Milvus 在十亿级向量场景下的检索性能处于行业第一梯队。

    LF AI & Data 基金会托管 · Apache 2.0 开源协议 · Zilliz 主导开发

    最后更新:2026年6月25日 · 数据来源:GitHub API + milvus.io

  • Ollama — 本地大模型运行首选工具,165K+ Stars 的本地 LLM 神器

    Ollama — 本地大模型运行首选工具,165K+ Stars 的本地 LLM 神器

    Ollama - Get up and running with LLMs

    ⚡ GitHub 热门 AI 开源项目

    Ollama

    在本地一键运行 Llama 3、DeepSeek、Qwen、Gemma 等开源大语言模型,无需云端,隐私优先

    165K+ Stars
    📥 40K+ 社区集成
    🦙 Go + C++
    📜 MIT 开源协议

    📌 项目简介

    Ollama 是一款开源的本地大语言模型运行工具,让你在 macOS、Windows、Linux 上轻松下载、运行和管理各类开源 LLM。它内置了 llama.cpp 推理引擎,支持量化模型的高效运行,同时提供简洁的 CLI、REST API 以及 Python / JavaScript SDK,是本地 AI 开发的首选入口。

    🔧 安装要求和过程

    环境要求

    • 支持 macOS 11+、Windows 10+、Linux(x86_64 / ARM64)
    • 建议 8GB+ 内存(7B 模型);16GB+(13B 模型);32GB+(33B+ 模型)
    • 磁盘空间:每个模型约 4GB~20GB
    🍎 macOS

    brew install ollama

    或下载 Ollama.dmg 手动安装

    🪟 Windows
    下载 OllamaSetup.exe
    官网 ollama.com 直接下载安装包

    🐧 Linux

    curl -fsSL https://ollama.com/install.sh | sh

    🐳 Docker

    docker run ollama/ollama

    ⚡ 快速开始

    1. 安装完成后,终端运行 ollama serve 启动服务(默认 11434 端口)
    2. 运行 ollama run deepseek-r1 拉取并启动 DeepSeek-R1 模型
    3. 直接在终端对话,或访问 http://localhost:11434 调用 REST API

    🚀 核心功能

    ① 一键运行海量开源模型

    内置模型库(ollama.com/library)涵盖 Llama 3、DeepSeek-R1、Qwen2.5、Gemma、Mistral、Phi-3 等数百个模型,一条命令即可拉取运行。支持自定义 Modelfile 导入 GGML / GGUF 格式模型。

    ② 完整的 REST API 与 SDK

    默认在 11434 端口提供 OpenAI 兼容的 REST API,官方提供 Python 和 JavaScript SDK。可以无缝接入 LangChain、Lobe Chat、Open WebUI 等生态,开发者集成成本极低。

    ③ 多模型并行与 GPU 加速

    支持同时加载多个模型,自动检测并利用 NVIDIA / AMD GPU 进行推理加速。macOS 上原生支持 Metal GPU 加速,Linux 支持 CUDA 和 ROCm,推理速度大幅提升。

    ④ 丰富的生态集成

    社区已推出 40,000+ 个集成工具,涵盖桌面应用(Open WebUI、Enchanted)、IDE 插件(Continue、CopilotKit)、Agent 框架(LangChain、AutoGen)、RAG 工具(AnythingLLM)等,几乎覆盖所有 AI 开发场景。

    ⑤ 隐私优先,完全离线

    所有推理在本地执行,数据不出本机。无需注册、无需联网、无需付费 API Key,特别适合对数据隐私有严格要求的企业内网和个人开发者。

    💡 典型使用场景

    场景一:本地 AI 编程助手

    搭配 Continue.devVS Code Ollama 插件,在断网环境下也能使用本地 LLM 辅助代码补全、解释和重构。使用 DeepSeek-Coder 或 CodeLlama 模型,响应速度毫秒级,代码质量媲美云端模型。

    实战示例:运行 ollama run deepseek-coder:6.7b,然后在 Continue.dev 中配置 Ollama 为默认 Provider,即可在 VS Code 侧边栏直接对话编程。

    场景二:私有知识库 RAG 系统

    结合 AnythingLLMOpen WebUI,将企业内网文档、PDF、Markdown 文件作为知识库,通过 Ollama 本地推理实现零数据外泄的智能问答系统。金融、医疗、法律等敏感行业尤为适用。

    实战示例:Docker 部署 AnythingLLM,在设置中选择 Ollama 作为 LLM Provider,指定本地模型(如 Llama3:8b),然后上传内部文档即可开始私有问答。

    场景三:AI 应用本地开发测试

    在开发 AI 应用时,使用 Ollama 替代 OpenAI API 进行本地测试和迭代,无需消耗云端配额,也避免了敏感测试数据外传的风险。Ollama 的 API 与 OpenAI 高度兼容,切换成本极低。

    实战示例:在 .env 中设置 OPENAI_BASE_URL=http://localhost:11434/v1OPENAI_API_KEY=ollama,现有基于 OpenAI SDK 的代码几乎不用改动即可切换至本地模型。

    ✨ 推荐理由

    作为本地 LLM 领域的”Docker”,Ollama 几乎是所有 AI 开发者入门本地模型的第一站。它把复杂的模型量化、推理引擎配置、GPU 驱动适配等底层细节全部封装,真正做到了”一行命令运行大模型”。

    我个人最常用的场景是在无网环境下做代码审查和文档撰写——启动 DeepSeek-R1 本地模型,响应速度非常快,且完全不担心代码泄露。相比云端 API,本地运行的成本优势在长期使用中极为明显:一次性下载模型,后续零费用无限调用。

    另外值得一提的是 Ollama 的 REST API 与 OpenAI 高度兼容,这意味着你可以用同一套代码同时支持云端和本地模型,在开发阶段用本地模型省成本,上线时切换到 GPT-4 保质量,这种灵活性是其他本地 LLM 工具难以提供的。

    如果你还没试过在本地运行 LLM,Ollama 是最好的起点。165K Stars 和 40K+ 社区集成不是偶然——它真的好用。


      GitHub 热门 AI 开源项目系列