标签: 自托管

  • nanobot:可完全自托管的轻量级个人 AI 智能体运行时

    nanobot:可完全自托管的轻量级个人 AI 智能体运行时

    nanobot 封面

    nanobot 是一个开源、超轻量的个人 AI 智能体运行时(agent runtime),把 WebUI、聊天渠道、工具、记忆、MCP、模型路由、自动化与部署打包在一个可读的小内核里,让你真正”拥有”自己的智能体,而不是被某个大平台锁定。

    ⭐ Stars 45,688+ 🍴 Forks 8,059
    💻 语言 Python 📜 协议 MIT
    🏢 团队 HKUDS(香港大学数据科学团队,LightRAG / Vibe-Trading 同门)

    📦 安装要求和过程

    环境要求

    • Python 3.11 及以上(必须)
    • Git:仅源码安装时需要
    • bun 或 npm:从源码构建 WebUI 时需要(PyPI/uv 安装包已内置 WebUI,无需额外构建)
    • 支持 macOS / Linux / Windows;零技术背景用户可走官方”无技术背景起步”向导

    快速安装(任选其一)

    ① 一键安装(macOS / Linux)

    curl -fsSL https://raw.githubusercontent.com/HKUDS/nanobot/main/scripts/install.sh | sh

    ② Windows PowerShell

    irm https://raw.githubusercontent.com/HKUDS/nanobot/main/scripts/install.ps1 | iex

    ③ 使用 uv(推荐,干净隔离)

    uv tool install nanobot-ai

    ④ pip 安装

    python -m pip install nanobot-ai

    ⑤ 从源码安装

    git clone https://github.com/HKUDS/nanobot.git
    cd nanobot
    python -m pip install .

    快速开始

    nanobot onboard        # 交互式初始化(生成 ~/.nanobot/config.json 与 workspace)
    nanobot gateway        # 启动网关,浏览器访问 http://127.0.0.1:8765
    nanobot agent -m "Hello!"   # 或直接在终端发一条消息测试

    配置只需在 ~/.nanobot/config.json 里填好 providers(API Key / 端点)与 modelPresets(模型预设)两块即可,支持 OpenAI 兼容接口、本地 LLM 与 fallback 模型路由。

    ✨ 核心功能

    • 轻量可读的小内核:核心只是一个 agent loop——消息进来,LLM 决定何时调用工具,记忆/Skill 仅作为上下文按需注入,不做臃肿的编排层,源码小而好改。
    • 聊天原生触达:内置 WebUI + OpenAI 兼容 API,并可接入 Telegram、Discord、Slack、微信、飞书、邮件、Mattermost、Teams 等渠道,把智能体开到你常用的聊天里。
    • 模型自由:兼容 OpenAI 兼容 API、本地 LLM(Ollama / vLLM)、图像生成与 Web 搜索,支持多模型预设与 fallback 路由,不被单一厂商绑定。
    • 工具与自动化:内置文件、Shell、Web 搜索、网页抓取、MCP、cron、图像生成、子智能体等工具;配合长期记忆(Dream)与定时自动化,可跑长周期任务。
    • 可拥有、可扩展:提供 Python SDK 与 OpenAI 兼容 API,可作为长期运行的本地 / 服务端 Agent 网关自托管, inspect、定制、扩展全部在自己手里。

    🌐 WebUI 与架构

    nanobot WebUI

    nanobot 内置 WebUI:聊天、工作区、Apps、Skills、Automations 与设置的统一工作台

    nanobot 架构

    围绕一个小 agent loop 的轻量架构:渠道进消息 → LLM 调度工具 → 按需拉入记忆/Skill

    🎯 典型使用场景

    • 24/7 实时市场 / 趋势分析:连接数据源与 Web 搜索,让智能体持续追踪行情与热点,自动产出洞察与简报。
    • 全栈软件工程助手:借助文件 / Shell / 代码工具,完成开发、部署与迭代;也可作为 Coding Agent 嵌入工作流。
    • 个人知识助理 + 日程自动化:用长期记忆(Dream)沉淀上下文,做随身知识库;用 cron 自动化管理日常例行任务。

    💡 推荐理由

    我用过不少 Agent 框架,nanobot 最打动我的是”“和”归你所有“这两点。它没有把整个系统做成一个庞大的编排黑盒,而是把核心收敛到一个可读的 agent loop,工具、记忆、Skill 都是按需挂上去的——这意味着你看得懂、改得动,也更容易排查问题。

    对隐私敏感、想自托管的人来说,它几乎是把”个人 AI 助手”这件事做对了的范本:本地优先、模型自由(连本地 Ollama/vLLM 都能用)、聊天渠道随便接,还能用 Python SDK / 兼容 API 嵌进自己的系统。相比被某个云端大平台锁死,nanobot 让你真正拥有自己的智能体。MIT 协议、来自 HKUDS(LightRAG 同门)团队,活跃度与文档完整度都很高,值得一试。

    🔗 下载地址

    ⚠️ 本文仅作技术介绍,使用本项目请遵循其 MIT 许可与当地法律法规。

  • AIRI:自托管 AI 数字伴侣,能实时语音聊天、陪你打 Minecraft(42K+ Stars)

    AIRI:自托管 AI 数字伴侣,能实时语音聊天、陪你打 Minecraft(42K+ Stars)

    AIRI 数字生命形象

    项目简介

    AIRI 是由 moeru-ai 团队开源的「自托管、你专属拥有」的 AI 数字生命(AI Companion)项目。它把大语言模型、实时语音交互与 VRM / Live2D 虚拟形象结合在一起,让你在 Web、桌面与移动端拥有一位能说话、能陪玩、有「身体」的赛博伴侣,目标是达到 AI 虚拟主播 Neuro-sama 那样的水平。整个项目基于 WebGPU / WebAudio / WebAssembly 等现代 Web 技术构建,强调本地优先与隐私保护。

    安装要求和过程

    环境要求

    • 运行时:Node.js 24+(项目已提升到 24.13.0),包管理使用 pnpm(monorepo 结构)。
    • 桌面端:默认可调用原生 NVIDIA CUDA / Apple Metal(通过 candle 项目),无需复杂依赖。
    • 移动端:使用 Capacitor(需 iOS 设备 / 模拟器)。
    • 浏览器:任意现代浏览器即可体验(PWA,已支持移动设备)。

    快速安装(普通用户)

    # Windows (winget)
    winget install MoeruAI.AIRI
    
    # 或 Scoop
    scoop bucket add airi https://github.com/moeru-ai/airi
    scoop install airi/airi
    
    # macOS (Homebrew)
    brew install --cask airi
    
    # Linux (Nix,需启用 flakes)
    nix run github:moeru-ai/airi
    
    # 不想安装?直接浏览器打开在线版
    # https://airi.moeru.ai

    AIRI 跨平台下载方式

    开发者从源码运行

    git clone https://github.com/moeru-ai/airi
    cd airi && pnpm i
    pnpm dev             # Web 版
    pnpm dev:tamagotchi # 桌面版

    核心功能

    • 实时语音交互(耳朵 + 嘴巴):客户端语音识别 + 说话人检测(VAD),配合 ElevenLabs / Azure Speech / OpenAI TTS / 阿里云 / 本地 Kokoro 等多供应商语音合成,对话延迟低、可离线运行。
    • 虚拟形象驱动(身体):支持 VRM 3D 模型与 Live2D 模型,自动眨眼、视线追踪、空闲眼动等动画,让 AI「活」在屏幕上。
    • 本地优先推理:基于 WebGPU 的浏览器内本地 LLM 推理,无需把数据发往外部服务器,隐私更有保障。
    • 游戏与记忆能力:可操控 Minecraft 游玩,Factorio 支持开发中(已有 PoC);内置 DuckDB WASM / pglite 浏览器内数据库与记忆系统(Alaya,开发中),让伴侣「记得你」。
    • 跨平台与集成:Web / 桌面(Win / macOS / Linux,桌面端走原生 CUDA / Metal 加速)/ 移动 PWA 全覆盖;支持 Telegram、Discord 聊天接入。

    典型使用场景

    1. 虚拟主播(VTuber):实时语音聊天、玩游戏、与观众互动,灵感直接来自 Neuro-sama,可作为直播 / 互动娱乐的数字人。
    2. 随身赛博伴侣:在手机、桌面、浏览器上随时拥有一个有形象、能聊天的专属电子宠物 / AI 朋友。
    3. 本地隐私 AI 助手:借助 WebGPU 本地推理在完全离线环境下运行 LLM,适合对数据隐私敏感的用户。

    推荐理由

    AIRI 是目前开源领域把「LLM + 实时语音 + 虚拟形象 + 游戏能力」整合得最完整、也最「有生命力」的项目之一。它完全自托管、可本地运行,技术栈现代(WebGPU / VRM / Live2D),跨平台覆盖到位,社区活跃(42K+ Stars、4.2K+ Forks,MIT 许可)。如果你一直好奇 Neuro-sama 是怎么「炼成」的,或者想拥有一个真正属于自己的、能聊天能陪玩的数字人,AIRI 值得一试。

    下载地址

  • OpenCut —— 开源版剪映,免费且隐私优先的跨平台视频编辑器

    OpenCut —— 开源版剪映,免费且隐私优先的跨平台视频编辑器

    OpenCut 开源视频编辑器

    项目简介

    OpenCut 是一个免费、开源的跨平台视频编辑器(Web / 桌面 / 移动端),被社区称为「开源版 CapCut(剪映)」。它采用 Rust 核心 + TypeScript 构建,主打隐私优先、永久免费、简单易用三大特性,目标是把剪映里越来越多被塞进付费墙的基础剪辑功能,重新免费、开放地还给创作者。

    安装要求和过程

    环境要求

    • 普通用户:无需安装,直接用浏览器打开官网 opencut.app 即可在线剪辑。
    • 本地开发 / 自托管:需要 Bun 运行时,以及 Docker + Docker Compose(用于本地数据库与 Redis)。
    • 核心贡献者(可选):需要 Rust 工具链与 wasm-pack,用于本地构建 GPU 合成器 / 特效 / 遮罩的 WASM 核心。

    快速开始(在线使用,零安装)

    # 直接打开官网,浏览器内即可剪辑导出
    https://opencut.app

    本地开发(贡献者)

    # 1. 安装工具链管理器 proto
    bash <(curl -fsSL https://moonrepo.dev/install/proto.sh)
    # 2. 进入仓库,安装锁定版本工具
    proto use
    # 3. 启动各端开发服务器
    moon run web:dev       # Web 端  → http://localhost:5173
    moon run api:dev       # API 端  → http://localhost:8787
    moon run desktop:dev   # 桌面端(见 apps/desktop/README.md)

    私有化自托管(Docker 全家桶)

    # 一条命令跑起完整生产环境(含应用构建)
    docker compose up -d
    # 访问 http://localhost:3100

    ⚠️ 状态说明:主仓库 OpenCut-app/OpenCut 正在用 Rust 核心「从零重写」,官网现网 opencut.app 当前跑的是稳定可用的经典版opencut-app/opencut-classic)。日常剪辑直接上官网即可;想私有化部署可参考经典版 README 的 Bun + Docker 流程。

    核心功能

    OpenCut 编辑器界面

    1. 隐私优先,视频不上云:所有素材与工程默认保存在本地设备,不强制上传云端,从源头规避隐私泄露焦虑。
    2. 免费开放,剪映付费功能免费用:时间线剪辑、字幕、转场、特效等基础能力全部免费,没有弹窗付费墙。
    3. 跨平台一致体验:一套 Rust 核心代码同时驱动 Web、桌面(GPUI)与移动端,渲染 / 特效 / 遮罩由 GPU 合成器处理,性能更优。
    4. 面向 AI 时代:内置 MCP Server 供 AI 智能体直接调用,支持 无头(Headless)模式做批量渲染与自动化,并集成 fal.ai 的生成式图像 / 视频 / 音频模型。
    5. 插件优先 + 脚本面板:重写版提供 Editor API、一等公民的第三方插件,以及编辑器内脚本标签,可玩性与扩展性强。

    典型使用场景

    • 短视频创作者:被剪映付费墙劝退的 Vlog / 抖音 / YouTube 创作者,可直接在浏览器里完成剪辑与导出,零成本起步。
    • 隐私敏感团队 / 个人:医疗、法务、企业内部视频等素材不出本地设备的场景,OpenCut 的本地优先架构天然契合。
    • 开发者与 AI 工作流:通过 MCP Server 让编程助手自动生成 / 批量渲染视频,或用脚本标签把重复剪辑流程自动化。

    推荐理由

    作为一个常年和视频打交道的人,剪映把「关键帧」「智能抠图」等越来越多基础功能塞进付费墙的操作,确实越来越劝退。OpenCut 把「免费 + 开源 + 隐私」三件事做得很扎实,GitHub 上 7 万+ Star 也证明这不是噱头,而是真实需求。它当前处于 Rust 核心重写期,主仓库在快速演进,而现网经典版已经能稳定剪辑。如果你想把剪辑工具私有化部署到自家服务器、或者希望素材 100% 留在本地,docker compose up -d 一条命令就能拥有属于自己的剪辑平台。对于期待 AI 自动剪辑的玩家,它的 MCP Server + 无头渲染路线也相当值得持续关注。

    OpenCut 产品路线图

    下载地址

  • PentAGI:完全自主的 AI 渗透测试智能体系统(20.7K Stars,Go 构建)

    PentAGI:完全自主的 AI 渗透测试智能体系统(20.7K Stars,Go 构建)

    PentAGI 概览

    项目简介

    PentAGI(Penetration testing Artificial General Intelligence)是一个面向信息安全专业人士、研究人员与爱好者的自动化安全测试平台。它用前沿 AI 技术把渗透测试流程完全自主化——从信息收集、漏洞利用到生成可执行的攻防报告,全部由多智能体团队在隔离的 Docker 沙箱中自动完成。项目由 vxcontrol 团队维护,采用 MIT 许可证,目前在 GitHub 上已收获 20.7K+ Stars。

    安装要求和过程

    环境要求

    • Docker 与 Docker Compose(或 Podman)
    • 最低 2 vCPU、4GB 内存、20GB 可用磁盘空间
    • 可访问外网(用于拉取镜像与更新)
    • 支持 10+ LLM 供应商:OpenAI / Anthropic / Google Gemini / AWS Bedrock / DeepSeek / Ollama / GLM / Kimi / Qwen 等

    快速安装

    # 1. 下载官方 docker-compose 编排文件
    curl -O https://raw.githubusercontent.com/vxcontrol/pentagi/master/docker-compose.yml
    
    # 2. 一条命令启动(默认拉起 Web UI、Agent 运行时、PostgreSQL+pgvector 等)
    docker compose up -d

    启动后访问 Web UI 完成登录与 LLM 供应商配置,即可用自然语言下发渗透测试任务。还可叠加 docker-compose-langfuse.yml(可观测)、docker-compose-graphiti.yml(知识图谱)、docker-compose-observability.yml(Grafana/Prometheus)等可选编排文件扩展能力。

    核心功能

    • 安全隔离 + 完全自主:所有操作在沙箱化的 Docker 环境中执行,AI 智能体自动规划并执行测试步骤,可选执行监控与智能任务规划提升可靠性。
    • 20+ 专业安全工具内置:开箱即用地集成了 nmap、metasploit、sqlmap 等一整套渗透利器。
    • 专家智能体团队:研究 / 开发 / 基础设施等专职 Agent 分工协作,配合任务规划让小模型也能高效运转。
    • 智能记忆 + 知识图谱:长期沉淀研究结果与成功路径,基于 Graphiti + Neo4j 构建语义关系图谱,增强上下文理解。
    • 详尽报告与可观测性:自动产出带利用指南的漏洞报告,并集成 Grafana/Prometheus 实现实时监控。

    典型使用场景

    • 授权环境下的自动化攻防演练:安全团队在自有靶场或获得书面授权的资产上,让 PentAGI 跑完整渗透流程,快速发现暴露面。
    • 红队作业与报告交付:红队队员把重复性信息收集、初步利用交给智能体,专注高价值的人工研判,并直接生成可交付的漏洞报告。
    • 安全研究与教学:结合 Graphiti 知识图谱复盘历次测试路径,沉淀方法论,用于教学与能力培养。

    推荐理由

    一句话——它把”渗透测试”这件高度依赖经验的手艺,变成了一条可由自然语言驱动、且全程可审计的流水线。对我个人而言最打动的有三点:① 彻底沙箱化,跑再多危险操作也不怕污染宿主机;② 多智能体分工比单一大模型稳得多,任务规划 + 执行监控让小模型也能干活;③ 知识图谱 + 长期记忆让它会”越用越聪明”。当然,它定位是合规授权场景下的安全研究利器,务必在合法授权范围内使用。

    下载地址

    • GitHub 仓库:https://github.com/vxcontrol/pentagi
    • 社区:Discord(discord.gg/2xrMh7qX6m)与 Telegram(t.me/+Ka9i6CNwe71hMWQy)
    • 部署方式:Docker / Docker Compose 自托管,数据完全自控

    本文仅作技术介绍,请在法律法规与授权范围内合理使用。

  • Open WebUI:自托管、可离线运行的 AI 聊天与智能体平台

    Open WebUI:自托管、可离线运行的 AI 聊天与智能体平台

    Open WebUI 界面演示

    项目简介

    Open WebUI 是一个功能丰富、可完全离线运行的自托管 AI 平台,支持 Ollama 本地模型与 OpenAI 兼容 API,内置 RAG 检索增强、多模型对话、语音/视频通话、智能体与插件生态,是把任意大模型变成”私有 ChatGPT”的一站式前端。(GitHub ⭐ 145K+,Python,Open WebUI License)

    安装要求和过程

    环境要求:Python 3.11(pip 方式);或 Docker 20.10+(容器方式);可搭配 Ollama 本地推理,或任意 OpenAI 兼容 API Key。

    方式一 · pip 安装(最简):

    pip install open-webui
    open-webui serve   # 访问 http://localhost:8080

    方式二 · Docker 一条命令(自带 Ollama,CPU):

    docker run -d -p 3000:8080   -v ollama:/root/.ollama -v open-webui:/app/backend/data   --name open-webui --restart always   ghcr.io/open-webui/open-webui:ollama

    方式三 · 仅用 OpenAI API:

    docker run -d -p 3000:8080   -e OPENAI_API_KEY=your_secret_key   -v open-webui:/app/backend/data   --name open-webui --restart always   ghcr.io/open-webui/open-webui:main

    部署后访问 http://localhost:3000 即可使用;也支持 Docker Compose、Kubernetes(Helm/Kustomize)与 uv 安装。

    核心功能

    • 广泛的模型与 API 接入:本地 Ollama + 任意 OpenAI 兼容后端(LM Studio、Groq、OpenRouter、vLLM、Mistral 等),支持多模型并行对话、各取所长。
    • 本地 RAG 知识库:支持 9 种向量数据库与多种文档解析引擎(Tika、Docling、Mistral OCR 等),混合检索(BM25+向量)+ 重排,用 # 命令把文档/网页直接拉进对话。
    • 智能体与插件生态:Filters / Actions / Pipes / Tools / Skills 插件机制,可接 MCP、OpenAPI 工具服务器,把任意基础模型包装成专属 Agent。
    • 语音/视频通话与多模态:本地 Whisper 等 STT + 多种 TTS 引擎,内置 DALL·E / Gemini / ComfyUI 图像生成与编辑,支持网页浏览与联网搜索。
    • 企业级管理与安全:细粒度 RBAC 与用户组、LDAP / SSO / SCIM 自动配置、PostgreSQL 持久化、横向扩展与 OpenTelemetry 可观测性。

    典型使用场景

    • 个人本地 AI 助手:用 Ollama 在笔记本上跑 Llama / Mistral,全程离线、数据不出本机,配合 RAG 问答私人文档。
    • 团队自托管 AI 中台:公司内部署,接入 OpenAI 或自建 vLLM,统一账号、权限与用量审计,替代公网 SaaS,守住数据隐私。
    • 知识库问答与自动化:把 Confluence / Notion / 本地文件建索引,用智能体 + 定时自动化做日报生成、资料检索与多模型 A/B 评估。

    推荐理由

    我把 Open WebUI 当作”私有 ChatGPT 的标杆”。它最打动我的是真正的离线优先与自托管能力——所有聊天与文档数据都留在自己的机器或服务器,不依赖任何云。RAG 开箱即用,多模型对比、语音通话、插件生态一应俱全,Docker 一条命令就能跑起来,对不想把对话记录交给第三方的用户极其友好。社区极其活跃、更新频繁,是个人和中小团队落地 AI 的最低门槛选择。

    下载地址

  • Dify:开源 LLM 应用开发平台,148K Stars 把 AI 工作流从原型秒送生产

    Dify:开源 LLM 应用开发平台,148K Stars 把 AI 工作流从原型秒送生产

    Dify 一览

    在 AI 应用落地的草莽时代,几乎每个团队都在重复造轮子:接模型要写一遍适配、做检索要搭一套向量库、上生产还要自己补日志和监控。把这套东西拼起来,往往比业务本身还费劲。Dify 的出现,就是要把这件事彻底标准化。

    一、项目简介

    Dify 是一个开源的 LLM 应用开发平台,用一张可视化画布把 AI 工作流、RAG 检索增强、Agent 能力、模型管理与可观测性打包在一起,让你从原型到生产只差一次部署。目前 GitHub 已收获 148.4K Stars、23K+ Fork,是开源 LLM 应用开发领域当之无愧的头部项目。

    二、安装要求和过程

    环境要求:

    • CPU ≥ 2 核
    • 内存(RAM)≥ 4 GiB
    • 已安装 DockerDocker Compose
    • 操作系统:Linux / macOS / Windows(WSL2)

    快速安装(Docker Compose,官方最推荐方式):

    git clone https://github.com/langgenius/dify.git
    cd dify/docker
    cp .env.example .env
    docker compose up -d

    启动完成后,浏览器访问 http://localhost/install 即可进入初始化向导。如果你需要高可用部署,官方文档还提供了 Helm Chart、Terraform(Azure / GCP)、AWS CDK 以及阿里云计算巢等多种方案。

    三、核心功能

    1. 可视化工作流画布(Workflow)
    在画布上拖拽编排 AI 流程,节点可调试、可分支、可回放,复杂逻辑一目了然。

    2. 全面的模型支持
    无缝接入数百个闭源 / 开源大模型(GPT、Mistral、Llama3 及所有 OpenAI 兼容模型),覆盖几十家推理服务商与自托管方案,切换模型无需改代码。

    3. 开箱即用的 RAG 管线
    从文档摄入到检索全链路覆盖,原生支持 PDF、PPT 等常见格式的智能提取,几步就能搭出带引用来源的问答助手。

    4. 强大的 Agent 能力
    基于 Function Calling 或 ReAct 定义智能体,内置 50+ 工具(Google 搜索、DALL·E、Stable Diffusion、WolframAlpha 等),也可接入自定义工具。

    5. LLMOps 与 Backend-as-a-Service
    应用日志与性能可监控、可迭代;所有能力均提供对应 API,轻松把 AI 能力嵌入自有业务系统。

    四、典型使用场景

    1. 企业知识库问答 / 智能客服
    导入内部文档构建 RAG,几步搭出带引用来源、可溯源的客服助手,替代翻手册式的重复答疑。

    2. 可视化 Agent 工作流自动化
    把“检索 → 生成 → 调用工具 → 校验”串成一张画布,用可视化的方式替代脆弱的脚本编排。

    3. 快速原型 + API 集成
    先用 Dify 低成本验证想法,再通过 BaaS API 把打磨好的 AI 能力无缝嵌入现有产品。

    五、推荐理由

    个人使用下来,Dify 最打动我的是“把复杂度收敛到一个画布上”。它不要求你先成为向量数据库专家或 Prompt 工程师,普通开发者也能在半小时内跑通一个带 RAG 的可用应用;而当项目要上生产时,LLMOps 的日志、评估与 API 化能力又刚好补上团队最缺的那一环。对于想认真做 AI 产品的团队,它是目前最省心的一站式底座——既能自建私有化守住数据,也能平滑对接云端大模型。

    六、下载地址

    许可证:Dify Open Source License(基于 Apache 2.0,附加部分条款)。本文数据截至 2026-07-11,Stars 约 148.4K。

  • CubeSandbox:给 AI Agent 的 60ms 硬件级安全沙箱,腾讯云开源(8.9K Stars)

    CubeSandbox:给 AI Agent 的 60ms 硬件级安全沙箱,腾讯云开源(8.9K Stars)

    CubeSandbox

    📌 项目简介

    CubeSandbox 是腾讯云开源的、面向 AI Agent 的即时、并发、安全、轻量沙箱服务。它基于自研的 RustVMM + KVM 微虚拟机(MicroVM)构建,主打「硬件级隔离」——每个沙箱都跑在独立的 Guest OS 内核里,从根上杜绝了 Docker 共享内核的逃逸风险。平均冷启动 <60ms、单实例内存开销 <5MB,可以放心拿它来跑 LLM 生成的不受信任代码、Agent 自动执行等高风险任务。

    🛠 安装要求与过程

    环境要求:

    • x86_64 Linux 服务器(推荐 OpenCloudOS 9,Ubuntu / Debian / CentOS 同样支持)
    • ≥ 4 核 CPU、≥ 8 GB 内存,建议挂载独立数据盘给 /data/cubelet
    • 需要 KVM 支持(云服务器若无 /dev/kvm,可开启腾讯云 PVM 嵌套虚拟化)
    • v0.5.0 起原生支持 ARM64 全栈

    一键安装:

    # 标准安装(需 /dev/kvm)
    curl -sL https://github.com/tencentcloud/CubeSandbox/raw/master/deploy/one-click/online-install.sh | bash
    
    # 云服务器无嵌套虚拟化时,开启 PVM 安装
    curl -sL https://github.com/tencentcloud/CubeSandbox/raw/master/deploy/one-click/online-install.sh   | CUBE_PVM_ENABLE=1 bash
    
    # 国内加速镜像
    curl -sL https://cnb.cool/CubeSandbox/CubeSandbox/-/git/raw/master/deploy/one-click/online-install.sh   | CUBE_PVM_ENABLE=1 MIRROR=cn bash

    安装完成后打开 Web 控制台:http://<控制节点IP>:12088,三步即可上手:查看 Overview → 从 Template Store 准备模板 → 创建沙箱(Sandboxes → + New sandbox)。

    如果只想在本地 Python 里玩,也可以 pip install cubesandbox 拉起组件做开发联调。

    ⚡ 核心功能

    • 亚 60ms 冷启动 + 高密度:单实例开销 <5MB,支持空闲自动挂起/唤醒(AutoPause/AutoResume),单机可并发跑成百上千个沙箱。
    • 硬件级隔离:每个实例独立 Guest OS 内核,基于 KVM MicroVM + eBPF 虚拟交换机(CubeVS)做内核级网络隔离,不存在容器共享内核的逃逸面。
    • 无缝兼容 E2B SDK:原生兼容 E2B 协议,业务代码零改动——只把 E2B_API_URL / E2B_API_KEY 指向你自己的 CubeSandbox 即可迁移。
    • 企业级安全:凭据保险库(密钥不进沙箱/上下文/日志)、出口控制(域名白名单 + 未授权出口即时阻断 + 审计日志)。
    • 快照·克隆·回滚:基于 CubeCoW 写时复制引擎,百毫秒级打检查点,可回滚或开分支,Agent 试错零成本。

    🎯 典型使用场景

    1. 跑 LLM/Agent 生成的不受信任代码

    把模型吐出来的 Python/Shell 丢进沙箱执行,硬件隔离 + 出口白名单保证即使代码作恶也伤不到宿主。E2B 兼容意味着你现在的 Code Interpreter 代码直接换环境变量就能用:

    export E2B_API_URL=http://<你的控制节点IP>:12088
    export E2B_API_KEY=<你的API Key>
    
    from e2b_code_interpreter import Sandbox
    sandbox = Sandbox()
    execution = sandbox.run_code("x = 1 + 1; print('result =', x)")
    print(execution.logs.stdout)   # result = 2

    2. 浏览器自动化 / 数据抓取 Agent

    给爬虫、RPA、AI 操作员一人一个干净隔离的浏览器环境,跑完即销毁,避免指纹污染和横向污染。配合 Template Store 预置好带登录态的镜像,开箱即用。

    3. 强化学习 / SWE-Bench 类大规模评测

    官方用 CubeSandbox 做 SWE-Bench RL 训练,上千个独立环境并发创建、秒级回收,单节点高密度把评测成本打下来。

    💡 推荐理由

    这两年「让 Agent 自己写代码自己跑」成了标配,但把模型生成的代码直接丢宿主机执行,等于把大门钥匙交给一个偶尔会发疯的实习生。CubeSandbox 的价值就在于:它把「隔离」这件事做到了又快又便宜又省心——60ms 启动让你几乎感觉不到沙箱的存在,<5MB 开销让并发成本可控,而 E2B 兼容意味着你不用重写一行业务代码就能把云端沙箱换成自建的、数据不出域的版本。

    对国内团队尤其友好:有 CN 镜像、有 PVM 解决云厂商嵌套虚拟化痛点、有中文文档和微信社群。想自建一套「AI 代码执行底座」,CubeSandbox 是目前最省事的开源选择之一。

    📥 下载地址

    许可:Apache-2.0(仓库主协议,部分组件为其他开源协议)。当前 Star 数约 8.9K,仍在快速增长中。

  • llama.cpp:119.5K Stars!纯 C/C++ 打造的大模型本地推理引擎

    llama.cpp:119.5K Stars!纯 C/C++ 打造的大模型本地推理引擎

    llama.cpp:119.5K Stars!纯 C/C++ 打造的大模型本地推理引擎

    📝 项目简介

    llama.cpp 是一个用纯 C/C++ 实现、零外部依赖的大语言模型(LLM)推理引擎。它让你无需 Python 环境、无需昂贵显卡,就能在笔记本、树莓派甚至手机上高性能地运行 LLaMA、Qwen、Gemma、Mistral 等主流开源模型——可以说,它是当下几乎所有「本地跑大模型」工具的底层基石。

    🌐 官网:https://llama.app

    📦 GitHub:https://github.com/ggml-org/llama.cpp

    ⭐ Stars:119.5K+

    📄 开源协议:MIT License

    💻 主要语言:C / C++

    💻 安装要求和过程

    环境要求

    • C/C++ 编译器:GCC / Clang / MSVC,支持 C++11 及以上
    • CMake 3.8+:从源码构建时需要
    • 可选 GPU 后端:CUDA(NVIDIA)、ROCm(AMD)、Metal(Apple Silicon)、Vulkan、SYCL 等,用于硬件加速
    • 可选 Python 3:仅用于模型格式转换脚本 convert_*.py
    • 支持平台:macOS / Linux / Windows,以及 iOS、Android、浏览器(WASM)等

    快速安装步骤

    方式一:包管理器一键安装(推荐新手)

    # macOS
    brew install llama.cpp
    
    # Windows
    winget install llama.cpp
    
    # Conda
    conda install -c conda-forge llama-cpp

    方式二:Docker 运行(自带 API 服务)

    docker run -p 8080:8080 -v ./models:/models \
      ghcr.io/ggml-org/llama.cpp:server -m /models/your_model.gguf

    方式三:从源码构建

    git clone https://github.com/ggml-org/llama.cpp
    cd llama.cpp
    cmake -B build
    cmake --build build --config Release

    快速开始:下载并运行一个模型

    # 命令行对话(自动从 Hugging Face 拉取 GGUF 模型)
    llama-cli -hf ggml-org/gemma-3-1b-it-GGUF
    
    # 启动 OpenAI 兼容的 API 服务(含简易 WebUI)
    llama-server -hf ggml-org/gemma-3-1b-it-GGUF --port 8080

    ✨ 核心功能

    1. 🪶 纯 C/C++ 零依赖,极致轻量

    不依赖 PyTorch、不依赖 Python 运行时,编译出一个二进制文件即可运行。极小的体积和无依赖特性,让它可以被移植到几乎所有计算设备——这正是它能跑在树莓派和手机上的根本原因。

    2. ⚡ 全平台硬件加速与混合推理

    针对 Apple Silicon(Metal / ARM NEON)、x86(AVX2 / AVX-512 / AMX)、RISC-V 等架构做了深度优化;支持 NVIDIA(CUDA)、AMD(ROCm)、摩尔线程(MUSA)、Vulkan、SYCL、OpenCL 等多种后端。CPU+GPU 混合推理甚至能运行超过显存容量的超大模型。

    3. 🗜️ GGUF 格式与 1.5~8 bit 量化

    模型统一封装为 GGUF 格式,并支持从 1.5-bit 到 8-bit 的整数量化。量化后显存与内存占用大幅下降,让消费级显卡甚至纯 CPU 也能流畅运行 70B 级别的大模型。

    4. 🔌 OpenAI 兼容 API 服务

    llama-server 提供与 OpenAI 完全兼容的 /v1 接口,并自带简易 WebUI。你现有的基于 OpenAI SDK 的应用几乎零改动就能切换到本地模型,彻底摆脱对云服务的依赖。

    5. 🧰 丰富的推理工具链

    内置 llama-bench(性能基准测试)、llama-perplexity(困惑度评估)、llama-quantize(模型量化)以及基于 GBNF 语法的约束解码(强制输出 JSON / 特定格式),覆盖从评测到生产的完整链路。

    🎯 典型使用场景

    场景一:在笔记本 / 手机上本地聊天,隐私数据不出端

    下载一个量化后的 Qwen 或 Gemma 模型,用 llama-cli 即可在断网环境下与 AI 对话。所有数据都在本地处理,特别适合处理合同、代码、笔记等敏感内容。

    场景二:自建私有 OpenAI 兼容推理服务

    在内网或离线环境中启动 llama-server,把本地模型包装成标准 API。前端应用、RAG 系统、Agent 框架(如 LangChain、Dify)都能直接对接,既保证数据合规,又省下云推理费用。

    llama-server -m models/qwen2.5-7b-instruct-q4_k_m.gguf --port 8080

    场景三:边缘设备与嵌入式部署

    在树莓派、工控机、车载设备上编译运行 llama.cpp,为 IoT 场景提供离线语音助手、本地知识问答等能力。配合量化技术,几百 MB 内存即可驱动一个可用的小模型。

    💡 推荐理由

    作为一名经常折腾本地大模型的开发者,我对 llama.cpp 的感情可以用「基石」二字形容。在它出现之前,想本地跑一个开源模型意味着安装几十 GB 的 PyTorch 环境,且基本只能在高端显卡上跑;llama.cpp 用纯 C/C++ 把这件事拉到了「人人可玩」的门槛。

    我的几点使用心得:

    • 它是整个生态的地基:Ollama、LM Studio、Jan、Open WebUI 乃至无数上层应用,底层推理几乎都调用了 llama.cpp。理解它,就理解了「本地 AI」的半壁江山。
    • 量化是性价比之王:7B 模型用 Q4_K_M 量化后体积不到 5GB,在普通笔记本上就能达到可用速度,是入门本地模型的最佳起点。
    • OpenAI 兼容接口太省心:一条 llama-server 命令就把本地模型变成标准 API,让我能把线上项目无痛切换到离线环境做.demo或内网部署。
    • 更新极快、社区极活跃:几乎每周都有新后端、新量化方法的合并,119K+ 的 Stars 背后是庞大而健康的贡献者群体。

    如果你想真正搞懂「大模型是怎么在本地跑起来的」,llama.cpp 是 2026 年依旧最值得 clone 一份源码、逐行读一读的开源项目。

    📥 下载地址

    🌐 官方网站:https://llama.app

    📦 GitHub 仓库:https://github.com/ggml-org/llama.cpp

    📚 官方文档:github.com/ggml-org/llama.cpp/docs

    🤗 GGUF 模型库:huggingface.co/ggml-org

    🐳 Docker 镜像:ghcr.io/ggml-org/llama.cpp


    📌 本文是《GitHub 热门 AI 开源项目》系列的第 95 期,每期介绍一个热门的 AI 开源项目。欢迎关注本栏目,获取更多优质开源项目介绍!

  • LocalAI:免费开源OpenAI替代方案,在本地硬件上运行全模态AI模型,47K+ Stars让AI彻底私有化

    LocalAI:免费开源OpenAI替代方案,在本地硬件上运行全模态AI模型,47K+ Stars让AI彻底私有化

    今天介绍一个让AI彻底私有化的开源神器——LocalAI。它被誉为”免费的开源OpenAI替代方案”,可以在任意硬件上运行各类AI模型(LLM、视觉、语音、图像、视频),无需GPU,数据完全本地化。

    项目简介

    LocalAI 是开源AI引擎,可作为OpenAI/Anthropic API的直接替代品。它采用”小核心+按需加载后端”的可组合架构,支持在消费级硬件上运行大语言模型、图像生成、语音识别、语音合成等各类AI模型,数据完全留在本地,无需云服务。

    LocalAI Logo
    LocalAI – 免费开源AI引擎

    安装要求和过程

    环境要求

    • 操作系统:macOS、Linux、Windows
    • GPU:无需GPU!支持NVIDIA、AMD、Intel、Apple Silicon、Vulkan、纯CPU
    • 内存:8GB+ RAM(运行小模型);16GB+(运行中大模型)
    • 存储:至少10GB可用空间(模型文件较大)

    快速安装(Docker推荐)

    # CPU环境(最常用)
    docker run -ti --name local-ai -p 8080:8080 localai/localai:latest
    
    # NVIDIA GPU环境(CUDA 12)
    docker run -ti --name local-ai -p 8080:8080 --gpus all \
      localai/localai:latest-gpu-nvidia-cuda-12
    
    # macOS(下载DMG直接安装)
    # 从 GitHub Releases 下载 LocalAI.dmg
    

    快速开始

    # 启动LocalAI
    docker run -p 8080:8080 -ti localai/localai:latest
    
    # 在另一个终端,运行模型
    local-ai run llama-3.2-1b-instruct:q4_k_m
    
    # 启动交互式聊天
    local-ai chat --model llama-3.2-1b-instruct:q4_k_m
    
    # 从HuggingFace加载模型
    local-ai run huggingface://TheBloke/phi-2-GGUF/phi-2.Q8_0.gguf
    
    # 从Ollama仓库加载
    local-ai run ollama://gemma:2b
    

    核心功能

    1. OpenAI API完全兼容:可作为OpenAI API的直接替代品,现有应用和库无需修改即可迁移。支持文本生成、嵌入、图像处理、语音识别、语音合成等全套API。
    2. 无需GPU,消费级硬件即可运行:优化后的推理引擎(llama.cpp等)可在CPU上高效运行,无需昂贵GPU。支持Intel/AMD/Apple Silicon等各平台。
    3. 支持全模态AI模型:不仅支持LLM,还支持图像生成(Stable Diffusion)、语音识别(Whisper)、语音合成(TTS)、音乐生成(MusicGen)、目标检测等,真正的”全模态AI引擎”。
    4. 内置AI智能体:集成LocalAGI(自主智能体平台),支持工具调用、RAG、MCP协议、技能扩展。内置Agent Hub社区,可分享和下载智能体配置。
    5. 企业级功能:支持多用户、API密钥认证、用户配额、基于角色的访问控制(RBAC)。支持分布式模式(通过PostgreSQL+NATS实现水平扩展),适合企业生产环境。
    LocalAI Demo
    LocalAI 项目导览演示

    典型使用场景

    • 私有化AI助手部署:企业内部需要AI助手但担心数据泄露?LocalAI让你在内网部署完全私有的AI服务,支持OpenAI API兼容,现有应用无缝迁移。可用于代码辅助、文档问答、知识库检索等场景。
    • 替代云API降低成本:OpenAI API按调用次数收费,长期使用成本高昂。LocalAI让你在本地硬件上运行开源模型,一次部署无限使用,特别适合高频调用场景(如客服机器人、内容生成流水线)。

    推荐理由

    LocalAI 是我见过的最完整的本地AI部署解决方案。与Ollama相比,LocalAI支持更多模态(图像、语音、视频);与vLLM相比,LocalAI无需GPU且更易用;与text-generation-webui相比,LocalAI有完整的API兼容性和企业级功能。

    我最喜欢的设计是“小核心+按需加载后端”的架构。核心只有很小的基础功能,每个后端(llama.cpp、vLLM、whisper.cpp、stable-diffusion等)都是独立的OCI镜像,仅在需要时才拉取。这意味着你不会安装任何用不到的组件,资源占用极小。

    另外,MCP协议支持让LocalAI可以无缝对接各类AI智能体工具,而分布式模式则让它能够水平扩展,处理大规模并发请求。对于需要私有化部署AI服务的企业来说,LocalAI是目前最好的选择。

    下载地址

    许可协议:MIT License(完全开源,可自由使用、修改、分发)

    支持后端:llama.cpp、vLLM、whisper.cpp、stable-diffusion、MLX、TensorRT等60+推理后端


    如果你喜欢本地部署AI,LocalAI绝对值得一试。它让”私有化AI”变得简单可行,再也不用担心数据泄露和API费用了。

  • Weaviate:AI 开发者最爱的开源向量数据库,语义搜索与 RAG 的首选数据底座

    Weaviate:AI 开发者最爱的开源向量数据库,语义搜索与 RAG 的首选数据底座

    📦 项目简介

    Weaviate 是一款开源、云原生的向量数据库,同时存储对象和向量,支持大规模语义搜索。它将向量相似度搜索、关键词过滤、检索增强生成(RAG)和重排序功能整合到单个查询接口中,是构建 AI 应用的理想数据底座。

    Weaviate Logo

    ⚙️ 安装要求和过程

    环境要求

    • Docker 20.10+(推荐方式)
    • 内存:最低 4GB RAM,生产环境建议 8GB+
    • 客户端:Python 3.8+、Node.js 16+、Java 11+、Go 1.18+

    快速安装(Docker 本地部署)

    第一步:创建 docker-compose.yml

    services:
      weaviate:
        image: cr.weaviate.io/semitechnologies/weaviate:1.36.0
        ports:
          - "8080:8080"
          - "50051:50051"
        environment:
          ENABLE_MODULES: text2vec-model2vec
          MODEL2VEC_INFERENCE_API: http://text2vec-model2vec:8080
      text2vec-model2vec:
        image: cr.weaviate.io/semitechnologies/model2vec-inference:minishlab-potion-base-32M
    

    第二步:启动 & 安装客户端

    docker compose up -d
    pip install -U weaviate-client
    

    也可使用 Weaviate Cloud 免费试用,或部署到 Kubernetes/AWS/GCP。

    🚀 核心功能

    ⚡ 毫秒级十亿向量搜索

    基于 Go 构建,HNSW 索引,十亿级向量语义搜索毫秒返回。

    🔀 混合检索(向量+关键词+过滤)

    单接口同时支持语义搜索、BM25 关键词搜索、图像搜索,内置 hybrid 查询自动融合分数。

    🤖 内置 RAG & 重排序

    无需额外工具,直接支持生成式搜索(RAG)和重排序,快速构建 Q&A、聊天机器人。

    📈 生产级可扩展性

    支持水平扩展、多租户隔离、副本、RBAC 权限控制,Kubernetes 原生编排。

    💾 向量压缩 & TTL

    内置标量/二进制/产品量化,大幅降低内存占用;支持对象 TTL 自动清理过期数据。

    💡 典型使用场景

    场景一:RAG 检索增强生成系统

    将企业文档导入 Weaviate,结合 LLM 构建精准问答系统,大幅降低幻觉率。

    import weaviate
    from weaviate.classes.query import Filter
    
    client = weaviate.connect_to_local()
    results = client.collections.get("Document").query.near_text(
        query="如何申请退款?", limit=5,
        filters=Filter.by_property("category").equal("help")
    )
    for obj in results.objects:
        print(obj.properties["content"])
    

    场景二:语义搜索 & 推荐引擎

    电商/内容平台实现”理解意图”的搜索,支持多模态(文本+图像)检索。

    📌 推荐理由

    • 生态最完整:Python/JS/Java/Go/C# 五大官方 SDK
    • AI Agent 集成:官方提供 Agent Skills,支持 Claude Code/Cursor
    • 商业友好:BSD-3-Clause 许可,可自由修改和分发
    • 云原生架构:存储计算分离,Kubernetes 原生,水平扩展无忧

    📥 下载地址 & 相关链接

    ✝️ BSD 3-Clause License | Go | 2016年发布