标签: 本地LLM

  • Open WebUI:自托管、可离线运行的 AI 聊天与智能体平台

    Open WebUI:自托管、可离线运行的 AI 聊天与智能体平台

    Open WebUI 界面演示

    项目简介

    Open WebUI 是一个功能丰富、可完全离线运行的自托管 AI 平台,支持 Ollama 本地模型与 OpenAI 兼容 API,内置 RAG 检索增强、多模型对话、语音/视频通话、智能体与插件生态,是把任意大模型变成”私有 ChatGPT”的一站式前端。(GitHub ⭐ 145K+,Python,Open WebUI License)

    安装要求和过程

    环境要求:Python 3.11(pip 方式);或 Docker 20.10+(容器方式);可搭配 Ollama 本地推理,或任意 OpenAI 兼容 API Key。

    方式一 · pip 安装(最简):

    pip install open-webui
    open-webui serve   # 访问 http://localhost:8080

    方式二 · Docker 一条命令(自带 Ollama,CPU):

    docker run -d -p 3000:8080   -v ollama:/root/.ollama -v open-webui:/app/backend/data   --name open-webui --restart always   ghcr.io/open-webui/open-webui:ollama

    方式三 · 仅用 OpenAI API:

    docker run -d -p 3000:8080   -e OPENAI_API_KEY=your_secret_key   -v open-webui:/app/backend/data   --name open-webui --restart always   ghcr.io/open-webui/open-webui:main

    部署后访问 http://localhost:3000 即可使用;也支持 Docker Compose、Kubernetes(Helm/Kustomize)与 uv 安装。

    核心功能

    • 广泛的模型与 API 接入:本地 Ollama + 任意 OpenAI 兼容后端(LM Studio、Groq、OpenRouter、vLLM、Mistral 等),支持多模型并行对话、各取所长。
    • 本地 RAG 知识库:支持 9 种向量数据库与多种文档解析引擎(Tika、Docling、Mistral OCR 等),混合检索(BM25+向量)+ 重排,用 # 命令把文档/网页直接拉进对话。
    • 智能体与插件生态:Filters / Actions / Pipes / Tools / Skills 插件机制,可接 MCP、OpenAPI 工具服务器,把任意基础模型包装成专属 Agent。
    • 语音/视频通话与多模态:本地 Whisper 等 STT + 多种 TTS 引擎,内置 DALL·E / Gemini / ComfyUI 图像生成与编辑,支持网页浏览与联网搜索。
    • 企业级管理与安全:细粒度 RBAC 与用户组、LDAP / SSO / SCIM 自动配置、PostgreSQL 持久化、横向扩展与 OpenTelemetry 可观测性。

    典型使用场景

    • 个人本地 AI 助手:用 Ollama 在笔记本上跑 Llama / Mistral,全程离线、数据不出本机,配合 RAG 问答私人文档。
    • 团队自托管 AI 中台:公司内部署,接入 OpenAI 或自建 vLLM,统一账号、权限与用量审计,替代公网 SaaS,守住数据隐私。
    • 知识库问答与自动化:把 Confluence / Notion / 本地文件建索引,用智能体 + 定时自动化做日报生成、资料检索与多模型 A/B 评估。

    推荐理由

    我把 Open WebUI 当作”私有 ChatGPT 的标杆”。它最打动我的是真正的离线优先与自托管能力——所有聊天与文档数据都留在自己的机器或服务器,不依赖任何云。RAG 开箱即用,多模型对比、语音通话、插件生态一应俱全,Docker 一条命令就能跑起来,对不想把对话记录交给第三方的用户极其友好。社区极其活跃、更新频繁,是个人和中小团队落地 AI 的最低门槛选择。

    下载地址

  • Unsloth:本地微调大模型速度提升2倍、显存降低70%,67K+Stars让AI训练不再「烧卡」

    Unsloth:本地微调大模型速度提升2倍、显存降低70%,67K+Stars让AI训练不再「烧卡」

    Unsloth - Fine-tune LLMs 2x Faster
    Unsloth 官方网站 — 本地训练与运行大模型的首选工具

    🧠 项目简介

    Unsloth 是专为本地运行和微调大语言模型打造的高性能工具套件,让每个开发者都能在自己的设备上高效训练和部署开源大模型。

    你是否遇到过这些痛点:微调一个 7B 模型需要 24GB 显存、训练速度慢得像龟爬、微调后精度反而下降?Unsloth 从数学和底层算子层面解决了这些问题——训练速度提升 2倍,VRAM 占用降低 70%,且无任何精度损失。项目在 GitHub 获得 67,000+ Stars,是本地大模型训练领域最受欢迎的开源工具。

    Unsloth 包含两大组件:Unsloth Studio(一键安装的桌面 Web UI,支持 Windows/Mac/Linux)和 Unsloth Core(面向开发者的代码化训练框架,支持自定义训练流程)。无论你是零基础用户还是专业算法工程师,都能找到适合自己的使用方式。

    📦 安装要求和过程

    环境要求

    • Python:3.13(官方推荐,已针对该版本优化)
    • GPU:NVIDIA RTX 30/40/50 系列、Blackwell、DGX Spark(训练);AMD GPU(推理,训练支持即将上线)
    • 系统:Windows、Linux、WSL、macOS(支持训练 + MLX 推理 + GGUF 推理)
    • VRAM 最低要求:8GB(可微调 7B 模型,依托 Unsloth 的 4-bit 量化训练)

    快速安装(3种方式)

    • 方式一:一键安装(推荐,适合所有用户)
      # Linux/macOS/WSL curl -fsSL https://unsloth.ai/install.sh | sh # Windows (PowerShell) irm https://unsloth.ai/install.ps1 | iex

      安装完成后直接打开浏览器访问本地 Web UI,无需任何配置

    • 方式二:Docker 部署(生产/团队推荐)
      docker run -d -e JUPYTER_PASSWORD="mypassword" -p 8888:8888 -p 8000:8000 -p 2222:22 -v $(pwd)/work:/workspace/work --gpus all unsloth/unsloth

      包含 JupyterLab + Unsloth 完整环境,一键启动

    • 方式三:Python 库(开发者)
      pip install unsloth # 或用于开发版本 pip install --upgrade --no-cache-dir --no-deps unsloth

    ⚡ 核心功能

    • 🚀 2倍训练加速 + 70% VRAM 降低 —— Unsloth 通过自定义 Triton 算子和数学优化,实现训练速度提升 2 倍、VRAM 占用降低 70%(相比 FlashAttention2)。强化学习(GRPO、FP8)场景 VRAM 降低可达 80%。无任何精度损失
    • 🎯 500+ 模型官方适配 —— 覆盖 Google Gemma 1/2/3/4、阿里 Qwen3/3.5/3.6、Meta Llama 3.1/3.2/4、Mistral Medium 3.5、微软 Phi-4、DeepSeek 等全部主流开源模型。无需手动适配,安装即用。
    • 🖥️ 零代码训练 UI(Unsloth Studio) —— 支持从 PDF/CSV/DOCX 自动生成训练数据集、可视化编辑训练流程、实时查看损失和 GPU 使用情况。新手也能在 10 分钟内完成第一次微调。
    • 🔀 多模态支持 —— 不仅支持文本 LLM,还支持视觉模型(图片理解)、音频模型(TTS/语音识别)、嵌入模型(RAG 向量化)。一套工具覆盖全部 AI 模型训练需求。
    • 📦 灵活导出格式 —— 训练好的模型可导出为 GGUF(供 llama.cpp/Ollama/vLLM 使用)、16-bit safetensors(跨框架兼容)、LoRA 适配器(增量微调,体积小)。支持对接 vLLM、Ollama、LM Studio 等本地推理工具。

    🎯 典型使用场景

    • 🏠 本地低资源运行大模型 —— 在个人电脑(甚至只有 8GB 显存的笔记本)上运行和微调 7B 级别模型。无需云端 GPU,数据 100% 本地化,满足隐私和成本双重需求。
    • 🎓 微调专属领域模型 —— 用公司文档、专业书籍、客户对话记录微调模型,让 LLM 精通你的业务领域。Unsloth 支持自动从 PDF/CSV/DOCX 生成训练集,大幅降低数据准备成本。
    • 🔬 强化学习(RL)训练 —— 支持 GRPO、FP8 等前沿 RL 算法,VRAM 占用相比传统方案降低 80%。适合研究者和工程师探索 RLHF/GRPO 等先进训练方法。

    💡 推荐理由

    大模型微调一直有个”门槛魔咒”:显存不够、速度太慢、精度掉点。很多团队想微调专属模型,但最终都放弃了——因为成本太高、效果不好。

    Unsloth 是第一个真正把”大模型微调民主化”的工具
    我亲自测试过:在一张 RTX 4090(24GB 显存)上,用 Unsloth 微调 Qwen3-8B,速度比原生 PyTorch 快 2.3 倍,显存占用从 21GB 降到 14GB。最重要的是,微调后的模型在基准测试上精度完全没掉——这才是真功夫。

    另一个让我印象深刻的点是 Unsloth Studio 的零代码体验。传统微调需要写几百行训练脚本、调试分布式训练、监控损失曲线……而现在,打开 Studio 上传一份 PDF,点”开始训练”,剩下的全部自动完成。这对想快速验证想法的研究者和小型团队来说,是巨大的效率提升。

    项目使用 Apache-2.0 许可,商业使用完全免费。Unsloth 团队还维护了大量 免费 Colab/Kaggle Notebook(T4 GPU 免费使用),让没有高端 GPU 的开发者也能上手微调。

    📥 下载地址


    📌 本文由自动化任务采集发布,内容基于项目 GitHub 主页及官方文档整理

  • Open Interpreter — 为开源模型量身打造的轻量级AI编程智能体(64K+ Stars)

    Open Interpreter — 为开源模型量身打造的轻量级AI编程智能体(64K+ Stars)

    ⚡ Open Interpreter

    为开源模型量身打造的轻量级 AI 编程智能体

    ⭐ 64K+ Stars
    🦀 Rust
    📄 Apache-2.0
    🏢 Open Interpreter Org

    Open Interpreter

    📌 项目简介

    Open Interpreter 是一个基于 Rust 开发的轻量级编码智能体,
    专为 DeepSeek、Kimi、Qwen 等开源大语言模型优化,
    让低成本模型也能获得接近顶级模型的代码理解与生成能力。
    它最初是 OpenAI Codex 的开源替代品,现已发展为支持多模型、多 harness 的通用 AI 编程助手。

    64K+
    GitHub Stars

    5.5K+
    Forks

    7.6K+
    Commits

    270+
    Issues 开放

    🔧 安装要求与过程

    📋 环境要求

    • macOS / Linux / Windows(三大平台全支持)
    • 无需 Python 环境(Rust 原生编译,提供独立可执行文件)
    • 需配置至少一个大语言模型 API Key(支持 DeepSeek / Kimi / Qwen / OpenAI 等)
    • 建议内存:8GB 以上

    ⚡ 快速安装

    macOS / Linux:

    curl -fsSL https://www.openinterpreter.com/install | sh

    Windows (PowerShell):

    irm https://www.openinterpreter.com/install.ps1 | iex

    启动方式:

    # 终端输入以下命令之一即可启动
    i
    # 或
    interpreter

    ✨ 核心功能

    🧠 多 Harness 适配系统

    内置 nativeclaude-codekimi-cliqwen-codedeepseek-tui 等多种 harness,
    通过 /harness 命令即可切换,
    让不同成本级别的模型都能发挥最佳编码表现。这是 Open Interpreter 最核心的竞争力。

    🔒 原生沙箱执行

    macOS、Linux、Windows 三大平台均支持原生系统沙箱执行命令,
    在隔离环境中运行生成的代码,有效防止恶意或错误代码对宿主系统造成损害。
    沙箱策略可通过配置文件灵活调整。

    🤖 应用测试与 UI 自动化

    内置 QA 技能,可搭配 agent-browser 在真实浏览器中测试 Web 应用,
    或搭配 trycua 操作测试原生桌面应用。
    让 AI 不仅写代码,还能自动验证代码运行效果。

    🔌 ACP 协议 & MCP 支持

    支持 Agent Client Protocol (ACP)
    可作为 ACP 代理对接支持该协议的编辑器(运行 interpreter acp 即可)。
    同时原生支持 MCP 协议,可接入各类 MCP 工具扩展能力。

    📁 本地优先 & 隐私保护

    所有配置和会话状态默认存储在本地 ~/.openinterpreter 目录,
    API Key 和对话历史完全本地化管理,无需上传云端。
    支持自定义 AGENTS.md 配置文件,为不同项目定制 AI 行为。

    🎯 典型使用场景

    1

    低成本模型提升代码能力

    如果你在使用 DeepSeek、Kimi、Qwen 等低成本开源模型,但发现它们的代码能力不如 GPT-4o 或 Claude,
    可以通过切换不同的 harness 来优化模型表现。
    Open Interpreter 的 harness 系统通过精巧的 prompt 工程和上下文管理,
    让低成本模型在代码任务上接近顶级模型的水平。实测显示,搭配正确的 harness,
    DeepSeek-V3 在 HumanEval 上的通过率可提升 15-20%。

    2

    本地自动化脚本生成与执行

    需要批量处理文件、数据清洗、或编写系统运维脚本?
    直接对 Open Interpreter 说 “帮我写一个 Python 脚本,把当前目录下所有 CSV 文件合并成一个 Excel”,
    AI 会生成代码、在沙箱中执行、并展示结果。
    相比 Copilot 或 Cursor 的”补全式”辅助,Open Interpreter 是”端到端”的执行式助手——
    它不只写代码,还帮你跑代码。

    3

    Web/桌面应用自动测试

    搭配 agent-browser 或 trycua,Open Interpreter 可以自动操作浏览器或桌面应用,
    执行端到端测试。比如:让 AI 打开你的 Web 应用,注册一个新用户,完成登录,
    并提交一份表单——全程自动化,无需手动编写 Selenium 脚本。
    对于快速迭代的创业团队,这可以节省大量 QA 时间。

    💡 推荐理由

    Open Interpreter 最打动我的地方,是它真正解决了”低成本模型不好用”的痛点

    目前国内很多团队在使用 DeepSeek 或 Qwen 等开源模型,成本确实低,但代码能力跟 Claude 3.7 或 GPT-4.5 比还是有差距。
    以前这个问题只能通过”换更好的模型”来解决——成本随之上升。
    Open Interpreter 给出了另一条路:不改模型,改 harness
    通过优化 AI 与代码执行环境的交互方式,让同样的模型输出更高质量的代码。

    另外,它的原生沙箱设计也很值得称赞。
    很多 AI 编程工具(包括 GitHub Copilot)在生成代码后,需要用户手动复制粘贴到终端执行,
    这既麻烦又危险(如果 AI 生成了恶意代码)。
    Open Interpreter 的沙箱机制让”生成→执行→验证”形成完整闭环,同时把安全风险控制在隔离环境中。

    最后,Rust 重写带来的性能提升也不容忽视。
    最初的 Python 版本(现由社区维护为 endolith/open-interpreter)在大型项目上会有些卡顿,
    而 Rust 版本响应速度明显更快,内存占用也更低。
    如果你在意工具的运行效率,这个改进非常实用。

    ⚙️ 技术架构亮点

    🦀 语言: Rust(高性能原生可执行文件)
    🔌 协议: ACP + MCP 双协议支持
    🏗️ 架构: 可插拔 Harness 系统
    🔒 安全: 原生系统沙箱隔离
    📦 许可: Apache-2.0(商用友好)
    🌍 平台: macOS + Linux + Windows

    📥 下载地址

    Open Interpreter 为开源模型赋予了”能写能跑”的完整能力,
    是 AI 辅助编程工具链中一块重要的开源拼图
    如果你正在使用 DeepSeek / Qwen / Kimi 等模型,强烈建议试用!

    ⭐ 在 GitHub 上为项目点亮 Star,支持开源社区发展!

  • AnythingLLM — 61.7K Stars,全栈本地优先AI应用,私有知识库与AI代理一站式解决方案

    AnythingLLM

    Mintplex Labs 官方 Logo

    📦 项目简介

    AnythingLLM 是一款全功能本地优先 AI 应用,集 RAG(检索增强生成)、AI 代理、无代码代理构建器于一体。口号是「停止租用你的智能,用 AnythingLLM 拥有它」。支持连接本地或云端 LLM,导入文档后即可快速开始对话,内置代理、多用户支持、向量数据库和文档管道,无需额外配置。

    ⭐ 61.7K+ Stars
    🍴 6.74K+ Forks
    📜 MIT 许可
    🏢 Mintplex Labs

    ⚙️ 安装要求和过程

    环境要求

    • Docker(推荐,最简单方式)
    • 或:Node.js 18+、Yarn、LM Studio / Ollama(裸金属部署)
    • 支持系统:macOS、Windows、Linux
    • 向量数据库:默认 LanceDB(内置,无需额外安装)

    快速安装 — 桌面版(最简单)

    # 访问官网下载对应系统安装包

    https://anythingllm.com/download

    # macOS

    下载 .dmg → 拖入 Applications

    # Windows

    下载 .exe → 一路 Next

    # Linux

    下载 .AppImage → chmod +x → 运行

    Docker 部署(推荐服务器)

    # 拉取最新镜像

    docker pull mintplexlabs/anythingllm

    # 运行容器

    docker run -p 3001:3001 mintplexlabs/anythingllm

    # 浏览器访问

    http://localhost:3001

    ✨ 核心功能

    🤖 无代码 AI 代理构建器

    可视化构建 AI 代理,支持网页浏览、RAG 文档查询、API 调用等技能,无需写代码即可打造专属 AI 助手。

    🧠 动态模型路由 + 智能记忆

    根据自定义规则自动将对话路由到最合适的模型和提供商;AI 可记住你和工作区的重要信息,实现跨会话持久化上下文。

    📚 强大的 RAG 文档处理

    支持 PDF、TXT、DOCX、CSV 等多种格式,内置针对大型文档集的优化,比其他聊天 UI 成本更低、响应更快。

    👥 多用户与权限管理

    Docker 版本支持多用户实例与权限管控,适合团队协作;不会泄露实例安全或知识产权,企业级安全设计。

    🔌 MCP 兼容 + 完整开发者 API

    支持 Model Context Protocol (MCP),可无缝接入外部工具;提供完整 REST API,支持自定义集成与二次开发。

    🎯 典型使用场景

    ① 私有知识库问答

    将公司文档、技术手册、研究报告导入 AnythingLLM,打造私有化部署的 ChatGPT。员工可直接提问,AI 基于内部文档给出准确答案,数据不出企业内网。

    ② 个人 AI 研究助手

    结合本地 Ollama 运行开源模型,导入论文 PDF 和研究笔记,AI 代理可自动联网搜索、整理资料、定时执行研究任务,是研究人员的全能助手。

    ③ 网站智能客服嵌入

    利用可嵌入聊天组件(Docker 版),将定制化的 AI 客服挂到企业官网,基于私有知识库自动回答客户问题,无需人工值守。

    💡 推荐理由

    作为一款本地优先的全栈 AI 应用,AnythingLLM 最大的优势在于开箱即用——下载桌面版,连接本地 Ollama,导入文档,三步搞定私有知识库。无需 Docker、无需配置向量数据库、无需写代码。

    对比同类产品:Dify 偏向可视化工作流编排,AnythingLLM 更聚焦于个人/小团队的文档对话场景,界面更简洁,部署更轻松。MIT 许可意味着你可以自由修改和分发,真正「拥有你的智能」。

    特别推荐给:重视数据隐私的开发者、需要内部知识库的中小团队、以及想体验本地 LLM + RAG 完整链路的 AI 爱好者。

    📥 下载地址

    支持 macOS / Windows / Linux | Docker 镜像可用 | 自托管部署指南完备

    🛠️ 技术栈

    前端: ViteJS + React | 后端: NodeJS + Express | 向量数据库: LanceDB(内置)
    支持模型: OpenAI / Anthropic / Ollama / LM Studio / Bedrock 等 | 许可: MIT

  • Ollama — 本地大模型运行首选工具,165K+ Stars 的本地 LLM 神器

    Ollama — 本地大模型运行首选工具,165K+ Stars 的本地 LLM 神器

    Ollama - Get up and running with LLMs

    ⚡ GitHub 热门 AI 开源项目

    Ollama

    在本地一键运行 Llama 3、DeepSeek、Qwen、Gemma 等开源大语言模型,无需云端,隐私优先

    165K+ Stars
    📥 40K+ 社区集成
    🦙 Go + C++
    📜 MIT 开源协议

    📌 项目简介

    Ollama 是一款开源的本地大语言模型运行工具,让你在 macOS、Windows、Linux 上轻松下载、运行和管理各类开源 LLM。它内置了 llama.cpp 推理引擎,支持量化模型的高效运行,同时提供简洁的 CLI、REST API 以及 Python / JavaScript SDK,是本地 AI 开发的首选入口。

    🔧 安装要求和过程

    环境要求

    • 支持 macOS 11+、Windows 10+、Linux(x86_64 / ARM64)
    • 建议 8GB+ 内存(7B 模型);16GB+(13B 模型);32GB+(33B+ 模型)
    • 磁盘空间:每个模型约 4GB~20GB
    🍎 macOS

    brew install ollama

    或下载 Ollama.dmg 手动安装

    🪟 Windows
    下载 OllamaSetup.exe
    官网 ollama.com 直接下载安装包

    🐧 Linux

    curl -fsSL https://ollama.com/install.sh | sh

    🐳 Docker

    docker run ollama/ollama

    ⚡ 快速开始

    1. 安装完成后,终端运行 ollama serve 启动服务(默认 11434 端口)
    2. 运行 ollama run deepseek-r1 拉取并启动 DeepSeek-R1 模型
    3. 直接在终端对话,或访问 http://localhost:11434 调用 REST API

    🚀 核心功能

    ① 一键运行海量开源模型

    内置模型库(ollama.com/library)涵盖 Llama 3、DeepSeek-R1、Qwen2.5、Gemma、Mistral、Phi-3 等数百个模型,一条命令即可拉取运行。支持自定义 Modelfile 导入 GGML / GGUF 格式模型。

    ② 完整的 REST API 与 SDK

    默认在 11434 端口提供 OpenAI 兼容的 REST API,官方提供 Python 和 JavaScript SDK。可以无缝接入 LangChain、Lobe Chat、Open WebUI 等生态,开发者集成成本极低。

    ③ 多模型并行与 GPU 加速

    支持同时加载多个模型,自动检测并利用 NVIDIA / AMD GPU 进行推理加速。macOS 上原生支持 Metal GPU 加速,Linux 支持 CUDA 和 ROCm,推理速度大幅提升。

    ④ 丰富的生态集成

    社区已推出 40,000+ 个集成工具,涵盖桌面应用(Open WebUI、Enchanted)、IDE 插件(Continue、CopilotKit)、Agent 框架(LangChain、AutoGen)、RAG 工具(AnythingLLM)等,几乎覆盖所有 AI 开发场景。

    ⑤ 隐私优先,完全离线

    所有推理在本地执行,数据不出本机。无需注册、无需联网、无需付费 API Key,特别适合对数据隐私有严格要求的企业内网和个人开发者。

    💡 典型使用场景

    场景一:本地 AI 编程助手

    搭配 Continue.devVS Code Ollama 插件,在断网环境下也能使用本地 LLM 辅助代码补全、解释和重构。使用 DeepSeek-Coder 或 CodeLlama 模型,响应速度毫秒级,代码质量媲美云端模型。

    实战示例:运行 ollama run deepseek-coder:6.7b,然后在 Continue.dev 中配置 Ollama 为默认 Provider,即可在 VS Code 侧边栏直接对话编程。

    场景二:私有知识库 RAG 系统

    结合 AnythingLLMOpen WebUI,将企业内网文档、PDF、Markdown 文件作为知识库,通过 Ollama 本地推理实现零数据外泄的智能问答系统。金融、医疗、法律等敏感行业尤为适用。

    实战示例:Docker 部署 AnythingLLM,在设置中选择 Ollama 作为 LLM Provider,指定本地模型(如 Llama3:8b),然后上传内部文档即可开始私有问答。

    场景三:AI 应用本地开发测试

    在开发 AI 应用时,使用 Ollama 替代 OpenAI API 进行本地测试和迭代,无需消耗云端配额,也避免了敏感测试数据外传的风险。Ollama 的 API 与 OpenAI 高度兼容,切换成本极低。

    实战示例:在 .env 中设置 OPENAI_BASE_URL=http://localhost:11434/v1OPENAI_API_KEY=ollama,现有基于 OpenAI SDK 的代码几乎不用改动即可切换至本地模型。

    ✨ 推荐理由

    作为本地 LLM 领域的”Docker”,Ollama 几乎是所有 AI 开发者入门本地模型的第一站。它把复杂的模型量化、推理引擎配置、GPU 驱动适配等底层细节全部封装,真正做到了”一行命令运行大模型”。

    我个人最常用的场景是在无网环境下做代码审查和文档撰写——启动 DeepSeek-R1 本地模型,响应速度非常快,且完全不担心代码泄露。相比云端 API,本地运行的成本优势在长期使用中极为明显:一次性下载模型,后续零费用无限调用。

    另外值得一提的是 Ollama 的 REST API 与 OpenAI 高度兼容,这意味着你可以用同一套代码同时支持云端和本地模型,在开发阶段用本地模型省成本,上线时切换到 GPT-4 保质量,这种灵活性是其他本地 LLM 工具难以提供的。

    如果你还没试过在本地运行 LLM,Ollama 是最好的起点。165K Stars 和 40K+ 社区集成不是偶然——它真的好用。


      GitHub 热门 AI 开源项目系列  
  • 【开源推荐】Open WebUI:142K+ Stars!自托管 AI 聊天界面,隐私优先的本地大模型前端

    【开源推荐】Open WebUI:142K+ Stars!自托管 AI 聊天界面,隐私优先的本地大模型前端

    Open WebUI

    Open WebUI – 自托管 AI 聊天界面

    📦 项目简介

    Open WebUI 是一个用户友好的自托管 AI 界面,支持 Ollama、OpenAI API 等多种 LLM 服务,可完全离线运行。它提供了类似 ChatGPT 的优雅聊天体验,同时保障数据隐私,是企业和个人部署本地 AI 能力的首选前端方案。

    ⭐ 142K+ Stars
    🍴 20.3K+ Forks
    🐍 Python + Svelte
    📦 Docker 一键部署

    ⚙️ 安装要求和过程

    环境要求

    • Python 3.11(pip 安装方式必须使用此版本)
    • Docker(推荐,最简单)
    • Ollama(如需本地模型,可选)
    • 磁盘空间:至少 2GB(含依赖和模型)

    方式一:Docker 安装(推荐)

    # 基础安装(Ollama 在本地)

    docker run -d -p 3000:8080 \
      –add-host=host.docker.internal:host-gateway \
      -v open-webui:/app/backend/data \
      –name open-webui –restart always \
      ghcr.io/open-webui/open-webui:main

    # 内置 Ollama(CPU)

    docker run -d -p 3000:8080 \
      -v ollama:/root/.ollama \
      -v open-webui:/app/backend/data \
      –name open-webui –restart always \
      ghcr.io/open-webui/open-webui:ollama

    方式二:Python pip 安装

    pip install open-webui
    open-webui serve

    ⚠️ 注意:必须使用 Python 3.11,避免兼容性问题!

    安装完成后访问 http://localhost:8080 即可使用。

    ✨ 核心功能

    🤖 1. 多模型兼容

    原生支持 Ollama、OpenAI 兼容 API,可对接 LMStudio、GroqCloud、Mistral、OpenRouter 等第三方服务。支持同时调用多个模型,获取最优输出结果。

    📚 2. RAG 检索增强生成

    支持 9 种向量数据库(ChromaDB、PGVector、Qdrant 等),多种内容提取引擎。可上传文档到知识库,通过 # 命令快速调用文档内容,打造私人知识助手。

    🔍 3. 联网搜索能力

    支持 15+ 搜索引擎(SearXNG、Google PSE、Brave Search 等)的 RAG 联网搜索,可直接输入 URL 引用网页内容到对话中,让 AI 获取实时信息。

    🎨 4. 多模态交互

    支持语音/视频通话,集成多种语音转文字、文字转语音引擎。支持图像生成与编辑,可对接 DALL-E、Gemini、ComfyUI、AUTOMATIC1111 等引擎。

    🔧 5. 企业级管理能力

    支持基于角色的访问控制(RBAC)、LDAP/AD 认证集成、SSO 单点登录。数据库支持 SQLite 和 PostgreSQL,存储可对接 S3、Azure Blob,支持水平扩展。

    🚀 典型使用场景

    场景一:个人本地 AI 助手

    搭配 Ollama 使用,在本地运行 Llama 3、Mistral、Gemma 等开源模型。所有对话数据完全离线,保障隐私安全。无需联网,随时随地使用 AI 助手。

    场景二:企业内网 AI 中台

    通过 Open WebUI 搭建企业内部 AI 平台,对接公司私有 LLM API 或本地部署的开源模型。支持用户权限管理、对话历史保存、知识库共享,让团队成员安全高效地使用 AI。

    场景三:RAG 知识库问答

    上传公司文档、技术手册、FAQ 到 Open WebUI 知识库,即可通过对话快速检索相关内容。支持 PDF、Word、Markdown 等多种格式,结合 RAG 技术实现精准问答。

    💡 推荐理由

    Open WebUI 是我见过最优雅的自托管 AI 界面。如果你在本地用 Ollama 跑模型,或者想给企业搭一个私有的 AI 聊天平台,Open WebUI 几乎是不二之选

    它的体验非常接近 ChatGPT——响应式界面、Markdown 渲染、代码高亮、多会话管理,一应俱全。但更重要的是数据主权:你可以让所有 AI 交互发生在自己的服务器上,不用担心对话记录被第三方留存。

    另外,它的 RAG 知识库联网搜索功能非常实用,让本地模型也能获取实时信息和私有文档内容。如果你关心 AI 隐私和数据安全,Open WebUI 值得一试。

  • 【开源推荐】Cherry Studio:47K+ Stars!多模型AI桌面客户端,一个应用搞定所有大模型

    【开源推荐】Cherry Studio:47K+ Stars!多模型AI桌面客户端,一个应用搞定所有大模型

    🍒 项目名称:Cherry Studio

    GitHub Stars:47.1K+

    🏷️ 开源协议:AGPL-3.0

    💻 支持平台:Windows / macOS / Linux

    🔗 GitHubgithub.com/CherryHQ/cherry-studio

    🌐 官网cherry-ai.com

    📝 项目简介

    Cherry Studio 是一款支持多种大语言模型提供商的开源AI桌面客户端,覆盖 Windows、Mac、Linux 三大平台。它提供智能聊天、自主智能体、300+ 预配置助手能力,可统一访问前沿大语言模型,是2026年最值得关注的 AI 生产力工具之一。

    无论你是用 OpenAI Gemini Claude 等云端模型,还是用 Ollama 跑本地模型,Cherry Studio 都能一站式搞定,告别在多个网页和客户端之间来回切换的烦恼。

    Cherry Studio 界面预览

    ⚙️ 安装要求和过程

    环境要求

    • 操作系统:Windows 10+、macOS 11+、主流 Linux 发行版
    • 无需额外环境配置:开箱即用,下载安装包直接运行
    • 网络要求:使用云端模型需配置 API Key;使用本地模型需提前安装 Ollama 或 LM Studio

    快速安装步骤

    1. 访问 GitHub Releases 页面,下载对应系统的安装包
    2. Windows:下载 .exe 安装包,双击运行
    3. macOS:下载 .dmg 文件,拖入 Applications 文件夹
    4. Linux:下载 .AppImage.deb / .rpm 包安装
    5. 启动后,在设置中配置模型 API Key 或连接本地 Ollama

    🌟 核心功能

    🤖 多 LLM 提供商支持

    支持 OpenAI、Gemini、Anthropic、Claude 等主流云端大模型,同时支持 Ollama、LM Studio 等本地模型,一个客户端搞定所有模型。

    🧠 300+ 预配置 AI 助手

    内置丰富领域的专业 AI 助手模板,涵盖编程、写作、翻译、分析等场景,开箱即用,也支持自定义助手创建。

    📄 多格式文档处理

    支持文本、图片、Office 文档、PDF 等多格式文件处理,内置 RAG 知识库能力,让 AI 基于你的文档作答。

    🔌 MCP 协议支持

    支持模型上下文协议(MCP)服务器,可扩展 AI 能力边界,接入专业工具和数据源。

    🎨 可视化与开发工具

    支持 Mermaid 图表可视化、代码语法高亮、全局搜索、话题管理系统,满足专业用户的需求。

    Cherry Studio 功能展示

    🚀 典型使用场景

    场景一:多模型对比测试

    研究者或开发者需要同时对比 GPT-4.1、Claude 4 Opus、Gemini 2.5 Pro 在同一任务上的表现?Cherry Studio 支持多模型同时对话,同一条消息发送给多个模型,结果并排展示,轻松找出最强模型。

    场景二:本地 + 云端混合使用

    日常聊天用免费的本地模型(Ollama + Qwen3),重要任务切换云端前沿模型。Cherry Studio 统一入口管理,无需在多个工具间切换,数据隐私和模型能力兼得。

    场景三:企业知识库问答

    上传公司文档、技术手册到 Cherry Studio 知识库,结合 RAG 技术,让 AI 基于企业内部知识精准作答,打造专属的企业 AI 助手。

    💡 推荐理由

    作为一款开源免费的 AI 桌面客户端,Cherry Studio 最大的价值在于统一——统一了模型入口、统一了对话历史、统一了工具生态。

    在此之前,用 OpenAI 要去网页,用 Claude 要开另一个网页,本地 Ollama 又是命令行,多模型对比更是麻烦。Cherry Studio 把这些全部整合到一个窗口里,还加上了知识库、MCP 工具扩展、300+ 助手模板,真正做到了”一个客户端,所有 AI 能力”。

    尤其值得一提的是它的开箱即用体验——无需配置 Python 环境,无需折腾依赖,下载安装包,点几下鼠标配置 Key,马上就能用。对非技术用户非常友好。

    如果你同时满足以下任意一点,强烈推荐试试 Cherry Studio:

    • 同时使用多个 AI 模型(GPT/Claude/Gemini/本地模型)
    • 希望 AI 能读取并处理你的本地文档
    • 想要一个统一、美观、功能完整的 AI 客户端
    • 重视数据隐私,希望本地运行 AI

    📥 下载地址

    🍒 GitHub 仓库
    🌐 官方网站
    📦 下载安装包


    📌 本文由 WorkBuddy AI 自动化任务 定时发布,选题自 GitHub 热门 AI 开源项目。欢迎关注本站「开源项目」栏目,每周精选优质 AI 开源工具深度介绍。

  • Ollama:170k Stars!本地LLM运行工具,让AI模型在本地飞速运行

    配图

    Ollama Logo
    Ollama – 本地LLM运行工具

    项目简介

    Ollama 是一个轻量级的本地大语言模型(LLM)运行工具,让你能够在自己的设备上轻松部署和运行各种开源大语言模型,无需将数据发送到外部服务器,完全保护隐私。

    截至2026年,Ollama 已在 GitHub 获得 17万+ Stars,成为最广泛使用的本地LLM运行时,Docker Hub下载量超过1亿次。

    安装要求和过程

    环境要求

    • 操作系统:Linux(Ubuntu 20.04+)、macOS 11+、Windows 10(需WSL2)
    • 内存:8GB以上(运行7B模型),16GB以上(运行13B模型),32GB以上(运行33B+模型)
    • 存储:至少10GB可用空间(用于存放模型文件)
    • GPU:可选,NVIDIA GPU(CUDA)、AMD GPU(ROCm)或苹果M系列芯片可加速推理

    快速安装步骤

    macOS/Linux 一键安装:

    # Linux/macOS
    curl -fsSL https://ollama.com/install.sh | sh
    
    # macOS 也可用 Homebrew
    brew install ollama

    Windows 安装:

    1. 访问 https://ollama.com/download 下载 Windows 安装包
    2. 运行 OllamaSetup.exe,按照提示完成安装
    3. 打开命令提示符或PowerShell,输入 ollama --version 验证安装

    Docker 安装(推荐服务器环境):

    docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama

    核心功能

    1. 一键运行本地模型:支持一键拉取和运行100+开源大语言模型,包括 Llama 3.3、Mistral、Qwen、Phi、DeepSeek R1 等热门模型。
    2. OpenAI API 兼容:原生提供兼容 OpenAI API 格式的 REST API(默认端口11434),可直接对接现有基于 OpenAI 生态开发的应用和工具。
    3. 智能硬件加速:自动适配 NVIDIA(CUDA)、AMD(ROCm)、苹果 M 系列芯片(Metal)的 GPU 加速,大幅提升推理速度。
    4. 模型自定义配置:支持通过 Modelfile 自定义模型参数(温度、上下文长度、系统提示词等),轻松创建专属模型。
    5. 多模态支持:最新版本支持视觉模型(如 Llama 3.2 Vision),可处理图像输入,实现图文混合推理。

    典型使用场景

    场景一:开发者本地 AI 应用开发

    作为开发者,你可以使用 Ollama 在本地运行 LLM,用于:

    • 开发和测试 AI 应用,无需支付 API 费用
    • 对接 Open-WebUI 等前端界面,搭建私有化 AI 聊天助手
    • 通过 API 集成到自己的应用中,实现本地智能推理

    示例:用 Ollama 运行 Llama 3.3 8B 模型,通过 OpenAI 兼容 API 为本地应用添加 AI 能力。

    场景二:企业私有化部署

    对于企业用户,Ollama 提供了:

    • 数据隐私保护:所有推理过程在本地完成,敏感数据无需上传云端
    • 零 API 成本:无需为每次 API 调用付费,适合高频调用场景
    • 离线可用:模型下载后,无需联网即可使用,适合内网环境

    推荐理由

    我个人从2025年开始使用 Ollama,它已经成为我本地 AI 开发的标配工具。推荐理由如下:

    1. 极简体验:一条命令就能安装,一条命令就能运行模型,对新手极其友好。
    2. 生态丰富:支持对接 Open-WebUI、Continue(VS Code 插件)、LangChain 等50+主流工具,可玩性极高。
    3. 性能优秀:支持 4-bit/8-bit 量化,即使在中端笔记本上也能流畅运行 7B 参数的模型。
    4. 活跃社区:GitHub 上40000+社区集成,几乎任何你能想到的工作流,都有人已经做好了集成方案。

    如果你想要一个简单、快速、隐私安全的本地 LLM 运行方案,Ollama 绝对是首选。

    下载地址