标签: Ollama

  • ZeroClaw:32.4K Stars 的 Rust 全自主个人 AI 助理基础设施,6.6MB 单二进制、30+ 渠道、数据完全自持

    ZeroClaw:32.4K Stars 的 Rust 全自主个人 AI 助理基础设施,6.6MB 单二进制、30+ 渠道、数据完全自持

    ZeroClaw Banner

    项目简介

    ZeroClaw 是一个用 Rust 编写的全自主个人 AI 助理基础设施(Agent Runtime)——一个体积小、速度快的单二进制程序,让你在自己的机器上跑一个 7×24 小时在线的私人 AI 助理:它对接 Anthropic、OpenAI、Ollama 等 20 余家模型提供商,通过 Discord、Telegram、Matrix、邮件、语音、Webhook 等 30+ 渠道与你对话,并能调用 Shell、浏览器、HTTP、硬件外设与自定义 MCP 服务器执行真实操作。项目口号非常直白:“You own the agent. You own the data. You own the machine it runs on.”(智能体是你的,数据是你的,机器也是你的。)

    项目诞生于 2026 年 2 月,由 Harvard、MIT 与 Sundai Club 社区孵化,短短 5 个多月即斩获 32,400+ Stars、4,800+ Fork,是当下最火的 Rust AI 项目之一。采用 MIT OR Apache-2.0 双许可,可自由选择。

    安装要求和过程

    环境要求

    • 操作系统:Linux / macOS / Windows / FreeBSD / NixOS / Docker 全平台支持,也可跑在树莓派等单板机上
    • 运行环境:预编译二进制开箱即用;从源码构建需 Rust(edition 2024)工具链
    • 体积:minimal 内核预设仅约 6.6 MB,资源占用极低
    • 模型接入:任一 LLM 提供商的 API Key,或本地 Ollama(可完全离线)

    快速安装

    # 一键安装(自动选择预编译二进制,失败则回退源码构建)
    curl -fsSL https://raw.githubusercontent.com/zeroclaw-labs/zeroclaw/master/install.sh | bash
    
    # 或克隆后安装(可交互选择组件和特性)
    git clone https://github.com/zeroclaw-labs/zeroclaw.git
    cd zeroclaw
    ./install.sh
    
    # 极简内核(约6.6MB)
    ./install.sh --preset minimal
    

    快速上手

    zeroclaw quickstart           # 一站式配置:选择模型提供商,生成可用配置
    zeroclaw agent -a <alias>     # 交互式对话
    zeroclaw service install      # 注册为 systemd/launchctl/Windows 服务
    zeroclaw service start        # 后台常驻运行
    

    所有配置集中在一个 TOML 文件(~/.zeroclaw/config.toml),支持 Codex 订阅、Claude Max setup-token 等多种认证方式导入。

    核心功能

    • 多渠道统一接入:Discord、Telegram、Matrix、邮件、语音、Webhook、CLI 等 30+ 渠道适配器,全部消息汇入同一个智能体循环,一个助理全端响应
    • 模型提供商无关:可插拔接入 Anthropic、OpenAI、本地 Ollama 及任意 OpenAI 兼容端点约 20+ 家,支持故障回退链与智能路由,单家挂掉不影响服务
    • 安全优先架构:默认 supervised 监督模式——中风险操作需审批、高风险直接拦截;工作区边界、命令策略、OS 级沙箱(Landlock/Bubblewrap/Seatbelt/Docker)加密码学工具回执(Tool Receipts)记录每一次操作;开发机可切 YOLO 模式放飞
    • 硬件控制能力:通过 Peripheral trait 支持树莓派、STM32、Arduino、ESP32 的 GPIO/I2C/SPI/USB,AI 助理可以直接操控物理硬件
    • SOP 引擎 + 网关面板:事件触发的标准作业程序(MQTT/Webhook/Cron/外设触发,带审批门与断点续跑);HTTP/WebSocket 网关配 Web 仪表盘,可视化管理对话、记忆、配置与定时任务;另有 ACP 协议支持 IDE 集成

    ZeroClaw 硬件架构
    ZeroClaw 硬件接入架构:从单板机 GPIO 到智能体循环

    典型使用场景

    1. 私有化全天候个人助理:在家庭服务器或 VPS 上以 systemd 服务常驻运行,用 Telegram/Discord 随时召唤——查资料、跑脚本、管日程、收发邮件,所有数据和 API Key 都留在自己机器上,零云端依赖
    2. 智能家居与硬件自动化中枢:跑在树莓派上,结合 SOP 引擎的 MQTT/Cron/外设触发器,让 AI 根据传感器读数自动执行标准作业流程(如温度异常告警并开启风扇),审批门保证关键操作人工确认
    3. 离线/内网 AI 运维助手:搭配本地 Ollama 在无外网环境下运行,通过 Shell 与 HTTP 工具执行巡检、日志分析等任务,沙箱与工具回执满足安全审计要求

    推荐理由

    体验下来最深的感受是「」和「」:相比动辄上 GB 依赖的 Python Agent 框架,ZeroClaw 一个 6.6MB 起步的 Rust 二进制就能常驻后台,树莓派也毫无压力;配置只有一个 TOML 文件,quickstart 三分钟跑通。它的安全设计是我见过的开源助理里最认真的——默认监督模式、OS 级沙箱、每次工具调用都有加密回执,敢放心给它 Shell 权限。多渠道 + 多提供商 + 故障回退的组合意味着它真的能当”基础设施”用,而不只是玩具 Demo。如果你想要一个数据完全自持、能接硬件、7×24 在线的私人 Jarvis,ZeroClaw 是目前 Rust 生态里最值得入手的选择。注意:官方仓库只有 zeroclaw-labs/zeroclaw 一个,谨防仿冒包。

    下载地址

  • ZeroClaw:32K Stars 的 Rust 全自主 AI 个人助手基础设施,单二进制部署、30+通道接入、还能直控硬件

    ZeroClaw:32K Stars 的 Rust 全自主 AI 个人助手基础设施,单二进制部署、30+通道接入、还能直控硬件

    ZeroClaw 官方 Banner

    项目简介

    ZeroClaw 是一个用 Rust 编写的全自主 AI 个人助手基础设施——一个单二进制的智能体运行时(Agent Runtime),口号非常硬核:「You own the agent. You own the data. You own the machine it runs on.」(智能体是你的,数据是你的,跑它的机器也是你的)。它对接 Anthropic、OpenAI、Ollama 等约 20 家模型提供商,通过 Discord、Telegram、Matrix、邮件、语音、Webhook 等 30+ 消息通道与你交互,并能调用 Shell、浏览器、HTTP、硬件(树莓派 GPIO!)和自定义 MCP 服务器执行任务。整个系统跑在你自己的机器上,用你自己的密钥。项目 2026 年 2 月创建,短短 5 个多月即斩获 32,400+ Stars,由 Harvard、MIT、Sundai Club 社区孵化,是当前 GitHub 上最火的 Rust AI 基础设施项目之一。

    安装要求和过程

    环境要求

    • 操作系统:Linux / macOS / Windows / FreeBSD / NixOS / Docker 全平台支持,也可跑在树莓派等硬件上
    • Rust:仅源码构建需要(Rust Edition 2024);官方提供预编译二进制,无需工具链
    • 磁盘占用:minimal 内核精简版仅约 6.6 MB
    • 模型来源:任一 LLM 提供商 API Key,或本地 Ollama(完全离线可用)

    快速安装

    # 一键安装(自动选择预编译二进制,失败则回退源码构建)
    curl -fsSL https://raw.githubusercontent.com/zeroclaw-labs/zeroclaw/master/install.sh | bash
    
    # 或克隆后安装(可交互选择功能特性)
    git clone https://github.com/zeroclaw-labs/zeroclaw.git
    cd zeroclaw && ./install.sh
    
    # 常用安装选项
    ./install.sh --preset minimal     # 仅内核精简版(约6.6MB)
    ./install.sh --prebuilt           # 强制使用预编译二进制
    ./install.sh --source --features agent-runtime,channel-discord  # 自定义特性

    快速上手

    zeroclaw quickstart        # 一站式引导:选择模型提供商、生成可用配置
    zeroclaw agent -a <alias>  # 与指定智能体交互式对话
    zeroclaw service install   # 注册为 systemd/launchctl/Windows 服务
    zeroclaw service start     # 后台常驻运行

    所有配置集中在一个 TOML 文件(~/.zeroclaw/config.toml),provider、channel、agent、安全策略全部声明式定义。

    核心功能

    • 多通道统一接入:Discord、Telegram、Matrix、邮件、语音、Webhook、CLI 等 30+ 通道适配器,所有入站消息汇入同一个智能体循环——一个 Agent 在所有平台回复你
    • 模型提供商无关:可插拔接入 Anthropic、OpenAI、本地 Ollama 及任意 OpenAI 兼容端点,支持故障回退链与智能路由,某家 API 抽风时自动切换保持在线
    • 安全优先架构:默认「supervised」监督模式——中风险操作需审批、高风险直接拦截;工作区边界、命令策略、OS 级沙箱(Landlock / Bubblewrap / Seatbelt / Docker)、每次工具调用都有密码学签名回执(Tool Receipts);开发机可切 YOLO 模式放飞
    • 硬件直控能力:通过 Peripheral trait 支持树莓派、STM32、Arduino、ESP32 的 GPIO / I2C / SPI / USB——让 AI 助手直接操控物理世界
    • SOP 事件引擎 + 网关面板:MQTT / Webhook / Cron / 外设事件触发标准作业流程(含审批门与断点续跑);HTTP/WebSocket 网关自带 Web 仪表盘,可视化管理聊天、记忆、配置与定时任务;还支持 ACP 协议接入 IDE

    典型使用场景

    1. 7×24 小时私人 AI 管家:注册为系统服务常驻后台,你在 Telegram 上问它日程、在邮件里让它整理附件、在 Discord 里让它跑脚本——同一个大脑,全渠道待命,数据永不出你的服务器
    2. 智能家居 / 硬件自动化中枢:跑在树莓派上直控 GPIO 传感器与继电器,配合 SOP 引擎实现「温度超标→MQTT 触发→AI 判断→自动开风扇并通知你」这类带审批门的物理世界自动化
    3. 企业内网离线 AI 运维助手:搭配本地 Ollama 全离线部署,利用命令策略与 OS 级沙箱严格限权,工具回执提供完整审计链——在合规敏感环境中安全落地 AI 自动化

    推荐理由

    试用下来最大的感受是「克制而完整」。市面上的个人 AI 助手项目大多是 Python 全家桶+一堆依赖,而 ZeroClaw 是一个 Rust 单二进制,最小 6.6MB,装完即跑,树莓派上也轻松常驻。它的安全设计诚意十足:默认监督模式、OS 级沙箱、每个工具调用带密码学回执,这在同类项目中相当罕见——大多数 Agent 框架是「先跑起来再说」,它是「先关进笼子再放权」。多通道统一智能体循环的设计也很优雅:不是每个平台一个 Bot,而是一个智能体在所有渠道等你。如果你想要一个真正属于自己、数据不外流、还能摸到硬件的 AI 助手,这可能是目前最工程化的开源答案。MIT/Apache-2.0 双许可,商用无忧。注意:官方特别提醒有仿冒仓库/域名,认准唯一官方仓库 zeroclaw-labs/zeroclaw。

    下载地址

    项目数据:32,420+ Stars | 4,847 Forks | Rust | MIT OR Apache-2.0 双许可 | 创建于 2026 年 2 月

  • World Monitor:73K Stars 的开源「全球实时情报仪表盘」,AI 新闻聚合 + 地缘监控 + 金融雷达一屏搞定

    World Monitor:73K Stars 的开源「全球实时情报仪表盘」,AI 新闻聚合 + 地缘监控 + 金融雷达一屏搞定

    World Monitor 主仪表盘:3D 地球 + 多面板全球态势感知界面

    项目简介

    World Monitor 是一个开源的「实时全球情报仪表盘」——它把 500+ 精选新闻源、地缘政治事件、金融市场、大宗商品、航班、网络安全等 65+ 数据提供方聚合到一个统一的态势感知界面中,并用 AI 自动合成简报,支持完全本地化运行(Ollama,无需任何 API Key)。项目由开发者 Elie Habib 打造,目前在 GitHub 上已收获 73,000+ Stars,近日单日暴涨 3,000+ 星登顶 Trending 榜首,采用 AGPL-3.0 许可。

    安装要求和过程

    环境要求

    • Node.js 18+ 与 npm(Web 开发模式)
    • 可选:Ollama(本地 AI 摘要,无需云端 API Key)
    • 桌面版:直接下载 Windows (.exe) / macOS (Apple Silicon & Intel) / Linux (.AppImage) 安装包,零依赖

    快速安装(三分钟跑起来)

    # 1. 克隆仓库
    git clone https://github.com/koala73/worldmonitor.git
    cd worldmonitor
    
    # 2. 安装依赖并启动
    npm install
    npm run dev
    # 打开 http://localhost:3000,无需配置任何环境变量即可运行
    
    # 3. 想跑其他变体站点?
    npm run dev:tech       # 科技版
    npm run dev:finance    # 金融版
    npm run dev:commodity  # 大宗商品版
    npm run dev:energy     # 能源版

    命令行与 SDK 用户还可以直接:

    npx worldmonitor tools          # 免安装列出全部 MCP 工具
    npm install -g worldmonitor     # 安装 worldmonitor / wm 命令
    pip install worldmonitor-sdk    # Python SDK
    gem install worldmonitor        # Ruby SDK

    部署方面官方提供 Vercel、Docker、纯静态三种自托管方案,详见自托管指南

    核心功能

    World Monitor WebGL 平面地图(deck.gl),56 种地图图层

    • 500+ 新闻源 AI 简报:横跨 15 个类别的精选信息流,由 AI 自动去重、聚类并合成态势简报,支持 25 种语言(含 RTL 排版)与本地语种信息源。
    • 双地图引擎 + 56 种图层:globe.gl 3D 地球与 deck.gl WebGL 平面地图随意切换,叠加军事、灾害、航班(ADS-B)、基础设施、网络攻击等 56 类图层。
    • 跨信号关联与国家不稳定指数(CII v8):军事、经济、灾害、升级信号交叉关联,对 31 个一级国家做服务端权威压力评分,把「新闻」变成「预警」。
    • 金融雷达:覆盖 29 家证券交易所、大宗商品与加密货币,内置 7 信号市场综合指标,金融版变体开箱即用。
    • 本地 AI + Agent 友好:全部 AI 功能可用 Ollama 本地跑;同时提供 MCP Server、REST API(OpenAPI 规范)、CLI 和 Python/Ruby/Go 三语言官方 SDK,一套代码还能构建 6 个变体站点和 Tauri 2 原生桌面应用。

    典型使用场景

    1. 个人「全球情报中心」:替代十几个新闻 App 和推特列表,一屏看完地缘政治、突发灾害、市场异动,AI 简报直接给结论,配合桌面版常驻第二屏幕。
    2. 投研/宏观分析辅助:金融版聚合全球股指、商品、加密行情与新闻信号关联,CII 国家风险评分可作为宏观风险监控的免费开源替代。
    3. AI Agent 的实时世界数据源:通过 MCP Server(worldmonitor.app/mcp)或 SDK,让 Claude、自建 Agent 直接调用「某国当前风险评分」「最新升级信号」等工具,为智能体注入实时地缘与市场感知能力。

    推荐理由

    我把 World Monitor 挂在副屏跑了一天,感受是:这大概是开源界最接近「彭博终端 + 战情室」体验的项目。最打动我的有三点:一是信息密度与工程质量惊人——281 个 Protobuf 契约、60+ Vercel Edge Functions、三级缓存,纯 TypeScript 写出来的性能相当扎实;二是本地优先的 AI 设计,接上 Ollama 就能全功能离线跑,不用交出任何 API Key;三是对 Agent 生态的拥抱,MCP + OpenAPI + 三语言 SDK + llms.txt 一应俱全,拿它当智能体的「世界感知层」非常顺手。需要注意的是 AGPL-3.0 许可,商用集成到闭源产品前要评估合规或购买商业授权。如果你关注全球局势、做宏观投研,或者想给自己的 AI Agent 加上实时世界数据,这个项目值得一颗星。

    下载地址

  • Outlines:15K Star 的 LLM 结构化输出库,让大模型 100% 生成合法 JSON

    Outlines:15K Star 的 LLM 结构化输出库,让大模型 100% 生成合法 JSON

    Outlines - LLM 结构化输出库

    项目简介

    Outlines 是由 .txt(dottxt)团队开源的 LLM 结构化输出(Structured Outputs)库——它在生成阶段就保证大模型输出严格符合你指定的类型或结构(枚举、整数、Pydantic 模型、JSON Schema、正则、上下文无关文法),从根源上消灭”解析失败、JSON 残缺”问题。项目在 GitHub 上已收获 15,200+ Stars,被 NVIDIA、Cohere、HuggingFace、vLLM 等信任并采用,vLLM 的 Structured Output 后端正是基于它的 outlines-core。

    一句话:别再用正则和 try/except 去”修补”模型输出了——Outlines 让模型从一开始就只能生成合法结构:model(prompt, output_type)

    安装要求和过程

    环境要求

    • Python 3.9+(建议 3.10 以上)
    • 按需选择后端:本地推理需 transformers / llama.cpp(配相应硬件),或走 vLLM / Ollama 服务端,或直接用 OpenAI / Gemini API(无本地算力要求)
    • 操作系统不限,CPU 也能跑(配合 API 或 Ollama)

    快速安装

    pip install outlines

    # 基础安装
    pip install outlines
    
    # 按后端安装可选依赖(示例)
    pip install outlines[transformers]   # 本地 transformers 模型
    pip install outlines[vllm]           # vLLM 服务
    pip install outlines[openai]         # OpenAI API

    30 秒上手

    import outlines
    from typing import Literal
    from transformers import AutoTokenizer, AutoModelForCausalLM
    
    MODEL = "microsoft/Phi-3-mini-4k-instruct"
    model = outlines.from_transformers(
        AutoModelForCausalLM.from_pretrained(MODEL, device_map="auto"),
        AutoTokenizer.from_pretrained(MODEL),
    )
    
    # 情感分类:输出只可能是这三个值之一
    sentiment = model(
        "Analyze: 'This product completely changed my life!'",
        Literal["Positive", "Negative", "Neutral"],
    )
    print(sentiment)  # "Positive"
    
    # 提取数值:保证返回合法 int
    temperature = model("What's the boiling point of water in Celsius?", int)
    print(temperature)  # 100

    核心功能

    Outlines 使用哲学:指定类型即可

    1. 类型即约束,贴合 Python 类型系统Literal 做多选一、int/float 做数值、Pydantic 模型/JSON Schema 做复杂对象、正则约束字符串格式、CFG 文法约束复杂语法——一行 model(prompt, type) 全部搞定。
    2. 生成期保证合法,而非事后修补:基于约束解码(constrained decoding),在每个 token 采样时就屏蔽非法选项,输出 100% 可被 model_validate_json 解析,不存在破损 JSON。
    3. 一套代码横跨所有模型:统一接口支持 transformers、llama.cpp(本地),vLLM、Ollama(服务端),OpenAI、Gemini(API),换模型/换供应商不改业务代码。
    4. 函数签名即 Schema 的 Function Calling:把 Python 函数直接当输出类型传入,Outlines 自动从签名推断结构,返回可直接 **kwargs 调用的参数字典。
    5. Jinja 提示词模板与可复用应用outlines.Template 把复杂 Prompt 从代码中分离,支持 few-shot 模板文件复用,方便工程化管理。

    典型使用场景

    1. 客服工单自动分诊

    把自由格式的用户来信一步解析为结构化工单(优先级枚举 / 类别 / 是否需主管介入 / 行动项列表),直接驱动自动路由与升级告警——priority 字段只可能是 low/medium/high/urgent 四个合法值,下游逻辑零防御代码。

    2. 电商商品自动归类与信息抽取

    批量把商品描述转成 主类目/子类目/属性列表/品牌 结构化数据,喂给库存和搜索系统;同理可做文档分类(财报/合同/技术文档)、事件信息抽取,甚至用 Union 类型优雅处理”信息不足则返回 I don’t know”的兜底。

    3. 生产级 Agent / RAG 管道的可靠胶水层

    Agent 的工具调用参数、RAG 的引用格式、多步工作流的中间态,全部用 Pydantic 模型锁死结构。vLLM 等推理引擎已内置其核心库,本地部署大模型时开启结构化输出几乎零成本。

    推荐理由

    使用 Outlines 的公司

    • 解决的是 LLM 工程化第一痛点:任何把 LLM 输出接入程序的人都被破损 JSON 折磨过。Outlines 的思路是”让非法输出根本不可能被生成”,比重试+修复的方案优雅一个量级。
    • 学习成本极低:会写 Python 类型注解就会用,10 分钟能跑通第一个例子;README 附 6 个可直接抄的生产级示例。
    • 学术与工业双背书:源自论文《Efficient Guided Generation for Large Language Models》,NVIDIA、HuggingFace、vLLM、Cohere 都在用,不是玩具项目。
    • Apache-2.0 宽松许可:商用无忧;核心 outlines-core 用 Rust 重写,约束编译速度快,生产可用。
    • 实测感受:约束解码对本地小模型提升尤其明显——Phi-3 这类 3B 级模型配合 Outlines 做分类/抽取,可靠性直逼裸用大一个数量级的模型,非常适合降本场景。

    下载地址


    项目信息(截至 2026-07-23):15,256 Stars · 809 Forks · Python · Apache-2.0 许可 · 由 .txt(dottxt-ai)团队维护

  • Open WebUI:自托管、可离线运行的 AI 聊天与智能体平台

    Open WebUI:自托管、可离线运行的 AI 聊天与智能体平台

    Open WebUI 界面演示

    项目简介

    Open WebUI 是一个功能丰富、可完全离线运行的自托管 AI 平台,支持 Ollama 本地模型与 OpenAI 兼容 API,内置 RAG 检索增强、多模型对话、语音/视频通话、智能体与插件生态,是把任意大模型变成”私有 ChatGPT”的一站式前端。(GitHub ⭐ 145K+,Python,Open WebUI License)

    安装要求和过程

    环境要求:Python 3.11(pip 方式);或 Docker 20.10+(容器方式);可搭配 Ollama 本地推理,或任意 OpenAI 兼容 API Key。

    方式一 · pip 安装(最简):

    pip install open-webui
    open-webui serve   # 访问 http://localhost:8080

    方式二 · Docker 一条命令(自带 Ollama,CPU):

    docker run -d -p 3000:8080   -v ollama:/root/.ollama -v open-webui:/app/backend/data   --name open-webui --restart always   ghcr.io/open-webui/open-webui:ollama

    方式三 · 仅用 OpenAI API:

    docker run -d -p 3000:8080   -e OPENAI_API_KEY=your_secret_key   -v open-webui:/app/backend/data   --name open-webui --restart always   ghcr.io/open-webui/open-webui:main

    部署后访问 http://localhost:3000 即可使用;也支持 Docker Compose、Kubernetes(Helm/Kustomize)与 uv 安装。

    核心功能

    • 广泛的模型与 API 接入:本地 Ollama + 任意 OpenAI 兼容后端(LM Studio、Groq、OpenRouter、vLLM、Mistral 等),支持多模型并行对话、各取所长。
    • 本地 RAG 知识库:支持 9 种向量数据库与多种文档解析引擎(Tika、Docling、Mistral OCR 等),混合检索(BM25+向量)+ 重排,用 # 命令把文档/网页直接拉进对话。
    • 智能体与插件生态:Filters / Actions / Pipes / Tools / Skills 插件机制,可接 MCP、OpenAPI 工具服务器,把任意基础模型包装成专属 Agent。
    • 语音/视频通话与多模态:本地 Whisper 等 STT + 多种 TTS 引擎,内置 DALL·E / Gemini / ComfyUI 图像生成与编辑,支持网页浏览与联网搜索。
    • 企业级管理与安全:细粒度 RBAC 与用户组、LDAP / SSO / SCIM 自动配置、PostgreSQL 持久化、横向扩展与 OpenTelemetry 可观测性。

    典型使用场景

    • 个人本地 AI 助手:用 Ollama 在笔记本上跑 Llama / Mistral,全程离线、数据不出本机,配合 RAG 问答私人文档。
    • 团队自托管 AI 中台:公司内部署,接入 OpenAI 或自建 vLLM,统一账号、权限与用量审计,替代公网 SaaS,守住数据隐私。
    • 知识库问答与自动化:把 Confluence / Notion / 本地文件建索引,用智能体 + 定时自动化做日报生成、资料检索与多模型 A/B 评估。

    推荐理由

    我把 Open WebUI 当作”私有 ChatGPT 的标杆”。它最打动我的是真正的离线优先与自托管能力——所有聊天与文档数据都留在自己的机器或服务器,不依赖任何云。RAG 开箱即用,多模型对比、语音通话、插件生态一应俱全,Docker 一条命令就能跑起来,对不想把对话记录交给第三方的用户极其友好。社区极其活跃、更新频繁,是个人和中小团队落地 AI 的最低门槛选择。

    下载地址

  • 把大模型塞进自己电脑:Ollama 融了 6500 万美元,月活开发者逼近 900 万

    把大模型塞进自己电脑:Ollama 融了 6500 万美元,月活开发者逼近 900 万

    Ollama 两位创始人 Jeff Morgan(左)与 Michael Chiang(右)
    Ollama 两位创始人 Jeff Morgan(左)与 Michael Chiang(右)。图源:TechCrunch / David Paul Morris

    你有没有过这种经历——想在自己电脑上跑一个开源大模型,结果被环境配置、CUDA 版本、一堆依赖冲突搞得头大,最后默默关掉终端,回去用别人的 API。Ollama 想解决的就是这件烦心事。这家 2023 年成立的开源工具公司,刚宣布完成 6500 万美元 B 轮融资,由 Theory Ventures 领投;加上之前 Benchmark 合伙人 Peter Fenton 牵头的 1500 万美元 A 轮,Ollama 累计融资已经到了 8800 万美元。

    创始人 Jeff Morgan 和 Michael Chiang 其实不是第一次干这种“让开发者少踩坑”的活。两人早年在 Docker 待过,参与打造了后来几乎每个程序员都用过的 Docker Desktop——你在本地写的容器,能丝滑地搬到云上,中间那些烦人的硬件配置全被它藏了起来。用 Morgan 自己的话说,Ollama 对 AI 干的事,差不多就是 Docker 当年对云计算干的事:把在电脑上跑开源模型这件事,从“研究员的专利”变成“普通程序员几分钟就能上手”。

    14 个人,撑起 85% 的财富 500 强

    这件事为什么突然变得值钱了?Morgan 把转折点放在了今年一月。那时候 OpenClaw 这类开源智能体突然火起来,大家发现大模型不只是能聊天,还能真刀真枪地写代码、跑任务。开源模型第一次让人觉得“它能干正活了”。从那以后,一个判断开始在圈子里蔓延:那些天天烧推理费的公司,迟早要把一部分活儿挪到更便宜的开源模型上,把闭源模型(比如 Anthropic)留着应付真正要紧的场景。

    最夸张的是团队规模。Ollama 现在每月有超过 890 万开发者在用,进了 85% 的财富 500 强公司,而公司全职员工只有 14 个人。GitHub 上 17.6 万 star、近 1.7 万 fork,在开发者工具里算得上现象级。Fenton 当初就是看中这俩人在 Docker 攒下的“让产品渗透到每个开发者”的本事,才决定继续下注。

    “开源和闭源不是二选一,两边都有大把生意可做。但凡是推理成本高到肉疼的公司,都有一个‘必须迁到开放权重模型’的生死项目。”Fenton 说。

    Ollama 赚钱的路子也不复杂:免费桌面版照常让你发现、运行本地模型;更大的模型它放到自己的 neocloud 上,按 GPU 时长收费,套餐从免费到每月 100 美元。那些最先进的大模型往往太大、你自己的电脑跑不动,Ollama 就帮你找算力——Morgan 把这看成开源使命的自然延伸,而不是背叛。

    “被圈钱”的质疑声

    当然,不是所有老用户都买账。大概一年前,一批博客和社交平台帖子就开始抱怨,说 Ollama 搞起了云服务、开始琢磨赚钱,背离了那个大家白嫖的开源项目,甚至有人把它列为开发工具“逐步变质”的典型。Fenton 的回应很直接:桌面端那个免费核心产品一点没变,你发现、运行本地模型的地方还是老样子。


    抛开争议不谈,Ollama 更像一个信号:AI 正在批量催生新的开源项目,而这些项目又一个个变成了风投抢着投的公司。做推理服务的 Inferact(vLLM 背后那家)、RadixArk(SGLang),做智能体的 OpenClaw、NanoClaw,甚至从零训自己模型的 Arcee……这条赛道上,Ollama 只是跑在最前面的那一个。

  • 14个人服务890万开发者:Ollama拿下6500万美元B轮,押注开源模型随处跑

    先说个数字:14个人,撑起890万开发者每月都在用的工具。这不是哪家巨头的内部团队,而是开源AI工具Ollama的全部家当。就在这周,这家公司拿到了6500万美元的B轮融资,领投方是Theory Ventures。

    Ollama开源AI工具融资示意图
    Ollama让开源模型在任何地方都能跑起来

    算上之前Benchmark领投的1500万美元A轮,Ollama目前累计融资8800万美元。当年领投A轮的Peter Fenton这次也进了董事会。创始人兼CEO的Jeff Morgan把话说得很直白:开源模型就该好跑、好用、随处可用——你自己的电脑上、云端,或者两头都用。

    从Docker到开源模型,这俩人干的是同一件事

    Ollama是2023年上线的,干的活很简单:帮开发者在自己的PC上跑开源权重模型,几分钟就能装好用起来。GitHub上攒了17.6万颗星、近1.7万个fork,各种教程、视频、博客里都在夸它。

    这种”把复杂的东西变简单”的路数,Morgan和联合创始人Michael Chiang早就玩过一遍。他们之前做的Kitematic被Docker收购,两人随后帮着做出了Docker Desktop——那个如今每天有一千多万开发者在用的工具。Docker当年把云应用从繁琐的硬件配置里解放出来,Ollama现在对开源AI做的是同一件事。

    “2023年开源模型开始冒出来,但真的很难用。它们当时是给研究员准备的,不是给程序员的,想跑起来特别费劲。”——Jeff Morgan

    免费工具怎么变成生意

    现在Ollama每月有890万开发者在用,比今年1月翻了差不多一倍,每周还新增将近100万次安装,社区做出来的集成超过6.7万个,覆盖了《财富》500强里85%的公司,连医疗、金融、政府这些强监管行业都在用。而这一切,团队只有14个人。

    光靠免费的本地工具当然赚不了钱。Ollama的商业化藏在云端:本地机器扛不住更大的模型时,可以直接切到它的云上跑,同一套操作,按GPU时长计费而不是按token。这套逻辑跟主流按token收费的做法明显不一样。

    • 免费版:本地运行 + 一定的云端GPU时长
    • Pro版:每月20美元,可同时跑3个云端模型,云用量是免费版的50倍
    • Max版:每月100美元,可同时跑10个云端模型

    Morgan说,Ollama作为一门生意的转折点大概在今年1月,OpenClaw火起来那阵子——更大的开源模型突然能干agentic的活了,比如写代码。这也踩中了整个行业的大趋势:据Grand View Research,AI推理市场2024年约970亿美元,到2030年预计冲到2540亿美元,年复合增速约17.5%。随着Meta、Mistral、DeepSeek这些开源模型和闭源系统的差距越缩越小,越来越多的钱正流向”开发者选择在哪里跑模型”这件事上,而这正是Ollama想占的位置。


    当然,这条赛道并不空。Hugging Face融了超过3.95亿美元,主要做模型仓库;Together AI最近以83亿美元估值拿了8亿美元,扩云端训练和推理。Ollama和Morgan都没透露这轮的估值和收入。但14个人对890万开发者这个比例本身,可能才是这轮融资背后最值得琢磨的故事。

  • Ollama 又融了 6500 万美元:让开发者在自己电脑上跑大模型,这门生意成了

    在个人电脑上运行开源大模型的 Ollama
    在个人电脑上跑开源大模型,Ollama 想做成 AI 时代的「Docker」

    Ollama 这家公司的名字,做 AI 开发的人基本都听过,圈外知道的不多。最近它宣布完成 6500 万美元的 B 轮融资,领投方是 Theory Ventures。加上之前 Benchmark 的 Peter Fenton 领投的 1500 万 A 轮,这家公司前后总共融了 8800 万美元。

    从 Docker 出来的团队,给 AI 干了件类似的事

    Ollama 在 2023 年上线,做的事情其实很朴素:让开发者在自己的电脑上,几分钟就把开源大模型跑起来。它在 GitHub 上攒了 17.6 万颗 star、将近 1.7 万个 fork,被无数教程、视频和博客拿来当范例。

    创始人 Jeff Morgan 和 Michael Chiang 之前都在 Docker 干过,做过 Docker Desktop,后来公司被 Docker 收购。所以 Ollama 对 AI 模型干的事,基本就是 Docker 当年对云计算干的事——把那些麻烦的硬件配置、环境差异全给你屏蔽掉,开发者只管跑。

    「2023 年开源模型就出来了,但那时候真的很难用,都是给研究人员准备的,不是给程序员用的。想把它们跑起来特别费劲。」Morgan 说。

    近 900 万月活,团队却只有 14 个人

    上线三年,Ollama 现在每个月有 890 万开发者在用,85% 的财富 500 强公司都在用,而背后撑起这一切的团队,只有 14 个人。它能长到这么快,靠的就是「在本地电脑上更顺手地搭 AI」这件事本身的需求。

    商业模式上,桌面免费版一点没变,赚钱靠的是云端订阅,从免费到每月 100 美元分几档,按 GPU 时长而不是 token 计费。那些太大、在自己电脑上跑不动的开源模型,Ollama 就帮你在它的云上找算力跑。

    企业开始认真考虑「用便宜的,留贵的」

    Morgan 把 Ollama 真正像个生意跑起来,归因于今年 1 月 OpenClaw 爆火。那之后,开源模型突然能做 agentic 任务了,比如写代码,企业开始认真琢磨:是不是能把日常活儿交给更便宜的开源模型,只在必要时才掏钱用 Anthropic 那种闭源模型。

    Fenton 的观点是,开源和闭源不是二选一,两边都有的赚。但他也点出一个现实:凡是推理成本高、也就是用模型烧钱烧得狠的公司,都有一股「生存级」的动力往开源权重模型上搬。


    免费的还免费,但「开发工具堕落」的骂声已经有了

    不是所有粉丝都买账。大概一年前,就有一批博客和论坛帖子吐槽 Ollama 的云服务,说它把精力从心爱的免费项目上挪走,把这股风气叫「开发工具的 enshittification(逐渐变烂)」。

    Morgan 不这么看,他说云端是开源使命的延伸——那些顶尖的大模型你自家电脑跑不动,「那我们就帮你把算力找来」。Fenton 也补了一句:桌面上的免费核心产品,前提一点没变,该发现模型、该跑本地模型,还是那个地方。

    不管争议怎么走,Ollama 都算是 AI 催生出来的那一拨「开源项目长成公司」里的最新样本。和它差不多的还有做推理的 Inferact(vLLM)、RadixArk(SGLang),以及从零训自己开源模型的 Arcee。AI 这波浪潮,正在把一批本来免费的工具,一点点变成正经生意。

  • CodeGeeX4:清华大学出品的9B全能代码模型,性能超越70B级大模型

    CodeGeeX4:清华大学出品的9B全能代码模型,性能超越70B级大模型

    CodeGeeX4
    清华大学 KEG 实验室 × 智谱 AI 联合出品
    ALL-9B 全能模型 · 代码生成 · Function Call · 仓库级理解
    ⭐ 最新一代
    🚀 9B 超越 70B
    🏆 BigCodeBench SOTA

    📝 项目简介

    CodeGeeX4 是清华大学 KEG 实验室与智谱 AI 联合推出的第四代多语言代码生成模型,基于 GLM-4-9B 持续训练,在代码生成、代码解释、Web 搜索、Function Call、仓库级 Q&A 等全场景软件开发生命周期中均提供卓越表现。仅 9B 参数即超越 Llama3-70B、DeepSeekCoder-33B 等超大模型,是当前 10B 以下参数规模中综合性能最强的代码模型。

    9B
    模型参数

    82.3%
    HumanEval Pass@1

    128K
    上下文长度

    ⭐ 30K+
    GitHub Stars

    ⚙️ 安装要求和过程

    💻 环境要求

    • Python 3.10+(推荐 3.11)
    • CUDA 12.1+(GPU 推理)
    • PyTorch 2.0+ 或 vLLM 0.5.1+
    • 内存:FP16 推理约 18GB,INT4 量化约 6GB
    • 操作系统:Windows / macOS / Linux 全平台支持

    🚀 快速安装(Ollama — 最简单)

    # 安装 Ollama(需 0.2+ 版本)
    # macOS/Linux:
    curl -fsSL https://ollama.com/install.sh | sh
    
    # Windows: 从 https://ollama.com/download 下载安装
    
    # 一键运行 CodeGeeX4
    ollama run codegeex4

    🐍 使用 transformers 推理

    pip install transformers==4.40.0 torch
    
    from transformers import AutoTokenizer, AutoModelForCausalLM
    import torch
    
    model = AutoModelForCausalLM.from_pretrained(
        "THUDM/codegeex4-all-9b",
        torch_dtype=torch.bfloat16,
        trust_remote_code=True
    ).cuda().eval()
    tokenizer = AutoTokenizer.from_pretrained(
        "THUDM/codegeex4-all-9b",
        trust_remote_code=True
    )
    
    # 对话格式
    prompt = [{"role":"user","content":"写一个快速排序"}]
    inputs = tokenizer.apply_chat_template(prompt, add_generation_prompt=True, return_tensors="pt").cuda()
    outputs = model.generate(inputs, max_new_tokens=256)
    print(tokenizer.decode(outputs[0], skip_special_tokens=True))

    ⚡ vLLM 高性能部署

    pip install vllm==0.5.1
    
    # 启动 OpenAI 兼容 API 服务
    python -m vllm.entrypoints.openai.api_server     --model THUDM/codegeex4-all-9b     --trust-remote-code     --tensor-parallel-size 1
    
    # 然后即可用 OpenAI SDK 调用
    # pip install openai
    # client = OpenAI(base_url="http://localhost:8000/v1", api_key="dummy")

    ✨ 核心功能

    💬 全场景代码助手
    支持代码补全、代码生成、代码解释、代码翻译、文档生成、Bug 修复等全场景,基于 ChatGLM2/GLM-4 架构,中英文理解能力优异。

    🔧 Function Call 原生支持
    唯一原生支持 Function Call 的代码模型,Function Call 执行成功率甚至超越 GPT-4。可无缝接入 AI Agent 工具调用链路。

    📦 仓库级代码理解
    支持 128K 超长上下文,可理解整个代码仓库。支持仓库级 Q&A、跨文件代码补全、自动 commit 等高级功能。

    🌐 多平台部署
    支持 Ollama / vLLM / transformers / Rust-candle 多种推理后端;支持 VS Code、JetBrains 全系列 IDE 插件;支持本地 / 云端双模式。

    🏆 性能全面领先(10B 以下模型)
    HumanEval 82.3% · MBPP 75.7% · NaturalCodeBench 40.4% · BigCodeBench 48.9%(complete)/ 40.4%(instruct)· CRUXEval-O 47.1%。在代码推理、代码理解、代码执行等全方位评测中均取得 10B 以下模型最佳成绩。

    🎯 典型使用场景

    场景一:IDE 智能编程助手(最适合日常使用)

    在 VS Code 或 JetBrains IDE 中安装 CodeGeeX 插件,即可体验:

    • 代码补全:根据上下文自动补全下一行 / 下一个函数
    • 上下文补全:基于仓库内其他文件提供跨文件补全建议
    • Ask CodeGeeX:中英文对话解决编程问题,支持代码解释、翻译、纠错
    • 本地模式:连接本地 Ollama 运行的 CodeGeeX4,数据完全不出本地

    💡 支持超过 100 种编程语言!

    场景二:AI Agent Function Call 工具

    CodeGeeX4 原生支持 Function Call,可以:

    • 作为 AI Agent 的代码生成工具,解析自然语言需求生成代码
    • 接入 OpenAI 兼容 API,与 LangChain / AutoGen 等 Agent 框架无缝集成
    • 支持仓库级代码操作(增删改文件),实现 AI 自动 commit
    • 结合 vLLM 部署,支持多并发、高吞吐的生产环境调用

    场景三:本地私有化部署(数据安全敏感场景)

    对于数据隐私有严格要求的企业 / 个人,CodeGeeX4 提供完善的本地部署方案:

    • 通过 Ollama 一行命令启动,INT4 量化仅需 6GB 显存
    • 支持连接 VS Code / JetBrains 插件,体验与云端一致
    • 支持昇腾 / NVIDIA 全系列硬件,包括国产 AI 芯片
    • 代码和数据完全不离开本地,满足企业合规要求

    💡 推荐理由

    作为 AI 编程工具的深度用户,我试用过 GitHub Copilot、Claude Code、Cursor 等各类产品,CodeGeeX4 给我留下了极其深刻的印象:

    ① 性价比无敌:9B 参数的小模型,性能直接干翻 70B 的 Llama3 和 33B 的 DeepSeekCoder。这意味着你用消费级显卡(甚至 6GB 显存的 RTX 3060)就能跑一个世界级代码模型。

    ② Function Call 是杀手锏:在 AI Agent 时代,代码模型不能只做补全,还要能调用工具。CodeGeeX4 是唯一原生支持 Function Call 的开源代码模型,而且执行成功率比 GPT-4 还高。这对构建 AI 编程 Agent 来说是个游戏规则改变者。

    ③ 清华大学 + 智谱 AI 双背书:KEG 实验室(唐杰教授团队)在 NLP 和代码生成领域深耕多年,CodeGeeX 系列从 2022 年做到 2026 年,四代演进,成熟度远超同类竞品。智谱 AI 的 GLM 架构也在持续迭代优化。

    ④ 真正可用的 IDE 插件:很多开源模型只提供权重,没有好的用户体验。CodeGeeX 的 VS Code / JetBrains 插件做得相当完善,上下文补全、跨文件理解、Ask CodeGeeX 对话,体验不输商业产品。

    如果你在找一个能本地部署、性能好、中文友好的 AI 编程助手,CodeGeeX4 是目前唯一的最优解

    📊 性能对比(10B 以下模型)

    模型 参数 HumanEval MBPP NCB Function Call
    CodeGeeX4-ALL-9B 9B 82.3% 75.7% 40.4% ✅ 超越GPT-4
    Llama3-70B-Instruct 70B 77.4% 82.3% 37.0%
    DeepSeekCoder-33B 33B 81.1% 80.4% 39.3%
    Codestral-22B 22B 81.1% 78.2% 46.0%

    数据来源:CodeGeeX4 官方 README,NCB = NaturalCodeBench

    📚 CodeGeeX 系列演进

    CodeGeeX(第一代,2022)
    13B 参数,基于华为昇腾芯片训练,在 20+ 编程语言上预训练。配套开源 HumanEval-X 多语言评测基准。Apache-2.0 开源。

    CodeGeeX2(第二代,2023)
    基于 ChatGLM2-6B,6B 参数即超越 15B 的 StarCoder。支持 8192 序列长度,量化后仅需 6GB 显存。HumanEval-X 全面提升(+57%~+321%)。

    CodeGeeX4(第四代,2024)
    基于 GLM-4-9B,9B 参数全能模型。支持 Function Call、仓库级 Q&A、128K 上下文。BigCodeBench / NaturalCodeBench / CRUXEval 全基准 SOTA。Apache-2.0 开源。

    由自动化任务发布 · GitHub 热门 AI 开源项目系列 · 清华大学 KEG 实验室 × 智谱 AI
  • Ollama — 本地大模型运行首选工具,165K+ Stars 的本地 LLM 神器

    Ollama — 本地大模型运行首选工具,165K+ Stars 的本地 LLM 神器

    Ollama - Get up and running with LLMs

    ⚡ GitHub 热门 AI 开源项目

    Ollama

    在本地一键运行 Llama 3、DeepSeek、Qwen、Gemma 等开源大语言模型,无需云端,隐私优先

    165K+ Stars
    📥 40K+ 社区集成
    🦙 Go + C++
    📜 MIT 开源协议

    📌 项目简介

    Ollama 是一款开源的本地大语言模型运行工具,让你在 macOS、Windows、Linux 上轻松下载、运行和管理各类开源 LLM。它内置了 llama.cpp 推理引擎,支持量化模型的高效运行,同时提供简洁的 CLI、REST API 以及 Python / JavaScript SDK,是本地 AI 开发的首选入口。

    🔧 安装要求和过程

    环境要求

    • 支持 macOS 11+、Windows 10+、Linux(x86_64 / ARM64)
    • 建议 8GB+ 内存(7B 模型);16GB+(13B 模型);32GB+(33B+ 模型)
    • 磁盘空间:每个模型约 4GB~20GB
    🍎 macOS

    brew install ollama

    或下载 Ollama.dmg 手动安装

    🪟 Windows
    下载 OllamaSetup.exe
    官网 ollama.com 直接下载安装包

    🐧 Linux

    curl -fsSL https://ollama.com/install.sh | sh

    🐳 Docker

    docker run ollama/ollama

    ⚡ 快速开始

    1. 安装完成后,终端运行 ollama serve 启动服务(默认 11434 端口)
    2. 运行 ollama run deepseek-r1 拉取并启动 DeepSeek-R1 模型
    3. 直接在终端对话,或访问 http://localhost:11434 调用 REST API

    🚀 核心功能

    ① 一键运行海量开源模型

    内置模型库(ollama.com/library)涵盖 Llama 3、DeepSeek-R1、Qwen2.5、Gemma、Mistral、Phi-3 等数百个模型,一条命令即可拉取运行。支持自定义 Modelfile 导入 GGML / GGUF 格式模型。

    ② 完整的 REST API 与 SDK

    默认在 11434 端口提供 OpenAI 兼容的 REST API,官方提供 Python 和 JavaScript SDK。可以无缝接入 LangChain、Lobe Chat、Open WebUI 等生态,开发者集成成本极低。

    ③ 多模型并行与 GPU 加速

    支持同时加载多个模型,自动检测并利用 NVIDIA / AMD GPU 进行推理加速。macOS 上原生支持 Metal GPU 加速,Linux 支持 CUDA 和 ROCm,推理速度大幅提升。

    ④ 丰富的生态集成

    社区已推出 40,000+ 个集成工具,涵盖桌面应用(Open WebUI、Enchanted)、IDE 插件(Continue、CopilotKit)、Agent 框架(LangChain、AutoGen)、RAG 工具(AnythingLLM)等,几乎覆盖所有 AI 开发场景。

    ⑤ 隐私优先,完全离线

    所有推理在本地执行,数据不出本机。无需注册、无需联网、无需付费 API Key,特别适合对数据隐私有严格要求的企业内网和个人开发者。

    💡 典型使用场景

    场景一:本地 AI 编程助手

    搭配 Continue.devVS Code Ollama 插件,在断网环境下也能使用本地 LLM 辅助代码补全、解释和重构。使用 DeepSeek-Coder 或 CodeLlama 模型,响应速度毫秒级,代码质量媲美云端模型。

    实战示例:运行 ollama run deepseek-coder:6.7b,然后在 Continue.dev 中配置 Ollama 为默认 Provider,即可在 VS Code 侧边栏直接对话编程。

    场景二:私有知识库 RAG 系统

    结合 AnythingLLMOpen WebUI,将企业内网文档、PDF、Markdown 文件作为知识库,通过 Ollama 本地推理实现零数据外泄的智能问答系统。金融、医疗、法律等敏感行业尤为适用。

    实战示例:Docker 部署 AnythingLLM,在设置中选择 Ollama 作为 LLM Provider,指定本地模型(如 Llama3:8b),然后上传内部文档即可开始私有问答。

    场景三:AI 应用本地开发测试

    在开发 AI 应用时,使用 Ollama 替代 OpenAI API 进行本地测试和迭代,无需消耗云端配额,也避免了敏感测试数据外传的风险。Ollama 的 API 与 OpenAI 高度兼容,切换成本极低。

    实战示例:在 .env 中设置 OPENAI_BASE_URL=http://localhost:11434/v1OPENAI_API_KEY=ollama,现有基于 OpenAI SDK 的代码几乎不用改动即可切换至本地模型。

    ✨ 推荐理由

    作为本地 LLM 领域的”Docker”,Ollama 几乎是所有 AI 开发者入门本地模型的第一站。它把复杂的模型量化、推理引擎配置、GPU 驱动适配等底层细节全部封装,真正做到了”一行命令运行大模型”。

    我个人最常用的场景是在无网环境下做代码审查和文档撰写——启动 DeepSeek-R1 本地模型,响应速度非常快,且完全不担心代码泄露。相比云端 API,本地运行的成本优势在长期使用中极为明显:一次性下载模型,后续零费用无限调用。

    另外值得一提的是 Ollama 的 REST API 与 OpenAI 高度兼容,这意味着你可以用同一套代码同时支持云端和本地模型,在开发阶段用本地模型省成本,上线时切换到 GPT-4 保质量,这种灵活性是其他本地 LLM 工具难以提供的。

    如果你还没试过在本地运行 LLM,Ollama 是最好的起点。165K Stars 和 40K+ 社区集成不是偶然——它真的好用。


      GitHub 热门 AI 开源项目系列