标签: Kimi

  • colibri:用纯 C 把 744B~2.8T MoE 大模型跑到本地

    colibri:用纯 C 把 744B~2.8T MoE 大模型跑到本地

    colibri 是近期 GitHub 上热度最高的本地推理引擎之一:只用纯 C 编写、零运行时依赖,就能把 744B 到 2.8T 参数的 MoE(混合专家)大模型跑在你现有的硬件上。它不是把模型硬塞进显存,而是把 VRAM、RAM 和 NVMe 当作同一层级来管理,按需从磁盘流式加载专家权重。项目上线一个月已收获 21.9K Stars,并支持 GLM-5.2、Inkling、Kimi K3、OLMoE 四大模型家族。

    本期我们就来拆解:colibri 是怎么让“本地运行千亿 MoE”这件事从神话变成可复现实验的。

    项目简介

    colibri 是一个面向前沿 MoE 模型的本地推理引擎。它用“存储即内存层级”的思路替代传统的“模型必须全进显存”假设:密集注意力层常驻 RAM,19456 个路由专家放在磁盘,只有在路由器真正需要时才被预取到 RAM/VRAM。这样一台只有 25 GB 内存的常规电脑也能把 744B 的 GLM-5.2 跑起来,而高端工作站则可以把全部专家驻留 GPU,达到接近数据中心的吞吐。

    配图速览

    colibri 核心速览
    colibri 核心数据一览
    三层存储层级
    colibri 把专家权重分布在 VRAM / RAM / NVMe 三个层级,速度随硬件变化,语义保持不变。

    安装要求和过程

    环境要求

    • 操作系统:Linux、macOS、Windows 11
    • 内存:最低 25 GB RAM(仅 CPU 流式);推荐 128 GB 或更高,配合多 GPU 可获得更好体验
    • 磁盘:GLM-5.2 int4 容器约 372 GB;Kimi K3 原始检查点约 1.6 TB
    • 软件:Python 3(仅用于 launcher 和转换脚本);编译源码需要 gcc/clang + OpenMP
    • GPU(可选):CUDA、Metal(Apple Silicon)、Vulkan 1.2(含 AMD RADV)后端均可选

    快速安装

    1. 下载对应平台的预编译 release 并解压:
    mkdir colibri && tar xzf colibri-v1.1.0-linux-x86_64.tar.gz -C colibri && cd colibri
    python3 coli info
    1. 或从源码构建:
    git clone https://github.com/JustVugg/colibri && cd colibri/c
    ./setup.sh
    1. 下载 GLM-5.2 int4 gs64 容器(推荐带 int8 MTP 头的版本):
    # 推荐从 Hugging Face 拉取 mastouri/GLM-5.2-colibri-int4-g64-with-int8-mtp
    # 约 372 GB,放 NVMe 上最佳
    1. 运行交互式聊天、API 服务或 Web 面板:
    COLI_MODEL=/nvme/glm52_i4 ./coli chat
    COLI_MODEL=/nvme/glm52_i4 ./coli serve    # OpenAI-compatible API
    ./coli web --model /nvme/glm52_i4          # API + 可视化 dashboard

    核心功能

    1. 存储即内存层级
      把 VRAM、RAM、NVMe 统一成专家权重的放置策略。缺显存不会悄悄改模型精度或路由语义,只会影响速度。
    2. 按需流式加载专家
      MoE 每层只激活少量专家。colibri 让 19456 个专家中的绝大部分常驻磁盘,通过 per-layer LRU、学习到的热专家 pinned set 和一层提前预取(PILOT)减少磁盘等待。
    3. 纯 C 零依赖引擎
      每个模型对应一个 C 文件(如 c/glm.c),无 BLAS、无运行时 Python、无 GPU 也能跑。
    4. 多后端异构执行
      支持 CPU、CUDA、Metal、Vulkan 四种后端,可组合使用;双 SSD 镜像可把只读专家读取带宽翻倍。
    5. 学习缓存与压缩状态
      引擎记录你的工作负载路由历史(.coli_usage),越用越快;MLA KV 状态压缩到原来的 1/57,并能持久化对话上下文。

    典型使用场景

    场景一:个人开发者跑前沿模型做实验

    你只有一台 64 GB RAM + 1 TB NVMe 的台式机。传统 vLLM/llama.cpp 会把 744B 模型拒之门外;colibri 让你用 COLI_MODEL=/nvme/glm52_i4 ./coli chat 直接对话,虽然 token/s 不高,但足以做提示工程、长文本探索和小批量评估。

    场景二:工作室搭建本地私有 API

    在多卡工作站(如 6× RTX 5090)上,把专家全部驻留 GPU,colibri 可提供 5.8–6.8 tok/s 的解码速度和 1.6 s 的 TTFT。通过 coli serve 提供 OpenAI-compatible API,内部团队就能在不联网的情况下调用千亿模型。

    场景三:MoE 推理系统研究

    colibri 把放置策略、调度、I/O、CPU/GPU 重叠都做成可测量的实验参数。研究者可以替换缓存策略、测试双 SSD 镜像、评估 int4/int8/MXFP4 格式对质量的影响,并把结果以 issue 形式回馈社区。

    推荐理由

    colibri 最打动我的不是“跑 744B 模型”这个噱头,而是它把“本地推理”重新定义为系统优化问题:不盲目堆硬件,而是认真测量每一个瓶颈——磁盘带宽、专家命中率、KV 压缩、CPU/GPU 重叠、量化质量——并用可复现的 A/B 来做决策。README 里反复出现的不是营销数字,而是“这个功能在哪台机器上、用什么 commit、跑什么 prompt 测出来的”。

    对于国内用户,它还有一个隐性好处:GLM-5.2、Kimi K3、Qwen3 MoE(roadmap)等模型天然和中国模型生态更近,未来可以更低成本地跑开源中文大模型。

    当然,它现在还是研究导向的项目:没有 SLA 保证速度,配置参数很多,对磁盘和内存仍有一定要求。但如果你既想摸到前沿模型,又不想把数据送出去,colibri 是 2026 年最值得关注的本地推理引擎之一。

    下载地址

  • Oh My OpenAgent:66.7K Stars 的 AI 编程智能体”满配套件”,一个词启动 11 个智能体并行开发

    Oh My OpenAgent:66.7K Stars 的 AI 编程智能体”满配套件”,一个词启动 11 个智能体并行开发

    Oh My OpenAgent

    项目简介

    Oh My OpenAgent(OmO)是韩国开发者 code-yeongyu 开源的「AI 编程智能体增强套件(Agent Harness)」——一句话概括:给 OpenCode / Codex CLI 装上一个”满配的 AI 开发团队”,装完只需输入 ultrawork 一个词,11 个专职智能体、54+ 生命周期钩子、5 个内置 MCP 就会自动协同,把复杂任务一路干到完成为止。项目目前已收获 66,693 Stars,甚至因为太火导致 Anthropic 封锁了 OpenCode 的 Claude 订阅接入——作者干脆转身拥抱多模型路由,主打”不要选赢家,要编排所有模型”。

    Oh My OpenAgent Team Mode 运行界面

    ▲ Team Mode 实战:Kimi K3 + GPT-5.6 Sol 多智能体并行工作

    安装要求和过程

    环境要求

    • Ultimate 版(OpenCode):需安装 Bun 与 OpenCode
    • Light 版(Codex CLI):仅需 Node.js/npm 环境,无需 Bun
    • 至少一个模型订阅或 API(推荐组合:ChatGPT $20 / Kimi Code $19 / GLM Coding $10,低成本即可跑满血)

    快速安装

    # Ultimate 版(OpenCode 完整体:11 智能体 + Team Mode + 全部功能)
    bunx oh-my-openagent install
    
    # Light 版(Codex CLI 插件:rules/LSP/ultrawork/ulw-loop 等便携组件)
    npx lazycodex-ai install
    # 非交互推荐模式
    npx lazycodex-ai install --no-tui --codex-autonomous
    
    # 两个都装
    bunx oh-my-openagent install --platform=both

    官方还推荐一种更省心的方式——直接把安装指南 URL 扔给任意 AI 助手(Claude Code、Cursor 等),让 AI 替你完成订阅检测、11 个智能体的模型匹配和各家 Provider 认证:

    Install and configure oh-my-openagent by following the instructions here:
    https://raw.githubusercontent.com/code-yeongyu/oh-my-openagent/refs/heads/dev/docs/guide/installation.md

    注意:npm 包与 CLI 命令仍叫 oh-my-opencode(更名过渡期双发布),但不要用 npx omo——那是另一个同名无关包。

    核心功能

    • ultrawork 一词流:输入 ultrawork(或 ulw)即激活全部智能体,配合 Todo Enforcer”偷懒检测”,智能体一旦闲置就被系统拽回来继续干,任务不完成不停手。
    • 纪律型智能体团队:主指挥 Sisyphus(Opus 5 / Kimi K3)负责规划与并行派活;深度工人 Hephaestus(GPT-5.6 Sol)端到端自主执行;规划师 Prometheus 以”面试模式”先访谈再出方案,另有 Oracle(架构/调试)、Librarian(文档检索)、Explore(快速扫码)各司其职。
    • Team Mode 多智能体系统(v4.0):Lead + 最多 8 个并行成员,tmux 实时可视化,衍生 hyperplan(5 个”敌对评审”轮番拆解你的方案)与 security-research(3 个漏洞猎手 + 2 个 PoC 工程师并行审计)两大技能。
    • Hashline 哈希锚定编辑:每行代码带内容哈希标签(11#VK|),编辑前校验、文件变了就拒绝写入,从根源消灭”stale line”错误——Grok Code Fast 1 的编辑成功率靠它从 6.7% 飙到 68.3%。
    • 按类别自动路由模型:子任务只声明类别(visual-engineering / deep / quick / ultrabrain),框架自动匹配最擅长的模型;同时完全兼容 Claude Code 的 hooks、commands、skills、MCP 与插件生态。

    典型使用场景

    • 大规模代码翻新:有用户用它一天清掉 8000 条 ESLint 警告;还有人一夜之间把 4.5 万行的 Tauri 桌面应用改造成 SaaS 网页应用——睡前下指令,醒来验收。
    • 多订阅省钱组合拳:不必为单一厂商付 $200/月,用 Kimi K3 + GPT-5.6 Sol 的平价组合即可超越原版 Claude Code 体验,模型按任务类别自动分工。
    • 方案评审与安全审计:写代码前先跑 hyperplan 让 5 个”杠精”智能体从不同角度挑刺;上线前用 security-research 让 5 个智能体并行做渗透式代码审计,按真实可利用性定级。

    推荐理由

    这是我见过”工程密度”最高的 Agent Harness 项目。它不是又一个 prompt 合集,而是把作者烧掉 2.4 万美元 token 试错换来的经验固化成了产品:Hashline 编辑工具解决的是所有编码智能体最痛的”改错行”问题;类别路由让”选模型”这件事彻底消失;Todo Enforcer 治好了 AI”干一半就摆烂”的顽疾。社区口碑也相当能打——”让我退订了 Cursor””用了就回不去了”。如果你已经在用 OpenCode 或 Codex CLI,这基本是无脑必装的存在;哪怕只是想围观多智能体协作的工程实践,读它的源码和文档也极有收获。唯一注意点:License 为 SUL-1.0(Sisyphus 使用许可),商用前建议先读一下条款,且默认开启匿名遥测(可通过 OMO_DISABLE_POSTHOG=1 关闭)。

    下载地址

    项目数据:66,693 Stars | 语言:TypeScript | License:SUL-1.0 | 最近更新:2026-07-28

  • 月之暗面 Kimi K3 即将发布:2-3 万亿参数,追平 Anthropic Opus 4.8

    Moonshot Kimi 大模型
    月之暗面(Moonshot AI)旗下 Kimi 系列(图源:TechCrunch / Getty Images)

    中国大模型公司月之暗面(Moonshot AI)的下一代 Kimi 模型 K3,据《金融时报》援引匿名信源,性能预计能和 Anthropic 的 Opus 4.8 打平甚至超过。如果成真,这会是迄今中国对外发布的最大开放权重模型。

    从 K2 到 K3,差距在肉眼可见地缩小

    Kimi 的 K2 系列在开源圈口碑不错,benchmark 排得上号,离最前沿的闭源模型也没差太远。K3 要走得更远——FT 说它的参数规模在 2 万亿到 3 万亿之间,会在”未来几天”放出。对一个一直被拿来和 GPT、Claude 比的中国实验室来说,这是第一次真正站到同一起跑线附近。

    估值跟着水涨船高

    趁着这股势头,Moonshot 正在新一轮融资,估值据称冲到 315 亿美元。今年五月它刚以 200 亿估值拿了 20 亿美元——不到两个月,账面上就多了一百多亿。资本用脚投票,显然相信”中国开源模型能追平前沿”这件事不是空话。

    企业要么买自己的开源模型(比如 DeepSeek、Z.ai 或 Moonshot 的),按自己的需求训一遍;要么就继续给闭源实验室交那份越来越贵的租子。

    大背景:大家开始怀疑”租 AI”值不值

    K3 的消息,撞上了一场正热的讨论——花大价钱买 OpenAI、Anthropic 的闭源模型到底值不值。纳德拉那句”付两遍钱”的警告还在发酵,行业里不少人担心,你喂给 ChatGPT、Claude 的数据,最后会被实验室悄悄吸进自家模型里。于是一些高管开始推自己的替代方案,或者干脆建议企业用便宜的开源模型,自己训练来用。


    开放权重这条路,中国走得最坚决

    Kimi K3 如果按 FT 说的规模落地,会成为迄今最大的中国开放权重模型。这背后是同一股潮流:当算力被少数闭源巨头攥着,开放权重给了企业一条不用仰人鼻息的路。月之暗面的打法很清晰——用越来越能打的开源模型,把”生产环境里真正跑业务”的那块蛋糕从闭源手里切下来。

    当然,FT 的消息来自匿名信源,参数和发布时间都还没官宣。但方向已经清楚:中国大模型和美国前沿之间的那道缝,正在被 Kimi 这样的模型一点点焊上。对用得起、也想自己掌控数据的企业来说,这比又一场”谁的参数更多”的军备竞赛更有看头。