标签: 开源项目(栏目)

  • colibri:用纯 C 把 744B~2.8T MoE 大模型跑到本地

    colibri:用纯 C 把 744B~2.8T MoE 大模型跑到本地

    colibri 是近期 GitHub 上热度最高的本地推理引擎之一:只用纯 C 编写、零运行时依赖,就能把 744B 到 2.8T 参数的 MoE(混合专家)大模型跑在你现有的硬件上。它不是把模型硬塞进显存,而是把 VRAM、RAM 和 NVMe 当作同一层级来管理,按需从磁盘流式加载专家权重。项目上线一个月已收获 21.9K Stars,并支持 GLM-5.2、Inkling、Kimi K3、OLMoE 四大模型家族。

    本期我们就来拆解:colibri 是怎么让“本地运行千亿 MoE”这件事从神话变成可复现实验的。

    项目简介

    colibri 是一个面向前沿 MoE 模型的本地推理引擎。它用“存储即内存层级”的思路替代传统的“模型必须全进显存”假设:密集注意力层常驻 RAM,19456 个路由专家放在磁盘,只有在路由器真正需要时才被预取到 RAM/VRAM。这样一台只有 25 GB 内存的常规电脑也能把 744B 的 GLM-5.2 跑起来,而高端工作站则可以把全部专家驻留 GPU,达到接近数据中心的吞吐。

    配图速览

    colibri 核心速览
    colibri 核心数据一览
    三层存储层级
    colibri 把专家权重分布在 VRAM / RAM / NVMe 三个层级,速度随硬件变化,语义保持不变。

    安装要求和过程

    环境要求

    • 操作系统:Linux、macOS、Windows 11
    • 内存:最低 25 GB RAM(仅 CPU 流式);推荐 128 GB 或更高,配合多 GPU 可获得更好体验
    • 磁盘:GLM-5.2 int4 容器约 372 GB;Kimi K3 原始检查点约 1.6 TB
    • 软件:Python 3(仅用于 launcher 和转换脚本);编译源码需要 gcc/clang + OpenMP
    • GPU(可选):CUDA、Metal(Apple Silicon)、Vulkan 1.2(含 AMD RADV)后端均可选

    快速安装

    1. 下载对应平台的预编译 release 并解压:
    mkdir colibri && tar xzf colibri-v1.1.0-linux-x86_64.tar.gz -C colibri && cd colibri
    python3 coli info
    1. 或从源码构建:
    git clone https://github.com/JustVugg/colibri && cd colibri/c
    ./setup.sh
    1. 下载 GLM-5.2 int4 gs64 容器(推荐带 int8 MTP 头的版本):
    # 推荐从 Hugging Face 拉取 mastouri/GLM-5.2-colibri-int4-g64-with-int8-mtp
    # 约 372 GB,放 NVMe 上最佳
    1. 运行交互式聊天、API 服务或 Web 面板:
    COLI_MODEL=/nvme/glm52_i4 ./coli chat
    COLI_MODEL=/nvme/glm52_i4 ./coli serve    # OpenAI-compatible API
    ./coli web --model /nvme/glm52_i4          # API + 可视化 dashboard

    核心功能

    1. 存储即内存层级
      把 VRAM、RAM、NVMe 统一成专家权重的放置策略。缺显存不会悄悄改模型精度或路由语义,只会影响速度。
    2. 按需流式加载专家
      MoE 每层只激活少量专家。colibri 让 19456 个专家中的绝大部分常驻磁盘,通过 per-layer LRU、学习到的热专家 pinned set 和一层提前预取(PILOT)减少磁盘等待。
    3. 纯 C 零依赖引擎
      每个模型对应一个 C 文件(如 c/glm.c),无 BLAS、无运行时 Python、无 GPU 也能跑。
    4. 多后端异构执行
      支持 CPU、CUDA、Metal、Vulkan 四种后端,可组合使用;双 SSD 镜像可把只读专家读取带宽翻倍。
    5. 学习缓存与压缩状态
      引擎记录你的工作负载路由历史(.coli_usage),越用越快;MLA KV 状态压缩到原来的 1/57,并能持久化对话上下文。

    典型使用场景

    场景一:个人开发者跑前沿模型做实验

    你只有一台 64 GB RAM + 1 TB NVMe 的台式机。传统 vLLM/llama.cpp 会把 744B 模型拒之门外;colibri 让你用 COLI_MODEL=/nvme/glm52_i4 ./coli chat 直接对话,虽然 token/s 不高,但足以做提示工程、长文本探索和小批量评估。

    场景二:工作室搭建本地私有 API

    在多卡工作站(如 6× RTX 5090)上,把专家全部驻留 GPU,colibri 可提供 5.8–6.8 tok/s 的解码速度和 1.6 s 的 TTFT。通过 coli serve 提供 OpenAI-compatible API,内部团队就能在不联网的情况下调用千亿模型。

    场景三:MoE 推理系统研究

    colibri 把放置策略、调度、I/O、CPU/GPU 重叠都做成可测量的实验参数。研究者可以替换缓存策略、测试双 SSD 镜像、评估 int4/int8/MXFP4 格式对质量的影响,并把结果以 issue 形式回馈社区。

    推荐理由

    colibri 最打动我的不是“跑 744B 模型”这个噱头,而是它把“本地推理”重新定义为系统优化问题:不盲目堆硬件,而是认真测量每一个瓶颈——磁盘带宽、专家命中率、KV 压缩、CPU/GPU 重叠、量化质量——并用可复现的 A/B 来做决策。README 里反复出现的不是营销数字,而是“这个功能在哪台机器上、用什么 commit、跑什么 prompt 测出来的”。

    对于国内用户,它还有一个隐性好处:GLM-5.2、Kimi K3、Qwen3 MoE(roadmap)等模型天然和中国模型生态更近,未来可以更低成本地跑开源中文大模型。

    当然,它现在还是研究导向的项目:没有 SLA 保证速度,配置参数很多,对磁盘和内存仍有一定要求。但如果你既想摸到前沿模型,又不想把数据送出去,colibri 是 2026 年最值得关注的本地推理引擎之一。

    下载地址

  • GitHub Copilot SDK:一套 Agent 运行时,六种语言官方 SDK

    GitHub Copilot SDK:一套 Agent 运行时,六种语言官方 SDK

    GitHub Copilot SDK

    项目简介

    GitHub Copilot SDK 是 GitHub 官方发布的多平台 Agent 运行时 SDK,让你在自己的应用中嵌入 Copilot CLI 的完整智能体引擎。支持 TypeScript、Python、Go、.NET(C#)、Java、Rust 六种语言,通过 JSON-RPC 与 Copilot CLI server 模式通信,SDK 自动管理进程生命周期——你只需定义 Agent 行为,Copilot 负责规划、工具调用和文件编辑。

    一句话:把 Copilot CLI 的 Agent 能力,以 SDK 形式嵌入任何应用。

    六语言SDK速览

    安装要求与过程

    环境要求

    • Node.js / TypeScript:Node.js ^20.19.0 或 ≥22.12.0
    • Python:Python 3.11+
    • .NET:.NET 8+ SDK
    • Go / Rust / Java:对应语言工具链 + 需额外安装 Copilot CLI
    • 认证:GitHub Copilot 订阅,或 BYOK 自带模型 API Key

    快速安装

    # Node.js / TypeScript
    npm install @github/copilot-sdk
    
    # Python
    pip install github-copilot-sdk
    python -m copilot download-runtime   # 下载运行时二进制
    
    # .NET
    dotnet add package GitHub.Copilot.SDK
    
    # Go
    go get github.com/github/copilot-sdk/go
    
    # Rust
    cargo add github-copilot-sdk
    
    # Java (Maven)
    <dependency>
      <groupId>com.github</groupId>
      <artifactId>copilot-sdk-java</artifactId>
    </dependency>

    Python 快速上手示例

    import asyncio
    from copilot import CopilotClient
    from copilot.session_events import AssistantMessageData, SessionIdleData
    from copilot.session import PermissionHandler
    
    async def main():
        async with CopilotClient() as client:
            async with await client.create_session(
                on_permission_request=PermissionHandler.approve_all,
                model="gpt-5",
            ) as session:
                done = asyncio.Event()
                def on_event(event):
                    match event.data:
                        case AssistantMessageData() as data:
                            print(data.content)
                        case SessionIdleData():
                            done.set()
                session.on(on_event)
                await session.send("What is 2+2?")
                await done.wait()
    
    asyncio.run(main())

    核心功能

    1. 六语言官方 SDK:TypeScript/Python/Go/.NET/Java/Rust 全部由 GitHub 官方维护,统一 API 设计,语义化版本管理(GA 状态)。
    2. Agent Loop 完整循环:内置完整的工具调用循环(Tool Use Loop),自动处理回合(Turn)与完成信号,无需自建编排层。
    3. Hooks 拦截机制:可在工具调用前后拦截、改写结果、处理错误——实现权限控制、日志审计、输出过滤等中间件逻辑。
    4. Custom Agents + Fleet Mode:定义带独立工具集和指令的子智能体;Fleet Mode 支持并行派发多个子智能体处理大型独立任务流。
    5. MCP Servers 集成:原生接入 Model Context Protocol 服务器,扩展外部工具能力;同时支持 Skills 提示词模块与 Plugin Directories 插件打包。
    6. 40+ Streaming Events:实时订阅会话事件流(assistant.message、tool.call、session.idle 等),构建响应式 UI。
    架构与核心能力

    典型使用场景

    场景一:IDE 插件内嵌 AI 编程助手

    在 VS Code / JetBrains 插件中集成 Copilot Agent,用户选中代码后调用 SDK 发起对话,Agent 自动读取文件上下文、执行重构建议、直接编辑文件。相比自己对接 LLM API + 构建工具链,SDK 已封装好文件读写、终端命令、Git 操作等全套工具。

    场景二:CI/CD 流水线中的自动化 Review Bot

    在 GitHub Actions 中用 Python SDK 启动 Copilot Session,将 PR diff 作为输入发送给 Agent,让它分析变更影响、生成 review 评论。通过 Hooks 可限制 Agent 只读不写,确保安全可控。

    场景三:SaaS 产品中的 AI 功能模块

    在 Web 后端通过 TypeScript SDK 创建带预算限制的 Session(Session Limits),为每个用户分配 AI Credits 配额。结合 Remote Sessions 功能,让用户在浏览器中实时看到 Agent 工作过程。BYOK 模式下可使用自有模型 Key,降低运营成本。

    推荐理由

    作为 GitHub 官方出品,Copilot SDK 的最大优势是「不用重复造轮子」。过去要在应用里嵌入 AI Agent 能力,你需要自己处理模型选择、提示词模板、工具定义、权限控制、错误恢复……现在这些全部由 Copilot CLI 引擎托管,SDK 只暴露简洁的 Session API。

    六种语言的覆盖面也令人印象深刻——从脚本到企业级后端,从前端到系统编程,几乎覆盖了主流开发栈。特别是 Python 和 TypeScript SDK 内置了 CLI 二进制,开箱即用体验非常顺滑。

    当然,它需要 Copilot 订阅或 BYOK 配置,不是完全免费的方案。但考虑到它提供的生产级 Agent 运行时能力,这个成本是合理的。如果你正在评估「如何在产品中加入 AI Agent 能力」,Copilot SDK 值得作为首选方案之一认真试用。

    下载地址

  • Last 30 Days —— 由点赞、转发和真金白银评分的 AI 全网搜索引擎

    Last 30 Days —— 由点赞、转发和真金白银评分的 AI 全网搜索引擎

    项目简介

    /last30days 是一个 AI Agent 技能(Agent Skill),它能在 Reddit、X(Twitter)、YouTube、Hacker News、Polymarket、TikTok、arXiv、小红书等 19+ 个平台并行检索任意话题,按真实用户互动(点赞、转发、交易量)评分,再由 AI Agent 合成一份带引用的 30 天情报简报。

    它的核心理念是:“Google 聚合编辑,/last30days 搜索人”——每个平台都是围墙花园,但你可以自带钥匙,让一个 Agent 同时搜索所有平台,告诉你什么真正重要。

    工作流与安装

    核心功能

    • 19+ 信息源并行检索:Reddit(免 API Key)、X/Twitter、YouTube 全文转写、Hacker News、Polymarket 预测市场、GitHub API 实时数据、TikTok、Instagram Reels、arXiv 论文、Techmeme 科技新闻、Digg AI 1000 账号聚合、LinkedIn、Threads、Bluesky、StockTwits、小红书、Pinterest 等。社区贡献者持续添加新源。
    • 真实互动评分:1500 赞的 Reddit 帖 > 没人读的博客;$66K 交易量的 Polymarket 赔率 > 专家猜测;360 万播放的 TikTok > 新闻稿。社交相关性优先于 SEO 相关性。
    • 发现模式(Discovery Mode):输入 /last30days what's exploding in AI agents? 自动切换为话题发现引擎,扫描 Reddit 分类、HN 热帖、Digg AI 1000 feed 和 X,由 Agent 评审后输出 5-10 个动量排名话题。
    • 跨平台对比/last30days OpenClaw vs Hermes vs Paperclip 输出架构/记忆/安全/适用场景的并排对比表,Star 数实时从 GitHub API 拉取。
    • 零配置开箱即用:Reddit / HN / Polymarket / GitHub 无需任何 Key 即可使用;首次运行设置向导在 30 秒内解锁 X、YouTube、TikTok、arXiv 等更多源。
    19+ 信息源总览

    安装要求与过程

    环境要求:

    • Claude Code(推荐):自动通过 marketplace 更新
    • Node.js 18+(用于 npx skills 安装)
    • Python 3.10+(可选,用于脚本模式)
    • Grok Build CLI / OpenClaw(对应宿主)

    快速安装步骤:

    Claude Code(推荐):

    /plugin marketplace add mvanhorn/last30days-skill

    Codex / Cursor / Copilot / Gemini CLI 等 50+ Agent Skills 宿主:

    npx skills add mvanhorn/last30days-skill -g

    Grok Build CLI:

    grok plugin install mvanhorn/last30days-skill

    OpenClaw:

    clawhub install last30days-official

    安装后在任意项目中运行 /last30days <话题> 即可开始研究。首次运行会弹出配置向导,引导你解锁更多需要认证的信息源。

    典型使用场景

    • 会议前调研/last30days Peter Steinberger —— 不只是 LinkedIn 2023 年的旧资料,而是他本月加入 OpenAI Codex 团队、23 个 PR 以 85% 合并率合并、r/ClaudeCode 上 227 赞讨论的最新动态。
    • 招聘信号分析/last30days Listen Labs --hiring-signals —— 从招聘页面变化推断公司战略方向:是否在扩张企业安全、客户成功或基础设施团队。
    • 热点追踪/last30days what's exploding in AI agents? —— 发现模式下输出动量排名的新兴话题,每条附带跨平台数据和 /last30days "<话题>" 一键跟进命令。
    • 工具选型决策/last30days OpenClaw vs Hermes vs Paperclip —— 并排对比表 + 架构差异 + 适用场景,Star 数实时拉取而非过时博客数据。
    • 旅行规划/last30days Universal Epic Universe —— 社区真实反馈:哪些项目在建、排队时间多长、年票何时开放。

    推荐理由

    这个项目解决了一个 Google 和 ChatGPT 都无法解决的问题:跨平台的实时社会信号聚合。Google 不碰 Reddit 评论和 X 帖子;ChatGPT 有 Reddit 合作但搜不了 X 或 TikTok;Gemini 有 YouTube 但没有 Reddit。每个平台都是孤岛,而 /last30days 用 Agent 把它们桥接起来。

    54K+ Stars、175 个合并 PR(其中 122 个来自 52 位社区贡献者)、支持 50+ 编程助手宿主——这已经从一个个人工具成长为社区基础设施。对于需要快速了解任意领域最新动态的人来说,这是目前最全面的开源方案。

    下载地址