标签: CPU推理

  • KTransformers:让消费级显卡跑起 DeepSeek 的异构推理引擎

    KTransformers:让消费级显卡跑起 DeepSeek 的异构推理引擎

    KTransformers

    项目简介

    KTransformers 是清华大学 MADSys 实验室联合 Approaching.AI 等团队开源的大模型异构推理与微调框架。它最出圈的能力,是让一块 24GB 显存的消费级显卡(如 RTX 4090)也能流畅运行 DeepSeek-V3 / R1 这类数百 GB 的巨型 MoE 模型——把”热专家”放在 GPU、”冷专家”卸载到 CPU/内存,配合 INT4/INT8/FP8 量化与 AMX/AVX 指令集优化,在本地把推理速度做到可用甚至惊艳。

    安装要求和过程

    环境要求:

    • Python 3.10 / 3.11 / 3.12(官方预编译 wheel 支持这三个版本)
    • Linux x86-64(manylinux_2_17),CPU 需支持 AVX2(Intel Haswell 2013+ / AMD Zen+ 及以上)
    • 可选 NVIDIA GPU,计算能力 8.0+(Ampere / Ada / Hopper,如 A100、RTX 3090/4090、H100);无需安装 CUDA toolkit,静态 CUDA 运行时已内置
    • 运行超大规模 MoE(如 DeepSeek-V3/R1)时,建议 64GB~382GB 内存用于专家卸载

    快速安装(PyPI,推荐大多数用户):

    pip install kt-kernel

    一行命令即装好含自动 CPU 检测、多指令集变体与 CUDA 加速的推理内核,无需编译。验证安装:

    kt version          # 查看 CLI 版本与检测到的 CPU 变体
    python -c "from kt_kernel import KTMoEWrapper; print('ok')"

    从源码编译(需要自定义 / AMD BLIS / ARM KML 后端):

    git clone https://github.com/kvcache-ai/ktransformers.git
    cd ktransformers/kt-kernel
    git submodule update --init --recursive
    ./install.sh        # 自动检测 CPU 并 -march=native 编译

    一条命令跑起来(自动适配硬件):

    kt run m2           # 启动模型推理服务(自动优化参数)
    kt chat             # 另开终端开始对话

    核心功能

    • CPU-GPU 异构推理(expert offload):把 Mixture-of-Experts 中高频访问的”热专家”留在 GPU,低频”冷专家”卸载到 CPU 与内存,显存占用从数十 GB 降到单卡 24GB 即可跑 DeepSeek-R1/V3。
    • 多指令集深度优化内核:内置 AMX(Intel Sapphire Rapids+)、AVX512(含 BF16/VNNI/VBMI)、AVX2 等多套 CPU 内核变体,运行时按 CPU 自动选择,并支持原生 FP8/BF16/INT4 精度。
    • 量化与长上下文:支持 CPU 侧 INT4/INT8 量化权重与 GPU 侧 GPTQ,配合 unsloth 1.58/2.51bit 与 IQ1_S/FP8 混合权重;可在 24GB 显存下放飞 139K+ 长上下文。
    • 微调(SFT)× LLaMA-Factory:支持在有限显存上对 DeepSeek-V3/R1、Qwen3-MoE 等超大 MoE 做 LoRA 微调,官方称比 ZeRO-Offload 快 6~12 倍、CPU 内存减半。
    • 生产级集成:提供干净的 Python API,可无缝接入 SGLang 做生产部署,实现”热专家 GPU / 冷专家 CPU”的异构服务。

    KTransformers × LLaMA-Factory 超大 MoE 微调

    图:KTransformers × LLaMA-Factory 在有限显存上微调超大 MoE 模型

    典型使用场景

    • 本地私有化跑 DeepSeek 满血版:开发者用一台配 24GB 显卡 + 大内存的主机,本地部署 DeepSeek-R1/V3 做代码助手、知识库问答,数据不出机器。
    • 高并发推理服务:在 8×L20 + Xeon 的服务器上,官方实测 DeepSeek-R1-0528(FP8)总吞吐 227.85 tokens/s、8 路并发输出 87.58 tokens/s,适合中小团队自建推理网关。
    • 超大模型低成本微调:用 4×RTX 4090 对 DeepSeek-V3 做 LoRA 微调(约 80GB 显存、3.7 it/s),或用单张 4090 微调 Qwen3-30B-A3B(8+ it/s),把训练成本打到消费级。

    推荐理由

    大模型推理的门槛,过去被”显存”死死卡住——想本地跑 DeepSeek 满血版,要么堆 H100 要么云上烧钱。KTransformers 的价值正在于此:它不跟你拼硬件,而是用异构调度 + 量化 + CPU 指令集优化把”不可能”变成”在家就能跑”。对预算有限的个人开发者、想做私有化部署的小团队、以及研究 MoE 推理优化的工程师来说,它是目前最务实的本地推理方案之一。

    工程上它也很”乖”:从 pip install kt-kernelkt run 一条命令起服务,内置 CPU 变体自动检测、NUMA 感知线程池,连 CUDA toolkit 都不用装。唯一的代价是——它目前主要面向 Linux x86-64,且吃内存(专家卸载越多越吃),上 Windows 原生或低内存机器要谨慎。但瑕不掩瑜,如果你想体验”把大模型装进自己电脑”,KTransformers 值得第一个试。

    下载地址

    许可:Apache-2.0 | 语言:Python / C++ | 维护:清华大学 MADSys 实验室、Approaching.AI、9#AISoft 及社区

  • Microsoft BitNet:1-bit LLM 官方推理框架,让 CPU 跑大模型速度提升 6 倍

    Microsoft BitNet:1-bit LLM 官方推理框架,让 CPU 跑大模型速度提升 6 倍

    ⭐ 39,599+ Stars
    MIT License
    Microsoft 官方
    Python/C++

    📌 项目简介

    Microsoft BitNet — 1-bit LLM 官方推理框架

    bitnet.cpp 是微软官方出品的 1-bit 大语言模型推理框架,专为 BitNet b1.58 等三元量化模型打造。它基于 llama.cpp 构建,提供一系列高度优化的内核,支持在 CPU 和 GPU 上实现 1.58-bit 模型的快速、无损推理。

    核心突破:1.58-bit 量化(每个权重只需 1.58 个比特),在大幅降低模型内存占用的同时,推理质量几乎无损。这意味着一台普通笔记本甚至手机,都能运行过去需要昂贵 GPU 才能跑的大模型。

    💡 为什么重要? BitNet 的论文《The Era of 1-bit LLMs》引爆了 AI 社区——它证明了 1-bit 量化模型可以媲美全精度模型的性能,同时内存占用降低 7-10 倍,能耗降低 70-82%。这是本地 LLM 部署和边缘 AI 的里程碑式突破。

    🔧 安装要求和过程

    环境要求

    依赖项 版本要求 说明
    Python ≥ 3.9 推荐用 Conda 管理环境
    CMake ≥ 3.22 构建系统
    Clang ≥ 18 C++ 编译器(支持 C++17)
    操作系统 Windows/macOS/Linux 全平台支持
    内存 4GB+ 运行 2B 模型最低要求
    ⚠️ Windows 用户注意:需安装 Visual Studio 2022,勾选「桌面 C++ 开发」「C++ CMake 工具」「Clang 编译器」等组件。所有命令需在 VS2022 开发者命令提示符中运行。

    快速安装步骤

    方式一:从源码构建(推荐)

    # 1. 克隆仓库(包含子模块)
    git clone --recursive https://github.com/microsoft/BitNet.git
    cd BitNet
    
    # 2. 创建 Conda 环境
    conda create -n bitnet-cpp python=3.9
    conda activate bitnet-cpp
    pip install -r requirements.txt
    
    # 3. 下载官方模型并配置环境
    huggingface-cli download microsoft/BitNet-b1.58-2B-4T-gguf --local-dir models/BitNet-b1.58-2B-4T
    python setup_env.py -md models/BitNet-b1.58-2B-4T -q i2_s

    方式二:使用 pip 安装(简化版)

    pip install bitnet-cpp
    bitnet setup --model microsoft/BitNet-b1.58-2B-4T

    方式三:Docker 部署

    docker build -t bitnet-cpp .
    docker run -it --rm bitnet-cpp

    🚀 核心功能

    1. 1.58-bit 极致量化推理

    每个权重仅用 {-1, 0, +1} 三个值表示(1.58 bits),相比 FP16 模型内存压缩 7-10 倍,推理速度提升 2-6 倍。这是目前业界最激进、也是最实用的 LLM 量化方案。

    2. CPU 原生优化(无需 GPU!)

    针对 x86 和 ARM CPU 深度优化:

    • x86 CPU:推理速度提升 2.37x ~ 6.17x,能耗降低 71.9% ~ 82.2%
    • ARM CPU(如 Apple M 系列):推理速度提升 1.37x ~ 5.07x,能耗降低 55.4% ~ 70.0%
    • 单 CPU 运行 100B 模型:速度达 5-7 tokens/秒,媲美人类阅读速度

    3. GPU 推理支持(2025 年 5 月上线)

    官方 GPU 推理内核已发布,支持 NVIDIA GPU 加速推理。GPU 分支提供比 CPU 高一个数量级的吞吐量,适合高并发场景。详见 gpu/README.md

    4. 多模型生态支持

    不仅支持微软官方 BitNet 模型,还兼容社区模型:

    • BitNet-b1.58-2B-4T(官方,2.4B 参数,HuggingFace 可下载)
    • bitnet_b1_58-large(0.7B)
    • Llama3-8B-1.58-100B-tokens(8B)
    • Falcon3 系列(1B-10B,tiiuae 出品)

    5. 完善的工具链

    • run_inference.py:对话模式/自定义 Prompt 推理
    • e2e_benchmark.py:性能基准测试
    • convert-helper-bitnet.py:safetensors → GGUF 格式转换
    • generate-dummy-bitnet-model.py:生成虚拟模型用于测试

    💡 典型使用场景

    场景一:本地私有化部署 LLM

    企业或因隐私要求不能在云端运行 LLM 的场景。BitNet 让一台普通办公电脑(甚至只有 CPU)就能运行 2B-7B 参数级别的模型,无需昂贵 GPU 投资。

    # 在普通办公电脑上运行私有对话助手
    python run_inference.py \
      -m models/BitNet-b1.58-2B-4T/ggml-model-i2_s.gguf \
      -p "你是一个专业的技术支持助手" \
      -cnv -t 8

    场景二:边缘设备和嵌入式 AI

    在树莓派、手机、IoT 设备上部署 AI 助手。1-bit 量化模型极小,2B 模型经量化后仅约 500MB,可以轻松嵌入边缘设备。微软研究人员已演示在 ARM 设备上流畅运行。

    场景三:大规模模型服务成本优化

    云服务商或企业 AI 平台可以用 BitNet 量化模型,将推理成本降低 70% 以上。同样硬件可以服务更多用户,或同样预算获得更高吞吐量。


    🏆 推荐理由

    为什么你应该关注 BitNet?

    • 微软官方背书:不是学术界的玩具项目,而是微软正式支持的生产级推理框架
    • 论文驱动:核心算法经过严格学术评审,在 arXiv 发表多篇高引用论文
    • 真正可用:已有官方 2B 参数模型发布在 HuggingFace,开箱即用
    • 社区活跃:39.6K+ Stars,3.6K+ Forks,303 个 Issues 讨论,持续迭代中
    • 生态融合:基于 llama.cpp 构建,天然兼容 Ollama、vLLM 等主流工具链

    个人使用心得:BitNet 最让我震撼的是它让「每个人都能本地运行 LLM」真正成为可能。过去跑一个 7B 模型需要 14GB+ 显存,现在用 BitNet 量化后,一台普通笔记本的 CPU 就能流畅运行。对于 AI 开发者、研究者、以及关注数据隐私的用户来说,这是一个必须收藏的项目。

    在线 Demo:试玩 BitNet 官方演示(Azure 托管,无需本地安装)


    📦 下载地址

    WorkBuddy AI 自动发布 | 数据来源:GitHub API | 更新时间:2026-07-04