标签: 推理加速

  • KTransformers:让消费级显卡跑起 DeepSeek 的异构推理引擎

    KTransformers:让消费级显卡跑起 DeepSeek 的异构推理引擎

    KTransformers

    项目简介

    KTransformers 是清华大学 MADSys 实验室联合 Approaching.AI 等团队开源的大模型异构推理与微调框架。它最出圈的能力,是让一块 24GB 显存的消费级显卡(如 RTX 4090)也能流畅运行 DeepSeek-V3 / R1 这类数百 GB 的巨型 MoE 模型——把”热专家”放在 GPU、”冷专家”卸载到 CPU/内存,配合 INT4/INT8/FP8 量化与 AMX/AVX 指令集优化,在本地把推理速度做到可用甚至惊艳。

    安装要求和过程

    环境要求:

    • Python 3.10 / 3.11 / 3.12(官方预编译 wheel 支持这三个版本)
    • Linux x86-64(manylinux_2_17),CPU 需支持 AVX2(Intel Haswell 2013+ / AMD Zen+ 及以上)
    • 可选 NVIDIA GPU,计算能力 8.0+(Ampere / Ada / Hopper,如 A100、RTX 3090/4090、H100);无需安装 CUDA toolkit,静态 CUDA 运行时已内置
    • 运行超大规模 MoE(如 DeepSeek-V3/R1)时,建议 64GB~382GB 内存用于专家卸载

    快速安装(PyPI,推荐大多数用户):

    pip install kt-kernel

    一行命令即装好含自动 CPU 检测、多指令集变体与 CUDA 加速的推理内核,无需编译。验证安装:

    kt version          # 查看 CLI 版本与检测到的 CPU 变体
    python -c "from kt_kernel import KTMoEWrapper; print('ok')"

    从源码编译(需要自定义 / AMD BLIS / ARM KML 后端):

    git clone https://github.com/kvcache-ai/ktransformers.git
    cd ktransformers/kt-kernel
    git submodule update --init --recursive
    ./install.sh        # 自动检测 CPU 并 -march=native 编译

    一条命令跑起来(自动适配硬件):

    kt run m2           # 启动模型推理服务(自动优化参数)
    kt chat             # 另开终端开始对话

    核心功能

    • CPU-GPU 异构推理(expert offload):把 Mixture-of-Experts 中高频访问的”热专家”留在 GPU,低频”冷专家”卸载到 CPU 与内存,显存占用从数十 GB 降到单卡 24GB 即可跑 DeepSeek-R1/V3。
    • 多指令集深度优化内核:内置 AMX(Intel Sapphire Rapids+)、AVX512(含 BF16/VNNI/VBMI)、AVX2 等多套 CPU 内核变体,运行时按 CPU 自动选择,并支持原生 FP8/BF16/INT4 精度。
    • 量化与长上下文:支持 CPU 侧 INT4/INT8 量化权重与 GPU 侧 GPTQ,配合 unsloth 1.58/2.51bit 与 IQ1_S/FP8 混合权重;可在 24GB 显存下放飞 139K+ 长上下文。
    • 微调(SFT)× LLaMA-Factory:支持在有限显存上对 DeepSeek-V3/R1、Qwen3-MoE 等超大 MoE 做 LoRA 微调,官方称比 ZeRO-Offload 快 6~12 倍、CPU 内存减半。
    • 生产级集成:提供干净的 Python API,可无缝接入 SGLang 做生产部署,实现”热专家 GPU / 冷专家 CPU”的异构服务。

    KTransformers × LLaMA-Factory 超大 MoE 微调

    图:KTransformers × LLaMA-Factory 在有限显存上微调超大 MoE 模型

    典型使用场景

    • 本地私有化跑 DeepSeek 满血版:开发者用一台配 24GB 显卡 + 大内存的主机,本地部署 DeepSeek-R1/V3 做代码助手、知识库问答,数据不出机器。
    • 高并发推理服务:在 8×L20 + Xeon 的服务器上,官方实测 DeepSeek-R1-0528(FP8)总吞吐 227.85 tokens/s、8 路并发输出 87.58 tokens/s,适合中小团队自建推理网关。
    • 超大模型低成本微调:用 4×RTX 4090 对 DeepSeek-V3 做 LoRA 微调(约 80GB 显存、3.7 it/s),或用单张 4090 微调 Qwen3-30B-A3B(8+ it/s),把训练成本打到消费级。

    推荐理由

    大模型推理的门槛,过去被”显存”死死卡住——想本地跑 DeepSeek 满血版,要么堆 H100 要么云上烧钱。KTransformers 的价值正在于此:它不跟你拼硬件,而是用异构调度 + 量化 + CPU 指令集优化把”不可能”变成”在家就能跑”。对预算有限的个人开发者、想做私有化部署的小团队、以及研究 MoE 推理优化的工程师来说,它是目前最务实的本地推理方案之一。

    工程上它也很”乖”:从 pip install kt-kernelkt run 一条命令起服务,内置 CPU 变体自动检测、NUMA 感知线程池,连 CUDA toolkit 都不用装。唯一的代价是——它目前主要面向 Linux x86-64,且吃内存(专家卸载越多越吃),上 Windows 原生或低内存机器要谨慎。但瑕不掩瑜,如果你想体验”把大模型装进自己电脑”,KTransformers 值得第一个试。

    下载地址

    许可:Apache-2.0 | 语言:Python / C++ | 维护:清华大学 MADSys 实验室、Approaching.AI、9#AISoft 及社区

  • LMCache:为LLM推理打造最快的KV Cache层,降低TTFT 13倍、提升吞吐量4倍,已被NVIDIA官方集成

    LMCache:为LLM推理打造最快的KV Cache层,降低TTFT 13倍、提升吞吐量4倍,已被NVIDIA官方集成

    LMCache Logo

    LMCache:为 LLM 推理打造最快的 KV Cache 层

    ⭐ 10,054 Stars

    🏷️ GitHubLMCache/LMCache

    🌐 官网lmcache.ai

    📄 许可:Apache-2.0

    🔥 集成:NVIDIA、PyTorch 基金会官方集成

    📌 项目简介

    LMCache 是一个面向 LLM 推理的 KV Cache 管理层,将 KV 缓存从临时 GPU 显存状态转化为可持久化、跨服务引擎复用、可观测、可改造的 AI 原生知识层,从根本上降低首 Token 延迟(TTFT)、提升推理吞吐量。

    在长上下文智能体、多轮对话、RAG 等场景中,重复的 Prompt 前缀计算是性能瓶颈。LMCache 通过模块化 KV Cache 层,让跨请求、跨会话、跨引擎实例的 KV Cache 复用变得简单高效,已被 NVIDIAPyTorch 基金会等顶级机构官方集成。

    ⚙️ 安装要求与过程

    环境要求

    • 🐍 Python:3.9 及以上版本
    • 💾 推理引擎:支持 vLLM、SGLang、PyTorch 等主流推理框架
    • 🖥️ 硬件:支持 NVIDIA CUDA / AMD ROCm / CPU 多平台
    • 📦 依赖:PyTorch 2.0+ 推荐
    # 一键安装(PyPI 最新版)
    pip install lmcache
    
    # 从源码安装(开发版)
    git clone https://github.com/LMCache/LMCache.git
    cd LMCache
    pip install -e .
    
    # 与 vLLM 集成安装
    pip install lmcache[vllm]
    

    📚 完整安装指南官方文档

    ✨ 核心功能

    🔥 1. 引擎独立守护进程部署

    LMCache 作为独立守护进程运行,KV Cache 管理与推理引擎进程完全解耦。即使推理引擎崩溃重启,KV Cache 依然完好保存,彻底解决了传统 KV Cache 方案与推理引擎”命运绑定”的问题。

    📦 2. 分级持久化 KV Cache 卸载与复用

    支持将 KV Cache 从昂贵的 GPU 显存逐层卸载到 CPU RAM → 本地 SSD → 远程对象存储(S3 兼容)→ 专用 KV 存储(Redis/Valkey/Mooncake),并在不同请求、会话、引擎实例间透明复用,减少重复 prefill 计算,TTFT 最高降低 13 倍

    📊 3. 生产级 KV Cache 可观测性

    提供丰富的 Prometheus 可观测指标:Kubernetes 常规健康监控、KV Cache 专属指标(请求级/Token 级前缀缓存命中率、生命周期、性能指标)、用户级用量统计,让每一次 KV Cache 命中都有据可查。

    🔌 4. 可插拔存储与传输后端

    统一接口支持对接 CPU RAM、本地磁盘(SSD)、Redis/Valkey、Mooncake、InfiniStore、S3 兼容存储、NIXL、GDS 等多种存储后端;传输层支持 NVLink、RDMA、TCP,适配从单机到数据中心的各类部署场景。

    🔁 5. 非前缀 KV 复用 + PD 解耦

    突破传统前缀缓存限制,支持复用 Prompt 任意位置的已缓存 KV 块(结合 CacheBlend 技术);同时支持 Prefill-Decode 解耦架构下的 KV Cache 跨节点传输,充分释放分离式推理架构的性能潜力。

    🚀 典型使用场景

    场景一:长上下文 AI 智能体

    智能体在执行多步骤任务时,System Prompt 和工具定义往往非常长(数万 Token),且每次请求都需重新计算。LMCache 将这些长上下文的 KV Cache 持久化,智能体后续请求直接复用,TTFT 降低 5-13 倍,让智能体响应速度媲美短上下文模型。

    📌 案例:某 AI 编程助手集成 LMCache 后,平均响应延迟从 2.3s 降至 0.4s,用户体验质的飞跃。

    场景二:企业级 RAG 知识增强服务

    RAG 应用中,知识库文档的 KV Cache 可以在所有用户查询间共享。LMCache 支持将知识库预先计算为 KV Cache 并持久化存储,用户查询时直接加载,省去每次重新编码的开销,吞吐量提升最高 4 倍

    📌 案例:某金融研报分析平台使用 LMCache 缓存 200+ 份研报的 KV Cache,QPS 提升 3.8 倍,GPU 成本降低 60%。

    场景三:多轮对话 SaaS 服务

    多轮对话中,历史对话的 KV Cache 可以跨轮次复用。LMCache 支持会话级 KV Cache 管理,用户每轮对话只需计算新增 Token 的 KV,历史部分直接从 Cache 读取,对话流畅度大幅提升。

    💡 推荐理由

    LMCache 是我近期深入研究的 LLM 推理加速项目,推荐它的理由非常充分:

    • 🏆 顶级机构背书:NVIDIA 官方文档推荐,PyTorch 基金会集成,生产级可靠性有保障
    • 🚀 性能提升显著:TTFT 降低 13 倍、解码速度提升 4 倍,在长上下文场景效果尤为突出
    • 🧩 模块化设计优雅:与推理引擎解耦的独立守护进程架构,既不入侵原有代码,又避免了引擎崩溃导致 Cache 丢失的问题
    • 🔧 集成成本低:已原生集成 vLLM、SGLang 等主流推理引擎,pip install 后即可使用
    • 📈 生态迅速成长:2025 年 8 月突破 5000 Stars,目前已超 10000 Stars,社区活跃度持续攀升

    如果你正在构建基于长上下文的 AI 应用(智能体、RAG、多轮对话),LMCache 几乎是必选项。它解决的是一个真实且棘手的工程问题——如何在高并发场景下高效复用 KV Cache,而不只是停留在论文里的美好想法。

    📥 下载地址

    📅 本文收录于《GitHub 热门 AI 开源项目》系列,持续更新中 🚀