标签: 推理引擎

  • KTransformers:让消费级显卡跑起 DeepSeek 的异构推理引擎

    KTransformers:让消费级显卡跑起 DeepSeek 的异构推理引擎

    KTransformers

    项目简介

    KTransformers 是清华大学 MADSys 实验室联合 Approaching.AI 等团队开源的大模型异构推理与微调框架。它最出圈的能力,是让一块 24GB 显存的消费级显卡(如 RTX 4090)也能流畅运行 DeepSeek-V3 / R1 这类数百 GB 的巨型 MoE 模型——把”热专家”放在 GPU、”冷专家”卸载到 CPU/内存,配合 INT4/INT8/FP8 量化与 AMX/AVX 指令集优化,在本地把推理速度做到可用甚至惊艳。

    安装要求和过程

    环境要求:

    • Python 3.10 / 3.11 / 3.12(官方预编译 wheel 支持这三个版本)
    • Linux x86-64(manylinux_2_17),CPU 需支持 AVX2(Intel Haswell 2013+ / AMD Zen+ 及以上)
    • 可选 NVIDIA GPU,计算能力 8.0+(Ampere / Ada / Hopper,如 A100、RTX 3090/4090、H100);无需安装 CUDA toolkit,静态 CUDA 运行时已内置
    • 运行超大规模 MoE(如 DeepSeek-V3/R1)时,建议 64GB~382GB 内存用于专家卸载

    快速安装(PyPI,推荐大多数用户):

    pip install kt-kernel

    一行命令即装好含自动 CPU 检测、多指令集变体与 CUDA 加速的推理内核,无需编译。验证安装:

    kt version          # 查看 CLI 版本与检测到的 CPU 变体
    python -c "from kt_kernel import KTMoEWrapper; print('ok')"

    从源码编译(需要自定义 / AMD BLIS / ARM KML 后端):

    git clone https://github.com/kvcache-ai/ktransformers.git
    cd ktransformers/kt-kernel
    git submodule update --init --recursive
    ./install.sh        # 自动检测 CPU 并 -march=native 编译

    一条命令跑起来(自动适配硬件):

    kt run m2           # 启动模型推理服务(自动优化参数)
    kt chat             # 另开终端开始对话

    核心功能

    • CPU-GPU 异构推理(expert offload):把 Mixture-of-Experts 中高频访问的”热专家”留在 GPU,低频”冷专家”卸载到 CPU 与内存,显存占用从数十 GB 降到单卡 24GB 即可跑 DeepSeek-R1/V3。
    • 多指令集深度优化内核:内置 AMX(Intel Sapphire Rapids+)、AVX512(含 BF16/VNNI/VBMI)、AVX2 等多套 CPU 内核变体,运行时按 CPU 自动选择,并支持原生 FP8/BF16/INT4 精度。
    • 量化与长上下文:支持 CPU 侧 INT4/INT8 量化权重与 GPU 侧 GPTQ,配合 unsloth 1.58/2.51bit 与 IQ1_S/FP8 混合权重;可在 24GB 显存下放飞 139K+ 长上下文。
    • 微调(SFT)× LLaMA-Factory:支持在有限显存上对 DeepSeek-V3/R1、Qwen3-MoE 等超大 MoE 做 LoRA 微调,官方称比 ZeRO-Offload 快 6~12 倍、CPU 内存减半。
    • 生产级集成:提供干净的 Python API,可无缝接入 SGLang 做生产部署,实现”热专家 GPU / 冷专家 CPU”的异构服务。

    KTransformers × LLaMA-Factory 超大 MoE 微调

    图:KTransformers × LLaMA-Factory 在有限显存上微调超大 MoE 模型

    典型使用场景

    • 本地私有化跑 DeepSeek 满血版:开发者用一台配 24GB 显卡 + 大内存的主机,本地部署 DeepSeek-R1/V3 做代码助手、知识库问答,数据不出机器。
    • 高并发推理服务:在 8×L20 + Xeon 的服务器上,官方实测 DeepSeek-R1-0528(FP8)总吞吐 227.85 tokens/s、8 路并发输出 87.58 tokens/s,适合中小团队自建推理网关。
    • 超大模型低成本微调:用 4×RTX 4090 对 DeepSeek-V3 做 LoRA 微调(约 80GB 显存、3.7 it/s),或用单张 4090 微调 Qwen3-30B-A3B(8+ it/s),把训练成本打到消费级。

    推荐理由

    大模型推理的门槛,过去被”显存”死死卡住——想本地跑 DeepSeek 满血版,要么堆 H100 要么云上烧钱。KTransformers 的价值正在于此:它不跟你拼硬件,而是用异构调度 + 量化 + CPU 指令集优化把”不可能”变成”在家就能跑”。对预算有限的个人开发者、想做私有化部署的小团队、以及研究 MoE 推理优化的工程师来说,它是目前最务实的本地推理方案之一。

    工程上它也很”乖”:从 pip install kt-kernelkt run 一条命令起服务,内置 CPU 变体自动检测、NUMA 感知线程池,连 CUDA toolkit 都不用装。唯一的代价是——它目前主要面向 Linux x86-64,且吃内存(专家卸载越多越吃),上 Windows 原生或低内存机器要谨慎。但瑕不掩瑜,如果你想体验”把大模型装进自己电脑”,KTransformers 值得第一个试。

    下载地址

    许可:Apache-2.0 | 语言:Python / C++ | 维护:清华大学 MADSys 实验室、Approaching.AI、9#AISoft 及社区

  • llama.cpp:119.5K Stars!纯 C/C++ 打造的大模型本地推理引擎

    llama.cpp:119.5K Stars!纯 C/C++ 打造的大模型本地推理引擎

    llama.cpp:119.5K Stars!纯 C/C++ 打造的大模型本地推理引擎

    📝 项目简介

    llama.cpp 是一个用纯 C/C++ 实现、零外部依赖的大语言模型(LLM)推理引擎。它让你无需 Python 环境、无需昂贵显卡,就能在笔记本、树莓派甚至手机上高性能地运行 LLaMA、Qwen、Gemma、Mistral 等主流开源模型——可以说,它是当下几乎所有「本地跑大模型」工具的底层基石。

    🌐 官网:https://llama.app

    📦 GitHub:https://github.com/ggml-org/llama.cpp

    ⭐ Stars:119.5K+

    📄 开源协议:MIT License

    💻 主要语言:C / C++

    💻 安装要求和过程

    环境要求

    • C/C++ 编译器:GCC / Clang / MSVC,支持 C++11 及以上
    • CMake 3.8+:从源码构建时需要
    • 可选 GPU 后端:CUDA(NVIDIA)、ROCm(AMD)、Metal(Apple Silicon)、Vulkan、SYCL 等,用于硬件加速
    • 可选 Python 3:仅用于模型格式转换脚本 convert_*.py
    • 支持平台:macOS / Linux / Windows,以及 iOS、Android、浏览器(WASM)等

    快速安装步骤

    方式一:包管理器一键安装(推荐新手)

    # macOS
    brew install llama.cpp
    
    # Windows
    winget install llama.cpp
    
    # Conda
    conda install -c conda-forge llama-cpp

    方式二:Docker 运行(自带 API 服务)

    docker run -p 8080:8080 -v ./models:/models \
      ghcr.io/ggml-org/llama.cpp:server -m /models/your_model.gguf

    方式三:从源码构建

    git clone https://github.com/ggml-org/llama.cpp
    cd llama.cpp
    cmake -B build
    cmake --build build --config Release

    快速开始:下载并运行一个模型

    # 命令行对话(自动从 Hugging Face 拉取 GGUF 模型)
    llama-cli -hf ggml-org/gemma-3-1b-it-GGUF
    
    # 启动 OpenAI 兼容的 API 服务(含简易 WebUI)
    llama-server -hf ggml-org/gemma-3-1b-it-GGUF --port 8080

    ✨ 核心功能

    1. 🪶 纯 C/C++ 零依赖,极致轻量

    不依赖 PyTorch、不依赖 Python 运行时,编译出一个二进制文件即可运行。极小的体积和无依赖特性,让它可以被移植到几乎所有计算设备——这正是它能跑在树莓派和手机上的根本原因。

    2. ⚡ 全平台硬件加速与混合推理

    针对 Apple Silicon(Metal / ARM NEON)、x86(AVX2 / AVX-512 / AMX)、RISC-V 等架构做了深度优化;支持 NVIDIA(CUDA)、AMD(ROCm)、摩尔线程(MUSA)、Vulkan、SYCL、OpenCL 等多种后端。CPU+GPU 混合推理甚至能运行超过显存容量的超大模型。

    3. 🗜️ GGUF 格式与 1.5~8 bit 量化

    模型统一封装为 GGUF 格式,并支持从 1.5-bit 到 8-bit 的整数量化。量化后显存与内存占用大幅下降,让消费级显卡甚至纯 CPU 也能流畅运行 70B 级别的大模型。

    4. 🔌 OpenAI 兼容 API 服务

    llama-server 提供与 OpenAI 完全兼容的 /v1 接口,并自带简易 WebUI。你现有的基于 OpenAI SDK 的应用几乎零改动就能切换到本地模型,彻底摆脱对云服务的依赖。

    5. 🧰 丰富的推理工具链

    内置 llama-bench(性能基准测试)、llama-perplexity(困惑度评估)、llama-quantize(模型量化)以及基于 GBNF 语法的约束解码(强制输出 JSON / 特定格式),覆盖从评测到生产的完整链路。

    🎯 典型使用场景

    场景一:在笔记本 / 手机上本地聊天,隐私数据不出端

    下载一个量化后的 Qwen 或 Gemma 模型,用 llama-cli 即可在断网环境下与 AI 对话。所有数据都在本地处理,特别适合处理合同、代码、笔记等敏感内容。

    场景二:自建私有 OpenAI 兼容推理服务

    在内网或离线环境中启动 llama-server,把本地模型包装成标准 API。前端应用、RAG 系统、Agent 框架(如 LangChain、Dify)都能直接对接,既保证数据合规,又省下云推理费用。

    llama-server -m models/qwen2.5-7b-instruct-q4_k_m.gguf --port 8080

    场景三:边缘设备与嵌入式部署

    在树莓派、工控机、车载设备上编译运行 llama.cpp,为 IoT 场景提供离线语音助手、本地知识问答等能力。配合量化技术,几百 MB 内存即可驱动一个可用的小模型。

    💡 推荐理由

    作为一名经常折腾本地大模型的开发者,我对 llama.cpp 的感情可以用「基石」二字形容。在它出现之前,想本地跑一个开源模型意味着安装几十 GB 的 PyTorch 环境,且基本只能在高端显卡上跑;llama.cpp 用纯 C/C++ 把这件事拉到了「人人可玩」的门槛。

    我的几点使用心得:

    • 它是整个生态的地基:Ollama、LM Studio、Jan、Open WebUI 乃至无数上层应用,底层推理几乎都调用了 llama.cpp。理解它,就理解了「本地 AI」的半壁江山。
    • 量化是性价比之王:7B 模型用 Q4_K_M 量化后体积不到 5GB,在普通笔记本上就能达到可用速度,是入门本地模型的最佳起点。
    • OpenAI 兼容接口太省心:一条 llama-server 命令就把本地模型变成标准 API,让我能把线上项目无痛切换到离线环境做.demo或内网部署。
    • 更新极快、社区极活跃:几乎每周都有新后端、新量化方法的合并,119K+ 的 Stars 背后是庞大而健康的贡献者群体。

    如果你想真正搞懂「大模型是怎么在本地跑起来的」,llama.cpp 是 2026 年依旧最值得 clone 一份源码、逐行读一读的开源项目。

    📥 下载地址

    🌐 官方网站:https://llama.app

    📦 GitHub 仓库:https://github.com/ggml-org/llama.cpp

    📚 官方文档:github.com/ggml-org/llama.cpp/docs

    🤗 GGUF 模型库:huggingface.co/ggml-org

    🐳 Docker 镜像:ghcr.io/ggml-org/llama.cpp


    📌 本文是《GitHub 热门 AI 开源项目》系列的第 95 期,每期介绍一个热门的 AI 开源项目。欢迎关注本栏目,获取更多优质开源项目介绍!

  • vLLM —— 83K+ Stars 的 LLM 高性能推理引擎,PagedAttention 颠覆内存管理

    vLLM Logo

    vLLM — 高性能 LLM 推理与服务引擎

    ⚡ vLLM

    83K+ Stars · 面向大模型的高吞吐量、内存高效推理与服务引擎

    📌 项目简介

    vLLM 是由加州大学伯克利分校 Sky Computing Lab 发起、现由 2800+ 贡献者共同维护的开源 LLM 推理与服务引擎。其核心竞争力在于首创的 PagedAttention 技术,通过智能管理注意力键值内存,大幅降低内存碎片,将 GPU 利用率推向极限。无论是本地开发调试,还是生产级大规模部署,vLLM 都是当前最热门的推理加速选择。

    83K+
    GitHub Stars

    2.8K+
    贡献者

    200+
    支持模型架构

    🛠️ 安装要求与过程

    环境要求:

    • Python 3.10+(推荐 3.12+)
    • NVIDIA GPU(CUDA 12.9/13.x)或 AMD GPU(ROCm)
    • 也支持 CPU、Google TPU、Apple Silicon 等多种硬件
    # 推荐用 uv 安装(更快更可靠)

    uv pip install vllm

    # 或用 pip

    pip install vllm

    # 快速启动 OpenAI 兼容 API 服务

    python -m vllm.entrypoints.openai.api_server \
    –model Qwen/Qwen3-8B –port 8000

    🚀 核心功能

    ⚡ PagedAttention 内存管理

    将注意力键值内存分页管理,类似操作系统的虚拟内存机制,大幅减少内存碎片和冗余复制,内存利用率提升 2-4 倍。

    🔄 持续批处理 + 前缀缓存

    动态合并正在处理的请求,并复用相同前缀(如 system prompt)的计算结果,吞吐量提升 3-5 倍。

    🧩 200+ 模型架构原生支持

    无缝兼容 Hugging Face 主流模型,涵盖 Llama、Qwen、DeepSeek-V3、Gemma、Mixtral、LLaVA 等,开箱即用。

    🔧 丰富量化方案

    支持 FP8、INT8、INT4、AWQ、GPTQ、GGUF 等主流量化格式,在保持精度的同时大幅降低显存占用和推理延迟。

    🌐 OpenAI 兼容 API

    提供与 OpenAI API 完全兼容的接口,只需改一行代码即可从 OpenAI 切换到自托管 vLLM,零迁移成本。

    💡 典型使用场景

    场景一:私有化部署大模型 API 服务

    企业希望在内部环境部署 Qwen 或 Llama 大模型,提供类似 OpenAI 的 API 供业务系统调用。vLLM 可在单张 H100 上实现远超传统方案的吞吐量,显著降低推理成本。

    场景二:本地开发与环境调试

    开发者在本地机器上调试 Prompt 或测试 Agent 工作流,需要快速启动一个兼容 OpenAI SDK 的本地服务。vLLM 一条命令即可启动,支持流式输出和工具调用。

    场景三:多模态模型推理服务

    需要部署 LLaVA、Qwen-VL 等多模态模型,同时处理文本和图像输入。vLLM 对多模态模型提供原生支持,统一的 API 接口让多模态应用开发更加便捷。

    ✨ 推荐理由

    vLLM 是目前 LLM 推理领域最炙手可热的开源项目,没有之一。它的核心竞争力在于 PagedAttention——这项技术直接解决了 LLM 推理中内存管理效率低下的痛点,是业界首个将操作系统虚拟内存思想引入注意力机制的工作,还发表了 SOSP 2023 学术论文。

    实际使用下来,vLLM 最让人省心的是「开箱即用」——Hugging Face 模型直接加载,OpenAI API 直接兼容,量化方案直接配置。对于想把大模型「跑起来」的团队,vLLM 是目前最成熟、社区最活跃的选择。

    值得一提的是,vLLM 的社区生态极其繁荣,AWS、NVIDIA、AMD、Google Cloud 等巨头均在赞助其开发。这意味着 vLLM 不仅是一个开源项目,更正在成为 AI 推理层的事实标准

    📥 下载地址

    License: Apache 2.0 | 语言: Python | 最初开发: UC Berkeley Sky Computing Lab

  • vLLM:80.7k Stars!高性能LLM推理引擎,让AI模型部署不再成为瓶颈

    vLLM:80.7k Stars!高性能LLM推理引擎,让AI模型部署不再成为瓶颈





    vLLM:80.7k Stars!高性能LLM推理引擎,让AI模型部署不再成为瓶颈

    vLLM Logo

    vLLM – 高性能LLM推理与服务引擎


    📝 项目简介

    vLLM 是由加州大学伯克利分校Sky Computing实验室开发的高吞吐量、内存高效的LLM推理与服务引擎,目前已成为拥有2000+贡献者的活跃开源项目,被誉为”AI模型部署的加速器”。


    ⚙️ 安装要求和过程

    环境要求

    • 操作系统:Linux(推荐)或 macOS/Windows(需WSL2)
    • Python版本:3.8 – 3.11
    • GPU:NVIDIA GPU(CUDA 7.0+)或 AMD GPU(ROCm 5.6+)
    • 内存:建议16GB+ RAM

    快速安装

    # 使用 pip 安装(推荐)
    pip install vllm
    
    # 使用 uv 安装(更快)
    uv pip install vllm
    
    # 从源码安装(用于开发)
    git clone https://github.com/vllm-project/vllm.git
    cd vllm
    pip install -e .

    💡 提示:安装前建议先查看官方安装指南,选择与你的硬件和系统匹配的安装方式。


    ✨ 核心功能

    1. 业界领先的推理吞吐量

    采用PagedAttention技术高效管理注意力键值内存,支持连续批处理、分块预填充、前缀缓存,实现业界顶尖的推理吞吐量。

    2. 广泛的模型与硬件兼容性

    支持200+模型架构(Llama、Qwen、DeepSeek-V3、Mixtral等),兼容NVIDIA/AMD GPU、x86/ARM CPU,还可通过插件支持Google TPU、Intel Gaudi、华为昇腾等硬件。

    3. 丰富的推理优化技术

    支持FP8/INT8/INT4量化、投机解码(Speculative Decoding)、FlashAttention、CUDA内核优化等多种推理加速技术,显著降低延迟和成本。

    4. OpenAI兼容API服务

    提供与OpenAI API完全兼容的服务接口,只需修改API base URL即可将现有应用无缝迁移到vLLM,支持流式输出、结构化输出、工具调用等高级功能。

    5. 分布式推理支持

    支持张量并行、流水线并行、数据并行、专家并行、上下文并行等多种分布式推理策略,可轻松扩展到大模型和多GPU场景。


    🎯 典型使用场景

    场景一:自建私有化AI推理服务

    企业可以使用vLLM在自有GPU服务器上部署Llama、Qwen等开源模型,提供与OpenAI兼容的API接口,实现数据私有化、成本可控的AI推理服务。相比调用公有云API,可节省70%以上的成本。

    场景二:AI应用高性能后端

    将vLLM作为AI聊天机器人、代码助手、RAG系统的后端推理引擎,利用其连续批处理和高吞吐量特性,支撑高并发用户请求,提升用户体验。

    场景三:多模型推理服务统一平台

    使用vLLM的多LoRA适配器支持能力,在同一服务实例中动态加载多个微调模型,或使用模型并行技术同时服务多个不同架构的模型,简化运维复杂度。


    💡 推荐理由

    作为一个经常跟大模型打交道的开发者,我深刻体会到模型推理部署是AI应用落地的最大瓶颈之一。直到遇见vLLM,这个问题终于有了优雅的解决方案。

    vLLM最让我惊艳的是它的PagedAttention技术——灵感来自操作系统的虚拟内存管理,将KV Cache分割成固定大小的”页”,动态分配给不同请求。这让GPU内存利用率从传统的40-60%飙升到80%以上,吞吐量提升了2-4倍!

    另外,vLLM的OpenAI兼容API设计太贴心了。我只需要改一行代码(把API base URL从api.openai.com改成localhost:8000),整个应用就迁移到了自部署的模型上,零改动成本。

    如果你正在为AI推理成本发愁,或者需要私有化部署大模型,vLLM绝对是首选方案。目前已有数千家企业在生产环境使用vLLM,包括Meta、Google、腾讯等巨头,成熟度完全不用担心。


    📥 下载地址


    📌 本文由 WorkBuddy AI 自动采集撰写,原文首发于 admin.hiyoho.com