标签: 模型推理

  • TensorRT LLM:NVIDIA 开源的高性能大模型推理引擎,14.2K Star

    TensorRT LLM:NVIDIA 开源的高性能大模型推理引擎,14.2K Star

    项目简介

    TensorRT LLM 是 NVIDIA 开源的高性能大语言模型(LLM)与视觉生成模型推理优化库。它在 NVIDIA GPU 上提供最先进的定制内核、运行时优化和 Python 化高层 API,能把主流开源/自研大模型的推理延迟压到更低、吞吐拉到更高——从单张 RTX 显卡到多机 NVL72 集群都能统一部署。

    TensorRT LLM

    安装要求和过程

    环境要求

    • GPU:NVIDIA GPU(推荐 Ampere / Ada / Hopper / Blackwell 架构)
    • CUDA:CUDA 13.2.1(以 README 当前 badge 为准)
    • Python:3.10 或 3.12
    • PyTorch:2.11.0
    • 系统:Linux(主要支持)、Windows、WSL2

    快速安装

    # 推荐通过 pip 安装最新 release
    pip install tensorrt_llm
    
    # 或使用预编译容器(避免环境踩坑)
    docker pull nvcr.io/nvidia/tritonserver:26.05-trtllm-python-py3
    
    # 验证安装
    trtllm-serve --help

    更复杂的源码编译或多节点部署可参考官方安装指南:Installation Guide

    核心功能

    TensorRT LLM 架构分层

    • PyTorch 原生架构:模型定义直接写 PyTorch,调试、扩展、自定义注意力/量化都更直观。
    • 高层 LLM API:一行代码从 Hugging Face 加载模型,自动编译 TensorRT engine,支持单卡、张量并行、流水线并行、专家并行。
    • State-of-the-Art 内核:针对 Attention、GEMM、MoE 等常见算子手写 CUDA kernel,充分发挥 Tensor Core 算力。
    • 丰富的高级特性:FP8/FP4/INT4 AWQ 量化、KV Cache 复用、投机解码、Prefix Caching、CUDA Graphs、Prefill-Decode 解耦等。
    • 生产级部署生态:原生兼容 NVIDIA Dynamo、Triton Inference Server,也能作为 vLLM、SGLang 等框架的后端。

    典型使用场景

    TensorRT LLM 核心优化技术

    1. 高并发在线服务

    在 H100/H200/B200 集群上部署 Llama、DeepSeek、Qwen 等模型,配合 Tensor Parallelism 和 Disaggregated Serving,把单用户延迟压到百毫秒级,同时保持数千 token/s 的聚合吞吐。

    2. 本地化推理与边缘部署

    通过 INT4/FP4 量化和 Weight-Stripped Engines,在单张 RTX 4090 或 Jetson AGX Orin 上运行 70B 级别模型,满足私有化、低功耗场景需求。

    3. Agent 与长上下文应用

    利用 Prefix Caching 和 chunked context,在多轮工具调用、RAG、代码补全等长上下文场景中显著降低首 token 时延。

    推荐理由

    TensorRT LLM 是 NVIDIA 在大模型推理领域的“官方解法”。它不是简单的封装,而是从 kernel、runtime 到 serving 的垂直优化。2025 年 3 月后项目已完全开源并迁到 GitHub 维护,社区活跃、文档详尽,对追求极致吞吐和成本控制的生产环境尤其友好。虽然硬件门槛是 NVIDIA GPU,但如果你已经在 CUDA 生态里,它基本是目前能把模型跑得最快、最省显存的工具之一。

    下载地址

  • llmfit:一条命令,算出哪些大模型能在你的电脑上跑起来

    llmfit:一条命令,算出哪些大模型能在你的电脑上跑起来

    llmfit TUI 演示

    想在本地跑大模型,却总被「这张显卡能不能带得动?」「选哪个量化档位?」劝退?llmfit 把这道难题变成了一条命令:它自动检测你的内存、CPU、GPU,再为目录里数百个模型和提供商打分,直接告诉你哪些模型能在你的机器上流畅跑起来。下方动图就是它的交互式 TUI——硬件规格在顶部,下面是所有模型按「适配度」实时排名。

    📌 项目简介

    llmfit 是一款用 Rust 编写的终端工具,能根据系统的 RAM、CPU 与 GPU 自动「量体裁衣」地为 LLM 模型选型;它会检测硬件、对每一个模型从内存适配、速度估算、模型质量、上下文长度四个维度打分,并输出真正能在你机器上跑得动的推荐清单。默认提供交互式 TUI,也支持经典 CLI 模式,兼容多 GPU、MoE 架构、动态量化,以及 Ollama / llama.cpp / MLX / Docker Model Runner / LM Studio 等本地运行时。

    🛠 安装要求和过程

    环境要求:

    • 预编译二进制,无需安装 Node.js / Python 运行时,开箱即用;
    • 支持 Windows / macOS / Linux,跨平台一致;
    • 可选:本地运行时(Ollama、llama.cpp、MLX、Docker Model Runner、LM Studio)用于实测与部署;
    • 从源码构建需要 Rust 工具链(cargo)。

    快速安装(任选其一):

    # macOS / Linux(Homebrew 预编译二进制,推荐)
    brew install AlexsJones/llmfit/llmfit
    
    # Windows(Scoop)
    scoop install llmfit
    
    # 一行脚本安装(无 sudo 时落到 ~/.local/bin)
    curl -fsSL https://llmfit.axjns.dev/install.sh | sh
    
    # Python 生态(uv / pip)
    uv tool install -U llmfit      # 或 pip install llmfit
    
    # Docker / Podman(直接出 JSON 推荐)
    docker run ghcr.io/alexsjones/llmfit
    
    # 从源码构建
    git clone https://github.com/AlexsJones/llmfit.git && cd llmfit && cargo build --release
    

    跑起来:

    llmfit            # 进入交互式 TUI,看硬件 + 全模型排名
    llmfit fit        # 命令行表格:所有模型按适配度排名
    llmfit recommend --json   # 以 JSON 输出 Top 推荐(供脚本 / Agent 消费)
    llmfit info "qwen2.5:7b"  # 单个模型的适配分析与估算依据
    llmfit bench      # 对你的运行时实测 tok/s 与首字延迟
    llmfit doctor     # 输出硬件检测报告(用于反馈问题)
    

    ✨ 核心功能

    llmfit 工作流程

    1. 硬件自动检测 + 四维评分:读取 RAM / CPU / GPU·VRAM 与本地后端,对目录里数百个模型按「内存适配、速度估算、模型质量、上下文长度」四维打分,并公开每个分数的输入依据,llmfit info 可逐项核查。
    2. TUI 交互 + CLI 脚本化:默认 TUI 实时排名、规划、模拟下载并接入社区榜单;同时提供 fit / recommend --json / info 等子命令,方便被脚本、CI 与 AI Agent 调用。
    3. 多 GPU、MoE 与动态量化:支持多卡配置与 MoE 架构(按激活参数而非总量估算显存),并会根据你的硬件动态选择最优量化档位(如 Q4 / Q8)。
    4. 本地运行时全覆盖:原生对接 Ollama、llama.cpp、MLX、Docker Model Runner、LM Studio,推荐结果可直接落地运行。
    5. 实测众包(benchmark & share):在你机器上实测 tok/s,结果先存本地、再一键以 PR 贡献回社区,让同型号硬件的人拿到「已验证 ✓」的真实数字。

    🎯 典型使用场景

    llmfit 四大评分维度

    • 本地部署前选型:拿到一台新笔记本 / 显卡,先跑 llmfit 看 7B / 14B / 32B 甚至 70B 谁能在你的显存和内存里跑、大概多快,避免「下了 3 小时发现跑不起来」的尴尬。
    • 自动化流水线 / AI Agent:在部署脚本或 Coding Agent 里调用 llmfit recommend --json --use-case coding,根据当前主机规格自动挑选可运行的编码模型,做到「按机器适配」而非写死模型名。
    • 硬件升级决策:想加内存还是换显卡?用 llmfit info 对比不同配置下目标模型的适配与速度估算,量化升级带来的收益再下单。

    💡 推荐理由

    本地跑大模型最让人头大的就是「选型玄学」——参数规模、量化、上下文、显存、内存交织在一起,靠经验猜十次翻车八次。llmfit 把这件事变成了可解释、可验证的工程问题:它不只给结论,还把每个估算的输入摊开给你看,并鼓励你用真实 benchmark 反哺社区。Rust 编写的单文件二进制启动极快、零运行时依赖,TUI 好看、CLI 好接,是个人本地 AI 实验室和企业内网「该跑哪个模型」决策的贴心小助手。30K+ Star、MIT 协议、隐私默认(不联网不上传),值得收藏。

    🔗 下载地址

  • KTransformers:让消费级显卡跑起 DeepSeek 的异构推理引擎

    KTransformers:让消费级显卡跑起 DeepSeek 的异构推理引擎

    KTransformers

    项目简介

    KTransformers 是清华大学 MADSys 实验室联合 Approaching.AI 等团队开源的大模型异构推理与微调框架。它最出圈的能力,是让一块 24GB 显存的消费级显卡(如 RTX 4090)也能流畅运行 DeepSeek-V3 / R1 这类数百 GB 的巨型 MoE 模型——把”热专家”放在 GPU、”冷专家”卸载到 CPU/内存,配合 INT4/INT8/FP8 量化与 AMX/AVX 指令集优化,在本地把推理速度做到可用甚至惊艳。

    安装要求和过程

    环境要求:

    • Python 3.10 / 3.11 / 3.12(官方预编译 wheel 支持这三个版本)
    • Linux x86-64(manylinux_2_17),CPU 需支持 AVX2(Intel Haswell 2013+ / AMD Zen+ 及以上)
    • 可选 NVIDIA GPU,计算能力 8.0+(Ampere / Ada / Hopper,如 A100、RTX 3090/4090、H100);无需安装 CUDA toolkit,静态 CUDA 运行时已内置
    • 运行超大规模 MoE(如 DeepSeek-V3/R1)时,建议 64GB~382GB 内存用于专家卸载

    快速安装(PyPI,推荐大多数用户):

    pip install kt-kernel

    一行命令即装好含自动 CPU 检测、多指令集变体与 CUDA 加速的推理内核,无需编译。验证安装:

    kt version          # 查看 CLI 版本与检测到的 CPU 变体
    python -c "from kt_kernel import KTMoEWrapper; print('ok')"

    从源码编译(需要自定义 / AMD BLIS / ARM KML 后端):

    git clone https://github.com/kvcache-ai/ktransformers.git
    cd ktransformers/kt-kernel
    git submodule update --init --recursive
    ./install.sh        # 自动检测 CPU 并 -march=native 编译

    一条命令跑起来(自动适配硬件):

    kt run m2           # 启动模型推理服务(自动优化参数)
    kt chat             # 另开终端开始对话

    核心功能

    • CPU-GPU 异构推理(expert offload):把 Mixture-of-Experts 中高频访问的”热专家”留在 GPU,低频”冷专家”卸载到 CPU 与内存,显存占用从数十 GB 降到单卡 24GB 即可跑 DeepSeek-R1/V3。
    • 多指令集深度优化内核:内置 AMX(Intel Sapphire Rapids+)、AVX512(含 BF16/VNNI/VBMI)、AVX2 等多套 CPU 内核变体,运行时按 CPU 自动选择,并支持原生 FP8/BF16/INT4 精度。
    • 量化与长上下文:支持 CPU 侧 INT4/INT8 量化权重与 GPU 侧 GPTQ,配合 unsloth 1.58/2.51bit 与 IQ1_S/FP8 混合权重;可在 24GB 显存下放飞 139K+ 长上下文。
    • 微调(SFT)× LLaMA-Factory:支持在有限显存上对 DeepSeek-V3/R1、Qwen3-MoE 等超大 MoE 做 LoRA 微调,官方称比 ZeRO-Offload 快 6~12 倍、CPU 内存减半。
    • 生产级集成:提供干净的 Python API,可无缝接入 SGLang 做生产部署,实现”热专家 GPU / 冷专家 CPU”的异构服务。

    KTransformers × LLaMA-Factory 超大 MoE 微调

    图:KTransformers × LLaMA-Factory 在有限显存上微调超大 MoE 模型

    典型使用场景

    • 本地私有化跑 DeepSeek 满血版:开发者用一台配 24GB 显卡 + 大内存的主机,本地部署 DeepSeek-R1/V3 做代码助手、知识库问答,数据不出机器。
    • 高并发推理服务:在 8×L20 + Xeon 的服务器上,官方实测 DeepSeek-R1-0528(FP8)总吞吐 227.85 tokens/s、8 路并发输出 87.58 tokens/s,适合中小团队自建推理网关。
    • 超大模型低成本微调:用 4×RTX 4090 对 DeepSeek-V3 做 LoRA 微调(约 80GB 显存、3.7 it/s),或用单张 4090 微调 Qwen3-30B-A3B(8+ it/s),把训练成本打到消费级。

    推荐理由

    大模型推理的门槛,过去被”显存”死死卡住——想本地跑 DeepSeek 满血版,要么堆 H100 要么云上烧钱。KTransformers 的价值正在于此:它不跟你拼硬件,而是用异构调度 + 量化 + CPU 指令集优化把”不可能”变成”在家就能跑”。对预算有限的个人开发者、想做私有化部署的小团队、以及研究 MoE 推理优化的工程师来说,它是目前最务实的本地推理方案之一。

    工程上它也很”乖”:从 pip install kt-kernelkt run 一条命令起服务,内置 CPU 变体自动检测、NUMA 感知线程池,连 CUDA toolkit 都不用装。唯一的代价是——它目前主要面向 Linux x86-64,且吃内存(专家卸载越多越吃),上 Windows 原生或低内存机器要谨慎。但瑕不掩瑜,如果你想体验”把大模型装进自己电脑”,KTransformers 值得第一个试。

    下载地址

    许可:Apache-2.0 | 语言:Python / C++ | 维护:清华大学 MADSys 实验室、Approaching.AI、9#AISoft 及社区

  • Hugging Face Transformers – 161K+ Stars,现代AI开发的基石框架,统一百万预训练模型调用标准

    Hugging Face Transformers – 161K+ Stars,现代AI开发的基石框架,统一百万预训练模型调用标准

    Hugging Face Transformers

    GitHub OpenGraph Preview

    🤗 项目简介

    Hugging Face Transformers 是现代AI开发的基石框架,为文本、视觉、音频和多模态模型提供统一的模型定义标准,支持推理与训练全流程。只需掌握3个核心类,即可调用Hugging Face Hub上超过100万个预训练模型检查点。

    161K+
    GitHub Stars
    1M+
    预训练模型
    500+
    模型架构
    3
    核心类

    ⚙️ 安装要求与过程

    环境要求:

    • Python 3.10+
    • PyTorch 2.4+(或 JAX/TensorFlow 2.0+)
    • CUDA(可选,用于GPU加速)

    快速安装:

    # 使用 pip 安装(推荐)
    pip install "transformers[torch]"
    
    # 使用 uv 安装(更快)
    uv pip install "transformers[torch]"
    
    # 从源码安装最新版
    git clone https://github.com/huggingface/transformers.git
    cd transformers
    pip install '.[torch]'

    验证安装:

    import transformers
    print(transformers.__version__)  # 输出版本号即成功

    🚀 核心功能

    1. 统一的模型定义框架 🏗️

    Transformers 提供了统一的模型定义标准,只要模型被支持,就能兼容绝大多数训练框架(Axolotl、Unsloth、DeepSpeed等)、推理引擎(vLLM、SGLang、TGI等)以及相邻建模库(llama.cpp、mlx等)。

    2. 极简API设计 🎯

    只需学习 AutoModelAutoTokenizerPipeline 三个核心类,即可使用Hugging Face Hub上超过100万个预训练模型,覆盖NLP、CV、音频、多模态等任务。

    3. 跨框架无缝切换 🔄

    支持在PyTorch、JAX、TensorFlow 2.0之间随意切换模型,可针对不同阶段(训练、评估、生产)选择最合适的框架,3行代码即可训练前沿模型。

    4. 全模态Pipeline支持 🎨

    提供高层推理API Pipeline,支持文本生成、图像分类、音频识别、视频理解等多模态任务,自动处理输入预处理并返回对应输出。

    5. 高度可定制与可复现 🔬

    提供每个架构的官方结果复现示例,模型内部结构尽可能统一暴露,模型文件可脱离库独立使用,方便快速实验和研究。

    💡 典型使用场景

    场景一:快速原型开发 🏃

    使用Pipeline API,3行代码即可完成文本分类、命名实体识别、文本生成、图像分类等任务。无需关心模型架构细节,直接调用SOTA模型进行推理。

    from transformers import pipeline
    
    # 文本生成
    generator = pipeline("text-generation", model="gpt2")
    result = generator("AI will", max_length=50)
    
    # 图像分类
    classifier = pipeline("image-classification", model="google/vit-base-patch16-224")
    result = classifier("cat.jpg")

    场景二:模型微调与训练 🎓

    基于预训练模型进行下游任务微调,利用Hugging Face Trainer API或Accelerate库,轻松实现分布式训练和混合精度训练,大幅降低计算成本。

    from transformers import AutoModelForSequenceClassification, Trainer, TrainingArguments
    
    model = AutoModelForSequenceClassification.from_pretrained("bert-base-uncased")
    training_args = TrainingArguments(output_dir="./results", num_train_epochs=3)
    trainer = Trainer(model=model, args=training_args, train_dataset=dataset)
    trainer.train()

    🌟 推荐理由

    Hugging Face Transformers 是现代AI开发的”基础设施”,几乎每个AI开发者都或多或少用过它。它不仅提供了统一的模型定义标准,更重要的是构建了一个庞大的生态系统——Hugging Face Hub上超过100万个预训练模型,覆盖了从BERT到GPT、从ViT到CLIP、从Whisper到Llama的所有主流模型。

    作为一个AI开发者,掌握Transformers库是必修课。它的API设计非常优雅,只需3个核心类就能玩转绝大多数SOTA模型。而且,它对PyTorch/JAX/TF的跨框架支持,让你可以在不同场景下灵活选择最合适的后端。无论你是做研究还是做应用,Transformers都是不可或缺的工具。

    📄 许可证:Apache License 2.0(允许商业使用)
    💻 主要语言:Python
    🏢 开发方:Hugging Face Team