
📌 项目简介
DwarfStar(简称 ds4)是 Redis 作者 antirez(Salvatore Sanfilippo)开源的一个原生本地推理引擎,专门为 DeepSeek V4 Flash / PRO 与 GLM 5.2 这类开源权重打造。它不追求做成通用 GGUF 运行器,而是把模型加载、分词、工具调用、KV 缓存、HTTP 服务乃至内置编码智能体垂直打通、一起调优;整个引擎用纯 C 编写、单文件二进制、零外部运行时依赖,在 Metal / CUDA / ROCm 三大后端上都能跑。

⚙️ 安装要求和过程
环境要求
- 硬件后端:Apple Silicon(Metal,96 GB 以上内存最佳,小内存可走 SSD 流式加载);NVIDIA CUDA 显卡(含 DGX Spark / GB10 多卡);AMD ROCm(Strix Halo,如 Framework Desktop)。
- 工具链:C 编译器(clang / gcc);CUDA 需
nvcc,ROCm 需hipcc。仅依赖系统工具链,无外部运行时依赖。 - 模型权重:需单独从 Hugging Face(
antirez/deepseek-v4-gguf)下载对应的 GGUF 文件,引擎不内置权重。
快速安装
# 克隆仓库
git clone https://github.com/antirez/ds4
cd ds4
# macOS(默认 Metal 后端)
make
# NVIDIA CUDA:DGX Spark / GB10
make cuda-spark
# 或通用本地 CUDA 构建
make cuda CUDA_ARCH=native
# AMD ROCm(Strix Halo / Framework Desktop,gfx1151)
make rocm
# CPU 参考 / 调试路径(非生产用途)
make cpu
下载模型权重
# 下载一个主模型(推荐 imatrix 版)
./download_model.sh ds4f-q2 # 96 / 128 GB 内存机器
./download_model.sh ds4f-q2-q4 # 末 6 层专家用 q4
./download_model.sh ds4f-q4 # ≥ 256 GB 内存
./download_model.sh ds4f-mxfp4 # 原生 MXFP4 专家,约 156 GB
./download_model.sh pro-q2-imatrix # 512 GB 内存,PRO q2 imatrix 量化
运行
# 单条提示
./ds4 -p "用一段话解释 Redis Stream。"
# 进入多轮交互式对话
./ds4
ds4> /help
# 启动 OpenAI / Anthropic 兼容的本地服务
./ds4-server --ctx 100000 --kv-disk-dir /tmp/ds4-kv --kv-disk-space-mb 8192
✨ 核心功能

- 贴近模型的「专用」引擎:不为通用 GGUF 设计,模型加载 / 分词 / 工具调用 / KV 缓存 / HTTP 服务 / 编码智能体垂直打通,针对少数量身优化的开源权重做专项调优。
- 三大后端原生加速:Metal(主战场,Mac 96 GB+)、NVIDIA CUDA(含多卡 / DGX Spark)、ROCm(Strix Halo);内存不足的机器还能用 SSD 流式加载权重。
- 分布式推理:管道并行把多台机器的内存叠加起来跑更大的模型;基于 RDMA 的张量并行甚至能让两台 128 GB MacBook 合力运行 4-bit 的 DeepSeek Flash 或 GLM 5.2。
- 内置原生编码智能体:推理由智能体内部直接驱动、没有 socket / API 边界,会话本身就是磁盘上的 KV 缓存;工具调用走原生 LLM 格式,延迟极低、KV 永不错位,还能用
/save/switch续上历史会话。 - OpenAI / Anthropic 兼容服务:
ds4-server提供/v1/chat/completions、/v1/responses等端点,支持多会话批处理与磁盘 KV 缓存,可完全私有化部署。

实测参考(q2 量化,意大利语长文本输入):MacBook Pro M5 Max(128 GB,Metal)在 2K 上下文下预填约 790 t/s、生成约 39 t/s;DGX Spark GB10 预填可达 826 t/s。128 GB 内存即可流畅跑 DeepSeek V4 Flash。
🎯 典型使用场景

- 个人高端 Mac / 工作站本地跑强模型:MacBook M5 Max、Mac Studio M3 Ultra、DGX Spark、Framework Desktop 用户,无需联网、隐私不出本机即可使用 DeepSeek V4 级别的大模型。
- 把闲置旧 CUDA 卡变成多用户服务器:借助 CUDA 多卡与
ds4-server的微批处理,把不再被 vLLM 支持的旧 Ada 架构显卡(如 8×L40S)改造成公司内部的多用户 LLM 服务。 - 企业内网私有化部署:用 OpenAI 兼容端点 + 磁盘 KV 缓存,配合工具调用承载客服、知识库问答、本地编码助手等智能体,数据全程不出内网。
💡 推荐理由
作为 Redis 作者的最新作品,ds4 最打动我的是它的「克制与专注」:它坦然承认自己不是万能的通用推理器,而是把一件事做到极致——让 DeepSeek V4 这类前沿开源权重在消费级 / 工作站级硬件上跑得又快又稳。对一个 C 写的单文件引擎来说,开箱即用的交互式 CLI、兼容 OpenAI 的服务端、甚至原生编码智能体全部到位,体验相当完整。
特别加分的是项目的坦诚:antirez 在 README 里明确做了「AI 全程披露」,说明代码大量借助 GPT / Claude 完成、但由人类把握方向与测试,同时也郑重致谢 llama.cpp 与 GGML——这种开源精神值得点赞。需要提醒的是,项目目前仍处快速迭代的 beta 阶段、文档也在持续补全,适合愿意折腾、想把手里高端硬件榨干的朋友尝鲜。
🔗 下载地址
- GitHub:https://github.com/antirez/ds4
- 模型权重(Hugging Face):https://huggingface.co/antirez/deepseek-v4-gguf
- 许可协议:MIT(部分 GGUF 量化逻辑沿用 llama.cpp 的 MIT 版权声明)









