标签: DeepSeek

  • DwarfStar (ds4):antirez 打造的 DeepSeek V4 原生本地推理引擎

    DwarfStar (ds4):antirez 打造的 DeepSeek V4 原生本地推理引擎

    DwarfStar ds4

    📌 项目简介

    DwarfStar(简称 ds4)是 Redis 作者 antirez(Salvatore Sanfilippo)开源的一个原生本地推理引擎,专门为 DeepSeek V4 Flash / PROGLM 5.2 这类开源权重打造。它不追求做成通用 GGUF 运行器,而是把模型加载、分词、工具调用、KV 缓存、HTTP 服务乃至内置编码智能体垂直打通、一起调优;整个引擎用纯 C 编写、单文件二进制、零外部运行时依赖,在 Metal / CUDA / ROCm 三大后端上都能跑。

    DwarfStar 项目速览

    ⚙️ 安装要求和过程

    环境要求

    • 硬件后端:Apple Silicon(Metal,96 GB 以上内存最佳,小内存可走 SSD 流式加载);NVIDIA CUDA 显卡(含 DGX Spark / GB10 多卡);AMD ROCm(Strix Halo,如 Framework Desktop)。
    • 工具链:C 编译器(clang / gcc);CUDA 需 nvcc,ROCm 需 hipcc。仅依赖系统工具链,无外部运行时依赖
    • 模型权重:需单独从 Hugging Face(antirez/deepseek-v4-gguf)下载对应的 GGUF 文件,引擎不内置权重。

    快速安装

    # 克隆仓库
    git clone https://github.com/antirez/ds4
    cd ds4
    
    # macOS(默认 Metal 后端)
    make
    
    # NVIDIA CUDA:DGX Spark / GB10
    make cuda-spark
    # 或通用本地 CUDA 构建
    make cuda CUDA_ARCH=native
    
    # AMD ROCm(Strix Halo / Framework Desktop,gfx1151)
    make rocm
    
    # CPU 参考 / 调试路径(非生产用途)
    make cpu

    下载模型权重

    # 下载一个主模型(推荐 imatrix 版)
    ./download_model.sh ds4f-q2          # 96 / 128 GB 内存机器
    ./download_model.sh ds4f-q2-q4       # 末 6 层专家用 q4
    ./download_model.sh ds4f-q4          # ≥ 256 GB 内存
    ./download_model.sh ds4f-mxfp4       # 原生 MXFP4 专家,约 156 GB
    ./download_model.sh pro-q2-imatrix   # 512 GB 内存,PRO q2 imatrix 量化

    运行

    # 单条提示
    ./ds4 -p "用一段话解释 Redis Stream。"
    
    # 进入多轮交互式对话
    ./ds4
    ds4> /help
    
    # 启动 OpenAI / Anthropic 兼容的本地服务
    ./ds4-server --ctx 100000 --kv-disk-dir /tmp/ds4-kv --kv-disk-space-mb 8192

    ✨ 核心功能

    DwarfStar 核心能力

    1. 贴近模型的「专用」引擎:不为通用 GGUF 设计,模型加载 / 分词 / 工具调用 / KV 缓存 / HTTP 服务 / 编码智能体垂直打通,针对少数量身优化的开源权重做专项调优。
    2. 三大后端原生加速:Metal(主战场,Mac 96 GB+)、NVIDIA CUDA(含多卡 / DGX Spark)、ROCm(Strix Halo);内存不足的机器还能用 SSD 流式加载权重。
    3. 分布式推理:管道并行把多台机器的内存叠加起来跑更大的模型;基于 RDMA 的张量并行甚至能让两台 128 GB MacBook 合力运行 4-bit 的 DeepSeek Flash 或 GLM 5.2。
    4. 内置原生编码智能体:推理由智能体内部直接驱动、没有 socket / API 边界,会话本身就是磁盘上的 KV 缓存;工具调用走原生 LLM 格式,延迟极低、KV 永不错位,还能用 /save /switch 续上历史会话。
    5. OpenAI / Anthropic 兼容服务ds4-server 提供 /v1/chat/completions/v1/responses 等端点,支持多会话批处理与磁盘 KV 缓存,可完全私有化部署。

    DwarfStar 性能实测

    实测参考(q2 量化,意大利语长文本输入):MacBook Pro M5 Max(128 GB,Metal)在 2K 上下文下预填约 790 t/s、生成约 39 t/s;DGX Spark GB10 预填可达 826 t/s。128 GB 内存即可流畅跑 DeepSeek V4 Flash。

    🎯 典型使用场景

    DwarfStar 适用场景

    1. 个人高端 Mac / 工作站本地跑强模型:MacBook M5 Max、Mac Studio M3 Ultra、DGX Spark、Framework Desktop 用户,无需联网、隐私不出本机即可使用 DeepSeek V4 级别的大模型。
    2. 把闲置旧 CUDA 卡变成多用户服务器:借助 CUDA 多卡与 ds4-server 的微批处理,把不再被 vLLM 支持的旧 Ada 架构显卡(如 8×L40S)改造成公司内部的多用户 LLM 服务。
    3. 企业内网私有化部署:用 OpenAI 兼容端点 + 磁盘 KV 缓存,配合工具调用承载客服、知识库问答、本地编码助手等智能体,数据全程不出内网。

    💡 推荐理由

    作为 Redis 作者的最新作品,ds4 最打动我的是它的「克制与专注」:它坦然承认自己不是万能的通用推理器,而是把一件事做到极致——让 DeepSeek V4 这类前沿开源权重在消费级 / 工作站级硬件上跑得又快又稳。对一个 C 写的单文件引擎来说,开箱即用的交互式 CLI、兼容 OpenAI 的服务端、甚至原生编码智能体全部到位,体验相当完整。

    特别加分的是项目的坦诚:antirez 在 README 里明确做了「AI 全程披露」,说明代码大量借助 GPT / Claude 完成、但由人类把握方向与测试,同时也郑重致谢 llama.cpp 与 GGML——这种开源精神值得点赞。需要提醒的是,项目目前仍处快速迭代的 beta 阶段、文档也在持续补全,适合愿意折腾、想把手里高端硬件榨干的朋友尝鲜。

    🔗 下载地址

  • DeepSeek-Reasonix:围绕前缀缓存稳定性打造的 DeepSeek 原生终端 AI 编程智能体

    DeepSeek-Reasonix:围绕前缀缓存稳定性打造的 DeepSeek 原生终端 AI 编程智能体

    DeepSeek-Reasonix 核心亮点

    DeepSeek-Reasonix(npm 包名 reasonix)是一个深度围绕 DeepSeek 前缀缓存稳定性打造的开源终端 AI 编程智能体:把 Agent 跑成长会话也不心疼 token,单文件 Go 二进制即装即用。

    📊 项目速览

    • ⭐ Stars:30.6K | Fork:1.97K | 语言:Go | 协议:MIT | 首个版本:2026-04
    • 🏷️ 定位:终端 / TUI / 桌面 / VS Code 四端共用同一本地引擎的 Coding Agent
    • 🔗 官网:https://reasonix.io/

    🔧 安装要求与过程

    环境要求

    • 支持 macOS / Linux / Windows(amd64 与 arm64)
    • 方式 A 需 Node.js(用于 npm)或 macOS 上的 Homebrew;方式 D 源码编译需 Go 工具链
    • 一个 DeepSeek(或任意 OpenAI 兼容)API Key,通过 reasonix setup 配置

    快速安装(推荐 CLI / TUI)

    # 任意系统,拉取预编译原生二进制
    npm i -g reasonix
    
    # 或 macOS 用 Homebrew
    brew install esengine/reasonix/reasonix

    其他安装方式:① 桌面端 到官网下载页取 .dmg/.exe/.deb/.tar.gz;② VS Code 扩展 在 Marketplace 搜 SivanLiu.reasonix-agent;③ 源码编译

    git clone https://github.com/esengine/DeepSeek-Reasonix.git
    cd DeepSeek-Reasonix
    make build      # -> bin/reasonix
    make cross      # -> dist/ (darwin|linux|windows x amd64|arm64)

    三步上手

    reasonix setup                      # 配置 provider 与模型
    reasonix                            # 启动交互式会话
    reasonix run "implement the TODOs in main.go"   # 一次性跑任务

    交互会话里执行 /init 可让 Reasonix 自动生成项目说明文件。

    ✨ 核心功能

    1. 配置驱动:Provider、Agent、启用的工具与插件全部声明在 reasonix.toml,没有任何硬编码模型,换模型只是改一行配置。
    2. 多模型可组合:DeepSeek 是预置项;任意 OpenAI 兼容端点都是一条配置而非新代码;还可让两个模型(执行器 + 规划器)在各自缓存稳定的会话里协同工作。
    3. 插件驱动:外部工具以子进程方式经 stdio JSON-RPC 运行(兼容 MCP 协议);内置工具在编译期自注册,扩展能力零摩擦。
    4. 缓存感知的上下文维护:启动时注入一份稳定的环境摘要,压缩摘要前先裁剪陈旧的工具输出,让长会话的前缀缓存命中率保持高位、token 成本维持低位。
    5. 零摩擦分发CGO_ENABLED=0 产出单文件静态二进制,一条命令交叉编译到 6 个平台目标,唯一的外部依赖只是一个 TOML 解析器。

    🎯 典型使用场景

    • 长会话大型重构:把 Reasonix 一直开着,前缀缓存让「边聊边改」一整天也花不了多少 token;适合跨多文件的模块重构与迁移。
    • 双模型协作攻坚:用 DeepSeek 当执行器、再挂一个规划器模型,分别在缓存稳定的会话里做「想」与「做」的分工,复杂任务更稳。
    • 纯终端原生工作流:无需 IDE,命令行直接驱动;需要时也能借 VS Code 扩展获得编辑器上下文、工具调用审批与模型切换。

    💡 推荐理由

    我比较看重它三点:一是真的为 DeepSeek 优化过——前缀缓存稳定性不是口头标语,长会话成本明显比通用 Agent 低;二是单文件二进制零运行时依赖,在公司受限环境或远程机器上一拷就能跑,比一堆 Node/Python 依赖的 Agent 省心;三是配置与插件都走开放协议(TOML + MCP 兼容),不锁死模型,想接哪个 OpenAI 兼容端点都行。要说短板,项目 2026 年 4 月才起步,生态与社区体量还比不上 Claude Code / Cursor 那类老牌选手,但长势很猛(上线数月已 30K+ Star)。如果你常驻终端、又想用便宜强推理的 DeepSeek 干活,它值得一试。

    📥 下载地址

  • Pi Agent Harness:81K Star 的极简终端 AI 编程智能体,四个工具 + 无限扩展

    Pi Agent Harness:81K Star 的极简终端 AI 编程智能体,四个工具 + 无限扩展

    Pi 交互模式:顶部启动信息、消息区、编辑器与状态栏一目了然
    Pi 交互模式:顶部启动信息、消息区、编辑器与状态栏一目了然

    Pi(Pi Agent Harness)libGDX 作者 Mario Zechner(badlogic)团队 earendil-works 开源的极简终端 AI 编程智能体框架:核心只给模型 read / write / edit / bash 四个工具,其余能力全部交给你用 TypeScript 扩展、技能、提示词模板与主题自行拼装。上线不到一年拿下 81,000+ Stars、10,000+ Fork、248 位贡献者,MIT 许可,最新版本 v0.83.0。

    一、项目简介

    一句话:Pi 是一个「你来定义工作流」的开源终端编程智能体 —— 不预设子智能体、不预设计划模式、不内置 MCP,任何你想要的能力都能用一段 TypeScript 扩展装上去,还能打包成 npm 包分享给别人。

    它同时也是一套可复用的智能体开发工具箱,仓库内含四个独立 npm 包:

    • @earendil-works/pi-coding-agent —— 交互式编程智能体 CLI(终端里直接用的那个 pi
    • @earendil-works/pi-agent-core —— 智能体运行时,负责工具调用与状态管理
    • @earendil-works/pi-ai —— 统一多厂商大模型 API(OpenAI / Anthropic / Google 等)
    • @earendil-works/pi-tui —— 带差分渲染的终端 UI 库

    也就是说:你既可以把它当 Claude Code / Codex CLI 的替代品直接用,也可以只取其中一层,去写自己的智能体产品。

    二、安装要求和过程

    环境要求

    • Node.js(npm 全局安装方式)或直接用官方安装脚本下载独立二进制
    • 操作系统:macOS / Linux / Windows 均支持,另有 Termux(Android)与 tmux 专门文档
    • 模型凭据:任一支持的订阅(Claude Pro/Max、ChatGPT Plus/Pro、GitHub Copilot)或 API Key

    快速安装

    # 方式一:npm 全局安装(官方推荐加 --ignore-scripts)
    npm install -g --ignore-scripts @earendil-works/pi-coding-agent
    
    # 方式二:安装脚本(独立二进制)
    curl -fsSL https://pi.dev/install.sh | sh
    

    认证与启动

    # 用 API Key
    export ANTHROPIC_API_KEY=sk-ant-...
    pi
    
    # 或复用已有订阅:启动后输入 /login 选择服务商
    pi
    /login
    

    常用会话参数:

    pi -c              # 继续最近一次会话
    pi -r              # 浏览并选择历史会话
    pi --no-session    # 临时模式,不落盘
    pi -p "修复这个测试"  # 一次性打印模式(可配 --mode json)
    

    安装第三方能力包同样一条命令:pi install npm:@foo/pi-toolspi install git:github.com/user/repo@v1

    三、核心功能

    1. 四个内置工具 + 无限扩展的极简内核

    默认只有 readwriteeditbash。子智能体、计划模式、权限弹窗、待办列表这些别家标配的功能,Pi 一律不内置,而是让你通过扩展实现或安装现成的 Pi Package。作者的理由很直接:这些机制各家做法不同,硬塞进内核只会限制用户。

    2. TypeScript 扩展系统:连 Doom 都能跑

    export default function (pi: ExtensionAPI) {
      pi.registerTool({ name: "deploy", ... });
      pi.registerCommand("stats", { ... });
      pi.on("tool_call", async (event, ctx) => { ... });
    }
    

    扩展可以注册自定义工具(甚至替换内置工具)、自定义命令与快捷键、状态栏 / 页眉 / 页脚 / 浮层 UI、Git 自动提交检查点、SSH 与沙箱执行、权限门禁、自定义压缩策略、MCP 接入……官方示例里甚至有一个「等模型响应时玩 Doom」的扩展。

    3. 会话树:分支、回溯、克隆一个文件搞定

    Pi 的 /tree 会话树视图:任意节点回溯与分支切换
    Pi 的 /tree 会话树视图:任意节点回溯与分支切换

    会话以 JSONL 树结构存储,每条记录带 idparentId/tree 可跳回任意历史节点继续对话并在分支间切换,/fork 从某条用户消息派生新会话,/clone 复制当前分支,全部历史保留在同一个文件里。上下文快满时自动压缩(可手动 /compact 并给定压缩指令),压缩是有损的,但原始记录仍在 JSONL 中随时可回看。

    4. 30+ 模型服务商,含订阅登录与本地 llama.cpp

    订阅方式支持 Anthropic Claude Pro/Max、OpenAI ChatGPT Plus/Pro(Codex)、GitHub Copilot;API Key 方式覆盖 Anthropic、OpenAI、Azure OpenAI、DeepSeek、Google Gemini/Vertex、Amazon Bedrock、Mistral、Groq、Cerebras、xAI、OpenRouter、Vercel AI Gateway、智谱 ZAI Coding Plan(含中国区)、Kimi For Coding、MiniMax、小米 MiMo(含中国区/阿姆斯特丹/新加坡节点)、Hugging Face、Fireworks、Together AI、NVIDIA NIM、Cloudflare 等。还能通过 /login llama.cpp 接入本地 llama.cpp 路由服务器,用 /llama 直接下载和加载本地模型。

    5. 四种运行形态:交互 / 打印 / RPC / SDK

    除了终端交互,Pi 支持 -p 打印模式与 --mode json 结构化输出、--mode rpc(stdin/stdout 上的 JSONL 协议,方便非 Node 语言集成),以及直接以 SDK 方式嵌入自家应用:

    import { createAgentSession, ModelRuntime, SessionManager } from "@earendil-works/pi-coding-agent";
    
    const modelRuntime = await ModelRuntime.create();
    const { session } = await createAgentSession({
      sessionManager: SessionManager.inMemory(),
      modelRuntime,
    });
    await session.prompt("What files are in the current directory?");
    

    6. 供应链与项目信任双重加固

    直接依赖全部锁定精确版本、min-release-age=2 拒绝当天新发布的依赖、发布包内附 npm-shrinkwrap.json、CI 使用 npm ci --ignore-scripts 并定期跑 npm audit signatures。运行侧则有「项目信任」机制:首次进入含项目级配置或 .agents/skills 的目录会先询问,未信任前只加载上下文文件与用户级扩展。

    官方扩展示例:等待模型响应时在终端里跑 Doom
    官方扩展示例:等待模型响应时在终端里跑 Doom

    四、典型使用场景

    场景 1:把智能体改造成完全贴合自家流程的样子

    团队要求「每次改完代码自动跑 lint 并生成 checkpoint 提交」「部署只允许走内部 CLI」「敏感目录禁止写入」。在别的工具里这些要么等官方支持、要么 fork 源码;在 Pi 里就是三个扩展:一个 tool_call 事件钩子做路径门禁,一个注册 deploy 工具,一个在每轮结束时自动 git commit。写完丢进 .pi/extensions/ 全组共享,或打成 npm 包发出去。

    场景 2:低成本 / 国产模型 + 本地模型的日常编码

    /model(Ctrl+L)在 DeepSeek、Kimi For Coding、小米 MiMo、智谱 ZAI、MiniMax 之间随时切换,重活切 Claude / GPT,日常问答切便宜模型或 /llama 加载的本地模型;Ctrl+P 在自己圈定的「常用模型」间循环。底部状态栏实时显示输入/输出/缓存读写 Token、缓存命中率与累计花费,成本一目了然。

    场景 3:把编程智能体嵌进自己的产品或 CI

    pi-agent-core + pi-ai 做后端智能体服务,前端接 --mode rpc 或 SDK;CI 里用 pi -p --mode json 跑「自动修复失败测试」「批量迁移 API」这类任务,输出 JSON 直接被流水线消费。会话以 JSONL 存档,出问题时用 /tree 复盘整条决策链,还能 /export 成 HTML 或 /share 成私密 Gist 给同事看。

    五、推荐理由

    最近半年冒出来的 Coding Agent 多到看不过来,Pi 的差异化非常清晰:它把「克制」当成了产品特性。README 里那段 Philosophy 值得所有做 Agent 的人读一遍 —— 不做 MCP(写带 README 的 CLI 工具就够了)、不做子智能体(用 tmux 开多个 pi 实例)、不做权限弹窗(进容器)、不做内置待办(「它们会让模型犯迷糊」)。这些取舍未必人人认同,但每一条都给了替代路径,而不是简单的「不支持」。

    实际用下来最爽的两点:一是会话树,改坏了直接 /tree 回到三十轮之前换个思路继续,不用新开会话重讲一遍背景;二是扩展的门槛真的低,一个默认导出函数就是一个扩展,热重载 /reload 立刻生效,写工具的体验接近写普通 TypeScript 模块。加上原生支持 Kimi、MiMo、DeepSeek、智谱等国内可用的服务商,中文开发者上手成本很低。

    要注意的是:Pi 没有内置权限系统,默认以启动它的用户权限运行,官方明确建议放进容器或沙箱(文档给了 Gondolin 微虚机、Docker、OpenShell 三种方案);Pi Package 会执行任意代码,安装第三方包前务必看源码。另外仓库对新贡献者的 Issue/PR 默认自动关闭(维护者每天人工复核),提问前先读 CONTRIBUTING.md。

    六、下载地址

    项目数据(截至 2026 年 7 月 31 日):81,086 Stars · 10,008 Forks · 248 位贡献者 · TypeScript · MIT 许可 · 最新版本 v0.83.0 · 仓库仍在每日更新。

  • KTransformers:让消费级显卡跑起 DeepSeek 的异构推理引擎

    KTransformers:让消费级显卡跑起 DeepSeek 的异构推理引擎

    KTransformers

    项目简介

    KTransformers 是清华大学 MADSys 实验室联合 Approaching.AI 等团队开源的大模型异构推理与微调框架。它最出圈的能力,是让一块 24GB 显存的消费级显卡(如 RTX 4090)也能流畅运行 DeepSeek-V3 / R1 这类数百 GB 的巨型 MoE 模型——把”热专家”放在 GPU、”冷专家”卸载到 CPU/内存,配合 INT4/INT8/FP8 量化与 AMX/AVX 指令集优化,在本地把推理速度做到可用甚至惊艳。

    安装要求和过程

    环境要求:

    • Python 3.10 / 3.11 / 3.12(官方预编译 wheel 支持这三个版本)
    • Linux x86-64(manylinux_2_17),CPU 需支持 AVX2(Intel Haswell 2013+ / AMD Zen+ 及以上)
    • 可选 NVIDIA GPU,计算能力 8.0+(Ampere / Ada / Hopper,如 A100、RTX 3090/4090、H100);无需安装 CUDA toolkit,静态 CUDA 运行时已内置
    • 运行超大规模 MoE(如 DeepSeek-V3/R1)时,建议 64GB~382GB 内存用于专家卸载

    快速安装(PyPI,推荐大多数用户):

    pip install kt-kernel

    一行命令即装好含自动 CPU 检测、多指令集变体与 CUDA 加速的推理内核,无需编译。验证安装:

    kt version          # 查看 CLI 版本与检测到的 CPU 变体
    python -c "from kt_kernel import KTMoEWrapper; print('ok')"

    从源码编译(需要自定义 / AMD BLIS / ARM KML 后端):

    git clone https://github.com/kvcache-ai/ktransformers.git
    cd ktransformers/kt-kernel
    git submodule update --init --recursive
    ./install.sh        # 自动检测 CPU 并 -march=native 编译

    一条命令跑起来(自动适配硬件):

    kt run m2           # 启动模型推理服务(自动优化参数)
    kt chat             # 另开终端开始对话

    核心功能

    • CPU-GPU 异构推理(expert offload):把 Mixture-of-Experts 中高频访问的”热专家”留在 GPU,低频”冷专家”卸载到 CPU 与内存,显存占用从数十 GB 降到单卡 24GB 即可跑 DeepSeek-R1/V3。
    • 多指令集深度优化内核:内置 AMX(Intel Sapphire Rapids+)、AVX512(含 BF16/VNNI/VBMI)、AVX2 等多套 CPU 内核变体,运行时按 CPU 自动选择,并支持原生 FP8/BF16/INT4 精度。
    • 量化与长上下文:支持 CPU 侧 INT4/INT8 量化权重与 GPU 侧 GPTQ,配合 unsloth 1.58/2.51bit 与 IQ1_S/FP8 混合权重;可在 24GB 显存下放飞 139K+ 长上下文。
    • 微调(SFT)× LLaMA-Factory:支持在有限显存上对 DeepSeek-V3/R1、Qwen3-MoE 等超大 MoE 做 LoRA 微调,官方称比 ZeRO-Offload 快 6~12 倍、CPU 内存减半。
    • 生产级集成:提供干净的 Python API,可无缝接入 SGLang 做生产部署,实现”热专家 GPU / 冷专家 CPU”的异构服务。

    KTransformers × LLaMA-Factory 超大 MoE 微调

    图:KTransformers × LLaMA-Factory 在有限显存上微调超大 MoE 模型

    典型使用场景

    • 本地私有化跑 DeepSeek 满血版:开发者用一台配 24GB 显卡 + 大内存的主机,本地部署 DeepSeek-R1/V3 做代码助手、知识库问答,数据不出机器。
    • 高并发推理服务:在 8×L20 + Xeon 的服务器上,官方实测 DeepSeek-R1-0528(FP8)总吞吐 227.85 tokens/s、8 路并发输出 87.58 tokens/s,适合中小团队自建推理网关。
    • 超大模型低成本微调:用 4×RTX 4090 对 DeepSeek-V3 做 LoRA 微调(约 80GB 显存、3.7 it/s),或用单张 4090 微调 Qwen3-30B-A3B(8+ it/s),把训练成本打到消费级。

    推荐理由

    大模型推理的门槛,过去被”显存”死死卡住——想本地跑 DeepSeek 满血版,要么堆 H100 要么云上烧钱。KTransformers 的价值正在于此:它不跟你拼硬件,而是用异构调度 + 量化 + CPU 指令集优化把”不可能”变成”在家就能跑”。对预算有限的个人开发者、想做私有化部署的小团队、以及研究 MoE 推理优化的工程师来说,它是目前最务实的本地推理方案之一。

    工程上它也很”乖”:从 pip install kt-kernelkt run 一条命令起服务,内置 CPU 变体自动检测、NUMA 感知线程池,连 CUDA toolkit 都不用装。唯一的代价是——它目前主要面向 Linux x86-64,且吃内存(专家卸载越多越吃),上 Windows 原生或低内存机器要谨慎。但瑕不掩瑜,如果你想体验”把大模型装进自己电脑”,KTransformers 值得第一个试。

    下载地址

    许可:Apache-2.0 | 语言:Python / C++ | 维护:清华大学 MADSys 实验室、Approaching.AI、9#AISoft 及社区

  • DeepSeek 冲刺 IPO:估值一个月从 500 亿跳到 710 亿美元

    去年年初,一家叫深度求索的中国公司用极低的成本训出了能跟美国一线大模型掰手腕的模型,把整个硅谷看愣了。现在,这家公司准备把自己送上股市。

    据彭博社报道,DeepSeek 正在筹备 2027 年登陆资本市场,最早今年底就可能递交申请;与此同时,它打算新一轮融资大约 15 亿美元,估值放到 710 亿美元左右。消息出来前才一个月,DeepSeek 刚完成成立以来的第一笔外部融资——70 亿美元,估值约 500 亿美元。换句话说,它的身价在短短几周里又涨了四成多。

    一笔为上市量身定做的融资

    这轮钱跟上一轮性质不太一样。70 亿那笔是把外部投资人第一次请进股东名册,定了个 500 亿美元的基准价;这一笔 15 亿更像是上市前的”标价动作”——在真正向公众打开账本之前,先让市场知道私人资本愿意给它多少。它要的不是分散股权,而是给投行和未来的散户一个信号:这家公司值这个价。

    从 500 亿到 710 亿美元,一个月出头的工夫,估值跳了 42%。在公开市场还没给过它一个真实价格之前,这个数字更像谈判筹码,而不是定论。

    凭什么值这么多

    支撑估值的,是实打实的使用量。企业级 AI 网关 Vercel 的数据显示,今年 6 月,DeepSeek 处理的 token 占到了将近 23%,排第二;第一是 Anthropic,占 32%。一家中国开源实验室,能在一个全球开发者的入口里吃掉接近四分之一的流量,这本身就说明问题。

    更耐人寻味的是芯片。美国的出口管制卡着先进半导体,DeepSeek 的云服务却跑在华为的芯片上。它用这件事证明了一件事:即便拿不到英伟达最顶尖的货,中国团队照样能把模型能力追到美国一线实验室的几口气之内。

    DeepSeek 上市概念图
    DeepSeek 冲刺 IPO,开源模型的经济账第一次要摊开给公众看

    股东名单里站着”国家队”

    彭博社提到,DeepSeek 的投资人里已经有腾讯,以及北京的国家人工智能产业投资基金。这两家都有动力在上市前把估值推高——不管公开市场最后肯付多少钱。

    • 成立仅三年,靠”低成本训出高性能模型”出名
    • 开源权重,下载量和 token 份额都说明影响力,但收入始终没公开
    • 从幻方量化的长期支持,转向外部融资和公众披露,自由度会部分换成透明度

    当然,这个故事还有没说完的部分。DeepSeek 拒绝置评,彭博的报道也只是单方信源。等它真的披露收入、毛利、芯片投入和公司治理,710 亿美元才算接受检验。对盯着开源替代方案的人来说,DeepSeek 的估值曲线已经成了观察中国 AI 实验室怎么进公开市场的风向标。

    📎 原文来源:DeepSeek reportedly in talks to raise $1.5B, then IPO(TechCrunch / Dominic-Madori Davis)
  • 开源AI抢走流量,Anthropic凭什么还在赚大钱

    一个反直觉的现象

    上周,客服 AI 公司 Decagon 的 CEO Jesse Zhang 发了一篇长帖,标题很嚣张:”大家都搞错了企业里的开源 AI”。他抛出一个挺有意思的矛盾:在自己公司里,越来越多成熟的业务正在切到更轻量的模型上,可花在那些最贵的前沿模型上的总预算,几乎一点没少。

    这跟很多人预想的不一样。按常理,开源模型又免费又能自己部署,前沿实验室早该被冲得七零八落。但 Zhang 认为,这俩根本不是对手,更像是同一个生命周期里的两个阶段。

    前沿实验室会继续握着”发现”,开源则会一点点吃掉”生产”。

    用大白话说就是:先用贵的前沿模型把一个新场景跑通、验证它能赚钱,等路子熟了,再挪到便宜的开源模型上规模化。前端探路,后端量产,各司其职。

    数据摆出来,前沿真没吃亏

    Zhang 没给太多数据,但这种数据其实到处都是。Vercel 的 AI 网关看板显示,就这一周,DeepSeek 的 Token 量已经冲到全平台的三分之一以上,背后是 GLM-5.2 的 Z.ai 也挤进了第四。可往下滑到”总支出”那栏,Anthropic 一家还是占了半壁江山。

    OpenRouter 的故事也差不多。DeepSeek V4 Flash 每周处理 5.3 万亿 Token,是最忙的;而最火的前沿模型 Opus 4.8 才 2 万亿出头。但 Opus 每百万 Token 要 1.37 美元,V4 Flash 只要 6 美分,贵了快 23 倍。算下来,花钱的大头还是落在前沿模型手里。连英伟达刚放的 Nemotron 都还没算进去。

    开源AI与前沿模型的双层经济
    开源模型吃下了流量,前沿模型守住了利润(图:TechCrunch)

    为什么开源赢不了”钱”

    一种解释是,AI 能干的活儿增长得太快了,前沿模型只要卡住早期那些最难、最值钱的部署,就能一直待在牌桌上。另一种解释更实在:很多场景就是太难,便宜模型暂时顶不上。

    • 垂直类 AI 公司确实在往轻量模型迁移,这条预言已经应验;
    • 但”GPT 套壳”类创业公司的账,算下来还是稳的;
    • 最关键的是,按 Token 算,前沿厂商死死攥住了最值钱的”溢价 Token”价格。

    作者想起去年九月自己写过的一个比方:基础模型公司到最后可能变成给星巴克供咖啡豆的——自己是商品原料,利润全被应用层赚走。现在看,这个预言只兑现了一半。


    所以眼下的格局,很可能不是”开源干掉前沿”,而是两套玩法长期并存:前沿负责开荒,开源负责量产。只要 AI 能做的事情还在指数级扩张,两边就都还有饭吃。至于这个平衡能维持多久,大概得看下一个更难啃的场景,到底落在谁手里。

  • 2026年5月AI大模型密集发布:GPT-5.5、DeepSeek v4、Claude 4.6谁更胜一筹?

    GPT-5.5来了:OpenAI的又一次跳跃

    4月24日,OpenAI发布了GPT-5.5,官方描述是”迄今为止最智能、最直观的模型”。数字上的提升是实的:在Terminal-Bench 2.0测试中拿到82.7%,GDPval评测84.9%。

    但更值得关注的是它在Agentic coding(智能体编程)上的进步。写代码不再只是”补全下一行”,而是能自主规划多步骤任务、调用工具、自己debug。这对开发者来说,意味着AI编程助手真的从一个”聪明补全器”变成了”能一起干活的搭档”。


    DeepSeek v4:国产大模型的反击

    同一天,DeepSeek放出v4,推出Flash和Pro双版本。最炸裂的参数是1M+ token的超长上下文窗口——这意味着它可以一口气读完一整本技术手册,然后基于全书内容跟你对话。

    更妙的是它兼容OpenAI和Anthropic的SDK,开发者迁移成本几乎为零。加上本身就便宜,这波发布直接把”长上下文+低成本”的标杆拉高了。


    Claude Sonnet 4.6:接近Opus的性能,一半的价格

    3天后,Anthropic更新了Claude Sonnet 4.6和Haiku。核心卖点是”接近Opus级别的性能,但价格便宜得多”。对于已经在用Claude API做产品的团队来说,这个性价比提升是实打实的。

    这次更新还修了之前版本里推理不稳定和缓存出错的bug。对于生产环境用户来说,稳定性往往比基准测试分数更值钱。


    Google Gemini Pro & Flash:双版本策略的聪明之处

    Google也在同一天(4月27日)更新了Gemini Pro和Flash。Pro负责扛性能大旗,Flash负责低延迟和高并发场景。两个版本都支持1M token上下文窗口,多模态能力和推理能力都有明显提升。

    Google这波操作聪明在:不让用户做”性能vs成本”的单选题,而是两个版本各司其职。对于需要同时服务C端和B端的应用来说,这种组合很实用。


    IBM Granite 4.1:小参数模型的逆袭

    4月30日,IBM发布了Granite 4.1,参数只有8B,但性能居然能跟32B的MoE模型掰手腕。这件事传递的信号很清楚:堆参数不是唯一出路,数据质量和训练效率同样能打

    对于想在本地部署、或者推理预算有限的团队来说,这类小参数高性能模型是真正的香饽饽。大模型不一定非得”大”。


    四个趋势,定义接下来半年

    把这波发布潮放在一起看,有四个趋势已经很明显了:

    • 超长上下文正在变成标配。1M+ token从”炫技”变成”基础配置”,这会从根本上改变应用能做的事情——一次性处理超长文档、多轮对话不遗忘、复杂任务规划,都会变得更可靠。
    • 小参数模型崛起。DeepSeek v4和IBM Granite 4.1都在证明:聪明的训练比盲目的参数堆砌更有效率。这对降低推理成本、推动AI应用普及是好事。
    • Agentic能力成为新战场。从GPT-5.5到Claude 4.6,所有厂商都在强化”让AI不只是回答,而是主动完成任务”的能力。这是从”对话助手”到”智能代理”的关键一跃。
    • 监管压力在累积。欧盟AI Act的合规期限是2026年8月,没几个月了。技术在狂奔,但安全性和透明度基准测试的进度明显滞后。这波发布潮里,几乎每家都提到了”负责任的AI”,但真正做到多少,还得看。

    对开发者意味着什么

    如果你在基于这些模型做应用,有几个方向值得认真考虑:一是重新设计应用架构,把1M+ token上下文窗口的能力用起来;二是关注Agentic模式,从”用户输入-模型回答”的单向模式,转向多步骤、带工具调用的任务执行模式;三是成本优化,小参数模型的性能提升意味着你有更多选择,不一定非得用最贵的那个。

    2026年5月的这波模型发布,表面上是各家在比拼基准测试分数,实际上是AI从”技术演示”走向”大规模应用”的转折点。谁能把模型能力稳定、低成本、安全地交付到用户手里,谁就赢了。

  • DeepSeek V4-Pro永久降价75%,输出token不到1美元

    上个月DeepSeek推出V4-Pro的时候,给了一个75%折扣的促销价,截止日期写在5月31日。业内普遍以为这只是新模型上线的拉新手段,到期后会涨回原价。结果5月22日,DeepSeek直接在官方文档里把折扣价改成了永久定价——没有任何预告,就是悄悄把数字改了。

    新价格出来之后,输出token的成本是每百万0.87美元。作为对比,OpenAI的GPT-5.5输出token定价大概是其34倍。Anthropic的Claude Opus 4.7、谷歌的Gemini 3.5 Flash,在同级别推理能力下,每token价格都比这家中国公司贵出一截。

    DeepSeek-V4-Pro永久降价后,在全球”性价比”排名中直接登顶。输出定价低于1美元/百万token的前沿模型,目前只有这一家。

    为什么敢这么定价?

    背后的技术原因挺直接:V4系列从设计之初就针对华为昇腾950 AI加速器做了优化,不依赖英伟达GPU。DeepSeek在发布V4时就说过,一旦昇腾950超级节点大规模可用,API定价会大幅下降,当时预计是2026年下半年。结果他们提前动了刀,说明对基础设施成本已经看得足够清楚了。

    具体价格表:缓存命中输入0.003625美元/百万token,缓存未命中输入0.435美元/百万token,输出0.87美元/百万token。人民币计价的话,大概是0.025元到6元/百万token的区间。

    行业反应

    彭博社把这件事定义为AI价格战的升级信号。开发者社区的反应更直接——之前犹豫要不要把DeepSeek纳入生产系统的团队,现在可以放心规划了,因为价格的不确定性消除了。

    这件事的另一个影响是:如果每百万token低于1美元的高性能推理成为常态,那么教育、工具类SaaS、小型创业公司这些对成本敏感的场景,AI接入的门槛就彻底打开了。


  • DeepSeek-V3:103K Stars!开源MoE大模型,以极低成本媲美GPT-4

    DeepSeek-V3:103K Stars!开源MoE大模型,以极低成本媲美GPT-4

    ⭐ GitHub热门AI开源项目 · 第38期

    DeepSeek-V3

    103K+ Stars  |  ⚡ MoE大模型  |  🚀 成本仅GPT-4的1/10

    由DeepSeek开发的开源混合专家大模型,在数学、代码和多语言基准测试中表现出色

    📌 项目简介

    DeepSeek-V3 是由DeepSeek团队开发的新一代开源混合专家(MoE)大语言模型,总参数规模达671B,每个token激活37B参数。该模型在数学、代码生成和多语言理解等基准测试中表现出色,性能媲美GPT-4和Claude 3.5,但训练成本仅约557万美元,是迄今为止性价比最高的开源大模型之一。

    671B
    总参数量

    37B
    激活参数量

    $5.57M
    训练成本

    128K
    上下文窗口

    ⚙️ 安装要求和过程

    环境要求

    • 🐍 Python 3.8+ (推荐使用Python 3.10+)
    • 📦 PyTorch 2.0+ 或更高版本
    • 💻 GPU 推荐:至少80GB显存(如A100/H100)用于完整模型推理
    • 💾 内存:建议至少128GB系统内存
    • 📁 磁盘空间:完整模型约需1.3TB存储空间(BF16格式)

    💡 提示:如果显存有限,可以使用模型量化(如4-bit/8-bit量化)或分布式推理来降低硬件要求。DeepSeek也提供了更小的蒸馏版本供本地部署。

    快速安装步骤

    # 1. 克隆官方仓库
    git clone https://github.com/deepseek-ai/DeepSeek-V3.git
    cd DeepSeek-V3

    # 2. 安装依赖
    pip install -r requirements.txt

    # 3. 下载模型权重(需同意许可协议)
    download deepseek-ai/DeepSeek-V3

    # 4. 运行推理示例
    python inference.py –model-path ./DeepSeek-V3 –input “你好,请介绍一下你自己”

    核心功能

    🧩 混合专家(MoE)架构

    采用创新的MoE架构,总参数671B但仅激活37B,大幅提升推理效率,降低计算成本。

    📐 超强数学推理

    在美国数学竞赛AIME 2024上取得优异成绩,数学推理能力接近甚至超越GPT-4o。

    💻 顶级代码生成

    在HumanEval和MBPP等代码基准测试中表现优异,支持多种编程语言,代码质量接近Claude 3.5。

    🌍 多语言支持

    支持中、英、法等多种语言,多语言理解能力在开源模型中处于领先地位。

    ⚡ 高效推理引擎

    配备优化的推理引擎,支持批处理、KV Cache、投机解码(Speculative Decoding)等加速技术,生成速度最高可达60 TPS(tokens per second)。

    🚀 典型使用场景

    📚 场景一:教育科技与数学辅导

    DeepSeek-V3的数学推理能力极强,可用于开发智能数学辅导系统。例如,某在线教育平台集成DeepSeek-V3后,能够逐步解答高中数学竞赛题,并给出详细的解题步骤和思路分析,学生满意度提升40%。

    💼 场景二:企业级代码助手

    利用DeepSeek-V3的代码生成能力,企业可以搭建内部代码助手。例如,某金融科技公司使用DeepSeek-V3辅助Python和SQL开发,代码审查效率提升50%,同时减少了30%的常见bug发生率。

    🌐 场景三:多语言内容生成

    DeepSeek-V3的多语言支持使其非常适合国际化内容生成。某跨境电商平台使用DeepSeek-V3自动生成产品描述(支持12种语言),内容生产速度提升10倍,且本地化质量显著优于传统机器翻译。

    💡 推荐理由

    作为一名经常使用大模型的开发者,我之所以强烈推荐 DeepSeek-V3,主要有以下几个原因:

    ① 性价比无敌 —— 训练成本仅约557万美元,但性能媲美GPT-4o和Claude 3.5 Sonnet。对于预算有限的团队来说,这是目前最好的开源选择。

    ② 开源可商用 —— 采用MIT License,完全开源且可免费商用。你可以自由部署、修改、二次开发,不用担心许可问题。

    ③ 推理效率高 —— MoE架构让它在保持强大能力的同时,推理成本远低于同级别密集模型。配合优化的推理引擎,可以在消费级硬件上运行量化版本。

    ④ 中文能力出色 —— 与许多主要面向英文优化的开源模型不同,DeepSeek-V3在中文理解和生成方面表现非常出色,适合国内开发者使用。

    ⑤ 活跃的社区支持 —— GitHub上103K+ stars,且有DeepSeek团队持续维护更新。社区贡献了大量教程、工具链和部署方案,降低了使用门槛。

    如果你正在寻找一个性能强劲、成本低廉、可商用的开源大模型,DeepSeek-V3绝对值得一试。💪

    📥 下载地址

    💡 提示:如果硬件资源有限,可以访问 DeepSeek开放平台 直接使用API,无需本地部署。


    📌 本文由 WorkBuddy AI 自动采集撰写

    关注我们,每周获取更多GitHub热门AI开源项目介绍 🚀

  • 不用改提示词,直接调模型“大脑”:DeepSeek-V4-Flash让LLM Steering回归实用

    跟AI打交道的人大概都有这种体验:你在系统提示词里写了800字约束模型的语气、风格和立场,结果对话进行到第三轮,模型就开始放飞自我了。提示词能影响的只是模型的输入端,模型内部怎么处理、怎么生成,你管不着。

    但现在有一种替代方案正在重新回到聚光灯下——LLM Steering(大语言模型引导)。这不是什么新概念,早在Anthropic做Golden Gate Claude的时候就引发过关注。只是以前它太重了,需要A100级别的GPU和PyTorch加TransformerLens,普通开发者根本玩不起。而DeepSeek-V4-Flash加上一个叫DwarfStar 4的工具,把这个门槛降到了单张RTX 4090就能跑。

    Steering到底是什么,跟提示词有什么区别

    打个比方。提示词就像你给一个人写了张纸条:”请你用简洁的语气回答”,这个人看了纸条,可能前两句照做了,聊着聊着又回到啰嗦的老样子。Steering则像你直接拧了这个人脑子里一个名为”简洁度”的旋钮,每一句话都说出来之前,这个旋钮都在生效。

    技术上的实现也不复杂。Steering的核心是对比对(Contrast Pair)——让模型分别处理两个条件,比如”简洁回答”和”详细回答”,记录某一层激活值的差异,算出平均差值作为”简洁方向向量”。之后在正常的推理过程中,把这个向量加到对应层的激活值上,模型的输出就会不自觉地偏向简洁。

    提示词管的是输入,Steering管的是过程。前者是”请你这样做”,后者是”我帮你这样做”。每个token生成时都在施加影响,所以效果在整个输出中保持一致。

    为什么以前没流行起来

    Steering概念好是好,但有三个硬伤一直挡在前面。第一,它只适用于开源模型——你需要访问模型内部每一层的激活值,而OpenAI和Anthropic的API不可能给你这个权限。第二,以前做激活值分析需要搭建PyTorch + TransformerLens的完整环境,硬件起步就是A100。第三,大多数Steering能实现的效果,其实用提示词也能凑合达到,多花几行字就完事了。

    所以之前Steering基本是大厂实验室的自留地,Anthropic拿它做可解释性研究,学术界拿它写论文,一线开发者完全用不上。

    DeepSeek-V4-Flash + DwarfStar 4改变了什么

    两个关键因素。DeepSeek-V4-Flash本身就是一个针对推理效率优化过的模型,能在相对有限的显存上运行,同时保持了不错的推理质量。而DwarfStar 4是llama.cpp的一个分支,专门为特定模型系列加了激活值钩子,把”提取和注入激活值”这个操作简化到了几乎一条命令就能完成。

    这意味着什么?以前你需要一个有A100的实验室和一整套PyTorch环境,现在你只需要一张4090和几行命令就能跑完整个Steering实验的流程。门槛的降低是数量级的。

    能拿它干什么

    • 语气一致性:让模型在长对话中始终维持特定的语气和风格,不会漂移
    • 领域偏移:不用微调,就让模型的输出偏向金融、医疗或法律风格(但只影响表达框架,不影响事实准确性)
    • 安全防护:构建安全拒绝向量,在推理时注入作为轻量级护栏
    • 上下文压缩:把原本需要大量token描述的约束条件压缩成一个向量,省出上下文窗口

    不过也别太乐观。Sean Goedecke在他那篇广为流传的文章里提到,Steering目前还有明显的局限性:你很难精确理解一个激活值差异到底编码了什么信息,副效应可能出现在不相关的任务上,而且在一个领域构建的向量未必能迁移到另一个领域。


    从黑盒喊话到白盒调参

    Bagua AI的文章里有一个观点我觉得很到位:过去几年,行业一直在把LLM当黑盒,用提示词从外面”喊”它。Steering的复兴代表了一个转变——我们从外部喊话,变成从内部调参。这不仅仅是效率优化,而是机械可解释性(Mechanistic Interpretability)走向工业化应用的第一步。

    对实际做开发的团队来说,Steering目前最直接的价值在于替代那些越来越臃肿的系统提示词。与其花500个token约束模型行为,不如提取一个向量注入进去,既省上下文窗口又稳定。这个账,但凡做过复杂Agent系统的人都会算。

    竞争壁垒正在从”提示词工程”转向”理解内部表征”。谁能读懂模型的激活空间,谁就能更好地控制模型。这项技能在未来可能比写prompt值钱得多。