标签: 模型微调

  • xAI联创带着11亿美元杀回来:这次他要让你「拥有自己的AI」

    Igor Babuschkin 是谁?简单说,他是 xAI 的联合创始人,在 DeepMind、OpenAI 都干过,跟着马斯克把 Grok 做出来。6 月 10 号他带着一家叫 River AI 的公司从 stealth 里走出来,8 月 11 号宣布融了 11 亿美元(种子轮和 A 轮一起)。领投的是 General Catalyst 和 AMP PBC,英伟达和 AMD 的战投都进来了,YC、淡马锡也跟了。

    River AI 概念图:围绕个人 AI 重建技术栈
    River AI 想围绕「个人 AI」重建从训练到硬件的整套技术栈

    「今天 AI 的造法不是未来的造法。AI 应该开放、免费、便宜,它该为你做事,而不是为训练它的实验室做事。我们做 River,就是想让个人和公司拥有自己的智能。」—— Igor Babuschkin

    他讲的故事其实挺反主流。现在大厂的逻辑是:模型我来训,能力我租给你,按 token 收费。Babuschkin 说这不对,AI 应该像「守护天使」一样属于你自己——它了解你,待在你身边,而不是属于某家实验室。

    River 现在卖的第一款产品叫 River API,做的是开放权重模型的「后训练」生意。你给它 Qwen3.6、Kimi K2.6、GLM 5.2 这类开源模型,它帮你做 LoRA 微调和强化学习。计费按 token 算,不按 GPU 小时算。企业说自己不用养一支 infra 团队,15 到 20 分钟就能跑完一次复杂的 RL,成本比闭源方案省两到四倍,训练出来的模型权重归客户自己,能直接部署到兼容 OpenAI 的接口上。

    价格摆上了台面

    在 Qwen3.6 35B 上训练是每百万 token 1 美元,Kimi K2.6 在 262k 上下文下是 12.84 美元,权重存储另算每月每 GB 0.1 美元。官方举了个例子,一次生产级的数学 RL 跑下来不到 1000 美元。这套打法瞄准的是那些想要模型贴合自己业务、又不想自己搭训练团队的公司。

    为什么是现在,为什么是他

    Babuschkin 在 DeepMind、OpenAI、xAI 前后待了快十年,见过 frontier lab 怎么造模型,也知道那套「租智能」的商业模式有多黏人。他认为下一仗不在谁模型最大,而在谁能让人低成本地训练、调优、拥有自己的模型。General Catalyst 的 CEO Hemant Taneja 说得很直白:美国要在开放权重模型上保持领先,River 的团队有这个能力。

    钱会花在哪

    这轮钱同时推进三件事:已经上线的训练 API、正在搭的个性化与持续学习层、以及更长远的、让个人 AI 跑在用户身边的硬件。有意思的是,英伟达和 AMD 这对 GPU 冤家,罕见地坐进了同一张股东名单——而 River 的路线图终点,恰恰是要把个人 AI 跑出别人的数据中心。

    • 11 亿美元是今年最早的超大早期融资之一,距公司亮相才两个月
    • 战略股东同时包含英伟达和 AMD,芯片两边都押了
    • 卖点不是更大的模型,而是「让你拥有模型」的训练和微调层
    • 短期生意是企业后训练云,长期赌的是个人 AI 硬件

  • KTransformers:让消费级显卡跑起 DeepSeek 的异构推理引擎

    KTransformers:让消费级显卡跑起 DeepSeek 的异构推理引擎

    KTransformers

    项目简介

    KTransformers 是清华大学 MADSys 实验室联合 Approaching.AI 等团队开源的大模型异构推理与微调框架。它最出圈的能力,是让一块 24GB 显存的消费级显卡(如 RTX 4090)也能流畅运行 DeepSeek-V3 / R1 这类数百 GB 的巨型 MoE 模型——把”热专家”放在 GPU、”冷专家”卸载到 CPU/内存,配合 INT4/INT8/FP8 量化与 AMX/AVX 指令集优化,在本地把推理速度做到可用甚至惊艳。

    安装要求和过程

    环境要求:

    • Python 3.10 / 3.11 / 3.12(官方预编译 wheel 支持这三个版本)
    • Linux x86-64(manylinux_2_17),CPU 需支持 AVX2(Intel Haswell 2013+ / AMD Zen+ 及以上)
    • 可选 NVIDIA GPU,计算能力 8.0+(Ampere / Ada / Hopper,如 A100、RTX 3090/4090、H100);无需安装 CUDA toolkit,静态 CUDA 运行时已内置
    • 运行超大规模 MoE(如 DeepSeek-V3/R1)时,建议 64GB~382GB 内存用于专家卸载

    快速安装(PyPI,推荐大多数用户):

    pip install kt-kernel

    一行命令即装好含自动 CPU 检测、多指令集变体与 CUDA 加速的推理内核,无需编译。验证安装:

    kt version          # 查看 CLI 版本与检测到的 CPU 变体
    python -c "from kt_kernel import KTMoEWrapper; print('ok')"

    从源码编译(需要自定义 / AMD BLIS / ARM KML 后端):

    git clone https://github.com/kvcache-ai/ktransformers.git
    cd ktransformers/kt-kernel
    git submodule update --init --recursive
    ./install.sh        # 自动检测 CPU 并 -march=native 编译

    一条命令跑起来(自动适配硬件):

    kt run m2           # 启动模型推理服务(自动优化参数)
    kt chat             # 另开终端开始对话

    核心功能

    • CPU-GPU 异构推理(expert offload):把 Mixture-of-Experts 中高频访问的”热专家”留在 GPU,低频”冷专家”卸载到 CPU 与内存,显存占用从数十 GB 降到单卡 24GB 即可跑 DeepSeek-R1/V3。
    • 多指令集深度优化内核:内置 AMX(Intel Sapphire Rapids+)、AVX512(含 BF16/VNNI/VBMI)、AVX2 等多套 CPU 内核变体,运行时按 CPU 自动选择,并支持原生 FP8/BF16/INT4 精度。
    • 量化与长上下文:支持 CPU 侧 INT4/INT8 量化权重与 GPU 侧 GPTQ,配合 unsloth 1.58/2.51bit 与 IQ1_S/FP8 混合权重;可在 24GB 显存下放飞 139K+ 长上下文。
    • 微调(SFT)× LLaMA-Factory:支持在有限显存上对 DeepSeek-V3/R1、Qwen3-MoE 等超大 MoE 做 LoRA 微调,官方称比 ZeRO-Offload 快 6~12 倍、CPU 内存减半。
    • 生产级集成:提供干净的 Python API,可无缝接入 SGLang 做生产部署,实现”热专家 GPU / 冷专家 CPU”的异构服务。

    KTransformers × LLaMA-Factory 超大 MoE 微调

    图:KTransformers × LLaMA-Factory 在有限显存上微调超大 MoE 模型

    典型使用场景

    • 本地私有化跑 DeepSeek 满血版:开发者用一台配 24GB 显卡 + 大内存的主机,本地部署 DeepSeek-R1/V3 做代码助手、知识库问答,数据不出机器。
    • 高并发推理服务:在 8×L20 + Xeon 的服务器上,官方实测 DeepSeek-R1-0528(FP8)总吞吐 227.85 tokens/s、8 路并发输出 87.58 tokens/s,适合中小团队自建推理网关。
    • 超大模型低成本微调:用 4×RTX 4090 对 DeepSeek-V3 做 LoRA 微调(约 80GB 显存、3.7 it/s),或用单张 4090 微调 Qwen3-30B-A3B(8+ it/s),把训练成本打到消费级。

    推荐理由

    大模型推理的门槛,过去被”显存”死死卡住——想本地跑 DeepSeek 满血版,要么堆 H100 要么云上烧钱。KTransformers 的价值正在于此:它不跟你拼硬件,而是用异构调度 + 量化 + CPU 指令集优化把”不可能”变成”在家就能跑”。对预算有限的个人开发者、想做私有化部署的小团队、以及研究 MoE 推理优化的工程师来说,它是目前最务实的本地推理方案之一。

    工程上它也很”乖”:从 pip install kt-kernelkt run 一条命令起服务,内置 CPU 变体自动检测、NUMA 感知线程池,连 CUDA toolkit 都不用装。唯一的代价是——它目前主要面向 Linux x86-64,且吃内存(专家卸载越多越吃),上 Windows 原生或低内存机器要谨慎。但瑕不掩瑜,如果你想体验”把大模型装进自己电脑”,KTransformers 值得第一个试。

    下载地址

    许可:Apache-2.0 | 语言:Python / C++ | 维护:清华大学 MADSys 实验室、Approaching.AI、9#AISoft 及社区

  • 穆拉蒂的 Thinking Machines 发布开源模型 Inkling,赌定制 AI 胜过万能模型

    Thinking Machines 创始人 Mira Murati
    Mira Murati 离开 OpenAI 后创办的 Thinking Machines Lab(图源:TechCrunch / Getty Images)

    Mira Murati 离开 OpenAI 后创办的 Thinking Machines Lab,憋了一年半,终于在周三把第一个自家模型拿了出来,名字叫 Inkling。它最特别的地方不是有多强,而是”开放权重”——外面的人能直接下载、修改、自己拿去用,不必永远挂在别人的服务器上按次付费。

    一个 9750 亿参数的”混合专家”

    Inkling 用的是混合专家架构(MoE),总参数 9750 亿,但每次只调动其中约 410 亿来干活。这种”大身子小身段”的设计现在很常见,好处是模型够大、跑起来又不至于太贵太慢。它在 45 万亿 token 的文字、图片、音频、视频上训过,四种模态它都能原生推理,不过目前只吐文字——代码、带格式的卡片、结构化数据都行。

    不跟你比谁最强,只求”哪都能凑合”

    公司自己都说了,Inkling”现在不是最强的模型,开源闭源都不是”。那它图什么?图的是”全面发展”。它会给你有把握的答案,没把握就明说”我不确定”,而不是硬编;你还能自己调”思考力度”,想快就轻一点,想深就重一点。官方说在代码 benchmark 上,它用的 token 只有英伟达 Nemotron 3 Ultra 的三分之一,就能达到同样的水平。

    由一家公司集中训练、然后定死的 AI,往往不如组织自己塑形的 AI——因为太多专业知识只属于掌握它的人。

    上面这句话,是 Thinking Machines 上周那篇博客的核心论点,也是这次发布想撑起的背景。

    真正的赌注:企业自己改的,比万能模型更好用

    Inkling 现在的定位不是成品,而是”起点”。组织可以用它的 Tinker 平台自己微调,把它变成贴合自己业务的东西。代价是:安全和合规得你自己负责,微调也确实要正经的机器学习人才。这和 OpenAI、Anthropic、Google 的打法正好反过来——那三家先把 ChatGPT、Claude、Gemini 当通用聊天机器人卖,再把智能体能力叠上去。


    为什么”自己养模型”突然成了潮流

    这个方向不是 Thinking Machines 一个人在喊。微软 CEO 纳德拉上周就警告企业,用闭源模型等于”付两遍钱”:一遍订阅费,一遍把你 prompt 和纠正里藏着的业务机密,喂进了人家的下一代模型。Hugging Face 的 Clem Delangue 也判断,前沿模型以后只留给试验和高价值任务,真正跑生产的活会挪到私有或开源模型上——这正是 Thinking Machines 押注的路线。

    最有说服力的一仗,是它和全球最大对冲基金 Bridgewater 的合作。两边用现成的开源模型,喂上 Bridgewater 自己的金融经验再训一轮,据说在金融推理测试里拿到 84.7%,干翻了一堆顶级闭源模型,而成本只有大概十四分之一。不过这分数两家自己评的,还没独立验证。

    九年还是九个月

    OpenAI 从技术面世到赚钱花了约五年,Anthropic 约三年,Thinking Machines 说自己只用了九个月。至于钱从哪来,公司一贯讳莫如深——三月它和英伟达签了部署一吉瓦 Vera Rubin 算力的合作,Inkling 全在 GB300 NVL72 上训出来的,但怎么 cover 这笔开销,它没说。

    团队现在大约 200 人,比年初一波离职(包括两位联合创始人跳回 OpenAI)后稳住了。公司的文化刻意不捧个人,按理说谁走都不算大新闻——虽然它整个故事到现在都还绑在那位知名联合创始人的名字上。