标签: 大模型

  • Kimi CLI:月之暗面开源的终端 AI 编程智能体(10K+ Stars)

    Kimi CLI:月之暗面开源的终端 AI 编程智能体(10K+ Stars)

    Kimi CLI 在 VS Code 中的集成效果

    Kimi CLI 是月之暗面(MoonshotAI)开源的终端 AI 编程智能体——直接在命令行里读改代码、执行命令、联网检索,并自主规划与调整动作,把 Kimi 大模型搬进了你的 shell 与编辑器。

    一、项目简介

    Kimi CLI 是一个运行在终端里的 AI Agent,主打软件工程与命令行操作两大类任务。它不只是聊天机器人,而是能真正读取/编辑代码、执行 shell 命令、检索与抓取网页,并在执行过程中自主规划、动态修正路线。项目由 MoonshotAI 维护,采用 Apache-2.0 协议,当前已在 GitHub 收获 10K+ Stars。值得留意的是,官方已宣布 Kimi CLI 正演进为下一代 Kimi Code CLI,安装新版本会自动迁移配置与会话,但现有文档与安装方式依旧可用。

    二、安装要求与过程

    环境要求:

    • Python ≥ 3.12(PyPI 包已发布,最新版 1.49.0)
    • 一个 Kimi 账号(登录后使用)或有效的 API Key
    • 可选:Node.js(用于运行 npx 类 MCP 服务,如 chrome-devtools-mcp);Zsh(如需 shell 插件)

    快速安装:

    # 方式一:pip 安装(推荐)
    pip install kimi-cli
    
    # 方式二:pipx 隔离安装
    pipx install kimi-cli
    
    # 启动并登录
    kimi          # 进入交互界面后输入 /login 完成登录
    

    登录后即可在终端直接与 Kimi 对话、让它改代码、跑命令;配置与历史会话会保存在本地,跨项目复用。

    三、核心功能

    • 终端即 Shell(Ctrl-X 切换):Kimi CLI 本身就是一个 shell,按 Ctrl-X 即可在不退出智能体的情况下直接运行 shell 命令,把对话与执行无缝融合。
    • VS Code 扩展:通过官方 Kimi Code 扩展 在编辑器侧边栏开启 Agent 面板,直接基于当前工程上下文协作(见上方截图)。
    • ACP 协议接入主流 IDE:原生支持 Agent Client Protocol,可作为 ACP Agent Server 接入 Zed、JetBrains 等任意兼容编辑器,命令为 kimi acp
    • 原生 MCP 支持:内置 kimi mcp 子命令组,支持 HTTP / stdio / OAuth 多种传输方式,一行即可增删与授权 MCP Server(如 Context7、Linear、chrome-devtools)。
    • Zsh 深度集成:配合 zsh-kimi-cli 插件,把 AI Agent 能力直接带进你的 shell,Ctrl-X 一键切到智能体模式。

    四、典型使用场景

    • 终端里的全栈开发:在服务器或本地终端直接让 Kimi 读懂整个代码库、定位 Bug、生成补丁并执行测试,无需切换到图形界面 IDE。
    • IDE 内结对编程:在 VS Code / Zed / JetBrains 中以 Agent 面板形式调用 Kimi,基于当前文件与工程上下文做重构、加功能、写测试,改动实时落盘。
    • 可扩展的自动化工作流:通过 MCP 接入 Linear、Context7、Chrome DevTools 等工具,让 Kimi CLI 自动查需求、查文档、跑端到端浏览器验证,组成稳定的开发自动化流水线。

    五、推荐理由

    作为一款国产大模型厂商出品的命令行智能体,Kimi CLI 最大的亮点是「终端原生」——它不强迫你离开 shell,Ctrl-X 即可在「智能体」与「命令模式」间无缝切换,对远程服务器、无界面环境极其友好。同时它对 ACP / MCP 双协议的原生支持,意味着你既能把它嵌入 VS Code、Zed、JetBrains,也能通过 MCP 无限扩展工具边界,灵活度很高。Apache-2.0 协议可商用、配置本地化,隐私与可玩性兼顾。虽项目正平滑演进为 Kimi Code CLI,但当前版本已足够稳定,是体验「Kimi 版 Claude Code」最轻量直接的入口。

    六、下载地址

    (注:Kimi CLI 正演进为 Kimi Code CLI,新版本会自动迁移配置与会话,建议关注官方仓库获取最新动态。)

  • KTransformers:让消费级显卡跑起 DeepSeek 的异构推理引擎

    KTransformers:让消费级显卡跑起 DeepSeek 的异构推理引擎

    KTransformers

    项目简介

    KTransformers 是清华大学 MADSys 实验室联合 Approaching.AI 等团队开源的大模型异构推理与微调框架。它最出圈的能力,是让一块 24GB 显存的消费级显卡(如 RTX 4090)也能流畅运行 DeepSeek-V3 / R1 这类数百 GB 的巨型 MoE 模型——把”热专家”放在 GPU、”冷专家”卸载到 CPU/内存,配合 INT4/INT8/FP8 量化与 AMX/AVX 指令集优化,在本地把推理速度做到可用甚至惊艳。

    安装要求和过程

    环境要求:

    • Python 3.10 / 3.11 / 3.12(官方预编译 wheel 支持这三个版本)
    • Linux x86-64(manylinux_2_17),CPU 需支持 AVX2(Intel Haswell 2013+ / AMD Zen+ 及以上)
    • 可选 NVIDIA GPU,计算能力 8.0+(Ampere / Ada / Hopper,如 A100、RTX 3090/4090、H100);无需安装 CUDA toolkit,静态 CUDA 运行时已内置
    • 运行超大规模 MoE(如 DeepSeek-V3/R1)时,建议 64GB~382GB 内存用于专家卸载

    快速安装(PyPI,推荐大多数用户):

    pip install kt-kernel

    一行命令即装好含自动 CPU 检测、多指令集变体与 CUDA 加速的推理内核,无需编译。验证安装:

    kt version          # 查看 CLI 版本与检测到的 CPU 变体
    python -c "from kt_kernel import KTMoEWrapper; print('ok')"

    从源码编译(需要自定义 / AMD BLIS / ARM KML 后端):

    git clone https://github.com/kvcache-ai/ktransformers.git
    cd ktransformers/kt-kernel
    git submodule update --init --recursive
    ./install.sh        # 自动检测 CPU 并 -march=native 编译

    一条命令跑起来(自动适配硬件):

    kt run m2           # 启动模型推理服务(自动优化参数)
    kt chat             # 另开终端开始对话

    核心功能

    • CPU-GPU 异构推理(expert offload):把 Mixture-of-Experts 中高频访问的”热专家”留在 GPU,低频”冷专家”卸载到 CPU 与内存,显存占用从数十 GB 降到单卡 24GB 即可跑 DeepSeek-R1/V3。
    • 多指令集深度优化内核:内置 AMX(Intel Sapphire Rapids+)、AVX512(含 BF16/VNNI/VBMI)、AVX2 等多套 CPU 内核变体,运行时按 CPU 自动选择,并支持原生 FP8/BF16/INT4 精度。
    • 量化与长上下文:支持 CPU 侧 INT4/INT8 量化权重与 GPU 侧 GPTQ,配合 unsloth 1.58/2.51bit 与 IQ1_S/FP8 混合权重;可在 24GB 显存下放飞 139K+ 长上下文。
    • 微调(SFT)× LLaMA-Factory:支持在有限显存上对 DeepSeek-V3/R1、Qwen3-MoE 等超大 MoE 做 LoRA 微调,官方称比 ZeRO-Offload 快 6~12 倍、CPU 内存减半。
    • 生产级集成:提供干净的 Python API,可无缝接入 SGLang 做生产部署,实现”热专家 GPU / 冷专家 CPU”的异构服务。

    KTransformers × LLaMA-Factory 超大 MoE 微调

    图:KTransformers × LLaMA-Factory 在有限显存上微调超大 MoE 模型

    典型使用场景

    • 本地私有化跑 DeepSeek 满血版:开发者用一台配 24GB 显卡 + 大内存的主机,本地部署 DeepSeek-R1/V3 做代码助手、知识库问答,数据不出机器。
    • 高并发推理服务:在 8×L20 + Xeon 的服务器上,官方实测 DeepSeek-R1-0528(FP8)总吞吐 227.85 tokens/s、8 路并发输出 87.58 tokens/s,适合中小团队自建推理网关。
    • 超大模型低成本微调:用 4×RTX 4090 对 DeepSeek-V3 做 LoRA 微调(约 80GB 显存、3.7 it/s),或用单张 4090 微调 Qwen3-30B-A3B(8+ it/s),把训练成本打到消费级。

    推荐理由

    大模型推理的门槛,过去被”显存”死死卡住——想本地跑 DeepSeek 满血版,要么堆 H100 要么云上烧钱。KTransformers 的价值正在于此:它不跟你拼硬件,而是用异构调度 + 量化 + CPU 指令集优化把”不可能”变成”在家就能跑”。对预算有限的个人开发者、想做私有化部署的小团队、以及研究 MoE 推理优化的工程师来说,它是目前最务实的本地推理方案之一。

    工程上它也很”乖”:从 pip install kt-kernelkt run 一条命令起服务,内置 CPU 变体自动检测、NUMA 感知线程池,连 CUDA toolkit 都不用装。唯一的代价是——它目前主要面向 Linux x86-64,且吃内存(专家卸载越多越吃),上 Windows 原生或低内存机器要谨慎。但瑕不掩瑜,如果你想体验”把大模型装进自己电脑”,KTransformers 值得第一个试。

    下载地址

    许可:Apache-2.0 | 语言:Python / C++ | 维护:清华大学 MADSys 实验室、Approaching.AI、9#AISoft 及社区

  • Databricks估值冲到1880亿美元:一家大数据公司怎么讲成了AI故事

    Databricks 又涨价了。7月17日,这家公司宣布新一轮融资,估值直接跳到 1880 亿美元,领投方是老牌对冲基金 Coatue。具体融了多少钱,Databricks 没明说,只说钱还没到账,这轮要等到今年夏天晚些时候才正式 close。有 VC 跟 TechCrunch 透露,这单很稳,想进来的机构太多,公司根本没必要藏着掖着这个新估值。

    估值坐火箭,钱却还没到账

    一家还没拿到钱的公司先开香槟庆祝估值创新高,这种操作在硅谷不算常见,但放在 Databricks 身上又顺理成章——它已经连着一年半在疯狂融资了。五个月前(今年2月)它刚以 1340 亿美元估值融了 50 亿美元;再往前五个月(2025年9月)是 1000 亿美元估值融 10 亿;再往前到 2024 年 12 月,那是当时破纪录的 100 亿美元融资、620 亿美元估值。轮次密到有人开玩笑说字母表快不够用了,有人发帖说”已经在等 Series AA 了”。

    “已经在等 Series AA 了”——轮次多到社区开始玩梗,侧面说明这家公司的融资节奏有多密。

    从大数据公司到 AI 供应商

    这套密集融资的背后,是一次相当成功的形象重塑。Databricks 2013 年成立,最早靠”大数据”起家——帮企业在云上存海量数据还能跑出飞快的分析。ChatGPT 出现之前,它头上贴的是”老牌 SaaS 明星”的标签。

    转折在于,它手里本来就躺着企业的核心数据,当各家开始想要”带企业级安全和治理的 AI”时,Databricks 几乎是顺水推舟接住了这波需求。它接二连三推出 AI 产品:

    • Lakebase:专为 AI 智能体打造的数据库
    • Unity:统一调度多家模型的 AI 网关
    • Omnigent:管理多个 agent 的”元编排”层

    开源模型成了它的省钱利器

    更妙的是,Databricks 成了企业拥抱便宜中国开源模型的一个标杆案例,尤其力推 Z.ai 的 GLM 5.2 做编程。上周 CEO Ali Ghodsi 把自己公司 3000 名工程师的真实 AI 成本 benchmark 晒了出来:在程序员实际干的活上,开源模型(尤其 GLM 5.2)现在已经能啃下最高难度的任务,而且总花费比 Anthropic 和 OpenAI 的闭源模型低。

    有个发现挺出乎意料:影响成本的除了模型本身,那层”harness”(包裹模型的智能体编程工具,比如 Codex 或 Claude Code)也同样关键。他们测下来,开源的 Pi 在管理上下文上特别能打,成本低还不掉质量。

    “模型选择只是拼图的一块,别把它当成全部。”——Ghodsi 的总结点破了一件事:省钱的胜负手,往往不在模型单价。


    这套”AI 公司”的人设,让 Databricks 的融资和估值一路坐上火箭。现在 AI 的光环有多强?连三明治店 Jersey Mike’s 在 IPO 文件里都提了 22 次 AI。这年头,沾上 AI 叙事,估值就能多飞一会儿。

    Databricks 估值随 AI 叙事飙升
    数据中心的钱,正随着 AI 叙事流向 Databricks 这样的平台(图源:TechCrunch)
  • Mira Murati交出首款模型Inkling:开放权重,还大方承认自己不是最强

    前 OpenAI 首席技术官 Mira Murati 憋了一年半,终于交出了第一份答卷。她创办的 Thinking Machines Lab 在周三上午发布了首款模型 Inkling,最扎眼的一点是:它是开放权重的。跟 OpenAI、Anthropic、谷歌那些锁在服务器里的旗舰模型不一样,外面的开发者和公司可以直接把它下载下来,拆开、改、跑在自己的机器上。

    Mira Murati与Thinking Machines
    Mira Murati 创办的 Thinking Machines 发布首款开放权重模型 Inkling|图源 TechCrunch

    Inkling 是个混合专家(MoE)模型,总参数 9750 亿,但每次干活只调用其中一小部分,大约 410 亿——这套设计能让超大模型跑起来又快又省。它从零训练,喂进去 45 万亿 token 的文本、图像、音频和视频,而且是原生跨这几种模态推理,不是后面硬接一个视觉模块。这也是这家公司闷头搞了一年半基础设施之后,第一次拿出能公开检验的东西。

    开局不吹牛,反而承认自己不是最强

    最反常规的是它的姿态。大部分模型发布都是先甩一张跑分图出来,Inkling 却在材料里白纸黑字写着:这不是当下最强的模型,无论开源还是闭源。它主打的是均衡好用,能给出带”把握程度”的回答,遇到没底的地方会直接标出不确定,而不是硬猜;用户还能自己调”思考强度”,想快就牺牲点质量换速度。官方说在某个编程基准上,它达到英伟达 Nemotron 3 Ultra 同等水平时,只用了大约三分之一的 token。

    “我认为模型选择很重要,但它不是消耗大部分精力的地方。”这句话来自另一家公司,却恰好点中了 Thinking Machines 的核心赌注——模型本身正在变成”配料”,怎么用才是关键。

    那问题来了,这东西到底卖给谁?答案很明确,是企业。但 Thinking Machines 没把它当成品来卖,而是当”起点”——让企业拿去,用自家的模型定制平台 Tinker 在自己的数据上微调。代价是,客户得自己保证微调后的模型安全,而且微调这活儿本身就需要真本事的机器学习人才。

    赌的是”人人同款”终将败给”自己定制”

    Thinking Machines 上周专门发了篇文章给这次发布铺垫:一个模型被某家公司集中训练好、然后定死不动,表现会输给企业自己去塑造的模型,因为太多专业知识是攥在具体的人手里的。说白了,中心化的大厂在给所有人卖同一件产品,反复由自己打磨;而愿意拥有并定制自家模型的企业,能从里面榨出多得多的价值。

    这个论调正在变响。微软 CEO 纳德拉——他家在 OpenAI 和 Anthropic 都砸了几十亿——上周日发博客警告说,企业用闭源 AI 其实付了两遍钱:一遍是订阅费,另一遍是把上千条提示词和纠正里藏着的业务知识,白白交给了模型,最后被吸收进下一代版本。Hugging Face 的 CEO 也有类似判断,觉得前沿模型以后多半只用来做实验和高价值任务,真正的生产活会转向私有或开源方案。


    最有说服力的证据,来自一家对冲基金

    支撑这套逻辑最硬的一个案例,来自和全球最大对冲基金桥水的合作(顺带说明,桥水并不是 Thinking Machines 的投资方)。两边研究员拿一个现成的开源模型,用桥水自己的金融专长继续训练,结果在金融推理测试上拿到 84.7%,压过了顶尖闭源模型,运行成本大约只有十四分之一——当然,这是两家自己评的,不是第三方独立测试。

    • 速度是另一张牌:OpenAI 从技术到有收入大概花了五年,Anthropic 约三年,Thinking Machines 说自己九个月就做到了;
    • 2025 年它拿下约 20 亿美元种子轮,估值 120 亿美元,当时是史上最大种子轮,Inkling 是这笔钱换来的第一份实打实的成果;
    • 它也坦承 Inkling 部分用到了别家开源模型(包括月之暗面的 Kimi K2)的输出,也就是业内争议不小的”蒸馏”做法。

    悬念还是那个老问题:企业到底想不想要一个得自己动手调的模型,而不是开箱即用的?微调要占用的工程时间,很多公司根本挤不出来。但如果 Thinking Machines 赌对了,前沿模型这场比赛一直在为错的东西较劲,那 Inkling 就不必在排行榜上赢过 GPT 或 Gemini,它只要有足够多的开发者愿意在它上面搭东西,而不是继续租别人的黑箱,就够了。

  • 从开源社区到估值15亿美元:Hermes Agent 背后的 Nous Research 又拿下7500万

    Nous Research 与开源智能体 Hermes
    图:开源智能体 Hermes 背后的 Nous Research 正以 15 亿美元估值敲定新一轮融资(图源:TechCrunch)

    据 TechCrunch 援引三位知情人士的消息,做开源智能体 Hermes 的 Nous Research 正在敲定新一轮融资。这轮由 Robot Ventures 领投,Union Square Ventures(USV)和其他几家知名机构也有份,公司估值到了 15 亿美元。据说这轮至少募 7500 万美元,而且投资人的兴趣高得有点出人意料。

    值得一提的是,这距离上一轮 5000 万美元的 A 轮才过去不到三个月。Nous Research 方面拒绝对外置评,USV 和 Robot Ventures 也没回 TechCrunch 的采访请求。但三个独立信源同时放出消息,基本可以确定这笔交易正在发生。

    一个从社区里长出来的团队

    Nous Research 2023 年才正式注册成立,创始团队是 Jeffrey Quesnelle、Karan Malhotra、Ryan Teknium 和 Shivani Mitra。它的根子其实更早,2022 年就从一个开源 AI 研究社区起步。换句话说,这家公司是先有了一帮愿意一起折腾模型的开发者,才慢慢变成一家公司的。

    在更早之前,它从 Paradigm、Robot Ventures、North Island Ventures、OSS Capital 和 Balaji Srinivasan 这些人手里累计拿了大约 7000 万美元。加上这一轮,资本对它下注的逻辑很清楚:大家想赌”开源智能体”会不会成为下一个被巨头盯上的赛道。

    Hermes 到底做对了什么

    故事的关键在 Hermes。OpenClaw 那个能在本地电脑上帮你跑任务、一度刷屏的 Agent 火了之后没几周,Nous Research 就推出了自己的对标产品。它也是跑在你自己电脑上的智能体,能替你办事,但有一个挺关键的区别:Hermes 出厂就带着一批”技能”——网页搜索、写代码、理解图片,这些都不用你额外配置。

    更特别的是,它被设计成能从你的使用里自己学东西。你用得越多,它就越知道怎么把活儿干好,还会在没人干预的情况下,自己攒出新的技能文件。这种”越用越懂你”的路子,让不少开发者觉得它比单纯调个 API 要顺手。

    在 OpenRouter 今年 5 月 9 日的数据里,Hermes Agent 单日消耗的 Token 量冲到 2710 亿,排在所有智能体第一位,把 OpenClaw 都甩在了后面。

    它也能像 OpenClaw 那样,在 Telegram、Discord 这类聊天工具里跟你对话、给你发消息。对很多人来说,最大的吸引力是:你可以远程、全天候地让 AI 替你跑任务,不用一直盯在屏幕前。

    开源加上好上手,让 Hermes 在 GitHub 上攒下了相当吓人的人气:大约 21.4 万颗 star,接近 4 万个 fork。开发者既能把它装在个人电脑上,也能丢到一台虚拟服务器上去跑。

    钱要花在哪,以及那个绕不开的问题

    除了 Hermes,Nous Research 还发了一些专攻编程和数学的语言模型,也搭了一张去中心化的网络,让贡献者把自家的硬件接进去,用于算力和训练。

    它还给了不想折腾环境的用户一个云端托管版,按月付费,档位从 20 到 200 美元不等。几位消息人士说,新一轮的钱主要就是用来把 Hermes 的产品和商业模式再往前推一推。

    这自然引出那个老问题:一个打着”开源、免费”旗号的智能体,真能靠订阅养活自己吗?Hermes 目前仍是 MIT 协议、官方也说”永久免费”,但五个月里两轮融了上亿美元,回报总得有出处。云端那个付费档,大概率才是收入真正落地的地方。对习惯自己托管的人来说,未来免费版和云端版会不会慢慢拉开功能差距,值得盯一盯。


  • Ollama 融了 6500 万美元:给 AI 做个「Docker」,月活逼近 900 万开发者

    Ollama 这个开源小工具,最近把 B 轮融到了 6500 万美元,由 Theory Ventures 领投。加上之前 Benchmark 的 Peter Fenton 领投的 1500 万 A 轮,公司到现在一共拿了 8800 万美元。

    Ollama 2023 年出来,干的事很实在:帮开发者在自己电脑上跑开源权重的大模型,几分钟就能跑起来。它在 GitHub 上攒了 17.6 万 star、快 1.7 万 fork,也被无数教程和视频夸过。

    Ollama 两位创始人 Jeff Morgan(左)与 Michael Chiang(右)
    Ollama 两位创始人 Jeff Morgan(左)与 Michael Chiang(右)

    两个做过 Docker 的人,想给 AI 也做个「容器」

    创始人 Jeff Morgan 和搭档 Michael Chiang 之前参与做过 Docker Desktop,就是那个把云端应用搬来搬去变得轻松的工具。Docker 后来收购了他们上一家公司 Kitematic。所以 Ollama 干的事,本质上就是「AI 版的 Docker」:把烦人的硬件配置、环境依赖全部藏起来。

    Morgan 说,2023 年开源模型刚冒头的时候特别难用,那时候它们是给研究者准备的,不是给程序员准备的。想跑起来真的费劲。三年过去,现在 Ollama 每个月被超过 890 万开发者使用,进了 85% 的财富 500 强,而公司只有 14 个人。

    真正的拐点,是智能体带火了开源模型

    Morgan 把公司的转折放到今年 1 月前后,那时候 OpenClaw 这类智能体突然变热,更大的开源模型忽然能干活了,比如写代码。他发现,愿意付钱的用户,尤其是兜里有钱的企业和快速成长的 AI 应用公司,开始越来越多地转向更便宜的开源模型,只在必要的时候才去碰 Anthropic 这种闭源模型。

    我觉得大多数人辩论时都搞错了一点。这不是二选一。开源和闭源都有大把生意可做,但凡是推理成本高的公司,都有个关乎生死的项目在推着他们往开源权重模型挪。

    不是所有人都买账

    当然,也不是每个 Ollama 粉丝都高兴它开始赚钱。大概一年前,一堆博客和社交帖子抱怨它的云服务抢了免费项目的风头,把它当成开发工具「糊化」的典型。Morgan 的回应是:那些太大的开源模型本来就没法在个人电脑上跑,所以我们说,那我们来帮你找算力。Fenton 也补了一句:桌面端那个免费产品一点没变,你照样能发现、能跑本地模型。

    • Ollama 想做的不是又一个模型,而是模型和开发者之间的那层基础设施
    • 开源模型的性价比,正在把企业从闭源 API 手里一点点撬走
    • vLLM、SGLang、NanoClaw 这些开源项目也在长成公司,VC 开始追这一类
    • 14 个人、890 万月活,这个人均产出数字挺吓人

  • 可灵 AI 单轮融了近 30 亿美元:全球视频大模型最大一笔钱

    可灵 AI 单轮融了近 30 亿美元:全球视频大模型最大一笔钱

    7月2日晚上,快手在港交所发了个公告——旗下的视频生成大模型“可灵 AI”要独立出来,单轮融资规模最高 30 亿美元,投后估值大概 180 亿美元。这个数字创下了全球视频大模型公司单轮融资的纪录,国内 AI 领域也就仅次于 DeepSeek 首轮的 70 亿美元。可灵这是要单飞了。

    30 亿美元约占可灵扩大后注册资本的 16.67%,对应投后估值约 180 亿美元——全球视频基础模型赛道迄今最大的一笔融资。

    钱是谁给的?

    这轮阵容挺豪华。领投的有 CPE 源峰、国方创投、来自阿布扎比的 BlueFive Capital、腾讯、中关村科学城基金和中信证券,一共 34 家机构认购。跟投里还有阿里云、百度这样的产业资本,华策影视、芒果系的厚为资本这些文娱产业方也进来了。值得一提的是,BlueFive 来自中东,这是中东资本头一回投中国的 AI 视频模型;而 CPE 源峰同时押了 Kimi 和可灵,等于在 AI 赛道上“通用+垂直”两头下注。整个交易分两步走:领投方先出 138.24 亿元人民币,15 家额外投资方再加 52.2 亿,60 天认购期里还能再进最多 14 亿,凑到上限 204.47 亿元。

    可灵 AI 单轮融资近 30 亿美元,创全球视频大模型公司融资纪录
    可灵 AI 单轮融资近 30 亿美元,创全球视频大模型公司融资纪录

    为什么现在要拆出来单干?

    说白了,是被算力开支和竞争逼的。快手这一年几乎把资本开支全砸在了 AI 基础设施上,调整后净利润因此被拖累。把可灵拆出来独立融资,既能给它输血,也能让母公司喘口气。数据其实很能打:可灵今年一季度收入超过 6.5 亿元,同比涨了 300% 多;3 月的年化收入(ARR)接近 5 亿美元,一年翻了四倍;全球用户已经破了 1 亿,而且大约四分之三的收入来自海外。对一个视频大模型来说,这样的海外变现能力不多见。

    拿到钱,仗才刚开始

    不过投资人现在的心态变了。以前看的是技术 demo 够不够炫,现在更盯着能不能赚钱、边际效率高不高。 30 亿美元砸研发是够了,但可灵得赶紧跟其他视频大模型拉开差距,把钱变成实打实的成本优势才行。协议里还写了回购条款:要是 2031 年 10 月底前没能完成 IPO,或者没按约定时间重组,投资人可以要求按原价加每年 8% 的单利回购,母公司还得连带担责。这压力可不小。


    快手已经放话,未来 12 个月内可能启动可灵 AI 赴港上市。视频大模型这条赛道,海外有 Runway、OpenAI 的 Sora,国内有一堆追兵,可灵手里多了 30 亿美元的弹药,但真正的较量,是把这笔钱花出效率来。

  • 马斯克又放卫星:Grok 4.5 自称 Opus 级,价格却砍到零头

    SpaceXAI 上市后交出的第一张答卷,就是 Grok 4.5。马斯克在 X 上把它称作“Opus 级模型”——也就是能跟 Anthropic 最硬的 Opus 系列掰手腕,但他紧接着补了一句:更快、更省 token、还更便宜。

    一张为“干活”而生的模型

    SpaceXAI 在周三的博客里把 Grok 4.5 定位成“干活主力”:写代码、搭应用、处理办公室杂活、做研究、写文档,这些行业里最想甩出去的重复脑力活它都想接。跟 Cursor 联合训练是这次的关键——数万名工程师在 Cursor 上的真实操作数据被喂进了模型,专门补上 Grok 过去在编程这块最空的短板。

    “我们的内部评估是,Grok 4.5 大致相当于 Opus 4.7,但快得多。能力、速度、低成本三者加在一起,才是它的竞争力。”——马斯克

    SpaceXAI 发布的 Grok 4.5 模型配图
    Grok 4.5 是 SpaceXAI 上市后的首个大模型,主打高 token 效率(图:Getty Images)

    真正的卖点不是跑分,是账单

    SpaceXAI 说 Grok 4.5 的 token 效率是其他头部模型的两倍。落到价格上就很直白了:输入每百万 token 2 美元,输出 6 美元。对比一下——Opus 4.7 是 5 美元和 25 美元,OpenAI 最贵的 Sol 档是 5 美元和 30 美元。换句话说,干同样的活,花的可能只有别人的零头。

    • 跑分没冲到全场第一,但在 SWE Bench Pro 上用到的输出 token 大约只有 Opus 4.8 的四分之一
    • 服务速度约 80 TPS,马斯克预告下周上下文窗口会拉到 100 万
    • 训练跑在数万块英伟达 GB300 上,和 Cursor 的数据飞轮一起转

    选在 GPT-5.6 前一天亮牌

    这周本来就是大模型发布的大周。OpenAI 的 GPT-5.6 定在周四全量开放(此前因美国政府的安全审查被卡了一阵)。SpaceXAI 偏偏选在前一天把 Grok 4.5 丢出来,火药味不用多说——它赌的不是谁的分数高,而是谁能让企业少掏钱。

  • 微软在Excel里悄悄换掉OpenAI:自研MAI接管Office

    微软总部与Office办公场景
    微软正把自研MAI模型悄悄塞进Excel和Word的AI功能里(图:Getty Images)

    过去两年,微软给外界的印象一直是”OpenAI 最铁的盟友”——Copilot 背后站着 GPT,Office 365 的不少智能功能都贴着 OpenAI 和 Anthropic 的标。但彭博社 7 月 7 日的一则报道把这个默契撕开了一道口子:在 Excel 和 Word 里,已经有相当一部分用户提问,不再交给 OpenAI 或 Anthropic,而是由微软自己的 MAI 模型来回答。

    具体数字没公开,但彭博说,每个星期这两款软件里已经有”数万条”AI 提示词是 MAI 在处理。别看占比还小,放到 Excel 和 Word 这种亿级用户的产品里,这已经是微软第一次把自研模型悄悄塞进了核心办公场景的台前,而不只是躲在测试环境里。

    从 Excel 和 Word 开始,微软动了”外人”的奶酪

    有意思的是,微软自己从没高调宣传过这步棋。以前它巴不得你记得 Office 365 是”由 OpenAI 和 Anthropic 的模型驱动”;现在它选择了闷声干。TechCrunch 找微软求证,对方只回了一句”暂无更多信息可以分享”。这种不否认也不解释的态度,某种程度上比一份正式声明更说明问题。

    微软 AI 模型业务负责人穆斯塔法·苏莱曼(Mustafa Suleiman)在 6 月 Build 大会上说得直白:”我们每年向 Anthropic 支付巨额费用,目标是逐步减少、并最终消除这部分支出。”

    一句话把动机说透了:不是不想用,是太贵了。

    七个模型一起上,MAI 到底是什么来头

    MAI 不是临时起意。就在今年 6 月的 Build 开发者大会上,微软一口气发布了 7 款全新的自研 AI 模型,覆盖语音、图像、代码和推理——其中包括一个能写代码的 agentic coder,以及一个文生图模型。也就是说,微软已经在为”逐步替换第三方”悄悄准备弹药了。

    这些模型的卖点很统一:不追求纸面参数多吓人,而是强调”同样的活儿,花更少的算力”。放在 Office 这种每天海量、高频、但单次并不复杂的调用场景里,自研模型的成本优势会被放大。再配合微软自己的 Maia AI 芯片做软硬协同,推理开销比外购方案低上一截。

    • MAI-Transcribe-1 / MAI-Voice-1:对标 OpenAI Whisper 的语音转录与生成
    • MAI-Image-2:图像生成,替代部分文生图需求
    • MAI Code 1 Flash:面向开发者的代码生成模型
    • MAI Thinking 1:主打轻量高频办公场景的推理模型

    除了 Office 套件,MAI 也已经接进了 GitHub Copilot;Teams 上自研的语音转写能力也计划在几个月内上线。微软的意思很明确:凡是能自己干的,就别再长期花钱请外援。


    不只是微软,整个硅谷都在”省 token”

    把镜头拉远一点,微软这步其实是一股大潮里的一朵浪。今年上半年还流行”tokenmaxxing”——能多烧就多烧,把智能拉满;最近几个月画风突变,Amazon、Uber、Meta、Accenture 都被曝在收紧员工的 AI 预算,能省则省。AI 服务的账单一出来,连硅谷自己人都被吓到。

    更戏剧性的是,成本压力甚至把一些公司推向了”对手阵营”。有报道说,硅谷已经有人开始盯着中国的便宜模型(比如 GLM-5.2)找 Agent 方案,虽然绕不开安全和合规的顾虑。这说明一件事:当账单足够疼,地缘和安全的优先级都会往后挪一挪。

    自研到底,是想把命门攥回自己手里

    微软当然不会明天就跟 OpenAI、Anthropic 说拜拜。它手里还握着和 OpenAI 的合作协议,只是折扣窗口正在收窄。苏莱曼团队真正在做的,是搭一套”自主可控”的模型体系,免得将来被头部实验室的市场价拿捏。

    这也折射出整个行业的尴尬:靠外购大模型做商业化,盈利模型到现在都没完全跑通。微软这次把自研模型塞进 Excel 和 Word,看起来是省几块钱的小动作,实则是大厂为”AI 主权”交的第一笔学费。接下来,GitHub Copilot、Teams,甚至 Bing,会不会也慢慢换上 MAI,值得盯着看。

  • 把大模型塞进自己电脑:Ollama 融了 6500 万美元,月活开发者逼近 900 万

    把大模型塞进自己电脑:Ollama 融了 6500 万美元,月活开发者逼近 900 万

    Ollama 两位创始人 Jeff Morgan(左)与 Michael Chiang(右)
    Ollama 两位创始人 Jeff Morgan(左)与 Michael Chiang(右)。图源:TechCrunch / David Paul Morris

    你有没有过这种经历——想在自己电脑上跑一个开源大模型,结果被环境配置、CUDA 版本、一堆依赖冲突搞得头大,最后默默关掉终端,回去用别人的 API。Ollama 想解决的就是这件烦心事。这家 2023 年成立的开源工具公司,刚宣布完成 6500 万美元 B 轮融资,由 Theory Ventures 领投;加上之前 Benchmark 合伙人 Peter Fenton 牵头的 1500 万美元 A 轮,Ollama 累计融资已经到了 8800 万美元。

    创始人 Jeff Morgan 和 Michael Chiang 其实不是第一次干这种“让开发者少踩坑”的活。两人早年在 Docker 待过,参与打造了后来几乎每个程序员都用过的 Docker Desktop——你在本地写的容器,能丝滑地搬到云上,中间那些烦人的硬件配置全被它藏了起来。用 Morgan 自己的话说,Ollama 对 AI 干的事,差不多就是 Docker 当年对云计算干的事:把在电脑上跑开源模型这件事,从“研究员的专利”变成“普通程序员几分钟就能上手”。

    14 个人,撑起 85% 的财富 500 强

    这件事为什么突然变得值钱了?Morgan 把转折点放在了今年一月。那时候 OpenClaw 这类开源智能体突然火起来,大家发现大模型不只是能聊天,还能真刀真枪地写代码、跑任务。开源模型第一次让人觉得“它能干正活了”。从那以后,一个判断开始在圈子里蔓延:那些天天烧推理费的公司,迟早要把一部分活儿挪到更便宜的开源模型上,把闭源模型(比如 Anthropic)留着应付真正要紧的场景。

    最夸张的是团队规模。Ollama 现在每月有超过 890 万开发者在用,进了 85% 的财富 500 强公司,而公司全职员工只有 14 个人。GitHub 上 17.6 万 star、近 1.7 万 fork,在开发者工具里算得上现象级。Fenton 当初就是看中这俩人在 Docker 攒下的“让产品渗透到每个开发者”的本事,才决定继续下注。

    “开源和闭源不是二选一,两边都有大把生意可做。但凡是推理成本高到肉疼的公司,都有一个‘必须迁到开放权重模型’的生死项目。”Fenton 说。

    Ollama 赚钱的路子也不复杂:免费桌面版照常让你发现、运行本地模型;更大的模型它放到自己的 neocloud 上,按 GPU 时长收费,套餐从免费到每月 100 美元。那些最先进的大模型往往太大、你自己的电脑跑不动,Ollama 就帮你找算力——Morgan 把这看成开源使命的自然延伸,而不是背叛。

    “被圈钱”的质疑声

    当然,不是所有老用户都买账。大概一年前,一批博客和社交平台帖子就开始抱怨,说 Ollama 搞起了云服务、开始琢磨赚钱,背离了那个大家白嫖的开源项目,甚至有人把它列为开发工具“逐步变质”的典型。Fenton 的回应很直接:桌面端那个免费核心产品一点没变,你发现、运行本地模型的地方还是老样子。


    抛开争议不谈,Ollama 更像一个信号:AI 正在批量催生新的开源项目,而这些项目又一个个变成了风投抢着投的公司。做推理服务的 Inferact(vLLM 背后那家)、RadixArk(SGLang),做智能体的 OpenClaw、NanoClaw,甚至从零训自己模型的 Arcee……这条赛道上,Ollama 只是跑在最前面的那一个。