标签: 大模型

  • Poolside 把 Laguna S 2.1 甩了出来:西方现在最能打的开放权重编程模型

    一家叫 Poolside 的旧金山小实验室,周二把新模型 Laguna S 2.1 端上了台面。这事有意思的地方不在于它有多大,而在于它小到能塞进一台桌面级机器,却把好几款数倍于己的闭源模型比了下去。

    九周造出来的小钢炮

    Laguna S 2.1 总参数 1180 亿,但每次推理只激活 80 亿,上下文窗口拉到了 100 万 token。Poolside 说它从 5 月 22 日才开始预训练,用 4096 张 H200,不到九周就发布了。在长周期编程基准 Terminal-Bench 2.1 上拿到 70.2%,比 1.6 万亿参数的 DeepSeek-V4-Pro-Max(64.0%)和 5500 亿参数的英伟达 Nemotron 3 Ultra(56.4%)都高;SWE-Bench Multilingual 上它拿到 78.5%,SWE-Bench Pro 公开集 59.4%。不到三个月,Poolside 从 M.1 一路连发三款模型,节奏快得不像一家小实验室。

    我们在这版模型上做的,不是堆更多智能,而是改进那些通向更强模型的行为:更多验证、更少想当然、不早早宣告胜利,也更持久。 —— Poolside 应用研究联合负责人 Pengming Wang

    把权重敞开给人看

    最关键的一点是,它是开放权重的,发布当天就挂在 Hugging Face 上,采用 OpenMDW-1.1 许可,连 BF16、FP8、INT4 各种量化版本都给了。模型小到能跑在单台英伟达 DGX Spark 上,也就是说企业可以把高频的编程智能体任务从按量计费的 API 搬到自己掌控的硬件里。

    • 1180 亿总参数、每次只激活 80 亿,上下文窗口 100 万 token
    • 开放权重,发布即上 Hugging Face,可本地跑在单台 DGX Spark
    • 西方近一年来首个有竞争力的开放权重编程模型

    西方的开源空窗

    Poolside 把这个发布摆进了一个更大的叙事里:过去一年,开发者明显转向能下载、能审查、能在自家基础设施上跑的开放权重系统,而这一类里能打的几乎都来自中国实验室——DeepSeek、通义千问、Kimi、智谱、MiniMax、腾讯混元。西方上一次放出开放权重,还是去年 8 月 OpenAI 的 gpt-oss-120b。联合 CEO Jason Warner 的话很直白:西方需要能信任、能运行、能在其上构建的开放权重模型。

    顺带一提,Poolside 把评测的完整轨迹也公开了,算是给开放二字加了点诚意。对政府、国防这类高度监管的客户来说,能自托管意味着敏感代码和数据不出自己的环境,这正是 Poolside 这门生意的根基。

    Poolside Laguna S 2.1 模型发布
    Poolside 发布的 Laguna S 2.1 开放权重编程模型

    📎 原文来源:Poolside 发布 Laguna S 2.1
  • 腾讯混元放出 Hyra:一个会自己改自己的科研智能体

    腾讯混元 7 月 21 日放出了一个有点特别的东西——Hyra-1.0,全称 Hunyuan Research Agent。说它特别,是因为这是个能自己改进自己的科研智能体,专门冲着那些讲究性能的研究和工程任务去的。

    能自我进化的 AI 科研智能体概念图
    腾讯混元 Hyra:一个会递归自我改进的科研智能体(示意图)

    腾讯说,Hyra 不光能在公开基准上刷分,还能扎进真实的产品系统、AI 研发流水线,甚至自然科学研究和工业场景里边跑边学、边学边进化。这话如果成立,那它就不只是个做题家了。

    “AI 自己改自己”,这一年突然火了

    递归自我改进(RSI)和自动化研究,是过去一年 AI 圈最热闹的前沿话题之一。几个标志性的例子放在一起看就明白热度从哪来:

    • Google DeepMind 的 AlphaEvolve,只用 48 次标量乘法就算完了 4×4 复数矩阵相乘;
    • Together AI 让一群智能体在开放环境里协作,把 11 维 kissing number 的已知下界从 593 推到了 604;
    • Andrej Karpathy 的 autoresearch,用一套精简循环让模型训练研究能自己转起来。

    这些进化型系统一个接一个冒出来,共同点是智能体正在跳出封闭的基准测试,跑到开放的科学发现里去,有些地方已经开始超过人类了。Hyra 想接的就是这一棒。

    框架越轻,动作空间越大

    Hyra 的 Harness 设计遵循 The Bitter Lesson:框架尽量轻、尽量简单,把智能体的动作空间尽量放大。

    具体怎么工作?给它一个任务描述,Hyra 就开始跑一个循环:根据历史经验去探索、提出更好的解法。所谓历史经验,包括过去每个方案跑出来的日志、评估器给的反馈、还有方案本身的源代码。这个循环一直转,直到它自己觉得可以收工,或者预算烧完,最后把历史上最优的那版方案交出来。

    腾讯给了个直观的例子:只给 Hyra 一张 2D 参考图,让它推断物体的三维结构,还得生成一个能直接渲染的 3D 模型。评判用的是基于 rubrics 的 VLM judge,从轮廓、比例、结构完整性、材质、视觉相似度几个维度打分。Hyra 在多轮探索里不断改建模代码、调渲染参数,官方称最后的结果比用 Claude Code 的 goal 模式生成的更贴近参考图,也更符合人的审美。


    从 AlphaEvolve 到 Hyra,能看出一个方向:大厂都在把”让 AI 帮着做研究”往前推。区别在于,腾讯这次强调的是从公开基准走进真实产业场景,让智能体在自家的研发流水线和工业问题上真刀真枪地迭代。这条路能走多远,还得看后面拿出来的活儿。至少 Hyra-1.0 把话说到了这份上。

  • Kimi Code CLI:终端里的下一代 AI 编程智能体(4.3K★,月之暗面开源)

    Kimi Code CLI:终端里的下一代 AI 编程智能体(4.3K★,月之暗面开源)

    Kimi Code CLI 封面

    Kimi Code CLI 是月之暗面(MoonshotAI)开源的终端 AI 编程智能体——它能在命令行里读改代码、执行 shell 命令、搜索文件、抓取网页,并依据反馈自主决定下一步;开箱即用 Kimi 大模型,也可配置接入其它兼容模型。

    一、项目简介

    一个跑在终端里的”AI 同事”。Kimi Code CLI 把代码读写、命令执行、文件检索、网页抓取与多步自主规划统一进一个轻量 TUI,口号是 “The Starting Point for Next-Gen Agents”(下一代智能体的起点)。它脱胎于此前广受关注的 Kimi CLI,把运行时收敛为单文件二进制,启动几乎无感,对 Kimi 大模型用户尤其友好。

    二、安装要求和过程

    环境要求

    • 普通用户无需 Node.js:官方脚本一条命令装好单文件二进制,无 PATH 烦恼、无全局模块冲突;
    • Windows 需先装 Git for Windows:Kimi Code CLI 用内置 Git Bash 作为 shell 环境;若 Git 装在自定义路径,设置环境变量 KIMI_SHELL_PATH 指向 bash.exe 绝对路径;
    • 账号:首次使用需 Kimi 账号(OAuth)或 Moonshot AI 开放平台 API Key;
    • 从源码开发需 Node.js ≥ 24.15.0 + pnpm 10.33.0。

    快速安装

    macOS / Linux:

    curl -fsSL https://code.kimi.com/kimi-code/install.sh | bash

    Windows(PowerShell):

    irm https://code.kimi.com/kimi-code/install.ps1 | iex

    快速开始

    cd your-project
    kimi            # 启动交互式 TUI
    kimi --version  # 验证安装

    首次在会话里执行 /login,选择 Kimi Code OAuth 或 API Key 登录,然后试着让它”看看这个项目,解释下主要目录“。

    三、核心功能

    Kimi Code CLI 核心能力

    1. 单文件分发:一条命令安装,无 Node.js、无 PATH 困扰、无全局模块冲突。
    2. 毫秒级启动:TUI 毫秒就绪,开启会话毫无负担,长时间 Agent 会话也不卡。
    3. 视频输入:把录屏 / 演示片段直接丢进聊天,Agent 逐帧”看懂”画面——把参考片转成 LUT、长视频剪成短片、屏幕录屏变成可运行代码。
    4. AI 原生 MCP:用 /mcp-config 对话式增删与鉴权 Model Context Protocol 服务器,免手改 JSON。
    5. 子智能体并行:内置 coder / explore / plan 子智能体在隔离上下文并行干活,主线对话保持清爽。
    6. ACP 编辑器集成kimi acp 接入 Zed、JetBrains 等任意 Agent Client Protocol 客户端,IDE 里直接驱动。

    四、典型使用场景

    Kimi Code CLI 工作流

    • 日常终端编程搭子:在任意项目目录敲 kimi,让它读代码、跑命令、搜文件、抓网页并自规划下一步,省去来回切窗口。
    • IDE 里的 Agent:在 Zed / JetBrains 配置 kimi acp,用熟悉的编辑器驱动 Agent,一次登录处处可用,开发流不断档。
    • 视频驱动开发:把产品录屏或参考片段丢给 Agent,让它”看懂”后落地为可运行代码或素材(例如把一段参考片转成调色 LUT)。

    五、推荐理由

    Kimi Code CLI 给我最大的惊喜是”“。作为 Kimi CLI 的演进版,它把运行时收敛成单文件二进制,启动几乎无感,TUI 也比不少同类更耐看;视频输入/mcp-config 对话式配置是真正能提升日常效率的巧思,而不是噱头。如果你已经在用 Kimi 大模型、又想要一个不折腾环境、能直接塞进终端和 IDE 的编码 Agent,它非常值得一试。MIT 协议、社区活跃(4.3K+ Stars、当日仍在高频更新),长期主义玩家可以放心上车。

    六、下载地址

  • mattpocock/skills:把顶级工程师的经验,打包成 AI 编码智能体的「技能库」

    mattpocock/skills:把顶级工程师的经验,打包成 AI 编码智能体的「技能库」

    mattpocock/skills 项目封面

    mattpocock/skills 是 TypeScript 布道师 Matt Pocock 日常使用的「AI 编码智能体技能库」——它不教你写 prompt,而是把数十年的工程经验浓缩成一组小而可组合、跨模型通用/skills 指令,专门修复 Claude Code、Codex 等编码智能体最常犯的四种失败模式。目前已在 GitHub 收获 17.8 万+ Stars,是近期最火的 AI 工程化开源项目之一。

    一、安装要求和过程

    环境要求

    • Node.js 18+(用于 skills.sh 安装器,npx 一行搞定)
    • 一个支持 skills 的编码智能体:Claude Code / Codex / 任意 Agent-Skills 标准 harness
    • 可选:GitHub 或 Linear 账号(/triage 技能需要对接 issue 追踪器)

    方式一 · 可改副本(推荐,想魔改就选它)

    npx skills@latest add mattpocock/skills

    选择要安装的技能与目标 agent,务必勾选 /setup-matt-pocock-skills;随后在 agent 中运行一次该命令完成仓库配置(选择 issue 追踪器、triage 标签、文档存放位置)。

    方式二 · Claude Code 原生插件(只读、常新、省心)

    /plugin marketplace add mattpocock/skills
    /plugin install mattpocock-skills@mattpocock

    装好后再跑一次 /setup-matt-pocock-skills。两种哲学:skills.sh 把技能复制进项目任你改;插件把它们作为只读束订阅更新

    二、核心功能

    整套技能围绕「软件工程基本功」展开,把对齐、TDD、架构、评审变成 Agent 拿来即用的小工具:

    四个失败模式对应技能

    • 对齐优先/grill-me/grill-with-docs——动手前先让 Agent 把你「拷问」一遍,并用 CONTEXT.md 沉淀项目共享语言,从根上消除需求歧义与啰嗦。
    • 测试驱动与诊断/tdd(红-绿-重构循环)、/diagnosing-bugs(复现→最小化→假设→插桩→修复→回归),让 Agent 真正跑起「代码运行反馈」闭环。
    • 架构纪律/to-spec/improve-codebase-architecture/codebase-design——对抗「一坨烂泥」,鼓励深模块、小接口。
    • 流程编排/implement/code-review/research/wayfinder/triage——把需求拆成可追溯的工单与规格,并以并行子智能体做「规范 + 标准」两轴评审。
    • 可组合、跨模型:所有技能与具体模型解耦,Claude Code / Codex / 其他 Agent 都能用;用户主动触发(User-invoked)与 Agent 自动调用(Model-invoked)两类技能分工清晰。

    User-invoked 与 Model-invoked 技能分类

    三、典型使用场景

    • 接手新项目前的「对齐会话」:用 /grill-with-docs 先和 Agent 把需求与领域术语聊透,生成 CONTEXT.md;后续每次对话都更省 token、更精准,变量/函数命名也跟着统一。
    • 写带测试的新功能:用 /implement 驱动 /tdd,先写失败测试再实现,最后 /code-review 把关——提交前质量稳,回归风险低。
    • 拯救腐烂的代码库:定期跑 /improve-codebase-architecture,扫描可深化的模块并生成可视化 HTML 报告,按图索骥重构,避免软件熵增失控。

    四、推荐理由

    这不是又一个「流程框架」(GSD/BMAD/Spec-Kit 那类会把过程控制权收走),而是把工程基本功变成 Agent 拿来即用的小工具——轻量、可改、不绑架你。最让我惊艳的是 CONTEXT.md 共享语言:用一句话把「section 里的 lesson 被 materialize」说清,代码命名、导航、token 消耗全跟着受益。两种安装方式恰好对应两种心态:想魔改就 fork 副本,想省心就装插件订阅更新。17.8 万 Stars、MIT 协议、几乎零上手成本,强烈建议所有用 Claude Code / Codex 的开发者装一套。

    五、下载地址

    许可:MIT | 语言:Shell/Markdown | Stars:178.9K+ | 创建于 2026-02,持续高频更新

  • Kimi CLI:月之暗面开源的终端 AI 编程智能体(10K+ Stars)

    Kimi CLI:月之暗面开源的终端 AI 编程智能体(10K+ Stars)

    Kimi CLI 在 VS Code 中的集成效果

    Kimi CLI 是月之暗面(MoonshotAI)开源的终端 AI 编程智能体——直接在命令行里读改代码、执行命令、联网检索,并自主规划与调整动作,把 Kimi 大模型搬进了你的 shell 与编辑器。

    一、项目简介

    Kimi CLI 是一个运行在终端里的 AI Agent,主打软件工程与命令行操作两大类任务。它不只是聊天机器人,而是能真正读取/编辑代码、执行 shell 命令、检索与抓取网页,并在执行过程中自主规划、动态修正路线。项目由 MoonshotAI 维护,采用 Apache-2.0 协议,当前已在 GitHub 收获 10K+ Stars。值得留意的是,官方已宣布 Kimi CLI 正演进为下一代 Kimi Code CLI,安装新版本会自动迁移配置与会话,但现有文档与安装方式依旧可用。

    二、安装要求与过程

    环境要求:

    • Python ≥ 3.12(PyPI 包已发布,最新版 1.49.0)
    • 一个 Kimi 账号(登录后使用)或有效的 API Key
    • 可选:Node.js(用于运行 npx 类 MCP 服务,如 chrome-devtools-mcp);Zsh(如需 shell 插件)

    快速安装:

    # 方式一:pip 安装(推荐)
    pip install kimi-cli
    
    # 方式二:pipx 隔离安装
    pipx install kimi-cli
    
    # 启动并登录
    kimi          # 进入交互界面后输入 /login 完成登录
    

    登录后即可在终端直接与 Kimi 对话、让它改代码、跑命令;配置与历史会话会保存在本地,跨项目复用。

    三、核心功能

    • 终端即 Shell(Ctrl-X 切换):Kimi CLI 本身就是一个 shell,按 Ctrl-X 即可在不退出智能体的情况下直接运行 shell 命令,把对话与执行无缝融合。
    • VS Code 扩展:通过官方 Kimi Code 扩展 在编辑器侧边栏开启 Agent 面板,直接基于当前工程上下文协作(见上方截图)。
    • ACP 协议接入主流 IDE:原生支持 Agent Client Protocol,可作为 ACP Agent Server 接入 Zed、JetBrains 等任意兼容编辑器,命令为 kimi acp
    • 原生 MCP 支持:内置 kimi mcp 子命令组,支持 HTTP / stdio / OAuth 多种传输方式,一行即可增删与授权 MCP Server(如 Context7、Linear、chrome-devtools)。
    • Zsh 深度集成:配合 zsh-kimi-cli 插件,把 AI Agent 能力直接带进你的 shell,Ctrl-X 一键切到智能体模式。

    四、典型使用场景

    • 终端里的全栈开发:在服务器或本地终端直接让 Kimi 读懂整个代码库、定位 Bug、生成补丁并执行测试,无需切换到图形界面 IDE。
    • IDE 内结对编程:在 VS Code / Zed / JetBrains 中以 Agent 面板形式调用 Kimi,基于当前文件与工程上下文做重构、加功能、写测试,改动实时落盘。
    • 可扩展的自动化工作流:通过 MCP 接入 Linear、Context7、Chrome DevTools 等工具,让 Kimi CLI 自动查需求、查文档、跑端到端浏览器验证,组成稳定的开发自动化流水线。

    五、推荐理由

    作为一款国产大模型厂商出品的命令行智能体,Kimi CLI 最大的亮点是「终端原生」——它不强迫你离开 shell,Ctrl-X 即可在「智能体」与「命令模式」间无缝切换,对远程服务器、无界面环境极其友好。同时它对 ACP / MCP 双协议的原生支持,意味着你既能把它嵌入 VS Code、Zed、JetBrains,也能通过 MCP 无限扩展工具边界,灵活度很高。Apache-2.0 协议可商用、配置本地化,隐私与可玩性兼顾。虽项目正平滑演进为 Kimi Code CLI,但当前版本已足够稳定,是体验「Kimi 版 Claude Code」最轻量直接的入口。

    六、下载地址

    (注:Kimi CLI 正演进为 Kimi Code CLI,新版本会自动迁移配置与会话,建议关注官方仓库获取最新动态。)

  • KTransformers:让消费级显卡跑起 DeepSeek 的异构推理引擎

    KTransformers:让消费级显卡跑起 DeepSeek 的异构推理引擎

    KTransformers

    项目简介

    KTransformers 是清华大学 MADSys 实验室联合 Approaching.AI 等团队开源的大模型异构推理与微调框架。它最出圈的能力,是让一块 24GB 显存的消费级显卡(如 RTX 4090)也能流畅运行 DeepSeek-V3 / R1 这类数百 GB 的巨型 MoE 模型——把”热专家”放在 GPU、”冷专家”卸载到 CPU/内存,配合 INT4/INT8/FP8 量化与 AMX/AVX 指令集优化,在本地把推理速度做到可用甚至惊艳。

    安装要求和过程

    环境要求:

    • Python 3.10 / 3.11 / 3.12(官方预编译 wheel 支持这三个版本)
    • Linux x86-64(manylinux_2_17),CPU 需支持 AVX2(Intel Haswell 2013+ / AMD Zen+ 及以上)
    • 可选 NVIDIA GPU,计算能力 8.0+(Ampere / Ada / Hopper,如 A100、RTX 3090/4090、H100);无需安装 CUDA toolkit,静态 CUDA 运行时已内置
    • 运行超大规模 MoE(如 DeepSeek-V3/R1)时,建议 64GB~382GB 内存用于专家卸载

    快速安装(PyPI,推荐大多数用户):

    pip install kt-kernel

    一行命令即装好含自动 CPU 检测、多指令集变体与 CUDA 加速的推理内核,无需编译。验证安装:

    kt version          # 查看 CLI 版本与检测到的 CPU 变体
    python -c "from kt_kernel import KTMoEWrapper; print('ok')"

    从源码编译(需要自定义 / AMD BLIS / ARM KML 后端):

    git clone https://github.com/kvcache-ai/ktransformers.git
    cd ktransformers/kt-kernel
    git submodule update --init --recursive
    ./install.sh        # 自动检测 CPU 并 -march=native 编译

    一条命令跑起来(自动适配硬件):

    kt run m2           # 启动模型推理服务(自动优化参数)
    kt chat             # 另开终端开始对话

    核心功能

    • CPU-GPU 异构推理(expert offload):把 Mixture-of-Experts 中高频访问的”热专家”留在 GPU,低频”冷专家”卸载到 CPU 与内存,显存占用从数十 GB 降到单卡 24GB 即可跑 DeepSeek-R1/V3。
    • 多指令集深度优化内核:内置 AMX(Intel Sapphire Rapids+)、AVX512(含 BF16/VNNI/VBMI)、AVX2 等多套 CPU 内核变体,运行时按 CPU 自动选择,并支持原生 FP8/BF16/INT4 精度。
    • 量化与长上下文:支持 CPU 侧 INT4/INT8 量化权重与 GPU 侧 GPTQ,配合 unsloth 1.58/2.51bit 与 IQ1_S/FP8 混合权重;可在 24GB 显存下放飞 139K+ 长上下文。
    • 微调(SFT)× LLaMA-Factory:支持在有限显存上对 DeepSeek-V3/R1、Qwen3-MoE 等超大 MoE 做 LoRA 微调,官方称比 ZeRO-Offload 快 6~12 倍、CPU 内存减半。
    • 生产级集成:提供干净的 Python API,可无缝接入 SGLang 做生产部署,实现”热专家 GPU / 冷专家 CPU”的异构服务。

    KTransformers × LLaMA-Factory 超大 MoE 微调

    图:KTransformers × LLaMA-Factory 在有限显存上微调超大 MoE 模型

    典型使用场景

    • 本地私有化跑 DeepSeek 满血版:开发者用一台配 24GB 显卡 + 大内存的主机,本地部署 DeepSeek-R1/V3 做代码助手、知识库问答,数据不出机器。
    • 高并发推理服务:在 8×L20 + Xeon 的服务器上,官方实测 DeepSeek-R1-0528(FP8)总吞吐 227.85 tokens/s、8 路并发输出 87.58 tokens/s,适合中小团队自建推理网关。
    • 超大模型低成本微调:用 4×RTX 4090 对 DeepSeek-V3 做 LoRA 微调(约 80GB 显存、3.7 it/s),或用单张 4090 微调 Qwen3-30B-A3B(8+ it/s),把训练成本打到消费级。

    推荐理由

    大模型推理的门槛,过去被”显存”死死卡住——想本地跑 DeepSeek 满血版,要么堆 H100 要么云上烧钱。KTransformers 的价值正在于此:它不跟你拼硬件,而是用异构调度 + 量化 + CPU 指令集优化把”不可能”变成”在家就能跑”。对预算有限的个人开发者、想做私有化部署的小团队、以及研究 MoE 推理优化的工程师来说,它是目前最务实的本地推理方案之一。

    工程上它也很”乖”:从 pip install kt-kernelkt run 一条命令起服务,内置 CPU 变体自动检测、NUMA 感知线程池,连 CUDA toolkit 都不用装。唯一的代价是——它目前主要面向 Linux x86-64,且吃内存(专家卸载越多越吃),上 Windows 原生或低内存机器要谨慎。但瑕不掩瑜,如果你想体验”把大模型装进自己电脑”,KTransformers 值得第一个试。

    下载地址

    许可:Apache-2.0 | 语言:Python / C++ | 维护:清华大学 MADSys 实验室、Approaching.AI、9#AISoft 及社区

  • Databricks估值冲到1880亿美元:一家大数据公司怎么讲成了AI故事

    Databricks 又涨价了。7月17日,这家公司宣布新一轮融资,估值直接跳到 1880 亿美元,领投方是老牌对冲基金 Coatue。具体融了多少钱,Databricks 没明说,只说钱还没到账,这轮要等到今年夏天晚些时候才正式 close。有 VC 跟 TechCrunch 透露,这单很稳,想进来的机构太多,公司根本没必要藏着掖着这个新估值。

    估值坐火箭,钱却还没到账

    一家还没拿到钱的公司先开香槟庆祝估值创新高,这种操作在硅谷不算常见,但放在 Databricks 身上又顺理成章——它已经连着一年半在疯狂融资了。五个月前(今年2月)它刚以 1340 亿美元估值融了 50 亿美元;再往前五个月(2025年9月)是 1000 亿美元估值融 10 亿;再往前到 2024 年 12 月,那是当时破纪录的 100 亿美元融资、620 亿美元估值。轮次密到有人开玩笑说字母表快不够用了,有人发帖说”已经在等 Series AA 了”。

    “已经在等 Series AA 了”——轮次多到社区开始玩梗,侧面说明这家公司的融资节奏有多密。

    从大数据公司到 AI 供应商

    这套密集融资的背后,是一次相当成功的形象重塑。Databricks 2013 年成立,最早靠”大数据”起家——帮企业在云上存海量数据还能跑出飞快的分析。ChatGPT 出现之前,它头上贴的是”老牌 SaaS 明星”的标签。

    转折在于,它手里本来就躺着企业的核心数据,当各家开始想要”带企业级安全和治理的 AI”时,Databricks 几乎是顺水推舟接住了这波需求。它接二连三推出 AI 产品:

    • Lakebase:专为 AI 智能体打造的数据库
    • Unity:统一调度多家模型的 AI 网关
    • Omnigent:管理多个 agent 的”元编排”层

    开源模型成了它的省钱利器

    更妙的是,Databricks 成了企业拥抱便宜中国开源模型的一个标杆案例,尤其力推 Z.ai 的 GLM 5.2 做编程。上周 CEO Ali Ghodsi 把自己公司 3000 名工程师的真实 AI 成本 benchmark 晒了出来:在程序员实际干的活上,开源模型(尤其 GLM 5.2)现在已经能啃下最高难度的任务,而且总花费比 Anthropic 和 OpenAI 的闭源模型低。

    有个发现挺出乎意料:影响成本的除了模型本身,那层”harness”(包裹模型的智能体编程工具,比如 Codex 或 Claude Code)也同样关键。他们测下来,开源的 Pi 在管理上下文上特别能打,成本低还不掉质量。

    “模型选择只是拼图的一块,别把它当成全部。”——Ghodsi 的总结点破了一件事:省钱的胜负手,往往不在模型单价。


    这套”AI 公司”的人设,让 Databricks 的融资和估值一路坐上火箭。现在 AI 的光环有多强?连三明治店 Jersey Mike’s 在 IPO 文件里都提了 22 次 AI。这年头,沾上 AI 叙事,估值就能多飞一会儿。

    Databricks 估值随 AI 叙事飙升
    数据中心的钱,正随着 AI 叙事流向 Databricks 这样的平台(图源:TechCrunch)
  • Mira Murati交出首款模型Inkling:开放权重,还大方承认自己不是最强

    前 OpenAI 首席技术官 Mira Murati 憋了一年半,终于交出了第一份答卷。她创办的 Thinking Machines Lab 在周三上午发布了首款模型 Inkling,最扎眼的一点是:它是开放权重的。跟 OpenAI、Anthropic、谷歌那些锁在服务器里的旗舰模型不一样,外面的开发者和公司可以直接把它下载下来,拆开、改、跑在自己的机器上。

    Mira Murati与Thinking Machines
    Mira Murati 创办的 Thinking Machines 发布首款开放权重模型 Inkling|图源 TechCrunch

    Inkling 是个混合专家(MoE)模型,总参数 9750 亿,但每次干活只调用其中一小部分,大约 410 亿——这套设计能让超大模型跑起来又快又省。它从零训练,喂进去 45 万亿 token 的文本、图像、音频和视频,而且是原生跨这几种模态推理,不是后面硬接一个视觉模块。这也是这家公司闷头搞了一年半基础设施之后,第一次拿出能公开检验的东西。

    开局不吹牛,反而承认自己不是最强

    最反常规的是它的姿态。大部分模型发布都是先甩一张跑分图出来,Inkling 却在材料里白纸黑字写着:这不是当下最强的模型,无论开源还是闭源。它主打的是均衡好用,能给出带”把握程度”的回答,遇到没底的地方会直接标出不确定,而不是硬猜;用户还能自己调”思考强度”,想快就牺牲点质量换速度。官方说在某个编程基准上,它达到英伟达 Nemotron 3 Ultra 同等水平时,只用了大约三分之一的 token。

    “我认为模型选择很重要,但它不是消耗大部分精力的地方。”这句话来自另一家公司,却恰好点中了 Thinking Machines 的核心赌注——模型本身正在变成”配料”,怎么用才是关键。

    那问题来了,这东西到底卖给谁?答案很明确,是企业。但 Thinking Machines 没把它当成品来卖,而是当”起点”——让企业拿去,用自家的模型定制平台 Tinker 在自己的数据上微调。代价是,客户得自己保证微调后的模型安全,而且微调这活儿本身就需要真本事的机器学习人才。

    赌的是”人人同款”终将败给”自己定制”

    Thinking Machines 上周专门发了篇文章给这次发布铺垫:一个模型被某家公司集中训练好、然后定死不动,表现会输给企业自己去塑造的模型,因为太多专业知识是攥在具体的人手里的。说白了,中心化的大厂在给所有人卖同一件产品,反复由自己打磨;而愿意拥有并定制自家模型的企业,能从里面榨出多得多的价值。

    这个论调正在变响。微软 CEO 纳德拉——他家在 OpenAI 和 Anthropic 都砸了几十亿——上周日发博客警告说,企业用闭源 AI 其实付了两遍钱:一遍是订阅费,另一遍是把上千条提示词和纠正里藏着的业务知识,白白交给了模型,最后被吸收进下一代版本。Hugging Face 的 CEO 也有类似判断,觉得前沿模型以后多半只用来做实验和高价值任务,真正的生产活会转向私有或开源方案。


    最有说服力的证据,来自一家对冲基金

    支撑这套逻辑最硬的一个案例,来自和全球最大对冲基金桥水的合作(顺带说明,桥水并不是 Thinking Machines 的投资方)。两边研究员拿一个现成的开源模型,用桥水自己的金融专长继续训练,结果在金融推理测试上拿到 84.7%,压过了顶尖闭源模型,运行成本大约只有十四分之一——当然,这是两家自己评的,不是第三方独立测试。

    • 速度是另一张牌:OpenAI 从技术到有收入大概花了五年,Anthropic 约三年,Thinking Machines 说自己九个月就做到了;
    • 2025 年它拿下约 20 亿美元种子轮,估值 120 亿美元,当时是史上最大种子轮,Inkling 是这笔钱换来的第一份实打实的成果;
    • 它也坦承 Inkling 部分用到了别家开源模型(包括月之暗面的 Kimi K2)的输出,也就是业内争议不小的”蒸馏”做法。

    悬念还是那个老问题:企业到底想不想要一个得自己动手调的模型,而不是开箱即用的?微调要占用的工程时间,很多公司根本挤不出来。但如果 Thinking Machines 赌对了,前沿模型这场比赛一直在为错的东西较劲,那 Inkling 就不必在排行榜上赢过 GPT 或 Gemini,它只要有足够多的开发者愿意在它上面搭东西,而不是继续租别人的黑箱,就够了。

  • 从开源社区到估值15亿美元:Hermes Agent 背后的 Nous Research 又拿下7500万

    Nous Research 与开源智能体 Hermes
    图:开源智能体 Hermes 背后的 Nous Research 正以 15 亿美元估值敲定新一轮融资(图源:TechCrunch)

    据 TechCrunch 援引三位知情人士的消息,做开源智能体 Hermes 的 Nous Research 正在敲定新一轮融资。这轮由 Robot Ventures 领投,Union Square Ventures(USV)和其他几家知名机构也有份,公司估值到了 15 亿美元。据说这轮至少募 7500 万美元,而且投资人的兴趣高得有点出人意料。

    值得一提的是,这距离上一轮 5000 万美元的 A 轮才过去不到三个月。Nous Research 方面拒绝对外置评,USV 和 Robot Ventures 也没回 TechCrunch 的采访请求。但三个独立信源同时放出消息,基本可以确定这笔交易正在发生。

    一个从社区里长出来的团队

    Nous Research 2023 年才正式注册成立,创始团队是 Jeffrey Quesnelle、Karan Malhotra、Ryan Teknium 和 Shivani Mitra。它的根子其实更早,2022 年就从一个开源 AI 研究社区起步。换句话说,这家公司是先有了一帮愿意一起折腾模型的开发者,才慢慢变成一家公司的。

    在更早之前,它从 Paradigm、Robot Ventures、North Island Ventures、OSS Capital 和 Balaji Srinivasan 这些人手里累计拿了大约 7000 万美元。加上这一轮,资本对它下注的逻辑很清楚:大家想赌”开源智能体”会不会成为下一个被巨头盯上的赛道。

    Hermes 到底做对了什么

    故事的关键在 Hermes。OpenClaw 那个能在本地电脑上帮你跑任务、一度刷屏的 Agent 火了之后没几周,Nous Research 就推出了自己的对标产品。它也是跑在你自己电脑上的智能体,能替你办事,但有一个挺关键的区别:Hermes 出厂就带着一批”技能”——网页搜索、写代码、理解图片,这些都不用你额外配置。

    更特别的是,它被设计成能从你的使用里自己学东西。你用得越多,它就越知道怎么把活儿干好,还会在没人干预的情况下,自己攒出新的技能文件。这种”越用越懂你”的路子,让不少开发者觉得它比单纯调个 API 要顺手。

    在 OpenRouter 今年 5 月 9 日的数据里,Hermes Agent 单日消耗的 Token 量冲到 2710 亿,排在所有智能体第一位,把 OpenClaw 都甩在了后面。

    它也能像 OpenClaw 那样,在 Telegram、Discord 这类聊天工具里跟你对话、给你发消息。对很多人来说,最大的吸引力是:你可以远程、全天候地让 AI 替你跑任务,不用一直盯在屏幕前。

    开源加上好上手,让 Hermes 在 GitHub 上攒下了相当吓人的人气:大约 21.4 万颗 star,接近 4 万个 fork。开发者既能把它装在个人电脑上,也能丢到一台虚拟服务器上去跑。

    钱要花在哪,以及那个绕不开的问题

    除了 Hermes,Nous Research 还发了一些专攻编程和数学的语言模型,也搭了一张去中心化的网络,让贡献者把自家的硬件接进去,用于算力和训练。

    它还给了不想折腾环境的用户一个云端托管版,按月付费,档位从 20 到 200 美元不等。几位消息人士说,新一轮的钱主要就是用来把 Hermes 的产品和商业模式再往前推一推。

    这自然引出那个老问题:一个打着”开源、免费”旗号的智能体,真能靠订阅养活自己吗?Hermes 目前仍是 MIT 协议、官方也说”永久免费”,但五个月里两轮融了上亿美元,回报总得有出处。云端那个付费档,大概率才是收入真正落地的地方。对习惯自己托管的人来说,未来免费版和云端版会不会慢慢拉开功能差距,值得盯一盯。


  • Ollama 融了 6500 万美元:给 AI 做个「Docker」,月活逼近 900 万开发者

    Ollama 这个开源小工具,最近把 B 轮融到了 6500 万美元,由 Theory Ventures 领投。加上之前 Benchmark 的 Peter Fenton 领投的 1500 万 A 轮,公司到现在一共拿了 8800 万美元。

    Ollama 2023 年出来,干的事很实在:帮开发者在自己电脑上跑开源权重的大模型,几分钟就能跑起来。它在 GitHub 上攒了 17.6 万 star、快 1.7 万 fork,也被无数教程和视频夸过。

    Ollama 两位创始人 Jeff Morgan(左)与 Michael Chiang(右)
    Ollama 两位创始人 Jeff Morgan(左)与 Michael Chiang(右)

    两个做过 Docker 的人,想给 AI 也做个「容器」

    创始人 Jeff Morgan 和搭档 Michael Chiang 之前参与做过 Docker Desktop,就是那个把云端应用搬来搬去变得轻松的工具。Docker 后来收购了他们上一家公司 Kitematic。所以 Ollama 干的事,本质上就是「AI 版的 Docker」:把烦人的硬件配置、环境依赖全部藏起来。

    Morgan 说,2023 年开源模型刚冒头的时候特别难用,那时候它们是给研究者准备的,不是给程序员准备的。想跑起来真的费劲。三年过去,现在 Ollama 每个月被超过 890 万开发者使用,进了 85% 的财富 500 强,而公司只有 14 个人。

    真正的拐点,是智能体带火了开源模型

    Morgan 把公司的转折放到今年 1 月前后,那时候 OpenClaw 这类智能体突然变热,更大的开源模型忽然能干活了,比如写代码。他发现,愿意付钱的用户,尤其是兜里有钱的企业和快速成长的 AI 应用公司,开始越来越多地转向更便宜的开源模型,只在必要的时候才去碰 Anthropic 这种闭源模型。

    我觉得大多数人辩论时都搞错了一点。这不是二选一。开源和闭源都有大把生意可做,但凡是推理成本高的公司,都有个关乎生死的项目在推着他们往开源权重模型挪。

    不是所有人都买账

    当然,也不是每个 Ollama 粉丝都高兴它开始赚钱。大概一年前,一堆博客和社交帖子抱怨它的云服务抢了免费项目的风头,把它当成开发工具「糊化」的典型。Morgan 的回应是:那些太大的开源模型本来就没法在个人电脑上跑,所以我们说,那我们来帮你找算力。Fenton 也补了一句:桌面端那个免费产品一点没变,你照样能发现、能跑本地模型。

    • Ollama 想做的不是又一个模型,而是模型和开发者之间的那层基础设施
    • 开源模型的性价比,正在把企业从闭源 API 手里一点点撬走
    • vLLM、SGLang、NanoClaw 这些开源项目也在长成公司,VC 开始追这一类
    • 14 个人、890 万月活,这个人均产出数字挺吓人