标签: AI开源

  • Ollama 融了 6500 万美元:14 个人,跑进 85% 的财富 500 强

    有个工具你可能从没听过名字,但它已经悄悄跑进了 85% 的财富 500 强企业里。它叫 Ollama,干的事很纯粹:让开发者在一行命令里,把开源大模型下载下来、在自己的电脑或服务器上跑起来。

    Ollama 创始人 Jeff Morgan(左)与 Michael Chiang(右)
    Ollama 联合创始人 Jeff Morgan(左)与 Michael Chiang(右)。(图源:David Paul Morris / Ollama)

    6500 万美元,钱从哪来

    7 月 9 日,Ollama 宣布完成 6500 万美元 B 轮融资,由 Theory Ventures 领投,Benchmark、8VC、Y Combinator 等跟投。算上早先 Benchmark 领投的 1500 万 A 轮,公司累计融资到了 8800 万美元。创始人兼 CEO Jeff Morgan 向 TechCrunch 确认了这笔交易。

    两个做过 Docker Desktop 的人

    Ollama 这事儿听着耳熟,是因为班底老道。Morgan 和联合创始人 Michael Chiang 早年在 Docker 收购他们的创业项目 Kitematic 后,参与打造了 Docker Desktop——今天超过一千万开发者每天在用的东西。Docker 把应用在不同云之间搬移变得轻松,Ollama 想对 AI 模型做同样的事:把繁琐的环境配置藏起来,让你只管跑。

    “2023 年开源模型刚出来时特别难用,它们是给研究人员准备的,不是给程序员用的,想把模型跑起来费老劲了。”Morgan 说。Ollama 就是冲着这份麻烦去的。

    数字摆出来,挺吓人

    上线三年,Ollama 现在每月有超过 890 万开发者在用,进驻了 85% 的财富 500 强,每周还新增近百万次安装。GitHub 上攒了 17.6 万 star、接近 1.7 万 fork。最夸张的是,撑起这一切的团队只有 14 个人。

    “Jeff 和 Michael 在 Docker 上做出的东西,每天有一千多万开发者在用。能做出一款在开发者里走向普适的产品,这种创造力极其罕见。”——Benchmark 合伙人 Peter Fenton

    为什么企业愿意买单

    对银行、医院这类机构来说,把数据送进第三方大模型 API 是合规上的大忌。在自己硬件上跑 Ollama,数据全程留在防火墙内,这正是它能在监管严格的行业落地的原因。Morgan 把业务的转折点放在今年 1 月前后——那时以 OpenClaw 为代表的智能体助手爆红,开源模型突然能干活了,尤其是写代码这类 agentic 任务。

    Fenton 的看法更直接:开源和闭源不是你死我活,但那些背着高额推理账单的公司,确实有动力把尽可能多的工作迁到开源模型上,只在必要时才调用 Anthropic 这类闭源模型。

    • 一行命令拉起 Llama、Mistral、DeepSeek 等开源权重模型,无需 API key
    • 本地跑不动的大模型,可走 Ollama 云端,按 GPU 时长计费而非按 token
    • 云上托管 Nemotron、GLM、DeepSeek、Kimi、MiniMax 等模型,做到首日上新
    • 免费桌面版不变,云端只是补上家里跑不了的大模型

    开源社区的疑虑

    不是所有人都鼓掌。大约一年前,就有开发者担心 Ollama 把重心偏向付费云、冷落了免费项目,把它列为开发者工具”变味”的例子。Morgan 和 Fenton 都回击说,免费桌面版没动过,云端只是把家里跑不了的大模型递到你手边。


    如果开源模型真如预期那样生成了世界上大部分 AI token,那么”谁把模型跑得稳、跑得安全、跑得便宜”这一层,就成了新的价值高地。Ollama 用 14 个人先占了坑,接下来要看这块地值不值这个价。

  • 开源AI抢走流量,Anthropic凭什么还在赚大钱

    一个反直觉的现象

    上周,客服 AI 公司 Decagon 的 CEO Jesse Zhang 发了一篇长帖,标题很嚣张:”大家都搞错了企业里的开源 AI”。他抛出一个挺有意思的矛盾:在自己公司里,越来越多成熟的业务正在切到更轻量的模型上,可花在那些最贵的前沿模型上的总预算,几乎一点没少。

    这跟很多人预想的不一样。按常理,开源模型又免费又能自己部署,前沿实验室早该被冲得七零八落。但 Zhang 认为,这俩根本不是对手,更像是同一个生命周期里的两个阶段。

    前沿实验室会继续握着”发现”,开源则会一点点吃掉”生产”。

    用大白话说就是:先用贵的前沿模型把一个新场景跑通、验证它能赚钱,等路子熟了,再挪到便宜的开源模型上规模化。前端探路,后端量产,各司其职。

    数据摆出来,前沿真没吃亏

    Zhang 没给太多数据,但这种数据其实到处都是。Vercel 的 AI 网关看板显示,就这一周,DeepSeek 的 Token 量已经冲到全平台的三分之一以上,背后是 GLM-5.2 的 Z.ai 也挤进了第四。可往下滑到”总支出”那栏,Anthropic 一家还是占了半壁江山。

    OpenRouter 的故事也差不多。DeepSeek V4 Flash 每周处理 5.3 万亿 Token,是最忙的;而最火的前沿模型 Opus 4.8 才 2 万亿出头。但 Opus 每百万 Token 要 1.37 美元,V4 Flash 只要 6 美分,贵了快 23 倍。算下来,花钱的大头还是落在前沿模型手里。连英伟达刚放的 Nemotron 都还没算进去。

    开源AI与前沿模型的双层经济
    开源模型吃下了流量,前沿模型守住了利润(图:TechCrunch)

    为什么开源赢不了”钱”

    一种解释是,AI 能干的活儿增长得太快了,前沿模型只要卡住早期那些最难、最值钱的部署,就能一直待在牌桌上。另一种解释更实在:很多场景就是太难,便宜模型暂时顶不上。

    • 垂直类 AI 公司确实在往轻量模型迁移,这条预言已经应验;
    • 但”GPT 套壳”类创业公司的账,算下来还是稳的;
    • 最关键的是,按 Token 算,前沿厂商死死攥住了最值钱的”溢价 Token”价格。

    作者想起去年九月自己写过的一个比方:基础模型公司到最后可能变成给星巴克供咖啡豆的——自己是商品原料,利润全被应用层赚走。现在看,这个预言只兑现了一半。


    所以眼下的格局,很可能不是”开源干掉前沿”,而是两套玩法长期并存:前沿负责开荒,开源负责量产。只要 AI 能做的事情还在指数级扩张,两边就都还有饭吃。至于这个平衡能维持多久,大概得看下一个更难啃的场景,到底落在谁手里。

  • DeepMind CEO呼吁设立独立机构,监管最强AI模型发布

    给最强模型找个”上市前审查员”

    前沿 AI 模型发布前,到底谁来把关?Google DeepMind 的 CEO 戴密斯·哈萨比斯这周在 X 上发了一篇长文,抛出了一个相当具体的答案:参照金融业的 FINRA,成立一个独立的”标准机构”,在最强模型向公众开放之前,先替大家把危险试出来。

    哈萨比斯把这篇框架文章命名为《前沿 AI 的框架,与一个新时代的开端》。他的设想是:最初,做前沿模型的实验室可以自愿在发布前最多 30 天,把模型交给这个标准机构做评测;一旦评估流程被证明靠谱,就会顺势变成强制要求——通不过,就不能在美国市场部署。发布之后要是冒出严重漏洞,实验室也得配合机构一起修。

    DeepMind CEO Demis Hassabis
    Google DeepMind CEO 戴密斯·哈萨比斯(图源:TechCrunch / Getty Images)

    “这个办法的好处是,它技术上聚焦,同时又不压制创新,还能奖励负责任的做法。”哈萨比斯坦言,机构要跟得上领域加速,并能在风险变大时加码。

    绕开”AI 版 FDA”的政治死结

    AI 监管在美国至今是个烫手山芋。白宫 AI 顾问、a16z 合伙人 Sriram Krishnan 前不久就把话挑明了:行政体系里”不会有 AI 的 FDA”。把标准机构设计成 FINRA 那样的自监管组织,恰恰是给这个分歧留了条缝——它既有约束力,又不用新设一个联邦部门。

    按哈萨比斯的构想,这个机构由开源代表和业内技术专家组成,资金来自各家 AI 实验室,还可以把某些评测外包给专门盯特定风险的 AI 安全小组。测试重点也很明确:网络攻击、生物威胁,以及模型试图绕开自身护栏的”欺骗”行为。

    到底是真能管住最强模型,还是最后变成大玩家们学会”应付考试”的又一处场子,现在谁也给不了答案。但至少在”模型上线前该有人先看一眼”这件事上,行业里最有分量的那几位,似乎正在慢慢达成共识。

  • 首笔推理芯片抵押贷落地:4亿美元押注AI算力的下一站

    算力生意的下半场

    训练一个大模型要烧掉天文数字的算力,但模型训好之后真正天天在跑的,是”推理”——也就是你每次提问、它给答案的那一下。最近一笔 4 亿美元的融资,把赌注压在了这块过去被忽视的市场上。

    AI 推理云创业公司 General Compute 拿到了 Upper90 的 4 亿美元贷款。有意思的是,这很可能是第一笔拿”推理专用芯片”做抵押的买卖。所谓推理芯片,专门用来高效跑已经训好的模型,不像训练芯片那么贵、那么吃水和电。

    General Compute 推理芯片
    General Compute 的推理芯片主打低功耗、免水冷(图源:TechCrunch)

    General Compute 的 SN50 芯片来自英特尔支持的 SambaNova,主打省电、不用昂贵的水冷,所以能比 GPU 更快铺进各种数据中心。公司声称推理速度能到 GPU 云的 16 倍。问题只有一个:作为一家新公司,怎么搞到足够多的芯片。

    “我们当年第一批给英伟达 GPU 融资时,市场还很低效,早进场的人能拿到风险补偿。”Upper90 的 Billy Libby 说。

    从 GPU 转向推理层

    这就轮到 Upper90 出场了。它的老板 Billy Libby 是个前高盛量化交易员,2021 年就曾给能源型数据中心创业公司 Crusoe 做 GPU 采购融资——他自称那是第一笔拿高端芯片做抵押的贷款。当时传统银行躲得远远的,怕芯片贬值太快;等 CoreWeave 把这种”芯片抵押”做成生意、还顺手搞出个轰动 IPO,大家才反应过来。

    现在 GPU 行情大家都摸透了,甚至有点买过头,Upper90 就把目光转向了 General Compute 这样的推理层公司。这个转向背后有个判断:不是谁都需要超级计算机,但谁都需要推理。开源模型越来越能打——月之暗面刚发的 Kimi K3 在编程基准上已经逼近 Anthropic 和 OpenAI 的旗舰——跑这些开源模型,便宜的推理芯片就够了。Groq、Cerebras 这类芯片公司也因此被收购方和公开市场盯上。

    General Compute 押注英伟达体系之外的芯片,逻辑和 TensorWave 绑定 AMD 类似:当替代方案越来越多,不被英伟达锁死的计算提供商,反而可能在成本上占优。

    “有一批芯片正在起量,总拥有成本惊人地好,速度也比英伟达快,但买家不多。”CEO Finn Puklowski 说,”和 Upper90 合作,不是’一个酷公司拿到钱买算力’这么简单,这是资本第一次组织起来,去敲碎英伟达的垄断。”

    对普通人来说,这事儿离得有点远。但它决定了你以后用 AI 是贵还是便宜:当推理产能不再被一家芯片厂卡脖子,模型跑起来的成本才会真正降下来。


    一句话看清这笔融资

    • General Compute 获 Upper90 的 4 亿美元贷款,或为首笔以推理芯片为抵押的融资
    • SN50 芯片(SambaNova)主打低功耗、免水冷,推理速度号称 GPU 云 16 倍
    • 资本从 GPU 转向推理层:开源模型崛起让低成本推理需求激增,英伟达之外的芯片有了空间
    📎 原文来源:Why the first GPU financiers are turning to inference chips in a $400 million deal(TechCrunch / Tim Fernholz,2026-07-17)
  • 从开源社区到估值15亿美元:Hermes Agent 背后的 Nous Research 又拿下7500万

    Nous Research 与开源智能体 Hermes
    图:开源智能体 Hermes 背后的 Nous Research 正以 15 亿美元估值敲定新一轮融资(图源:TechCrunch)

    据 TechCrunch 援引三位知情人士的消息,做开源智能体 Hermes 的 Nous Research 正在敲定新一轮融资。这轮由 Robot Ventures 领投,Union Square Ventures(USV)和其他几家知名机构也有份,公司估值到了 15 亿美元。据说这轮至少募 7500 万美元,而且投资人的兴趣高得有点出人意料。

    值得一提的是,这距离上一轮 5000 万美元的 A 轮才过去不到三个月。Nous Research 方面拒绝对外置评,USV 和 Robot Ventures 也没回 TechCrunch 的采访请求。但三个独立信源同时放出消息,基本可以确定这笔交易正在发生。

    一个从社区里长出来的团队

    Nous Research 2023 年才正式注册成立,创始团队是 Jeffrey Quesnelle、Karan Malhotra、Ryan Teknium 和 Shivani Mitra。它的根子其实更早,2022 年就从一个开源 AI 研究社区起步。换句话说,这家公司是先有了一帮愿意一起折腾模型的开发者,才慢慢变成一家公司的。

    在更早之前,它从 Paradigm、Robot Ventures、North Island Ventures、OSS Capital 和 Balaji Srinivasan 这些人手里累计拿了大约 7000 万美元。加上这一轮,资本对它下注的逻辑很清楚:大家想赌”开源智能体”会不会成为下一个被巨头盯上的赛道。

    Hermes 到底做对了什么

    故事的关键在 Hermes。OpenClaw 那个能在本地电脑上帮你跑任务、一度刷屏的 Agent 火了之后没几周,Nous Research 就推出了自己的对标产品。它也是跑在你自己电脑上的智能体,能替你办事,但有一个挺关键的区别:Hermes 出厂就带着一批”技能”——网页搜索、写代码、理解图片,这些都不用你额外配置。

    更特别的是,它被设计成能从你的使用里自己学东西。你用得越多,它就越知道怎么把活儿干好,还会在没人干预的情况下,自己攒出新的技能文件。这种”越用越懂你”的路子,让不少开发者觉得它比单纯调个 API 要顺手。

    在 OpenRouter 今年 5 月 9 日的数据里,Hermes Agent 单日消耗的 Token 量冲到 2710 亿,排在所有智能体第一位,把 OpenClaw 都甩在了后面。

    它也能像 OpenClaw 那样,在 Telegram、Discord 这类聊天工具里跟你对话、给你发消息。对很多人来说,最大的吸引力是:你可以远程、全天候地让 AI 替你跑任务,不用一直盯在屏幕前。

    开源加上好上手,让 Hermes 在 GitHub 上攒下了相当吓人的人气:大约 21.4 万颗 star,接近 4 万个 fork。开发者既能把它装在个人电脑上,也能丢到一台虚拟服务器上去跑。

    钱要花在哪,以及那个绕不开的问题

    除了 Hermes,Nous Research 还发了一些专攻编程和数学的语言模型,也搭了一张去中心化的网络,让贡献者把自家的硬件接进去,用于算力和训练。

    它还给了不想折腾环境的用户一个云端托管版,按月付费,档位从 20 到 200 美元不等。几位消息人士说,新一轮的钱主要就是用来把 Hermes 的产品和商业模式再往前推一推。

    这自然引出那个老问题:一个打着”开源、免费”旗号的智能体,真能靠订阅养活自己吗?Hermes 目前仍是 MIT 协议、官方也说”永久免费”,但五个月里两轮融了上亿美元,回报总得有出处。云端那个付费档,大概率才是收入真正落地的地方。对习惯自己托管的人来说,未来免费版和云端版会不会慢慢拉开功能差距,值得盯一盯。


  • Ollama 融了 6500 万美元:给 AI 做个「Docker」,月活逼近 900 万开发者

    Ollama 这个开源小工具,最近把 B 轮融到了 6500 万美元,由 Theory Ventures 领投。加上之前 Benchmark 的 Peter Fenton 领投的 1500 万 A 轮,公司到现在一共拿了 8800 万美元。

    Ollama 2023 年出来,干的事很实在:帮开发者在自己电脑上跑开源权重的大模型,几分钟就能跑起来。它在 GitHub 上攒了 17.6 万 star、快 1.7 万 fork,也被无数教程和视频夸过。

    Ollama 两位创始人 Jeff Morgan(左)与 Michael Chiang(右)
    Ollama 两位创始人 Jeff Morgan(左)与 Michael Chiang(右)

    两个做过 Docker 的人,想给 AI 也做个「容器」

    创始人 Jeff Morgan 和搭档 Michael Chiang 之前参与做过 Docker Desktop,就是那个把云端应用搬来搬去变得轻松的工具。Docker 后来收购了他们上一家公司 Kitematic。所以 Ollama 干的事,本质上就是「AI 版的 Docker」:把烦人的硬件配置、环境依赖全部藏起来。

    Morgan 说,2023 年开源模型刚冒头的时候特别难用,那时候它们是给研究者准备的,不是给程序员准备的。想跑起来真的费劲。三年过去,现在 Ollama 每个月被超过 890 万开发者使用,进了 85% 的财富 500 强,而公司只有 14 个人。

    真正的拐点,是智能体带火了开源模型

    Morgan 把公司的转折放到今年 1 月前后,那时候 OpenClaw 这类智能体突然变热,更大的开源模型忽然能干活了,比如写代码。他发现,愿意付钱的用户,尤其是兜里有钱的企业和快速成长的 AI 应用公司,开始越来越多地转向更便宜的开源模型,只在必要的时候才去碰 Anthropic 这种闭源模型。

    我觉得大多数人辩论时都搞错了一点。这不是二选一。开源和闭源都有大把生意可做,但凡是推理成本高的公司,都有个关乎生死的项目在推着他们往开源权重模型挪。

    不是所有人都买账

    当然,也不是每个 Ollama 粉丝都高兴它开始赚钱。大概一年前,一堆博客和社交帖子抱怨它的云服务抢了免费项目的风头,把它当成开发工具「糊化」的典型。Morgan 的回应是:那些太大的开源模型本来就没法在个人电脑上跑,所以我们说,那我们来帮你找算力。Fenton 也补了一句:桌面端那个免费产品一点没变,你照样能发现、能跑本地模型。

    • Ollama 想做的不是又一个模型,而是模型和开发者之间的那层基础设施
    • 开源模型的性价比,正在把企业从闭源 API 手里一点点撬走
    • vLLM、SGLang、NanoClaw 这些开源项目也在长成公司,VC 开始追这一类
    • 14 个人、890 万月活,这个人均产出数字挺吓人

  • 把大模型塞进自己电脑:Ollama 融了 6500 万美元,月活开发者逼近 900 万

    把大模型塞进自己电脑:Ollama 融了 6500 万美元,月活开发者逼近 900 万

    Ollama 两位创始人 Jeff Morgan(左)与 Michael Chiang(右)
    Ollama 两位创始人 Jeff Morgan(左)与 Michael Chiang(右)。图源:TechCrunch / David Paul Morris

    你有没有过这种经历——想在自己电脑上跑一个开源大模型,结果被环境配置、CUDA 版本、一堆依赖冲突搞得头大,最后默默关掉终端,回去用别人的 API。Ollama 想解决的就是这件烦心事。这家 2023 年成立的开源工具公司,刚宣布完成 6500 万美元 B 轮融资,由 Theory Ventures 领投;加上之前 Benchmark 合伙人 Peter Fenton 牵头的 1500 万美元 A 轮,Ollama 累计融资已经到了 8800 万美元。

    创始人 Jeff Morgan 和 Michael Chiang 其实不是第一次干这种“让开发者少踩坑”的活。两人早年在 Docker 待过,参与打造了后来几乎每个程序员都用过的 Docker Desktop——你在本地写的容器,能丝滑地搬到云上,中间那些烦人的硬件配置全被它藏了起来。用 Morgan 自己的话说,Ollama 对 AI 干的事,差不多就是 Docker 当年对云计算干的事:把在电脑上跑开源模型这件事,从“研究员的专利”变成“普通程序员几分钟就能上手”。

    14 个人,撑起 85% 的财富 500 强

    这件事为什么突然变得值钱了?Morgan 把转折点放在了今年一月。那时候 OpenClaw 这类开源智能体突然火起来,大家发现大模型不只是能聊天,还能真刀真枪地写代码、跑任务。开源模型第一次让人觉得“它能干正活了”。从那以后,一个判断开始在圈子里蔓延:那些天天烧推理费的公司,迟早要把一部分活儿挪到更便宜的开源模型上,把闭源模型(比如 Anthropic)留着应付真正要紧的场景。

    最夸张的是团队规模。Ollama 现在每月有超过 890 万开发者在用,进了 85% 的财富 500 强公司,而公司全职员工只有 14 个人。GitHub 上 17.6 万 star、近 1.7 万 fork,在开发者工具里算得上现象级。Fenton 当初就是看中这俩人在 Docker 攒下的“让产品渗透到每个开发者”的本事,才决定继续下注。

    “开源和闭源不是二选一,两边都有大把生意可做。但凡是推理成本高到肉疼的公司,都有一个‘必须迁到开放权重模型’的生死项目。”Fenton 说。

    Ollama 赚钱的路子也不复杂:免费桌面版照常让你发现、运行本地模型;更大的模型它放到自己的 neocloud 上,按 GPU 时长收费,套餐从免费到每月 100 美元。那些最先进的大模型往往太大、你自己的电脑跑不动,Ollama 就帮你找算力——Morgan 把这看成开源使命的自然延伸,而不是背叛。

    “被圈钱”的质疑声

    当然,不是所有老用户都买账。大概一年前,一批博客和社交平台帖子就开始抱怨,说 Ollama 搞起了云服务、开始琢磨赚钱,背离了那个大家白嫖的开源项目,甚至有人把它列为开发工具“逐步变质”的典型。Fenton 的回应很直接:桌面端那个免费核心产品一点没变,你发现、运行本地模型的地方还是老样子。


    抛开争议不谈,Ollama 更像一个信号:AI 正在批量催生新的开源项目,而这些项目又一个个变成了风投抢着投的公司。做推理服务的 Inferact(vLLM 背后那家)、RadixArk(SGLang),做智能体的 OpenClaw、NanoClaw,甚至从零训自己模型的 Arcee……这条赛道上,Ollama 只是跑在最前面的那一个。

  • 英伟达开源机器人技能库 ASPIRE:机器人开始像程序员一样,边改 bug 边攒本事

    英伟达开源机器人技能库 ASPIRE:机器人开始像程序员一样,边改 bug 边攒本事

    以前训练机器人,靠的是海量数据反复喂、靠梯度下降一点点更新权重,练完就是一堆定死的浮点数。英伟达刚开源的 ASPIRE 把这套逻辑掀了——它让机器人像程序员改 bug 一样,边干边试错、边试错边把经验攒下来。负责具身智能的 Jim Fan 直接放话:这是训练范式的一次彻底改写。

    机器人持续学习与技能库概念图
    ASPIRE 让机器人把每次操作经验沉淀成可复用的技能库

    ASPIRE 全称是 Agentic Skill Programming through Iterative Robot Exploration,说白了就是物理世界里的机器人版 Coding Agent。背后调用的 GPT 或 Claude 不再直接输出机械动作,而是写出一段可调试、可复现的控制代码;机器人执行时,把感知图像、导航、抓取、碰撞报错、运动轨迹全程记下来。

    任务失败了,AI 就回放这段多模态轨迹,像研究员一样判断哪一步出了问题,改代码、再跑一遍;一旦跑通,就把这套解决办法提炼成标准化的 Skill,存进一个越攒越厚的技能库,下次遇到同类场景直接调用,不用从零再试。

    三个变化,把老路子整个翻了过来

    Jim Fan 把这次转变拆成三条,新旧对比很清楚。训练,从梯度下降变成了不断打磨技能;练出来的东西,不再是一份网络权重文件,而是一座持续扩容的感知运动技能库;至于分布式训练,则变成一群 Agent 各自练不同的技能,再把经验汇总进同一个库里。

    这么做的直接好处,是把机器人开发的数据门槛砍了下来。技能库里已经涵盖抓取、移动、操作这些常见任务的预训练模型,开发者拿来组合、微调就行,不再需要动辄百万级的训练数据从头练。

    对国内厂商是把双刃剑

    开源当然降低了研发门槛,谁都能站在英伟达的肩膀上往前走。但硬币的另一面是,一旦大家都用它的技能库、它的标准,机器人的核心能力就等于被英伟达定义了。这跟当年 CUDA 的路数如出一辙——先把地基铺好、免费给你用,等你离不开了,话语权也就攥在人家手里。

    值得留意的几点:

    • 训练目标从更新权重,变成不断打磨和复用单条技能
    • 技能支持跨机型迁移,能大幅省下仿真复现和重训的成本
    • 为人形、工业机器人的通用自主学习提供了一套开源底座

    从大模型卷参数,到智能体卷能不能真把活干成,再到现在机器人开始攒技能,AI 的竞争重心正一步步从静态的权重,挪向动态的、能持续成长的能力。ASPIRE 未必是终点,但它至少给出了一个方向:让机器人像人一样,把每次踩过的坑都变成下次的本事。

  • Ollama 又融了 6500 万美元:让开发者在自己电脑上跑大模型,这门生意成了

    在个人电脑上运行开源大模型的 Ollama
    在个人电脑上跑开源大模型,Ollama 想做成 AI 时代的「Docker」

    Ollama 这家公司的名字,做 AI 开发的人基本都听过,圈外知道的不多。最近它宣布完成 6500 万美元的 B 轮融资,领投方是 Theory Ventures。加上之前 Benchmark 的 Peter Fenton 领投的 1500 万 A 轮,这家公司前后总共融了 8800 万美元。

    从 Docker 出来的团队,给 AI 干了件类似的事

    Ollama 在 2023 年上线,做的事情其实很朴素:让开发者在自己的电脑上,几分钟就把开源大模型跑起来。它在 GitHub 上攒了 17.6 万颗 star、将近 1.7 万个 fork,被无数教程、视频和博客拿来当范例。

    创始人 Jeff Morgan 和 Michael Chiang 之前都在 Docker 干过,做过 Docker Desktop,后来公司被 Docker 收购。所以 Ollama 对 AI 模型干的事,基本就是 Docker 当年对云计算干的事——把那些麻烦的硬件配置、环境差异全给你屏蔽掉,开发者只管跑。

    「2023 年开源模型就出来了,但那时候真的很难用,都是给研究人员准备的,不是给程序员用的。想把它们跑起来特别费劲。」Morgan 说。

    近 900 万月活,团队却只有 14 个人

    上线三年,Ollama 现在每个月有 890 万开发者在用,85% 的财富 500 强公司都在用,而背后撑起这一切的团队,只有 14 个人。它能长到这么快,靠的就是「在本地电脑上更顺手地搭 AI」这件事本身的需求。

    商业模式上,桌面免费版一点没变,赚钱靠的是云端订阅,从免费到每月 100 美元分几档,按 GPU 时长而不是 token 计费。那些太大、在自己电脑上跑不动的开源模型,Ollama 就帮你在它的云上找算力跑。

    企业开始认真考虑「用便宜的,留贵的」

    Morgan 把 Ollama 真正像个生意跑起来,归因于今年 1 月 OpenClaw 爆火。那之后,开源模型突然能做 agentic 任务了,比如写代码,企业开始认真琢磨:是不是能把日常活儿交给更便宜的开源模型,只在必要时才掏钱用 Anthropic 那种闭源模型。

    Fenton 的观点是,开源和闭源不是二选一,两边都有的赚。但他也点出一个现实:凡是推理成本高、也就是用模型烧钱烧得狠的公司,都有一股「生存级」的动力往开源权重模型上搬。


    免费的还免费,但「开发工具堕落」的骂声已经有了

    不是所有粉丝都买账。大概一年前,就有一批博客和论坛帖子吐槽 Ollama 的云服务,说它把精力从心爱的免费项目上挪走,把这股风气叫「开发工具的 enshittification(逐渐变烂)」。

    Morgan 不这么看,他说云端是开源使命的延伸——那些顶尖的大模型你自家电脑跑不动,「那我们就帮你把算力找来」。Fenton 也补了一句:桌面上的免费核心产品,前提一点没变,该发现模型、该跑本地模型,还是那个地方。

    不管争议怎么走,Ollama 都算是 AI 催生出来的那一拨「开源项目长成公司」里的最新样本。和它差不多的还有做推理的 Inferact(vLLM)、RadixArk(SGLang),以及从零训自己开源模型的 Arcee。AI 这波浪潮,正在把一批本来免费的工具,一点点变成正经生意。

  • 腾讯混元3正式版来了:姚顺雨操刀,把“幻觉”砍掉一大半

    腾讯混元3正式版
    混元3正式版发布,腾讯AI全家桶迎来核心引擎

    千呼万唤,腾讯混元3(Hy3)正式版终于在7月6日公布了。这个模型背后站着一个人——姚顺雨,清华姚班出身,去年底被请来当腾讯首席AI科学家。为了这款产品,腾讯前后准备了大半年,光是研发架构就动了一次大手术。

    2025年12月,腾讯把企业内部的AI研发体系重新切分,新设了AI Infra部、AI Data部和数据计算平台部,姚顺雨双线向刘炽平和卢山汇报。他到任后的第一件事很硬核:推翻原来的训练框架,一个月内把整套预训练和强化学习的基础设施重搭了一遍,还定下三条规矩——不偏科、不刷榜、不烧钱。

    重建后的第一个产物是4月23日上线的Hy3 preview,从启动训练到发布只用了三个月。但预览版毕竟只是预览,能力只能说“尚可”。正式版这次,是真的支棱起来了。

    架构没大改,改的是“喂什么”

    混元3正式版沿用了preview的底层架构:总参数量295B,每次推理只激活21B,另外还有3.8B参数用在MTP层。模型一共80层,GQA分组注意力,192个专家每次激活top-8,上下文窗口拉到256K。换句话说,有效参数量大约是GLM 5.2的一半。

    架构在preview阶段就定型了,正式版没动结构。那它到底改了什么?官方说法是“提升了后训练数据的质量和多样性,扩大了RL算力规模”。说白了,模型骨架没换,但喂给它的数据更好、更多样了,强化学习也给到了更多算力。

    搜索能力追平GPT-5.5

    从官方放出的基准成绩看,混元3在搜索智能体方向表现最强:BrowseComp拿到84.2分,在所有对比模型里排第一,直接追平了GPT-5.5。代码方向,SWE-Bench Verified是78.0分,和开源模型不相上下,但跟顶级闭源(GPT-5.5的84.4)还有点距离。

    评分终归是评分,腾讯自己也承认,公开榜单并不能完全反映模型的“真实战斗力”。

    更值得说的是幻觉率。相比preview版本,正式版的幻觉率从12.5%降到了5.4%,降幅超过一半;常识错误率从25.4%降到12.7%;多轮对话问题率从17.4%降到7.9%;长对话理解基准MRCR从42.9%升到75.1%。腾讯还搞了个“土办法”验证:拉来270位不同学科的专家,用真实工作场景做盲测,收集了312份对比,Hy3均分2.67/4,在前端开发、数据/存储、CI/CD这些类别上优势明显。

    便宜,而且开源

    价格延续了preview的性价比路线:API输入1元/百万tokens,输出4元/百万tokens,命中缓存只要0.25元。模型权重以Apache 2.0协议在GitHub、HuggingFace、ModelScope等平台开源,全球开发者能免费商用。

    市场反应挺实在。preview上线两周,token调用量就达到上一代Hy2的十倍,在OpenRouter上周调用3.66万亿token,拿了总榜和市占率“双第一”。到正式版发布时,日均token消耗又涨了20倍,其中代码和Agent类场景增长最猛。

    已经渗进腾讯全家桶

    模型跑分再高,最终要落在产品里。Hy3正式版已经接进了WorkBuddy/CodeBuddy、元宝、ima、QQ浏览器、腾讯新闻、微信读书、腾讯文档等核心业务。以WorkBuddy为例,任务解决率从preview的72%跳到90%,平均耗时缩短34%,文档处理token消耗比GLM5.2省了47%以上。

    有意思的是微信小程序开发。Hy3 preview时就演示过用自然语言生成完整小程序,正式版更进一步——你让它做个快递小程序,它能连前端带后端、外加API、数据结构和项目方案一起吐出来。而微信自己的原生AI助手“小微”用的是WeLM加DeepSeek,普通用户和开发者各取所需,这大概就是腾讯想要的分工。