标签:

  • Ollama 融了 6500 万美元:14 个人,跑进 85% 的财富 500 强

    有个工具你可能从没听过名字,但它已经悄悄跑进了 85% 的财富 500 强企业里。它叫 Ollama,干的事很纯粹:让开发者在一行命令里,把开源大模型下载下来、在自己的电脑或服务器上跑起来。

    Ollama 创始人 Jeff Morgan(左)与 Michael Chiang(右)
    Ollama 联合创始人 Jeff Morgan(左)与 Michael Chiang(右)。(图源:David Paul Morris / Ollama)

    6500 万美元,钱从哪来

    7 月 9 日,Ollama 宣布完成 6500 万美元 B 轮融资,由 Theory Ventures 领投,Benchmark、8VC、Y Combinator 等跟投。算上早先 Benchmark 领投的 1500 万 A 轮,公司累计融资到了 8800 万美元。创始人兼 CEO Jeff Morgan 向 TechCrunch 确认了这笔交易。

    两个做过 Docker Desktop 的人

    Ollama 这事儿听着耳熟,是因为班底老道。Morgan 和联合创始人 Michael Chiang 早年在 Docker 收购他们的创业项目 Kitematic 后,参与打造了 Docker Desktop——今天超过一千万开发者每天在用的东西。Docker 把应用在不同云之间搬移变得轻松,Ollama 想对 AI 模型做同样的事:把繁琐的环境配置藏起来,让你只管跑。

    “2023 年开源模型刚出来时特别难用,它们是给研究人员准备的,不是给程序员用的,想把模型跑起来费老劲了。”Morgan 说。Ollama 就是冲着这份麻烦去的。

    数字摆出来,挺吓人

    上线三年,Ollama 现在每月有超过 890 万开发者在用,进驻了 85% 的财富 500 强,每周还新增近百万次安装。GitHub 上攒了 17.6 万 star、接近 1.7 万 fork。最夸张的是,撑起这一切的团队只有 14 个人。

    “Jeff 和 Michael 在 Docker 上做出的东西,每天有一千多万开发者在用。能做出一款在开发者里走向普适的产品,这种创造力极其罕见。”——Benchmark 合伙人 Peter Fenton

    为什么企业愿意买单

    对银行、医院这类机构来说,把数据送进第三方大模型 API 是合规上的大忌。在自己硬件上跑 Ollama,数据全程留在防火墙内,这正是它能在监管严格的行业落地的原因。Morgan 把业务的转折点放在今年 1 月前后——那时以 OpenClaw 为代表的智能体助手爆红,开源模型突然能干活了,尤其是写代码这类 agentic 任务。

    Fenton 的看法更直接:开源和闭源不是你死我活,但那些背着高额推理账单的公司,确实有动力把尽可能多的工作迁到开源模型上,只在必要时才调用 Anthropic 这类闭源模型。

    • 一行命令拉起 Llama、Mistral、DeepSeek 等开源权重模型,无需 API key
    • 本地跑不动的大模型,可走 Ollama 云端,按 GPU 时长计费而非按 token
    • 云上托管 Nemotron、GLM、DeepSeek、Kimi、MiniMax 等模型,做到首日上新
    • 免费桌面版不变,云端只是补上家里跑不了的大模型

    开源社区的疑虑

    不是所有人都鼓掌。大约一年前,就有开发者担心 Ollama 把重心偏向付费云、冷落了免费项目,把它列为开发者工具”变味”的例子。Morgan 和 Fenton 都回击说,免费桌面版没动过,云端只是把家里跑不了的大模型递到你手边。


    如果开源模型真如预期那样生成了世界上大部分 AI token,那么”谁把模型跑得稳、跑得安全、跑得便宜”这一层,就成了新的价值高地。Ollama 用 14 个人先占了坑,接下来要看这块地值不值这个价。

  • NotebookLM 改名 Gemini Notebook:Google 把笔记本变成会写代码的分析终端

    Google 又改名字了。这次轮到 NotebookLM——那个最早因为”用资料生成播客”火出圈的研究工具。7 月 16 日,Google 正式把它改名为 Gemini Notebook。名字变了,能用的东西也多了一截:每个笔记本现在都是一个带安全隔离的容器,里面能直接写代码、跑数据分析。

    Google 将 NotebookLM 更名为 Gemini Notebook
    Google 将 NotebookLM 更名为 Gemini Notebook,并加入代码执行能力。(图源:TechCrunch)

    从 Project Tailwind 到 Gemini Notebook

    往前倒三年,2023 年 Google I/O 上它还没名字,叫 Project Tailwind,定位是”帮你读资料的 AI”。后来改叫 NotebookLM,一路加功能:让两个虚拟主播就着你的文档聊天的音频概览、视频摘要、更多文件格式、企业版套餐。到今天,它已经坐拥 3000 万用户,超过 60 万家组织在用。

    Google 这几年有个习惯:实验期先用个独立名字试水,等跑顺了就收进 Gemini 大旗。Bard 变 Gemini、Duet AI 变 Gemini for Workspace,现在轮到 NotebookLM。说白了,它不想让用户在好几个牌子里迷路。

    真正的变化:笔记本里能跑代码了

    改名只是门面,核心更新是每个笔记本变成一个独立的安全容器。用户可以在里面生成并运行代码,把多个来源的资料拉到一起做复杂的分析,结果直接在工具里呈现,不用再导出到别的环境里折腾。

    Google 表示,借助代码执行能力,用户能够接入多个来源,并在工具内部直接完成复杂的数据分析。

    这套玩法现在优先开放给 Google AI Ultra 付费用户,以及开了 AI Ultra Access、AI Expanded Access 的 Workspace 企业客户。普通 Pro 用户会在接下来几周内陆续拿到。

    它想成为你工作流里的那一层

    现在你已经在 Gemini App 里能翻看自己的笔记本,Google 还放话,很快就能在搜索的 AI Mode 里直接调出笔记本内容。换句话说,NotebookLM 当年是个独立的研究沙盒,Gemini Notebook 想做的是贯穿 Google 整个产品线的分析层。

    • 每个笔记本都是独立安全容器,代码和数据不出隔离环境
    • 多来源数据可在工具内直接跑分析,省去导出到外部环境的环节
    • Ultra 与企业客户先用,Pro 用户几周后跟进
    • 笔记本将接入 Gemini App 与搜索 AI Mode,打通使用场景

    对普通用户来说,名字怎么改无所谓,关键是它能把”读资料—想清楚—出结果”这件事压缩在同一个界面里。当研究工具开始自己写代码跑数,AI 助手的边界又往外推了一步。

  • KTransformers:让消费级显卡跑起 DeepSeek 的异构推理引擎

    KTransformers:让消费级显卡跑起 DeepSeek 的异构推理引擎

    KTransformers

    项目简介

    KTransformers 是清华大学 MADSys 实验室联合 Approaching.AI 等团队开源的大模型异构推理与微调框架。它最出圈的能力,是让一块 24GB 显存的消费级显卡(如 RTX 4090)也能流畅运行 DeepSeek-V3 / R1 这类数百 GB 的巨型 MoE 模型——把”热专家”放在 GPU、”冷专家”卸载到 CPU/内存,配合 INT4/INT8/FP8 量化与 AMX/AVX 指令集优化,在本地把推理速度做到可用甚至惊艳。

    安装要求和过程

    环境要求:

    • Python 3.10 / 3.11 / 3.12(官方预编译 wheel 支持这三个版本)
    • Linux x86-64(manylinux_2_17),CPU 需支持 AVX2(Intel Haswell 2013+ / AMD Zen+ 及以上)
    • 可选 NVIDIA GPU,计算能力 8.0+(Ampere / Ada / Hopper,如 A100、RTX 3090/4090、H100);无需安装 CUDA toolkit,静态 CUDA 运行时已内置
    • 运行超大规模 MoE(如 DeepSeek-V3/R1)时,建议 64GB~382GB 内存用于专家卸载

    快速安装(PyPI,推荐大多数用户):

    pip install kt-kernel

    一行命令即装好含自动 CPU 检测、多指令集变体与 CUDA 加速的推理内核,无需编译。验证安装:

    kt version          # 查看 CLI 版本与检测到的 CPU 变体
    python -c "from kt_kernel import KTMoEWrapper; print('ok')"

    从源码编译(需要自定义 / AMD BLIS / ARM KML 后端):

    git clone https://github.com/kvcache-ai/ktransformers.git
    cd ktransformers/kt-kernel
    git submodule update --init --recursive
    ./install.sh        # 自动检测 CPU 并 -march=native 编译

    一条命令跑起来(自动适配硬件):

    kt run m2           # 启动模型推理服务(自动优化参数)
    kt chat             # 另开终端开始对话

    核心功能

    • CPU-GPU 异构推理(expert offload):把 Mixture-of-Experts 中高频访问的”热专家”留在 GPU,低频”冷专家”卸载到 CPU 与内存,显存占用从数十 GB 降到单卡 24GB 即可跑 DeepSeek-R1/V3。
    • 多指令集深度优化内核:内置 AMX(Intel Sapphire Rapids+)、AVX512(含 BF16/VNNI/VBMI)、AVX2 等多套 CPU 内核变体,运行时按 CPU 自动选择,并支持原生 FP8/BF16/INT4 精度。
    • 量化与长上下文:支持 CPU 侧 INT4/INT8 量化权重与 GPU 侧 GPTQ,配合 unsloth 1.58/2.51bit 与 IQ1_S/FP8 混合权重;可在 24GB 显存下放飞 139K+ 长上下文。
    • 微调(SFT)× LLaMA-Factory:支持在有限显存上对 DeepSeek-V3/R1、Qwen3-MoE 等超大 MoE 做 LoRA 微调,官方称比 ZeRO-Offload 快 6~12 倍、CPU 内存减半。
    • 生产级集成:提供干净的 Python API,可无缝接入 SGLang 做生产部署,实现”热专家 GPU / 冷专家 CPU”的异构服务。

    KTransformers × LLaMA-Factory 超大 MoE 微调

    图:KTransformers × LLaMA-Factory 在有限显存上微调超大 MoE 模型

    典型使用场景

    • 本地私有化跑 DeepSeek 满血版:开发者用一台配 24GB 显卡 + 大内存的主机,本地部署 DeepSeek-R1/V3 做代码助手、知识库问答,数据不出机器。
    • 高并发推理服务:在 8×L20 + Xeon 的服务器上,官方实测 DeepSeek-R1-0528(FP8)总吞吐 227.85 tokens/s、8 路并发输出 87.58 tokens/s,适合中小团队自建推理网关。
    • 超大模型低成本微调:用 4×RTX 4090 对 DeepSeek-V3 做 LoRA 微调(约 80GB 显存、3.7 it/s),或用单张 4090 微调 Qwen3-30B-A3B(8+ it/s),把训练成本打到消费级。

    推荐理由

    大模型推理的门槛,过去被”显存”死死卡住——想本地跑 DeepSeek 满血版,要么堆 H100 要么云上烧钱。KTransformers 的价值正在于此:它不跟你拼硬件,而是用异构调度 + 量化 + CPU 指令集优化把”不可能”变成”在家就能跑”。对预算有限的个人开发者、想做私有化部署的小团队、以及研究 MoE 推理优化的工程师来说,它是目前最务实的本地推理方案之一。

    工程上它也很”乖”:从 pip install kt-kernelkt run 一条命令起服务,内置 CPU 变体自动检测、NUMA 感知线程池,连 CUDA toolkit 都不用装。唯一的代价是——它目前主要面向 Linux x86-64,且吃内存(专家卸载越多越吃),上 Windows 原生或低内存机器要谨慎。但瑕不掩瑜,如果你想体验”把大模型装进自己电脑”,KTransformers 值得第一个试。

    下载地址

    许可:Apache-2.0 | 语言:Python / C++ | 维护:清华大学 MADSys 实验室、Approaching.AI、9#AISoft 及社区

  • Discord 的 AI 审核翻车:8000 多人因为一张棋盘图被封号

    Discord 应用图标
    Discord 的自动安全系统误判无害图片,导致超 8000 个账号被封(图源:TechCrunch)

    你只是往 Discord 上传了一张棋盘截图,或者游戏贴图,甚至是一张带方格的透明背景图,账号就突然没了。过去两个月,超过 8000 名用户经历了这种事——而锅不在他们,在 Discord 的 AI 审核系统出了 bug。

    一张棋盘图引发的误封

    Discord 已经承认,从今年 5 月起,它的自动安全系统把一批完全无害的图片误判成了有害内容:电子表格、棋盘、游戏纹理,还有白底和灰底的透明背景,统统中招。光是上周末,又有 200 个账号被误封。公司说问题已经修好,受影响账号正在陆续恢复。

    “我们的系统会把内容与已知有害材料做匹配,这种相似匹配可能产生误报,所以按设计,理应有信任与安全团队的人工复核再采取行动。”——Discord 官方说明

    Discord 在 X 上解释过这套机制:系统会把用户上传的内容,跟已知有害材料的数据库做相似度匹配,初衷是抓非法内容。问题出在流程的最后一环——一个 bug 让系统跳过了人工复核,直接把账号给封了。换句话说,本该”先审核、后处罚”的设计,被这个漏洞绕了过去。

    用户为什么这么愤怒

    不少人在 X 和 Reddit 上吐槽,自己只是传了张带方格图案的图就被永久封禁。有人怀疑,Discord 的审核模型对方格图案特别敏感,因为这些图案以前常被人拿来遮挡、伪装违规内容,系统学”歪”了。对把 Discord 当工作沟通、游戏社群或远距离社交主阵地的用户来说,这种无差别封号代价不小。

    • 一个游戏制作人说,自己靠它联系所有合作方,账号没了等于断了线;
    • 误判发生时,用户先被扣上最严重的安全帽子、先被踢出门,事后才轮到申诉;
    • 自动化审核一旦出错,替你背锅的是成千上万个真实的人。

    Discord 不是孤例。去年 Instagram、Facebook 群组就出现过大规模莫名封号,很多人怀疑是 AI 审核的锅,但 Meta 从没公开认过。Tumblr 也挨过类似骂。现在 Meta 的监督委员会正在逼平台提高透明度。


    最扎心的不是 bug,是代价结构

    这件事最让人不舒服的地方,在于它的代价分配:误判发生时,用户先被定罪、先被踢出,申诉是后面的事。在信任与安全这件事上,流程往往和算法一样重要。AI 初审加人工复核的混合模式喊了很久,但 Discord 这跤说明,只要中间任何一环断了,受伤的就是普通用户。把误报率当成硬指标公开,可能比事后修 bug 更有意义。

  • Prime Intellect 融了 13 亿美元:企业不想再给大模型厂商”交租”了

    Prime Intellect 创始人团队
    Prime Intellect 把训练 AI 智能体的全套家当打包成”全栈”服务(图源:TechCrunch)

    一家 2024 年才成立的公司,靠帮企业自己训练 AI 智能体,融到了 1.3 亿美元 A 轮,估值直接站上 10 亿美元。投资方名单读起来像一张 AI 圈名人堂——英伟达、英特尔、戴尔的战投都在,还有 Perplexity、Box、Harvey、Cognition 这些公司的创始人以个人身份下注。这轮由 Radical Ventures 领投,光看阵容就知道,芯片和云厂商都想在”谁来训练明天的模型”这件事上占个座。

    一家成立两年的公司,凭什么值 10 亿

    Prime Intellect 做的事说白了就是一句话:别再从 OpenAI 或 Anthropic 那里按 token 租智能了,自己造一个更适合业务的。它把训练 AI 智能体需要的家当打包成一套”全栈”——算力、强化学习框架、评估工具,客户像逛市场一样按需取用,不会被绑死在一套方案上。

    “不应该只有旧金山玻璃大厦里的少数极客才拥有训练 AI 模型的能力,每一家企业、每一个国家都应该拥有这种能力。”——Prime Intellect CEO Vincent Weisser

    为什么这件事忽然有了土壤?几年前,自己训模型还是只有巨头玩得起的游戏。但现在强化学习这套打法成熟了,模型可以在具体任务上反复试错、被奖励、被修正,企业慢慢能当自己的”AI 实验室”。真正的难点在于底层基建太复杂,大多数公司根本凑不齐这套零件——Prime Intellect 就卡在了这个缝里。

    企业为什么不想再”租”智能了

    吸引力来自实打实的结果。金融公司 Ramp 用它做了一个在表格里找答案的 Agent,官方说法是准确率高过前沿模型,速度更快,成本只有零头。更关键的是心态变化:企业越来越不愿意把专有数据喂给 OpenAI 和 Anthropic,也怕哪天模型像上个月 Anthropic 的 Fable 那样说关就关。

    • 把敏感业务数据留在自己手里,而不是交给第三方大模型厂商;
    • 不用担心模型被突然下线,业务连续性更有保障;
    • 在垂直任务上,自训的小模型成本可能远低于调用前沿 API。

    Radical Ventures 的合伙人 David Katz 说得更直白:大家开始琢磨”怎么把企业自己的智能掌握在手里,别冒那些风险”。目前年化收入已经冲到 1 亿美元,Ramp、Zapier 都是付费客户。


    钱正流向训练场,而不是模型

    这轮融资背后藏着一个正在成形的判断——资本正在涌向”训练场”,而不是模型本身。就在五天前,做 Agent 安全训练环境的 Bespoke Labs 也拿了 4000 万美元。两笔加起来的信号很清楚:企业想要的不再是又一份订阅,而是 Agent 这个东西的所有权。英伟达和英特尔同时开出支票,说明连芯片厂也信了这套逻辑——它们不在乎模型最后归谁,只要训练跑在自己的硅上就行。接下来一年要回答的问题是,Prime Intellect 能不能在 OpenAI 和 Anthropic 自己猛攻企业市场时,守住这 1 亿美元的增速。

  • TikTok悄悄测试AI肖像检测:想抓深伪换脸,先交自拍和身份证

    刷短视频的人多少都想过一个问题:要是有人用 AI 把自己的脸换到一段视频里,到处招摇撞骗,自己该怎么发现、又该怎么治?TikTok 最近在悄悄试一个答案。

    据 The Verge 的 Jay Peters 报道,TikTok 正在小范围内测一款”肖像检测”(Likeness Detection)工具,目前只对一部分美国创作者开放。它的逻辑很简单:你先加入,系统就帮你盯着平台上有没有 AI 生成的内容在冒用你的脸,发现了你再来核对、举报。

    TikTok 美国发言人 Zachary Kizer 说得很清楚:这项工具是自愿加入的,想用就得先通过 Jumio 做身份验证——实时自拍加身份证件那一整套。

    先验证,再参与

    这点特别关键。创作者想用这个工具,第一步不是”开启扫描”,而是先证明”我是我”。TikTok 不保留身份证件,面部信息也只用于匹配肖像、找出可能的盗用。验证通过后,系统才会去扫那些可能用了你长相的 AI 内容,把疑似结果推给你,由你决定要不要举报。

    TikTok AI 肖像检测
    TikTok 的 AI 肖像检测功能示意(图源:The Verge / Nick Barclay)

    和 Meta 的翻车形成对照

    把时间往回拨几天就很耐人寻味。就在这个月,Meta 推出 Muse Image,允许任何人基于 Instagram 上的公开照片生成 AI 图像,而且所有账号默认就被拉进这个功能。结果骂声来得太快,短短三天 Meta 就撤下了功能,承认自己”没把握好分寸”。

    TikTok 几乎是反着来的:身份验证在前,参与全凭自愿,控制权始终在创作者手里。


    不是 TikTok 一个人在做

    它其实跟在 YouTube 后面。YouTube 早就在做类似的工具,并且已经向所有成年用户开放;更早之前,它把这类保护也给了名人和艺人经纪公司。换句话说,平台从”发现深伪我们再删”走向”帮创作者主动揪出盗用”,已经成了大视频平台的标配方向。

    • 验证机制本身是个隐私取舍:要系统帮你找冒用,就得先交脸的数据
    • 平台得说清楚数据存多久、会不会拿去训练模型、退出后还扫不扫
    • 打假不等于一刀切下架,恶搞、新闻、评论这些边界仍要人工判断

    对创作者来说,一个能乱真的 AI 换脸,轻则毁名声,重则配合诈骗和色情内容。手动搜基本是杯水车薪,所以自动检测才有价值。代价是,你得先信任平台,把最敏感的身份信号交出去。

  • AI芯片又一笔10亿美元:SambaNova估值冲到110亿,摩根大通把算力搬回自家机房

    SambaNova 这家公司,你可能没怎么听过,但在 AI 芯片这条赛道上,它刚干了一件挺有象征意义的事。7 月初,这家 2017 年成立的帕罗奥图创业公司宣布完成 10 亿美元 F 轮融资的第一笔交割,投后估值来到 110 亿美元。领投方是老牌成长基金 General Atlantic,贝莱德、卡塔尔投资局、Intel Capital 等一众机构跟投。

    有意思的是,这笔钱距离它上一次融资只隔了不到五个月。今年 2 月它才拿下 3.5 亿美元 E 轮,同时发布了第五代芯片 SN50。换句话说,资本市场的钱还在疯狂往 AI 基础设施里灌。

    SambaNova 的 CEO Rodrigo Liang 说了一句很直白的话:摩根大通这种级别的银行开始自己搭私有、安全的算力底座来跑推理,这个信号会传到银行业之外。

    它到底造的是什么芯片

    SambaNova 走的是和英伟达不一样的路子。它的芯片不是要取代英伟达,而是贴着英伟达一起用。公司主打”高端推理”——把今天动辄几万亿参数的前沿大模型,塞进一个机柜里跑,而且跑得飞快。Liang 对外说过,SN50 跑推理的解码部分比竞品快五到十倍。

    SambaNova AI 芯片
    SambaNova 的 AI 推理芯片(图源:TechCrunch)

    今年 2 月发布的 SN50 基于数据流架构,计算能力是上一代 SN40 的 5 倍,网络带宽是 4 倍,预计 2026 年下半年开始向客户发货,软银是它的第一个部署伙伴。

    三类客户,和一个 IPO 悬念

    Liang 把客户分成三块:一是主权云,各国政府出钱扶植本地私有云;二是新云(neocloud);三是自建自用的大企业。除了摩根大通,沙特阿美、英特尔以及一些日本企业也在客户名单上。


    • SambaNova 成立以来累计融资规模已相当可观,本轮后现金储备进一步增厚
    • 资金一大用途是锁供应链——在汹涌的需求面前先把产能和物料攥在手里
    • 与英特尔的关系也在加深,双方从投资到联合开发产品一起推向市场

    至于公司未来,Liang 话讲得很活。被问到连续融资是不是意味着铁了心独立,他说”一直有人来找我们”,这扇门在动态的 AI 市场里还开着,但增长势头更可能把公司推向”某天上市”。据 CNBC 报道,他甚至提到了 2027 年 IPO 的可能性,大概率选美国。

    AI 基础设施建设的热度,从这 10 亿美元里就能看出来。当大行都不愿意把最敏感的模型推理完全交给云厂商,像 SambaNova 这样专做”把大模型安全跑在自己地盘上”的芯片公司,就有了存在的理由。

  • Cua:开源 Computer-Use 2.0 框架,让 AI 智能体像人一样操作电脑

    Cua:开源 Computer-Use 2.0 框架,让 AI 智能体像人一样操作电脑

    Cua 开源 Computer-Use 2.0 框架

    项目简介

    Cua 是 trycua 出品的一套开源「Computer-Use 2.0」基础设施,围绕「让 AI 智能体像人一样看屏幕、点按钮、敲键盘完成任务」这一目标,提供了四大模块——后台驱动(Cua Drivers)、智能体沙箱(Cua Sandboxes)、评测基准(Cua-Bench)与 macOS 虚拟化(Lume),覆盖从训练、评测到数据生成的全流程。它把「驱动—沙箱—评测—虚拟化」四件事拆成可独立使用又互相咬合的开源组件,MIT 协议、跨平台,并支持通过 MCP 接入 Claude Code、Cursor、Codex 等主流编码智能体。

    安装要求和过程

    环境要求:

    • Cua Drivers(后台驱动):macOS 12+ / Windows 10+ / Linux(X11 或 Wayland);需搭配 Claude Code、Cursor、Codex 等编码智能体。
    • Cua Sandboxes(沙箱):Python 3.11+,pip install cua
    • Cua-Bench(评测):需 uv;Linux / macOS。
    • Lume(虚拟化):Apple Silicon(M1+)macOS,依赖 Apple Virtualization.Framework。

    快速安装:

    # 1) Cua Drivers — 后台驱动原生桌面应用(macOS / Linux)
    /bin/bash -c "$(curl -fsSL https://cua.ai/driver/install.sh)"
    #  Windows (PowerShell)
    irm https://cua.ai/driver/install.ps1 | iex
    
    # 2) Cua Sandboxes — 任意系统的智能体沙箱
    pip install cua
    
    # 3) Lume — macOS 虚拟化
    /bin/bash -c "$(curl -fsSL https://cua.ai/lume/install.sh)"
    
    # 4) Cua-Bench — 评测与 RL 环境
    git clone https://github.com/trycua/cua && cd cua/cua-bench
    uv tool install -e . && cb image create linux-docker

    核心功能

    Cua 四大模块生态图

    1. 后台 Computer-Use 驱动:在 macOS / Windows / Linux 上后台驱动原生应用,智能体点击、键入、校验,全程不抢走你的光标与窗口焦点;同一套 CLI + MCP 服务器可接入 Claude Code、Cursor、Codex、OpenClaw 等。
    2. 跨 OS 智能体沙箱:一个统一 API 调度任意系统的 VM/容器(Linux / macOS / Windows / Android 及 BYOI),看屏、点击、执行代码,云端或本地(QEMU)皆可。
    3. 评测与 RL 基准(Cua-Bench):在 OSWorld、ScreenSpot、Windows Arena 上评测 computer-use 智能体,并导出轨迹用于训练与强化学习。
    4. macOS 原生虚拟化(Lume):基于 Apple Virtualization.Framework,在 Apple Silicon 上以近原生性能创建、管理 macOS / Linux 虚拟机,支持 unattended 无人值守安装。
    5. 开放可组合生态:cua-driver / cua-agent / cua-sandbox / cua-computer-server / cua-bench / lume / lumier 七大包,lumier 还提供 Docker 兼容接口,便于把 Lume 虚拟机接入现有编排。

    典型使用场景

    Cua 后台 Computer-Use 工作流

    • 给编码智能体一台「电脑」:把 Cua Sandbox 接进 Claude Code,让它在隔离的 macOS / Windows 虚拟机里自行打开浏览器、跑脚本、截图验证,完成端到端任务而不污染本机。
    • 后台自动化办公流:用 Cua Drivers 在后台驱动 Slack、Excel、浏览器等原生应用,自动填表、导出报表、跨软件搬运数据,你依旧能正常用电脑。
    • 评测与训练自己的 CUA 模型:用 Cua-Bench 在标准化环境里跑基准、收集轨迹,进而做监督微调或 RL,持续改进自家 computer-use 模型。

    推荐理由

    一句话:如果你在折腾「让 AI 操作电脑」,Cua 是目前最完整、最务实的开源底座。它把「驱动—沙箱—评测—虚拟化」四件事拆成了可独立使用又互相咬合的模块——想给 Agent 加双手,用 Drivers;想搞评测训练,用 Bench;想在 Mac 上批量起虚拟机,用 Lume。MIT 协议、跨平台、支持 MCP 接入主流编码助手,落地门槛低。相比闭源的 Operator / Manus 类服务,Cua 把控制权和数据都留在你手里——这正是本地优先时代最该有的样子。

    下载地址

  • 苹果 iOS 27 公测开放:重做版 Siri 终于能打 ChatGPT 了?

    这么多年,Siri 一直是那种你喊它定个闹钟还行、稍微复杂点就装听不懂的助手。苹果显然也知道。今年 WWDC 上它亮出了”史上最大改版”的 Siri,当时只给开发者玩;现在 iOS 27 公开测试版一推,普通用户也能上手了——这是苹果头一回把这套 AI 版 Siri 大面积放开。

    全球揣着 iPhone、iPad、Mac 的人加起来有 25 亿。哪怕只有一小撮人装公测,这场测试的规模也够吓人:它等于把苹果重写后的 AI 助手,直接丢进真实生活里接受拷打,对手是 ChatGPT、Gemini、Claude 那些早就上桌的玩家。

    这次 Siri 到底变了什么

    过去的 Siri 像个只会念预设台词的播音员,新版则更像一个能翻你手机、懂你上下文的助手。它能读你设备上的邮件、照片、短信,能看你屏幕正显示什么,也能接住”今天本地有什么活动””刚才新闻说了啥”这类本来得搜网页才答得出的问题。

    入口也比以前多。除了老办法”嘿 Siri”和按侧边键,你还能从灵动岛往下滑把它叫出来;它甚至还塞进了 iPhone 自带的聚光搜索(Spotlight),等于顺手把搜索框也变成了问答框。苹果头一回给 Siri 做了个独立 App——虽然对已经深度嵌进系统的它来说,单独开个 App 多少有点多余。

    iOS 27 上的 AI 版 Siri
    iOS 27 公测里的 AI 版 Siri:能读邮件照片、看屏幕、跨设备调用

    底层是和谷歌一起”蒸馏”出来的

    说到内核,新版 Siri 靠的是 Apple Intelligence,以及苹果自己跑在设备上的基础模型,再加上私有云计算(Private Cloud Compute)。有意思的是,这些模型是苹果拉着谷歌、用 Gemini 当老师”蒸馏”出来的——但不是把 Gemini 改个名就拿来用,而是用苹果自己的数据和针对 Apple 芯片做的瘦身版。好处是模型小、跑得快,还能在端侧保护隐私:Private Cloud Compute 保证你的个人数据不会被苹果存下来,也不会被它翻看。

    开发者测试里,Siri 已经能找准相册里某张照片、总结群聊、把短信里的约会塞进日历,甚至对着镜头告诉你手里的食物大概多少卡。但它也会犯傻——有次被问”伊朗最新消息”,它跑去通讯录里找叫 Iran 的联系人。

    别急着全靠它

    苹果自己也说,公测归公测,真要设备一天都不能出岔子,最好还是等 9 月正式版。今年的开发者测试版整体算稳,比前几年靠谱,但 bug 仍在。另外,欧盟地区暂时还用不上这套 Siri。

    • 覆盖 iPhone、iPad、Mac、Apple Watch、CarPlay、AirPods、Apple TV、Vision Pro 全系设备
    • 不靠开 App 也能用,随时唤醒,更容易渗进日常
    • EU 用户暂被排除,是这版最大的区域遗憾

    说到底,Siri 这次不再是那个只会定闹钟的梗了。它能不能真的追上 ChatGPT 们,还得看秋天正式版和那 25 亿设备上的真实表现。但至少,苹果把”AI 助手”这堂课,补上了最该补的一节。

    📎 原文来源:Apple opens its new Siri AI to everyone with the iOS 27 public beta(TechCrunch / Sarah Perez)
  • DeepSeek 冲刺 IPO:估值一个月从 500 亿跳到 710 亿美元

    去年年初,一家叫深度求索的中国公司用极低的成本训出了能跟美国一线大模型掰手腕的模型,把整个硅谷看愣了。现在,这家公司准备把自己送上股市。

    据彭博社报道,DeepSeek 正在筹备 2027 年登陆资本市场,最早今年底就可能递交申请;与此同时,它打算新一轮融资大约 15 亿美元,估值放到 710 亿美元左右。消息出来前才一个月,DeepSeek 刚完成成立以来的第一笔外部融资——70 亿美元,估值约 500 亿美元。换句话说,它的身价在短短几周里又涨了四成多。

    一笔为上市量身定做的融资

    这轮钱跟上一轮性质不太一样。70 亿那笔是把外部投资人第一次请进股东名册,定了个 500 亿美元的基准价;这一笔 15 亿更像是上市前的”标价动作”——在真正向公众打开账本之前,先让市场知道私人资本愿意给它多少。它要的不是分散股权,而是给投行和未来的散户一个信号:这家公司值这个价。

    从 500 亿到 710 亿美元,一个月出头的工夫,估值跳了 42%。在公开市场还没给过它一个真实价格之前,这个数字更像谈判筹码,而不是定论。

    凭什么值这么多

    支撑估值的,是实打实的使用量。企业级 AI 网关 Vercel 的数据显示,今年 6 月,DeepSeek 处理的 token 占到了将近 23%,排第二;第一是 Anthropic,占 32%。一家中国开源实验室,能在一个全球开发者的入口里吃掉接近四分之一的流量,这本身就说明问题。

    更耐人寻味的是芯片。美国的出口管制卡着先进半导体,DeepSeek 的云服务却跑在华为的芯片上。它用这件事证明了一件事:即便拿不到英伟达最顶尖的货,中国团队照样能把模型能力追到美国一线实验室的几口气之内。

    DeepSeek 上市概念图
    DeepSeek 冲刺 IPO,开源模型的经济账第一次要摊开给公众看

    股东名单里站着”国家队”

    彭博社提到,DeepSeek 的投资人里已经有腾讯,以及北京的国家人工智能产业投资基金。这两家都有动力在上市前把估值推高——不管公开市场最后肯付多少钱。

    • 成立仅三年,靠”低成本训出高性能模型”出名
    • 开源权重,下载量和 token 份额都说明影响力,但收入始终没公开
    • 从幻方量化的长期支持,转向外部融资和公众披露,自由度会部分换成透明度

    当然,这个故事还有没说完的部分。DeepSeek 拒绝置评,彭博的报道也只是单方信源。等它真的披露收入、毛利、芯片投入和公司治理,710 亿美元才算接受检验。对盯着开源替代方案的人来说,DeepSeek 的估值曲线已经成了观察中国 AI 实验室怎么进公开市场的风向标。

    📎 原文来源:DeepSeek reportedly in talks to raise $1.5B, then IPO(TechCrunch / Dominic-Madori Davis)