标签: AI

  • OpenAI 造了个专门搞破坏的 AI:让 GPT-Red 天天揍自家模型

    大模型现在不只会聊天了。它们能自己读邮件、改代码、在网页上点来点去,有的甚至能替你下单、改价格。能力越强,可被钻空子的地方就越多——OpenAI 的研究员管这叫”攻击面在扩大,爆炸半径也在扩大”。靠一帮人手动去挑漏洞,早就跟不上了。

    一个专门干坏事的模型

    OpenAI 想了个听起来像科幻的点子:造一个不参与任何正经工作、唯一的任务就是攻击自家其他模型的 AI,名字叫 GPT-Red。它干的就是安全圈里常说的”红队测试”——过去由一队人扮演黑客,穷尽办法去攻破系统,赶在发布前把窟窿补上。GPT-Red 把这个流程整个自动化了。

    “相比人类红队员,模型特别擅长判断什么方法真正有效、哪种攻击成功率最高,而且一旦盯上一个漏洞,会极度执着地往下深挖。”——GPT-Red 联合创造者 Dylan Hunn

    在”道场”里越打越强

    GPT-Red 不是生来就会搞破坏。研究人员拿一个没被训练成黑客的模型,让它和好几个防守模型进入”自我对弈”循环:它负责攻,对方负责守。一轮轮打下来,攻的越来越刁,守的也越来越硬。整个训练被放在 OpenAI 专门搭的”道场”里,模拟浏览网页、处理邮件日历、编辑代码这些真实场景。

    最有意思的发现是一种叫”伪造思维链”的攻击。思维链是模型边想边记的”内部小本本”,GPT-Red 学会了往别人的小本本里塞一条假记录,让对方误以为某些错误信息已经验证过。研究员打了个比方:就像有人告诉你”1+1=3,而且你自己确认过了”,模型想都不想就吐出 3。

    OpenAI 用自我对弈训练出的红队模型 GPT-Red
    OpenAI 用自我对弈训练出的”红队黑客”GPT-Red(图源:MIT Technology Review)

    效果肉眼可见

    OpenAI 把 GPT-Red 找出的强力攻击拿去试自家模型:对去年 8 月的 GPT-5,成功率超过 90%;对刚发布的 GPT-5.6,掉到了 23% 以下。他们还重跑了 2025 年人类红队找 GPT-5 漏洞的实验,GPT-Red 找出的有效攻击比人还多。连一个自动售货机智能体 Vendy 都被它骗去改了商品价格、取消用户订单。

    • 它不擅长需要攻防双方来回多轮对话的复杂攻击,这恰恰是人类黑客的强项
    • 用图片做提示注入的本领还不行,得继续练
    • OpenAI 把它定位成人类红队的辅助,而不是替代品

    不出意外,OpenAI 不会把 GPT-Red 放出来。研究员说他们已经训了一年多,背后是世界最富公司之一的算力堆出来的,”不是谁照着这个思路就能轻易复刻的”。但换个角度看,当防守方开始用 AI 批量生产攻击来练自己,安全这件事本身,也已经进入了自动化时代。

  • Kimi CLI:月之暗面开源的终端 AI 编程智能体(10K+ Stars)

    Kimi CLI:月之暗面开源的终端 AI 编程智能体(10K+ Stars)

    Kimi CLI 在 VS Code 中的集成效果

    Kimi CLI 是月之暗面(MoonshotAI)开源的终端 AI 编程智能体——直接在命令行里读改代码、执行命令、联网检索,并自主规划与调整动作,把 Kimi 大模型搬进了你的 shell 与编辑器。

    一、项目简介

    Kimi CLI 是一个运行在终端里的 AI Agent,主打软件工程与命令行操作两大类任务。它不只是聊天机器人,而是能真正读取/编辑代码、执行 shell 命令、检索与抓取网页,并在执行过程中自主规划、动态修正路线。项目由 MoonshotAI 维护,采用 Apache-2.0 协议,当前已在 GitHub 收获 10K+ Stars。值得留意的是,官方已宣布 Kimi CLI 正演进为下一代 Kimi Code CLI,安装新版本会自动迁移配置与会话,但现有文档与安装方式依旧可用。

    二、安装要求与过程

    环境要求:

    • Python ≥ 3.12(PyPI 包已发布,最新版 1.49.0)
    • 一个 Kimi 账号(登录后使用)或有效的 API Key
    • 可选:Node.js(用于运行 npx 类 MCP 服务,如 chrome-devtools-mcp);Zsh(如需 shell 插件)

    快速安装:

    # 方式一:pip 安装(推荐)
    pip install kimi-cli
    
    # 方式二:pipx 隔离安装
    pipx install kimi-cli
    
    # 启动并登录
    kimi          # 进入交互界面后输入 /login 完成登录
    

    登录后即可在终端直接与 Kimi 对话、让它改代码、跑命令;配置与历史会话会保存在本地,跨项目复用。

    三、核心功能

    • 终端即 Shell(Ctrl-X 切换):Kimi CLI 本身就是一个 shell,按 Ctrl-X 即可在不退出智能体的情况下直接运行 shell 命令,把对话与执行无缝融合。
    • VS Code 扩展:通过官方 Kimi Code 扩展 在编辑器侧边栏开启 Agent 面板,直接基于当前工程上下文协作(见上方截图)。
    • ACP 协议接入主流 IDE:原生支持 Agent Client Protocol,可作为 ACP Agent Server 接入 Zed、JetBrains 等任意兼容编辑器,命令为 kimi acp
    • 原生 MCP 支持:内置 kimi mcp 子命令组,支持 HTTP / stdio / OAuth 多种传输方式,一行即可增删与授权 MCP Server(如 Context7、Linear、chrome-devtools)。
    • Zsh 深度集成:配合 zsh-kimi-cli 插件,把 AI Agent 能力直接带进你的 shell,Ctrl-X 一键切到智能体模式。

    四、典型使用场景

    • 终端里的全栈开发:在服务器或本地终端直接让 Kimi 读懂整个代码库、定位 Bug、生成补丁并执行测试,无需切换到图形界面 IDE。
    • IDE 内结对编程:在 VS Code / Zed / JetBrains 中以 Agent 面板形式调用 Kimi,基于当前文件与工程上下文做重构、加功能、写测试,改动实时落盘。
    • 可扩展的自动化工作流:通过 MCP 接入 Linear、Context7、Chrome DevTools 等工具,让 Kimi CLI 自动查需求、查文档、跑端到端浏览器验证,组成稳定的开发自动化流水线。

    五、推荐理由

    作为一款国产大模型厂商出品的命令行智能体,Kimi CLI 最大的亮点是「终端原生」——它不强迫你离开 shell,Ctrl-X 即可在「智能体」与「命令模式」间无缝切换,对远程服务器、无界面环境极其友好。同时它对 ACP / MCP 双协议的原生支持,意味着你既能把它嵌入 VS Code、Zed、JetBrains,也能通过 MCP 无限扩展工具边界,灵活度很高。Apache-2.0 协议可商用、配置本地化,隐私与可玩性兼顾。虽项目正平滑演进为 Kimi Code CLI,但当前版本已足够稳定,是体验「Kimi 版 Claude Code」最轻量直接的入口。

    六、下载地址

    (注:Kimi CLI 正演进为 Kimi Code CLI,新版本会自动迁移配置与会话,建议关注官方仓库获取最新动态。)

  • KTransformers:让消费级显卡跑起 DeepSeek 的异构推理引擎

    KTransformers:让消费级显卡跑起 DeepSeek 的异构推理引擎

    KTransformers

    项目简介

    KTransformers 是清华大学 MADSys 实验室联合 Approaching.AI 等团队开源的大模型异构推理与微调框架。它最出圈的能力,是让一块 24GB 显存的消费级显卡(如 RTX 4090)也能流畅运行 DeepSeek-V3 / R1 这类数百 GB 的巨型 MoE 模型——把”热专家”放在 GPU、”冷专家”卸载到 CPU/内存,配合 INT4/INT8/FP8 量化与 AMX/AVX 指令集优化,在本地把推理速度做到可用甚至惊艳。

    安装要求和过程

    环境要求:

    • Python 3.10 / 3.11 / 3.12(官方预编译 wheel 支持这三个版本)
    • Linux x86-64(manylinux_2_17),CPU 需支持 AVX2(Intel Haswell 2013+ / AMD Zen+ 及以上)
    • 可选 NVIDIA GPU,计算能力 8.0+(Ampere / Ada / Hopper,如 A100、RTX 3090/4090、H100);无需安装 CUDA toolkit,静态 CUDA 运行时已内置
    • 运行超大规模 MoE(如 DeepSeek-V3/R1)时,建议 64GB~382GB 内存用于专家卸载

    快速安装(PyPI,推荐大多数用户):

    pip install kt-kernel

    一行命令即装好含自动 CPU 检测、多指令集变体与 CUDA 加速的推理内核,无需编译。验证安装:

    kt version          # 查看 CLI 版本与检测到的 CPU 变体
    python -c "from kt_kernel import KTMoEWrapper; print('ok')"

    从源码编译(需要自定义 / AMD BLIS / ARM KML 后端):

    git clone https://github.com/kvcache-ai/ktransformers.git
    cd ktransformers/kt-kernel
    git submodule update --init --recursive
    ./install.sh        # 自动检测 CPU 并 -march=native 编译

    一条命令跑起来(自动适配硬件):

    kt run m2           # 启动模型推理服务(自动优化参数)
    kt chat             # 另开终端开始对话

    核心功能

    • CPU-GPU 异构推理(expert offload):把 Mixture-of-Experts 中高频访问的”热专家”留在 GPU,低频”冷专家”卸载到 CPU 与内存,显存占用从数十 GB 降到单卡 24GB 即可跑 DeepSeek-R1/V3。
    • 多指令集深度优化内核:内置 AMX(Intel Sapphire Rapids+)、AVX512(含 BF16/VNNI/VBMI)、AVX2 等多套 CPU 内核变体,运行时按 CPU 自动选择,并支持原生 FP8/BF16/INT4 精度。
    • 量化与长上下文:支持 CPU 侧 INT4/INT8 量化权重与 GPU 侧 GPTQ,配合 unsloth 1.58/2.51bit 与 IQ1_S/FP8 混合权重;可在 24GB 显存下放飞 139K+ 长上下文。
    • 微调(SFT)× LLaMA-Factory:支持在有限显存上对 DeepSeek-V3/R1、Qwen3-MoE 等超大 MoE 做 LoRA 微调,官方称比 ZeRO-Offload 快 6~12 倍、CPU 内存减半。
    • 生产级集成:提供干净的 Python API,可无缝接入 SGLang 做生产部署,实现”热专家 GPU / 冷专家 CPU”的异构服务。

    KTransformers × LLaMA-Factory 超大 MoE 微调

    图:KTransformers × LLaMA-Factory 在有限显存上微调超大 MoE 模型

    典型使用场景

    • 本地私有化跑 DeepSeek 满血版:开发者用一台配 24GB 显卡 + 大内存的主机,本地部署 DeepSeek-R1/V3 做代码助手、知识库问答,数据不出机器。
    • 高并发推理服务:在 8×L20 + Xeon 的服务器上,官方实测 DeepSeek-R1-0528(FP8)总吞吐 227.85 tokens/s、8 路并发输出 87.58 tokens/s,适合中小团队自建推理网关。
    • 超大模型低成本微调:用 4×RTX 4090 对 DeepSeek-V3 做 LoRA 微调(约 80GB 显存、3.7 it/s),或用单张 4090 微调 Qwen3-30B-A3B(8+ it/s),把训练成本打到消费级。

    推荐理由

    大模型推理的门槛,过去被”显存”死死卡住——想本地跑 DeepSeek 满血版,要么堆 H100 要么云上烧钱。KTransformers 的价值正在于此:它不跟你拼硬件,而是用异构调度 + 量化 + CPU 指令集优化把”不可能”变成”在家就能跑”。对预算有限的个人开发者、想做私有化部署的小团队、以及研究 MoE 推理优化的工程师来说,它是目前最务实的本地推理方案之一。

    工程上它也很”乖”:从 pip install kt-kernelkt run 一条命令起服务,内置 CPU 变体自动检测、NUMA 感知线程池,连 CUDA toolkit 都不用装。唯一的代价是——它目前主要面向 Linux x86-64,且吃内存(专家卸载越多越吃),上 Windows 原生或低内存机器要谨慎。但瑕不掩瑜,如果你想体验”把大模型装进自己电脑”,KTransformers 值得第一个试。

    下载地址

    许可:Apache-2.0 | 语言:Python / C++ | 维护:清华大学 MADSys 实验室、Approaching.AI、9#AISoft 及社区

  • Discord 的 AI 审核翻车:8000 多人因为一张棋盘图被封号

    Discord 应用图标
    Discord 的自动安全系统误判无害图片,导致超 8000 个账号被封(图源:TechCrunch)

    你只是往 Discord 上传了一张棋盘截图,或者游戏贴图,甚至是一张带方格的透明背景图,账号就突然没了。过去两个月,超过 8000 名用户经历了这种事——而锅不在他们,在 Discord 的 AI 审核系统出了 bug。

    一张棋盘图引发的误封

    Discord 已经承认,从今年 5 月起,它的自动安全系统把一批完全无害的图片误判成了有害内容:电子表格、棋盘、游戏纹理,还有白底和灰底的透明背景,统统中招。光是上周末,又有 200 个账号被误封。公司说问题已经修好,受影响账号正在陆续恢复。

    “我们的系统会把内容与已知有害材料做匹配,这种相似匹配可能产生误报,所以按设计,理应有信任与安全团队的人工复核再采取行动。”——Discord 官方说明

    Discord 在 X 上解释过这套机制:系统会把用户上传的内容,跟已知有害材料的数据库做相似度匹配,初衷是抓非法内容。问题出在流程的最后一环——一个 bug 让系统跳过了人工复核,直接把账号给封了。换句话说,本该”先审核、后处罚”的设计,被这个漏洞绕了过去。

    用户为什么这么愤怒

    不少人在 X 和 Reddit 上吐槽,自己只是传了张带方格图案的图就被永久封禁。有人怀疑,Discord 的审核模型对方格图案特别敏感,因为这些图案以前常被人拿来遮挡、伪装违规内容,系统学”歪”了。对把 Discord 当工作沟通、游戏社群或远距离社交主阵地的用户来说,这种无差别封号代价不小。

    • 一个游戏制作人说,自己靠它联系所有合作方,账号没了等于断了线;
    • 误判发生时,用户先被扣上最严重的安全帽子、先被踢出门,事后才轮到申诉;
    • 自动化审核一旦出错,替你背锅的是成千上万个真实的人。

    Discord 不是孤例。去年 Instagram、Facebook 群组就出现过大规模莫名封号,很多人怀疑是 AI 审核的锅,但 Meta 从没公开认过。Tumblr 也挨过类似骂。现在 Meta 的监督委员会正在逼平台提高透明度。


    最扎心的不是 bug,是代价结构

    这件事最让人不舒服的地方,在于它的代价分配:误判发生时,用户先被定罪、先被踢出,申诉是后面的事。在信任与安全这件事上,流程往往和算法一样重要。AI 初审加人工复核的混合模式喊了很久,但 Discord 这跤说明,只要中间任何一环断了,受伤的就是普通用户。把误报率当成硬指标公开,可能比事后修 bug 更有意义。

  • Prime Intellect 融了 13 亿美元:企业不想再给大模型厂商”交租”了

    Prime Intellect 创始人团队
    Prime Intellect 把训练 AI 智能体的全套家当打包成”全栈”服务(图源:TechCrunch)

    一家 2024 年才成立的公司,靠帮企业自己训练 AI 智能体,融到了 1.3 亿美元 A 轮,估值直接站上 10 亿美元。投资方名单读起来像一张 AI 圈名人堂——英伟达、英特尔、戴尔的战投都在,还有 Perplexity、Box、Harvey、Cognition 这些公司的创始人以个人身份下注。这轮由 Radical Ventures 领投,光看阵容就知道,芯片和云厂商都想在”谁来训练明天的模型”这件事上占个座。

    一家成立两年的公司,凭什么值 10 亿

    Prime Intellect 做的事说白了就是一句话:别再从 OpenAI 或 Anthropic 那里按 token 租智能了,自己造一个更适合业务的。它把训练 AI 智能体需要的家当打包成一套”全栈”——算力、强化学习框架、评估工具,客户像逛市场一样按需取用,不会被绑死在一套方案上。

    “不应该只有旧金山玻璃大厦里的少数极客才拥有训练 AI 模型的能力,每一家企业、每一个国家都应该拥有这种能力。”——Prime Intellect CEO Vincent Weisser

    为什么这件事忽然有了土壤?几年前,自己训模型还是只有巨头玩得起的游戏。但现在强化学习这套打法成熟了,模型可以在具体任务上反复试错、被奖励、被修正,企业慢慢能当自己的”AI 实验室”。真正的难点在于底层基建太复杂,大多数公司根本凑不齐这套零件——Prime Intellect 就卡在了这个缝里。

    企业为什么不想再”租”智能了

    吸引力来自实打实的结果。金融公司 Ramp 用它做了一个在表格里找答案的 Agent,官方说法是准确率高过前沿模型,速度更快,成本只有零头。更关键的是心态变化:企业越来越不愿意把专有数据喂给 OpenAI 和 Anthropic,也怕哪天模型像上个月 Anthropic 的 Fable 那样说关就关。

    • 把敏感业务数据留在自己手里,而不是交给第三方大模型厂商;
    • 不用担心模型被突然下线,业务连续性更有保障;
    • 在垂直任务上,自训的小模型成本可能远低于调用前沿 API。

    Radical Ventures 的合伙人 David Katz 说得更直白:大家开始琢磨”怎么把企业自己的智能掌握在手里,别冒那些风险”。目前年化收入已经冲到 1 亿美元,Ramp、Zapier 都是付费客户。


    钱正流向训练场,而不是模型

    这轮融资背后藏着一个正在成形的判断——资本正在涌向”训练场”,而不是模型本身。就在五天前,做 Agent 安全训练环境的 Bespoke Labs 也拿了 4000 万美元。两笔加起来的信号很清楚:企业想要的不再是又一份订阅,而是 Agent 这个东西的所有权。英伟达和英特尔同时开出支票,说明连芯片厂也信了这套逻辑——它们不在乎模型最后归谁,只要训练跑在自己的硅上就行。接下来一年要回答的问题是,Prime Intellect 能不能在 OpenAI 和 Anthropic 自己猛攻企业市场时,守住这 1 亿美元的增速。

  • TikTok悄悄测试AI肖像检测:想抓深伪换脸,先交自拍和身份证

    刷短视频的人多少都想过一个问题:要是有人用 AI 把自己的脸换到一段视频里,到处招摇撞骗,自己该怎么发现、又该怎么治?TikTok 最近在悄悄试一个答案。

    据 The Verge 的 Jay Peters 报道,TikTok 正在小范围内测一款”肖像检测”(Likeness Detection)工具,目前只对一部分美国创作者开放。它的逻辑很简单:你先加入,系统就帮你盯着平台上有没有 AI 生成的内容在冒用你的脸,发现了你再来核对、举报。

    TikTok 美国发言人 Zachary Kizer 说得很清楚:这项工具是自愿加入的,想用就得先通过 Jumio 做身份验证——实时自拍加身份证件那一整套。

    先验证,再参与

    这点特别关键。创作者想用这个工具,第一步不是”开启扫描”,而是先证明”我是我”。TikTok 不保留身份证件,面部信息也只用于匹配肖像、找出可能的盗用。验证通过后,系统才会去扫那些可能用了你长相的 AI 内容,把疑似结果推给你,由你决定要不要举报。

    TikTok AI 肖像检测
    TikTok 的 AI 肖像检测功能示意(图源:The Verge / Nick Barclay)

    和 Meta 的翻车形成对照

    把时间往回拨几天就很耐人寻味。就在这个月,Meta 推出 Muse Image,允许任何人基于 Instagram 上的公开照片生成 AI 图像,而且所有账号默认就被拉进这个功能。结果骂声来得太快,短短三天 Meta 就撤下了功能,承认自己”没把握好分寸”。

    TikTok 几乎是反着来的:身份验证在前,参与全凭自愿,控制权始终在创作者手里。


    不是 TikTok 一个人在做

    它其实跟在 YouTube 后面。YouTube 早就在做类似的工具,并且已经向所有成年用户开放;更早之前,它把这类保护也给了名人和艺人经纪公司。换句话说,平台从”发现深伪我们再删”走向”帮创作者主动揪出盗用”,已经成了大视频平台的标配方向。

    • 验证机制本身是个隐私取舍:要系统帮你找冒用,就得先交脸的数据
    • 平台得说清楚数据存多久、会不会拿去训练模型、退出后还扫不扫
    • 打假不等于一刀切下架,恶搞、新闻、评论这些边界仍要人工判断

    对创作者来说,一个能乱真的 AI 换脸,轻则毁名声,重则配合诈骗和色情内容。手动搜基本是杯水车薪,所以自动检测才有价值。代价是,你得先信任平台,把最敏感的身份信号交出去。

  • AI芯片又一笔10亿美元:SambaNova估值冲到110亿,摩根大通把算力搬回自家机房

    SambaNova 这家公司,你可能没怎么听过,但在 AI 芯片这条赛道上,它刚干了一件挺有象征意义的事。7 月初,这家 2017 年成立的帕罗奥图创业公司宣布完成 10 亿美元 F 轮融资的第一笔交割,投后估值来到 110 亿美元。领投方是老牌成长基金 General Atlantic,贝莱德、卡塔尔投资局、Intel Capital 等一众机构跟投。

    有意思的是,这笔钱距离它上一次融资只隔了不到五个月。今年 2 月它才拿下 3.5 亿美元 E 轮,同时发布了第五代芯片 SN50。换句话说,资本市场的钱还在疯狂往 AI 基础设施里灌。

    SambaNova 的 CEO Rodrigo Liang 说了一句很直白的话:摩根大通这种级别的银行开始自己搭私有、安全的算力底座来跑推理,这个信号会传到银行业之外。

    它到底造的是什么芯片

    SambaNova 走的是和英伟达不一样的路子。它的芯片不是要取代英伟达,而是贴着英伟达一起用。公司主打”高端推理”——把今天动辄几万亿参数的前沿大模型,塞进一个机柜里跑,而且跑得飞快。Liang 对外说过,SN50 跑推理的解码部分比竞品快五到十倍。

    SambaNova AI 芯片
    SambaNova 的 AI 推理芯片(图源:TechCrunch)

    今年 2 月发布的 SN50 基于数据流架构,计算能力是上一代 SN40 的 5 倍,网络带宽是 4 倍,预计 2026 年下半年开始向客户发货,软银是它的第一个部署伙伴。

    三类客户,和一个 IPO 悬念

    Liang 把客户分成三块:一是主权云,各国政府出钱扶植本地私有云;二是新云(neocloud);三是自建自用的大企业。除了摩根大通,沙特阿美、英特尔以及一些日本企业也在客户名单上。


    • SambaNova 成立以来累计融资规模已相当可观,本轮后现金储备进一步增厚
    • 资金一大用途是锁供应链——在汹涌的需求面前先把产能和物料攥在手里
    • 与英特尔的关系也在加深,双方从投资到联合开发产品一起推向市场

    至于公司未来,Liang 话讲得很活。被问到连续融资是不是意味着铁了心独立,他说”一直有人来找我们”,这扇门在动态的 AI 市场里还开着,但增长势头更可能把公司推向”某天上市”。据 CNBC 报道,他甚至提到了 2027 年 IPO 的可能性,大概率选美国。

    AI 基础设施建设的热度,从这 10 亿美元里就能看出来。当大行都不愿意把最敏感的模型推理完全交给云厂商,像 SambaNova 这样专做”把大模型安全跑在自己地盘上”的芯片公司,就有了存在的理由。

  • Cua:开源 Computer-Use 2.0 框架,让 AI 智能体像人一样操作电脑

    Cua:开源 Computer-Use 2.0 框架,让 AI 智能体像人一样操作电脑

    Cua 开源 Computer-Use 2.0 框架

    项目简介

    Cua 是 trycua 出品的一套开源「Computer-Use 2.0」基础设施,围绕「让 AI 智能体像人一样看屏幕、点按钮、敲键盘完成任务」这一目标,提供了四大模块——后台驱动(Cua Drivers)、智能体沙箱(Cua Sandboxes)、评测基准(Cua-Bench)与 macOS 虚拟化(Lume),覆盖从训练、评测到数据生成的全流程。它把「驱动—沙箱—评测—虚拟化」四件事拆成可独立使用又互相咬合的开源组件,MIT 协议、跨平台,并支持通过 MCP 接入 Claude Code、Cursor、Codex 等主流编码智能体。

    安装要求和过程

    环境要求:

    • Cua Drivers(后台驱动):macOS 12+ / Windows 10+ / Linux(X11 或 Wayland);需搭配 Claude Code、Cursor、Codex 等编码智能体。
    • Cua Sandboxes(沙箱):Python 3.11+,pip install cua
    • Cua-Bench(评测):需 uv;Linux / macOS。
    • Lume(虚拟化):Apple Silicon(M1+)macOS,依赖 Apple Virtualization.Framework。

    快速安装:

    # 1) Cua Drivers — 后台驱动原生桌面应用(macOS / Linux)
    /bin/bash -c "$(curl -fsSL https://cua.ai/driver/install.sh)"
    #  Windows (PowerShell)
    irm https://cua.ai/driver/install.ps1 | iex
    
    # 2) Cua Sandboxes — 任意系统的智能体沙箱
    pip install cua
    
    # 3) Lume — macOS 虚拟化
    /bin/bash -c "$(curl -fsSL https://cua.ai/lume/install.sh)"
    
    # 4) Cua-Bench — 评测与 RL 环境
    git clone https://github.com/trycua/cua && cd cua/cua-bench
    uv tool install -e . && cb image create linux-docker

    核心功能

    Cua 四大模块生态图

    1. 后台 Computer-Use 驱动:在 macOS / Windows / Linux 上后台驱动原生应用,智能体点击、键入、校验,全程不抢走你的光标与窗口焦点;同一套 CLI + MCP 服务器可接入 Claude Code、Cursor、Codex、OpenClaw 等。
    2. 跨 OS 智能体沙箱:一个统一 API 调度任意系统的 VM/容器(Linux / macOS / Windows / Android 及 BYOI),看屏、点击、执行代码,云端或本地(QEMU)皆可。
    3. 评测与 RL 基准(Cua-Bench):在 OSWorld、ScreenSpot、Windows Arena 上评测 computer-use 智能体,并导出轨迹用于训练与强化学习。
    4. macOS 原生虚拟化(Lume):基于 Apple Virtualization.Framework,在 Apple Silicon 上以近原生性能创建、管理 macOS / Linux 虚拟机,支持 unattended 无人值守安装。
    5. 开放可组合生态:cua-driver / cua-agent / cua-sandbox / cua-computer-server / cua-bench / lume / lumier 七大包,lumier 还提供 Docker 兼容接口,便于把 Lume 虚拟机接入现有编排。

    典型使用场景

    Cua 后台 Computer-Use 工作流

    • 给编码智能体一台「电脑」:把 Cua Sandbox 接进 Claude Code,让它在隔离的 macOS / Windows 虚拟机里自行打开浏览器、跑脚本、截图验证,完成端到端任务而不污染本机。
    • 后台自动化办公流:用 Cua Drivers 在后台驱动 Slack、Excel、浏览器等原生应用,自动填表、导出报表、跨软件搬运数据,你依旧能正常用电脑。
    • 评测与训练自己的 CUA 模型:用 Cua-Bench 在标准化环境里跑基准、收集轨迹,进而做监督微调或 RL,持续改进自家 computer-use 模型。

    推荐理由

    一句话:如果你在折腾「让 AI 操作电脑」,Cua 是目前最完整、最务实的开源底座。它把「驱动—沙箱—评测—虚拟化」四件事拆成了可独立使用又互相咬合的模块——想给 Agent 加双手,用 Drivers;想搞评测训练,用 Bench;想在 Mac 上批量起虚拟机,用 Lume。MIT 协议、跨平台、支持 MCP 接入主流编码助手,落地门槛低。相比闭源的 Operator / Manus 类服务,Cua 把控制权和数据都留在你手里——这正是本地优先时代最该有的样子。

    下载地址

  • 苹果 iOS 27 公测开放:重做版 Siri 终于能打 ChatGPT 了?

    这么多年,Siri 一直是那种你喊它定个闹钟还行、稍微复杂点就装听不懂的助手。苹果显然也知道。今年 WWDC 上它亮出了”史上最大改版”的 Siri,当时只给开发者玩;现在 iOS 27 公开测试版一推,普通用户也能上手了——这是苹果头一回把这套 AI 版 Siri 大面积放开。

    全球揣着 iPhone、iPad、Mac 的人加起来有 25 亿。哪怕只有一小撮人装公测,这场测试的规模也够吓人:它等于把苹果重写后的 AI 助手,直接丢进真实生活里接受拷打,对手是 ChatGPT、Gemini、Claude 那些早就上桌的玩家。

    这次 Siri 到底变了什么

    过去的 Siri 像个只会念预设台词的播音员,新版则更像一个能翻你手机、懂你上下文的助手。它能读你设备上的邮件、照片、短信,能看你屏幕正显示什么,也能接住”今天本地有什么活动””刚才新闻说了啥”这类本来得搜网页才答得出的问题。

    入口也比以前多。除了老办法”嘿 Siri”和按侧边键,你还能从灵动岛往下滑把它叫出来;它甚至还塞进了 iPhone 自带的聚光搜索(Spotlight),等于顺手把搜索框也变成了问答框。苹果头一回给 Siri 做了个独立 App——虽然对已经深度嵌进系统的它来说,单独开个 App 多少有点多余。

    iOS 27 上的 AI 版 Siri
    iOS 27 公测里的 AI 版 Siri:能读邮件照片、看屏幕、跨设备调用

    底层是和谷歌一起”蒸馏”出来的

    说到内核,新版 Siri 靠的是 Apple Intelligence,以及苹果自己跑在设备上的基础模型,再加上私有云计算(Private Cloud Compute)。有意思的是,这些模型是苹果拉着谷歌、用 Gemini 当老师”蒸馏”出来的——但不是把 Gemini 改个名就拿来用,而是用苹果自己的数据和针对 Apple 芯片做的瘦身版。好处是模型小、跑得快,还能在端侧保护隐私:Private Cloud Compute 保证你的个人数据不会被苹果存下来,也不会被它翻看。

    开发者测试里,Siri 已经能找准相册里某张照片、总结群聊、把短信里的约会塞进日历,甚至对着镜头告诉你手里的食物大概多少卡。但它也会犯傻——有次被问”伊朗最新消息”,它跑去通讯录里找叫 Iran 的联系人。

    别急着全靠它

    苹果自己也说,公测归公测,真要设备一天都不能出岔子,最好还是等 9 月正式版。今年的开发者测试版整体算稳,比前几年靠谱,但 bug 仍在。另外,欧盟地区暂时还用不上这套 Siri。

    • 覆盖 iPhone、iPad、Mac、Apple Watch、CarPlay、AirPods、Apple TV、Vision Pro 全系设备
    • 不靠开 App 也能用,随时唤醒,更容易渗进日常
    • EU 用户暂被排除,是这版最大的区域遗憾

    说到底,Siri 这次不再是那个只会定闹钟的梗了。它能不能真的追上 ChatGPT 们,还得看秋天正式版和那 25 亿设备上的真实表现。但至少,苹果把”AI 助手”这堂课,补上了最该补的一节。

    📎 原文来源:Apple opens its new Siri AI to everyone with the iOS 27 public beta(TechCrunch / Sarah Perez)
  • DeepSeek 冲刺 IPO:估值一个月从 500 亿跳到 710 亿美元

    去年年初,一家叫深度求索的中国公司用极低的成本训出了能跟美国一线大模型掰手腕的模型,把整个硅谷看愣了。现在,这家公司准备把自己送上股市。

    据彭博社报道,DeepSeek 正在筹备 2027 年登陆资本市场,最早今年底就可能递交申请;与此同时,它打算新一轮融资大约 15 亿美元,估值放到 710 亿美元左右。消息出来前才一个月,DeepSeek 刚完成成立以来的第一笔外部融资——70 亿美元,估值约 500 亿美元。换句话说,它的身价在短短几周里又涨了四成多。

    一笔为上市量身定做的融资

    这轮钱跟上一轮性质不太一样。70 亿那笔是把外部投资人第一次请进股东名册,定了个 500 亿美元的基准价;这一笔 15 亿更像是上市前的”标价动作”——在真正向公众打开账本之前,先让市场知道私人资本愿意给它多少。它要的不是分散股权,而是给投行和未来的散户一个信号:这家公司值这个价。

    从 500 亿到 710 亿美元,一个月出头的工夫,估值跳了 42%。在公开市场还没给过它一个真实价格之前,这个数字更像谈判筹码,而不是定论。

    凭什么值这么多

    支撑估值的,是实打实的使用量。企业级 AI 网关 Vercel 的数据显示,今年 6 月,DeepSeek 处理的 token 占到了将近 23%,排第二;第一是 Anthropic,占 32%。一家中国开源实验室,能在一个全球开发者的入口里吃掉接近四分之一的流量,这本身就说明问题。

    更耐人寻味的是芯片。美国的出口管制卡着先进半导体,DeepSeek 的云服务却跑在华为的芯片上。它用这件事证明了一件事:即便拿不到英伟达最顶尖的货,中国团队照样能把模型能力追到美国一线实验室的几口气之内。

    DeepSeek 上市概念图
    DeepSeek 冲刺 IPO,开源模型的经济账第一次要摊开给公众看

    股东名单里站着”国家队”

    彭博社提到,DeepSeek 的投资人里已经有腾讯,以及北京的国家人工智能产业投资基金。这两家都有动力在上市前把估值推高——不管公开市场最后肯付多少钱。

    • 成立仅三年,靠”低成本训出高性能模型”出名
    • 开源权重,下载量和 token 份额都说明影响力,但收入始终没公开
    • 从幻方量化的长期支持,转向外部融资和公众披露,自由度会部分换成透明度

    当然,这个故事还有没说完的部分。DeepSeek 拒绝置评,彭博的报道也只是单方信源。等它真的披露收入、毛利、芯片投入和公司治理,710 亿美元才算接受检验。对盯着开源替代方案的人来说,DeepSeek 的估值曲线已经成了观察中国 AI 实验室怎么进公开市场的风向标。

    📎 原文来源:DeepSeek reportedly in talks to raise $1.5B, then IPO(TechCrunch / Dominic-Madori Davis)