标签: AI

  • Notion 砍了邮箱 App,转头做了个「Agents」:把 ChatGPT、Gemini、Claude 全塞进一个聊天框

    Notion Agents iPhone 应用界面示意图
    Notion Agents 把 ChatGPT、Gemini、Claude 收编进一个聊天框(配图由 AI 生成)

    Notion 这公司最近有点”拆东墙补西墙”的意思。上个月它刚宣布砍掉做了刚好一年的邮箱 App Notion Mail;这个月,它就端出了一个全新的 iPhone 应用,叫 Agents。

    它不是另一个笔记 App

    7 月 7 日上线的 Notion Agents,和它家那个主力的笔记 App 不是一回事。它不让你写文档,而是专门用来”聊”——跟你自己的 AI 代理聊,也跟接进来的大模型聊。目前支持三个:Anthropic 的 Claude、Google 的 Gemini,还有 OpenAI 的 GPT。换句话说,Notion 自己不下场做模型,而是做了个”代理集散中心”,把别人的模型都接进来。

    用法上挺直白。你可以在里面问代理问题,也可以随手记点东西:打一段文字、录一段语音、拍张照片,代理会自己判断这些内容该归到哪。它连着你真实的 Notion 工作区和你那一整套工具栈,所以回答不是凭空编的,而是从你自己的文档和数据里长出来的。

    Notion 主 App 是个”仓库”,你把东西存进去;Agents 是个”前台”,你动动嘴,它去仓库里翻、去帮你办。

    砍邮箱、做代理,Notion 在赌什么

    把 Notion Mail 的退场和 Agents 的登场放一起看,逻辑就清楚了。做邮箱那一年,Notion 想的是”AI 帮我处理收件箱”;现在它发现,比起替你盯邮件,更值钱的是做一个”你随时能调度的代理中枢”。邮箱是入口之一,但不是非争不可的入口;而”代理能连你的全部工作”这个位置,谁占住谁就掌握主动。

    • “懂你的工作”:接的是你真实的文档和工具,不是凭空编的答案
    • “即时捕捉任何东西”:文字、照片、语音,代理自己决定放哪
    • 能直接干活:建页面、起草周报、跨工具搜东西,全在一个聊天框里

    当然,Agents 现在还是个 iPhone 专属应用(iPad 和 Mac 上能勉强跑,但没专门适配)。对于一个主打”随时随地处理工作”的工具来说,桌面端的缺位有点尴尬。而且它本质上是个聚合层——模型能力好不好,最终还是 Claude、Gemini、GPT 说了算。

    Notion 的护城河,在于它握着你的文档、数据库和项目,也就是”上下文”。代理再聪明,没有你的真实数据也是空转。所以这事挺典型的:大厂做 AI,拼到最后往往不是谁模型最强,而是谁最贴近你的真实工作流。Notion 把赌注压在”上下文”上,砍掉边缘业务、All in 代理,这一步走得够干脆。


  • Google Photos 上线「Video Remix」:你手机里那段糊视频,几秒钟被 AI 改头换面

    Google Photos Video Remix AI 视频重混功能示意图
    Google Photos 的 Video Remix 把 AI 视频编辑做成了相册里的一键按钮(配图由 AI 生成)

    你手机相册里那些拍得一般、光线很暗、背景很乱的视频,以前基本就躺在那儿吃灰了。现在 Google 想让你点一下,AI 把它们”重混”一遍。7 月 8 日,Photos 里上线了一个叫 Video Remix 的功能,它跑在 Gemini Omni 这套模型上,干的事很具体。

    几秒钟能改头换面

    给暗乎乎的片段补光(Google 管这叫 cinematic relighting),把平淡的背景换成别的场景,或者给整段视频套上水彩、速写本这类艺术风格。入口藏在 Photos 的 “Create” 标签页里,Google 把它定义成你的”创意中枢”。操作逻辑很简单:挑一段视频,选个效果,等几秒,出来一份被重新打过光的版本。

    这个功能不是给所有人开的。目前只面向 Google AI Plus、Pro、Ultra 这几个订阅档位的用户灰度推送,也不是全球同时铺开。换句话说,你如果还用着免费的 Photos,暂时看不到这个按钮。

    Google 自己的说明里反复强调,用 Video Remix 生成的视频会带上 SynthID 的隐形水印,标明”这是 AI 动手过的”。

    三个月塞了三个,相册快成工具箱了

    有意思的是,这已经不是 Google Photos 今年第一次往相册里塞 AI 生成类工具了。翻一翻时间线,短短三个月里它已经堆了至少三个功能相近的东西。用户打开相册,本意是找张旧照片,结果迎面撞上一堆”AI 帮你重做”的入口。功能多是好事,但当每个入口都在暗示”你原来的素材不够好、让我替你重造一遍”,体验就开始变味了。

    水印这事儿,真挡得住吗

    再说 SynthID。Google 一直把这套隐形水印当成”负责任 AI”的门面,意思是 AI 生成的内容能被溯源、被识别。理想很丰满:以后看到一段以假乱真的视频,系统能告诉你”这是 AI 改的”。但现实骨感——水印只对”在 Google 生态内生成”的内容有效。你导出视频、转码一遍、或者用别的工具再处理,水印就可能掉了。

    • 给暗光视频补光、换背景,门槛低到几乎零成本
    • 艺术风格迁移让”看起来像那么回事”变得特别容易
    • SynthID 只对原生生成内容生效,二次传播基本失效

    我倒不是说 Google 存了什么坏心。把专业级的视频调色、风格化能力下放到每个人的相册,确实是技术进步。但当一个日活几十亿的产品,把”AI 改写现实”做成一键按钮,它承担的就不只是”好玩”的责任了。水印是第一步,但远远不够。


  • CubeSandbox:给 AI Agent 的 60ms 硬件级安全沙箱,腾讯云开源(8.9K Stars)

    CubeSandbox:给 AI Agent 的 60ms 硬件级安全沙箱,腾讯云开源(8.9K Stars)

    CubeSandbox

    📌 项目简介

    CubeSandbox 是腾讯云开源的、面向 AI Agent 的即时、并发、安全、轻量沙箱服务。它基于自研的 RustVMM + KVM 微虚拟机(MicroVM)构建,主打「硬件级隔离」——每个沙箱都跑在独立的 Guest OS 内核里,从根上杜绝了 Docker 共享内核的逃逸风险。平均冷启动 <60ms、单实例内存开销 <5MB,可以放心拿它来跑 LLM 生成的不受信任代码、Agent 自动执行等高风险任务。

    🛠 安装要求与过程

    环境要求:

    • x86_64 Linux 服务器(推荐 OpenCloudOS 9,Ubuntu / Debian / CentOS 同样支持)
    • ≥ 4 核 CPU、≥ 8 GB 内存,建议挂载独立数据盘给 /data/cubelet
    • 需要 KVM 支持(云服务器若无 /dev/kvm,可开启腾讯云 PVM 嵌套虚拟化)
    • v0.5.0 起原生支持 ARM64 全栈

    一键安装:

    # 标准安装(需 /dev/kvm)
    curl -sL https://github.com/tencentcloud/CubeSandbox/raw/master/deploy/one-click/online-install.sh | bash
    
    # 云服务器无嵌套虚拟化时,开启 PVM 安装
    curl -sL https://github.com/tencentcloud/CubeSandbox/raw/master/deploy/one-click/online-install.sh   | CUBE_PVM_ENABLE=1 bash
    
    # 国内加速镜像
    curl -sL https://cnb.cool/CubeSandbox/CubeSandbox/-/git/raw/master/deploy/one-click/online-install.sh   | CUBE_PVM_ENABLE=1 MIRROR=cn bash

    安装完成后打开 Web 控制台:http://<控制节点IP>:12088,三步即可上手:查看 Overview → 从 Template Store 准备模板 → 创建沙箱(Sandboxes → + New sandbox)。

    如果只想在本地 Python 里玩,也可以 pip install cubesandbox 拉起组件做开发联调。

    ⚡ 核心功能

    • 亚 60ms 冷启动 + 高密度:单实例开销 <5MB,支持空闲自动挂起/唤醒(AutoPause/AutoResume),单机可并发跑成百上千个沙箱。
    • 硬件级隔离:每个实例独立 Guest OS 内核,基于 KVM MicroVM + eBPF 虚拟交换机(CubeVS)做内核级网络隔离,不存在容器共享内核的逃逸面。
    • 无缝兼容 E2B SDK:原生兼容 E2B 协议,业务代码零改动——只把 E2B_API_URL / E2B_API_KEY 指向你自己的 CubeSandbox 即可迁移。
    • 企业级安全:凭据保险库(密钥不进沙箱/上下文/日志)、出口控制(域名白名单 + 未授权出口即时阻断 + 审计日志)。
    • 快照·克隆·回滚:基于 CubeCoW 写时复制引擎,百毫秒级打检查点,可回滚或开分支,Agent 试错零成本。

    🎯 典型使用场景

    1. 跑 LLM/Agent 生成的不受信任代码

    把模型吐出来的 Python/Shell 丢进沙箱执行,硬件隔离 + 出口白名单保证即使代码作恶也伤不到宿主。E2B 兼容意味着你现在的 Code Interpreter 代码直接换环境变量就能用:

    export E2B_API_URL=http://<你的控制节点IP>:12088
    export E2B_API_KEY=<你的API Key>
    
    from e2b_code_interpreter import Sandbox
    sandbox = Sandbox()
    execution = sandbox.run_code("x = 1 + 1; print('result =', x)")
    print(execution.logs.stdout)   # result = 2

    2. 浏览器自动化 / 数据抓取 Agent

    给爬虫、RPA、AI 操作员一人一个干净隔离的浏览器环境,跑完即销毁,避免指纹污染和横向污染。配合 Template Store 预置好带登录态的镜像,开箱即用。

    3. 强化学习 / SWE-Bench 类大规模评测

    官方用 CubeSandbox 做 SWE-Bench RL 训练,上千个独立环境并发创建、秒级回收,单节点高密度把评测成本打下来。

    💡 推荐理由

    这两年「让 Agent 自己写代码自己跑」成了标配,但把模型生成的代码直接丢宿主机执行,等于把大门钥匙交给一个偶尔会发疯的实习生。CubeSandbox 的价值就在于:它把「隔离」这件事做到了又快又便宜又省心——60ms 启动让你几乎感觉不到沙箱的存在,<5MB 开销让并发成本可控,而 E2B 兼容意味着你不用重写一行业务代码就能把云端沙箱换成自建的、数据不出域的版本。

    对国内团队尤其友好:有 CN 镜像、有 PVM 解决云厂商嵌套虚拟化痛点、有中文文档和微信社群。想自建一套「AI 代码执行底座」,CubeSandbox 是目前最省事的开源选择之一。

    📥 下载地址

    许可:Apache-2.0(仓库主协议,部分组件为其他开源协议)。当前 Star 数约 8.9K,仍在快速增长中。

  • 亚马逊秘密项目Moonraker曝光:要让Alexa真正像个能办事的Agent

    亚马逊 Alexa AI 代理概念图
    亚马逊秘密项目 Moonraker 旨在让 Alexa 升级为 AI 代理(概念图)

    Amazon 的 Alexa 一直被吐槽”听懂了但办不成事”。最近 Business Insider 翻出一批内部规划文件,曝光了一个此前没对外说过的项目,代号”Moonraker”——亚马逊想让 Alexa 从一个”问答机”变成能一口气跑完多个动作的 AI 代理。

    从”一句话”到”一串动作”

    现在的 Alexa+ 已经能帮用户叫车、买票,不过得靠 Uber、Ticketmaster 这些合作伙伴接好接口,本质上还是”你说一句、它办一件”。Moonraker 要做的,是让一次请求触发一连串操作。文件里举了个例子:”帮我叫辆车,再给我朋友发条消息”——以前 Alexa 大概率会卡在第二步,现在它要自己把这两件事都办了。

    这个方向一点都不新鲜,Google、OpenAI、Anthropic 早就推出了能自己上网、跑多步流程的 agent 产品。亚马逊只是终于坐不住,要把 Alexa 也推进这条赛道。

    代价是真贵

    但让 Alexa 变聪明,烧钱也烧得吓人。内部文件直接把 Moonraker 标成 Alexa+ 这轮升级里”成本最高”的新项目,预计 2026 年光 GPU 费用就要超过 1 亿美元。有文件甚至建议,要么推迟、要么缩水,给成本压力降降温。

    一些亚马逊高管觉得,团队在喂 Alexa 的 AI 模型上花超了,运行这些模型的费用已经成了内部越来越大的心病。这其实不是亚马逊一家的问题——整个硅谷都在经历一场”token 账单”的清醒:当先进 AI 真正铺开,账怎么算都肉疼。

    Alexa 的”成长的烦恼”

    翻翻 Alexa+ 的履历,麻烦一直没断过。助手在美国的铺开被推迟了好几回,年初才扩大可用范围;内部 beta 测试的时候还曝出幻觉、答非所问的问题,有个员工的 Alexa 误把鱼缸过滤器关了,鱼当场没了。CEO 贾西在最新的股东信里倒是很乐观,说大家跟 Alexa+ 聊天翻了一倍、下单频次是以前的三倍,但也没忘补一句:”Alexa 离成为全世界最好的个人助理,还早得很。”

    为了撑起 Moonraker,亚马逊去年底就备好了几百张英伟达 GPU,测试时还用了 Anthropic 的 Sonnet 模型做高级推理和视觉回应。不过面对 BI 的提问,亚马逊选择了不置评。


    说到底,Moonraker 是亚马逊给 Alexa 的一场豪赌:它想让语音助手真正”办成事”,而不只是”聊聊天”。只是这门生意的账,目前怎么看都不便宜。

  • 特朗普松口,OpenAI GPT-5.6本周四全面开放:Sol、Terra、Luna三件套来了

    OpenAI GPT-5.6 模型发布概念图
    OpenAI GPT-5.6 模型套件公开上线(概念图)

    OpenAI 在周二深夜扔出一条重磅消息:GPT-5.6 要来了,而且这次是面向所有人的公开上线。按照公司的说法,旗舰模型 Sol,加上中端的 Terra 和走量的 Luna,会在本周四一起向公众开放。距离 6 月 26 日它第一次以”受限预览”的身份露面,还不到两周。

    一场由政府点头的”放行”

    这次放行背后,站着特朗普政府。据 Axios 报道,在 OpenAI 和美国商务部下属的”AI 标准与创新中心”又做了一轮测试、开了几轮会之后,政府才给了这次大规模发布的绿灯。OpenAI 还专门派了技术专家常驻华盛顿,随时准备回答监管方的疑问。

    其实上个月,特朗普政府就要求 OpenAI 搞”分批发布”——先把模型开放给政府批准的少数实体,普通人暂时摸不着。当时 OpenAI 就明说,这不是它喜欢的发布方式。

    有意思的是,白宫自己并不认”绿灯”这个说法。一位官员回应说,法律上根本不需要、也没发过什么许可,”放不放、怎么放,决定权完全在公司手里”,还搬出了 6 月 2 日那份 AI 行政令——里面明确禁止联邦层面对模型发布搞强制牌照或预审。换句话说,那些测试和会谈,都是”自愿”的。

    不只 OpenAI 一家被卡过

    把视线拉宽一点,你会发现这阵子最先进的模型几乎都被”限”过。6 月商务部直接禁止外国人使用 Anthropic 的 Mythos 和 Fable 模型,等于逼着它们退出部分市场;上周 Fable 的禁令才刚松绑,用户访问隔了一天就恢复。OpenAI 和 Anthropic 这两家头部公司,最近的处境出奇地像。

    实力与定价才是真看点

    抛开监管戏码,GPT-5.6 本身有两把刷子。OpenAI 说它在写代码、网络安全、生物这几个方向特别能打,长任务的代理(agentic)能力也比上代稳。Sol 还多了两个档位:一个叫”max”,专门做更深层的推理;一个叫”ultra”,能调度子代理——这明显有 OpenAI 收购的 OpenClaw 团队的手笔。

    • Sol:旗舰,主打高端任务,定价每百万 token 输入 5 美元、输出 30 美元。
    • Terra:中端,定位”高吞吐量工作”,价格正好是 Sol 的一半。
    • Luna:日常款,便宜又快,价格还不到 Terra 的一半。

    这个定价挺狠——Sol 的成本差不多只有 Anthropic 旗舰 Claude Fable 5(10/50 美元)的一半。在大家都在喊”token 太贵”的当口,OpenAI 直接把价码压了下来。


    安全方面,OpenAI 这次也下足了功夫。Sol 被训练成会拒绝违规的网络协助请求,包括用户试图伪装意图或”越狱”的情况;公司还投入了约 70 万块 A100e 等效 GPU 小时做自动化红队测试。OpenAI 自己也说,希望这种”政府点头才能发”的流程别变成长期常态——毕竟把最好的工具卡在门外,受影响的还有开发者、企业和网络安全防御方。

  • OfficeCLI:让 AI Agent 一句话掌控 Word / Excel / PowerPoint 的开源办公套件

    OfficeCLI:让 AI Agent 一句话掌控 Word / Excel / PowerPoint 的开源办公套件

    release license

    📌 项目简介

    OfficeCLI 是全球首个专为 AI Agent 打造的 Office 办公套件,用一行命令就能让任意 AI 智能体读取、编辑、自动化生成 Word / Excel / PowerPoint 文档。它采用单一可执行文件、无需安装 Microsoft Office、零依赖、跨平台运行,目前已斩获 11.5K+ Stars(Apache-2.0 协议)。

    “OfficeCLI’s built-in HTML rendering engine reproduces documents with high fidelity —— and that’s what gives AI eyes.”

    ⚙️ 安装要求和过程

    环境要求

    • 单一二进制:自包含可执行文件,无需安装 Microsoft Office无需 .NET 运行时
    • 跨平台:macOS / Linux / Windows 均可运行。
    • 仅需基础的命令行环境,内存占用极低。

    快速安装

    # macOS / Linux
    curl -fsSL https://raw.githubusercontent.com/iOfficeAI/OfficeCLI/main/install.sh | bash
    
    # Windows (PowerShell)
    irm https://raw.githubusercontent.com/iOfficeAI/OfficeCLI/main/install.ps1 | iex
    
    # 或任选其一
    brew install officecli
    npm install -g @officecli/officecli

    安装后运行 officecli install 将二进制加入 PATH,并自动把 officecli skill 注入 Claude Code、Cursor、Windsurf、GitHub Copilot 等 AI 编程工具,Agent 立刻就能替你创建 / 读取 / 编辑 Office 文档。

    30 秒上手

    # 1. 创建一个空白 PPT
    officecli create deck.pptx
    
    # 2. 启动实时预览(浏览器打开 http://localhost:26315)
    officecli watch deck.pptx
    
    # 3. 另开终端添加一页,浏览器即时刷新
    officecli add deck.pptx / --type slide --prop title="Hello, World!"

    ✨ 核心功能

    • 三格式全读写改:Word(.docx)、Excel(.xlsx)、PowerPoint(.pptx) 全部支持创建、读取(文本 / 结构 / 样式 / 公式)、修改与重组,告别 python-pptx 等一堆库。
    • 内置 HTML 渲染引擎:把文档渲染成 HTML / PNG,给 AI 装上“眼睛”,形成 渲染 → 看 → 改 的闭环,AI 能看见自己生成的成品并自动修正。
    • 路径寻址 + 结构化 JSON:用 /slide[1]/shape[1] 这样的 XPath 式路径精准定位任意元素,并可输出结构化 JSON,便于程序化操作。
    • 实时预览officecli watch 启动本地预览服务(localhost:26315),每次 add / set / remove 命令即时刷新浏览器,所见即所得。
    • 为 Agent 而生:一行 curl -fsSL https://officecli.ai/SKILL.md 即可让 AI Agent 自动读取技能文件并安装使用;自动把 skill 装进主流 AI 编程工具。

    🎯 典型使用场景

    1. AI 自动生成汇报 PPT:让 Agent 一句话产出季度汇报、融资路演、技术分享等演示文稿,自动处理排版、配色与图表。
    2. 批量处理 Excel 报表:自动生成预算表、成绩册、销售看板,支持公式、图表与条件格式。
    3. 程序化生成 Word 文档:一键产出学术论文、项目方案、年度报告,支持多语言 i18n 与 RTL 从右到左排版。

    💡 推荐理由

    以前用 python-pptx 写个 PPT 要 50 行代码还容易错位,OfficeCLI 一行命令就搞定;更关键的是它自带渲染闭环,让 AI 能“看见”自己生成的样子并自我修正——这对想给 Agent 接上“办公能力”的开发者几乎是开箱即用的利器。Apache-2.0 协议、单一二进制、零依赖,本地运行也保障了文档隐私。如果你正在做 AI 办公自动化、RPA 或 Agent 工具链,非常值得一试。

    🔗 下载地址

  • OpenAI放出新语音模型:能随时打断、还能实时翻译,但口音有点出戏

    AI语音助手与声波动画
    GPT-Live-1 让 ChatGPT 的语音对话更接近真人

    OpenAI 今天把 ChatGPT 的「嘴」和「耳朵」换了一套新引擎。新模型叫 GPT-Live-1,还有个轻量版 GPT-Live-1 mini,官方说法是听起来更自然,也更会把握说话的节奏,不会再动不动就抢你的话。

    这次升级最关键的一点,是它变成了「全双工」模型——也就是能边听边说。你可以随时插话打断它,它也能在你说的时候默默听着,而不是像老版那样非得等你彻底说完、停顿一下才开口。实时翻译这种场景,靠的也是这个能力。

    从「三件套」到「一根线」

    之前的语音模式其实是拼起来的:先靠语音转文字把你说的话写成字,再丢给大模型想答案,最后用文字转语音念出来。环节一多,就容易出岔子——要么在你说话时突然打断,要么脑子跟不上、答非所问。

    新模型把这条链路收拢了。OpenAI 说,它会把你的提问交给最新的文字模型(比如 GPT-5.5)去做搜索、推理或者调度 Agent,同时语音对话还在继续,不用停下来等。它甚至能憋着不说话,安静听你讲上一长段,把上下文都接住,等被叫到才接话。

    我们觉得长远来看,语音会成为操作电脑的一种主要方式,也能用来打理那些越来越复杂、跑得很长的 Agent 任务。

    上面这句话出自 ChatGPT Voice 的产品负责人 Atty Eleti。他透露,自己散步时跟语音功能聊过三四十分钟。OpenAI 有意把语音往「能扛长时间复杂工作」的方向推,外界也一直传它今年可能出一副带 AI 的耳机,不过这次公司没提任何硬件。

    不是伴侣,但还在打磨

    默认情况下,免费用户会拿到 mini 版,付费档才能用上更大的 GPT-Live-1,它会逐步替换掉现在的 Advanced Voice Mode。OpenAI 强调,他们并不想把它做成「AI 陪伴」,而是加了护栏:对青少年给适龄的回应,聊到自残这类话题会提供求助资源。

    竞争对手也没闲着。苹果和亚马逊都在把自家的助手改得更会接话、更懂上下文;由 Oculus 联合创始人创办的 Sesame,也在做能边聊边在后台干活的助手。OpenAI 的方向和大家一致:让你能 hands-free 地跟助手聊更久。


    演示翻车的一幕,也值得记住

    新模型当然还有毛糙的地方。现场演示印地语实时翻译时,助手一口浓重的美式口音,说出来的印地语生硬又书面,听起来很出戏。OpenAI 说新模型是针对「大多数常用语言」优化的,但究竟覆盖哪些,它没细说。

    • 全双工 + 随时打断,是这次最实在的进步,聊天不再像在跟自动语音菜单较劲。
    • 接上 GPT-5.5 之后,语音能干的活明显变多,甚至能顺手给你看张图。
    • 口音和少数语言仍是短板,离「全世界都能自然聊」还早。

    OpenAI 透露,现在每个月有超过 1.5 亿人用语音或听写跟 ChatGPT 说话。从「能对话」走到「聊得像个真人在旁边」,GPT-Live-1 算是往前迈了一大步——只是这一步迈得还不够稳,尤其是当你说的不是英语的时候。

    📎 原文来源:OpenAI releases new voice models for more natural live conversations(TechCrunch / Ivan Mehta)
  • Meta想让AI眼镜别那么吓人,可它的整体打法偏偏相反

    Meta AI眼镜与录制指示灯
    Ray-Ban Meta 智能眼镜的录制指示灯,正成为隐私争议的焦点

    这几天 Meta 给自家智能眼镜上了一道「保险」:以后要是有人把那颗提示正在录像的小灯给遮住或弄坏了,眼镜的摄像头会直接罢工。听起来挺贴心,像是终于听见了大家的担心——毕竟 Ray-Ban Meta 这副眼镜,早就被不少人贴上了「偷拍神器」的标签。

    可问题是,就在这条「我们很在乎你隐私」的公告发出来的同一周,Meta 干的另一堆事,方向完全是反的。

    小灯一挡,摄像头就关,这招晚了一步

    先说这个被 Meta 拿来「自我表彰」的新功能。公司在博客里写得很自豪,说「其他任何摄像头都没这么干过,我们很骄傲能领这个头」。但往下读就露馅了:Meta 自己承认,之所以要做这个功能,是因为已经有人拿胶带把指示灯贴上了,逼得他们只能改技术,让灯被挡住时就自动停录。

    更尴尬的是,公告里还补了一句:那些铁了心要偷拍的人,会「用更复杂的手段去改装甚至毁掉那颗灯」。换句话说,Meta 等于亲手盖章确认了一件事——确实有人买这副眼镜,就是冲着不打招呼记录别人去的,而且目标常常是女性。

    你拍的照片和视频谁能看到?Meta 的回答是「只有你,除非你主动分享」。可它的隐私政策又白纸黑字写着:任何你丢给 Meta AI 的图片,都可以被用来训练它的模型。

    同一周,它还在往你的隐私里伸手

    就在发布防偷拍功能的那天,Meta 还顺手宣布了一件事:现在 Meta AI 可以用任何一个公开 Instagram 用户的照片来生成 AI 图像,除非你手动关掉这个选项。把两件事摆在一起看,那颗摄像头小灯的保护意味,一下子就淡了。

    这还不是全部。Meta 这些年一直在推进的方向,几乎每一步都在要你的数据:用你让眼镜分析过的图片训 AI、默认开启拿你个人内容喂模型的 AI 功能、研究怎么「连续录音」、甚至探索用生物识别做 facial recognition。据《金融时报》消息,他们还在测试一款原型机,会「持续采集音频、每隔几秒拍一张照片」。


    信任这东西,欠账太多就难补

    围绕 AI 眼镜的隐私问题,Meta 眼下正挨着好几桩调查和诉讼。其中一桩的由头格外难看:此前 Meta 取消了一家外包公司的合同,因为肯尼亚的外包工爆料,他们在用眼镜拍下的视频训练 AI 时,被迫看了大量色情、裸体和有人在厕所的极端内容。

    把这副眼镜单独拿出来看,它确实只是个硬件。但放到 Meta 的整体履历里,味道就不一样了——剑桥分析数据门、儿童安全相关的诉讼、员工按键记录被用来训模型、打算拿你 AI 聊天里的内容卖精准广告……连苹果当年都因为隐私顾虑,一度不肯把 Meta 的模型接进自己的系统。

    • 给摄像头加一道防篡改保护,是必要的,也该夸。
    • 但同一周就用你的公开照片喂图像生成,又让「我们在意隐私」显得言不由衷。
    • 真正的问题不在某颗灯,而在 Meta 的整体生意,始终建立在多拿一点你的数据上。

    所以那颗小灯能不能让人安心,答案其实很清楚:它挡得住手欠遮灯的人,却挡不住 Meta 自己想把你的影像、声音和生活痕迹都收进系统的那股劲。消费者要的不只是「灯亮着」,而是「你别总惦记着我的数据」——这一点,Meta 离做到还差得远。

    📎 原文来源:Meta wants its AI glasses to seem less creepy. Its AI strategy says otherwise.(TechCrunch / Sarah Perez)
  • Claude Cowork登陆手机和网页:Anthropic把AI代理带出代码圈

    Claude Cowork 跨设备办公AI代理
    Claude Cowork 想当那个「在后台帮你把杂事干完」的同事(配图由 AI 生成)

    Anthropic 把 Claude Cowork 从桌面搬到了手机和网页上。这款长得像 Claude Code、但面向「通用知识工作」的 AI 代理,今年 1 月先以桌面App的形式上线;从 7 月 7 日这天起,Max 订阅用户能在网页和手机上用上它。也就是说,你可以在办公桌前开个任务,路上用手机看进度,哪怕笔记本合着,回头也能拿到成品。

    这个动作背后的意思很清楚:Anthropic 不想让 Cowork 给人「给小白用的编程工具」的印象,它更想把它做成那种能在后台默默干活、跟着你在不同设备间切换、遇到只有你拍板的事才跳出来问你的「行政搭档」。一句话,写代码的代理大战,正顺着办公区一路烧进其他工位。

    聊天框之外,抢的是「干活的那块地」

    这股劲头不只在 Anthropic 一家身上。OpenAI 的 Codex 走的也是同一条路——它本来是个软件开发工具,现在越来越多被非程序员拿去写报告、理表格、做PPT、搞研究、分析数据。对这两家实验室来说,赌注正从「谁的聊天机器人最聪明」悄悄变成「谁占住了大家真正干活的那块屏幕」。

    Anthropic 没把 Cowork 局限在独立App里。之前它刚推出 Claude Tag——一个常驻在 Slack 里的 Claude,像队友一样待在群里。把 Cowork 做成跨平台应用还有一个实际好处:代理能在后台继续跑任务,不要求某台设备一直在线。

    「把周一的客户准备设在早上 6 点:Claude 过一遍邮件串、会议记录和最近的新闻,把简报文档搭好,跟进邮件也写好但先不发出去。你喝咖啡的时候审一遍就行。」

    Anthropic 自己举了上面这个例子。深活儿还是留在桌面App里干——那里 Claude 能碰本地文件和浏览器;但网页和手机版让没装App的人也能用。聊天和 Cowork 在网页、桌面端先打通,项目和数据产物在两端共享。

    数据说了大实话:它八成不是在写代码

    Anthropic 顺手放出了 Cowork 的早期数据,挺能说明问题。他们抽样了 5 月最后两周、来自 60 多万家组织的 120 万次匿名会话,想看看大家到底拿它干什么。

    • 最大的一块占 33.4%,是「业务流程运转」:把散落的进展汇总成一份报告、做入职清单、对齐表格。这类活儿在财务、人事、行政岗最常见。
    • 排第二的 16.4% 是内容创作和文案:草稿、幻灯片、社媒帖子、方案书,通常是市场和管理的活。
    • 软件开发呢?只占 8.7%。

    Anthropic 自己的总结是:写代码虽然最吸睛,但 AI 在日常业务里的使用正在往上走,而且大家觉得最有用的那类任务,画像越来越清楚。他们把 Cowork 最对味的场景叫做「工作之外的工作」——那些撑起一家公司运转、却往往不是某个人核心职责的杂事。

    所以别被「Claude Code 的亲戚」这个标签带偏了。Cowork 真正想抢的,是每天淹没我们的那堆准备、汇总、草稿和跟进。它能后台跑、跨设备跟人走,这恰恰戳中了很多职场人最头疼的地方。接下来要看的,是它能不能真的把「喝咖啡时顺手审一遍」这件事,做得比人自己动手还省心。

  • SambaNova再融10亿美元、估值110亿:AI芯片烧到了银行金库

    SambaNova AI推理芯片与本地数据中心
    SambaNova 押注「本地推理」,把大模型放进企业的自有机柜里(配图由 AI 生成)

    AI 芯片公司 SambaNova 又拿到钱了。这轮 F 轮融资刚完成「首关」,金额 10 亿美元,估值冲到 110 亿美元,领投方是 General Atlantic。公司 CEO 兼联合创始人 Rodrigo Liang 跟 TechCrunch 说,接下来几周还会有更多投资人进来,第二关很快收尾。距离上一轮 3.5 亿美元的 E 轮,才过去五个月。

    这家 2017 年在加州帕罗奥图成立、如今九岁的公司,节奏明显在加快。今年 2 月它刚发布了新一代芯片 SN50,当时顺手拿了 E 轮的钱;现在 F 轮又来了。Liang 对「要不要一直独立」这个问题打起了太极——他说公司一直有人来打听收购,门没关死,但眼前的势头和增长「大概率会把它推向上市」。

    和英特尔越绑越紧

    SambaNova 跟英特尔的关系,比外界以为的更深。英特尔从 C 轮就是股东,这一轮也跟进了,两边还签了多年的合作,基于英特尔的至强(Xeon)芯片一起做 AI 推理产品,共同开发、共同卖。「这让我们能借英特尔的体量,放大自己的技术」,Liang 是这么说的。去年底彭博还报过英特尔想以约 16 亿美元收购 SambaNova 的消息,谈判最后黄了。

    「摩根大通决定用 SambaNova 做推理方案,这是件大事。它给银行业放了句话:是时候别完全依赖云服务了,这些银行想要的是异构的基础设施。」

    这话说的是一桩新买卖:摩根大通选了 SambaNova 当「推理基础设施伙伴」,用它的 SN40L 和 SN50 系统在银行内部跑安全、私有的 AI 推理。在 Liang 看来,像摩根大通这种级别的银行开始自建私有、安全的推理环境,是一个会超出金融业本身的信号——企业和政府「才刚刚踏上 AI 这条路」,之前的增长都集中在模型公司和前沿实验室手里,剩下的「大把收入」还在桌上。

    把万亿参数模型塞进一个机柜

    SambaNova 给自己找的差异化定位是「高端推理」——专门跑最大的模型,而且跑得快。现在的前沿模型动辄上万亿参数,SambaNova 的卖点就是能把多万亿参数的模型装进单个机柜,从而跑出速度。SN40L 在 2023 年 9 月发布,云上和本地都能用;SN50 今年 2 月亮相,计划 2026 年下半年开始给客户发货,软银是它的第一个部署伙伴。


    Liang 把客户分成三类:一是主权云(政府出钱扶本地伙伴建私有云),二是新锐云(neocloud),三是自己搭设施用的企业。除了摩根大通,沙特阿美、英特尔和一些日本企业也在客户名单上。

    这 10 亿美元主要用来两件事:把生意做大规模,以及在这波「难以置信的需求浪潮」里把供应链锁住。Liang 的原话是,钱要用来确保供应链,好兑现订单、买齐未来 12 个月要交付的材料。本轮跟投的名单很长,Seligman Ventures、T. Rowe Price、Capital Group,还有黑石、卡塔尔投资局(QIA)、Vista Equity Partners 等等都在里面。

    看下来,SambaNova 赌的其实是一个正在发生的转向:当云上的通用算力越来越贵、也越让人不放心,大机构开始想把最关键、最敏感的模型搬回自己的机房。芯片、合作、客户订单,都朝着这个方向摆。至于它最后是被收购还是敲钟上市,Liang 留了个活口——但这个市场里,「总有人来敲门」本身就是一种底气。