标签: AI

  • Meta的AI生图刚上线就翻车:默认能拿你的公开照片去拼图

    Meta 超级智能实验室这周高调推出了图像生成模型 Muse Image,本想秀一把“把 AI 创作塞进 Instagram”的肌肉,结果其中一个功能刚露面就被用户和经纪公司围攻,不到三天就灰溜溜地撤了。

    问题出在那个“@一下”的功能

    Muse Image 可以让人在提示词里 @ 某个公开 Instagram 账号,模型就会去参考那个人的公开照片来生成图像。听起来是个挺聪明的社交创作玩法,但 Meta 压根没设计“通知对方”的机制——也就是说,别人拿了你的脸去生图,你可能完全不知情。公开账号默认是开启状态,想不被用,得自己进设置手动关掉。

    “我们的初衷是提供一个好用的创作工具,也给大家控制自己公开内容是否被引用的权利。但反馈告诉我们,这个功能没踩准点,所以已经下线了。”——Meta 官方博客

    经纪公司先急了

    第一个把 Meta 撤功能的决定捅出来的是 Puck News 的 Dylan Byers。据他转述,真正让 Meta 松手的,是用户和 talent agency(包括 CAA 这样的大牌经纪公司)的双重施压。想想也不意外:明星的公开照片本来就是被深伪色情内容盯得最狠的,平台再开个“一键拿脸”的口子,等于把火引到自己身上。

    这锅 AI 生图背了不止一次

    把公开照片默认纳入 AI 生成,Meta 不是头一个踩雷的。Google 刚把 Gemini 的 Nano Banana 接到 Google Photos 上,同样引发了“我的私人内容怎么被用了”的争议。区别是,Meta 这回连个提醒都没给,直接默认开启,激怒大家也就不奇怪了。

    • Muse Image 由 Meta 超级智能实验室(MSL)打造,支持提示词生图与局部修改
    • 提示词里 @ 公开账号即可引用其照片,默认不通知本人
    • 上线约三天后,在用户与经纪公司(含 CAA)施压下被移除
    Meta Muse Image 隐私争议概念图
    Muse Image 能融合公开 Instagram 照片生成图像,但“默认可用、不通知本人”的设计引发了隐私反弹。

    TechCrunch 还专门写了篇教程,教用户怎么关掉这个开关。一个功能需要媒体出科普帖教人“如何不被用”,本身就说明默认设置有多离谱。好在 Meta 这次认错挺快,但下一次“默认开启、事后道歉”的剧本,用户大概不会再买账了。

  • ChatGPT这次把嗓子和耳朵焊一起了:GPT-Live-1学会边听边插嘴

    OpenAI 这周二给 ChatGPT 换了一套全新的语音内核。新模型叫 GPT-Live-1 和 GPT-Live-1 mini,听着像普通版本号更新,其实改的是最底层的交互逻辑——它第一次让 AI 在跟你说话的时候,也能同时听你说话。

    以前是“你一句我一句”,现在能直接打断

    老版本的高级语音模式本质上是三段流水线:先把你的话转成文字,再丢给大模型想答案,最后用语音合成念出来。这种方式有个老毛病,你话还没说完它就可能抢答,中间停顿一下它又以为你说完了。GPT-Live-1 把这三段压成了一个“语音到语音”的统一模型,声音本身就是输入输出,不用再绕一圈文字。最直观的变化是,你可以在它说话时直接插一句“等一下我说的不是这个”,它能接住你的打断,顺着上下文继续。

    它把“聪明”和“说话”分开了

    OpenAI 在简报里说,新模型遇到要查资料、要推理、要调工具的活儿,会把任务甩给后台的 GPT-5.5,自己只管把对话顺畅地接下去。换句话说,语音层负责“像人一样聊”,脑子层负责“想明白”。产品负责人 Atty Eleti 说他自己遛弯时跟语音助手聊过三四十分钟,模型还能安静地听很久、把上下文攒着等被叫到。

    “我们觉得,语音慢慢会变成人们操作电脑的一种主要入口,甚至是处理那些又长又复杂的智能体任务的方式。”——ChatGPT Voice 负责人 Atty Eleti

    不是来当陪聊的

    虽然话术上强调“更自然”,但 OpenAI 反复划清界限:这不是要做一个 AI 伴侣。模型里内置了针对青少年的适龄回应,以及遇到自残这类话题时给资源引导的护栏。它也顺手支持实时翻译、用视觉卡片甩出天气和股票——代价是,目前优化的是“大多数口语”,具体哪些语言并没列清楚。

    对手们也没闲着

    苹果和亚马逊都在把自家助手往“更会聊”的方向改,Oculus 联合创始人搞的 Sesame 也上线了能边干活边聊天的助手。有意思的是,OpenAI 自己放风说今年可能出一副带 AI 的无线耳机——把语音做成主入口,硬件才是真正的落点。

    • 全双工架构:说话和聆听同步进行,支持中途打断与插话
    • 免费用户默认用 GPT-Live-1 mini,付费档可切到更大的 GPT-Live-1
    • 复杂任务转交后台 GPT-5.5,语音层只负责把对话接顺
    OpenAI GPT-Live-1 全双工语音模型概念图
    GPT-Live-1 让 ChatGPT 的语音交互从“轮流发言”走向“自然对话”

    当然,演示里也露了怯。现场秀印地语实时翻译时,助手带着一股浓重的美式口音,腔调还有点书呆子气。这说明“全双工”的架子搭起来了,但离哪种语言都顺溜还有距离。

  • ComfyUI-Manager:ComfyUI 必备的插件管家,15.3K+ Stars 让节点安装一键搞定

    ComfyUI-Manager:ComfyUI 必备的插件管家,15.3K+ Stars 让节点安装一键搞定

    ComfyUI-Manager 主菜单

    项目简介

    ComfyUI-Manager 是 ComfyUI 生态的官方扩展「插件管家」,让你在图形界面里一键安装、更新、禁用、启用上千个自定义节点与模型,是每位 ComfyUI 用户都离不开的「应用商店」。项目由社区发起,现由 Comfy-Org 官方维护,已接入 registry.comfy.org 官方节点仓库,累计 15.3K+ Stars、2.3K+ Forks,采用 GPL-3.0 许可。

    安装要求和过程

    环境要求:已安装 ComfyUI;系统具备 Python 3Git 即可(无需额外依赖,纯 Python 实现)。

    方式一 · 通用安装(推荐)

    # 进入 ComfyUI 的自定义节点目录
    cd ComfyUI/custom_nodes
    git clone https://github.com/Comfy-Org/ComfyUI-Manager comfyui-manager
    # 重启 ComfyUI 即可在菜单看到 Manager 按钮

    方式二 · Windows 便携版:下载 install-manager-for-portable-version.bat 放入 ComfyUI_windows_portable 目录,右键「另存为」后双击运行。

    方式三 · comfy-cli 一并安装(最省心)

    python -m venv venv
    venv\Scripts\activate      # Linux/macOS 用 . venv/bin/activate
    pip install comfy-cli
    comfy install            # 同时装好 ComfyUI + ComfyUI-Manager

    方式四 · Linux + venv 脚本:下载 install-comfyui-venv-linux.sh 赋可执行权限后运行,自动完成 ComfyUI 与 Manager 的 venv 部署。

    核心功能

    • 一键管理自定义节点:内置 2000+ 节点库,图形界面中搜索、安装、更新、禁用、启用、卸载全部点点鼠标完成,告别手动 git clone + pip install
    • 模型一键下载与管理:集成模型库,直接在界面拉取常用模型权重,并可通过 extra_model_paths.yaml 统一管理模型路径。
    • 快照(Snapshot)管理:一键保存当前「节点 + 模型 + 配置」的完整状态,随时还原,是应对环境崩坏、多机一致的「救命功能」。
    • 缺失节点自动识别:导入他人工作流时,自动列出缺失的自定义节点并一键补齐,彻底解决「换个机器工作流就跑不起来」的问题。
    • 工作流分享 + 命令行 + 安全策略:支持分享到 comfyworkflows / OpenArt 等平台;提供 cm-cli 供高级用户脱离界面使用;security_level 与独立安装开关保障公共部署安全(V3.38 已迁移到受保护系统路径)。

    ComfyUI-Manager 安装对话框

    典型使用场景

    1. 新手快速搭建 AI 绘画工作流:刚装好 ComfyUI 不知道装什么?打开 Manager 搜索 ControlNet、AnimateDiff、IP-Adapter 等热门节点,一键安装即可开始出图。
    2. 团队 / 多机环境一致性:在一台机器调好所有节点后用快照保存,其他机器直接还原,杜绝「在我电脑上能跑」的玄学问题。
    3. 复现他人分享的工作流:从社区下载 .json 工作流,Manager 自动检测并安装其中缺失的节点,秒级复现大佬的节点组合。

    ComfyUI-Manager 模型安装

    推荐理由

    如果你用过 ComfyUI,一定体会过「满屏红字找不到节点」的痛苦。ComfyUI-Manager 把原本繁琐的命令行操作全部收敛为一个图形化面板,安装、更新、回滚一条龙,极大降低了 AI 绘画的入门门槛。个人最离不开的是它的快照功能——折腾节点把环境搞崩后,一个还原就能满血复活;而「缺失节点自动安装」让复现别人的工作流从半小时缩短到几秒钟。如今项目归入 Comfy-Org 官方维护、接入官方节点仓库,并更新了安全补丁,稳定性与可信度都上了一个台阶。一句话:装 ComfyUI 不装 Manager,等于买了手机不装应用商店。

    下载地址

  • 把AI数据中心搬进你家:Sunrun付费让110万户屋主托管算力节点

    如果有人付钱,让你把一小块AI数据中心搬进自己家,你干不干?美国最大的家庭光伏储能公司Sunrun,这周就抛出了这么个方案。

    Sunrun分布式AI算力家庭节点示意图
    把算力节点铺进千家万户,而不是盖一座大机房

    Sunrun启动了一个”分布式AI算力”试点:在装了它家太阳能板和储能电池的住宅里,放进一台台小小的算力节点——本质上就是分布式系统里的服务器单元。参与的屋主能拿到报酬,Sunrun则把这些节点汇聚起来的算力,卖给企业级的算力买家,比如AI公司。

    为什么不直接盖数据中心

    因为数据中心现在越来越不受待见。今年5月的一项调查显示,超过70%的美国人反对在自己家附近新建数据中心,理由无外乎污染、噪音、耗水耗电。Sunrun的思路正好反过来:不把算力堆进一座巨型机房,而是打散成无数个小节点,撒到全国各地的房子里。

    “AI公司正在拼命抢电力和算力。近二十年里,我们已经把运营、融资、规模化分布式资产这套本事练熟了。现在我们要用它,把算力搬到离能源和推理更近的地方。”——Sunrun总裁兼首席营收官 Paul Dickson

    这里有个关键区分:AI训练需要成千上万块GPU挤在一起、高度同步,很难分散;而推理不一样,它是模块化的、天然可以按地理位置铺开,而且对延迟很敏感——离用户越近越好。这恰恰是”边缘部署”的用武之地,也正好卡在Sunrun的能力圈里。据McKinsey预测,AI推理需求每年增长约35%,到2030年会超过训练,成为AI算力里占比最大的那部分。

    110万个家庭,就是它的底牌

    Sunrun手里有超过110万现有客户,这是它敢这么玩的底气。传统数据中心从审批、建设到并网,动辄要好几年;而Sunrun的分布式模式,能在很短时间内堆出可观的推理算力。它列出的几个优势也挺实在:

    • 节点装在电表之后,还配了家用电池,即便遇上部分电网停电也能继续跑
    • 省掉了买地、建输电线路、排队等电网接入这些漫长环节
    • 它本来就在为一百多万户家庭的能源设备做监控和维护,现成的运维体系直接能用

    不过资本市场没买账。消息公布当天,Sunrun股价盘前一度走高,开盘后调头下跌6.1%,算上这波,今年以来已经跌了38%。这个AI试点跟它上月宣布的、联合特斯拉和Renew Home把住宅聚成16吉瓦虚拟电厂的计划是分开的两回事。Sunrun说,试点会跑上几个月,评估结果后再决定要不要大规模铺开——目前它已经在跟企业算力客户、公用事业公司和房产开发商聊更大范围推广的事了。

  • 14个人服务890万开发者:Ollama拿下6500万美元B轮,押注开源模型随处跑

    先说个数字:14个人,撑起890万开发者每月都在用的工具。这不是哪家巨头的内部团队,而是开源AI工具Ollama的全部家当。就在这周,这家公司拿到了6500万美元的B轮融资,领投方是Theory Ventures。

    Ollama开源AI工具融资示意图
    Ollama让开源模型在任何地方都能跑起来

    算上之前Benchmark领投的1500万美元A轮,Ollama目前累计融资8800万美元。当年领投A轮的Peter Fenton这次也进了董事会。创始人兼CEO的Jeff Morgan把话说得很直白:开源模型就该好跑、好用、随处可用——你自己的电脑上、云端,或者两头都用。

    从Docker到开源模型,这俩人干的是同一件事

    Ollama是2023年上线的,干的活很简单:帮开发者在自己的PC上跑开源权重模型,几分钟就能装好用起来。GitHub上攒了17.6万颗星、近1.7万个fork,各种教程、视频、博客里都在夸它。

    这种”把复杂的东西变简单”的路数,Morgan和联合创始人Michael Chiang早就玩过一遍。他们之前做的Kitematic被Docker收购,两人随后帮着做出了Docker Desktop——那个如今每天有一千多万开发者在用的工具。Docker当年把云应用从繁琐的硬件配置里解放出来,Ollama现在对开源AI做的是同一件事。

    “2023年开源模型开始冒出来,但真的很难用。它们当时是给研究员准备的,不是给程序员的,想跑起来特别费劲。”——Jeff Morgan

    免费工具怎么变成生意

    现在Ollama每月有890万开发者在用,比今年1月翻了差不多一倍,每周还新增将近100万次安装,社区做出来的集成超过6.7万个,覆盖了《财富》500强里85%的公司,连医疗、金融、政府这些强监管行业都在用。而这一切,团队只有14个人。

    光靠免费的本地工具当然赚不了钱。Ollama的商业化藏在云端:本地机器扛不住更大的模型时,可以直接切到它的云上跑,同一套操作,按GPU时长计费而不是按token。这套逻辑跟主流按token收费的做法明显不一样。

    • 免费版:本地运行 + 一定的云端GPU时长
    • Pro版:每月20美元,可同时跑3个云端模型,云用量是免费版的50倍
    • Max版:每月100美元,可同时跑10个云端模型

    Morgan说,Ollama作为一门生意的转折点大概在今年1月,OpenClaw火起来那阵子——更大的开源模型突然能干agentic的活了,比如写代码。这也踩中了整个行业的大趋势:据Grand View Research,AI推理市场2024年约970亿美元,到2030年预计冲到2540亿美元,年复合增速约17.5%。随着Meta、Mistral、DeepSeek这些开源模型和闭源系统的差距越缩越小,越来越多的钱正流向”开发者选择在哪里跑模型”这件事上,而这正是Ollama想占的位置。


    当然,这条赛道并不空。Hugging Face融了超过3.95亿美元,主要做模型仓库;Together AI最近以83亿美元估值拿了8亿美元,扩云端训练和推理。Ollama和Morgan都没透露这轮的估值和收入。但14个人对890万开发者这个比例本身,可能才是这轮融资背后最值得琢磨的故事。

  • Dify:开源 LLM 应用开发平台,148K Stars 把 AI 工作流从原型秒送生产

    Dify:开源 LLM 应用开发平台,148K Stars 把 AI 工作流从原型秒送生产

    Dify 一览

    在 AI 应用落地的草莽时代,几乎每个团队都在重复造轮子:接模型要写一遍适配、做检索要搭一套向量库、上生产还要自己补日志和监控。把这套东西拼起来,往往比业务本身还费劲。Dify 的出现,就是要把这件事彻底标准化。

    一、项目简介

    Dify 是一个开源的 LLM 应用开发平台,用一张可视化画布把 AI 工作流、RAG 检索增强、Agent 能力、模型管理与可观测性打包在一起,让你从原型到生产只差一次部署。目前 GitHub 已收获 148.4K Stars、23K+ Fork,是开源 LLM 应用开发领域当之无愧的头部项目。

    二、安装要求和过程

    环境要求:

    • CPU ≥ 2 核
    • 内存(RAM)≥ 4 GiB
    • 已安装 DockerDocker Compose
    • 操作系统:Linux / macOS / Windows(WSL2)

    快速安装(Docker Compose,官方最推荐方式):

    git clone https://github.com/langgenius/dify.git
    cd dify/docker
    cp .env.example .env
    docker compose up -d

    启动完成后,浏览器访问 http://localhost/install 即可进入初始化向导。如果你需要高可用部署,官方文档还提供了 Helm Chart、Terraform(Azure / GCP)、AWS CDK 以及阿里云计算巢等多种方案。

    三、核心功能

    1. 可视化工作流画布(Workflow)
    在画布上拖拽编排 AI 流程,节点可调试、可分支、可回放,复杂逻辑一目了然。

    2. 全面的模型支持
    无缝接入数百个闭源 / 开源大模型(GPT、Mistral、Llama3 及所有 OpenAI 兼容模型),覆盖几十家推理服务商与自托管方案,切换模型无需改代码。

    3. 开箱即用的 RAG 管线
    从文档摄入到检索全链路覆盖,原生支持 PDF、PPT 等常见格式的智能提取,几步就能搭出带引用来源的问答助手。

    4. 强大的 Agent 能力
    基于 Function Calling 或 ReAct 定义智能体,内置 50+ 工具(Google 搜索、DALL·E、Stable Diffusion、WolframAlpha 等),也可接入自定义工具。

    5. LLMOps 与 Backend-as-a-Service
    应用日志与性能可监控、可迭代;所有能力均提供对应 API,轻松把 AI 能力嵌入自有业务系统。

    四、典型使用场景

    1. 企业知识库问答 / 智能客服
    导入内部文档构建 RAG,几步搭出带引用来源、可溯源的客服助手,替代翻手册式的重复答疑。

    2. 可视化 Agent 工作流自动化
    把“检索 → 生成 → 调用工具 → 校验”串成一张画布,用可视化的方式替代脆弱的脚本编排。

    3. 快速原型 + API 集成
    先用 Dify 低成本验证想法,再通过 BaaS API 把打磨好的 AI 能力无缝嵌入现有产品。

    五、推荐理由

    个人使用下来,Dify 最打动我的是“把复杂度收敛到一个画布上”。它不要求你先成为向量数据库专家或 Prompt 工程师,普通开发者也能在半小时内跑通一个带 RAG 的可用应用;而当项目要上生产时,LLMOps 的日志、评估与 API 化能力又刚好补上团队最缺的那一环。对于想认真做 AI 产品的团队,它是目前最省心的一站式底座——既能自建私有化守住数据,也能平滑对接云端大模型。

    六、下载地址

    许可证:Dify Open Source License(基于 Apache 2.0,附加部分条款)。本文数据截至 2026-07-11,Stars 约 148.4K。

  • Meta开放Muse Spark 1.1,想让自家的模型给开发者写代码

    Meta Muse Spark 1.1 编程模型概念图
    Meta 通过 Meta Model API 开放 Muse Spark 1.1(配图)

    今年 4 月,Meta 带着自家的第一个自研模型 Muse Spark 重新杀回 AI 牌桌。才过去三个月,它又往前挪了一步:把升级版 Muse Spark 1.1 通过一个新的 Meta Model API,开放给美国开发者做公开预览。换句话说,Meta 不再满足于只把模型藏在自己产品里,它想成为别人搭 AI 工具时脚下的那层地基。

    从”自己玩”到”让别人也来用”

    Meta 对 1.1 版的定位是比初代”跨了一大步”,改进来自开发者的反馈。具体能干什么?更硬的编程能力,包括发现和修复复杂 bug;更好地支持跨多个 App 的端到端智能体工作流,甚至多智能体协作;还原生具备对图片、视频、文档的多模态感知。上下文窗口给到了 100 万 token。

    Meta 说 Muse Spark 1.1 相比初代是”step-change”级别的跃迁,重点补上了复杂 bug 修复、多智能体编排,以及跨图片、视频、文档的原生多模态感知。

    身后那笔账

    这次发布紧跟在本周 Muse Image 的后面——那个图像生成模型因为能把别的用户的 Instagram 内容揉进生成结果里,已经惹出争议。但 Muse Spark 1.1 走的是另一条路:它要接进 AI 编程软件,去挤那个已经很挤的赛道。这一切都发生在 Meta 想证明自己砸下去的几十亿美元没白花的大背景下;过去一年它挖了一堆明星工程师、做了内部重组,目标就是追上 OpenAI、Google 和 Anthropic。

    怎么拿到,花多少钱

    新模型现在就能在 Meta AI App 和网站里用 Thinking 模式体验,同时通过 Meta Model API 向美国开发者开放公开预览。每个新开的 API 账号,Meta 还送 20 美元的免费额度。回想一下,Muse Spark 最早只在 Meta AI 里能用,后来才陆续驱动了 Instagram、WhatsApp 里的聊天机器人,以及最新的 Meta 智能眼镜。开发者 API 的具体按 token 计费标准还没公布,重度使用可能会被限流。

    分数还没追上,但路线选得巧

    在硬跑分上,Muse Spark 1.1 还没坐到领头的位置。Terminal-Bench 2.0 这种真实编程任务的测试里它拿了 59.0 分,落在 OpenAI 的 GPT-5.5(82.7)、Google 的 Gemini(68.5)和 Anthropic 的 Claude Opus(65.4)后面;SWE-Bench Verified 上它 77.4%,而 GPT-5.5 是 88.7%。Meta 自己也在声明里认了这些差距,说会继续往长程智能体和编程工作流里砸钱补窟窿。

    • 公开预览 7 月 9 日启动,而它的私下预览从 4 月就开始了。
    • 通过 meta.ai 和 Meta AI App,模型目前免费可用,企业级调用成本待定。
    • 100 万 token 上下文,是它目前最能拿得出手的一张牌。

    对 Meta 来说,这一步的意义不只在分数。当 OpenAI、Google、Anthropic 都在抢”谁坐在普通人的聊天框里”时,Meta 悄悄选了另一条战线——抢”谁坐在成千上万个编程助手、检索管道和自动智能体下面”。这条战线更安静,但可能更值钱:底层模型一旦被大量开发者依赖,迁移成本就高了,后面的议价权也就到了 Meta 手里。

  • OpenAI放出GPT-5.6,顺手把Codex做成了人人可用的办公搭子

    OpenAI GPT-5.6 与 ChatGPT Work 概念图
    OpenAI GPT-5.6 与全新的 ChatGPT Work 智能体(配图)

    两周前,GPT-5.6 其实已经”发布”过一次,但那时候普通用户根本摸不到。6 月 26 日那波上线,只向大约 20 家提前报备过的机构开放——因为特朗普 6 月 2 日签的行政令要求,AI 公司在全面公开前沿模型之前,得先把模型交给政府做能力评估。这等于 OpenAI 自己定的发布日,被外部按了暂停键。

    等了两周,才拿到放行条

    美国商务部下属的 AI 标准与创新中心把模型审了两周,7 月 8 日放行,GPT-5.6 这才算真正面向所有人开放。Sam Altman 在 X 上给它的评价是”我们做过的最强模型”。系统卡片里写得挺坦率:Sol 在网络安全、生物这两个领域能找出漏洞和攻击的”零件”,但在测试条件下没能自己拼出一条完整的攻击链。这也解释了为什么管控会下沉到产品层——部分 API 调用可能被拦截,甚至在生成到一半时被暂停,交给安全系统复核。

    ChatGPT Work:把 Codex 塞给普通人

    OpenAI 挑在同一天抛出了另一个东西:ChatGPT Work。简单说,它是把 ChatGPT 和 Codex 揉到了一块儿。Codex 本来是给写代码的人用的,现在 OpenAI 想让不懂编程的普通人也能用它干非编程的活——从你指定的 App、文件和工作流里收集上下文,直接产出文档、表格、演示文稿,甚至网页应用。

    OpenAI 在博客里说,ChatGPT Work 能从你选择的工具里收集上下文,产出文档、表格、演示文稿和网页应用;一个”统一插件目录”让它能连上 Slack、Gmail、Google Drive、日历和各类 CRM。

    说白了,它不再只是一个聊天框,而是想坐到你工作流的正中央。落地范围也够大方:Mac 和 Windows 的桌面端,连免费用户都能立刻用上;手机和网页端先给 Pro、Enterprise、Edu 这几个档位,Plus 和 Business 会在接下来几天陆续放开。OpenAI 的说法是,全球已经开始推送,24 小时内基本铺满。

    一家人,三种打法

    GPT-5.6 不是单个模型,而是一家人。Sol 是旗舰,主打智能和效能;Terra 是均衡的日常工作模型;Luna 走性价比路线,便宜又快。OpenAI 还加了一个 Ultra 模式,默认让四个智能体并行干活,对付复杂任务。

    • Sol 在一项智能体”考试”里比 Anthropic 的 Fable 5 高了 13 分,而且用的 token 更少。
    • Terra 和 Luna 在某些评测里,用大约十六分之一的成本就能打平 Fable 5。
    • 这一家人背后就一个信号:模型不光要比谁聪明,还要比谁便宜。

    顺便给微软递了颗定心丸

    OpenAI 说 GPT-5.6 会成为 Microsoft Copilot 的”首选模型”。这话多少有点针对性:这周彭博刚报道微软为了省钱,开始更多依赖自家 MAI 模型,外界一度猜测两家要闹掰。OpenAI 这波等于公开把”我们还是好搭档”写在脸上,也顺手压了压”分家”的传闻。


    把最近几件事连起来看挺有意思:Codex 并进了 ChatGPT,Atlas 浏览器退场,能力改由 Chrome 扩展承接。模型在 API 里打价格战,产品在桌面上抢入口——OpenAI 的意图很直白,就是想让你电脑上那个”替你干活的东西”只叫一个名字。聊天框时代的 ChatGPT 是个浏览器标签页,智能体时代的 ChatGPT,想变成你电脑里常驻的那一层。

  • Desktop Commander MCP:让 AI 直接掌控你的终端与文件系统

    Desktop Commander MCP:让 AI 直接掌控你的终端与文件系统

    Desktop Commander MCP

    一、项目简介

    Desktop Commander MCP 是一个为 Claude、Cursor、VS Code、Claude Code 等 AI 编程客户端提供「终端控制 + 文件系统搜索 + 差异文件编辑」能力的 MCP(Model Context Protocol)服务器。它让你的 AI 助手不再只会「动嘴」,而是能在你的本地电脑上真正「动手」——开终端、搜文件、改代码、跑命令、看结果,一条龙闭环。

    项目由 wonderwhy-er 维护,目前 GitHub 收获 6,700+ Stars、882 Forks,采用 MIT 协议开源,底层用 TypeScript 实现,跨 Windows / macOS / Linux 全平台可用。

    二、安装要求与过程

    环境要求

    • Node.js(推荐 18+;或改用 Docker 方式,无需安装 Node);
    • 一个支持 MCP 的客户端:Claude Desktop / Cursor / VS Code / Claude Code / Codex / Gemini CLI / Windsurf 等;
    • 操作系统:Windows、macOS、Linux 均可。

    快速安装(以 Claude Desktop 为例,npx 自动更新)

    npx @wonderwhy-er/desktop-commander@latest setup

    或手动在 claude_desktop_config.json 中添加:

    {
      "mcpServers": {
        "desktop-commander": {
          "command": "npx",
          "args": ["-y", "@wonderwhy-er/desktop-commander@latest"]
        }
      }
    }

    其他客户端一句话安装

    # Claude Code
    claude mcp add --scope user desktop-commander -- npx -y @wonderwhy-er/desktop-commander@latest
    
    # Codex
    codex mcp add desktop-commander -- npx -y @wonderwhy-er/desktop-commander@latest
    
    # Qwen Code
    qwen mcp add desktop-commander -- npx -y @wonderwhy-er/desktop-commander@latest

    不想装 Node?直接用 Docker 一键脚本(install-docker.sh / install-docker.ps1)启动;也可以通过 Smithery、Cursor 的 MCP 安装链接等图形化方式添加。

    三、核心功能

    1. 增强型终端控制:运行长时间命令、管理交互式进程(start_process / interact_with_process / read_process_output / force_terminate)、会话管理,并支持指定 bash / zsh 等 shell。
    2. 完整文件系统操作:读 / 写 / 移动 / 递归列目录、按文件名与内容搜索(基于 vscode-ripgrep 的递归搜索)、读取文件元数据、负偏移 tail 读取超大日志。
    3. 差异文件编辑(edit_block):精准 SEARCH/REPLACE 替换、模糊回退、字符级 diff、多文件与正则模式替换,像资深工程师一样做「外科手术式」修改,而不是整文件重写。
    4. 即时数据分析与办公文档:在内存中直接跑 Python / Node / R 代码;原生读写 Excel(.xlsx/.xls/.xlsm)、PDF、DOCX;直接分析 CSV / JSON,数据不出本机。
    5. 企业级安全与可观测:符号链接遍历防护、命令黑名单、Docker 隔离、全面审计日志(10MB 轮转)、动态配置无需重启。

    四、典型使用场景

    • 大型代码库重构:让 Claude 用 ripgrep 递归搜出所有调用某函数的地方,逐文件用 edit_block 做差异修改。社区里有用户用它一次性修完 23 个文件、76 个错误的 Svelte 5 项目,速度远超传统 AI 编码体验。
    • 本地数据分析:把 Downloads 里的 CSV 丢给 Agent,它直接在内存里跑 Python 做清洗、统计、画图,全程不离开本机,隐私可控。
    • 自动化日常办公:自动按文件类型整理 Downloads、找出重复照片、把 Excel 报表转成图表或 Markdown,把重复的体力活交给 AI。

    五、推荐理由

    一句话总结:这是目前我用过「最像把 AI 变成真同事」的 MCP 工具。它不只是一个文件服务器,而是把「读代码 → 改代码 → 跑命令 → 看结果」的闭环搬进了对话框。

    最香的是差异编辑(edit_block)——AI 不再整文件重写,而是精准打补丁,token 消耗更低、上下文更稳,长时间对话也不容易「翻车」。配合 Claude Code / Cursor,几乎可以取代一部分 IDE 操作,Vibe Coding 体验拉满。

    唯一要留意的是权限边界:它默认能跑任意终端命令,建议在配置里用 allowedDirectories 限定工作目录,并保持审计日志开启。整体来说,开源 MIT、跨平台、一行命令装好,强烈推荐给所有做 AI 编程的人。

    六、下载地址

  • Etched走出隐身:50亿美元估值、10亿美元订单,专打AI推理芯片

    一家芯片公司从隐身模式里走了出来

    Etched这家公司以前低调得很,但最近它直接把成绩单摊在了桌上:芯片已经由台积电成功制造出来,累计拿下了10亿美元的系统订单,整体估值也到了50亿美元。它的方向很专注——做Transformer推理专用的芯片和整机系统,专门帮前沿模型更快、更便宜地跑推理。

    所谓推理,就是用户输入问题后模型真正生成答案的那一步。对今天的AI公司来说,这一步既是用户体验的瓶颈,也是最大的成本中心。谁能把推理成本压下去,谁就能让大模型服务更便宜、响应更快。Etched赌的正是这一点。

    Etched已签10亿美元客户订单,累计融资8亿美元,最新一轮由Stripes领投,投后估值50亿美元。

    这家公司2022年成立,创始人Gavin Uberti和Robert Wachen都是哈佛辍学生,后来拿了Peter Thiel的Thiel Fellowship。其实他们早在2024年就跟TechCrunch聊过芯片计划。那时候他们已经从Primary Venture Partners等投资人手里拿到超过1.25亿美元。不过据他们在Patrick O’Shaughnessy的播客里回忆,2023年最初融资时非常艰难,他们拿着30页备忘录讲“AI未来需要专用芯片,而不是通用GPU”,结果几乎每个大投资人都拒绝了。

    投资人名单豪华,但市场考验才刚开始

    现在融资环境完全是另一个世界。Etched披露的累计融资额是8亿美元,其中去年12月那轮未公开的融资由Stripes领投,金额约5亿美元,估值50亿美元。参与方包括VentureTech Alliance、Jane Street、Hudson River Trading、Two Sigma、Ribbit Capital,以及Andrej Karpathy、Geoffrey Hinton、Fei-Fei Li、Arthur Mensch、Scott Wu等AI界名人。Peter Thiel和Stanley Druckenmiller也在股东名单里。

    不过融资热归融资热,芯片能不能真正兑现性能,还需要独立测试。Etched目前在做的是“前沿推理集群”——把芯片、定制机柜和软件打包成一套系统。它说自己比Nvidia的GPU更快、更省电、更便宜,但这些数字来自公司自己,真实世界表现还得等客户大规模部署后才能验证。

    AI推理芯片概念图
    专用AI推理芯片正试图从通用GPU手中抢走推理市场。

    在这个赛道里,Etched不是孤例。Cerebras今年率先IPO,Groq刚刚完成6.5亿美元融资,亚马逊、Google、微软都在做自己的AI芯片,OpenAI也推出了和Broadcom合作的首款定制芯片。推理芯片的竞赛正在升温,每家公司都在赌自己的路线。


    对AI行业来说,推理芯片的稀缺性正在被放大。训练一度是最大难题,但现在越来越多公司发现,真正烧钱的其实是服务用户时的推理。Etched的崛起说明,资本市场已经把这个环节视为下一个主战场。至于它能不能撼动Nvidia,还要看第一批客户订单交付后的实际表现。