标签: AI

  • 谷歌用爆表财报回应AI烧钱质疑:云业务同比暴涨82%

    过去一年,Alphabet 的投资人没少为一件事发愁:谷歌在 AI 上砸了那么多钱,到底值不值?这份最新财报出来,他们大概可以稍微松口气了。谷歌用一组漂亮到有点吓人的数字,回应了外界关于”AI 泡沫”的质疑。

    谷歌云与AI业务
    谷歌云业务成为其AI巨额投入的最有力背书 图片来源:Getty Images

    云业务成了最硬的底气

    最亮眼的一栏,是谷歌云。这块业务主要靠企业采用 AI 拉动,本季度营收同比暴涨 82%,达到 248 亿美元。这个增速比上个季度的 63%(当时是 200 亿美元)还要猛,也远远甩开了华尔街 224.6 亿美元的预期。

    谷歌说,这波增长主要来自企业级 AI 解决方案和 AI 基础设施的采购。更能说明问题的是它手里的云合同积压——也就是签了约但还没转化成收入的部分——已经堆到了 5140 亿美元。这几乎是一张写好的未来收入账单。

    “我们的 AI 投入正在重新定义业务每个环节的可能性,各条线都势头很好。”——谷歌 CEO 桑达尔·皮查伊

    整体来看,Alphabet 本季度净利润冲到 1121 亿美元,而去年同期只有 281 亿美元,几乎是翻了两番。公司总营收同比增长 24%,达到 1198 亿美元,其中谷歌服务(搜索、YouTube 等)收入增长 15%,达到 945 亿美元。

    Gemini 用户也在猛涨

    消费端同样有好消息。谷歌的 AI 聊天应用 Gemini 目前月活跃用户已达 9.5 亿。作为对比,2025 年第四季度这个数字还是 7.5 亿——几个季度就多了两亿人。搭配企业侧的云增长,谷歌这次算是 B 端和 C 端两头都拿出了成绩。

    当然,营收猛增对谷歌来说并不算新鲜事。这已经是它连续第 12 个季度实现两位数营收增长。只是即便用它自己的高标准来衡量,这个季度也称得上格外丰收。


    钱还得接着烧,分析师追着问回报

    好数字之外,谷歌的开销依旧惊人。它今年的资本支出——建数据中心、买芯片、扩基础设施的钱——预计在 1800 亿到 1900 亿美元之间。这个数字在财报电话会上没能躲过分析师的追问,好几位直接逼问皮查伊:这些投资到底什么时候、能带来多少回报?

    皮查伊的回应偏向乐观。他把算力产能投资的收获期指向 2027 年,说公司看到了强劲的需求信号,包括一批长期订单。用他的话讲,如今的局面比一年前看起来更健康,这也是谷歌敢继续加码的底气所在。几个关键数据可以帮你快速抓住这份财报的重点:

    • 谷歌云营收同比 +82%,达 248 亿美元,超出华尔街预期;
    • 云合同积压高达 5140 亿美元,净利润同比从 281 亿飙到 1121 亿美元;
    • Gemini 月活 9.5 亿;全年资本支出预计 1800 亿–1900 亿美元。

    对于一直担心 AI 是不是在空烧钱的投资人,这份财报至少证明了一件事:谷歌的云生意确实把 AI 的投入接住了。至于 1900 亿美元的年支出能不能在 2027 年如期兑现回报,就要看接下来几个季度它能不能一直这样交卷了。

  • Uber创始人卡兰尼克带17亿美元回归:这次他要造机器人的底盘

    如果你以为特拉维斯·卡兰尼克(Travis Kalanick)在被自己一手创办的 Uber 扫地出门后就此淡出,那这次他用一笔巨款把所有人的注意力又拉了回来。他的机器人公司 Atoms 刚刚完成一轮 17 亿美元的融资,领投方是硅谷顶级风投 a16z,本·霍洛维茨(Ben Horowitz)本人将进入董事会。

    特拉维斯·卡兰尼克
    Uber 联合创始人特拉维斯·卡兰尼克 图片来源:Getty Images

    参与这轮融资的还有贝恩资本、Fifth Wall 等机构。但最有戏剧性的一笔,是 Uber 也出现在了投资人名单里。要知道,2017 年正是这家公司在性骚扰、歧视和职场文化风波中把卡兰尼克赶下了 CEO 的位置。九年过去,被赶走的创始人和赶走他的公司,又坐到了同一张桌子上。

    Atoms 到底是家什么公司

    说白了,Atoms 是卡兰尼克离开 Uber 后一系列动作的集大成者。他先是搞了个叫 CloudKitchens 的”幽灵厨房”生意,今年三月又给整个盘子换了个新名字叫 Atoms,同时把老同事安东尼·莱万多夫斯基(Anthony Levandowski)掌舵的重工业自动化公司 Pronto 收入囊中。

    卡兰尼克说,他还想把生意做到采矿业里去,走得比 Pronto 现在给矿区车辆做的自动化更远。去年有消息称,他曾想在 Uber 支持下买下中国自动驾驶公司小马智行(Pony AI)的美国业务,不过据 The Information 报道,这桩谈判在三月已经告吹。

    “某种程度上,这轮融资是在了却一桩未竟之事。它是燃料,让我们把从 Uber 起步、在 CloudKitchens 延续、如今要在 Atoms 收尾的’比特到原子’故事讲完。”——特拉维斯·卡兰尼克

    在 X 上宣布融资的帖子里,卡兰尼克没有透露 Atoms 具体要造什么,但他把自己的野心说得很大。他说 16 年前就踏上了”把物理世界数字化”的旅程——用软件去理解、预测、控制现实世界,打造一种”以原子为基础的计算机”,在这里制造业就是 CPU,房地产就是存储,运输就是网络。他还有个更直白的说法:要给机器人造一个”底盘”(wheelbase)。

    a16z 为什么押注”回归的卡兰尼克”

    “特拉维斯回来了。”霍洛维茨在同一天发帖,语气里满是兴奋。他的理由是,要撼动经济里那些老派又笨重的环节,需要一种稀缺的创业者——既要有近乎偏执的拼劲,又要有跨越软件架构到机械工程的知识广度。在他看来,卡兰尼克就是这样的人。

    霍洛维茨认为,Atoms 的核心是让人在物理世界里变得更高效。他把这件事的价值类比成 Uber 之于出行、计算机之于数字世界——用 AI 和机器人,让每个人、每件事都更有生产力。


    卡兰尼克没细说这笔钱会怎么花,但从字里行间看,很大一部分会砸向招人。他把创业者要面对的对手形容成”最终 Boss”——大自然,以及它对一切改变的顽固抵抗。听上去像是在给自己打气,也像是在给准备加入的人递一份挑战书。这里的几个看点值得留意:

    • 17 亿美元的规模,在机器人赛道属于顶格融资,a16z 亲自坐进董事会分量很足;
    • Uber 的回归投资,让这段”创始人被逐”的旧账多了层和解的意味;
    • Atoms 想做的是机器人的通用”底座”,而不是单一产品,野心指向的是整个物理世界的自动化。

    争议缠身的创业者、天量资金、几乎没有边界的目标,卡兰尼克这次的故事一开场就足够抓人。至于他能不能真的把”比特到原子”这条线走通,恐怕得等 Atoms 拿出第一台真机器才好评判。

  • Microsoft AutoGen – 微软开源多智能体AI编程框架 [59.9K+ Stars]

    Microsoft AutoGen – 微软开源多智能体AI编程框架 [59.9K+ Stars]

    📝 项目简介

    Microsoft AutoGen 是微软研究院出品的开源多智能体 AI 编程框架,官方定位为 “A programming framework for agentic AI”。它把”多个会自主对话的 Agent 协同工作”这件事,抽象成一套事件驱动的运行时 + 消息协议,让 LLM、工具、人类三方可以在同一套代码里自由组合,既能 自主行动,也能 和人并肩工作,被广泛视为现代 Multi-Agent 协作范式的奠基性项目之一。

    59.9K+
    GitHub Stars

    9.0K+
    Forks

    Python / .NET
    双语言支持

    MIT
    代码许可

    数据来源:GitHub REST API(仓库 microsoft/autogen,截至 2026-07-23)。

    ⚙️ 安装要求和过程

    环境要求

    • Python:3.10 及以上(v0.4+ 推荐 3.11)
    • 操作系统:Linux / macOS / Windows 均支持
    • LLM 凭据:OpenAI 兼容 API Key(Azure OpenAI / OpenAI / Ollama / 本地 vLLM 等均可)
    • 可选依赖:Docker(隔离代码执行)、Node.js(Studio 浏览器依赖)
    • .NET 用户:.NET 8 SDK,dotnet add package Microsoft.AutoGen

    快速安装(Python,v0.4+ 推荐)

    # 1) 创建并激活虚拟环境
    python3 -m venv .venv && source .venv/bin/activate
    
    # 2) 安装 AgentChat 核心 + OpenAI 扩展
    pip install -U "autogen-agentchat" "autogen-ext[openai]"
    
    # 3) (可选) 安装无代码可视化工作台
    pip install -U "autogenstudio"
    
    # 4) 验证
    python -c "import autogen_agentchat; print(autogen_agentchat.__version__)"

    从源码安装(v0.4)

    git clone https://github.com/microsoft/autogen.git
    cd autogen
    pip install -e ./python/packages/autogen-agentchat
    pip install -e ./python/packages/autogen-ext[openai]
    # 启动 Studio
    autogenstudio ui --port 8080

    配置 LLM(OpenAI 兼容)

    把 API Key 放进环境变量(推荐),或写入 OAI_CONFIG_LIST

    # .env
    OPENAI_API_KEY=sk-...
    # 可选:Azure / 自定义网关
    AZURE_OPENAI_API_KEY=...
    AZURE_OPENAI_ENDPOINT=https://your-resource.openai.azure.com/
    OPENAI_API_BASE=https://your-gateway.example.com/v1
    ⚠️ 版本提示:自 v0.4 起,包名由 pyautogen 改为 autogen-agentchat / autogen-ext。v0.2 用户可参考 官方迁移指南

    🏗️ 架构总览

    AutoGen 把”造一个能自主干活的 AI”这件事切成三层 API,开发者可以按需选择从底层到高层:

    AutoGen 三层架构:Extensions / AgentChat / Core

    • Core API(底层):消息传递、事件驱动、分布式 Runtime,同时支持 Python 与 .NET,是整条链路的”内核”。
    • AgentChat API(高阶):双智能体对话、群聊、AgentTool 多专家路由——大多数应用只需要这一层。
    • Extensions API(扩展):LLM 客户端、工具注册、MCP 协议适配、模型上下文协议桥接。

    再上面还有三个开箱即用的”上层建筑”:AutoGen Studio(无代码 GUI)、AutoGen Bench(基准评测)、Magentic-One(微软开源的通用多智能体团队基线)。

    ✨ 核心功能

    🤖 1. 多智能体对话与编排

    把每个 Agent 看作一个会发消息的对象,通过 initiate_chat / a_initiate 一行就能拉起对话;支持两人私聊、群聊(SelectorGroupChat / Swarm / RoundRobin)与按需动态编排(AgentTool 把”专家 Agent”当工具调)。

    🧠 2. 可插拔模型与工具

    原生支持 OpenAI / Azure OpenAI / Anthropic / Ollama / vLLM / Gemini 等模型;工具侧通过 FunctionTool + MCP 一键接入浏览器、数据库、Shell、文件系统、Playwright 等上百种能力。

    🧑‍💻 3. 人机协同(Human-in-the-Loop)

    通过 UserProxyAgent / input_func 任意把人类拉进对话:审批、纠正、补充上下文,AI 不会”擅自做主”——这是 AutoGen 最早让业界眼前一亮的杀手锏。

    🖥️ 4. AutoGen Studio:无代码工作台

    可视化拖拽搭建 Agent 团队、连接工具、调试消息流、上传数据集。零代码也能跑通一个 Magentic-One 风格的”会自己上网 + 写代码 + 操作文件”的 AI 助手。

    🔁 5. Magentic-One 通用团队基线

    微软在 AutoGen 上开源的”通用多智能体”参考实现:Orchestrator 动态规划 → 调用 Coder / Computer-Use / Web-Surfer / File-Surfer 四个专家完成任务,对标 OpenAI Operator 与 Anthropic Computer Use。

    Magentic-One 风格的多智能体协作流程:Orchestrator + 4 个专家 Agent

    🎯 典型使用场景

    场景一:自动数据分析 + 报告生成

    做法Planner Agent 拆解任务 → Coder Agent 写 pandas / matplotlib 代码 → Executor 在 Docker 里跑 → Writer Agent 把结果整理成 Markdown 报告。人类只在最后审阅。

    收益:原本 2 小时的手工分析压缩到 10 分钟以内;每一步可追溯、可重放。

    场景二:多角色代码评审 / PR 自动化

    做法Author Agent 改代码 → Reviewer Agent 提风格 / 性能意见 → Tester Agent 自动跑单测 + 覆盖率 → Approver 收口。整套流程在一个 SelectorGroupChat 里循环。

    收益:把”人盯 PR”变成”AI 盯 PR”,工程师只看最后结论。

    场景三:Magentic-One 通用办公助手

    做法:把 Coder / Computer-Use / Web / Files 四个 Agent 配成团队,Orchestrator 自动调度。让它”打开 Chrome 去 LinkedIn 搜索 Python 后端岗位、截图、写到 jobs.md“——这是 OpenAI Operator 还没发布时,AutoGen 社区最早跑通的范式。

    收益:任何能拆成”打开应用 → 抓信息 → 写文件”的流程都能交给它。

    💡 推荐理由(也聊聊它的现状)

    作为多智能体框架的”鼻祖级”项目,AutoGen 给整个行业留下了三份被广泛借鉴的遗产:把”对话”当作 Agent 协作的一等公民把”人”显式拉进循环把”工具调用”做成可插拔。从 2023 年发布至今,AutoGen 一直是 Multi-Agent 论文与开源项目的引用常客,60K Star 是其行业地位的最好注解。

    实际用下来,AutoGen 最打动我的有三点:

    1. 上手曲线友好:AgentChat API 让你 5 行代码就能跑起一个”用户 ↔ 助手”对话;想加工具,FunctionTool(...) 一包就完事;想加人类审核,UserProxyAgent 直接接管输入。
    2. 生态厚、可借鉴多:官方 + 社区沉淀了 Magentic-One、AutoGen Bench、AG2(前 AutoGen 延续)等一大批可直接 fork 的参考实现,几乎所有”AI 办公助手”类产品都能在 AutoGen 里找到原型。
    3. 底层够”工程”:Core API 的事件驱动 + 分布式 Runtime 设计,让它既能跑 Jupyter 玩具,也能跑生产级服务;而且 Python 与 .NET 双实现,给企业 .NET 栈留了通路。

    ⚠️ 也要如实告诉你:维护模式与迁移

    自 2025 年起,AutoGen 仓库进入 社区维护模式(community-maintained):bug fix 与小幅改进由社区接管,重大新特性已并入微软官方的 Microsoft Agent Framework

    对新项目而言:如果只是做多智能体原型 / 内部工具,现在的 AutoGen 仍然完全够用、生态最厚;如果是从 0 起步并预计要跑 2-3 年的产品,建议同步评估 Microsoft Agent FrameworkAG2(原 AutoGen 核心贡献者 fork 的延续版本)。

    📥 下载地址

    🌐

    官方网站

    microsoft.github.io/autogen

    🐙

    GitHub 仓库

    github.com/microsoft/autogen

    📚

    文档中心

    stable 文档

    🐍

    PyPI 安装

    pip install autogen-agentchat


    #Microsoft #AutoGen #多智能体 #AgenticAI #开源项目

  • 三星谷歌智能眼镜再加两款设计,今秋带着 Gemini 正式登场

    智能眼镜这条赛道,最近又热闹了一点。在三星 7 月的 Unpacked 发布会上,三星和 Google 把双方合作的 Android XR 智能眼镜往前推了一步:除了今年 5 月已经亮相的那批设计,又多了 Gentle Monster 和 Warby Parker 两家时尚品牌操刀的两款新样子。眼镜本身就带着 Google 的 Gemini AI,计划今年秋天正式开卖。

    这不是凭空冒出来的概念。Android XR 是 Google 专门给头显和眼镜打造的操作系统,三星负责把硬件做出来。早在 5 月的 Google I/O 上,这个项目就以”Project Aura”之类的名号露过脸,当时大家就猜它会走”科技公司出系统、传统眼镜品牌出颜值”的路线。现在看,这条路真的走通了。

    三星与谷歌合作的智能眼镜新设计
    三星与 Google 的智能眼镜新设计,由 Gentle Monster 与 Warby Parker 操刀。(图源:The Verge)

    “眼镜真正的门槛从来不是屏幕够不够亮,而是你愿不愿意天天戴出门。”一位行业观察者这样形容这场竞赛。

    为什么非得拉时尚品牌入伙

    智能眼镜卖了好几年,始终没真正飞进大众生活,原因很直白:大多数长得像实验器材。Meta 的雷朋眼镜之所以能卖出点声量,靠的正是”看起来就是副普通墨镜”。三星和 Google 显然也想通了这点——与其自己设计一个四不像,不如把镜框交给 Gentle Monster、Warby Parker 这种本来就被年轻人追捧的品牌。

    对用户来说,这意味着挑眼镜第一次有了”选款式”的余地;对品牌来说,则是把自己的设计语言直接铺到一块全新的智能硬件上。双赢的算盘打得挺响。

    Gemini 上车,意味着什么

    比起镜框长什么样,更值得琢磨的是眼镜里那颗 Gemini。Google 的当家多模态模型塞进镜架,意味着你戴着它就能做实时翻译、看东西问问题、把眼前看到的信息直接喂给 AI 处理。出门旅游对着路牌拍一下、开会时悄悄记笔记、逛街时问”这牌子哪家店有货”——这些场景正是 Google 想用 Gemini 抢下来的日常入口。

    这也让眼镜从”显示设备”变成了”始终在线的 AI 助手”。区别在哪?以前的智能眼镜主要把内容投给你看,现在的思路是让 AI 主动帮你处理世界里的信息。

    一场还没打完的仗

    把镜头拉远,Google 和三星这步棋,正面撞上了 Meta 的雷朋眼镜,以及苹果也在悄悄布局的 AI 眼镜计划。大家赌的都是同一件事:下一代人机交互的入口,可能不再是手机屏幕,而是一副你忘了自己戴着、却随时能调起 AI 的眼镜。

    不过话说回来,设计和模型都就位了,真正的考验才刚开始。续航、重量、隐私,还有”戴着它跟人说话会不会尴尬”这种说不清的社会接受度,任何一个卡住,再好看的镜框也救不回来。

    • 新设计来自 Gentle Monster 与 Warby Parker,今秋随三星新品上市;
    • 眼镜搭载 Google Gemini,支持实时翻译、视觉问答等 AI 能力;
    • 背后是 Google 的 Android XR 平台,三星负责硬件落地;
    • 直接竞品指向 Meta 雷朋眼镜与苹果的 AI 眼镜计划。

  • AMD 豪掷 50 亿美元投资 Anthropic,2GW 的 MI450 显卡就位

    这两天 AI 圈又有笔大钱落了地。AMD 在周三官宣,要往 Anthropic 投最多 50 亿美元,同时帮这家公司把算力盘子做大。作为交换,Anthropic 会用上最多 2 吉瓦(GW)的 AMD Instinct MI450 系列 AI 显卡,跑在 AMD 新推出的 Helios 机架级系统上。

    AMD 与 Anthropic 达成最高 50 亿美元战略合作
    AMD 将向 Anthropic 投资最多 50 亿美元,并部署 MI450 系列 AI 显卡。(图源:The Verge)

    光看数字可能没感觉,拆开说就明白了。2GW 是什么概念?大概相当于两座中等城市全年的用电峰值压进一堆机房里。Anthropic 计划先在 2027 年上半年把第一座 1GW 的集群点亮,剩下的后续铺开。这事儿最早是《华尔街日报》捅出来的,AMD 自己随后发了公告确认。

    “通过与 AMD 在全栈层面合作,我们既锁定了需要的算力容量,又能针对 Claude 的训练和推理做优化。” —— Anthropic 联合创始人、首席计算官 Tom Brown

    为什么是 AMD,而不是老朋友英伟达

    过去提到前沿模型的算力,大家默认就是英伟达的卡。Anthropic 虽然也不是纯英伟达阵营——它之前就搭过 Google 的 TPU、Amazon 的 Trainium——但 AMD 能拿下一家顶级实验室的”主粮”订单,意义不一样。MI450 是 AMD 今年力推的新一代 Instinct,配上 Helios 这种把计算、网络、散热打包好的机架方案,摆明了是要正面啃英伟达的蛋糕。

    对 AMD 来说,这笔买卖不只是一张订单。Anthropic 是当下最能打的大模型团队之一,它的背书等于给 MI450 做了一次硬核实测广告。往后别的公司采购时,心里会多一个”连 Anthropic 都在用”的参照。

    Anthropic 的算力拼图越铺越大

    把这次合作放进水里看,Anthropic 最近在算力上的动作密集得有点吓人。它前面已经和 SpaceX、TeraWulf 签了数据中心协议,又拉着 Google、博通(Broadcom)搞了一笔不小的基建交易,和 Amazon 也有算力方面的合作。甚至有传闻说,它跟 Meta 之间也可能谈成类似的租赁协议。

    一家原本以”安全优先”出名的实验室,现在像在同时下好几盘棋:一边要保证训练和推理用的算力源源不断,一边还得把供应方分散开,别被任何一家芯片厂绑死。2GW 的 AMD 卡,就是这张网里最新、也最显眼的一根线。

    钱之外的那层合作

    这次不是单纯的”我买你股票、你买我显卡”。双方还签了个多年工程协作:AMD 会把 Anthropic 的 Claude 用到自己的软件开发、工程和产品的日常流程里。换句话说,卖卡的人自己先成了重度用户——用 Claude 来写代码、做工程决策,等于把客户的工具嵌进了供应商的研发流水线。

    这种”你用我的模型优化我的芯片,我拿你的算力跑你的模型”的闭环,正在成为大厂之间的新默契。对 Anthropic 而言,多一个强力算力后盾;对 AMD 而言,多一个能帮它把软件生态磨顺的顶级伙伴。

    • AMD 最多投 50 亿美元,Anthropic 部署最多 2GW 的 MI450 显卡;
    • 首批 1GW 计划在 2027 上半年上线,基于 Helios 机架级系统;
    • Anthropic 近期算力合作已覆盖 SpaceX、TeraWulf、Google、博通、Amazon;
    • 双方另有多年工程协作,AMD 将 Claude 引入内部研发流程。

  • llmfit:一条命令,算出哪些大模型能在你的电脑上跑起来

    llmfit:一条命令,算出哪些大模型能在你的电脑上跑起来

    llmfit TUI 演示

    想在本地跑大模型,却总被「这张显卡能不能带得动?」「选哪个量化档位?」劝退?llmfit 把这道难题变成了一条命令:它自动检测你的内存、CPU、GPU,再为目录里数百个模型和提供商打分,直接告诉你哪些模型能在你的机器上流畅跑起来。下方动图就是它的交互式 TUI——硬件规格在顶部,下面是所有模型按「适配度」实时排名。

    📌 项目简介

    llmfit 是一款用 Rust 编写的终端工具,能根据系统的 RAM、CPU 与 GPU 自动「量体裁衣」地为 LLM 模型选型;它会检测硬件、对每一个模型从内存适配、速度估算、模型质量、上下文长度四个维度打分,并输出真正能在你机器上跑得动的推荐清单。默认提供交互式 TUI,也支持经典 CLI 模式,兼容多 GPU、MoE 架构、动态量化,以及 Ollama / llama.cpp / MLX / Docker Model Runner / LM Studio 等本地运行时。

    🛠 安装要求和过程

    环境要求:

    • 预编译二进制,无需安装 Node.js / Python 运行时,开箱即用;
    • 支持 Windows / macOS / Linux,跨平台一致;
    • 可选:本地运行时(Ollama、llama.cpp、MLX、Docker Model Runner、LM Studio)用于实测与部署;
    • 从源码构建需要 Rust 工具链(cargo)。

    快速安装(任选其一):

    # macOS / Linux(Homebrew 预编译二进制,推荐)
    brew install AlexsJones/llmfit/llmfit
    
    # Windows(Scoop)
    scoop install llmfit
    
    # 一行脚本安装(无 sudo 时落到 ~/.local/bin)
    curl -fsSL https://llmfit.axjns.dev/install.sh | sh
    
    # Python 生态(uv / pip)
    uv tool install -U llmfit      # 或 pip install llmfit
    
    # Docker / Podman(直接出 JSON 推荐)
    docker run ghcr.io/alexsjones/llmfit
    
    # 从源码构建
    git clone https://github.com/AlexsJones/llmfit.git && cd llmfit && cargo build --release
    

    跑起来:

    llmfit            # 进入交互式 TUI,看硬件 + 全模型排名
    llmfit fit        # 命令行表格:所有模型按适配度排名
    llmfit recommend --json   # 以 JSON 输出 Top 推荐(供脚本 / Agent 消费)
    llmfit info "qwen2.5:7b"  # 单个模型的适配分析与估算依据
    llmfit bench      # 对你的运行时实测 tok/s 与首字延迟
    llmfit doctor     # 输出硬件检测报告(用于反馈问题)
    

    ✨ 核心功能

    llmfit 工作流程

    1. 硬件自动检测 + 四维评分:读取 RAM / CPU / GPU·VRAM 与本地后端,对目录里数百个模型按「内存适配、速度估算、模型质量、上下文长度」四维打分,并公开每个分数的输入依据,llmfit info 可逐项核查。
    2. TUI 交互 + CLI 脚本化:默认 TUI 实时排名、规划、模拟下载并接入社区榜单;同时提供 fit / recommend --json / info 等子命令,方便被脚本、CI 与 AI Agent 调用。
    3. 多 GPU、MoE 与动态量化:支持多卡配置与 MoE 架构(按激活参数而非总量估算显存),并会根据你的硬件动态选择最优量化档位(如 Q4 / Q8)。
    4. 本地运行时全覆盖:原生对接 Ollama、llama.cpp、MLX、Docker Model Runner、LM Studio,推荐结果可直接落地运行。
    5. 实测众包(benchmark & share):在你机器上实测 tok/s,结果先存本地、再一键以 PR 贡献回社区,让同型号硬件的人拿到「已验证 ✓」的真实数字。

    🎯 典型使用场景

    llmfit 四大评分维度

    • 本地部署前选型:拿到一台新笔记本 / 显卡,先跑 llmfit 看 7B / 14B / 32B 甚至 70B 谁能在你的显存和内存里跑、大概多快,避免「下了 3 小时发现跑不起来」的尴尬。
    • 自动化流水线 / AI Agent:在部署脚本或 Coding Agent 里调用 llmfit recommend --json --use-case coding,根据当前主机规格自动挑选可运行的编码模型,做到「按机器适配」而非写死模型名。
    • 硬件升级决策:想加内存还是换显卡?用 llmfit info 对比不同配置下目标模型的适配与速度估算,量化升级带来的收益再下单。

    💡 推荐理由

    本地跑大模型最让人头大的就是「选型玄学」——参数规模、量化、上下文、显存、内存交织在一起,靠经验猜十次翻车八次。llmfit 把这件事变成了可解释、可验证的工程问题:它不只给结论,还把每个估算的输入摊开给你看,并鼓励你用真实 benchmark 反哺社区。Rust 编写的单文件二进制启动极快、零运行时依赖,TUI 好看、CLI 好接,是个人本地 AI 实验室和企业内网「该跑哪个模型」决策的贴心小助手。30K+ Star、MIT 协议、隐私默认(不联网不上传),值得收藏。

    🔗 下载地址

  • OpenAI 推出 Presence:把“靠谱”的 AI 智能体塞进企业客服和电话里

    企业用 AI 智能体,早就不缺”能不能跑起来”的证明了,缺的是”能不能放心让它干正事”。OpenAI 今天拿出的 Presence,瞄准的就是这个缺口——一套帮企业把可信智能体真正部署到生产和内部流程里的产品。

    从”能答”到”能办事”

    Presence 支持的智能体可以回答问题、解决工单、调用公司系统、在授权范围内直接动手操作,必要时再转给真人。关键设计是每个部署只盯一个具体活儿:处理账单纠纷、理赔保险索赔、解决员工 IT 求助都行。智能体只拿到这件事需要的知识和权限,企业自己定规则——什么它能做、什么要审批、什么必须人工接手。

    上线不是终点。真实会话和转人工的记录会暴露智能体的盲区,Presence 用 Codex 去分析这些信号、提出改动建议,团队先在和生产版本对照的环境里测过,再批准小范围推送。模型在变,业务在变,智能体也得跟着变,但方向盘始终在企业手里。

    已经替 OpenAI 自己接电话了

    这套东西不是 PPT。它现在就跑在 OpenAI 自己的英文电话客服线上(1-888-GPT-0090):接开放式提问、核验来电人身份、调取账户信息、执行授权操作。几周内,它的质量评分就追平甚至超过了一线人工客服的标准,目前 75% 的进线问题能自己搞定;靠 Codex 驱动的提升循环,十天里把人工转接率又压低了 15 个百分点。

    OpenAI Presence 平台示意
    OpenAI Presence 将语音、聊天、策略与人工转接工作流整合到企业智能体平台中。

    外部客户也在试:BBVA 在墨西哥探索用语音智能体做日常银行服务,软银在测自然的日语客户对话,IAG 想在大风大浪等极端天气时段提供及时支援。BBVA 的人说,他们就是把 Presence 当设计伙伴,一起把金融客服的语音体验打磨得更顺、更个性化。

    不是自助,是”陪跑”

    上线前,团队会用模拟和评分器把常见请求、边界情况、高风险场景先跑一遍,护栏在互动越界时介入。目前 Presence 还是限量开放,由 OpenAI 的现场部署工程师和少数全球集成商带着企业落地,暂时不卖自助版。


    对企业来说,最难的从来不是”上 AI”,而是”上完之后不出事”。Presence 的思路不性感,但很实在:把权限、策略、护栏、评估、改写全捆在一起,让智能体在受控的框里慢慢变聪明。

    📎 原文来源:Introducing OpenAI Presence
  • 阿里千问甩出 Qwen-Image-3.0:这次不拼好看,拼的是“像真的”

    阿里这两天把 Qwen-Image 系列推到了第三代。前两代分别强调”精准”,以及”精准、多样、完整、美观、真实”,到了 3.0,团队把核心词压成了一个字——”实”。说白了,前两代在想办法让图”好看”,这一代想让图”有用”。

    一张图里塞下一整版报纸

    最直观的变化是”内容量”。新模型能吃进最多 4.5k token 的指令,一口气画出报纸版面、分镜脚本、试卷这类信息密度极高的图。官方演示里有个 3×3 的网格,九宫格里每一格都是独立的科普插图——隧道安全漫画、空间几何课、细胞 DNA 对比……单是描述这张图就花掉 3.7k token,而它是一口气生成的,不是把九张小图拼起来。

    Qwen-Image-3.0 渲染的人像细节
    Qwen-Image-3.0 渲染的人像细节,皮肤质感接近照片级。

    这种”横向铺开”考验的是模型在同一张画布上并列多个概念、还互不干扰的能力;而”纵向钻深”考验的是层层嵌套——比如在一张图里从外到内叠出 VSCode 界面、Qwen Chat 窗口、微信对话,再到一张手冲咖啡海报。

    10 像素的小字也读得清

    光塞得多没用,还得细。Qwen-Image-3.0 能把 10px 的小字渲染得清清楚楚,毛孔、发丝这种微观细节也到位,皮肤质感接近照片。学术排版是终极压力测试,密集的 LaTeX 公式、上下标、希腊字母、定理编号,符号一个都不能错。它甚至能模拟高中生课堂笔记的红笔批注——下划线、波浪线、圈画,笔迹自然得有点真假难辨。

    会说 12 种语言,还懂真实世界

    第三块叫”深知识”:原生支持 12 种语言的文字渲染,能模仿网页、游戏、直播间的界面,背后是世界知识的支撑。它还能联网取最新信息——你让它画一张”杭州 7 月 21 日天气预报”,它能真的去查。更脑洞的是,它可以把齐白石和梵高拽进同一个直播间,一起给 Qwen-Image-3.0 打广告。


    从”能用”到”好用”,图像生成模型这三年走了很远。阿里的算盘很清楚:当模型能稳定产出报纸 PDF、短剧分镜、复杂 UI 这类高价值内容,它就不只是玩具,而是真正能进设计、教育、电商产线的生产力工具。

  • AI 数据中心 2035 年或吃下美国五分之一电力,是今天的 4 倍

    一个被低估的数字

    彭博新能源财经(BloombergNEF)刚出的一份报告,算了一笔有点吓人的账:到 2035 年,美国的数据中心可能吃掉全国五分之一的发电量,是现在的 4 倍。撑起这个预测的,是 AI 算力的疯狂扩张——未来十年,数据中心容量会冲到接近 200 吉瓦,其中将近一半用来做模型训练和推理。

    更关键的是,这些算力大部分还挤在美国本土。报告估计,到 2033 年,按电力需求算,全球 64% 的 AI 芯片都会落在美国。

    彭博这次对 2035 年用电量的预测,比它自己去年 12 月的版本高出了 83%。

    这可不是孤例。电力行业非营利机构 EPRI 把 2024 年的预测直接翻了一倍多,标普的预估在半年里也涨了超过三分之一。各大机构对数据中心耗电的判断,几乎都在往上修,原因只有一个:美国建数据中心的速度,比任何人预想的都快。

    电网已经在喊疼

    问题紧接着就来了:未来十年新建的数据中心,大部分要接上本来就紧绷的电网。PJM 互联电网从弗吉尼亚一路覆盖到伊利诺伊,到时要把 34% 的电力分给数据中心;管着得州大半的 ERCOT,也得拿出 22% 的发电容量。

    PJM 自己早就扛不住了。它手里攥着全美大量的数据中心,连接申请一度多到瘫痪,最后干脆把新电源接入的排队冻结了四年。今年 4 月虽然重新开放,但局面已经紧张到有一家公用事业公司(American Electric Power)威胁要退出互联。供需失衡,把电价在一年里推高了 76%。

    • 即便排队拥堵、价格飞涨,数据中心还是拼命想挤进 PJM——最近一次容量拍卖里,它们占了 38% 的费用。
    • 美国之外,数据中心也在狂奔。按激进情景,到 2033 年全球会多出 1935 太瓦时的电力需求,差不多等于印度一年的用电量。

    AI 的账单,最后谁来付

    这份报告点破了一件事:我们整天聊 AI 有多聪明、多便宜、多无处不在,却很少算它背后的电费。每一次模型训练、每一句聊天回复,都在悄悄吃掉电网里的电。当数据中心要占掉一个国家五分之一的电力,涨价的就不只是科技公司,还有普通家庭的账单。

    算力是 AI 的燃料,电是算力的燃料。在大家追逐更大模型、更强智能的时候,这道最底层的约束,可能比算法本身更早撞上天花板。

    数据中心与电力消耗
    图片来源:TechCrunch / Bloomberg via Getty Images

  • Anthropic 15亿美元版权和解获批:作家拿到钱,AI公司却赢麻了

    一笔刷新版权史的天价赔偿

    上周一,美国一名联邦法官正式批准了 Anthropic 与一群作者、出版商达成的 15 亿美元(约 108 亿元人民币)和解协议。这是美国版权史上金额最大的一笔和解,覆盖大约 50 万部作品,平均每一部书赔 3000 美元。表面看,写书的人终于从 AI 公司手里讨到了一笔钱。

    但把这个案子拆开看,真正笑到最后的可能不是作家。这场官司的核心争议其实只有一句话:用受版权保护的书籍去训练 AI 模型,到底合不合法。

    主审的 Alsup 法官给出的回答是:训练本身属于「合理使用」(fair use),只有「偷书」这件事违法。

    也就是说,法院把「训练 AI」和「获取数据的方式」切成了两件事。Anthropic 建训练库时有两条路:一条是花钱买书自己扫描,这条路没问题;另一条是从 Library Genesis、Pirate Library Mirror 这类盗版站点直接下载,这条路被法官认定违法。Anthropic 愿意认栽赔钱,是为了避免盗版那部分真的上法庭——万一陪审团开出天文数字的赔偿,可比这 15 亿疼多了。

    作家为什么高兴不起来

    很多作者和创作者并不觉得这是一场胜利。原因很直接:判决确认了「用版权书训练 AI 算合理使用」这一点,等于给整个行业发了一张通行证。以后 Google、Meta、OpenAI、Midjourney 再被起诉,都可以拿这个判例当挡箭牌。

    更要命的是,Anthropic 选择和解而非上诉,意味着这个案子永远走不到上诉法院,也就没法变成一个有约束力的先例。其他法官在别的事实下,照样可以给出完全不同的结论——事实上,类似的官司正在四处开花。

    • 就在一周前,Hachette、Cengage、Elsevier 等出版商连同作家 Scott Turow,又把 Google 告上了法庭,指控后者用他们的版权作品训练 Gemini。
    • Meta、OpenAI、Midjourney 也各自背着一堆版权诉讼,案子一件没少。
    • 部分作者和出版商还选择退出了这次和解、单独起诉 Anthropic,认为每本书 3000 美元根本不够。

    AI 公司为什么不慌

    对 Anthropic 来说,15 亿美元看着吓人,但公司前不久刚又融了 130 亿美元。比起可能高达数百亿甚至上万亿的盗版侵权赔偿风险,这笔钱更像买个安稳。Anthropic 的总法律顾问也直言,这次和解恰恰证明了「用书籍训练 AI 属于合理使用」这一立场站得住脚。

    站在这个节点回看,这场和解更像是 AI 公司与内容创作者之间力量对比的一次公开亮相:模型需要数据,而数据快被扒光了,公司宁愿花钱摆平「怎么拿的数据」,也不愿让「能不能拿」成为问题。写作者拿到的是补偿,失去的却是对自己作品的控制权。

    Anthropic 的 Claude 形象
    图片来源:TechCrunch / Westend61 via Getty Images