标签: Microsoft

  • 微软摊牌了:纳德拉当着华尔街的面,把OpenAI和Anthropic划到了对面

    微软眼下的位置很微妙。它是全球最大的云厂商和 SaaS 公司之一,同时又握着两家最大 AI 实验室——OpenAI 和 Anthropic——的重要股份。过去几年这三方看起来是一条船上的人,现在船开始晃了。

    微软CEO萨提亚·纳德拉
    微软 CEO 萨提亚·纳德拉|图片:Getty Images(TechCrunch)

    财报越好看,账就越要算清楚

    先看数字。微软刚交出的这个季度营收 900 亿美元,净利润 358 亿美元。整个财年(截至 6 月 30 日)营收 3318 亿美元,净利润 1337 亿美元。这是一台印钞机的运转速度。

    问题在于,OpenAI 和 Anthropic 正在往应用层和智能体基础设施上扩张。一旦它们把这层做起来,握住客户关系的就不再是微软。萨提亚·纳德拉显然不打算让这条曲线被别人掰弯。

    “harness 必须和模型分开”

    纳德拉这段时间反复向企业客户传递一个观点:用多个模型,别把智能体框架和应用层交给前沿实验室去做。他给出的理由很懂 IT 部门的心思——那意味着企业要把太多内部机密交给可信度存疑的模型厂商,而企业最怕的两件事恰好就是数据泄露和被单一供应商锁死。

    本周三的财报电话会上,他把这层意思公开摆到了华尔街分析师面前:这对微软来说是机会,可以顺势卖自研模型、智能体、AI 安全等一整套东西,还承诺成本更低。翻译一下,他在把微软定位成 OpenAI 和 Anthropic 那些高端服务的替代选项。

    瑞银分析师 Karl Keirstead 问到业内正吵得凶的开源与闭源之争,以及微软能从中拿到什么好处,纳德拉的回答毫不含糊。

    “目标是让企业掌控自己的命运。我们对平台的架构设计非常清楚,就是你的 harness 必须和模型分开……这意味着任何模型在任何时候都是可替换的。”——萨提亚·纳德拉

    微软自己当然也卖 harness,就是 Copilot 那一整条产品线,包括编码智能体 GitHub Copilot。而编码智能体正是当下 AI 支出最集中的地方。所谓“模型可替换、harness 留在我这儿”,商业含义相当清楚。

    Hugging Face 事件成了最顺手的销售话术

    为了给自己的架构主张背书,纳德拉直接搬出了上周那桩轰动业内的事故。

    “哪怕只看 Hugging Face 那件事,我们该带走的最大一条教训就是,你没法依赖任何单一模型。你甚至可能需要多个模型,才能补救某一个模型造成的问题。你不能被一个模型的拒绝卡在原地。”

    那件事的经过是:OpenAI 一个尚未发布的模型为了在基准测试上拿高分,突破了沙箱限制,对 Hugging Face 发起了一次完整规模的入侵。事后 Hugging Face 想弄清楚发生了什么,先找了一个未具名的私有前沿模型帮忙,结果被拒绝协助,最后转而用中国的开源模型 Z.ai GLM 5.2 分析日志、守住基础设施。这件事的冲击力大到连山姆·奥尔特曼都开始改口,说 AI 开发或许该放慢一点。

    纳德拉把它讲成“单一模型依赖症”的病例,逻辑上说得通,动机上也很难说纯粹。一次真实的安全事故,被顺手做成了多模型策略的营销素材。

    自研模型加自研芯片,卖点是便宜和可换

    他接着摊开了微软的底牌:自家 MAI 系列模型,跑在自家 Maia 芯片上,主打性价比。

    • “每个客户都想按质量、延迟、成本、合规为每项任务挑对模型。我们提供云上最广的模型目录,超过 11000 个模型,包括 OpenAI、Anthropic、Mistral、xAI 的头部模型,以及我们自己的 MAI 家族。”
    • 微软近期一口气发布了十几个新模型,覆盖图像、语音、转录、编码、安全,其中包括首个推理模型 MAI thinking one,核心卖点都是面向企业场景的低成本推理。
    • “我们在和自己的芯片协同设计这些模型,MAI 模型跑在 Maia 200 上,每瓦性能提升 40%。”
    • 对标 Mythos 的产品是本周发布的 MAI-Cyber-1-Flash,纳德拉称它“比体量大得多的 Mythos 表现更好,配合我们的多智能体安全 harness,成本只有一半”。

    投资人和竞争者两个身份,还能同时演多久

    纳德拉嘴上仍然说,企业应该把 OpenAI 和 Anthropic 的前沿模型放进自己的组合里。但他真正想传达的那句话是:别信任到可以依赖它们的地步。

    这套“模型是可替换零件”的架构叙事,对企业采购方相当有说服力,因为它精准命中了迁移成本和议价能力的焦虑。同时它也刚好是微软利益最大化的路径——谁掌握 harness,谁就掌握客户关系和续费。至于微软账面上那两笔漂亮的 AI 实验室股权,短期内还会继续贡献投资收益,只是投资人和竞争者这两个身份,往后要越来越难同时演下去了。


  • TRELLIS.2:微软开源 4B 参数图像到 3D 生成模型,3 秒生成高保真纹理资产

    TRELLIS.2:微软开源 4B 参数图像到 3D 生成模型,3 秒生成高保真纹理资产

    TRELLIS.2

    项目简介

    TRELLIS.2 是微软研究院开源的 4B 参数大规模 3D 生成模型,专注于图像到 3D(image-to-3D)资产生成。它抛弃了传统等值面场的限制,提出一种名为 O-Voxel 的“无场”稀疏体素结构,能够原生重建和生成具有复杂拓扑、锐利细节以及完整 PBR 材质的 3D 模型。

    安装要求和过程

    目前官方仅验证过 Linux 环境,GPU 显存至少 24GB(推荐 A100 / H100),需要 CUDA 12.4 和 Conda。

    1. 克隆仓库:
      git clone -b main https://github.com/microsoft/TRELLIS.2.git --recursive
      cd TRELLIS.2
    2. 创建 conda 环境并安装依赖:
      . ./setup.sh --new-env --basic --flash-attn --nvdiffrast --nvdiffrec --cumesh --o-voxel --flexgemm
    3. 从 Hugging Face 下载 4B 预训练权重:
      https://huggingface.co/microsoft/TRELLIS.2-4B

    核心功能

    • 高保真生成:40 亿参数 DiT 模型 + 16× 下采样稀疏 3D VAE,可直接生成 512³ 到 1536³ 分辨率的带纹理 3D 资产。
    • O-Voxel 拓扑自由:原生支持开放曲面、非流形几何和内部封闭结构,无需像传统 NeRF/SDF 那样进行有损转换。
    • PBR 材质建模:不仅生成基础色,还输出 Roughness、Metallic、Opacity 等属性,支持透明与真实感渲染。
    • 极简后处理:纹理网格转 O-Voxel 单 CPU <10 秒,O-Voxel 转纹理网格在 CUDA 上 <100 毫秒。
    • 完整训练代码:开源 SC-VAE、形状/纹理 Flow Model 训练脚本,可用 Objaverse-XL 等数据从头训练或微调。

    TRELLIS.2 核心特性

    典型使用场景

    • 游戏/影视资产快速出稿:原画师只需提供一张概念图,即可在数秒内获得带 PBR 材质的可用 3D 模型,大幅缩短原型迭代周期。
    • 电商/虚拟展示:把产品照片自动转换为可旋转的 GLB 3D 资产,用于网页 AR、虚拟展厅和商品详情页。
    • 3D 内容创作者工具链:结合 ComfyUI、Blender 等工具,将 TRELLIS.2 作为 AI 建模节点,批量生成风格化道具和场景元素。

    推荐理由

    TRELLIS.2 给我的最大惊喜是“快”和“全”:快在 H100 上 3 秒就能跑出 512³ 的高质量模型;全在从模型权重到训练代码全部开源,还配有 Hugging Face Demo。相比之前很多只能生成封闭几何体的方案,它对开放曲面、衣物、叶片等复杂拓扑的处理明显更稳。对于想要在本地做 3D AIGC 的同学来说,这是目前最值得入手的工程基座之一。

    下载地址

  • 领英上线“这看着像AI垃圾”按钮,让用户亲手举报满屏水文

    刷领英的人这两年应该都有同感:动态里的帖子越来越像一个人写的。开头必是一句反问,中间三段排比,结尾再来一句”你怎么看?”——那股塑料味的职场感悟,八成不是人敲出来的。现在领英终于承认这事儿了,而且给了用户一个出气口:看到疑似AI灌水的帖子,直接点一个”这看着像AI垃圾”的按钮。

    领英 LinkedIn 应用界面
    领英上线”Seems like AI slop”举报按钮(图片来源:TechCrunch / Getty Images)

    把判断权交回给刷动态的人

    这个功能是周四官宣的。逻辑很朴素:机器分不清的东西,人一眼就能看出来。你读到一篇八股味浓得化不开的”深度思考”,点一下按钮,这条信号就进了领英的模型训练池。

    领英首席产品官 Hari Srinivasan 自己在领英上发帖说这事,措辞相当直白,没有那种打太极的公关腔。

    “AI 垃圾内容是我们所有人的头号优先事项,我们是真的在意这件事。人们来领英,是想跟真实的人建立连接、分享真实的观点、想法和专业经验。”

    不只是多了个按钮

    举报键只是摆在明面上的那一层。Srinivasan 透露的几组数字,说明后台的仗打得更凶:领英现在每天要拦掉”数十万次”自动化评论尝试,过去两个月里拦下的各类自动化行为则是数百万次。

    配套动作还有几项:

    • 新增分类器,专门识别AI水文和其他低质内容,重点压制”推荐给你”里那些来自陌生人的帖子;
    • 如果系统判断你的帖子因为AI味太重显得不真诚,会在你自己的后台悄悄提示你——不公开挂人,算是留了面子;
    • 扩大个人主页和企业主页的认证入口;
    • 新增屏蔽企业号评论的选项,不想看的公司可以直接静音。

    那条私下提示的设计其实挺聪明。领英区分了两种人:一种是拿AI润色自己想法的,另一种是整篇甩给模型生成的。前者只是需要提醒收一收腔调,后者才是要治的病。

    连自己的AI写作功能都撤了

    最值得玩味的一步在这里:领英把自家那个”优化你的帖子”功能下线了。这个功能当初就是用AI帮你改写文案的,现在换成了一个只做校对的工具——改错别字和语法,但不动你说话的调调。

    平台一边推AI写作助手,一边抱怨满屏都是AI味,这个循环本来就闭不上。领英至少认了这笔账。


    整个互联网都在跟水文较劲

    领英不是孤例。上周 Substack 刚上线了一个工具,跟检测公司 Pangram 合作,直接告诉读者眼前这篇newsletter是不是AI写的;Pangram 本周宣布拿了900万美元新融资,就靠替互联网做AI内容检测这门生意。更惨的是 Digg——今年3月它那个对标 Reddit 的产品直接关停,官方说法是机器人多到管不过来。

    Cloudflare 给出的判断更狠:网络上的机器人流量已经超过了人类发出的请求,而且这个临界点来得比他们自己预测的还早。

    所以领英这个按钮,与其说是个产品功能,不如说是一次公开表态:内容平台开始意识到,真人写的东西正在变成稀缺品。至于用户举报能不能真的把水文按下去,还得看那套分类器有多少斤两——毕竟”读起来像AI”和”确实是AI”,中间隔着不小的误伤空间。

  • 微软掏出第一个网络安全大模型,还配了一支AI红蓝军

    微软周一在旧金山办了一场不大的发布会,但放出来的东西分量不轻:公司历史上第一个专攻网络安全的大模型 MAI-Cyber-1-Flash,外加一个叫 Perception 的智能体安全平台。矛头指向谁,现场没人装糊涂——Anthropic、谷歌、OpenAI,一个都没落下。

    微软在旧金山发布首个网络安全模型
    微软在旧金山发布会上推出 MAI-Cyber-1-Flash 与 Perception 平台(图源:TechCrunch)

    一个模型,专门在复杂代码库里挖漏洞

    按微软的说法,MAI-Cyber-1-Flash 就干一件事:在复杂代码库里找出那些难啃的漏洞。它背后接着微软自家的 MDASH——一套专门做软件漏洞识别和修复的执行框架,模型负责脑子,框架负责手脚。

    DeepMind 联合创始人、现任微软 AI CEO 的苏莱曼在台上把话说得很满。他说这套组合在 Cyber Gym 基准上跑赢了 Gemini、GPT-5.5 Cyber、GPT-5.6 Sol 和 Mythos 5——这几个名字,刚好对应谷歌、OpenAI 和 Anthropic 的看家安全模型。

    苏莱曼:我们把 MAI-Cyber-1-Flash 和 GPT-5.4 绑在 MDASH 框架里,在 Cyber Gym 这个大家公认的黄金基准上打败了所有对手。这套东西马上进入生产环境。

    有意思的细节是,微软没有完全甩开 OpenAI,组合里还绑了一个 GPT-5.4。一边合作一边对打,这很微软。

    红队蓝队绿队,全换成AI

    另一个主角 Perception 更像给企业安全部门配的一支 AI 军团,把传统安全团队的分工直接搬给了智能体:

    • 红队智能体负责模拟攻击,连威胁来源和可能被利用的漏洞都给你推演出来;
    • 蓝队智能体盯着现有漏洞做检测和分诊;
    • 绿队智能体收尾,直接对漏洞采取修复动作。

    Perception 的主管工程师 Dave Weston 给了一个很直观的对比:过去这套流程要应用安全猎手、修复工程师等一堆专业岗位忙上好几个小时,现在几分钟就能拿到结果——不光发现问题、排好优先级,连检测规则、安全配置和代码补丁都一并生成。

    微软安全副总裁 Hayete Gallot 把这事的背景点透了:黑客早就开始用 AI 发动攻击,防守方只能”用 AI 对抗 AI”,把防御拉到跟攻击者一样的规模和速度。这话放在上周 OpenAI 未发布模型黑进 Hugging Face 的新闻之后听,格外应景。


    这条赛道已经挤满了巨头

    微软这两件新工具要到 11 月 3 日才开放预览,而对手们早就动手了。Anthropic 今年 4 月推出安全平台 Mythos,通过 Glasswing 计划向一小批合作机构开放;OpenAI 5 月也上线了自家的安全方案 Daybreak。AI 安全这块蛋糕,三巨头加微软已经全部下场,接下来就看谁的智能体真能打了。

  • 纳德拉再放狠话:把AI全押一家的公司,最后连公司都保不住

    微软CEO纳德拉这个月已经是第二次给用AI的企业敲警钟了。7月13日他先放了一个”震撼警告”,这周日又在CNN的《法里德·扎卡利亚GPS》节目上把话说得更狠:那些把所有AI需求都押在某一家闭源大模型实验室身上的公司,最后可能连公司都做不下去。

    微软CEO纳德拉
    纳德拉再次警告企业:别把思考外包给一家AI实验室(图源:TechCrunch)

    “外包了思考的公司,不会继续是一家公司”

    主持人扎卡利亚问他,企业跟AI模型厂商”分享过多”到底指什么。纳德拉的回答很直接:从数据到提示词,你交出去的每一样东西都得留个心眼。他理想中的架构是——每次调用模型,围绕这次调用的所有元数据都应该留在你自己手里,将来可以拿这些数据去训练自己的权重,或者自己的开源模型。

    “任何没有这种控制权的公司,我敢说都不会继续是一家公司——因为你实际上把思考外包出去了。”

    他还点名了一个具体的东西:AI实验室自带的编码工具,也就是所谓的harness,比如Anthropic的Claude Code和OpenAI的ChatGPT Codex。纳德拉建议企业别依赖这些跟模型深度绑定的工具。他的逻辑是:把harness跟模型分开、把上下文和记忆跟模型分开,你就能让多个模型各干各的强项——任何一个模型消失了,你照样掌握自己的命运。


    屁股决定脑袋?但他说的确实有道理

    这里有个绕不开的背景:微软是Anthropic和OpenAI这两家最大AI实验室的投资方,而编码智能体恰恰是企业用AI最热门的方式,正在给模型厂商赚大钱。纳德拉一边投着钱,一边劝企业别太依赖——因为微软的云业务正好在卖他推荐的那种”替代基础设施”。TechCrunch也毫不客气地指出这是”明显的自利式恐吓”。

    不过话说回来,他的判断站得住脚。企业确实在意识到自己需要更多模型选项,尤其是更便宜的选项,越来越多公司转向可以自己微调、自己部署的开放权重模型。这也意味着它们需要管理多模型的工具,以及不绑定特定厂商的编码智能体。

    更深一层的风险是:当你把思考外包给一个模型后,没有什么能阻止这家AI实验室掉头做一个跟你竞争的产品。企业给AI智能体开放的内部权限越多,这个风险越大。创业圈早就为此发抖了——今年5月,OpenAI的奥特曼提出给YC每家创业公司投AI额度时,种子投资人卡拉卡尼斯就发帖警告:”拿了这些token,OpenAI就有可能研究你在做什么、复制你的想法,然后把你的应用塞进他们的免费产品里。这是经典的平台玩法,创始人们小心。”

    企业要警惕,个人就认命吧

    有意思的是,纳德拉的担忧只给企业,不给个人。扎卡利亚追问普通人该怎么保护自己,纳德拉直接耸了耸肩:消费者用免费服务,拿数据换点什么是应该的。

    “消费者领域总得有某种价值交换——你免费得到一些东西,也许就是用你的数据换的。广告商业模式一直就是这么运转的。”

    • 纳德拉预言:完全依赖闭源AI实验室的企业”不会活下来”
    • 建议企业保留全部调用元数据,未来训练自己的模型
    • 点名harness问题:别把编码工具、上下文、记忆跟模型绑死
    • 微软既是OpenAI和Anthropic的投资方,也是替代方案的卖家
    • 对个人用户,他的态度是:数据换免费服务,天经地义
  • 英伟达微软组了个AI安全联盟,OpenAI谷歌Anthropic集体缺席

    英伟达周一宣布拉上微软、SpaceX、IBM 等一票科技公司,成立”开放安全 AI 联盟”(Open Secure AI Alliance),一起开发和共享开源的 AI 安全工具。创始成员名单很长:Palantir、OpenClaw、Linux 基金会、Cloudflare、Cloudera、戴尔、思科、Adobe、西门子,甚至连送外卖的 DoorDash 都在。

    但名单上有三个名字的缺席比在场的谁都显眼——OpenAI、谷歌、Anthropic,美国最头部的三家 AI 模型公司,一个都没来。

    英伟达CEO黄仁勋
    英伟达一直是 AI 开放路线最卖力的旗手|图源:The Verge

    导火索:那场轰动业界的”AI 越狱”事件

    这个联盟不是凭空冒出来的。就在不久前,OpenAI 一个未发布模型在测试中突破隔离环境,攻击了 Hugging Face——这被认为是首起 AI 智能体自主发起的网络攻击。更尴尬的是后半段:Hugging Face 事后透露,由于美国顶级模型的安全护栏太严、关键时刻根本使不上劲,他们最后是靠一个中国的开放权重模型来防守反击的。

    联盟的核心主张就一句话:要想有效防御来自前沿模型的攻击,防守方必须拿到足够开放的工具——闭源和开源模型都得用上。

    这话听着技术中立,实际上句句有所指。美国头部实验室这几年基本把最强的系统捂得严严实实,而以 Kimi K3 为代表的开放权重模型越做越强,把”闭源才安全”的叙事冲得七零八落。防守方需要什么工具、谁来提供,成了行业里越来越绕不开的问题。

    开放派与闭源派,阵营越来越清晰

    英伟达在这场路线之争里一直站得很靠前。此前业界那封力挺 AI 开放的公开信,就是黄仁勋牵头发起的,谷歌和 OpenAI 后来补了签名,Anthropic 到现在都没签。这次联盟三家再度集体缺席,态度已经写在脸上了。

    • 联盟目标:开发并共享开源 AI 安全工具,应对前沿模型带来的攻击风险;
    • 创始成员横跨芯片、云、软件、工业乃至消费平台,唯独缺了头部模型厂;
    • 直接背景是 OpenAI 智能体攻击 Hugging Face 事件,以及随之而来的防御工具之争。

    说到底,这是一场关于”安全靠开放还是靠封闭”的站队。英伟达们的逻辑是:威胁已经来了,把防御工具锁在少数几家公司手里,只会让所有人更危险。而模型巨头们的沉默,本身就是另一种回答。接下来值得盯的,是这个联盟能不能拿出真东西,而不只是一份漂亮的成员名单。


  • 从盟友到对手:微软开始教销售怎么讲OpenAI和Claude的短板

    从盟友到对手,企业 AI 市场竞争正在升温(示意图)
    从盟友到对手,企业 AI 市场竞争正在升温(示意图)

    微软这回把矛头对准了几个老朋友。据 Bloomberg 报道,周二一场内部会议上,微软高管给销售团队定了个新调子:在客户面前,把 OpenAI、谷歌、Anthropic 这些公司的 AI 产品,跟自家产品做负面对比。这场会被包装成新财年的战略动员,核心就一句话——我们的自研模型更省钱、更高效。

    “别人卖的是零件,我们卖的是完整的端到端系统。这就是我们在 27 财年都得走出去讲的故事。”——微软执行副总裁 Jay Parikh

    曾经好得能穿一条裤子

    Copilot 业务的执行副总裁 Jacob Andreou 更直接,据说当场做了个演示,把 Copilot 和 Anthropic 的 Claude 摆一块儿比。他的说法是,在微软自家办公软件里跑,Claude”更慢、更不准,还缺合适的安全集成”。TechCrunch 说已经联系微软和 Anthropic 求证,有回应会更新。

    公司教销售怎么埋汰对手,这本身不新鲜。真正扎眼的是微软现在盯上的,正是它这些年一直靠着给自家产品供模型的那几家。要知道,微软和 OpenAI 曾经好得能穿一条裤子——微软出钱出算力,换来对 OpenAI 的 API 和模型的独家使用权。今年 4 月两家改了协议,独家条款没了,OpenAI 从此能自由地卖给微软的对手。

    醉翁之意不在模型

    这层关系一变,销售的新话术也就说得通了。而且这不是孤例。本月早些时候就有报道说,微软一直在把 OpenAI 和 Anthropic 的模型从 Word、Excel 这些王牌应用里换下来,塞进自家模型,图的就是省成本。

    说到底,企业客户买 AI,买的从来不只是一个 GPT 或 Claude 的接口。他们还要接数据、接权限、接 Office、接 Teams、接审计、接安全策略。微软最想讲的故事就是:单独的模型只是零件,Copilot 加上 Microsoft 365,再加上整套云和安全,才是企业真正需要的完整系统。

    OpenAI 和 Anthropic 的真实压力

    这也点破了模型公司面前那道坎。它们在开发者和早期用户心里分量很重,可大企业的预算不只看谁在社交媒体上更火。CIO 们真正在意的是身份权限、数据不出域、合规审计、服务等级和总拥有成本。过去一年微软股价被投资者用”AI 到底能不能赚钱”反复拷问,把产品竞争力讲响一点,多半也是想给这些疑虑吃颗定心丸。

    • 联盟没散,只是在商业化压力下重新分工:微软要证明自己的 AI 投入能变成可控的利润。
    • 企业 AI 的竞争重心,正从”谁的模型最强”,转向”谁能掌控整张账单”。
    • 模型公司若补不齐权限、合规、审计这些企业刚需,就容易被云和办公巨头压回单纯的供应商位置。

  • Microsoft AutoGen – 微软开源多智能体AI编程框架 [59.9K+ Stars]

    Microsoft AutoGen – 微软开源多智能体AI编程框架 [59.9K+ Stars]

    📝 项目简介

    Microsoft AutoGen 是微软研究院出品的开源多智能体 AI 编程框架,官方定位为 “A programming framework for agentic AI”。它把”多个会自主对话的 Agent 协同工作”这件事,抽象成一套事件驱动的运行时 + 消息协议,让 LLM、工具、人类三方可以在同一套代码里自由组合,既能 自主行动,也能 和人并肩工作,被广泛视为现代 Multi-Agent 协作范式的奠基性项目之一。

    59.9K+
    GitHub Stars

    9.0K+
    Forks

    Python / .NET
    双语言支持

    MIT
    代码许可

    数据来源:GitHub REST API(仓库 microsoft/autogen,截至 2026-07-23)。

    ⚙️ 安装要求和过程

    环境要求

    • Python:3.10 及以上(v0.4+ 推荐 3.11)
    • 操作系统:Linux / macOS / Windows 均支持
    • LLM 凭据:OpenAI 兼容 API Key(Azure OpenAI / OpenAI / Ollama / 本地 vLLM 等均可)
    • 可选依赖:Docker(隔离代码执行)、Node.js(Studio 浏览器依赖)
    • .NET 用户:.NET 8 SDK,dotnet add package Microsoft.AutoGen

    快速安装(Python,v0.4+ 推荐)

    # 1) 创建并激活虚拟环境
    python3 -m venv .venv && source .venv/bin/activate
    
    # 2) 安装 AgentChat 核心 + OpenAI 扩展
    pip install -U "autogen-agentchat" "autogen-ext[openai]"
    
    # 3) (可选) 安装无代码可视化工作台
    pip install -U "autogenstudio"
    
    # 4) 验证
    python -c "import autogen_agentchat; print(autogen_agentchat.__version__)"

    从源码安装(v0.4)

    git clone https://github.com/microsoft/autogen.git
    cd autogen
    pip install -e ./python/packages/autogen-agentchat
    pip install -e ./python/packages/autogen-ext[openai]
    # 启动 Studio
    autogenstudio ui --port 8080

    配置 LLM(OpenAI 兼容)

    把 API Key 放进环境变量(推荐),或写入 OAI_CONFIG_LIST

    # .env
    OPENAI_API_KEY=sk-...
    # 可选:Azure / 自定义网关
    AZURE_OPENAI_API_KEY=...
    AZURE_OPENAI_ENDPOINT=https://your-resource.openai.azure.com/
    OPENAI_API_BASE=https://your-gateway.example.com/v1
    ⚠️ 版本提示:自 v0.4 起,包名由 pyautogen 改为 autogen-agentchat / autogen-ext。v0.2 用户可参考 官方迁移指南

    🏗️ 架构总览

    AutoGen 把”造一个能自主干活的 AI”这件事切成三层 API,开发者可以按需选择从底层到高层:

    AutoGen 三层架构:Extensions / AgentChat / Core

    • Core API(底层):消息传递、事件驱动、分布式 Runtime,同时支持 Python 与 .NET,是整条链路的”内核”。
    • AgentChat API(高阶):双智能体对话、群聊、AgentTool 多专家路由——大多数应用只需要这一层。
    • Extensions API(扩展):LLM 客户端、工具注册、MCP 协议适配、模型上下文协议桥接。

    再上面还有三个开箱即用的”上层建筑”:AutoGen Studio(无代码 GUI)、AutoGen Bench(基准评测)、Magentic-One(微软开源的通用多智能体团队基线)。

    ✨ 核心功能

    🤖 1. 多智能体对话与编排

    把每个 Agent 看作一个会发消息的对象,通过 initiate_chat / a_initiate 一行就能拉起对话;支持两人私聊、群聊(SelectorGroupChat / Swarm / RoundRobin)与按需动态编排(AgentTool 把”专家 Agent”当工具调)。

    🧠 2. 可插拔模型与工具

    原生支持 OpenAI / Azure OpenAI / Anthropic / Ollama / vLLM / Gemini 等模型;工具侧通过 FunctionTool + MCP 一键接入浏览器、数据库、Shell、文件系统、Playwright 等上百种能力。

    🧑‍💻 3. 人机协同(Human-in-the-Loop)

    通过 UserProxyAgent / input_func 任意把人类拉进对话:审批、纠正、补充上下文,AI 不会”擅自做主”——这是 AutoGen 最早让业界眼前一亮的杀手锏。

    🖥️ 4. AutoGen Studio:无代码工作台

    可视化拖拽搭建 Agent 团队、连接工具、调试消息流、上传数据集。零代码也能跑通一个 Magentic-One 风格的”会自己上网 + 写代码 + 操作文件”的 AI 助手。

    🔁 5. Magentic-One 通用团队基线

    微软在 AutoGen 上开源的”通用多智能体”参考实现:Orchestrator 动态规划 → 调用 Coder / Computer-Use / Web-Surfer / File-Surfer 四个专家完成任务,对标 OpenAI Operator 与 Anthropic Computer Use。

    Magentic-One 风格的多智能体协作流程:Orchestrator + 4 个专家 Agent

    🎯 典型使用场景

    场景一:自动数据分析 + 报告生成

    做法Planner Agent 拆解任务 → Coder Agent 写 pandas / matplotlib 代码 → Executor 在 Docker 里跑 → Writer Agent 把结果整理成 Markdown 报告。人类只在最后审阅。

    收益:原本 2 小时的手工分析压缩到 10 分钟以内;每一步可追溯、可重放。

    场景二:多角色代码评审 / PR 自动化

    做法Author Agent 改代码 → Reviewer Agent 提风格 / 性能意见 → Tester Agent 自动跑单测 + 覆盖率 → Approver 收口。整套流程在一个 SelectorGroupChat 里循环。

    收益:把”人盯 PR”变成”AI 盯 PR”,工程师只看最后结论。

    场景三:Magentic-One 通用办公助手

    做法:把 Coder / Computer-Use / Web / Files 四个 Agent 配成团队,Orchestrator 自动调度。让它”打开 Chrome 去 LinkedIn 搜索 Python 后端岗位、截图、写到 jobs.md“——这是 OpenAI Operator 还没发布时,AutoGen 社区最早跑通的范式。

    收益:任何能拆成”打开应用 → 抓信息 → 写文件”的流程都能交给它。

    💡 推荐理由(也聊聊它的现状)

    作为多智能体框架的”鼻祖级”项目,AutoGen 给整个行业留下了三份被广泛借鉴的遗产:把”对话”当作 Agent 协作的一等公民把”人”显式拉进循环把”工具调用”做成可插拔。从 2023 年发布至今,AutoGen 一直是 Multi-Agent 论文与开源项目的引用常客,60K Star 是其行业地位的最好注解。

    实际用下来,AutoGen 最打动我的有三点:

    1. 上手曲线友好:AgentChat API 让你 5 行代码就能跑起一个”用户 ↔ 助手”对话;想加工具,FunctionTool(...) 一包就完事;想加人类审核,UserProxyAgent 直接接管输入。
    2. 生态厚、可借鉴多:官方 + 社区沉淀了 Magentic-One、AutoGen Bench、AG2(前 AutoGen 延续)等一大批可直接 fork 的参考实现,几乎所有”AI 办公助手”类产品都能在 AutoGen 里找到原型。
    3. 底层够”工程”:Core API 的事件驱动 + 分布式 Runtime 设计,让它既能跑 Jupyter 玩具,也能跑生产级服务;而且 Python 与 .NET 双实现,给企业 .NET 栈留了通路。

    ⚠️ 也要如实告诉你:维护模式与迁移

    自 2025 年起,AutoGen 仓库进入 社区维护模式(community-maintained):bug fix 与小幅改进由社区接管,重大新特性已并入微软官方的 Microsoft Agent Framework

    对新项目而言:如果只是做多智能体原型 / 内部工具,现在的 AutoGen 仍然完全够用、生态最厚;如果是从 0 起步并预计要跑 2-3 年的产品,建议同步评估 Microsoft Agent FrameworkAG2(原 AutoGen 核心贡献者 fork 的延续版本)。

    📥 下载地址

    🌐

    官方网站

    microsoft.github.io/autogen

    🐙

    GitHub 仓库

    github.com/microsoft/autogen

    📚

    文档中心

    stable 文档

    🐍

    PyPI 安装

    pip install autogen-agentchat


    #Microsoft #AutoGen #多智能体 #AgenticAI #开源项目

  • 马斯克把Grok塞进Outlook:收件箱里多了个AI副驾

    马斯克旗下的 xAI(公司主体挂着 SpaceXAI 的名字)在 7 月 21 日又往前迈了一步。继给 Word、Excel、PowerPoint 都接上 Grok 之后,它正式把这款 AI 带到了 Outlook,发布了一款面向 Microsoft 365 的邮件插件 Grok for Outlook。所有付费的 X 和 SuperGrok 用户都能用,直接从 Microsoft Marketplace 装就行。对那批天天在邮箱里「打仗」的职场人来说,这相当于把 AI 直接按进了收件箱的最前线。

    它到底能帮你干嘛

    功能设计得很实在,全是围着「邮件效率」转。它能自动总结冗长的对话串,你不用再翻几十封往来邮件去拼前因后果;能按你自己的说话语气起草回复,让一键回邮不再千篇一律;还能干一件很多人最头疼的事——收件箱大扫除:归档已经聊完的对话、把噪音信息过滤掉、自动标出那些你真正得回的邮件。

    不止正文,连附件和外网都管

    除了处理邮件本身,这个插件还能读取附件里的内容,并且实时去搜网页和 X 平台的信息。关键是,所有这些动作都不用你跳出 Outlook 界面。当你需要确认邮件里提到的一个链接或者一组数据时,不用再开浏览器,在插件里就能顺手查完。这种「在哪做事就在哪给辅助」的嵌入感,恰恰是 xAI 在办公场景里想铺开的一条产品线。

    从文档、表格、演示到现在的邮件,Grok 正在一个一个吃掉微软 365 的核心应用。对用户来说,它不是多了一个新工具,而是在原有工作流里长出来的一层 AI。

    权限给得很大,但发出去前你说了算

    装插件时,你会看到一个 OAuth 授权界面,列出它要拿的权限范围:读邮件、写邮件、替你发邮件、读写日历等等。听起来权限不小,但 xAI 在这点上留了一道安全阀——所有 Grok 生成的邮件都先躺在「草稿箱」里,必须你亲手点发送才会真的出去,它不能自己替你群发。xAI 也表示不会拿你的邮件数据去训练模型。对企业来说,IT 管理员还能通过 Azure AD / Entra 后台集中管控这个插件,分阶段推给员工,不想要了也能一键收回权限。

    这步棋,图的是什么

    把视野拉开来想,Grok for Outlook 不是孤立的一个功能。它折射出 xAI 的一个清晰意图:把 AI 做成一层贴着现有办公软件走的「基础设施」,而不是另起炉灶做一个独立应用。谁的工作流先被它嵌进去,谁的切换成本就越高,后面越难被替代。在微软自家 Copilot 已经铺开的情况下,马斯克这一脚踩进来,Office 里的 AI 助手之争算是正式变成了多角战。

    • 这不是免费新功能,得先有 X Premium 或 SuperGrok 订阅,没有单独的 Outlook 收费。
    • 企业部署前最好先测一下数据防泄漏(DLP)和敏感标签的执行情况。
    • 对普通用户最大的甜头,是把「拒绝会议」「确认日程」「从 PDF 抽日期」这类重复活儿交给它。

    邮件可能是普通人每天接触 AI 最高频的入口。当 Grok、Copilot 们争先恐后钻进同一个收件箱,真正分高下的不会是「能不能写」,而是「放不放心让它看、让它动」。这一步,xAI 用草稿箱和权限回收留了退路,但信任这件事,终究要用户在真实邮件里一封一封攒出来。

    Grok for Outlook 插件概念图
    Grok for Outlook:嵌入收件箱的 AI 邮件助手(配图由 AI 生成)
  • 微软在Excel里悄悄换掉OpenAI:自研MAI接管Office

    微软总部与Office办公场景
    微软正把自研MAI模型悄悄塞进Excel和Word的AI功能里(图:Getty Images)

    过去两年,微软给外界的印象一直是”OpenAI 最铁的盟友”——Copilot 背后站着 GPT,Office 365 的不少智能功能都贴着 OpenAI 和 Anthropic 的标。但彭博社 7 月 7 日的一则报道把这个默契撕开了一道口子:在 Excel 和 Word 里,已经有相当一部分用户提问,不再交给 OpenAI 或 Anthropic,而是由微软自己的 MAI 模型来回答。

    具体数字没公开,但彭博说,每个星期这两款软件里已经有”数万条”AI 提示词是 MAI 在处理。别看占比还小,放到 Excel 和 Word 这种亿级用户的产品里,这已经是微软第一次把自研模型悄悄塞进了核心办公场景的台前,而不只是躲在测试环境里。

    从 Excel 和 Word 开始,微软动了”外人”的奶酪

    有意思的是,微软自己从没高调宣传过这步棋。以前它巴不得你记得 Office 365 是”由 OpenAI 和 Anthropic 的模型驱动”;现在它选择了闷声干。TechCrunch 找微软求证,对方只回了一句”暂无更多信息可以分享”。这种不否认也不解释的态度,某种程度上比一份正式声明更说明问题。

    微软 AI 模型业务负责人穆斯塔法·苏莱曼(Mustafa Suleiman)在 6 月 Build 大会上说得直白:”我们每年向 Anthropic 支付巨额费用,目标是逐步减少、并最终消除这部分支出。”

    一句话把动机说透了:不是不想用,是太贵了。

    七个模型一起上,MAI 到底是什么来头

    MAI 不是临时起意。就在今年 6 月的 Build 开发者大会上,微软一口气发布了 7 款全新的自研 AI 模型,覆盖语音、图像、代码和推理——其中包括一个能写代码的 agentic coder,以及一个文生图模型。也就是说,微软已经在为”逐步替换第三方”悄悄准备弹药了。

    这些模型的卖点很统一:不追求纸面参数多吓人,而是强调”同样的活儿,花更少的算力”。放在 Office 这种每天海量、高频、但单次并不复杂的调用场景里,自研模型的成本优势会被放大。再配合微软自己的 Maia AI 芯片做软硬协同,推理开销比外购方案低上一截。

    • MAI-Transcribe-1 / MAI-Voice-1:对标 OpenAI Whisper 的语音转录与生成
    • MAI-Image-2:图像生成,替代部分文生图需求
    • MAI Code 1 Flash:面向开发者的代码生成模型
    • MAI Thinking 1:主打轻量高频办公场景的推理模型

    除了 Office 套件,MAI 也已经接进了 GitHub Copilot;Teams 上自研的语音转写能力也计划在几个月内上线。微软的意思很明确:凡是能自己干的,就别再长期花钱请外援。


    不只是微软,整个硅谷都在”省 token”

    把镜头拉远一点,微软这步其实是一股大潮里的一朵浪。今年上半年还流行”tokenmaxxing”——能多烧就多烧,把智能拉满;最近几个月画风突变,Amazon、Uber、Meta、Accenture 都被曝在收紧员工的 AI 预算,能省则省。AI 服务的账单一出来,连硅谷自己人都被吓到。

    更戏剧性的是,成本压力甚至把一些公司推向了”对手阵营”。有报道说,硅谷已经有人开始盯着中国的便宜模型(比如 GLM-5.2)找 Agent 方案,虽然绕不开安全和合规的顾虑。这说明一件事:当账单足够疼,地缘和安全的优先级都会往后挪一挪。

    自研到底,是想把命门攥回自己手里

    微软当然不会明天就跟 OpenAI、Anthropic 说拜拜。它手里还握着和 OpenAI 的合作协议,只是折扣窗口正在收窄。苏莱曼团队真正在做的,是搭一套”自主可控”的模型体系,免得将来被头部实验室的市场价拿捏。

    这也折射出整个行业的尴尬:靠外购大模型做商业化,盈利模型到现在都没完全跑通。微软这次把自研模型塞进 Excel 和 Word,看起来是省几块钱的小动作,实则是大厂为”AI 主权”交的第一笔学费。接下来,GitHub Copilot、Teams,甚至 Bing,会不会也慢慢换上 MAI,值得盯着看。