标签: AI模型

  • 微软Build 2026放大招:7款自研MAI模型亮相,不再只靠OpenAI

    6月2日到3日,微软Build 2026开发者大会在旧金山举办。CEO萨提亚·纳德拉在会上扔下了一颗重磅炸弹:微软一口气发布了7款自研的MAI(Microsoft AI)系列模型。这是微软跟OpenAI合作这么多年以来,第一次真正意义上具备了不依赖OpenAI的独立AI能力。

    微软Build 2026
    微软Build 2026:MAI系列模型正式亮相

    为什么现在发布MAI

    这个时间点选得挺有意思。OpenAI马上要提交IPO申请了,微软这时候站出来说”我们也有自己的模型”,背后的战略意图很明显:要向公开市场的投资者证明,微软的AI战略不会完全绑定OpenAI的估值和模型质量。

    MAI系列不是实验室里的演示产品,而是已经投入生产使用的实战模型。微软在现场演示的所有功能,用的都是自研模型,没有借助OpenAI的技术。这让Copilot从”OpenAI模型的分发渠道”变成了一个真正独立的AI平台。

    7款模型都干了什么

    MAI-Thinking-1是旗舰推理模型,定位是对标前沿AI模型的推理能力。MAI-Code-1-Flash是微软首款不依赖OpenAI的编程模型,能把自然语言描述直接转成源代码。

    图像生成这边,MAI-Image-2.5在Arena图像编辑排行榜上拿了1403分,性能超过了Gemini 3 Pro的图像预览版。语音转写模型MAI-Transcribe-1.5支持43种语言,转写精度达到行业最优水平,速度比同类产品快5倍。

    MAI-Voice-2语音生成模型已经集成到Copilot、Teams、GitHub、Dynamics 365等微软产品和服务中。另外还有2款没公开名称的推理专属模型,面向Azure AI Foundry的企业工作负载。

    AI编程市场的格局变化

    当前AI编程市场里,Anthropic凭着Claude Code领先,OpenAI正把重心从消费端转向企业端Codex产品。谷歌和微软则靠着云基础设施、分发渠道和资金优势在加速追赶。

    谷歌在2026年I/O大会上推出了定价100美元/月的AI开发者订阅服务,Gemini 3.5 Flash的代理和编程能力已经达到前沿水平。谷歌的策略是靠生态优势压低价格,和Anthropic正面竞争。

    微软这次发布MAI系列,等于是在AI编程市场里又多了一个重量级玩家。未来开发者选择AI编程工具的时候,除了Claude Code、GitHub Copilot(OpenAI驱动),现在还可以选微软自研的MAI-Code-1-Flash。


    微软这一步走得挺关键。有了MAI系列,微软在AI战略上有了更多主动权,不再需要看OpenAI的脸色。对开发者来说,多一个选择总是好事,尤其是这个选择还带着微软全套云基础设施和企业服务的支持。

  • 谷歌开源Gemma 4 12B,16GB内存笔记本就能跑多模态AI

    谷歌走了条不同的路

    大部分玩家都在冲更大、更强的模型,谷歌反过来证明:一个精心设计的120亿参数模型,配合聪明的架构选择,在边缘设备上也能给出不俗的多模态推理能力。

    谷歌刚刚做了一个挺有意思的举动。6月3日,这家公司悄悄上线了Gemma 4 12B——一个119.5亿参数的开源多模态模型,最关键的卖点是:普通16GB内存的笔记本就能跑。

    砍掉编码器,延迟和内存都降了

    这个人称”统一架构”的东西,说白了就是把传统多模态模型里那些分开的编码器给砍掉了。

    传统做法里,音频和图像得先经过专门的编码器转成语言模型能懂的表示,这一转就带来了延迟和额外内存消耗。Gemma 4 12B直接让原始音频波形和视觉块流入核心语言模型的嵌入空间,只用了3500万参数的轻量线性层。

    结果就是:延迟低了,内存需求降到16GB,还能一次性微调整个多模态系统。

    性能不弱,上下文窗口大到离谱

    这个小模型跑分接近谷歌自己260亿参数的混合专家模型。它支持256K token上下文窗口——这对需要处理长财报、大型代码库或一小时会议记录的企业来说很实用。

    另外还内置了”思考模式”,会在生成回复前先列出逐步推理过程;开箱就支持函数调用和系统提示,这些都是搭建自主智能体的基础能力。

    企业哪几种场景最适合

    • 严格数据隐私和合规要求(比如医疗、金融、国防),敏感数据不能传出本地
    • 多模态智能体工作流,需要实时音频和变分辨率图像输入
    • 成本敏感的边缘部署,比如零售库存监控、本地客服亭、离线现场服务

    当然也有局限

    如果你主要做的是海量知识检索,又不搭RAG管道,那可能还是需要更大的基础模型。

    另外音频输入严格限制在30秒内处理,视频理解只有60秒(按每秒1帧算)。需要处理长视频或大型音频档案的企业,还是得用API模型或分块架构。


    谷歌这次把小模型路线走得很坚决。对企业技术负责人来说,Gemma 4 12B值得认真评估——尤其是当你既想要多模态能力,又不想把所有数据都送到云端去的时候。

  • 微软干了件迟早要干的事:不再只当OpenAI的经销商

    微软干了件迟早要干的事:不再只当OpenAI的经销商

    6月2日到3日,微软Build 2026开发者大会开完之后,很多人意识到一件事:微软好像真的不打算继续完全依赖OpenAI了。

    这次大会上,微软一口气发布了7款自研MAI系列模型。其中包括他们的首款高级推理模型MAI-Thinking-1。微软在介绍里特意强调了一句话:”完全基于干净数据从零开始训练,没有使用来自第三方模型的蒸馏数据。”这句话翻译过来就是:这是我们自己做的,跟OpenAI没有关系。

    微软投了OpenAI 130亿美元,但Copilot背后跑的还是别人的模型。每调用一次API,就是在给OpenAI送钱。这算什么护城河?

    7款模型,覆盖全部核心场景

    这次发布的MAI模型家族,基本把AI能做的事情全覆盖了:

    • MAI-Thinking-1:首款高级推理模型,350亿活跃参数,在关键软件工程基准测试中达到业界领先水平。定价比OpenAI的同类产品低。
    • MAI-Image 2.5 和 MAI-Image 2.5 Flash:文生图 + 图像编辑,Flash版本是轻量版。
    • MAI-Transcribe-1.5:语音转写,速度是竞争对手模型的5倍,支持43种语言。
    • MAI-Voice-2 和 MAI-Voice-2 Flash:语音合成,新增15种语言支持,提供更多语音选项。
    • MAI-Code-1:编程辅助,具备推理效率优化特性,已经集成到GitHub Copilot和Visual Studio Code中。

    这套模型家族发布之后,微软在AI能力上有了完整的自主权。以前微软要用推理模型,得找OpenAI要API;要用图像生成,也得依赖别人的模型。现在这些能力微软自己都有了。

    MAI-Thinking-1是个什么水平的模型

    微软对MAI-Thinking-1的定位是”中等规模模型”,350亿活跃参数。这个规模比GPT-4o或者Claude Opus要小,但微软的意思是:我们不需要最大的模型,我们需要的是性价比最高的模型。

    从基准测试的成绩来看,MAI-Thinking-1在软件工程相关的测试里达到了业界领先模型的水平。微软没有具体说是哪些模型,但”业界领先”这几个字,指向的应该是OpenAI的o1系列或者Anthropic的Claude。

    有个细节值得注意:微软强调这个模型”没有使用第三方模型的蒸馏数据”。这不是一句客套话。模型蒸馏是指用大型模型(比如GPT-4)的输出去训练小型模型,让小型模型”学会”大型模型的能力。如果微软用了OpenAI模型的蒸馏数据,那么微软的模型本质上还是在依赖OpenAI。现在微软明确说了”没有”,这意味着微软在训练数据层面做到了完全独立。


    微软为什么现在做这件事

    微软和OpenAI的关系在过去几个月里发生了很明显的变化。2026年初,微软和OpenAI结束了独家合作关系,微软被列为OpenAI的竞争对手。Build大会前不久,微软还推出了Scout,一个基于OpenClaw框架的个人AI助理,这个动作本身就说明微软在准备自己的AI产品路线。

    从商业逻辑上看,微软每年给OpenAI付的API费用不是一个小数目。如果微软自己的MAI模型能做到差不多好的效果,但成本只有OpenAI的一半或者三分之一,那么把Copilot背后的模型换成自己的,每年能省下的钱是相当可观的。

    另一个角度是竞争。Google有Gemini,Meta有Llama,Amazon有自己的模型家族。微软是唯一一个大规模推广AI产品(Copilot)但没有完全自主模型能力的巨头。这个短板,Build 2026之后,微软补上了。


  • 阿里发了款新模型,价格只有Claude的一半,性能却差不多

    阿里发了款新模型,价格只有Claude的一半,性能却差不多

    5月20日的杭州阿里云峰会上,高级副总裁刘伟光说了一句挺有意思的话:”我们正在打造中国AI工厂。”台下的人可能还没意识到,这句话背后的分量——阿里不再满足于做开源模型的社区宠儿,它要直接和Anthropic、OpenAI在企业级市场正面刚。

    “我们在各基准测试中排名靠前,超过中国所有其他AI模型。”
    ——阿里云首席AI架构师 周静仁

    当天正式发布的Qwen3.7 Max,是阿里第一款闭源旗舰模型。这个转向值得玩味:过去两年,阿里靠开源的Qwen 3.5、3.6系列占据了大量开发者生态,现在它想把这套生态转化成真金白银的企业收入。


    数字摆出来,确实有点东西

    先说硬指标。Qwen3.7 Max的上下文窗口达到100万tokens,比上一代Qwen 3.6的25.6万tokens提升了近40倍。这意味着什么?你可以把一整本技术手册、一个中等规模代码库,一次性塞进模型的”工作记忆”里,不用再做切片和向量检索。

    人工分析智能指数(AA Intelligence Index v4.0)给Qwen3.7 Max打了56.6分,综合排名第5,是发布时排名最高的中国模型。排它前面的是GPT-5.5(60.2分)、Claude Opus 4.7(57.3分),分差在误差范围内。

    换成大白话:阿里这套模型,智能水平和Claude Opus 4.7差不多,但定价只有后者的一半。

    评测维度 Qwen3.7 Max Claude Opus 4.7 GPT-5.5
    AA智能指数 56.6(第5) 57.3(第4) 60.2(第1)
    Terminal-Bench 2.0 69.7 65.4(4.6基线) 未披露
    SWE-Bench Pro 60.6 57.3(4.6基线) 未披露
    输入定价(美元/百万tokens) 2.5 5.0 5.0
    输出定价(美元/百万tokens) 7.5 25.0 30.0

    定价是亮点,但实际成本有点猫腻

    标题说”价格只有Claude的一半”,指的是官方标价。但用起来是不是真的只要一半,这里有个坑。

    Digital Applied的评测发现,Qwen3.7 Max的输出冗余度极高。在AA智能指数评测中,它一共生成了9700万输出tokens,而对比组的中位数仅为2400万tokens——是中位数的4倍。换句话说,同样回答一个问题,Qwen3.7 Max可能会输出4倍长度的”废话”。

    按7.5美元/百万输出tokens计算,同等任务下Qwen3.7 Max的实际输出成本是中等冗余度模型的2.5倍。所以标价和Claude Opus 4.7的实际差距,远没有一半那么大。

    不过,阿里给了一个挺实在的折扣:缓存输入0.25美元/百万tokens(90%折扣)。对于智能体任务(重复调用相同系统提示词),这个折扣能把成本压得很低。


    智能体编程是真本事

    Qwen3.7 Max的核心卖点是”智能体(Agent)能力”。阿里在发布会上演示了一个35小时自主运行的编程任务:模型连续运行35小时,完成1158次工具调用、432次内核评估、5次架构重设计,最终把Triton内核的几何平均速度提升了10倍。

    这个演示还没被独立复现,但基准测试成绩是实打实的。Terminal-Bench 2.0(测试多步骤智能体工作流)得分69.7,SWE-Bench Pro(真实软件工程任务)得分60.6,MCP-Atlas(模型上下文协议适配)得分76.4,均领先对比组。

    更重要的是兼容性。Qwen3.7 Max支持OpenAI兼容和Anthropic兼容两种API规范,可以适配Claude Code、OpenClaw、Qwen Code、Hermes Agent等多款智能体框架。已经用上Claude Code的团队,无需重写框架就能切换调用。


    两个地方要注意

    第一个是幻觉率。Qwen3.7 Max的AA-Omniscience幻觉率为22.9%,是同期前沿模型中最低的,较上一代Qwen 3.6的44.2%大幅下降。但这个提升部分来自”弃答策略”:模型答题尝试率从67.3%下降至48.0%,超过一半的问题它会选择”不知道”而非给出答案。

    这意味着什么?如果你做的是智能体编程,答错比弃答危害更大,Qwen3.7 Max反而有优势。但如果你做的是RAG管道、法律或医疗问答这些需要高召回率的场景,它的弃答率会让你头疼,这类场景建议用DeepSeek V4 Pro或Claude Opus 4.7。

    第二个是开源权重。阿里已公布计划推出开源的Qwen 3.7 Plus轻量版,但截至5月25日,HuggingFace的Qwen组织下仅公布了Qwen 3.6及更早版本权重,暂未放出Qwen 3.7系列权重。需要自部署的团队,目前还得用Qwen 3.6系列或者DeepSeek V4 Pro。


    战略意图比模型本身更值得琢磨

    把Qwen3.7 Max放在更大的格局里看,这事的意义不止是一款新模型发布。

    过去两年,中美AI模型之间的差距,外界普遍认为是”一个迭代周期”——大概6到9个月。Qwen3.7 Max的AA智能指数和Claude Opus 4.7只差0.7分,基本在误差范围内。这意味着,中国前沿AI已经不再落后西方实验室一个迭代周期,差距正在收窄到同一代内的不同批次。

    阿里的全栈布局也在同步推进。模型(Qwen3.7 Max)+ 自研芯片(Zhenwu M890 AI加速器)+ 智能体框架,这套组合在地缘政治压力下有特殊的战略价值——即便买不到英伟达最新芯片,阿里也有一套自己可控的技术栈。

    对于企业用户来说,Qwen3.7 Max目前是通过阿里云模型工作室、OpenRouter、Together AI、Qubrid AI四个渠道访问。建议针对自身任务子集做基准测试,结合实际冗余度调整后的成本做路由决策,而不是只看官方定价。

  • 微软和OpenAI分手了,现在准备开战

    上周的微软Build 2026大会,看上去像极了一个刚离婚的人急着装扮好自己、在社交平台发精致自拍。过去几年里,微软在AI这件事上几乎把所有筹码压在OpenAI身上,两家公司那场充满戏剧性的”联姻”闹了快两年,终于在4月下旬实质性分手——虽然微软至今还是OpenAI最重要的云合作伙伴,但那种”我们是一家人”的说法,现在已经没人再提了。

    “我们要进全球前四”

    微软AI负责人穆斯塔法·苏莱曼在Build大会期间接受The Verge采访时说了一段很直白的话:微软的目标是要证明自己能成为全球排名前四的AI实验室。他说的”目前有意义实验室只有三家”指的是Google DeepMind、OpenAI和Anthropic——言下之意,微软现在还排不进去。

    “我一直想打造全球最顶尖的前沿模型,完全多模态的那种。要做到这一点,我们必须证明自己可以从头开始完成所有需要的工作,而不是只从其他公司获取成果。”

    这段话的潜台词其实很清楚:以前微软不需要自己做模型,OpenAI帮它搞定了。现在不行了,得自己来。

    追赶推理模型

    这次Build大会上,苏莱曼发布了微软第一款具备推理能力的AI模型,叫MAI-Thinking-1,同时还一口气推出了6款聚焦图像、语音、转录、编程的新模型。说实话,这个动作晚了好几年——OpenAI早在2024年秋天就开始发布推理模型了,Anthropic也早就跟上了。

    不过苏莱曼强调了一个卖点:价格。他说在某些任务场景下,MAI-Thinking-1比OpenAI同类产品更便宜。这话现在听起来挺聪明的,因为最近已经有不少企业客户在抱怨AI工具太贵了,Uber甚至因为AI预算四个月就烧完整年额度而设了每员工每月1500美元的上限。

    苏莱曼还特意说明,MAI-Thinking-1的开发没有用任何”蒸馏”技术,也就是没有拿别的公司的AI模型来训练自己的模型。如果这款模型表现真的好,微软显然不希望外界觉得是OpenAI的功劳。

    “和OpenAI重新谈判合同是我们发展的关键节点。这意味着我们可以更大规模训练模型,明确追求完全拥有自主知识产权的超级智能,使用我们自己的数据,不做蒸馏,从零开始训练。”

    网络安全工具暗战

    纳德拉在大会上还重点介绍了一款叫MDASH的AI网络安全工具,说它集成了100个AI智能体,发现漏洞的能力”比任何单一模型都强”。这明显是在暗指Anthropic几个月前发布的Claude Mythos Preview——那款模型专门用来扫描代码漏洞,备受关注的同时也引发了不少担忧,因为让AI大规模扫描关键基础设施的代码,这件事本身就有风险。

    OpenAI也有自己的网络安全系统。三家公司现在大概率会在政府和企业的网络安全市场上正面竞争,而这两个市场正是它们现在最迫切需要开拓的。

    AI智能体的明争暗斗

    微软在AI智能体这条赛道上的处境其实有点尴尬。现在最火的开源智能体平台叫OpenClaw,它已经把”AI智能体应该是什么样”这件事的答案摆在了所有人面前。而OpenAI最近还把OpenClaw的创始人彼得·斯坦伯格挖走了。

    微软的策略之一是让OpenClaw和Windows系统好好配合。斯坦伯格本人还意外出现在了Build大会现场,上台演示了OpenClaw如何增强了安全性。他说现在企业用户可以在公司内部运行OpenClaw了,”我们甚至把挂接组件本身做成了插件”。

    但微软同时也在推自己的Copilot”超级应用”,里面的智能体叫”Autopilots”(副驾驶)。纳德拉介绍它们是可以”具备完整企业合规能力的自主、长运行智能体”。第一款正式推出的产品叫Scout,定位是”永远在线的个人智能体”。

    Autopilot智能体可以查看你的邮箱、加入Teams群聊、检查日历、发送每日简报。因为企业客户之前看过不少关于OpenClaw把系统搞崩的负面消息,所以微软在台上反复强调Copilot的安全工具和防护机制,明显是在安抚企业客户。


    微软的优势和疑问

    微软这么多年一直押注OpenAI,某种程度上确实导致它在AI竞赛里落后了。但现在OpenAI和其他竞争对手都在拼命往企业市场跑、急着盈利,微软反而有一些别人没有的优势:它已经有一大堆企业客户了,而且跟其他AI公司比起来,安全性和可靠性的口碑更好。

    跟谷歌一样,微软也有花不完的钱、用不完的计算资源、多元化的收入来源,这意味着它可以做高风险的大额投入,而不需要承担过大的生存压力。

    但问题也很多。微软这次一口气发布了7款新模型,说了各种基准测试的优势,但这不代表真实用户就会买账——一款领先一两周的新模型,很快就会被别人超过。AI超级应用到现在基本上还是一个没有经过市场验证的概念。微软进的是一个拥挤但整体表现仍然不太好的AI智能体市场,它的产品到底好不好用,目前为止还没有人真正见过。

    • 微软正式将OpenAI列为竞争对手,结束多年”独家合作”关系
    • MAI-Thinking-1是微软第一款自研推理模型,定价低于OpenAI同类产品
    • MDASH网络安全工具直接对标Anthropic的Claude Mythos
    • Copilot”Autopilots”智能体面向企业客户,强调合规和安全
    • 微软优势在于现有企业客户基础和安全性口碑,但产品尚未经市场验证