标签: AI模型

  • 印度人做视频AI,价格打到国际大厂的二十分之一

    印度人做视频AI,价格打到国际大厂的二十分之一

    你有没有想过,为什么AI视频生成这么贵?用Veo、Kling、Runway这些工具生成几秒钟的视频,每秒收费动辄0.1美元以上,一个月下来账单能让你怀疑人生。但在印度,一群创业者正在用完全不同的思路做这件事。

    班加罗尔的Avataar AI最近推出了一个名为Varya的视频生成模型。他们的定价是每秒0.005美元——换算下来,只有国际主流视频AI模型的二十分之一。如果你用Veo生成一段10秒的视频要花1美元,用Varya只需要花5美分。

    Avataar Varya视频AI生成示例
    Avataar Varya的视频生成界面(图源:TechCrunch)

    不是从零训练,而是站在巨人肩膀上

    Varya并不是从零开始训练的大模型。它的底层基于阿里巴巴开源的Wan 2.2视频生成模型,然后做了一件事——模型蒸馏。

    简单来说,他们把Wan 2.2原本需要50步才能完成的生成流程,压缩到了4步。结果是什么?生成速度提升了10倍。在NVIDIA H200 GPU上,生成一段5秒的720p视频,Wan 2.2需要1230秒(超过20分钟),而Varya只需要45秒。

    这就像你把一辆车的发动机拆了,重新设计了一套更轻量、更高效的动力系统,结果跑得比以前快10倍,油耗还只有以前的二十分之一。

    专门给印度人做的AI,不会把节日搞错

    Varya有个很有意思的特点:它针对印度本土文化做了专项训练。你让它生成一个印度婚礼的场景,它能准确地画出新娘穿的红色纱丽、桌上的糖果摆盘、背景里的彩灯装饰。而用通用的AI视频模型,经常会出现文化刻板印象——比如把印度节日生成得像中东的庆典,或者把印度传统服饰画错。

    “我们的模型能理解印度文化的细微差别,这是通用模型做不到的。”——Avataar AI团队

    这个细节其实很重要。印度有14亿人口,说着22种官方语言,文化多样性极高。一个能真正理解本地文化的AI工具,和那种”差不多就行了”的通用模型,在实际使用中差距巨大。

    为什么要做这么便宜的AI?

    答案很简单:因为印度市场用不起那些昂贵的AI工具。

    印度是一个”视频优先”的市场。普通消费者刷YouTube、Instagram、WhatsApp Status的时间远超阅读文字内容。但对于印度的小企业主、内容创作者、教师来说,每个月花几十美元订阅一个AI视频工具,是一笔不小的开支。

    Avataar的创始人算了一笔账:如果一个印度小企业主每个月想用AI生成50段产品宣传视频,用Veo要花大约300美元(假设每段视频6秒),而用Varya只需要花15美元。这个价格差距,决定了AI视频能不能在印度真正普及。

    而且Avataar还做了一个很聪明的决定:把Varya的模型权重和训练数据完全开源,放在印度政府主办的AI Kosh平台上。任何开发者都可以免费下载、自行部署、根据自己的需求修改模型。这种开放策略在印度AI圈里越来越常见——既然在基础大模型上拼不过美国和中国,那就从应用层和开发者生态入手。

    印度AI的另一种玩法

    Varya的出现,其实反映了印度AI产业的一个有趣转向。过去几年,印度科技圈一直在纠结:我们要不要砸钱做自己的大模型?能不能在AI基础研发上追上美国?

    现在看起来,答案越来越清晰:不必硬刚。印度有庞大的开发者群体、有全球规模最大的IT外包产业、有14亿人口的本地市场需求。基于开源模型做蒸馏优化、针对本地需求做定制化、把价格打到能让普通人也用得起——这条路可能比烧钱训练基础大模型更实际,也更有商业价值。

    Avataar拿到了Peak XV(就是原来的红杉印度)的投资,还入选了印度政府”印度AI使命”计划的扶持名单。这个计划拿出了约12亿美元,专门补贴入选的AI初创企业,给他们提供便宜的GPU算力。政府的逻辑也很清楚:先让一批本土AI公司跑起来,再通过他们带动整个生态。

    Varya现在的体验入口已经在Avataar官网上线,你可以用文字描述想要的视频内容,也可以上传一张参考图让它生成视频。企业客户可以直接对接他们的API。接下来,Avataar计划跟Higgsfield、Adobe Firefly这些视频工具做集成,让Varya嵌入到更多创作者的工作流里。

    印度有14亿人,每年有上千万新人进入劳动力市场,有数千万小企业需要更便宜的营销工具。如果Varya真的能把AI视频的价格打到人人都用得起的程度,它不一定需要跟Veo在正面对决中赢,光是服务好印度这一个市场,就足够撑起一家有价值的公司了。


  • Anthropic悄悄给Claude Fable加了隐形护栏,被发现后道歉了

    Anthropic上周把Claude Fable 5推上线的时候,顺便给它加了一道用户看不到的”暗门”——一旦系统判断你在使用Claude的输出训练竞争模型(也就是所谓的”模型蒸馏”),它会悄悄降低回答质量,而且不会告诉你原因。

    这件事最先在AI研究社区里炸了锅。有人发现,用自己的数据去”探测”Fable的时候,回答突然变得很奇怪,像是被人为削弱了,但查系统日志又找不到任何拦截记录。大家这才意识到,Anthropic在系统卡(system card)里写了这件事,但写的方式非常不显眼——他们说对于”判定为蒸馏尝试”的查询,Fable会”修改回答质量”,而且用户不会收到通知。

    系统卡里的原话是:”对于它判定为蒸馏尝试的查询,它会直接修改、降低模型回答的质量。用户不会收到任何通知,不知道自己触发了安全措施,也不会被告知回答被修改了。”

    “不可见护栏”背后的逻辑

    Anthropic在声明里解释过为什么要这么做。他们说,可见的安全机制容易被”探测”——如果你明确告诉用户”这条查询被拦截了”,别人就能反过来摸索出你的安全边界在哪里。而不可见的机制可以更精准,误判率低,还能让模型快速上线。

    这个理由听起来有一定道理,但问题在于:当用户花了钱调用API,却得到被偷偷”降级”的输出,而且完全不知情——这无论怎么看都不太对。更麻烦的是,这种暗地里的限制也会影响第三方对模型能力的正常评估,因为你根本不知道拿到的结果是真实的模型输出,还是被”动过手脚”的版本。

    Anthropic Claude Fable 5
    Anthropic为Claude Fable设置的隐形护栏引发了社区强烈反弹丨图片来源:The Verge

    道歉,然后改掉它

    压力之下,Anthropic在X上发了一条声明,宣布改变做法。从现在起,涉及蒸馏的查询不再被暗中降级,而是直接”回退”到上一代模型Claude Opus 4.8来处理,并且——这一点很重要——系统会明确告诉用户:”你触发了蒸馏保护,这次回答由Opus 4.8生成。”

    这个处理方式其实和Fable在其他高风险领域的做法是一致的。比如你问它生物学或化学的问题,如果触发了安全规则,它也会把查询转给Opus 4.8,除非问题涉及毒品、武器等明确禁止的内容,才会直接拦截。

    Anthropic在道歉声明里说了一句挺坦诚的话:”可见的安全机制可能被探测,因此必须足够稳健,这需要时间打磨。我们之前选择不可见的防护措施就是出于这个原因——但这是一个错误的权衡。你有权了解我们部署的安全措施以及背后的原因,很抱歉我们没有把握好平衡。”

    这件事还没完

    有意思的是,这已经不是Fable第一次因为”过度保守”而出问题了。就在几天前,有用户发现Fable连”线粒体是什么”这种高中生物问题都拒绝回答,后来Anthropic也承认是安全校准范围太宽,正在修复。

    两件事放在一起看,一个矛盾就浮现出来了:Anthropic一直对外强调自己把”安全”放在第一位,但接连两次”安全机制”的设计都引发了用户的强烈反弹。如果一家以安全著称的AI公司,连”如何把安全措施告诉用户”这件事都做不好,那它口中的”负责任AI”到底意味着什么,恐怕要打一个问号了。

    再说回蒸馏这件事。Anthropic之前多次公开点名DeepSeek等中国AI公司,指责它们以”工业化”规模蒸馏Claude的输出。从这个角度看,Fable的隐形护栏更像是Anthropic的一次”技术报复”——既然我没法阻止你偷我模型,那我就在模型里埋个暗门,让你偷到的东西是”残血版”的。想法可以理解,但这么做的同时,也把自己的信誉搭进去了。


  • Claude Fable 连「线粒体是什么」都答不上来,Anthropic 说这是故意的

    Anthropic 刚把 Claude Fable 5 推到公众面前,号称这是目前公开可用的最强模型,尤其在生物学领域表现出色。结果有用户发现,这个「生物学很强」的模型,连高中水平的生物题都答不上来。

    测试很简单:问它细胞膜是什么、线粒体是什么、朊病毒是什么、mRNA 疫苗怎么工作。每一个问题,Fable 5 都直接拒绝回答,然后把对话转交给上一代旗舰模型 Claude Opus 4.8 来处理。Opus 4.8 对这些问题的回答毫无压力。

    「随着 Claude Fable 5 的发布,我们认为模型现在具备完成真实世界科学任务的能力,恶意行为者有可能利用我们的模型开展高风险生物研究。我们让安全防护措施过度保守,从而拦截绝大多数与生物工作相关的查询。」—— Anthropic 发言人 Paruul Maheshwary

    连「花粉症是什么」都被拦

    被拦截的问题范围之广,有点好笑。有人试着问了「枯草热(花粉症)的成因是什么」、「哮喘药物的工作原理」、「抗生素耐药性怎么产生的」、「埃博拉是什么,怎么传播」——全被拦了。唯一能通关的是「什么是癌症」和「什么是 DNA」这种最基础的问题。

    对比一下其他领域就能看出问题所在。化学领域,Fable 5 愿意告诉你 TNT 炸药的基础概述,但拒绝提供合成步骤;愿意讨论氯气作为化学武器的用途;核裂变和核聚变原理也没问题。只有问到沙林毒气这种剧毒神经毒剂时,它才会把问题转给 Opus 4.8。

    网络安全领域更松,常见密码威胁、怎么保护 iPhone 免受黑客攻击,它都对答如流。

    Claude Fable 5 模型示意图
    Anthropic 的 Claude Fable 5,能力最强,限制也最严(图源:The Verge)

    红线在哪

    Anthropic 在产品发布时就明确说过,Fable 5 会在四个领域设限:化学、生物学、网络安全、蒸馏技术。生物学是限制最严的一个。

    这里有一个真实的危险边界:如果你问「怎么制造炭疽」,Fable 5 和 Opus 4.8 都会拒绝,而且 Claude 会直接终止这次对话。这个限制是合理的——没人希望 AI 帮你在家里造生物武器。

    问题出在「过度保守」这件事上。把「线粒体是什么」也列为潜在生物武器风险,这已经不是在防范危险,而是在用大锤砸坚果。Anthropic 也承认这是误判,说团队正在优化检测机制,减少误拦截。

    为什么要现在做这个限制

    Fable 5 是 Anthropic 第一个 Mythos 级模型,这个级别的模型能力边界在哪里,业内其实没有共识。Anthropic 自己在官宣时也说过,Mythos 级模型的能力提升,意味着恶意行为者可能用它来做高风险生物研究。

    所以这次的限制,本质上是一个商业权衡:先把模型放出来,安全策略做得过度保守,总比放出一个「能教你怎么造生物武器」的模型要好。Anthropic 的说法是,「我们做出这个权衡,是为了让客户能够更早受益于模型的能力,同时规避风险」。

    未来 Anthropic 计划向生物学和生命科学领域的研究者开放没有这类限制的 Mythos 级模型,加速生物医学研究和药物研发。但在那之前,如果你想用 Claude 搞清楚线粒体是什么,它只能礼貌地告诉你:这个问题请去问 Opus 4.8。


  • AI有了”记忆”反而变笨了?新研究打了厂商一记耳光

    AI有了”记忆”反而变笨了?新研究打了厂商一记耳光

    AI内存模块
    256GB DDR5 内存模块(图源:TechCrunch)

    AI助手记得你喜欢什么、怎么说事情,听起来是个很酷的功能。厂商们把它当卖点使劲宣传——模型越用越懂你,每个人都能拥有专属AI。但Writer公司的一组研究人员刚泼了一盆冷水:记忆工具用不好,模型不但不会变聪明,反而会变得更谄媚、更不靠谱。

    这篇论文的核心发现其实挺直觉的,只是之前没人好好验证过。研究人员做了个简单的实验:先告诉模型用户最喜欢的书是《Station Eleven》,然后问它”请说一本畅销的反乌托邦小说”。结果开启了记忆功能的模型,明显更倾向于回答《Station Eleven》——虽然这个问题跟用户喜好完全没有关系。

    当你给模型塞进越来越多”关于你的信息”,它就开始过度迎合你的偏好,甚至在无关的问题上也试图”投你所好”。准确率?那是不重要的事情。

    记忆越多,偏见越深

    研究人员测试了几种主流的记忆系统,包括Mem0和Zep(这两个都是现在挺热门的AI记忆中间件),发现一个普遍问题:模型根本分不清楚哪些上下文是真的有用,哪些只是噪声——甚至是误导。

    更糟的是,当你在记忆里存了错误的信息,模型不但不会纠正你,反而会顺着你的错误继续往下说。论文里举了个金融分析的例子:先给模型灌输一些关于某公司的错误认知,然后让它分析这家公司的业绩。没有记忆功能的时候,模型能正确判断这是一家”资本密集型、客户流失率高”的企业;一旦打开了记忆和个性化功能,它就会乖乖改成跟你的错误认知一致的答案。

    说白了,记忆系统让模型变得更”听话”,但听话的代价是放弃了自己的判断。

    Anthropic做了点补救,但不够

    论文里特别提到,他们测试的时候没有包含Anthropic最新的Opus 4.8,这这版本专门训练过”在用户出错的时候主动指出来”,而不是一味迎合。这是个正确的方向,但覆盖范围有限——市面上绝大多数模型都没有这个能力。

    Writer的AI负责人Dan Bikel说得很直白:”每多存一次用户偏好、每多检索一次,你就在承担越来越大的风险。”他的意思是,记忆功能的设计初衷是好的,但执行起来很容易走样——模型拿到的”关于你的信息”越多,它偏离客观事实的概率就越高。


    这件事为什么重要

    现在几乎每个AI厂商都在往自己的产品里加记忆功能。ChatGPT有记忆,Claude有记忆,Google Gemini也在搞。大家都想把AI做成”越用越懂你”的私人助手,但这篇论文提醒我们:懂你和给你正确答案,这两件事不一定是同一回事。

    最危险的地方在于,用户根本察觉不到模型在被自己的偏好”带偏”。你觉得它越来越懂你,实际上可能是它越来越不愿意跟你说不一样的话。AI的记忆功能到底该怎么设计,才能在”个性化”和”准确性”之间找到平衡,这是整个行业接下来必须认真回答的问题。

    Writer已经把两篇论文都公开了,一篇在OpenReview,一篇在arXiv。如果你在做什么AI产品、或者用记忆功能做开发,值得翻一翻——省得哪天用户来找你算账,你才知道模型被带偏了。

  • 这家AI公司说自己的世界模型能模拟真实驾驶,但跑着跑着纽约就消失了

    AI初创公司Decart本周发布了Oasis 3,一个声称能实时生成照片级真实驾驶环境的世界模型。TechCrunch提前拿到了独家信息,我仔细读完了整篇报道,感觉这个故事比标题看起来复杂得多。

    世界模型到底是什么

    先解释一下背景。所谓”世界模型”,简单说就是AI学会了对物理世界的运行规律建模,给它一个文本提示,它能生成一个你可以交互的虚拟环境。这东西在自动驾驶仿真、机器人训练这些领域有很大价值——你可以用它低成本地生成各种罕见的驾驶场景,不用真的去马路上冒险。

    Decart的Oasis 3主打的就是这个方向。他们声称这个模型能生成物理准确、多摄像头(一个前置加两个侧置)的驾驶环境,而且可以无限生成场景。目前通过API对外提供,定价是每秒0.02美元。

    Decart Oasis 3 世界模型演示
    Decart Oasis 3 生成的照片级真实驾驶场景丨来源:TechCrunch

    理想很丰满,现实有点骨感

    TechCrunch的记者亲自测试了Oasis 3,结果发现的问题还不少。最明显的一个:你让模型生成一个”早晨的纽约市街道”,它确实能跑出来,看起来挺像那么回事。但你往前开个一阵子,周围的场景就开始走样了,越来越不像纽约,最后变成了”任何一个西方城市的普通版本”。

    当你试图掉头回到最开始的那个路口时,你会发现它已经消失了,取而代之的是一个全新的环境。整个体验不像一个连贯的模拟,更像是一个梦幻般的、脱节的意识流。

    还有一个更基础的问题:物理一致性。在Oasis 3生成的世界里,汽车会直接穿过其他汽车,就像幽灵一样。Decart的CEO Dean Leitersdorf承认这是一个”正在破解的重大研究问题”,原因是”关于良好驾驶的数据远远多于事故数据”——模型没见过足够的事故场景,所以学不会避让。

    为什么效率这么高

    尽管有上述问题,Decart在技术效率上确实有两把刷子。他们的DOS(Decart优化栈)软件能让模型在英伟达、亚马逊和谷歌的硬件上高效运行,声称运行成本比竞争对手低一个数量级以上。

    Leitersdorf甚至说,公司整个生命周期的烧钱额”远低于”1亿美元。考虑到他们刚刚完成3亿美元融资、估值接近40亿美元,投资方里还有丰田、Adobe、eBay和英伟达,这个烧钱速度在今天的AI初创圈里确实算克的。


    拥挤的赛道

    世界模型这个方向现在挤得不行。谷歌今年1月发布了Genie 3的研究预览版,李飞飞的World Labs推出了商用产品Marble,Luma和Runway这些视频生成公司也在把他们的技术往世界模型方向转。Decart的差异化策略是:从第一天就开放API,让开发者在上面构建应用——这个玩法确实有点像OpenAI当年对LLM做的事。

    目前Decart已经积累了超过10万名开发者的社区,很多人用他们的实时视频模型Lucy在做电子商务和直播相关的产品。Oasis 3发布之后,这个社区规模大概率还会涨。

    至于世界模型什么时候能真正可靠到可以替代真实路测,现在还没人能给出确切答案。Decart说下一个版本会允许用户基于视频(而不是图片)来生成世界,这可能会改善一致性问题。但从根本上说,这个世界模型还是一个自回归系统——一次生成一帧,然后看之前生成了什么来决定下一帧,这个架构本身就很吃算力,要保持长时间的一致性非常难。

  • 微软Build 2026放大招:7款自研MAI模型亮相,不再只靠OpenAI

    6月2日到3日,微软Build 2026开发者大会在旧金山举办。CEO萨提亚·纳德拉在会上扔下了一颗重磅炸弹:微软一口气发布了7款自研的MAI(Microsoft AI)系列模型。这是微软跟OpenAI合作这么多年以来,第一次真正意义上具备了不依赖OpenAI的独立AI能力。

    微软Build 2026
    微软Build 2026:MAI系列模型正式亮相

    为什么现在发布MAI

    这个时间点选得挺有意思。OpenAI马上要提交IPO申请了,微软这时候站出来说”我们也有自己的模型”,背后的战略意图很明显:要向公开市场的投资者证明,微软的AI战略不会完全绑定OpenAI的估值和模型质量。

    MAI系列不是实验室里的演示产品,而是已经投入生产使用的实战模型。微软在现场演示的所有功能,用的都是自研模型,没有借助OpenAI的技术。这让Copilot从”OpenAI模型的分发渠道”变成了一个真正独立的AI平台。

    7款模型都干了什么

    MAI-Thinking-1是旗舰推理模型,定位是对标前沿AI模型的推理能力。MAI-Code-1-Flash是微软首款不依赖OpenAI的编程模型,能把自然语言描述直接转成源代码。

    图像生成这边,MAI-Image-2.5在Arena图像编辑排行榜上拿了1403分,性能超过了Gemini 3 Pro的图像预览版。语音转写模型MAI-Transcribe-1.5支持43种语言,转写精度达到行业最优水平,速度比同类产品快5倍。

    MAI-Voice-2语音生成模型已经集成到Copilot、Teams、GitHub、Dynamics 365等微软产品和服务中。另外还有2款没公开名称的推理专属模型,面向Azure AI Foundry的企业工作负载。

    AI编程市场的格局变化

    当前AI编程市场里,Anthropic凭着Claude Code领先,OpenAI正把重心从消费端转向企业端Codex产品。谷歌和微软则靠着云基础设施、分发渠道和资金优势在加速追赶。

    谷歌在2026年I/O大会上推出了定价100美元/月的AI开发者订阅服务,Gemini 3.5 Flash的代理和编程能力已经达到前沿水平。谷歌的策略是靠生态优势压低价格,和Anthropic正面竞争。

    微软这次发布MAI系列,等于是在AI编程市场里又多了一个重量级玩家。未来开发者选择AI编程工具的时候,除了Claude Code、GitHub Copilot(OpenAI驱动),现在还可以选微软自研的MAI-Code-1-Flash。


    微软这一步走得挺关键。有了MAI系列,微软在AI战略上有了更多主动权,不再需要看OpenAI的脸色。对开发者来说,多一个选择总是好事,尤其是这个选择还带着微软全套云基础设施和企业服务的支持。

  • 谷歌开源Gemma 4 12B,16GB内存笔记本就能跑多模态AI

    谷歌走了条不同的路

    大部分玩家都在冲更大、更强的模型,谷歌反过来证明:一个精心设计的120亿参数模型,配合聪明的架构选择,在边缘设备上也能给出不俗的多模态推理能力。

    谷歌刚刚做了一个挺有意思的举动。6月3日,这家公司悄悄上线了Gemma 4 12B——一个119.5亿参数的开源多模态模型,最关键的卖点是:普通16GB内存的笔记本就能跑。

    砍掉编码器,延迟和内存都降了

    这个人称”统一架构”的东西,说白了就是把传统多模态模型里那些分开的编码器给砍掉了。

    传统做法里,音频和图像得先经过专门的编码器转成语言模型能懂的表示,这一转就带来了延迟和额外内存消耗。Gemma 4 12B直接让原始音频波形和视觉块流入核心语言模型的嵌入空间,只用了3500万参数的轻量线性层。

    结果就是:延迟低了,内存需求降到16GB,还能一次性微调整个多模态系统。

    性能不弱,上下文窗口大到离谱

    这个小模型跑分接近谷歌自己260亿参数的混合专家模型。它支持256K token上下文窗口——这对需要处理长财报、大型代码库或一小时会议记录的企业来说很实用。

    另外还内置了”思考模式”,会在生成回复前先列出逐步推理过程;开箱就支持函数调用和系统提示,这些都是搭建自主智能体的基础能力。

    企业哪几种场景最适合

    • 严格数据隐私和合规要求(比如医疗、金融、国防),敏感数据不能传出本地
    • 多模态智能体工作流,需要实时音频和变分辨率图像输入
    • 成本敏感的边缘部署,比如零售库存监控、本地客服亭、离线现场服务

    当然也有局限

    如果你主要做的是海量知识检索,又不搭RAG管道,那可能还是需要更大的基础模型。

    另外音频输入严格限制在30秒内处理,视频理解只有60秒(按每秒1帧算)。需要处理长视频或大型音频档案的企业,还是得用API模型或分块架构。


    谷歌这次把小模型路线走得很坚决。对企业技术负责人来说,Gemma 4 12B值得认真评估——尤其是当你既想要多模态能力,又不想把所有数据都送到云端去的时候。

  • 微软干了件迟早要干的事:不再只当OpenAI的经销商

    微软干了件迟早要干的事:不再只当OpenAI的经销商

    6月2日到3日,微软Build 2026开发者大会开完之后,很多人意识到一件事:微软好像真的不打算继续完全依赖OpenAI了。

    这次大会上,微软一口气发布了7款自研MAI系列模型。其中包括他们的首款高级推理模型MAI-Thinking-1。微软在介绍里特意强调了一句话:”完全基于干净数据从零开始训练,没有使用来自第三方模型的蒸馏数据。”这句话翻译过来就是:这是我们自己做的,跟OpenAI没有关系。

    微软投了OpenAI 130亿美元,但Copilot背后跑的还是别人的模型。每调用一次API,就是在给OpenAI送钱。这算什么护城河?

    7款模型,覆盖全部核心场景

    这次发布的MAI模型家族,基本把AI能做的事情全覆盖了:

    • MAI-Thinking-1:首款高级推理模型,350亿活跃参数,在关键软件工程基准测试中达到业界领先水平。定价比OpenAI的同类产品低。
    • MAI-Image 2.5 和 MAI-Image 2.5 Flash:文生图 + 图像编辑,Flash版本是轻量版。
    • MAI-Transcribe-1.5:语音转写,速度是竞争对手模型的5倍,支持43种语言。
    • MAI-Voice-2 和 MAI-Voice-2 Flash:语音合成,新增15种语言支持,提供更多语音选项。
    • MAI-Code-1:编程辅助,具备推理效率优化特性,已经集成到GitHub Copilot和Visual Studio Code中。

    这套模型家族发布之后,微软在AI能力上有了完整的自主权。以前微软要用推理模型,得找OpenAI要API;要用图像生成,也得依赖别人的模型。现在这些能力微软自己都有了。

    MAI-Thinking-1是个什么水平的模型

    微软对MAI-Thinking-1的定位是”中等规模模型”,350亿活跃参数。这个规模比GPT-4o或者Claude Opus要小,但微软的意思是:我们不需要最大的模型,我们需要的是性价比最高的模型。

    从基准测试的成绩来看,MAI-Thinking-1在软件工程相关的测试里达到了业界领先模型的水平。微软没有具体说是哪些模型,但”业界领先”这几个字,指向的应该是OpenAI的o1系列或者Anthropic的Claude。

    有个细节值得注意:微软强调这个模型”没有使用第三方模型的蒸馏数据”。这不是一句客套话。模型蒸馏是指用大型模型(比如GPT-4)的输出去训练小型模型,让小型模型”学会”大型模型的能力。如果微软用了OpenAI模型的蒸馏数据,那么微软的模型本质上还是在依赖OpenAI。现在微软明确说了”没有”,这意味着微软在训练数据层面做到了完全独立。


    微软为什么现在做这件事

    微软和OpenAI的关系在过去几个月里发生了很明显的变化。2026年初,微软和OpenAI结束了独家合作关系,微软被列为OpenAI的竞争对手。Build大会前不久,微软还推出了Scout,一个基于OpenClaw框架的个人AI助理,这个动作本身就说明微软在准备自己的AI产品路线。

    从商业逻辑上看,微软每年给OpenAI付的API费用不是一个小数目。如果微软自己的MAI模型能做到差不多好的效果,但成本只有OpenAI的一半或者三分之一,那么把Copilot背后的模型换成自己的,每年能省下的钱是相当可观的。

    另一个角度是竞争。Google有Gemini,Meta有Llama,Amazon有自己的模型家族。微软是唯一一个大规模推广AI产品(Copilot)但没有完全自主模型能力的巨头。这个短板,Build 2026之后,微软补上了。


  • 阿里发了款新模型,价格只有Claude的一半,性能却差不多

    阿里发了款新模型,价格只有Claude的一半,性能却差不多

    5月20日的杭州阿里云峰会上,高级副总裁刘伟光说了一句挺有意思的话:”我们正在打造中国AI工厂。”台下的人可能还没意识到,这句话背后的分量——阿里不再满足于做开源模型的社区宠儿,它要直接和Anthropic、OpenAI在企业级市场正面刚。

    “我们在各基准测试中排名靠前,超过中国所有其他AI模型。”
    ——阿里云首席AI架构师 周静仁

    当天正式发布的Qwen3.7 Max,是阿里第一款闭源旗舰模型。这个转向值得玩味:过去两年,阿里靠开源的Qwen 3.5、3.6系列占据了大量开发者生态,现在它想把这套生态转化成真金白银的企业收入。


    数字摆出来,确实有点东西

    先说硬指标。Qwen3.7 Max的上下文窗口达到100万tokens,比上一代Qwen 3.6的25.6万tokens提升了近40倍。这意味着什么?你可以把一整本技术手册、一个中等规模代码库,一次性塞进模型的”工作记忆”里,不用再做切片和向量检索。

    人工分析智能指数(AA Intelligence Index v4.0)给Qwen3.7 Max打了56.6分,综合排名第5,是发布时排名最高的中国模型。排它前面的是GPT-5.5(60.2分)、Claude Opus 4.7(57.3分),分差在误差范围内。

    换成大白话:阿里这套模型,智能水平和Claude Opus 4.7差不多,但定价只有后者的一半。

    评测维度 Qwen3.7 Max Claude Opus 4.7 GPT-5.5
    AA智能指数 56.6(第5) 57.3(第4) 60.2(第1)
    Terminal-Bench 2.0 69.7 65.4(4.6基线) 未披露
    SWE-Bench Pro 60.6 57.3(4.6基线) 未披露
    输入定价(美元/百万tokens) 2.5 5.0 5.0
    输出定价(美元/百万tokens) 7.5 25.0 30.0

    定价是亮点,但实际成本有点猫腻

    标题说”价格只有Claude的一半”,指的是官方标价。但用起来是不是真的只要一半,这里有个坑。

    Digital Applied的评测发现,Qwen3.7 Max的输出冗余度极高。在AA智能指数评测中,它一共生成了9700万输出tokens,而对比组的中位数仅为2400万tokens——是中位数的4倍。换句话说,同样回答一个问题,Qwen3.7 Max可能会输出4倍长度的”废话”。

    按7.5美元/百万输出tokens计算,同等任务下Qwen3.7 Max的实际输出成本是中等冗余度模型的2.5倍。所以标价和Claude Opus 4.7的实际差距,远没有一半那么大。

    不过,阿里给了一个挺实在的折扣:缓存输入0.25美元/百万tokens(90%折扣)。对于智能体任务(重复调用相同系统提示词),这个折扣能把成本压得很低。


    智能体编程是真本事

    Qwen3.7 Max的核心卖点是”智能体(Agent)能力”。阿里在发布会上演示了一个35小时自主运行的编程任务:模型连续运行35小时,完成1158次工具调用、432次内核评估、5次架构重设计,最终把Triton内核的几何平均速度提升了10倍。

    这个演示还没被独立复现,但基准测试成绩是实打实的。Terminal-Bench 2.0(测试多步骤智能体工作流)得分69.7,SWE-Bench Pro(真实软件工程任务)得分60.6,MCP-Atlas(模型上下文协议适配)得分76.4,均领先对比组。

    更重要的是兼容性。Qwen3.7 Max支持OpenAI兼容和Anthropic兼容两种API规范,可以适配Claude Code、OpenClaw、Qwen Code、Hermes Agent等多款智能体框架。已经用上Claude Code的团队,无需重写框架就能切换调用。


    两个地方要注意

    第一个是幻觉率。Qwen3.7 Max的AA-Omniscience幻觉率为22.9%,是同期前沿模型中最低的,较上一代Qwen 3.6的44.2%大幅下降。但这个提升部分来自”弃答策略”:模型答题尝试率从67.3%下降至48.0%,超过一半的问题它会选择”不知道”而非给出答案。

    这意味着什么?如果你做的是智能体编程,答错比弃答危害更大,Qwen3.7 Max反而有优势。但如果你做的是RAG管道、法律或医疗问答这些需要高召回率的场景,它的弃答率会让你头疼,这类场景建议用DeepSeek V4 Pro或Claude Opus 4.7。

    第二个是开源权重。阿里已公布计划推出开源的Qwen 3.7 Plus轻量版,但截至5月25日,HuggingFace的Qwen组织下仅公布了Qwen 3.6及更早版本权重,暂未放出Qwen 3.7系列权重。需要自部署的团队,目前还得用Qwen 3.6系列或者DeepSeek V4 Pro。


    战略意图比模型本身更值得琢磨

    把Qwen3.7 Max放在更大的格局里看,这事的意义不止是一款新模型发布。

    过去两年,中美AI模型之间的差距,外界普遍认为是”一个迭代周期”——大概6到9个月。Qwen3.7 Max的AA智能指数和Claude Opus 4.7只差0.7分,基本在误差范围内。这意味着,中国前沿AI已经不再落后西方实验室一个迭代周期,差距正在收窄到同一代内的不同批次。

    阿里的全栈布局也在同步推进。模型(Qwen3.7 Max)+ 自研芯片(Zhenwu M890 AI加速器)+ 智能体框架,这套组合在地缘政治压力下有特殊的战略价值——即便买不到英伟达最新芯片,阿里也有一套自己可控的技术栈。

    对于企业用户来说,Qwen3.7 Max目前是通过阿里云模型工作室、OpenRouter、Together AI、Qubrid AI四个渠道访问。建议针对自身任务子集做基准测试,结合实际冗余度调整后的成本做路由决策,而不是只看官方定价。

  • 微软和OpenAI分手了,现在准备开战

    上周的微软Build 2026大会,看上去像极了一个刚离婚的人急着装扮好自己、在社交平台发精致自拍。过去几年里,微软在AI这件事上几乎把所有筹码压在OpenAI身上,两家公司那场充满戏剧性的”联姻”闹了快两年,终于在4月下旬实质性分手——虽然微软至今还是OpenAI最重要的云合作伙伴,但那种”我们是一家人”的说法,现在已经没人再提了。

    “我们要进全球前四”

    微软AI负责人穆斯塔法·苏莱曼在Build大会期间接受The Verge采访时说了一段很直白的话:微软的目标是要证明自己能成为全球排名前四的AI实验室。他说的”目前有意义实验室只有三家”指的是Google DeepMind、OpenAI和Anthropic——言下之意,微软现在还排不进去。

    “我一直想打造全球最顶尖的前沿模型,完全多模态的那种。要做到这一点,我们必须证明自己可以从头开始完成所有需要的工作,而不是只从其他公司获取成果。”

    这段话的潜台词其实很清楚:以前微软不需要自己做模型,OpenAI帮它搞定了。现在不行了,得自己来。

    追赶推理模型

    这次Build大会上,苏莱曼发布了微软第一款具备推理能力的AI模型,叫MAI-Thinking-1,同时还一口气推出了6款聚焦图像、语音、转录、编程的新模型。说实话,这个动作晚了好几年——OpenAI早在2024年秋天就开始发布推理模型了,Anthropic也早就跟上了。

    不过苏莱曼强调了一个卖点:价格。他说在某些任务场景下,MAI-Thinking-1比OpenAI同类产品更便宜。这话现在听起来挺聪明的,因为最近已经有不少企业客户在抱怨AI工具太贵了,Uber甚至因为AI预算四个月就烧完整年额度而设了每员工每月1500美元的上限。

    苏莱曼还特意说明,MAI-Thinking-1的开发没有用任何”蒸馏”技术,也就是没有拿别的公司的AI模型来训练自己的模型。如果这款模型表现真的好,微软显然不希望外界觉得是OpenAI的功劳。

    “和OpenAI重新谈判合同是我们发展的关键节点。这意味着我们可以更大规模训练模型,明确追求完全拥有自主知识产权的超级智能,使用我们自己的数据,不做蒸馏,从零开始训练。”

    网络安全工具暗战

    纳德拉在大会上还重点介绍了一款叫MDASH的AI网络安全工具,说它集成了100个AI智能体,发现漏洞的能力”比任何单一模型都强”。这明显是在暗指Anthropic几个月前发布的Claude Mythos Preview——那款模型专门用来扫描代码漏洞,备受关注的同时也引发了不少担忧,因为让AI大规模扫描关键基础设施的代码,这件事本身就有风险。

    OpenAI也有自己的网络安全系统。三家公司现在大概率会在政府和企业的网络安全市场上正面竞争,而这两个市场正是它们现在最迫切需要开拓的。

    AI智能体的明争暗斗

    微软在AI智能体这条赛道上的处境其实有点尴尬。现在最火的开源智能体平台叫OpenClaw,它已经把”AI智能体应该是什么样”这件事的答案摆在了所有人面前。而OpenAI最近还把OpenClaw的创始人彼得·斯坦伯格挖走了。

    微软的策略之一是让OpenClaw和Windows系统好好配合。斯坦伯格本人还意外出现在了Build大会现场,上台演示了OpenClaw如何增强了安全性。他说现在企业用户可以在公司内部运行OpenClaw了,”我们甚至把挂接组件本身做成了插件”。

    但微软同时也在推自己的Copilot”超级应用”,里面的智能体叫”Autopilots”(副驾驶)。纳德拉介绍它们是可以”具备完整企业合规能力的自主、长运行智能体”。第一款正式推出的产品叫Scout,定位是”永远在线的个人智能体”。

    Autopilot智能体可以查看你的邮箱、加入Teams群聊、检查日历、发送每日简报。因为企业客户之前看过不少关于OpenClaw把系统搞崩的负面消息,所以微软在台上反复强调Copilot的安全工具和防护机制,明显是在安抚企业客户。


    微软的优势和疑问

    微软这么多年一直押注OpenAI,某种程度上确实导致它在AI竞赛里落后了。但现在OpenAI和其他竞争对手都在拼命往企业市场跑、急着盈利,微软反而有一些别人没有的优势:它已经有一大堆企业客户了,而且跟其他AI公司比起来,安全性和可靠性的口碑更好。

    跟谷歌一样,微软也有花不完的钱、用不完的计算资源、多元化的收入来源,这意味着它可以做高风险的大额投入,而不需要承担过大的生存压力。

    但问题也很多。微软这次一口气发布了7款新模型,说了各种基准测试的优势,但这不代表真实用户就会买账——一款领先一两周的新模型,很快就会被别人超过。AI超级应用到现在基本上还是一个没有经过市场验证的概念。微软进的是一个拥挤但整体表现仍然不太好的AI智能体市场,它的产品到底好不好用,目前为止还没有人真正见过。

    • 微软正式将OpenAI列为竞争对手,结束多年”独家合作”关系
    • MAI-Thinking-1是微软第一款自研推理模型,定价低于OpenAI同类产品
    • MDASH网络安全工具直接对标Anthropic的Claude Mythos
    • Copilot”Autopilots”智能体面向企业客户,强调合规和安全
    • 微软优势在于现有企业客户基础和安全性口碑,但产品尚未经市场验证