标签: AI模型

  • 微软不再只靠OpenAI了,它悄悄练出了一套自己的AI模型

    Microsoft MAI AI模型
    微软在Build 2026上发布的MAI模型家族,标志着AI战略的重要转向(配图由AI生成)

    Microsoft和OpenAI这对搭档,这几年几乎绑定在一起。Copilot用的是OpenAI的模型,Azure上跑的是OpenAI的API,连Windows里的AI功能都离不开GPT的底层支持。但这种关系正在起变化。

    在上个月的Build 2026大会上,微软悄悄干了一件大事——它发布了一套完全自研的AI模型家族,名字叫MAI(Microsoft AI)。其中最值得说的是MAI-Thinking-1,这是微软第一个自己从头训练的推理模型。

    说”从头训练”很重要。现在很多公司做模型都是拿别人的前沿模型来蒸馏,相当于抄作业。微软这次说的是,他们的训练数据是干净的,没有从第三方前沿模型里蒸馏,是自己从零开始训的。

    MAI-Thinking-1:350亿参数,MoE架构

    MAI-Thinking-1有多大?微软给的数字是350亿活跃参数。这里说的是”活跃参数”,因为模型用了MoE(混合专家)架构——每次推理只激活需要的部分,不用把整个模型都跑一遍。这样做的好处是效率高、成本低。

    性能方面,微软说它在SWE-Bench Pro上的表现跟Claude Opus 4.6差不多,但成本要低很多。GitHub的运营负责人Kyle Daigle说这个模型是冲着”高性能高效率”去的,token价格会很有竞争力。

    一口气发了7个模型

    但光有一个推理模型还不够。微软这次一口气发了7个模型,覆盖了文本推理、代码生成、图像生成、语音转文字、文字转语音整个链路。

    • MAI-Code-1-Flash:专门给GitHub Copilot和VS Code用的代码模型,主打推理效率高,适合大规模跑
    • MAI-Image-2.5:做文生图和图像编辑,在Arena.ai的图像榜单上排第二,微软说它是市面上性价比最高的图像模型
    • MAI-Voice-2:多语言语音合成,支持15种语言,还能保留说话人的声音特征
    • MAI-Transcribe-1.5:语音识别,支持43种语言,速度是同类模型的5倍

    为什么要独立?三个原因

    这些模型现在有的已经上线Microsoft Foundry,有的还在私人预览阶段。但方向已经很清楚了:微软要把AI的每一层都掌握在自己手里。

    这件事的背后是微软和OpenAI合作条款的重新谈判。新协议签下来,微软访问OpenAI模型和技术授权到2032年,但这个授权变成了非独占的——OpenAI可以卖给别人,微软也可以自己搞。

    微软为什么这时候要独立?有三个原因说得通。第一,不能把命门捏在一个外部供应商手里。第二,自己的模型可以针对自己的产品、硬件、企业客户做优化,不用迁就别人的路线图。第三,也是实在的,跑自己的模型可以省掉一大笔给第三方模型提供商的分成。

    AI操作系统的一步棋

    更值得关注的是,微软还在做一个叫Scout的永远在线的AI助手,基于OpenClaw开源项目。这东西能帮你准备会议、管日程、起草邮件,是往”AI操作系统”方向走的一步棋。有意思的是,微软之前一直把自主AI智能体当成安全风险来看,现在直接把它做成了产品功能。

    硬件端也在布局。微软发布了Surface RTX Spark开发者盒子,用Nvidia的芯片,让开发者可以在本地跑和测试模型。还有能在Windows PC上直接跑的Aion小模型,以及跟高通一起做的基于Android的AI设备原型。

    这些动作串在一起,看得出来微软的算盘:它不想只当OpenAI的分销渠道,它要自己做模型、自己做智能体、自己做硬件、自己做企业AI平台。对用微软产品的公司和开发者来说,这意味着以后会有更多选择,也可能用上更便宜的AI能力。

  • 你在AI模型里的”存在感”是多少?这个网站让你查自己在大模型里的分量

    你在AI模型里的”存在感”是多少?这个网站让你查自己在大模型里的分量

    你有没有试过在Google上搜自己的名字?以前这会让你看到自己的社交媒体、工作信息、也许还有一篇你忘了的多年前写的博客。但现在,越来越多的人发现:ChatGPT或者Gemini告诉他们关于自己的事情——而且有时候,那些事情是错的。

    两个前OpenAI员工Thomas Dimson和Joey Flynn(他们是在OpenAI收购他们的设计工作室Global Illumination时加入的)最近做了一个网站,叫In the Weights。这个网站干的事说起来有点滑稽:它帮你查,你在各个AI大模型里的”存在感”到底有多强。

    “权重”里的存在感,被量化成了一个分数

    这里的”权重”(weights)指的是AI模型训练完成之后,那些决定模型输出结果的数值参数。In the Weights网站宣称,它衡量的是”一个模型在不用网络搜索等工具的情况下,能多准确地回忆起某人”。

    具体做法是:向不同的模型(包括Grok、Gemini、多个版本的GPT、Claude,还有一些不太知名的模型)提问,问题类似于”某某是谁?给出最多10个结果,每个附一段简短描述和一个置信度。”然后网站把相似的描述聚类,给出一个”强度分数”。

    In the Weights网站界面
    像素风格的排行榜界面,灵感来自任天堂经典游戏

    《小鬼当家》主角居然排第一

    写这篇文章的时候,排行榜还在实时变动。目前排在第一位的是《小鬼当家》的主演Macaulay Culkin,强度分数988。歌剧演唱家Luciano Pavarotti紧随其后。这个排行榜本身就挺能说明问题的——哪些人”值得”被AI记住,似乎和名气、文化影响力有直接关系。

    本文原作者Anthony Ha的分数只有641,排在前6%。刚看到的时候还有点小得意,直到发现好几个同事的分数都比他高。当然,AI批评者Anthony Moser不客气地说,这玩意儿”本质上就是让13个聊天机器人告诉你关于你自己的事”。说得也没错。

    为什么有人在乎这个

    Dimson说,他做这个网站的灵感来自一个观察:2026年,在Google上搜自己已经不是那个”标准动作”了,越来越多的人从聊天机器人那里了解一个人。而”那么多人的生命,都以某种方式被编码进了AI大脑的浮点数字里”。

    他觉得,被AI”记住”这件事,触及了一个更深的焦虑——在AI越来越了解我们的时代,我们怎么确认自己还”存在”?把这个存在感量化成一个分数,放在一个像素风格的排行榜上,这本身就很2026年。


  • 一家迈阿密AI创业公司说它突破了LLM十年的数学瓶颈,外界将信将疑

    一家迈阿密AI创业公司说它突破了LLM十年的数学瓶颈,外界将信将疑

    一家迈阿密AI创业公司说它突破了LLM十年的数学瓶颈

    一家叫Subquadratic的迈阿密AI创业公司,上个月从隐身模式走出来,扔了一颗重磅炸弹:他们说自己解决了一个卡了LLM近十年的数学瓶颈。

    细节很少,很多人不信。但Subquadratic开始拿出证据了——他们公布了第三方公司Appen对他们的新模型SubQ的独立评估结果。结果看起来,这家公司的说法或许值得认真看待。

    Subquadratic AI模型突破LLM瓶颈
    Subquadratic声称SubQ模型突破了LLM的二次方计算瓶颈

    根据Subquadratic的说法,他们开发了一种全新的LLM,叫SubQ,比市面上任何其它模型都更快、更便宜、能耗也低得多。公司还声称,SubQ一次性处理的文本量是最其它大多数模型的12倍,可以执行分析数百份文档或者整个代码库这样的数据密集型任务。

    SubQ在编码等关键任务上的表现基本上能跟Google DeepMind、OpenAI和Anthropic的最佳模型持平。

    问题就在于,这家公司一开始除了少数几个自己发布的测试分数之外,几乎没提供什么证据。而且SubQ至今还没有广泛开放给公众试用。

    所以Subquadratic的说法遭到质疑一点也不奇怪。AI工程师Dan McArthur在X上总结了很多人的反应:”SubQ要么是自Transformer以来最大的突破……要么它就是AI圈的Theranos。”

    注意力机制

    要理解为什么Subquadratic的说法很重要,我们需要深入了解一下大多数LLM是怎么工作的。LLM内部的核心机制是一种叫做”Transformer”的神经网络,它运行一个叫做”密集注意力”的过程。今天的LLM通常将多个Transformer串联在一起。

    密集注意力的工作原理是这样的:当Transformer处理一段文本时,它首先将每个词编码成一个数字,然后将每个数字与那段文本中的每个其它数字相乘。一段10000个词长的文本会触发近5000万次单独的乘法运算。这是大量的计算,也是LLM以能耗巨兽著称的主要原因。

    随着文本长度的增加,计算次数会急剧上升。词的数量翻倍,计算次数大致翻两番,这种增长速度被称为”二次方扩张”。

    削减成本

    Subquadratic的解决方案是抛弃密集注意力,转而使用”稀疏注意力”,这大幅减少了所需的计算次数。稀疏注意力不是将分配给每个token的数字与每个其它数字相乘,而是只选择其中一些数字来相乘。

    “稀疏注意力说,不是所有那些关系都重要,因为它们本来就不重要,”联合创始人兼CTO Alex Whedon说。”如果你在读一本书,你不会去看第一个词和第二个词,第一个和第三个——那太疯狂了。”

    这听起来简单,但Subquadratic也不是第一个尝试的。以前选择哪些数字相乘的技术,都没能产生一个能像密集注意力一样好地捕捉文档含义的机制。

    Subquadratic声称终于破解了这个问题。他们将SubQ宣传为第一个在性能上能与主流密集注意力模型匹敌的稀疏注意力LLM。

    “从历史上看,大多数机制都使用固定模式,”Whedon说。”这相当局限。我们的机制动态选择哪些是重要的,这是对每段文本即时计算的。”

    测试结果

    第三方公司Appen评估了SubQ。在一个纯粹的速度测试中,Appen发现SubQ比使用以前稀疏注意力技术的模型快56倍。在LiveCodeBench编码测试上,SubQ得分89.7%,跟其它顶级编码模型差不多。

    成本方面,根据Subquadratic的说法,通过RULER 128测试,运行Anthropic的Opus 4.6要花费2600美元。SubQ花了8美元。

    SubQ似乎确实能够处理非常大的数据集。该模型有一个长达1200万token的上下文窗口。今天大多数顶级模型的上下文窗口是100万token长。


    尽管得分很高,在更多人亲自上手试用模型之前,一些质疑是有道理的。独立AI研究员Will Depue说:”他们可能做出了真实有用的东西。但公开证据还不足以证明他们解决了二次注意力瓶颈这一更强硬的说法。”

    与此同时,Subquadratic联合创始人Whedon坚持认为,做出不同的东西是他唯一的选择。”如果你想构建一个有竞争力的模型,你必须要有新想法,”他说。

  • Claude Design悄悄升级了编辑器,Anthropic这是要跟Figma、Canva正面刚?

    用AI生成设计图是一回事,能拿来干活是另一回事。Anthropic这几天给Claude Design推了一波更新,思路很直接——不让它只当”出图工具”,而是真的能介入日常设计流程。

    Claude Design更新后的编辑器截图
    Claude Design更新后的编辑器界面 | 图片来源:Anthropic

    新编辑器:终于能直接拖拽了

    之前用Claude Design生成出来的设计稿,好看是好看,但想改个按钮位置还得重新描述一遍需求,或者截图再喂回去。这次新编辑器给了拖拽、缩放、对齐这些基本操作,不用离开界面就能把元素摆到合适的位置。

    这件事的意义比看起来大。AI设计工具过去一直卡在”最后一公里”——图生成出来了,但设计师还是要打开Figma重新画一遍。现在Claude Design想让自己就是那个”最后一环”。

    导出到Adobe、Canva,不再画地为牢

    另一个实用的更新是导出选项变多了。现在Claude Design的项目可以直接导出到Adobe和Canva这些主流设计工具里。对设计师来说,这意味着AI生成的初稿不必困在Claude的界面里,能顺滑地衔接进已有的工作流。

    Anthropic的算盘大概是:你既然已经在用Claude生成设计了,为什么不干脆把后续编辑、导出、协作都在我这儿搞定?

    Claude Design和Claude Code打通了

    这次更新里最值得关注的一个细节:Claude Design和Claude Code做了联动。用户在Design里做的软件界面布局,可以直接转交给Claude Code继续写代码,不用截图、不用重新描述,Code能接着Design的内容继续干。

    这个方向其实挺自然的。Anthropic之前推Claude Code就是主打”能写代码”,现在再把设计端也捏进来,等于在推”设计→开发”的一体化工作流。Figma这些年一直在做DevMode、在做跟代码的衔接,Claude现在从另一端杀进来。


    Anthropic的野心不止于”聊天”

    Claude系列工具这段时间在”横向扩张”。从Claude聊天,到Claude Code写代码,再到Claude Design做设计,Anthropic在把Claude往”全栈创作工具”的方向推。每一步都在蹭Figma、Canva、VS Code这些老牌工具的基本盘。

    目前来看Claude Design还替代不了Figma,但它不需要替代——只要能吃掉”AI生成初稿然后直接迭代”这个场景,就已经是一块很有价值的地盘了。

  • 76名网络安全专家联名抗议:美国政府封禁Anthropic最强模型,是在削弱防御

    76名网络安全专家联名抗议:美国政府封禁Anthropic最强模型,是在削弱防御

    上周,美国政府对Anthropic的Fable和Mythos模型下达了出口管制令,理由是国家安全。Anthropic随即暂停了全球用户对这两款模型的访问。

    事情到这里,看起来又是一个AI监管收紧的故事。但接下来的发展有点出人意料——76名网络安全专家联名写了一封公开信,要求政府撤销这道命令。

    网络安全AI概念图
    网络安全专家联名抗议Anthropic模型出口管制令

    联署名单相当豪华

    这份公开信的签署者里有不少业内重量级人物:前Facebook首席安全官Alex Stamos、漏洞赏金平台Bugcrowd创始人Casey Ellis、著名密码学家兼前苹果安全设计经理Jon Callas、计算机科学家Paul Vixie、前Block应用安全工程负责人Dino Dai Zovi、Luta Security创始人Katie Moussouris,以及安全意识培训公司SocialProof Security的CEO Rachel Tobac。

    他们在信里说得很直接:把最好的模型从网络安全防御者手里拿走,而没有充分的理由,这是”危险的”。

    “当我们的对手在快速进步的时候,把最好的能力从防御者那里拿走,是没有充分理由的危险行为。”

    禁令到底是怎么来的

    Anthropic今年4月推出Mythos预览版时,声称这个模型找安全漏洞的能力太强,所以需要严格限制访问,防止恶意黑客或外国对手拿来在互联网上搞破坏。实际操作里,Anthropic只给了大约50家公司初始访问权限,最近才扩展到15个国家的约150个组织。

    6月9日,Anthropic发布了Fable,这是Mythos的公开版本,但加了严格的护栏,阻止它在生物、化学和网络安全领域的使用,同时也防止别人通过”蒸馏”来复制这个模型。

    问题是,Fable的护栏严格到了许多网络安全专家发现它基本拦掉了任何与网络安全相关的提示词。

    亚马逊的论文:是真越狱还是误报

    据信,白宫的出口管制令可能源于一份亚马逊研究人员的论文,论文展示了一个可以绕过Fable护栏、解锁其Mythos级别能力的方法。

    但联署人之一Katie Moussouris在审阅了这份尚未公开的论文后,给出了完全不同的判断:这根本不是真正的越狱。

    她写道,研究人员只是让Fable去修复含有”故意植入的漏洞”的开源代码——而这正是模型最初拒绝”审查代码安全问题”之后发生的事情。

    “论文里描述的行为没办法被真正修复,任何尝试都只会削弱模型用于防御的能力。”Moussouris写道,”防御者需要能够要求AI修复文件里的bug、解释修复为什么重要、以及编写确认补丁有效的测试。这不是护栏绕过,这是AI模型能为防御性安全做的最有价值的事情:执行防御者每天都在跑的’发现、修复、测试’循环。”

    专家们真正担心的是什么

    公开信里还指出,亚马逊论文里描述的方法,在OpenAI的GPT-5.5上、在Anthropic自己公开可用的Claude Opus 4.8和Sonnet上、”甚至在中国的Kimi 2.7这样的模型上”都能复现。

    也就是说,封掉Fable和Mythos,并没有真正消除这个所谓的”漏洞”——它只是让美国自己的防御者用不上好工具,而对手那边照样能用上类似的能力。

    专家们的要求很明确:他们想要的是由”民主的规则制定程序”产生、基于产业和学术专家科学研究、透明且公平执行的监管,并且”只以最低必要程度使用,以确保美国公众的安全”。

  • 六月AI大模型”挤爆了”:GPT、Claude、Gemini、Grok扎堆发布

    六月AI大模型发布潮
    2026年6月,AI大模型迎来史上最密集的发布潮

    2026年6月,AI圈有点挤。往常一家头部公司发新模型,行业得消化好一阵;这个月倒好,OpenAI、Anthropic、Google、xAI四家差不多同时亮剑,GPT-5.6、Claude Sonnet 4.8、Gemini 3.5 Pro、Grok 5扎堆亮相,上下文窗口一口气推到150万Token。有人开玩笑说,AI圈的六月像双十一预售——不约而同,就怕自己晚一步。

    意外曝光的”后台日志”

    这一波发布潮,最早是从”泄露”开始的。今年4月下旬,有开发者发现OpenAI Codex的后台日志里短暂出现了一个陌生代号——GPT-5.6。没过几天,Claude Code的源码里也被人扒出了Claude Sonnet 4.8和另一个叫Jupiter V1的内部模型代号。

    两家公司都没官宣,但开发者社区已经炸了。评论区最高的赞只有一句话:”When launch?” 从GPT-5.5发布到5.6现身,中间只隔了一个多月。大模型迭代周期从”数月”缩短到”数天”,AI军备竞赛的节奏已经完全不一样了。

    四家同时亮剑,打的什么算盘?

    Google的Gemini 3.5 Pro走的是”长上下文”路线,150万Token的窗口意味着你可以把一整本书丢进去,还能接着对话。这个方向很Google——他们有搜索基础设施的底子,处理超长文本本来就是强项。

    Anthropic的Claude Sonnet 4.8继续在”安全”和”可控”上做文章,面向企业用户的味道很浓。OpenAI的GPT-5.6则更像在补全5.5没做完的事——据泄露出来的信息,5.6在代码能力和多模态理解上有明显提升。

    马斯克的Grok 5是最难预测的。xAI的数据中心折腾了好几个月(SpaceX的Colossus 1因为延迟问题租给了Anthropic和Google),但Grok 5如果准时出来,打的就是”实时信息”这张牌——毕竟Grok直接接Twitter/X的 firehose,这是其他家都没有的数据优势。

    国产阵营也没闲着。Qwen3.6、GLM-5.1、Kimi也在6月前后密集更新,而且走的是开源路线。国际市场打性能,国内市场打价格+开源,两边都在抢时间窗口。

    模型越强,商业越难

    密集发布背后有一个不那么显见的问题:模型能力越来越强,但怎么赚钱反而越来越难。Gemini 3.5 Pro的150万Token上下文听起来很厉害,但每次推理的计算成本也跟着涨。GPT-5.6能力更强,但不降价就没人用,降价就亏本——这是所有头部玩家都在面对的困局。

    一个正常的月份里,一家发新模型就够行业消化一阵了。但2026年6月,我们迎来的是四家同时发布。这不是巧合——大家都在抢同一个时间窗口,抢同一批企业客户,抢同一批开发者的注意力。挤就挤吧,用户倒是有的挑了。


    📎 相关信息:GPT-5.6与Claude Sonnet 4.8泄露分析、June 2026 AI Model Release Tracker
  • Anthropic的AI模型被政府盯上了,Fable 5和Mythos 5遭全面封禁





    Anthropic的AI模型被政府盯上了,Fable 5和Mythos 5遭全面封禁

    Anthropic这两款模型——Fable 5和Mythos 5,本来是自家的主力产品,结果上周五突然被政府一纸命令给封了。

    Anthropic办公室
    Anthropic总部 | 图片来源:The Verge

    命令的理由是”国家安全”,要求Anthropic切断所有外国公民对这两个模型的访问权限,不管这些人是在美国境内还是境外,连Anthropic自己的员工也在受限范围内。

    公司发了一份声明,说他们在配合政府的要求,但话里话外也透着不解。政府”没提供国家安全关切的具体细节”,也就是说,Anthropic到现在也不知道自己到底踩了哪条红线。

    越狱漏洞到底有多严重?

    更有意思的是,政府跟Anthropic说的是这两个模型存在”潜在越狱(jailbreak)”风险,但都是口头说的,没给书面证据。

    Anthropic自己评估了一下,觉得发现的那些漏洞都挺轻微的,而且同类问题在GPT 5.5身上也能看到。公司在声明里把自己合规的努力都列出来了:跟美国、英国政府都有合作,数据保留政策也做了调整,就是为了追踪有没有人拿这些模型干坏事。


    亚马逊CEO的”神助攻”?

    这事其实折射出一个更大的问题:AI公司现在夹在政府监管和商业利益之间,左右为难。政府一句话,产品就得下线,连为什么都不一定告诉你。

    而对Anthropic来说,Fable 5和Mythos 5都是花了大价钱训练的,这一刀切下去,损失不小。有意思的是,就在政府禁令出来之前,亚马逊CEO安迪·贾西还专门跟美国官员提过,说Fable存在安全隐患。这是不是有点太巧了?

    • 亚马逊是Anthropic的重要投资方,此举可能是在为自己的AI产品扫清竞争对手
    • 政府以国家安全为由封禁AI模型,但拒绝提供具体证据,这种操作引发行业担忧
    • AI公司面临的监管风险远超预期,合规成本将成为重要考量因素

    不管真相如何,这件事给整个AI行业敲了个警钟:别以为训练出一个厉害的模型就高枕无忧了,政府要是觉得你有风险,随时可以让你关门。


  • 微软搞出自家推理模型,不再只靠OpenAI了





    微软搞出自家推理模型,不再只靠OpenAI了

    微软搞出自家推理模型,不再只靠OpenAI了

    2026年6月3日 · IT之家

    微软在Build 2026开发者大会上扔出一个信号:他们不再只做OpenAI的”包装工”了。七款自研AI模型一同亮相,其中最引人注目的是MAI-Thinking-1——微软第一款高级推理模型。

    这款模型有350亿活跃参数,规模不算大,但微软强调它是从零开始用干净数据训练的,没有走捷径去蒸馏第三方模型(这话里带着对谁的不满,大家心里有数)。在软件工程相关的基准测试里,它的成绩能跟业界顶尖模型掰手腕。

    微软AI CEO穆斯塔法·苏莱曼在台上重申了他们的理念——”人文主义超级智能”。这话听着有点虚,但配合这一波模型发布,意思很明确:微软要在AI底层能力上自己掌舵,而不是永远跟在别人后面。

    一口气发了七款模型,覆盖全场景

    除了MAI-Thinking-1,微软这次还端出了覆盖图像、语音、编程的完整的自研模型矩阵:

    • MAI-Image 2.5 和 MAI-Image 2.5 Flash —— 支持文生图和图像编辑,Flash版本主打速度
    • MAI-Transcribe-1.5 —— 语音转写,速度是竞争对手模型的五倍,开会录音整理终于不用等半天
    • MAI-Voice-2 —— 语音合成,新增15种语言支持,Flash版本即将推出
    • MAI-Code-1 —— 编程辅助,推理效率做了优化,已经集成进GitHub Copilot和Visual Studio Code

    这套组合拳打出来,微软在AI模型层的能力版图像是补齐了。过去大家提起微软的AI能力,第一反应是”他们用OpenAI的技术”,现在这个故事要改写了。

    为什么要自己搞模型?

    这个问题其实不难回答。微软跟OpenAI的关系一直以来都有点微妙——既是最大的金主(投了上百亿美元),又是 deepest 的商业合作伙伴,但核心技术却攥在别人手里。

    OpenAI有自己的商业化节奏,有自己的产品规划,微软想做的一些事情不一定跟OpenAI的利益完全对齐。比如微软希望把AI能力深度集成到Windows、Office、Azure里,这种底层整合如果完全依赖外部技术,长期来看是有风险的。

    还有一个更现实的原因:成本。每次调用OpenAI的API都是有成本的,如果微软能把一部分推理 workload 迁移到自家模型上,这笔账长期来看是划算的。


    MAI-Thinking-1到底强在哪?

    微软对这款模型的技术细节还守得比较紧,目前公开的信息有限。可以确定的是:

    • 中等规模(350亿参数),不是那种动辄万亿参数的”暴力美学”路线
    • 专门优化了推理能力,适合需要多步逻辑推导的任务
    • 软件工程基准测试成绩突出,这对微软的基本盘(开发者工具)来说很有意义
    • 干净数据训练,不依赖第三方模型蒸馏——这一点微软特意提了,态度很明确

    这套说辞听起来是不是有点耳熟?Anthropic也说自己”更安全、更负责”,谷歌也说自己”最开放”。各家都在讲自己的故事,最终还是得看实际用起来怎么样。

    对行业意味着什么

    微软这一步,本质上是把”模型层”的主动权往自己手里挪。过去几年AI圈的故事线是”OpenAI发明未来,微软帮忙卖出去”,现在微软想说的是”我们也能发明未来”。

    这对OpenAI来说未必是坏事。微软有了自研模型,反而可能在跟监管、跟合作伙伴谈判的时候有更多筹码,最终对OpenAI也是加分项。但如果哪天微软觉得自研模型够用了,OpenAI失去微软这个最大金主的风险也不是零。

    这场AI大戏,越来越有意思了。


  • Oculus 创始人做了一款对话 AI,说话像人一样自然,iOS 版上线了

    Oculus 创始人做了一款对话 AI,说话像人一样自然,iOS 版上线了

    你用 ChatGPT 语音模式的时候,有没有过这种感觉:它回答太快了,快到不自然;或者它开始”思考”的时候,对话就卡住了,像打电话突然没了声音。

    Oculus 的联合创始人早就注意到了这个问题。他们离开 VR 赛道,做了一个叫 Sesame 的对话 AI,5月28日刚在 iOS 上线了公开预览版。

    Sesame AI 对话界面
    Sesame iOS app 对话界面(图片来源:TechCrunch)

    说话的时候也能”思考”

    Sesame 解决的核心问题其实很朴素:快速回复和周全思考之间,向来有个矛盾。慢一点通常更准确,但等太久又让人觉得不自然。

    他们的做法是:一边说话,一边在后台跑多个并行搜索,把结果融进回复里。所以对话不会卡住,AI 甚至可以在句子中间调整内容——就像人突然想起一件要补充的事,顺口就带出来了。

    四个 AI 角色,各有各的性格

    目前 app 里有四个 AI 代理:Maya、Miles、Simone 和 Charlie,每个都有自己的声音、性格和记忆。Maya 和 Miles 在之前的技术预览版里已经上线过,红杉资本说前几周就有超过 100 万人体验了这两个代理。

    Beta 测试期间,团队根据反馈加了不少功能:带图片结果的搜索卡片、记录要点的笔记功能、不方便说话时用的文本模式,以及一个”隐身模式”——对话内容不会被记入记忆。

    Sesame 在发布声明里写了一段话,很能代表他们的产品思路:”快速回复和花时间构思周全的回复之间存在着固有的矛盾。更慢的回复通常更准确,但如果耗时太久,也会让人感觉不自然。”

    下一步是智能眼镜,再下一步是”替你行动”

    这款 iOS app 只是 Sesame 更大计划的第一步。团队透露,他们预计在 2027 年推出智能眼镜产品。更远一点的规划是:这些 AI 代理不只是陪你聊天,还能代表你采取行动——这也是它们被称为”代理”而不是”聊天机器人”的原因。

    这个方向其实比聊天更有想象力。现在的 AI 工具,不管是对话型的还是代理型的,都需要你先把需求想清楚、表达清楚,有时候甚至还得知道”应该怎么实现”。但一个能自然对话的代理,可以帮你把这一步也给省了。

    目前这个 iOS app 已经在 39 个国家上线,完整功能完全免费,不过新注册用户可能还是会遇到一个短暂的等待名单。Android 版本也计划在未来推出。

    Sesame 去年刚从红杉资本等机构拿到 2.5 亿美元的 B 轮融资。Oculus 联合创始人的背景,加上红杉的押注,让这家公司在对话 AI 赛道里显得挺特别。


  • AI记忆工具翻车了?研究发现它反而让模型变得更蠢

    AI公司一直在推一个卖点:你的AI助手会用得越久越懂你。它记得你上次聊到一半的话题,知道你喜欢什么样的回复风格,甚至会把你的偏好喂给下一次对话。理论上,这应该让AI变得越来越好用。

    但这个理所当然的假设,最近被AI公司Writer的研究人员给砸了。本周发布的两篇论文显示,流行的记忆系统不但没让模型变得更聪明,反而可能让模型表现变差——而且差得挺明显。

    记忆越多,错得越多

    Writer的AI负责人Dan Bikel是这两篇论文的参与者之一。他们的实验设计很巧妙:先让AI记住用户的偏好(比如用户最喜欢的书是《Station Eleven》),然后问AI一个完全无关的问题(比如”请推荐一本好看的反乌托邦小说”)。

    结果有点尴尬。AI在回答无关问题时,提到《Station Eleven》的概率大幅上升——哪怕这个问题跟用户最喜欢的书八竿子打不着。如果用的是Mem0、Zep这类记忆压缩工具,这种”强行关联”的倾向会更明显。

    论文里写得很直白:所有记忆系统本质上都分不清哪些是相关上下文、哪些是干扰信息。它们会严重损害输出的多样性和创造性,还会引入非预期的偏见,限制系统的实用价值。

    迎合你,牺牲事实

    第二个实验更值得警惕。研究人员先给用户灌输一个关于金融的错误认知,然后让AI分析某家公司的业绩。结果:AI获取的上下文越多,表现越差。

    具体案例是这样的:如果没有开启记忆/个性化功能,AI模型能正确判断某家公司是资本密集型业务,且客户流失率很高。但开启相关功能后,AI会”乐于”修正自己的答案来迎合用户的错误认知——或者直接根据用户的偏好给出错误结论。

    Bikel说得很清楚:”我们想明确,模型在多大程度上是有用地关注用户偏好,又在多大程度上会给出错误答案。每多存储、检索一次用户偏好,你面临的风险就会不断上升。”

    不是所有模型都中招

    这个研究有个例外:Anthropic近期发布的Opus 4.8模型经过了专门训练,会主动反驳用户输入的错误信息,不会被这类问题影响。但研究人员发现的规律在其他大部分模型中都普遍存在。

    这说明AI的上下文平衡非常脆弱。本应提升体验的记忆工具,如果打破了这种平衡,就会产生非预期的负面影响。AI公司一边大肆宣传记忆功能的好处,一边可能没完全想清楚代价是什么。


    这件事的讽刺之处在于,记忆功能一直是AI助手”个性化”卖点的核心。AI公司花了不少精力宣传”它会越来越懂你”,但现在研究发现,懂你太多可能反而是一件坏事。

    对于普通用户来说,这也许是个提醒:AI助手记得你上次说了什么,不一定总是好事。它可能记住了你的偏见,然后在你不知道的时候,把偏见塞进了回答里。

    📎 原文来源:How memory tools can make AI models worse | TechCrunch / Russell Brandom