标签: Mira Murati

  • Mira Murati交出首款模型Inkling:开放权重,还大方承认自己不是最强

    前 OpenAI 首席技术官 Mira Murati 憋了一年半,终于交出了第一份答卷。她创办的 Thinking Machines Lab 在周三上午发布了首款模型 Inkling,最扎眼的一点是:它是开放权重的。跟 OpenAI、Anthropic、谷歌那些锁在服务器里的旗舰模型不一样,外面的开发者和公司可以直接把它下载下来,拆开、改、跑在自己的机器上。

    Mira Murati与Thinking Machines
    Mira Murati 创办的 Thinking Machines 发布首款开放权重模型 Inkling|图源 TechCrunch

    Inkling 是个混合专家(MoE)模型,总参数 9750 亿,但每次干活只调用其中一小部分,大约 410 亿——这套设计能让超大模型跑起来又快又省。它从零训练,喂进去 45 万亿 token 的文本、图像、音频和视频,而且是原生跨这几种模态推理,不是后面硬接一个视觉模块。这也是这家公司闷头搞了一年半基础设施之后,第一次拿出能公开检验的东西。

    开局不吹牛,反而承认自己不是最强

    最反常规的是它的姿态。大部分模型发布都是先甩一张跑分图出来,Inkling 却在材料里白纸黑字写着:这不是当下最强的模型,无论开源还是闭源。它主打的是均衡好用,能给出带”把握程度”的回答,遇到没底的地方会直接标出不确定,而不是硬猜;用户还能自己调”思考强度”,想快就牺牲点质量换速度。官方说在某个编程基准上,它达到英伟达 Nemotron 3 Ultra 同等水平时,只用了大约三分之一的 token。

    “我认为模型选择很重要,但它不是消耗大部分精力的地方。”这句话来自另一家公司,却恰好点中了 Thinking Machines 的核心赌注——模型本身正在变成”配料”,怎么用才是关键。

    那问题来了,这东西到底卖给谁?答案很明确,是企业。但 Thinking Machines 没把它当成品来卖,而是当”起点”——让企业拿去,用自家的模型定制平台 Tinker 在自己的数据上微调。代价是,客户得自己保证微调后的模型安全,而且微调这活儿本身就需要真本事的机器学习人才。

    赌的是”人人同款”终将败给”自己定制”

    Thinking Machines 上周专门发了篇文章给这次发布铺垫:一个模型被某家公司集中训练好、然后定死不动,表现会输给企业自己去塑造的模型,因为太多专业知识是攥在具体的人手里的。说白了,中心化的大厂在给所有人卖同一件产品,反复由自己打磨;而愿意拥有并定制自家模型的企业,能从里面榨出多得多的价值。

    这个论调正在变响。微软 CEO 纳德拉——他家在 OpenAI 和 Anthropic 都砸了几十亿——上周日发博客警告说,企业用闭源 AI 其实付了两遍钱:一遍是订阅费,另一遍是把上千条提示词和纠正里藏着的业务知识,白白交给了模型,最后被吸收进下一代版本。Hugging Face 的 CEO 也有类似判断,觉得前沿模型以后多半只用来做实验和高价值任务,真正的生产活会转向私有或开源方案。


    最有说服力的证据,来自一家对冲基金

    支撑这套逻辑最硬的一个案例,来自和全球最大对冲基金桥水的合作(顺带说明,桥水并不是 Thinking Machines 的投资方)。两边研究员拿一个现成的开源模型,用桥水自己的金融专长继续训练,结果在金融推理测试上拿到 84.7%,压过了顶尖闭源模型,运行成本大约只有十四分之一——当然,这是两家自己评的,不是第三方独立测试。

    • 速度是另一张牌:OpenAI 从技术到有收入大概花了五年,Anthropic 约三年,Thinking Machines 说自己九个月就做到了;
    • 2025 年它拿下约 20 亿美元种子轮,估值 120 亿美元,当时是史上最大种子轮,Inkling 是这笔钱换来的第一份实打实的成果;
    • 它也坦承 Inkling 部分用到了别家开源模型(包括月之暗面的 Kimi K2)的输出,也就是业内争议不小的”蒸馏”做法。

    悬念还是那个老问题:企业到底想不想要一个得自己动手调的模型,而不是开箱即用的?微调要占用的工程时间,很多公司根本挤不出来。但如果 Thinking Machines 赌对了,前沿模型这场比赛一直在为错的东西较劲,那 Inkling 就不必在排行榜上赢过 GPT 或 Gemini,它只要有足够多的开发者愿意在它上面搭东西,而不是继续租别人的黑箱,就够了。

  • 消失18个月后,Mira Murati谨慎地回到了聚光灯下

    Mira Murati其实不太喜欢站在台上。在OpenAI担任CTO的那些年,她虽然会出席公开场合,但很少充当公司的对外门面。2024年离开OpenAI、创办自己的公司Thinking Machines Lab之后,她更是几乎从媒体视野里消失了。

    Mira Murati在彭博社活动上
    Mira Murati在彭博社活动上谨慎露面(图源:TechCrunch)

    所以当她本周在旧金山接受彭博社采访时——这是她大约18个月来第一次重要的媒体露面——即便她说话极其谨慎,依然值得拿出来聊聊。

    时机选得不错。Thinking Machines已经幕后运作了一年半:筹钱、招研究员,还推出了一款叫Tinker的产品,一个用来微调开源AI模型的API。但竞争对手们没闲着。她曾经工作了6年的OpenAI一直处在新闻漩涡中心;Anthropic现在是所有人都在谈论的名字;马斯克的xAI已经被并入SpaceX,准备搞一场规模惊人的公开募股。在这种环境下,一直保持低调的边际收益越来越小,到了某个节点,你得制造一些动静,至少让市场记得你还活着。

    她正在做的东西,听起来确实不一样

    Murati用这次彭博社露面 preview 了 Thinking Machines 所谓的”交互模型”——一种根本不同的AI交互界面。她告诉采访者Emily Chang,跟当前大多数AI产品采用的轮流式、提示-响应模式不同,他们家的模型设计用来在200毫秒的间隔内处理连续的音频、文本和视频流。

    理念是,它们能更接近实时地捕捉人类交流的特性——打断、中途修正,甚至思考时的停顿。

    但Murati很谨慎地把它定位成第一步,不是成品,而且她拒绝给出任何产品的具体发布日期。这种克制反而让人觉得,她可能在认真做东西,而不是在用PPT融资。

    那件让所有人记住她的事

    她还回答了那个让她第一次广泛进入公众视野的事件的问题:2023年11月那混乱的一周,OpenAI董事会解雇了Sam Altman,她成了临时CEO。在公司内部,这件事被称为”the blip”。

    Murati说,她对那几天里每个时刻的决定都很清楚——保护使命和团队是贯穿始终的主线,即使从外面看情况好像失控了,这些选择也显得理所当然。她说,如果不是她参与了那奇怪的五天及其后续,公司可能已经”崩溃”了。

    但她承认,意图清晰不代表判断正确。事后看来,她会更努力地争取更多信息和一份实际的过渡计划。

    她真正担心的事

    当被问到是否还信任她的前老板时,她把话题绕开了,转向了一个她反复提及的更大担忧:太多重大决策集中在太少人手里——不仅在OpenAI,整个行业都是这样。

    她说,她的担忧与其说是任何个别领导者的品格,不如说是结构性制衡的缺失。好人也会做错误决定,善意的组织也会偏离方向。人们太关注”美德”,而对”治理”关注太少。


    Murati出生在阿尔巴尼亚,说话带有轻微的东欧口音。她反驳了不可避免的”反乌托邦”或”乌托邦”框架,认为这两种结果都不是注定的,我们现在所处的时期将决定事情会向哪个方向发展。不过她也明确说了,如果人类过早地放开控制权,未来将会变得非常不同,而且不会更好。

  • 前OpenAI CTO Murati时隔18个月露面,说AI行业治理缺位比个人品格更值得担心

    Mira Murati又出现在镜头前了。这位前OpenAI CTO、现在Thinking Machines Lab的创始人,在过去18个月里几乎没怎么公开说过话。这次接受TechCrunch采访,她选得很谨慎,没有把公司底牌全亮出来。

    为什么现在出来讲话

    Thinking Machines Lab成立快一年半了,这段时间一直在低调干活:融资、招人、做了一个开源AI模型微调的API产品叫Tinker。但同行没闲着,OpenAI、Anthropic、xAI这些实验室一直在刷存在感,长期低调的收益在递减。

    她需要一个时机,让市场和人才记得Thinking Machines还在牌桌上。这次采访,就是这一步。

    她预告了一个新产品方向

    Murati透露,他们正在研发一种她称之为”交互模型”的东西。这类模型会打破现在AI产品”你问一句、它答一句”的轮次模式,改为以200毫秒为间隔,持续处理音频、文本、视频的流输入。

    这样做的目标是捕捉人类交流里的那些细节:打断、中途修正、思考时的停顿。它更接近实时交互,而不是现在的”问答机”模式。Murati强调这只是第一步,没有给出具体上线时间。

    Mira Murati采访
    Mira Murati接受采访(图片来源:TechCrunch)

    2023年那场”换帅风波”,她这么看

    当被问到2023年11月OpenAI董事会突然开除Sam Altman、后又让他回归的那场风波时,Murati把它称为”小插曲”。她说当时做决策的核心逻辑是保护公司使命和团队,如果没有她的参与,公司很可能会”分崩离析”。

    但她也承认,当时应该更积极推动信息公开、制定更好的过渡方案、提升透明度。当被直接问及是否还信任前老板Sam Altman时,她没有接话,转而去谈一个更结构性的话题。

    她真正担心的事:治理,而不是人品

    Murati回避了关于Altman个人信任的问题,转而强调:整个AI行业都存在重要决策集中在少数人手中的问题。相比个人品格,她更担心的是治理结构缺乏制衡机制。

    这个观点值得琢磨。行业里很多人盯着Altman、Musk、Zuckerberg这些人的性格和诚信说事,但Murati指向的是制度层面:如果决策权本身就过度集中,换谁来坐那个位置,风险都还在。

    她认为行业过于关注”道德正确性”,却在制度建设上走得不够快。这句话某种程度上也是在为自己的创业方向背书:Thinking Machines要做的事情里,治理和安全是核心议题。

    对AI的未来,她没有走极端

    Murati明确表示,她既不认同”AI必然带来反乌托邦”的悲观论调,也不认同”AI必然带来乌托邦”的乐观版本。她认为当前阶段的发展走向将决定最终结果。

    她多次强调一个观点:如果人类过早放弃对AI的主导权,未来会变得完全不同,且不会更好。这个说法不极端,但立场很清楚:AI应该被人类主导,而不是反过来。


    Murati这次露面,更像一个精心设计的重新开始,而不是一次全盘托出。她没有公布新产品发布日期,没有透露Thinking Machines的具体技术路线图,也没有深度评价前东家的现状。但她释放了一个信号:Thinking Machines还活着,而且在认真做东西。至于做的东西能不能打过OpenAI和Anthropic,那是下一阶段的问题了。

  • 前OpenAI CTO放大招:Thinking Machines实时交互模型200ms响应

    前OpenAI CTO放了个大招

    Mira Murati离开OpenAI自己创业才一年多,前几天直接把第一个模型甩了出来。不是那种传统的”你问一句我答一句”的回合制AI,而是真正能实时互动的交互模型。200毫秒的响应延迟,你随时可以插话打断,AI也能同时听、说、看、调用工具。

    这套系统叫TML-Interaction-Small,采用的是2760亿参数的混合专家架构,每次推理只激活120亿参数。关键是它把前后台拆开了:前台专门维持对话流畅,200毫秒为一个时间片持续接收信息;后台负责复杂推理和工具调用,结果流式返回前台,不会打断你的说话节奏。

    200毫秒是什么概念?人说话时自然的停顿间隔大约是200-300毫秒。也就是说,这个模型的响应速度已经接近人类对话的节奏了。

    不只是速度快

    以前那些号称”实时”的语音AI,本质上都是把语音识别、语言模型、语音合成这几个模块拼在一起,中间靠外部工具协调。你说话的时候AI只能等着,说完一段它才开始处理,这就是典型的”回合制”。

    Thinking Machines这套系统是原生实时交互,从架构层面就设计成可以交错处理音频、视频、文本的流数据。它用的编码方案也挺聪明:音频用dMel轻量编码,图像用hMLL编码,所有组件跟Transformer主干网络一起训练,不用单独的编码器拖慢速度。


    在FD-Bench v1.5基准测试里,这个模型拿了77.8分。作为对比,OpenAI的GPT-Realtime-2和谷歌的Gemini 3.1 Flash Live都没超过它。响应延迟0.40秒,比GPT-Realtime-2快了大概4倍。

    钱和人都不缺

    Murati这个人挺厉害的,在OpenAI当CTO的时候就是技术核心人物之一。她出来单干,投资人直接给了20亿美元种子轮,估值砸到120亿美元。团队里还有FAIR实验室的前研究员Piotr Dollar这种级别的人物。

    算力方面也没拖后腿,跟英伟达、谷歌分别签了超过10亿美元的合作协议,拿到基于GB300芯片的超级计算资源。这种配置,基本上就是把”我要做顶级AI”写在脸上了。

    团队自己说几个月里迭代了12个版本,训练日志写了137页。这种折腾劲,倒是很像早期OpenAI的风格。


    真正的交互应该是什么样

    现在大家用ChatGPT语音模式或者Alexa那种智能助手,体验上总感觉差了点什么。你不能在它说话的时候插话,它也不能在你还在想怎么表达的时候就开始回应。这种”半双工”的交互方式,本质上还是把AI当成一个高级搜索引擎来用。

    Murati想做的,是让AI真正像一个人一样跟你对话。你可以随时打断,它可以同时处理多件事,后台在跑复杂推理的时候前台对话不受影响。这种体验,才是大家一直在说的”贾维斯”该有的样子。

    当然现在这个模型还只是研究预览版,正式开放还要等几个月。但方向已经很明确了:AI交互的下一个战场,不是谁的模型参数更多,而是谁能真正做到”自然对话”。

  • Thinking Machines Lab发布实时交互模型:Mira Murati跳出OpenAI后的第一枪

    Mira Murati沉默一年多后,交出了第一张答卷

    前OpenAI首席技术官Mira Murati离开老东家快两年了。她创办的Thinking Machines Lab(TML)在2026年5月11日终于放出了第一个研究预览模型——TML-Interaction-Small。这不是又一个”我们有大模型要发布”的常规操作,而是一个直接挑战现有AI交互范式的新尝试。

    Murati这个人的履历不需要太多介绍:OpenAI的GPT系列和Claude的竞速时代,她坐在CTO的位置上。2023年Altman被董事会开除那几天,她还短暂当过OpenAI的临时CEO。现在她带着一批OpenAI老部下另起炉灶,拿了两轮总共20多亿美元的融资,估值一度冲到500亿美元。

    现有AI都说自己”实时”,但你说话的时候它还在等你停;TML想做的是你随时可以插话,它随时可以接话。

    200毫秒的”微轮次”设计

    目前的实时语音模型——包括OpenAI的GPT-Realtime和Google的Gemini Live——都有一个共同的设计妥协:它们依赖外挂的语音活动检测组件来判断”用户说完了没”,然后把完整输入传给模型,模型生成回复时感知会冻结。你说话的时候它听,它说话的时候你只能等。

    TML的解法是”时间对齐微轮次”:以200毫秒为粒度,同时处理200ms输入、生成200ms输出,输入token流和输出token流在同一个时钟周期里交错运行。效果是你可以随时打断它,它也可以根据视觉信号无提示地响应——比如你指了指屏幕上的某个东西,它不需要你先说”看这个”就能接话。

    Thinking Machines Lab交互模型示意图
    TML交互模型的工作机制示意图(来源:Unite.AI)

    2760亿参数,但只激活120亿

    首个公开亮相的模型TML-Interaction-Small采用MoE(混合专家)架构,总参数规模2760亿(276B),但每次推理只激活120亿(12B)参数。这个设计的目的很明确:在保持模型”脑子够用”的同时,把延迟压到200ms以内。

    另一个有意思的设计是前后台拆分。前台(交互模型)负责低延迟实时交互,没有重型独立编码器:音频通过轻量嵌入层输入梅尔频谱特征,图像拆成40×40的patch,所有组件从零开始和Transformer共同训练。后台是独立的异步运行模型,负责深度推理、工具调用、网页浏览这些高负载任务,不占用前台交互的计算资源。


    跟GPT-Realtime和Gemini Live比怎么样

    TML自己跑了两个测试基准:FD-bench V1(轮次切换延迟)和FD-bench V1.5(交互质量,覆盖用户打断、反馈、背景语音等场景)。数据是他们自家报的,第三方还没验证,但数字差距确实不小:

    • 轮次切换延迟:TML-Interaction-Small 0.40秒 vs GPT-Realtime-2.0(最小思考模式)1.18秒 vs Gemini 3.1 Flash Live(高思考模式)0.57秒
    • 交互质量得分:TML 77.8 vs GPT-Realtime-2.0 46.8 vs Gemini 3.1 Flash Live 45.5

    这个分数意味着什么,现在下结论还太早。FD-bench V1.5是TML自己推出的视觉交互测试集,目前还没有独立的baseline可以对照。而且200ms的延迟在实际网络环境下能不能稳住,也是个大问号。

    钱和人的问题

    TML的融资故事挺戏剧性的。2025年7月完成20亿美元种子轮,估值120亿美元,是当时有记录以来最大规模的种子轮。领投方是Andreessen Horowitz,参投方阵容豪华:英伟达、AMD、思科、Accel、ServiceNow、Jane Street都在列。但2025年底他们想再融一轮把估值推到500亿美元,没成。

    人也在流失。2026年1月,联合创始人Barret Zoph和Luke Metz离职返回OpenAI,核心成员Andrew Tulloch被Meta超级智能实验室挖走。Meta累计从TML挖走了5名创始成员。Murati随后提拔PyTorch联合创始人Soumith Chintala担任公司CTO,算是一个信号:她需要更扎实的工程领袖来稳住局面。

    算力方面,2026年3月跟英伟达达成了合作,英伟达将进行未披露金额的投资,并部署至少1GW的下一代Vera Rubin计算系统。同时也扩大了与谷歌云的合作,使用英伟达GB300硬件训练前沿模型。

    接下来会怎样

    目前模型没有向企业或公众开放。TML表示未来几个月会向选定合作伙伴开放有限研究预览,2026年晚些时候会扩大发布范围。他们还计划推出更大规模的交互模型——当前的276B版本是能满足延迟要求的最小变体,更大的版本在效果上会更好,但延迟能不能压住是未知数。

    值得观察的问题有几个:长会话下的稳定性、弱网环境下的表现、实时安全拒答机制怎么设计。TML这次把”交互范式”这个根本问题拎出来打,勇气是有的,但能不能落地进生产环境,还需要等模型真正开放之后才知道。