标签: AI技术

  • 机器人要迎来自己的「ChatGPT时刻」?这家公司把宝押在了游戏数据上

    OpenAI 用 GPT-3 拉开基础模型时代那阵子,做自然语言处理的公司还在各自为战,每家都从头训练一个专门解决自己任务的模型。现在没人这么干了,大家都是先拿 GPT、Claude 或者 Llama 这种通用模型,再微调或者写提示词去适配自己的需求。

    Pim de Witte 是 General Intuition 的 CEO,他觉得「具身智能」也会走一模一样的路。

    从「为每个机器人单独训练」到「一个通用大脑」

    现在不少团队在干的事,是围着某一台具体的机器人、某一个具体的环境,收集一大堆真实世界数据,专门训一个模型。de Witte 在 TechCrunch 的 Equity 播客里说,这种活儿很快会变得多余。他觉得行业真正该做的,是先把数据质量做上去,训出一个能把「怎么动、怎么和环境互动」的直觉迁移到各种场景里的通用模型。

    他有一句挺敢说的判断:模型本身能不能泛化,才是产品。它只要有了对空间和时间的底层理解,大家就不需要再去攒几十万、上百万小时的真实数据了,因为说到底,你真正需要的可能只有几分钟。

    游戏画面里的按键,成了机器人的老师

    General Intuition 自己的基础模型,是在数百万小时的游戏录像上训出来的,而且不只是看画面,还记下了「人什么时候按了手柄上的哪个键」。de Witte 和公司的领投方 Vinod Khosla 都相信,这种带「动作标注」的数据,才是让 AI 长出类人空间推理直觉的关键。

    四足机器人在办公室中自主行走,周围悬浮游戏画面与神经网络节点
    用游戏数据训练出的物理 AI 基础模型,正试图统一机器人的「大脑」

    模型本身能不能泛化,才是真正卖钱的东西。等它有了对空间和时间的底层理解,谁还愿意去攒上百万小时的真实数据?说到底,你需要的可能只有几分钟。

    8 分钟真实数据,机器狗就站起来了

    光说不练没用。这家公司上个月刚靠着这个想法融了 3.2 亿美元、估值冲到 23 亿美元。他们已经演示过:同一个模型既能连续打几小时游戏,也能驱动一台四足机器人,而且驱动机器人时,只用了 8 分钟的真实世界数据做微调。

    de Witte 说最让他们意外的,是这台机器狗「零样本」就跑起来了:只靠一个前置摄像头,没有别的传感器,办公室里还不断有人走动、有东西乱放。他觉得这就是未来的样子。

    它不想造机器人,想做「物理世界的地基」

    General Intuition 的终局不是自己下场造机器。它想当「物理 AI 的基础模型」,给其他机器人公司当底座,让他们在自己的机器上搭东西。用 de Witte 自己的比喻:我们不会去开一家自动驾驶公司,但我们要让下一个人造自动驾驶公司容易十倍。

    • 大模型用 GPT-3 统一了文本,机器人可能正要被「世界模型」统一
    • 游戏数据贵在「按键标注」,这比单纯看视频更接近真实动作
    • 只靠几分钟真实数据就能迁移,意味着真实世界采集的成本可能被砍掉一大截
    • Khosla 把它称为「一代人的赌注」,赌的是专有数据会成为通用智能体的地基

  • 可灵 AI 单轮融了近 30 亿美元:全球视频大模型最大一笔钱

    可灵 AI 单轮融了近 30 亿美元:全球视频大模型最大一笔钱

    7月2日晚上,快手在港交所发了个公告——旗下的视频生成大模型“可灵 AI”要独立出来,单轮融资规模最高 30 亿美元,投后估值大概 180 亿美元。这个数字创下了全球视频大模型公司单轮融资的纪录,国内 AI 领域也就仅次于 DeepSeek 首轮的 70 亿美元。可灵这是要单飞了。

    30 亿美元约占可灵扩大后注册资本的 16.67%,对应投后估值约 180 亿美元——全球视频基础模型赛道迄今最大的一笔融资。

    钱是谁给的?

    这轮阵容挺豪华。领投的有 CPE 源峰、国方创投、来自阿布扎比的 BlueFive Capital、腾讯、中关村科学城基金和中信证券,一共 34 家机构认购。跟投里还有阿里云、百度这样的产业资本,华策影视、芒果系的厚为资本这些文娱产业方也进来了。值得一提的是,BlueFive 来自中东,这是中东资本头一回投中国的 AI 视频模型;而 CPE 源峰同时押了 Kimi 和可灵,等于在 AI 赛道上“通用+垂直”两头下注。整个交易分两步走:领投方先出 138.24 亿元人民币,15 家额外投资方再加 52.2 亿,60 天认购期里还能再进最多 14 亿,凑到上限 204.47 亿元。

    可灵 AI 单轮融资近 30 亿美元,创全球视频大模型公司融资纪录
    可灵 AI 单轮融资近 30 亿美元,创全球视频大模型公司融资纪录

    为什么现在要拆出来单干?

    说白了,是被算力开支和竞争逼的。快手这一年几乎把资本开支全砸在了 AI 基础设施上,调整后净利润因此被拖累。把可灵拆出来独立融资,既能给它输血,也能让母公司喘口气。数据其实很能打:可灵今年一季度收入超过 6.5 亿元,同比涨了 300% 多;3 月的年化收入(ARR)接近 5 亿美元,一年翻了四倍;全球用户已经破了 1 亿,而且大约四分之三的收入来自海外。对一个视频大模型来说,这样的海外变现能力不多见。

    拿到钱,仗才刚开始

    不过投资人现在的心态变了。以前看的是技术 demo 够不够炫,现在更盯着能不能赚钱、边际效率高不高。 30 亿美元砸研发是够了,但可灵得赶紧跟其他视频大模型拉开差距,把钱变成实打实的成本优势才行。协议里还写了回购条款:要是 2031 年 10 月底前没能完成 IPO,或者没按约定时间重组,投资人可以要求按原价加每年 8% 的单利回购,母公司还得连带担责。这压力可不小。


    快手已经放话,未来 12 个月内可能启动可灵 AI 赴港上市。视频大模型这条赛道,海外有 Runway、OpenAI 的 Sora,国内有一堆追兵,可灵手里多了 30 亿美元的弹药,但真正的较量,是把这笔钱花出效率来。

  • Meta要把囤的 AI 算力卖出去:从最大买家变身云厂商

    Meta要把囤的 AI 算力卖出去:从最大买家变身云厂商

    7月1日彭博社爆料,Meta在筹划一项叫“Meta Compute”的云业务,打算把自己囤的 AI 算力和模型访问权卖给外面的公司。消息一出,Meta 股价当天涨了 8.8%,市值多了大概 1270 亿美元;而专门做算力租赁的 CoreWeave 和 Nebius 分别跌了 14% 和 17%,连美光、闪迪这些存储芯片股也跟着跳水。一边是狂欢,一边是恐慌,同一条新闻让两拨人看到了完全不同的未来。

    全球最大的 GPU 买家之一,正式转身成为算力卖家——这被不少人视为 AI 基础设施商业模式的一个分水岭。

    为什么要卖?

    Meta 今年 4 月把全年资本开支指引提到 1250 亿到 1450 亿美元,比去年的 722 亿差不多翻了一倍,钱都花在了数据中心、芯片和电力上。问题是,训练一个大模型可能几个月里把几万张 GPU 吃满,但训练一结束,这批集群的利用率就掉到三成到五成,剩下的算力就在那儿空转、烧电费。扎克伯格的打法一直是“先囤够再说”,先按最高峰的训练需求把地基打好,至于建完怎么用,回头再想。现在“卖出去”就是那个回头再想的答案。

    两条路子:托管模型,或者直接出租 GPU

    据知情人士说,Meta Compute 至少规划了两条线。一条学 AWS 的 Bedrock,把托管在自家基础设施上的模型(包括自研的 Muse Spark)开放给开发者,按 token 收费。这对 Meta 是头一回能从 Llama 生态里直接赚到钱——开源这么多年,Llama 被别家云厂商免费拿去商用,Meta 一分授权费都收不到。另一条更直接,学 CoreWeave 那种新型云公司,把 GPU 集群按小时租给企业客户。两条线同时推,牵头的是基础设施负责人 Santosh Janardhan、超级智能实验室的 Daniel Gross,还有 Meta 总裁 Dina Powell McCormick。

    Meta 计划把囤积的 AI 算力对外出租,直接闯进云计算市场
    Meta 计划把囤积的 AI 算力对外出租,直接闯进云计算市场

    市场为什么慌?

    这事真正戳中的,是撑了 AI 产业两年狂奔的那套逻辑——算力稀缺。过去两年,“算力不够用”维持了坚挺的租赁价格,也给巨头们疯狂扩张提供了理由。可要是连 Meta 这种级别的买家都开始往外卖“富余”算力,投资人自然会问:基建是不是要到顶了?高盛的交易台已经警告,一旦供给上来、租赁价往下走,最先扈不住的就是硬件。衡量 H100 租赁价格的 ORNN 指数最近确实在往下掉。

    • 出租的是上一代 H100/H200 推理算力,前沿训练要用的 GB200、自研 Rubin 芯片 Meta 还在拼命买
    • 目标据说是每 GW 每年变现 100 亿到 150 亿美元,把“成本包被”变成创收资产
    • SpaceX/xAI 已经跑通类似模式:把孟菲斯的 Colossus 集群按月租给 Anthropic,月租 12.5 亿美元

    一家 To C 公司,能做好 To B 吗?

    麻烦也在这儿。AWS、Azure、谷歌云做了几十年,靠的不只是机房,还有成熟的软件平台、企业销售队伍和客服体系。Meta 靠广告活了 21 年,是个彻彻底底的 To C 公司,突然要去伺候企业客户,节奏、文化、人才都得重搭。更微妙的是反垄断:Meta 跟 CoreWeave 还有总额 352 亿美元的长期采购合同没走完,一边是人家最大的客户,一边又下场抢生意,这种双重身份监管一看一个准。

    短期看,Meta 卖算力是笔资产周转的买卖——把上一代推理算力拿出来回血,同时继续囤最新的训练卡。但往长了看,当算力从“抢都抢不到的稀缺品”慢慢变成“能挂牌出售的大宗商品”,整个行业的定价方式、竞争格局和投资故事,可能都要重写一遍。扎克伯格说过,几乎每周都有公司来问能不能买他们的算力,甚至愿意出高于成本的价。现在,这些人等到回音了。

  • 把 AI 叫成「同事」,人类反而更易犯错:一份 1261 人的研究给硅谷泼冷水

    把 AI 叫成「同事」,人类反而更易犯错:一份 1261 人的研究给硅谷泼冷水

    人类与被称为员工的AI智能体
    当 AI 被冠上「员工」头衔,人的责任感也在悄悄转移(配图:AI 生成)

    硅谷正热衷于把 AI 智能体包装成「数字员工」:给它起名字、发工牌、塞进组织架构图,仿佛它真能和人类并肩干活。但《麻省理工科技评论》援引波士顿大学的一项研究,给这股热潮泼了盆冷水——一旦把 AI 当同事,人的表现反而更差。

    一个名字改变了人的行为

    研究让 1261 名管理者审阅同一份 AI 生成的产出,随机分成三组:一组被告知来自无名工具,一组来自人类同事「Alex」,一组来自 AI 同事「Alex-3」。结果很刺眼——拿到「AI 员工」版本的人,抓出的错误比另一组少了 18%,还多出 44% 把问题甩给上级复核。本想靠 AI 省时间,反而凭空多出一层审批。

    「AI 智能体现在被当成能替代人的东西来营销,这是条走不通的路。」——2024 年诺奖得主、MIT 经济学家 Daron Acemoglu

    责任被悄悄转移

    当 AI 被叫「员工」,人更少把自己当成产出的责任人。这个苗头放到医疗、教育、政务里就危险了——它很容易变成甩锅的方便借口,真出事时大家第一反应是「是 Alex 犯的错」。Acemoglu 的观点是,智能体该被设计成增强人的能力,而不是替代人。

    工人真正想要的,其实不是这些

    斯坦福另一项研究问了 1500 名劳动者:技术专家觉得最该交给 AI 的任务(比如替销售核对客户信用),恰恰是工人最不想要的;他们想要的是辅助自己判断,而不是替自己拿主意。叫它「同事」很简单,也方便出事时推卸,但那只是一层品牌包装,并不会让工具本身更胜任。

    • 近三分之一受访管理者表示,公司已经把 AI 智能体当成「员工」,23% 甚至写进了组织架构图。
    • 微软、OpenAI、Anthropic、谷歌自 4 月起密集推出「数字同事」式 agent 管理工具。
    • 研究提醒:拟人化叙事侵蚀的是人的审查质量,这是治理风险,不是修辞问题。

  • 估值冲上10亿美元:Prime Intellect 想让每家企业都拥有自己的「AI实验室」

    估值冲上10亿美元:Prime Intellect 想让每家企业都拥有自己的「AI实验室」

    Prime Intellect 团队与算力集群
    Prime Intellect 把「AI 实验室」能力打包成企业可用的全栈平台(图源:TechCrunch)

    一家叫 Prime Intellect 的创业公司刚完成 1.3 亿美元 A 轮融资,估值一口气冲到 10 亿美元。它做的事有点反常识:别人都在帮你更好地用 OpenAI、Anthropic,它却想帮你彻底甩开这些前沿实验室,自己动手造 AI 智能体。

    从「租模型」到「自己造」

    过去企业想上 AI,基本只有一条路:去大厂的 API 里租现成模型。Prime Intellect 给出的是一套「全栈」——算力、强化学习框架、评估工具打包在一起,又像超市货架一样可以挑着用,不用担心被某个厂商绑死。创始人 2024 年才起步,看准的是强化学习这条技术路线:模型靠奖励和惩罚反复打磨,企业就能针对自己的业务训练专属智能体,相当于把「AI 实验室」搬回了公司内部。

    企业为什么突然想自己掌控

    动力很现实。把专有数据交给别人,企业怕的是失去控制权;更怕依赖的模型说关就关——Anthropic 的 Fable 项目上个月突然停摆,就是一记警钟。CEO Vincent Weisser 说得很直白:不该只有旧金山那几栋玻璃大楼里的人有能力训练模型,每家企业、每个国家都该有。

    「不该只是旧金山玻璃塔里那几个极客才有训练 AI 的能力,应该是每家企业、每个国家都行。」

    钱和数据主权一起到账

    这套打法已经有人买单。金融科技公司 Ramp 用它的平台做了个查表格的 agent,准确率压过前沿模型,速度更快,成本却只有零头。Zapier 也在客户名单里。快速起量把公司年化收入推到了 1 亿美元。领投方 Radical Ventures 的评价是:别人只给零件,Prime Intellect 给的是顶级 AI 实验室才有的「一站式」能力,而且价格企业扛得住。

    • 本轮由 Radical Ventures 领投,英伟达、英特尔、戴尔的战投悉数入局,还有 Perplexity 创始人等多位明星创业者个人跟投。
    • 平台走模块化路线,客户按需取用,不必一次性押上全部预算。
    • 背后是大公司在 AI 主权上的集体焦虑:数据要握在自己手里,供应链不能卡在别人手上。

  • 一封“哈哈”邮件点燃世纪诉讼:苹果把 OpenAI 告上法庭

    一封内部邮件里写了句“哈哈,我发现我能访问[网络存储],太逗了”,最后把两家公司送上了法庭。上周五,苹果在加州北区联邦法院正式起诉 OpenAI,指控对方系统性窃取苹果硬件商业机密。

    41 页诉状里最刺眼的几句话

    苹果这次不是只点名几个“野路子员工”,而是把矛头直接指向 OpenAI 的领导层。诉状里写,这种偷机密的行为“被领导层常态化并树立为榜样”,还甩出一句狠话:OpenAI 刚起步的硬件业务“从根上就烂了,靠偷来的商业秘密撑着”。

    “这只是冰山一角。苹果看不到 OpenAI 大门背后发生了什么,而那里头的违规行为,是被领导层当成常态来示范的。”——苹果诉状原文

    苹果 CEO 与 OpenAI CEO 同框配图
    苹果与 OpenAI 的关系正滑向破裂(图:Getty Images)

    从苹果带走的,不止经验

    被重点点名的有两个人。一个是 Tang Tan,在苹果干了 24 年,做到 iPhone 和 Apple Watch 的产品设计副总裁,跳槽后成了 OpenAI 的硬件负责人。苹果说他拿内部项目代号去挖人,还让去面试的候选人把苹果真机零件、原型机搬去 OpenAI 做“展示讲解”——有候选人当场愣住:“我都不知道办公室的东西能往外带。”

    另一个叫 Chang Liu,做了 8 年高级系统电气工程师,离职时没交还公司发的笔记本,转头用上面存的一个认证漏洞下了一堆机密文档。他在发给前同事的邮件里得意地写:“哈哈,我发现能访问[网络存储],太逗了。”对方回:“我准备好了。”几个月后,这位前同事也去了 OpenAI。

    • 苹果称目前已发现 400 多名前苹果员工在 OpenAI 工作
    • 指控 OpenAI 连专属的金属表面处理工艺都拿来用在了自家硬件上
    • 苹果今年 2 月就曾去信交涉,对方一直没回

    真正怕的,是对手的硬件

    这场官司的背景很清楚:OpenAI 正在秘密打造自己的第一款硬件,传闻是一部靠 AI 智能体替代 App 的手机,而它去年花 65 亿美元收购了 Jony Ive 的设计公司 io。这东西一旦成型,就是 iPhone 诞生以来对苹果核心业务最大的威胁。OpenAI 的回应很简短:“我们对别的公司的商业秘密没兴趣。”

  • 马斯克又放卫星:Grok 4.5 自称 Opus 级,价格却砍到零头

    SpaceXAI 上市后交出的第一张答卷,就是 Grok 4.5。马斯克在 X 上把它称作“Opus 级模型”——也就是能跟 Anthropic 最硬的 Opus 系列掰手腕,但他紧接着补了一句:更快、更省 token、还更便宜。

    一张为“干活”而生的模型

    SpaceXAI 在周三的博客里把 Grok 4.5 定位成“干活主力”:写代码、搭应用、处理办公室杂活、做研究、写文档,这些行业里最想甩出去的重复脑力活它都想接。跟 Cursor 联合训练是这次的关键——数万名工程师在 Cursor 上的真实操作数据被喂进了模型,专门补上 Grok 过去在编程这块最空的短板。

    “我们的内部评估是,Grok 4.5 大致相当于 Opus 4.7,但快得多。能力、速度、低成本三者加在一起,才是它的竞争力。”——马斯克

    SpaceXAI 发布的 Grok 4.5 模型配图
    Grok 4.5 是 SpaceXAI 上市后的首个大模型,主打高 token 效率(图:Getty Images)

    真正的卖点不是跑分,是账单

    SpaceXAI 说 Grok 4.5 的 token 效率是其他头部模型的两倍。落到价格上就很直白了:输入每百万 token 2 美元,输出 6 美元。对比一下——Opus 4.7 是 5 美元和 25 美元,OpenAI 最贵的 Sol 档是 5 美元和 30 美元。换句话说,干同样的活,花的可能只有别人的零头。

    • 跑分没冲到全场第一,但在 SWE Bench Pro 上用到的输出 token 大约只有 Opus 4.8 的四分之一
    • 服务速度约 80 TPS,马斯克预告下周上下文窗口会拉到 100 万
    • 训练跑在数万块英伟达 GB300 上,和 Cursor 的数据飞轮一起转

    选在 GPT-5.6 前一天亮牌

    这周本来就是大模型发布的大周。OpenAI 的 GPT-5.6 定在周四全量开放(此前因美国政府的安全审查被卡了一阵)。SpaceXAI 偏偏选在前一天把 Grok 4.5 丢出来,火药味不用多说——它赌的不是谁的分数高,而是谁能让企业少掏钱。

  • ChatGPT语音终于学会闭嘴:OpenAI GPT-Live全双工上线

    ChatGPT语音模式升级示意
    OpenAI 用 GPT-Live 重写 ChatGPT 语音模式,让它学会”边听边说”(图:The Verge)

    用过 ChatGPT 语音模式的朋友大概都经历过这种尴尬:你话才说到一半,正组织下一句,AI 突然插进来”好的,我理解你的意思是……”,而你后面那半句它压根没听见。这不是你表达有问题,是旧版语音模型的底层架构决定的——它只能等你彻底闭嘴,才轮到它开口。

    7 月 8 日,OpenAI 给这个问题从根上动了刀。新发布的 GPT-Live-1 和 GPT-Live-1 mini 两款语音模型,第一次在 ChatGPT 里实现了”全双工”:它能一边听你说话,一边组织自己的回答,你随时可以打断、插话、改口,它都接得住。

    “它终于学会闭嘴了”

    The Verge 给这篇报道起的标题特别传神——”ChatGPT 升级后的语音模式更擅长闭嘴了”。OpenAI 产品负责人 Atty Eleti 在发布会上解释:”这是一个全双工模型,意味着它可以同时说话和听。从模型侧看,它能持续、同时地处理输入流、产出输出流。”

    OpenAI 研究负责人 Kundan Kumar 把 GPT-Live-1 称为公司”迄今最聪明的语音模型”。它会在需要推理或联网搜索时,自动把你的请求转交给 GPT-5.5 这类最强文本模型,再回头把结论用说话的方式讲给你听。

    换句话说,以前语音助手是”听写—理解—朗读”三段流水线,现在声音本身就是输入也是输出,延迟从秒级压到了毫秒级,对话节奏终于像人跟人聊天了。

    几个真实用得上的新花样

    全双工带来的不只是”不打断你”这么简单,还顺手解锁了几个挺实用的能力:

    • 实时翻译:你还在说中文,它已经同步翻成英文,不用等你停下
    • “听口令再开口”:你可以让它先闭嘴,等你喊它才接话
    • 会”嗯、对、收到”:它用这些词告诉你”我在听”,对话更自然
    • 聊天气、股票、赛事时,会顺手生成对应的图片辅助说明

    OpenAI 说,新版语音模式就是为了让人能”更长时间地 Hands-free 聊天”。产品负责人 Eleti 自己就说,他散步时跟语音助手聊过 30 到 40 分钟。看得出来,OpenAI 想让 ChatGPT 从一个”要打字的工具”,变成一个”能一直挂着的对话入口”。


    不是 AI 伴侣,也还有翻车的时候

    OpenAI 特意划了一条线:GPT-Live 不是要做”AI 伴侣”,不打算跟你谈情说爱。它内置了 safeguards,对青少年给年龄合适的回答,聊到自伤这类话题会转接专业危机热线。毕竟 OpenAI 正背着一串”ChatGPT 诱发妄想、伤害用户心理健康”的官司,安全这块不敢马虎。

    不过 demo 也不是完美。展示印地语实时翻译时,助手带着一股浓重的美式口音,印地语说得生硬又书卷气。OpenAI 承认新模型针对”大多数主流语言”做了优化,但没说清到底是哪些。这也是全双工语音要真正好用,还得跨过的一道坎。

    谁能先用上

    GPT-Live-1 已经推到 iOS、安卓和网页端。Go、Plus、Pro 订阅用户默认用更大的 GPT-Live-1,免费用户则是轻量版的 GPT-Live-1 mini。苹果和亚马逊也在把自家的语音助手往”更会接话、更懂上下文”的方向改,Sesame 这类创业公司也在做类似的事。语音这条赛道,下半年只会更挤。

    对普通用户来说,最直观的变化可能就是:以后跟 ChatGPT 打电话,它终于不会在你喘气的功夫抢话了。

  • 微软在Excel里悄悄换掉OpenAI:自研MAI接管Office

    微软总部与Office办公场景
    微软正把自研MAI模型悄悄塞进Excel和Word的AI功能里(图:Getty Images)

    过去两年,微软给外界的印象一直是”OpenAI 最铁的盟友”——Copilot 背后站着 GPT,Office 365 的不少智能功能都贴着 OpenAI 和 Anthropic 的标。但彭博社 7 月 7 日的一则报道把这个默契撕开了一道口子:在 Excel 和 Word 里,已经有相当一部分用户提问,不再交给 OpenAI 或 Anthropic,而是由微软自己的 MAI 模型来回答。

    具体数字没公开,但彭博说,每个星期这两款软件里已经有”数万条”AI 提示词是 MAI 在处理。别看占比还小,放到 Excel 和 Word 这种亿级用户的产品里,这已经是微软第一次把自研模型悄悄塞进了核心办公场景的台前,而不只是躲在测试环境里。

    从 Excel 和 Word 开始,微软动了”外人”的奶酪

    有意思的是,微软自己从没高调宣传过这步棋。以前它巴不得你记得 Office 365 是”由 OpenAI 和 Anthropic 的模型驱动”;现在它选择了闷声干。TechCrunch 找微软求证,对方只回了一句”暂无更多信息可以分享”。这种不否认也不解释的态度,某种程度上比一份正式声明更说明问题。

    微软 AI 模型业务负责人穆斯塔法·苏莱曼(Mustafa Suleiman)在 6 月 Build 大会上说得直白:”我们每年向 Anthropic 支付巨额费用,目标是逐步减少、并最终消除这部分支出。”

    一句话把动机说透了:不是不想用,是太贵了。

    七个模型一起上,MAI 到底是什么来头

    MAI 不是临时起意。就在今年 6 月的 Build 开发者大会上,微软一口气发布了 7 款全新的自研 AI 模型,覆盖语音、图像、代码和推理——其中包括一个能写代码的 agentic coder,以及一个文生图模型。也就是说,微软已经在为”逐步替换第三方”悄悄准备弹药了。

    这些模型的卖点很统一:不追求纸面参数多吓人,而是强调”同样的活儿,花更少的算力”。放在 Office 这种每天海量、高频、但单次并不复杂的调用场景里,自研模型的成本优势会被放大。再配合微软自己的 Maia AI 芯片做软硬协同,推理开销比外购方案低上一截。

    • MAI-Transcribe-1 / MAI-Voice-1:对标 OpenAI Whisper 的语音转录与生成
    • MAI-Image-2:图像生成,替代部分文生图需求
    • MAI Code 1 Flash:面向开发者的代码生成模型
    • MAI Thinking 1:主打轻量高频办公场景的推理模型

    除了 Office 套件,MAI 也已经接进了 GitHub Copilot;Teams 上自研的语音转写能力也计划在几个月内上线。微软的意思很明确:凡是能自己干的,就别再长期花钱请外援。


    不只是微软,整个硅谷都在”省 token”

    把镜头拉远一点,微软这步其实是一股大潮里的一朵浪。今年上半年还流行”tokenmaxxing”——能多烧就多烧,把智能拉满;最近几个月画风突变,Amazon、Uber、Meta、Accenture 都被曝在收紧员工的 AI 预算,能省则省。AI 服务的账单一出来,连硅谷自己人都被吓到。

    更戏剧性的是,成本压力甚至把一些公司推向了”对手阵营”。有报道说,硅谷已经有人开始盯着中国的便宜模型(比如 GLM-5.2)找 Agent 方案,虽然绕不开安全和合规的顾虑。这说明一件事:当账单足够疼,地缘和安全的优先级都会往后挪一挪。

    自研到底,是想把命门攥回自己手里

    微软当然不会明天就跟 OpenAI、Anthropic 说拜拜。它手里还握着和 OpenAI 的合作协议,只是折扣窗口正在收窄。苏莱曼团队真正在做的,是搭一套”自主可控”的模型体系,免得将来被头部实验室的市场价拿捏。

    这也折射出整个行业的尴尬:靠外购大模型做商业化,盈利模型到现在都没完全跑通。微软这次把自研模型塞进 Excel 和 Word,看起来是省几块钱的小动作,实则是大厂为”AI 主权”交的第一笔学费。接下来,GitHub Copilot、Teams,甚至 Bing,会不会也慢慢换上 MAI,值得盯着看。

  • Reddit 用 AI 反 AI 垃圾:每天拦 2300 万次,背后是门 GEO 生意

    Reddit 用 AI 反 AI 垃圾:每天拦 2300 万次,背后是门 GEO 生意

    AI 盾牌机器人正在过滤社交平台上的垃圾与机器人内容
    Reddit 用 AI 检测系统对抗 AI 生成的垃圾内容。配图由 AI 生成

    如果有人说“用 AI 来治理 AI 制造的垃圾”,你可能会觉得这是句绕口令。但 Reddit 现在真在这么干。这家公司最近公布了一组数字:靠一套升级过的 AI 垃圾检测系统,他们每天在内容被真人看到之前,就拦掉 2300 万次垃圾浏览;每天新抓到大约 2.5 万条“像垃圾的帖子和评论”;顺手废掉将近 200 万个水军刷出来的假赞。

    Reddit 这波操作,表面是清理社区,底下其实藏着一股更具体的焦虑:有人正在用 AI 批量生产内容,往 Reddit 里灌,目的不是跟你聊天,而是去影响 ChatGPT、谷歌 AI 搜索会给出什么答案。

    新型“搜索引擎优化”:驯化聊天机器人

    这事儿有个新名字,叫 GEO(生成式引擎优化),也有人叫它 AEO。逻辑不复杂:现在 AI 聊天机器人在回答问题时,特别爱引用 Reddit 的帖子。于是品牌方发现,只要在 Reddit 高流量版块里悄悄埋几句产品好评,成本极低,却能左右那些机器人推荐什么。The Verge 就点名了一家叫 RedRover 的公司,公然揽活,派 AI 智能体到 Reddit 和博客上铺量内容,既冲谷歌排名,也冲 ChatGPT 的答案。

    “我们最管用的工作,发生在帖子被任何人类看到之前。”Reddit 在自己的公告里写道。他们不再等违规内容流到社区里才判断好坏,而是从源头就掐断。

    具体怎么拦?Reddit 说,账号一创建,系统就开始盯信号,把可疑角色挡在发帖之前。对那些真的进来的,他们用大模型去识别那种特别隐蔽、有组织的“假互动”和“人造热度”——这类套路老系统经常看走眼。最近他们还加了一道:凡是看着像机器人的可疑账号,都会被要求证明自己是真人。过去三个月,每天作废的假赞接近 200 万个。

    从“删帖慢”到“五秒内”

    不只是垃圾内容。在治理仇恨、暴力这类有害信息上,自动化也把效率拉满了:从发现到处理的平均时间,压到了 5 秒以内,用户接触到有害内容的概率降了四成多。对一个有 21 年抗机器人历史的老社区来说,这算一次明显的升级。


    说到底,Reddit 这套打法等于亲口承认了一件事:光靠人工审核,已经追不上 AI 辅助的操纵了。当“投喂聊天机器人”变成一门生意,平台能拿出来的、唯一现实的反制,就是同样用 AI、在更大规模上做检测。至于这场猫鼠游戏谁先累,现在还看不出来。