标签: 大模型

  • Cursor发布Composer 2.5:不换底座追上Opus 4.7,成本仅1/10

    Cursor这次真的被我急了。过去几个月,Claude Code抢走了大量开发者注意力,Anthropic那帮人做的编程助手不仅能力强,还能以Cursor根本拿不到的价格直接服务用户。相当于Cursor一边和Claude Code竞争,一边还得向Anthropic付钱用他们的模型——这生意怎么算都别扭。

    5月18日,Cursor扔出了Composer 2.5。有意思的是,他们没换底座模型,仍然用着月之暗面的Kimi K2.5,但把85%的计算预算全部砸进了后训练。训练数据量是上一代的25倍,强化学习轮次拉满。结果在SWE-Bench Multilingual上拿到79.8%,和Claude Opus 4.7的80.5%几乎贴着跑。


    成本才是真正的杀手锏

    Composer 2.5每百万输入token收费0.50美元,输出2.50美元。达到同样性能,OpenAI和Anthropic的竞品要花差不多10倍的钱。Cursor自己做的effort curve显示,用不到1美元的单任务成本就能在CursorBench v3.1上拿到63%的成绩,而Opus 4.7和GPT-5.5得花好几美元才能摸到这个线。


    三个关键技术改进

    Cursor搞了三个关键改进。第一个是带文本反馈的定向强化学习——模型跑长任务时,不是等整个任务结束才给奖励信号,而是在出错的地方直接插入提示(比如工具调用失败时提醒”Available tools…”),让模型立刻知道哪步做错了。

    第二个是大规模合成数据,用”功能删除”法生成训练样本:从可运行代码库里删掉某个功能,让模型重新实现,用测试通过与否作为奖励信号。

    第三个是Sharded Muon优化器,分布式跑Newton-Schulz正交化,1T参数模型单步优化只需0.2秒。


    马斯克确认用Colossus 2训练

    马斯克在推特上转发了Composer 2.5的发布,还透露这模型部分跑在Colossus 2超算上训练。Cursor已经宣布下一代模型要用Colossus 2的百万H100等效算力,计算量是现在的10倍。按照这个节奏,Anthropic和OpenAI在编程模型上的定价优势,可能撑不了太久。

    AI编程工具市场正在分裂成两个阵营:一边是模型厂商自己做工具(Anthropic的Claude Code、OpenAI的Codex),另一边是独立工具厂商(Cursor、Warp、Zed)。独立厂商的命门是上游模型依赖,Cursor这次证明了一件事:你不一定要自研底座模型,后训练+合成数据+强化学习这套路,足以在垂直场景追平顶级模型。

  • LlamaIndex:49.5k Stars!领先的大模型数据框架,让AI理解你的私有数据

    LlamaIndex:49.5k Stars!领先的大模型数据框架,让AI理解你的私有数据

    🦙 LlamaIndex
    49.5k Stars!领先的大模型数据框架,让AI理解你的私有数据
    ⭐ 49.5k Stars
    🔧 数据框架
    📚 RAG引擎

    💡 项目简介

    LlamaIndex 是用于构建智能体(agentic)应用的开源框架,提供数据接入、结构化组织、检索增强接口等完整能力。它核心解决如何用私有数据增强LLM能力的问题——LLM本身基于公开数据预训练,无法直接获取用户私有数据,而LlamaIndex提供完整工具链,实现私有数据的接入、结构化、检索增强全流程。

    目前LlamaIndex已在GitHub获得49,514 Stars,是构建RAG(检索增强生成)应用的首选框架之一。无论是新手还是高级开发者,都能找到适合自己的API层级。

    ⚙️ 安装要求和过程
    环境要求
    Python版本:3.8+
    依赖管理:pip
    可选:OpenAI API Key(使用OpenAI模型时)

    快速安装
    # 新手快速上手(推荐)
    pip install llama-index
    
    # 高级用户自定义安装
    pip install llama-index-core  # 核心框架
    pip install llama-index-llms-openai  # OpenAI集成
    pip install llama-index-llms-ollama  # Ollama本地模型集成
    pip install llama-index-embeddings-huggingface  # HuggingFace嵌入模型

    ✨ 核心功能
    📥 多源数据接入
    提供数据连接器,支持接入API、PDF、文档、SQL等各类数据源和格式。无论是本地文件还是在线服务,都能轻松整合。

    🗂️ 数据结构化组织
    支持构建索引、知识图谱等结构,让数据可被LLM高效使用。提供多种索引类型:向量索引、树形索引、列表索引等。

    🔍 高级检索与查询接口
    输入LLM提示词,即可返回检索到的上下文和知识增强后的输出。支持多种检索策略:向量检索、关键词检索、混合检索等。

    🔧 灵活扩展性
    支持自定义所有核心模块,适配不同场景需求。提供300+集成包(LlamaHub),覆盖LLM、嵌入模型、向量存储等组件。

    🤖 多模型兼容
    支持OpenAI、本地Ollama、HuggingFace等各类LLM和嵌入模型。无需修改代码即可切换底层模型,真正实现解耦。

    🚀 典型使用场景
    1️⃣ 企业知识库问答系统
    将公司文档、PDF、API文档等私有数据接入LlamaIndex,构建智能问答系统,让员工快速获取准确信息。支持多用户、权限管理、对话历史等高级功能。

    2️⃣ 个人第二大脑
    整合个人笔记、文章、代码注释等,构建个性化AI助手,实现智能检索和知识管理。配合LlamaParse,甚至能解析扫描版PDF和图片。

    3️⃣ RAG应用快速原型
    利用LlamaIndex的高阶API,仅需5行代码即可完成数据接入和查询,快速验证RAG应用想法。适合创业团队快速MVP验证。

    💡 推荐理由

    🎯 完美的平衡:LlamaIndex是我接触过的最优雅的RAG框架之一。它完美平衡了易用性和灵活性——新手可以用5行代码快速上手,高级用户又能深度定制每个组件。

    🔌 强大的生态:特别是它对各类LLM和向量存储的广泛支持(300+集成包),让你可以轻松切换不同的技术栈而无需重写代码。LlamaHub让集成变得像pip install一样简单。

    📖 优秀的文档:它的文档详尽、社区活跃,几乎能找到所有常见问题的解决方案。从入门教程到高级进阶,覆盖全链路。

    🚀 企业级能力:配套的企业级文档智能处理平台LlamaParse,支持130+种文档格式解析,让非结构化文档的结构化处理变得轻而易举。

    📥 下载地址
    🔗 相关链接
    GitHub仓库https://github.com/run-llama/llama_index
    官方文档https://developers.llamaindex.ai
    LlamaParse(企业文档OCR)https://cloud.llamaindex.ai
    PyPI安装pip install llama-index

    📌 开源协议
    LlamaIndex 使用 MIT License,允许商用、修改、分发,非常适合企业和个人开发者使用。


    📌 本文属于「开源项目」系列,持续介绍GitHub上的优质AI开源项目,欢迎关注!

    🔥 下期预告:更多精彩AI开源项目即将上线,敬请期待…

  • Andrej Karpathy官宣加入Anthropic,OpenAI联合创始人为何选择竞对

    5月19日,AI圈被一条推文炸开了锅——Andrej Karpathy在X上官宣了自己加入Anthropic的消息。这位OpenAI的联合创始人、特斯拉前AI负责人,选择在这时候加入Claude的缔造者,让不少人感到意外。

    「我认为LLM前沿领域接下来的几年会特别关键。我很兴奋能加入这里的团队,重新回到研发一线。」——Andrej Karpathy

    他到底是谁

    karpathy在AI圈子里的分量,不需要太多介绍。他是OpenAI的创始成员之一,早年深耕深度学习和计算机视觉,2017年被马斯克挖去特斯拉,一手搭建了FSD(全自动驾驶)和Autopilot的核心团队。2022年离开特斯拉后,他短暂回归OpenAI一年,2024年又出来创立了Eureka Labs,想用AI助手做教育。

    他还有一门非常出名的在线课程《Neural Networks: Zero to Hero》,教学生从零开始用代码实现神经网络,在YouTube上有一大批忠实观众。可以说,他是少数几个既能搞懂大模型理论、又能真正把大规模训练跑起来的人。

    Andrej Karpathy
    Andrej Karpathy(图源:San Francisco Chronicle / Getty Images)

    在Anthropic做什么

    Karpathy本周正式入职Anthropic,在Nick Joseph的带领下专注于预训练(pre-training)方向。预训练是构建前沿模型最烧钱、最吃算力的阶段,直接决定了Claude的核心知识和能力上限。

    Anthropic方面还透露,Karpathy会着手组建一个专门的团队,研究方向是用Claude来加速预训练研究本身。这个思路很清晰——用AI来研究AI,用更强的模型来帮自己训练下一代模型,形成研发飞轮。


    为什么是现在

    Anthropic在这个时间点挖来Karpathy,信号很明确:他们相信AI辅助的研发,而不仅仅是堆算力,才是接下来和OpenAI、Google竞争的关键。能同时懂LLM理论和大尺度训练实践的研究者,圈子里掰着手指头数得过来,Karpathy是一个。

    至于他创立的Eureka Labs,目前还没有进一步的消息。Karpathy在自己的帖子里也提到,他对教育的热情不会消失,未来会找时间继续这件事。

    • OpenAI联合创始人身份,深度参与GPT早期研发
    • 特斯拉FSD团队缔造者,大规模AI落地经验
    • 顶级AI教育者,Zero to Hero课程影响数十万开发者
    • 唯一同时深度参与过OpenAI和特斯拉AI全栈的领军人物

    同一天,Anthropic还宣布了另一位重磅人才的加入:网络安全老将Chris Rohlf加入了前沿红队(frontier red team)。Rohlf在Yahoo的”The Paranoids”安全团队成名,后来在Meta待了六年,职业生涯跨度超过20年。他在X上写道:「我们有一个真正的机会,用AI大幅改善网络安全」,并认为此刻加入Anthropic是正确的选择。

    两则人事消息同一天公布,怎么看都像是Anthropic在Google I/O期间的一次精准人才公关。不管是巧合还是刻意为之,Anthropic正在用行动告诉外界:他们不仅在模型能力上追,在人才吸引上也一点不虚。

  • 千问接入淘宝:阿里把AI购物这件事做透了

    对话就能买东西,阿里这次玩真的

    阿里巴巴最近把通义千问和淘宝打通了。不是那种噱头式的”AI购物助手”,而是真正能让用户通过对话完成浏览、比价、下单全流程的整合。你在千问App里说一句话,它就能帮你把商品找好、对比完毕、直接下单。

    这套系统接入了淘宝和天猫超过40亿件商品。40亿是什么概念?基本上你能想到的东西都在里面了。以前要用关键词搜索、翻页、对比详情页,现在直接跟AI说你想要什么,它帮你搞定。

    传统电商的逻辑是”人找货”——你得知道自己要什么、怎么描述、哪个关键词有效。AI购物的逻辑是”对话即交易”——你只需要表达需求,剩下的事AI帮你完成。

    淘宝里头也有AI助手了

    阿里这套打法挺聪明的,不是只做一个独立的AI购物App,而是双向打通。千问App能调用淘宝的商品库,淘宝站内也上线了千问赋能的AI购物助手。

    淘宝里头的AI助手还加了几个实用功能:虚拟试穿、30天价格走势追踪。这些功能单独看不算新鲜,但跟对话式购物结合起来,体验就完全不一样了。你可以直接问”这件衣服我穿好看吗”,AI帮你试穿;也可以说”这个价格划算吗”,AI给你看价格走势。


    依托专属”技能库”,千问还能帮你管理物流、处理售后。以前买完东西要查物流得去淘宝App,要退货得找客服,现在直接在对话里说一声就行。

    中外电商的AI路数不一样

    看看国外的玩法,就会发现阿里的打法挺特别的。亚马逊也在用AI优化购物体验,但它不敢让你直接通过AI完成交易,担心失控。加拿大电商平台Shopify倒是接了AI助手,但它用的是第三方的,自己不研发。

    阿里这种”我有大模型、我有电商平台、我把它们打通”的路数,中外都没几家能抄。Google有模型但没电商,亚马逊有电商但模型不够强,只有阿里两家都有。

    这种全链路打通,才是AI商业化真正有力的打法。不是做个聊天机器人让你玩,而是让AI真正进入交易环节、产生实际收入。


    AI购物到底是噱头还是趋势

    肯定有人会说,这不就是个升级版的”智能客服”吗?其实差别挺大的。智能客服是”你问它答”,而且通常只能处理固定流程里的问题。AI购物助手是”你说需求,它帮你完成交易”,主动权在用户手里,但执行权在AI手里。

    这种模式能不能成,关键看两件事:一是AI推荐的准确性,别你想要的跟它给的不是一回事;二是用户对AI做决策的信任度,敢不敢让它帮你下单、处理售后。

    阿里敢全线铺开,说明它在内部测试里对这两件事都有底气。接下来几个月,看用户买不买账就知道了。

  • 前OpenAI CTO放大招:Thinking Machines实时交互模型200ms响应

    前OpenAI CTO放了个大招

    Mira Murati离开OpenAI自己创业才一年多,前几天直接把第一个模型甩了出来。不是那种传统的”你问一句我答一句”的回合制AI,而是真正能实时互动的交互模型。200毫秒的响应延迟,你随时可以插话打断,AI也能同时听、说、看、调用工具。

    这套系统叫TML-Interaction-Small,采用的是2760亿参数的混合专家架构,每次推理只激活120亿参数。关键是它把前后台拆开了:前台专门维持对话流畅,200毫秒为一个时间片持续接收信息;后台负责复杂推理和工具调用,结果流式返回前台,不会打断你的说话节奏。

    200毫秒是什么概念?人说话时自然的停顿间隔大约是200-300毫秒。也就是说,这个模型的响应速度已经接近人类对话的节奏了。

    不只是速度快

    以前那些号称”实时”的语音AI,本质上都是把语音识别、语言模型、语音合成这几个模块拼在一起,中间靠外部工具协调。你说话的时候AI只能等着,说完一段它才开始处理,这就是典型的”回合制”。

    Thinking Machines这套系统是原生实时交互,从架构层面就设计成可以交错处理音频、视频、文本的流数据。它用的编码方案也挺聪明:音频用dMel轻量编码,图像用hMLL编码,所有组件跟Transformer主干网络一起训练,不用单独的编码器拖慢速度。


    在FD-Bench v1.5基准测试里,这个模型拿了77.8分。作为对比,OpenAI的GPT-Realtime-2和谷歌的Gemini 3.1 Flash Live都没超过它。响应延迟0.40秒,比GPT-Realtime-2快了大概4倍。

    钱和人都不缺

    Murati这个人挺厉害的,在OpenAI当CTO的时候就是技术核心人物之一。她出来单干,投资人直接给了20亿美元种子轮,估值砸到120亿美元。团队里还有FAIR实验室的前研究员Piotr Dollar这种级别的人物。

    算力方面也没拖后腿,跟英伟达、谷歌分别签了超过10亿美元的合作协议,拿到基于GB300芯片的超级计算资源。这种配置,基本上就是把”我要做顶级AI”写在脸上了。

    团队自己说几个月里迭代了12个版本,训练日志写了137页。这种折腾劲,倒是很像早期OpenAI的风格。


    真正的交互应该是什么样

    现在大家用ChatGPT语音模式或者Alexa那种智能助手,体验上总感觉差了点什么。你不能在它说话的时候插话,它也不能在你还在想怎么表达的时候就开始回应。这种”半双工”的交互方式,本质上还是把AI当成一个高级搜索引擎来用。

    Murati想做的,是让AI真正像一个人一样跟你对话。你可以随时打断,它可以同时处理多件事,后台在跑复杂推理的时候前台对话不受影响。这种体验,才是大家一直在说的”贾维斯”该有的样子。

    当然现在这个模型还只是研究预览版,正式开放还要等几个月。但方向已经很明确了:AI交互的下一个战场,不是谁的模型参数更多,而是谁能真正做到”自然对话”。

  • OpenAI连发三个语音模型,这次不只是”能说话”

    OpenAI连发三个语音模型,这次不只是”能说话”

    5月7日凌晨,OpenAI一口气发了三款音频模型:GPT-Realtime-2、GPT-Realtime-Translate和GPT-Realtime-Whisper。官方说法是让开发者能构建”在用户说话时推理、翻译和转写”的实时语音产品。三款模型已经开放给开发者测试了。

    这次更新的重点在于”分工”。三款模型各管一摊事:GPT-Realtime-2管实时语音Agent,GPT-Realtime-Translate管实时翻译,GPT-Realtime-Whisper管实时转写。这个打法很OpenAI——不只要做最好的单一模型,还要把整个语音AI的赛道拆成几块,各自做到极致。

    OpenAI GPT-Realtime-2 语音模型
    GPT-Realtime-2 是 OpenAI 首个具备 GPT-5 级推理能力的语音模型(图源:OpenAI)

    GPT-Realtime-2:从”能说”到”会说”

    GPT-Realtime-2是这次更新的主角。OpenAI官方的说法是,这是第一款具备”GPT-5级推理”的语音模型。这个模型被设计来处理复杂请求、调用工具、处理对话中的打断,还能在更长的语音会话里保持上下文。

    这些能力对应的都是语音Agent落地时最头疼的问题。比如一个用户想咨询买房的事,或者想改签机票,这些场景都可能包含一大堆条件和多轮确认。上下文窗口从32K提升到128K之后,模型可以在更长的实时对话里保留前面出现过的信息,不会聊到一半把前面说的话忘了。

    GPT-Realtime-2在Big Bench Audio测试上比上一代GPT-Realtime-1.5高15.2%,在Audio MultiChallenge上高13.8%。这两个指标衡量的是模型在音频输入、多轮语音、复杂指令和上下文整合方面的能力。

    还有一个很实用的细节:可调推理强度。你可以根据场景选择用多少算力。多数生产场景可以先使用较低的推理强度,优先保证通话里的响应速度;遇到更复杂的客服、预订、排障任务,再提高推理强度,用更多计算换取更完整的判断。这个设计很接地气——语音交互最怕的就是卡顿,用户在电话里等一两秒就会觉得”这AI不行”。


    已经有企业在用了,效果还不错

    OpenAI公布了几个已经在测试的企业用户:美国房地产网站Zillow、旅游预订平台Priceline、德国电信。这些都不是小打小闹的Demo,而是真实业务场景。

    Zillow在用GPT-Realtime-2构建可以理解住房条件并安排看房的语音助手。他们说,在最困难的对抗性测试中,经过prompt优化后,电话任务成功率从69%提升到95%。这个提升幅度很夸张,但也说明语音Agent在垂直场景里确实能干活了。

    Priceline的用例更典型:旅游预订链条很长,用户可能要查航班、订酒店、调整日期、处理延误、比较价格,还可能在境外需要翻译。语音Agent如果能稳定接入后台系统,就有机会把”问答”推进到”办事”。这个跨越才是语音AI真正有价值的地方。

    另外两款模型:翻译和转写

    GPT-Realtime-Translate主打实时语音到语音翻译,支持70多种输入语言到13种输出语言。传统语音翻译常常要求说话人停顿,系统等一句话结束后再翻译;而GPT-Realtime-Translate更接近连续口译的形态,说话人讲话时它就能跟上节奏。

    GPT-Realtime-Whisper则强调实时流式转写,可以在说话人讲话时生成字幕、会议记录和工作流更新。它的价格最便宜,只有0.017美元/分钟。

    三款模型放在一起看,OpenAI已经把实时音频拆成了三个明确入口,价格和延迟要求各不相同。奥特曼想要的可能是”通吃”——不管你要做语音客服、跨语言会议还是实时字幕,都得用我的API。


    语音AI这波竞争,正在从”像人”变成”能办事”

    这个市场里已经有一堆强势玩家了。ElevenLabs今年2月完成5亿美元D轮融资,估值110亿美元;Deepgram今年1月完成1.3亿美元融资,估值13亿美元,服务1300多家客户;Cartesia的Sonic 3模型已经有1万多客户使用,主打90毫秒低延迟。

    OpenAI的优势在于模型栈——它可以把整个企业调用TTS的链路放在同一个开发者平台里。对开发者来说,少接几个供应商,就少一些延迟、集成和运维成本。但语音市场并不好啃,每家都有自己的地盘和忠实客户。

    从目前企业用户的测试反馈来看,GPT-Realtime-2确实在某些场景里把语音Agent的完成率拉到了一个可用的水平。但这波”从对话走向执行”的转型能不能真正跑通,可能还得看接下来半年这些早期客户的真实业务数据。

  • Google I/O 2026 Day 1直击:Gemini 4.0、Omni多模态、XR眼镜齐亮相

    今天Google I/O 2026正式开幕,谷歌一口气发布了多个重磅产品。看完整个发布会,感觉谷歌这次是认真了,不再是以前那种”我们有个很酷的研究项目”的画饼风格,而是实打实地把AI塞进了每一个产品线里。

    Gemini 4.0:不止是基准测试

    Gemini 4.0这次是真的来了。谷歌没有只拿基准测试分数说事,而是把重点放在了实际应用场景上——Workspace集成、多模态推理、智能体可靠性,这些都是企业用户真正关心的东西。

    外界预期Gemini 4.0在多模态推理上会有显著提升,如果它能接近Claude Mythos Preview的94.6% GPQA成绩,那谷歌就真的把今年早些时候丢掉的话语权给抢回来了。

    谷歌的优势在于生态。安卓30亿+设备、搜索数据、Workspace 2亿+用户,这不是OpenAI或者Anthropic短时间内能追上的。

    Gemini Omni:文本+图像+视频统一管线

    这次最让我意外的是Gemini Omni。它不是Veo的升级版,而是一个统一的文本/图像/视频生成管线,可以在对话窗口里直接生成和编辑视频,还会自动配背景音乐。

    早期泄露的测试报告显示,Omni在提示词保真度和音频质量上都比Veo 3.1强。如果这套系统正式上线,谷歌就是第一个在消费级场景里提供全模态统一生成能力的厂商。叠加安卓生态的分发优势,这个组合拳确实不好接。

    Google I/O 2026
    Google I/O 2026 Day 1 发布会现场

    Android XR眼镜与Aluminium OS

    硬件方面,谷歌和三星、Warby Parker、Gentle Monster、XREAL合作的Android XR眼镜正式亮相。无屏版本重80克以内,售价379-499美元,搭载骁龙AR Gen 3,延迟200ms。这个规格如果能兑现,Meta的Ray-Ban系列可能要感受到压力了。

    更值得关注的是Aluminium OS,这个基于安卓开发的系统将替代ChromeOS,首批笔记本由宏碁、华硕、戴尔、惠普、联想生产,2026年秋季上市。谷歌这是在把安卓的势力范围从手机扩展到PC。


    Gemini Spark:谷歌版的AI智能体

    Gemini Spark是这次发布的一个容易被忽略但很重要的产品。它能自动化跨应用任务——整理收件箱、生成会议简报、追踪新闻事件进展。这和微软的Copilot、Anthropic的Claude Cowork是一个赛道的产品,但谷歌的优势在于它自己的应用生态(Gmail、Calendar、Drive、Docs)。

    总体来看,谷歌这次的策略很清晰:不追求单一的基准测试冠军,而是把Gemini铺到所有能铺的地方——手机、眼镜、笔记本、云端、企业应用。这种打法短期内在基准测试上可能不够性感,但长期来看,生态黏性才是最难被颠覆的壁垒。

  • Anthropic估值冲至1.2万亿美元,超越OpenAI登顶AI王座

    Anthropic最近在链上Pre-IPO市场的隐含估值冲到了1.2万亿美元,正式超过OpenAI,成为全球AI新王。这个数字有多夸张?比OpenAI高出20%,如果以此估值上市,Anthropic将直接空降全球第11大上市公司。

    Anthropic估值飙升
    Anthropic估值走势(图源:36氪)

    80倍增长,Dario在台上”凡尔赛”

    估值暴涨的背后是业绩真的在飞。CEO Dario Amodei在旧金山开发者大会上透露,今年第一季度Anthropic的年化收入和使用量同比涨了80倍——他们原本的规划仅仅是10倍。

    Dario甚至还”抱怨”说增速太快很难驾驭,希望回到仅仅10倍的增长,那样会轻松点。推动这波增长的核心是Claude Code,2025年底上线的这个编程工具在开发者群体里扩散速度超出了所有人预期。


    马斯克出手:22万块GPU救急

    因为需求爆炸,Anthropic的算力基础设施被瞬间击穿,用户发现Claude开始限流甚至高峰期掉线。关键时刻,马斯克出现了——Anthropic与SpaceX达成独家合作,拿下Colossus 1数据中心的全部算力。

    这个数据中心拥有300MW计算能力和22万块英伟达顶级GPU,一个月内全部到账。几个月前马斯克还在网上骂Claude”邪恶”,现在把给Grok准备的GPU全都给了Anthropic,也是挺讽刺的。

    拿到这22万块GPU之后,Anthropic直接给用户送了大礼包:Claude Code五小时限额翻倍,Pro/Max取消峰值限制,API速率大幅提升。


    2000亿美元抱上谷歌大腿

    据外媒透露,Anthropic已与谷歌签署了一份为期五年、价值约2000亿美元的云服务协议,占到了谷歌云合同积压总额的40%以上。现在的AI圈,正陷入一种疯狂的循环:云巨头掏钱给AI公司,AI公司转手把这笔钱作为”房租”买回算力服务。

    把Anthropic所有已公开的算力合同摊开:亚马逊5GW、谷歌+博通5GW、微软+英伟达300亿美元Azure容量、Fluidstack 500亿美元基础设施、SpaceX 300MW+22万张GPU,三线并进的算力格局已经成型。

    1.2万亿美元估值建立在2029年收入增长20-30倍的预期之上。这场算力豪赌能不能兑现,接下来三年见分晓。

  • Google I/O 2026今天开幕:Gemini 4.0、XR眼镜、新系统齐亮相

    Google I/O 2026今天开幕,大家期待的Gemini 4.0终于要亮相了。这次谷歌不只是更新模型,而是打算把AI能力直接塞进操作系统、塞进眼镜里,完成从”AI功能叠加”到”AI原生重构”的战略跨越。

    Gemini 4.0:上下文窗口拉到1000万tokens

    参数规模据说到3-5万亿,上下文窗口突破1000万tokens,是GPT-5.5的25倍,可以一次性加载完整代码库或者整本书籍做深度分析。更重要的是原生多模态,文本、图像、音频、视频统一处理,不用在不同模型之间来回切换。

    深度整合谷歌搜索之后,Gemini 4.0的知识可以实时更新、事实实时核查,幻觉率压到3%以内。定价预计每百万输入2.5美元,性价比相当能打。


    Android XR眼镜:80克、499美元起

    谷歌将推出首款自研Android XR智能眼镜,重量不到80克,售价499美元起,比同类竞品便宜不少。搭载高通骁龙AR Gen 3处理器,内置本地Gemini Nano轻量模型,200毫秒内响应,支持离线导航和实时翻译。

    深度适配Gemini 4.0之后,这副眼镜具备实时视觉理解、主动智能推送、多模态交互能力。谷歌还开放了Android XR SDK,现有安卓应用可以快速迁移到XR场景。


    Aluminum OS:8年磨一剑,三系统合一

    历时8年研发的Aluminum OS将正式落地,把Android、Chrome OS、Fuchsia三个系统揉在一起,手机、电脑、XR设备、智能家居全终端统一适配。

    Gemini 4.0拿到系统级接口,可以打通跨应用数据壁垒,实现实时上下文感知与主动智能执行。该系统将首发搭载于10月发布的Pixel 10系列手机,谷歌的AI硬件闭环生态算是真正立起来了。

    谷歌这次形成”大模型+硬件+操作系统+开发者生态”的全栈布局,直接对标OpenAI和Anthropic,全球AI竞争进入最激烈阶段。

  • OpenAI砸40亿美元成立部署公司,顺便把Tomoro买了

    OpenAI砸40亿美元成立部署公司,顺便把Tomoro买了

    OpenAI这周干了件大事——掏了超过40亿美元,成立了一家专门帮企业落地AI的新公司。名字很直白,叫”OpenAI Deployment Company”。说白了,就是以前卖模型,现在直接派人到你公司里帮你把AI用起来。

    为了把这件事做成,OpenAI顺便把一家叫Tomoro的AI咨询公司给收购了。这家公司不是昨天才成立的——它2023年就跟OpenAI合作过,客户名单里有美泰、红牛、乐购、维珍大西洋航空这些大牌子。收购完成后,Tomoro大概150个资深AI工程师和部署专家直接并入新公司。

    Tomoro的团队不是来OpenAI总部坐班的——他们会被派驻到客户现场,跟企业各个团队一起工作,找AI能真正产生价值的地方。

    为什么要做这件事

    过去这两年,OpenAI在消费者端赚足了眼球——ChatGPT的周活用户数字每次财报季都是亮点。但企业端这边,Anthropic的Claude其实跑得更快。很多公司在评估”到底用哪家的基础模型”时,Claude在企业级场景里的口碑确实不错。

    OpenAI这次成立部署公司,摆明了是要补上这块短板。光有模型不够,得有人帮客户把模型真正用起来——做集成、做定制、做业务流程改造。这块市场,咨询公司(埃森哲、德勤)和技术服务商都在抢,OpenAI现在是自己下场了。


    钱从哪来,谁在背后

    这40亿美元不是OpenAI自己全出的。TPG领投,安宏资本(Advent)、贝恩资本、布鲁克菲尔德(Brookfield)作为联合牵头创始合作方一起进来。OpenAI持有多数股权并掌控运营——也就是说,这家部署公司是个合资企业,但OpenAI说了算。

    有意思的是,路透社上周还报道说,OpenAI和Anthropic分别跟私募股权机构成立了合资公司,正在谈收购更多帮企业做AI落地的服务商。这个赛道突然就热了——因为大家意识到,卖API调用次数这件事,天花板是看得见的。真正赚钱的是帮企业把AI嵌进业务流程里,那种合同是长期的、高黏性的。


    这对行业意味着什么

    这件事释放了一个挺明确的信号:AI大模型公司的竞争,已经从”谁的模型更强”转向”谁能帮客户真正把AI用起来”。模型能力会有差距,但这个差距在缩小。真正的壁垒是——谁有更多的工程师能派到客户现场,谁有更多的行业落地经验,谁能帮客户把AI变成业务流程里真正产生价值的东西。

    Anthropic之前在企业端跑得快,一部分原因是它的模型在代码生成、数据分析这些场景里确实好用,另一部分原因是它更早地在开发者生态上投入。OpenAI这次直接收购Tomoro、组建150人的部署团队,是在用”堆人”的方式快速追上。

    对那些正在犹豫”要不要上AI”的企业来说,这其实是个好消息——以后不光是买个模型回去自己折腾,大厂会直接派人来帮你做。当然,费用估计也不会便宜。