标签: AI模型

  • OpenAI GPT-5.6 因政府要求限制发布,监管大幕刚拉开

    OpenAI GPT-5.6 政府监管
    OpenAI 最新模型 GPT-5.6 的发布受到美国政府限制

    OpenAI本周五证实,应美国政府要求,它正在把最新一代模型GPT-5.6的发布范围压缩到”一小群受信任的合作伙伴”。这件事的蹊跷之处在于,政府没有发正式禁令,而是”要求”企业自觉,企业也真的照做了。

    这一代GPT-5.6一共有三个型号:Sol是旗舰,Terra是日常使用的均衡版本,Luna则是速度更快、成本更低的选项。按理说Sol是OpenAI目前最强的模型,但特朗普政府把三个型号的发布全都限了。OpenAI的说法是,预览版只给那些”参与情况已与政府共享”的合作伙伴。

    特朗普政府这波操作不是孤立事件。此前Anthropic发布其最强公开模型Fable 5之后,政府直接下令禁止任何外国国民访问,导致Anthropic不得不把整个模型下线。

    政府到底要干什么

    前白宫AI顾问、即将入职OpenAI的Dean Ball说得很直白:特朗普最近签的那项行政令,要求特定AI公司在发布前最多30天把最先进的模型提交政府审查,这实际上是搞出了一个”事实上的非自愿许可制度”,对前沿AI实施了强力限制。

    Ball还指出一个更棘手的问题:政府并没有拿出明确的安全标准。这意味着什么?模型发布可能被无限期推迟。对中国来说这可能是好消息,对美国那些砸了几十亿美元建AI基础设施的公司来说,这简直是噩梦。

    OpenAI这次虽然照做了,但态度很明确:这不该成为长期默认做法。公司在周五的博客里写得很清楚:”我们不认为这种政府审查流程应该成为长期默认。它让用户、开发者、企业、网络防御者和全球合作伙伴都无法获得最好的工具。”

    GPT-5.6 Sol到底强在哪

    撇开监管风波不谈,GPT-5.6 Sol确实是OpenAI目前最强的模型。根据OpenAI的说法,Sol在编码、生物和网络安全方面的代理能力都有提升,还引入了”max”推理努力模式和”ultra”模式——后者用协调的子代理来解决高度复杂的任务(当然,你的token消耗量也会随之飙升)。

    OpenAI宣称GPT-5.6 Sol在几个基准测试中都表现优异,编码工作流甚至略优于Anthropic的Claude Mythos 5(没错,就是本月也被特朗普政府实际上禁掉的那款)。而且Sol的性价比更高——输出token用量只有Mythos预览版的三分之一。


    安全方面,OpenAI强调Sol搭载了目前最强大的安全堆栈,对对抗性攻击做了深度加固,而且故意优化为优先支持防御性网络安全工作,而不是进攻性渗透。换句话说,这个模型的设计目标就是难被越狱,同时优先教用户怎么防御攻击,而不是怎么入侵系统。

    OpenAI还学乖了——Anthropic的Fable 5当初就是因为过度谨慎栽了跟头。Fable 5上线那短短几天里,只要分类器检测到高风险话题(比如网络安全、生物、化学),它不光会拒绝提示词,还会偷偷把请求路由到一个旧模型。这种过度谨慎的流程和”暗箱降权”引发了大量误报和用户反弹。OpenAI这次把安全护栏直接内置到核心模型行为里,而不是靠上面叠一个独立过滤器。

    定价和开放时间表

    GPT-5.6三个型号的定价分了档:Sol是每百万输入token 5美元、输出token 30美元;Terra正好是一半;Luna则是1美元和6美元。OpenAI还改进了提示词缓存,让重复提示的成本更便宜、也更可预测。

    目前的限制只是”短期步骤”,OpenAI说接下来几周会让GPT-5.6走上更广泛应用之路,同时正与政府合作制定新的行政令框架,涉及网络安全,以及”未来模型发布的可重复流程”。

    话说回来,政府伸手管模型发布这件事,才刚刚开始。Anthropic的Mythos风波还没完全平息,OpenAI又被迫缩小发布范围,接下来轮到谁?谷歌?Meta?这场AI监管大戏,估计还有得演。

  • OpenAI联手博通九个月拿出第一颗自研芯片,Jalapeño能不能撼动英伟达?

    OpenAI联手博通九个月拿出第一颗自研芯片,Jalapeño能不能撼动英伟达?

    6月24日晚上,OpenAI在旧金山和帕洛阿尔托两地同步开发布会,亮出了一颗以墨西哥辣椒命名的芯片——Jalapeño。这是OpenAI成立九年来的第一颗自研芯片,从立项设计到成功流片,只用了九个月。

    OpenAI Jalapeño AI推理芯片
    OpenAI与博通联合发布的首款自研AI推理芯片Jalapeño,从设计到流片仅用时九个月。

    发布会现场,博通CEO陈福阳(Hock Tan)和总裁Charlie Kawwas把首批工程样片交到了OpenAI CEO山姆·奥特曼和总裁格雷格·布罗克曼手里。这个画面挺有象征意义的——一家靠算法和模型起家的AI公司,正式迈进了硬件领域。

    九个月做出一颗芯片,这是什么概念

    正常来说,一颗复杂AI芯片从设计到流片,周期通常是18到24个月。Jalapeño只用了九个月,部分原因是OpenAI自己参与了开发流程——AI帮工程师加快了某些设计工作。

    但更关键的是分工。OpenAI负责芯片的底层架构设计,博通负责硅片实现(代工制造)和网络硬件(包括Tomahawk交换芯片),加拿大电子制造服务商Celestica负责板卡与机架系统集成。这种分工模式让OpenAI能专注于自己最懂的部分——AI模型需要什么样的计算——而把制造和集成交给有经验的人。

    博通CEO陈福阳在接受路透社采访时说,Jalapeño的性能”可与英伟达Blackwell芯片和谷歌TPU相媲美”。他同时透露,这款AI加速器相比传统GPU可节省约50%的成本。

    专门优化的ASIC路线

    Jalapeño不是通用GPU,而是一款面向大语言模型推理场景量身打造的ASIC(专用集成电路)。与英伟达GPU相比,ASIC可编程灵活性更低,但可以针对AI专属任务做深度优化,成本优势显著。

    在架构上,Jalapeño重点优化了数据流,减少数据移动,让计算、内存与网络资源的配置更均衡,实际利用率更接近理论峰值。OpenAI硬件负责人理查德·何(Richard Ho)说,团队围绕”对前沿AI模型最为关键的内核、内存传输、网络以及服务模式”对架构做了全面优化。

    首批工程样片已经在实验室以量产标准的频率和功耗条件下稳定运行机器学习任务,还成功跑通了OpenAI今年2月推出的代码模型GPT-5.3-Codex-Spark。早期测试显示,Jalapeño的每瓦性能(能效比)将显著优于当前业界最先进水平。

    只供内部使用,不对外销售

    一个值得注意的细节:Jalapeño芯片和配套服务器系统均不会对外销售,只供OpenAI内部使用。配套服务器由天弘科技负责生产。

    这意味着OpenAI做这颗芯片,目的不是跟英伟达打擂台卖芯片,而是给自己建一条算力的”后路”——降低对英伟达GPU的依赖,同时压低自己的推理成本。

    这个策略不难理解。OpenAI每年花在算力上的钱是个天文数字,而且英伟达GPU并不总是那么容易拿到。能自己控制供应链,对OpenAI这样的公司来说,战略价值远大于财务账面上省的那点钱。

    部署时间表和后续规划

    按照OpenAI的规划,Jalapeño将在2026年底前开始小规模部署,2027年快速爬坡,2028年上半年实现全面规模化量产。远期规划总耗电量最高将达到10吉瓦,配套建设千兆瓦级数据中心集群。

    OpenAI把Jalapeño定位为”多代计算平台的首个里程碑”。布罗克曼说:”通过自主研发更多底层技术环节,我们可以用更高效率提供智能服务,持续推动前沿人工智能技术实现规模化普惠落地。”

    芯片发布也让人联想到OpenAI的IPO传闻。奥特曼最近表示,公司正考虑”在未来一年内”进行公开上市。Coinbase已经推出了与OpenAI相关的Pre-IPO期货。自己掌握芯片供应链,对于一家准备上市的公司来说,绝对是加分项。


  • 这个AI不直接回答问题,它把Claude和Gemini叫来一起干活

    大多数AI模型的工作方式都很直白:你问问题,它给你答案。但日本AI创业公司Sakana AI最近发布的Fugu Ultra模型,选择了一条完全不同的路——它自己不生产答案,而是充当”调度主任”,把任务派给其他AI模型来完成。

    这个听起来有点”偷懒”的思路, benchmark跑分居然干翻了一众前沿模型。Sakana说Fugu Ultra在编码、推理、科学计算、智能体能力这些硬核测试里,成绩和Anthropic的Fable 5、Mythos Preview基本持平。一个”二传手”凭什么做到这个水平?答案藏在它的架构里。

    Sakana Fugu Ultra AI模型架构示意图
    Fugu Ultra通过调度多个前沿AI模型协同完成任务(配图由AI生成)

    “河豚”的命名来由

    Fugu在日语里是”河豚”的意思。河豚是一道需要极高烹饪技艺的菜——处理得当是美味,处理不好就是毒药。Sakana(日语”鱼”的发音)用这个词命名自己的模型,大概是在暗示:把多个AI模型编排在一起,本身就是一门险中求胜的手艺。

    技术上说,Fugu本身也是一个训练过的语言模型,只是它的专长不是直接回答用户的提问,而是学会了一套”智能体编排”的能力。当你向Fugu发起请求,它先判断这个任务该怎么做:简单的就自己搞定,复杂的就自动组建一个”专家团队”来协同完成。

    Fugu通过训练学会了判断”什么时候该把任务委托出去、智能体之间怎么通信、怎么把多个模型的输出整合成一个可靠的答案”——这整套编排逻辑不是人工写死的规则,而是模型自己学出来的。

    底层调用了哪些模型?

    Sakana没有公开完整名单,但确认Fugu会在合适的任务上调用Claude和Gemini等前沿模型。有意思的是,Fugu不会告诉你它这次具体用了哪个模型——用户看到的是一个统一的回答,底层调度对用户透明。

    这个设计有个很实用的好处:如果某家供应商突然限制访问(比如美国政府某天又说不许某些地区用Claude),Fugu可以自动切换到其他可用模型,不需要用户手动干预。这种”供应商无关”的架构,在当下的地缘政治环境下显得格外有意思。

    • Fugu Ultra针对复杂多步骤任务优化,可调度更深的智能体池
    • 基础版Fugu平衡性能与延迟,支持用户自主排除特定模型(满足数据合规需求)
    • 底层智能体池完全可替换,未来会持续纳入更新的高效模型
    • Sakana强调:未公开可用的闭源模型(如Fable 5)不会被纳入智能体池

    Beta测试用户的真实反馈

    接近500人的Beta测试里,收集到了一些挺有说服力的反馈。一位软件工程师说,Fugu Ultra做代码审查比GPT-5.5更全面,能发现其他工具漏掉的漏洞——别的工具标出3个问题,Fugu能找出20个以上。一位企业平台公司的高管提到,Fugu在长会话里的人格稳定性远超其他模型,不会出现”人格漂移”,这对智能体类产品来说是个关键指标。

    还有一位网络安全工程师的反馈也很典型:只要给Fugu一个范围明确的指令,它能端到端完成信息收集、XSS/SQL注入检测、认证逻辑审查,最后输出一份带证据和复测步骤的完整报告,而且全程不超出指定范围,不会乱执行破坏性操作。

    这会不会是AI的新范式?

    Fugu的出现,触及了一个正在AI圈子里引发越来越多讨论的问题:未来最强大的AI能力,会不会不是来自某个单一的超大模型,而是来自能把各种模型调度好的”元模型”?如果答案是肯定的,那训练和拥有底座大模型的公司,和那些最擅长编排底座模型的上层公司,谁的价值链地位更高?

    Sakana自己当然相信后者。他们在ICLR 2026发表的两篇论文(TRINITY和Conductor)就是在为这个方向做学术背书。Fugu能不能真的跑出来,还需要更多真实场景的验证,但至少它提出了一个值得认真看待的问题:当每个人都在训练更大的模型的时候,也许最聪明的玩法不是造更大的模型,而是把现有的模型用得更聪明。


  • 有人做了个AI”名气排行榜”,你的名字在大模型里有多大分量?

    有人做了个AI”名气排行榜”,你的名字在大模型里有多大分量?

    AI模型名气排行榜
    “In the Weights”网站界面,像素风设计,展示AI模型对人物的”认知强度”

    你上一次在谷歌上搜索自己的名字是什么时候?如果你试过,你可能已经注意到结果和以前不太一样了。这不是你的错觉——随着聊天机器人越来越成为人们获取信息的主要方式,搜索引擎已经不再是那个”权威记录者”了。

    那么问题来了:如果有人想看看自己在AI眼里”存在”吗,该怎么办?

    两个前OpenAI员工做了一个”AI虚荣搜索”

    托马斯·丁森和乔伊·弗林决定解决这个问题。他们做了一个叫”In the Weights”的网站——名字里的”weights”指的是AI模型的参数权重,也就是那些决定模型输出效果的神秘数字。

    这个网站做的事情很简单,但也足够让人上头:它向十几个主流AI模型(包括Grok、Gemini、多个版本的GPT、Claude、Llama)提出一个类似”XXX是谁?给出最多10个结果”的问题,然后给出一个”强度分数”。分数越高,意味着AI模型们越”认识”你。

    “在weights里,意味着你的存在被认为在创造超级人工智能的过程中是重要的。”——In the Weights网站关于页面

    排行榜一直在变

    网站的排行榜是实时变化的——就在我写这篇文章的时候,排名第一的是《小鬼当家》的主演麦考利·卡尔金,他的强度分数是988,和歌剧演唱家卢西亚诺·帕瓦罗蒂咬得很紧。

    TechCrunch的作者安东尼·哈——就是报道这件事的那位记者——在这个网站上的强度分数是641,排在前6%。他承认自己看了一眼同事的分数之后,感觉还能再高一点。

    网站还会标注可能的AI幻觉:显然GPT-5.4 Mini在回答”Anthony Ha是谁”的时候,给出的答案是”这是一个缩写,可能指代多个人”。

    这不只是虚荣心作祟

    丁森在接受TechCrunch采访时说,2026年做谷歌式的”虚荣搜索”已经不对了,因为越来越多的流量在流向大模型。他还说,这个网站的方向某种程度上是被一篇戏谑的博客文章”定调”的——那篇文章用幽默的方式讨论了AI权重和”我们是否只是一堆肉做的”这个经典哲学问题。

    到目前为止,这个网站的”接收情况”已经超出了他们的预期。他们本来以为这会是一个小小的好奇心满足工具,没想到它好像触发了某种神经——人们真的很好奇自己是否能在超级智能里”永垂不朽”。


    In the Weights用一种轻松、怀旧的方式(网站界面是任天堂NES风格的像素风)提出了一个严肃的问题:当AI模型成为人们认知世界的主要中介的时候,被AI”记住”到底意味着什么?你可以去试试看——但友情提醒,分数可能会让你有点在意。

  • 微软不再只靠OpenAI了,它悄悄练出了一套自己的AI模型

    Microsoft MAI AI模型
    微软在Build 2026上发布的MAI模型家族,标志着AI战略的重要转向(配图由AI生成)

    Microsoft和OpenAI这对搭档,这几年几乎绑定在一起。Copilot用的是OpenAI的模型,Azure上跑的是OpenAI的API,连Windows里的AI功能都离不开GPT的底层支持。但这种关系正在起变化。

    在上个月的Build 2026大会上,微软悄悄干了一件大事——它发布了一套完全自研的AI模型家族,名字叫MAI(Microsoft AI)。其中最值得说的是MAI-Thinking-1,这是微软第一个自己从头训练的推理模型。

    说”从头训练”很重要。现在很多公司做模型都是拿别人的前沿模型来蒸馏,相当于抄作业。微软这次说的是,他们的训练数据是干净的,没有从第三方前沿模型里蒸馏,是自己从零开始训的。

    MAI-Thinking-1:350亿参数,MoE架构

    MAI-Thinking-1有多大?微软给的数字是350亿活跃参数。这里说的是”活跃参数”,因为模型用了MoE(混合专家)架构——每次推理只激活需要的部分,不用把整个模型都跑一遍。这样做的好处是效率高、成本低。

    性能方面,微软说它在SWE-Bench Pro上的表现跟Claude Opus 4.6差不多,但成本要低很多。GitHub的运营负责人Kyle Daigle说这个模型是冲着”高性能高效率”去的,token价格会很有竞争力。

    一口气发了7个模型

    但光有一个推理模型还不够。微软这次一口气发了7个模型,覆盖了文本推理、代码生成、图像生成、语音转文字、文字转语音整个链路。

    • MAI-Code-1-Flash:专门给GitHub Copilot和VS Code用的代码模型,主打推理效率高,适合大规模跑
    • MAI-Image-2.5:做文生图和图像编辑,在Arena.ai的图像榜单上排第二,微软说它是市面上性价比最高的图像模型
    • MAI-Voice-2:多语言语音合成,支持15种语言,还能保留说话人的声音特征
    • MAI-Transcribe-1.5:语音识别,支持43种语言,速度是同类模型的5倍

    为什么要独立?三个原因

    这些模型现在有的已经上线Microsoft Foundry,有的还在私人预览阶段。但方向已经很清楚了:微软要把AI的每一层都掌握在自己手里。

    这件事的背后是微软和OpenAI合作条款的重新谈判。新协议签下来,微软访问OpenAI模型和技术授权到2032年,但这个授权变成了非独占的——OpenAI可以卖给别人,微软也可以自己搞。

    微软为什么这时候要独立?有三个原因说得通。第一,不能把命门捏在一个外部供应商手里。第二,自己的模型可以针对自己的产品、硬件、企业客户做优化,不用迁就别人的路线图。第三,也是实在的,跑自己的模型可以省掉一大笔给第三方模型提供商的分成。

    AI操作系统的一步棋

    更值得关注的是,微软还在做一个叫Scout的永远在线的AI助手,基于OpenClaw开源项目。这东西能帮你准备会议、管日程、起草邮件,是往”AI操作系统”方向走的一步棋。有意思的是,微软之前一直把自主AI智能体当成安全风险来看,现在直接把它做成了产品功能。

    硬件端也在布局。微软发布了Surface RTX Spark开发者盒子,用Nvidia的芯片,让开发者可以在本地跑和测试模型。还有能在Windows PC上直接跑的Aion小模型,以及跟高通一起做的基于Android的AI设备原型。

    这些动作串在一起,看得出来微软的算盘:它不想只当OpenAI的分销渠道,它要自己做模型、自己做智能体、自己做硬件、自己做企业AI平台。对用微软产品的公司和开发者来说,这意味着以后会有更多选择,也可能用上更便宜的AI能力。

  • 你在AI模型里的”存在感”是多少?这个网站让你查自己在大模型里的分量

    你在AI模型里的”存在感”是多少?这个网站让你查自己在大模型里的分量

    你有没有试过在Google上搜自己的名字?以前这会让你看到自己的社交媒体、工作信息、也许还有一篇你忘了的多年前写的博客。但现在,越来越多的人发现:ChatGPT或者Gemini告诉他们关于自己的事情——而且有时候,那些事情是错的。

    两个前OpenAI员工Thomas Dimson和Joey Flynn(他们是在OpenAI收购他们的设计工作室Global Illumination时加入的)最近做了一个网站,叫In the Weights。这个网站干的事说起来有点滑稽:它帮你查,你在各个AI大模型里的”存在感”到底有多强。

    “权重”里的存在感,被量化成了一个分数

    这里的”权重”(weights)指的是AI模型训练完成之后,那些决定模型输出结果的数值参数。In the Weights网站宣称,它衡量的是”一个模型在不用网络搜索等工具的情况下,能多准确地回忆起某人”。

    具体做法是:向不同的模型(包括Grok、Gemini、多个版本的GPT、Claude,还有一些不太知名的模型)提问,问题类似于”某某是谁?给出最多10个结果,每个附一段简短描述和一个置信度。”然后网站把相似的描述聚类,给出一个”强度分数”。

    In the Weights网站界面
    像素风格的排行榜界面,灵感来自任天堂经典游戏

    《小鬼当家》主角居然排第一

    写这篇文章的时候,排行榜还在实时变动。目前排在第一位的是《小鬼当家》的主演Macaulay Culkin,强度分数988。歌剧演唱家Luciano Pavarotti紧随其后。这个排行榜本身就挺能说明问题的——哪些人”值得”被AI记住,似乎和名气、文化影响力有直接关系。

    本文原作者Anthony Ha的分数只有641,排在前6%。刚看到的时候还有点小得意,直到发现好几个同事的分数都比他高。当然,AI批评者Anthony Moser不客气地说,这玩意儿”本质上就是让13个聊天机器人告诉你关于你自己的事”。说得也没错。

    为什么有人在乎这个

    Dimson说,他做这个网站的灵感来自一个观察:2026年,在Google上搜自己已经不是那个”标准动作”了,越来越多的人从聊天机器人那里了解一个人。而”那么多人的生命,都以某种方式被编码进了AI大脑的浮点数字里”。

    他觉得,被AI”记住”这件事,触及了一个更深的焦虑——在AI越来越了解我们的时代,我们怎么确认自己还”存在”?把这个存在感量化成一个分数,放在一个像素风格的排行榜上,这本身就很2026年。


  • 一家迈阿密AI创业公司说它突破了LLM十年的数学瓶颈,外界将信将疑

    一家迈阿密AI创业公司说它突破了LLM十年的数学瓶颈,外界将信将疑

    一家迈阿密AI创业公司说它突破了LLM十年的数学瓶颈

    一家叫Subquadratic的迈阿密AI创业公司,上个月从隐身模式走出来,扔了一颗重磅炸弹:他们说自己解决了一个卡了LLM近十年的数学瓶颈。

    细节很少,很多人不信。但Subquadratic开始拿出证据了——他们公布了第三方公司Appen对他们的新模型SubQ的独立评估结果。结果看起来,这家公司的说法或许值得认真看待。

    Subquadratic AI模型突破LLM瓶颈
    Subquadratic声称SubQ模型突破了LLM的二次方计算瓶颈

    根据Subquadratic的说法,他们开发了一种全新的LLM,叫SubQ,比市面上任何其它模型都更快、更便宜、能耗也低得多。公司还声称,SubQ一次性处理的文本量是最其它大多数模型的12倍,可以执行分析数百份文档或者整个代码库这样的数据密集型任务。

    SubQ在编码等关键任务上的表现基本上能跟Google DeepMind、OpenAI和Anthropic的最佳模型持平。

    问题就在于,这家公司一开始除了少数几个自己发布的测试分数之外,几乎没提供什么证据。而且SubQ至今还没有广泛开放给公众试用。

    所以Subquadratic的说法遭到质疑一点也不奇怪。AI工程师Dan McArthur在X上总结了很多人的反应:”SubQ要么是自Transformer以来最大的突破……要么它就是AI圈的Theranos。”

    注意力机制

    要理解为什么Subquadratic的说法很重要,我们需要深入了解一下大多数LLM是怎么工作的。LLM内部的核心机制是一种叫做”Transformer”的神经网络,它运行一个叫做”密集注意力”的过程。今天的LLM通常将多个Transformer串联在一起。

    密集注意力的工作原理是这样的:当Transformer处理一段文本时,它首先将每个词编码成一个数字,然后将每个数字与那段文本中的每个其它数字相乘。一段10000个词长的文本会触发近5000万次单独的乘法运算。这是大量的计算,也是LLM以能耗巨兽著称的主要原因。

    随着文本长度的增加,计算次数会急剧上升。词的数量翻倍,计算次数大致翻两番,这种增长速度被称为”二次方扩张”。

    削减成本

    Subquadratic的解决方案是抛弃密集注意力,转而使用”稀疏注意力”,这大幅减少了所需的计算次数。稀疏注意力不是将分配给每个token的数字与每个其它数字相乘,而是只选择其中一些数字来相乘。

    “稀疏注意力说,不是所有那些关系都重要,因为它们本来就不重要,”联合创始人兼CTO Alex Whedon说。”如果你在读一本书,你不会去看第一个词和第二个词,第一个和第三个——那太疯狂了。”

    这听起来简单,但Subquadratic也不是第一个尝试的。以前选择哪些数字相乘的技术,都没能产生一个能像密集注意力一样好地捕捉文档含义的机制。

    Subquadratic声称终于破解了这个问题。他们将SubQ宣传为第一个在性能上能与主流密集注意力模型匹敌的稀疏注意力LLM。

    “从历史上看,大多数机制都使用固定模式,”Whedon说。”这相当局限。我们的机制动态选择哪些是重要的,这是对每段文本即时计算的。”

    测试结果

    第三方公司Appen评估了SubQ。在一个纯粹的速度测试中,Appen发现SubQ比使用以前稀疏注意力技术的模型快56倍。在LiveCodeBench编码测试上,SubQ得分89.7%,跟其它顶级编码模型差不多。

    成本方面,根据Subquadratic的说法,通过RULER 128测试,运行Anthropic的Opus 4.6要花费2600美元。SubQ花了8美元。

    SubQ似乎确实能够处理非常大的数据集。该模型有一个长达1200万token的上下文窗口。今天大多数顶级模型的上下文窗口是100万token长。


    尽管得分很高,在更多人亲自上手试用模型之前,一些质疑是有道理的。独立AI研究员Will Depue说:”他们可能做出了真实有用的东西。但公开证据还不足以证明他们解决了二次注意力瓶颈这一更强硬的说法。”

    与此同时,Subquadratic联合创始人Whedon坚持认为,做出不同的东西是他唯一的选择。”如果你想构建一个有竞争力的模型,你必须要有新想法,”他说。

  • Claude Design悄悄升级了编辑器,Anthropic这是要跟Figma、Canva正面刚?

    用AI生成设计图是一回事,能拿来干活是另一回事。Anthropic这几天给Claude Design推了一波更新,思路很直接——不让它只当”出图工具”,而是真的能介入日常设计流程。

    Claude Design更新后的编辑器截图
    Claude Design更新后的编辑器界面 | 图片来源:Anthropic

    新编辑器:终于能直接拖拽了

    之前用Claude Design生成出来的设计稿,好看是好看,但想改个按钮位置还得重新描述一遍需求,或者截图再喂回去。这次新编辑器给了拖拽、缩放、对齐这些基本操作,不用离开界面就能把元素摆到合适的位置。

    这件事的意义比看起来大。AI设计工具过去一直卡在”最后一公里”——图生成出来了,但设计师还是要打开Figma重新画一遍。现在Claude Design想让自己就是那个”最后一环”。

    导出到Adobe、Canva,不再画地为牢

    另一个实用的更新是导出选项变多了。现在Claude Design的项目可以直接导出到Adobe和Canva这些主流设计工具里。对设计师来说,这意味着AI生成的初稿不必困在Claude的界面里,能顺滑地衔接进已有的工作流。

    Anthropic的算盘大概是:你既然已经在用Claude生成设计了,为什么不干脆把后续编辑、导出、协作都在我这儿搞定?

    Claude Design和Claude Code打通了

    这次更新里最值得关注的一个细节:Claude Design和Claude Code做了联动。用户在Design里做的软件界面布局,可以直接转交给Claude Code继续写代码,不用截图、不用重新描述,Code能接着Design的内容继续干。

    这个方向其实挺自然的。Anthropic之前推Claude Code就是主打”能写代码”,现在再把设计端也捏进来,等于在推”设计→开发”的一体化工作流。Figma这些年一直在做DevMode、在做跟代码的衔接,Claude现在从另一端杀进来。


    Anthropic的野心不止于”聊天”

    Claude系列工具这段时间在”横向扩张”。从Claude聊天,到Claude Code写代码,再到Claude Design做设计,Anthropic在把Claude往”全栈创作工具”的方向推。每一步都在蹭Figma、Canva、VS Code这些老牌工具的基本盘。

    目前来看Claude Design还替代不了Figma,但它不需要替代——只要能吃掉”AI生成初稿然后直接迭代”这个场景,就已经是一块很有价值的地盘了。

  • 76名网络安全专家联名抗议:美国政府封禁Anthropic最强模型,是在削弱防御

    76名网络安全专家联名抗议:美国政府封禁Anthropic最强模型,是在削弱防御

    上周,美国政府对Anthropic的Fable和Mythos模型下达了出口管制令,理由是国家安全。Anthropic随即暂停了全球用户对这两款模型的访问。

    事情到这里,看起来又是一个AI监管收紧的故事。但接下来的发展有点出人意料——76名网络安全专家联名写了一封公开信,要求政府撤销这道命令。

    网络安全AI概念图
    网络安全专家联名抗议Anthropic模型出口管制令

    联署名单相当豪华

    这份公开信的签署者里有不少业内重量级人物:前Facebook首席安全官Alex Stamos、漏洞赏金平台Bugcrowd创始人Casey Ellis、著名密码学家兼前苹果安全设计经理Jon Callas、计算机科学家Paul Vixie、前Block应用安全工程负责人Dino Dai Zovi、Luta Security创始人Katie Moussouris,以及安全意识培训公司SocialProof Security的CEO Rachel Tobac。

    他们在信里说得很直接:把最好的模型从网络安全防御者手里拿走,而没有充分的理由,这是”危险的”。

    “当我们的对手在快速进步的时候,把最好的能力从防御者那里拿走,是没有充分理由的危险行为。”

    禁令到底是怎么来的

    Anthropic今年4月推出Mythos预览版时,声称这个模型找安全漏洞的能力太强,所以需要严格限制访问,防止恶意黑客或外国对手拿来在互联网上搞破坏。实际操作里,Anthropic只给了大约50家公司初始访问权限,最近才扩展到15个国家的约150个组织。

    6月9日,Anthropic发布了Fable,这是Mythos的公开版本,但加了严格的护栏,阻止它在生物、化学和网络安全领域的使用,同时也防止别人通过”蒸馏”来复制这个模型。

    问题是,Fable的护栏严格到了许多网络安全专家发现它基本拦掉了任何与网络安全相关的提示词。

    亚马逊的论文:是真越狱还是误报

    据信,白宫的出口管制令可能源于一份亚马逊研究人员的论文,论文展示了一个可以绕过Fable护栏、解锁其Mythos级别能力的方法。

    但联署人之一Katie Moussouris在审阅了这份尚未公开的论文后,给出了完全不同的判断:这根本不是真正的越狱。

    她写道,研究人员只是让Fable去修复含有”故意植入的漏洞”的开源代码——而这正是模型最初拒绝”审查代码安全问题”之后发生的事情。

    “论文里描述的行为没办法被真正修复,任何尝试都只会削弱模型用于防御的能力。”Moussouris写道,”防御者需要能够要求AI修复文件里的bug、解释修复为什么重要、以及编写确认补丁有效的测试。这不是护栏绕过,这是AI模型能为防御性安全做的最有价值的事情:执行防御者每天都在跑的’发现、修复、测试’循环。”

    专家们真正担心的是什么

    公开信里还指出,亚马逊论文里描述的方法,在OpenAI的GPT-5.5上、在Anthropic自己公开可用的Claude Opus 4.8和Sonnet上、”甚至在中国的Kimi 2.7这样的模型上”都能复现。

    也就是说,封掉Fable和Mythos,并没有真正消除这个所谓的”漏洞”——它只是让美国自己的防御者用不上好工具,而对手那边照样能用上类似的能力。

    专家们的要求很明确:他们想要的是由”民主的规则制定程序”产生、基于产业和学术专家科学研究、透明且公平执行的监管,并且”只以最低必要程度使用,以确保美国公众的安全”。

  • 六月AI大模型”挤爆了”:GPT、Claude、Gemini、Grok扎堆发布

    六月AI大模型发布潮
    2026年6月,AI大模型迎来史上最密集的发布潮

    2026年6月,AI圈有点挤。往常一家头部公司发新模型,行业得消化好一阵;这个月倒好,OpenAI、Anthropic、Google、xAI四家差不多同时亮剑,GPT-5.6、Claude Sonnet 4.8、Gemini 3.5 Pro、Grok 5扎堆亮相,上下文窗口一口气推到150万Token。有人开玩笑说,AI圈的六月像双十一预售——不约而同,就怕自己晚一步。

    意外曝光的”后台日志”

    这一波发布潮,最早是从”泄露”开始的。今年4月下旬,有开发者发现OpenAI Codex的后台日志里短暂出现了一个陌生代号——GPT-5.6。没过几天,Claude Code的源码里也被人扒出了Claude Sonnet 4.8和另一个叫Jupiter V1的内部模型代号。

    两家公司都没官宣,但开发者社区已经炸了。评论区最高的赞只有一句话:”When launch?” 从GPT-5.5发布到5.6现身,中间只隔了一个多月。大模型迭代周期从”数月”缩短到”数天”,AI军备竞赛的节奏已经完全不一样了。

    四家同时亮剑,打的什么算盘?

    Google的Gemini 3.5 Pro走的是”长上下文”路线,150万Token的窗口意味着你可以把一整本书丢进去,还能接着对话。这个方向很Google——他们有搜索基础设施的底子,处理超长文本本来就是强项。

    Anthropic的Claude Sonnet 4.8继续在”安全”和”可控”上做文章,面向企业用户的味道很浓。OpenAI的GPT-5.6则更像在补全5.5没做完的事——据泄露出来的信息,5.6在代码能力和多模态理解上有明显提升。

    马斯克的Grok 5是最难预测的。xAI的数据中心折腾了好几个月(SpaceX的Colossus 1因为延迟问题租给了Anthropic和Google),但Grok 5如果准时出来,打的就是”实时信息”这张牌——毕竟Grok直接接Twitter/X的 firehose,这是其他家都没有的数据优势。

    国产阵营也没闲着。Qwen3.6、GLM-5.1、Kimi也在6月前后密集更新,而且走的是开源路线。国际市场打性能,国内市场打价格+开源,两边都在抢时间窗口。

    模型越强,商业越难

    密集发布背后有一个不那么显见的问题:模型能力越来越强,但怎么赚钱反而越来越难。Gemini 3.5 Pro的150万Token上下文听起来很厉害,但每次推理的计算成本也跟着涨。GPT-5.6能力更强,但不降价就没人用,降价就亏本——这是所有头部玩家都在面对的困局。

    一个正常的月份里,一家发新模型就够行业消化一阵了。但2026年6月,我们迎来的是四家同时发布。这不是巧合——大家都在抢同一个时间窗口,抢同一批企业客户,抢同一批开发者的注意力。挤就挤吧,用户倒是有的挑了。


    📎 相关信息:GPT-5.6与Claude Sonnet 4.8泄露分析、June 2026 AI Model Release Tracker