标签:

  • OpenAI说这次真的解决了80年数学难题,上次的尴尬还记得吗?

    OpenAI说这次真的解决了80年数学难题,上次的尴尬还记得吗?

    如果你最近刷到OpenAI又双叒叕宣布”解决数学难题”的消息,第一反应可能是:又来?

    确实,这话听着耳熟。7个月前,OpenAI时任副总裁Kevin Weil在X上发帖,信誓旦旦地说GPT-5找到了10个此前未解的埃尔德什问题解决方案,另外11个也取得了进展。结果呢?被打脸了。那些”新解决方案”早就存在于现有文献中,压根不是什么新发现。

    那次翻车之后,Yann LeCun、谷歌DeepMind CEO Demis Hassabis等竞争对手轮番嘲讽,Weil也只能默默删帖。可以说OpenAI在数学证明这件事上,信用已经透支得差不多了。

    这次被解决的是保罗·埃尔德什(Paul Erdős)1946年首次提出的几何猜想。近80年来,数学家们普遍认为这个问题的最优解大致类似正方形网格。OpenAI的新推理模型把这种想法推翻了,发现了一种全新的构造族,性能更优。

    但这次,OpenAI好像真的没吹牛。

    这次OpenAI在X上发帖宣布消息时,还附上了数学家Noga Alon、Melanie Wood和Thomas Bloom的支持性评论。Bloom是Erdos Problems网站的维护者,就在7个月前,他还在社交媒体上称Weil的那条官宣是”戏剧性的不实描述”。这次他站出来背书,分量不轻。

    不是专门训练出来的”数学天才”

    OpenAI的说法是:这是”AI首次自主解决数学领域核心的著名开放问题”。而且特别强调,这个证明是由新的通用推理模型产出的,不是专门为了解这个数学题、甚至不是专门针对这个问题设计的系统。

    换句话说,这是个意外之喜,不是定向训练的结果。这意味着模型的推理能力已经强到可以在没有专门训练的情况下,自主产出原创的数学证明。

    这件事为什么重要?OpenAI的解释是:这意味着AI系统现在更有能力处理长难推理链,并且能以研究人员此前未探索过的方式跨领域连接想法。这对生物学、物理学、工程和医学都有重要意义。

    Erdős数学问题示意图
    埃尔德什问题相关数学示意图 | 图源:TechCrunch

    数学界会买账吗?

    Thomas Bloom的声明说得很漂亮:”AI正在帮助我们更全面地探索几个世纪以来我们搭建的数学殿堂。还有哪些未被发现的美妙事物正等待被发掘?”

    话是这么说,但数学界向来对计算机辅助证明持保留态度。1998年四色定理的证明用到了计算机穷举,至今仍有数学家觉得不够”优雅”。这次OpenAI给出的证明,能不能被数学界真正接受,恐怕还得看同行评审的结果。

    不过有一点倒是挺有意思的:上次的尴尬过去才7个月,OpenAI就端出了一个有数学家背书的成果。是模型能力真的跃升了,还是这次学乖了、先找好背书再开发布会?

    答案可能要等一等才能知道。但至少这次,OpenAI没有让自己再次成为笑话。


  • Supabase:103k Stars!开源Firebase替代品,AI应用的数据底座首选

    Supabase:103k Stars!开源Firebase替代品,AI应用的数据底座首选

    Supabase - The Open Source Firebase Alternative

    Supabase – 开源 Firebase 替代品

    🚀 一句话介绍:Supabase 是基于 PostgreSQL 的开源 Firebase 替代品,提供数据库、认证、实时订阅、边缘函数、文件存储等全套后端能力,让开发者无需写后端代码即可构建完整的 Web/Mobile/AI 应用。


    ⚙️
    安装要求与过程

    环境要求

    • Docker Desktop(本地开发必备)
    • Node.js 18+(前端集成)
    • Git(获取源码)
    • 支持 macOS / Windows(WSL2) / Linux

    🚀 快速安装(3种方式)

    # 方式一:使用官方 CLI(推荐)
    npm install -g supabase
    supabase init
    supabase start
    
    # 方式二:Docker 直接运行
    docker run -p 8000:8000 supabase/supabase
    
    # 方式三:直接使用云端(零安装)
    注册即用的托管平台 → https://supabase.com/dashboard

    ✅ 本地启动后访问 http://localhost:54323 即可打开控制台



    核心功能

    🗄️

    托管 PostgreSQL 数据库

    完整 PostgreSQL 实例,支持扩展、备份、SSL 加密,直接提供生产级数据库服务。

    🔐

    身份认证与授权

    基于 JWT 的完整认证体系,支持邮箱/密码、魔法链接、OAuth(GitHub/Google/Apple 等)。

    自动生成 API

    零配置自动生成 REST API(PostgREST)和 GraphQL API,实时订阅数据库变更(Realtime)。

    🤖

    AI 向量存储

    内置 pgvector 扩展,支持向量嵌入存储与语义搜索,是构建 RAG 应用和 AI 知识库的理想数据底座。

    边缘函数

    基于 Deno 的全球边缘函数,支持 TypeScript,超低延迟执行后端逻辑,就近部署。


    💡
    典型使用场景

    场景一:AI 应用的数据底座

    利用 Supabase 内置的 pgvector 扩展存储向量嵌入,配合 Supabase 客户端库实现语义搜索。适合构建 RAG 应用、AI 聊天机器人的知识库、文档问答系统等。与 OpenAI / Anthropic API 无缝集成,是 AI 全栈开发的首选后端。

    场景二:SaaS 应用快速启动

    一个命令 supabase init 即可获得全套后端:数据库 + 认证 + API + 文件存储 + 实时订阅。不需要雇用后端团队,不需要配置服务器,专注于前端业务逻辑即可。大量 indie hackers 和创业团队用它在一周内完成 MVP 上线。

    场景三:实时协作应用

    Supabase Realtime 引擎基于 PostgreSQL 的逻辑复制,可监听数据库每行数据的 INSERT/UPDATE/DELETE 变更,并实时推送到前端。适合构建多人协作工具(如 Notion 类应用)、实时聊天、在线白板等场景。


    ❤️
    推荐理由

    作为一名 AI 开发者,我选择 Supabase 最核心的原因是:它把 PostgreSQL 的强大数据能力与 AI 应用的需求完美结合了。内置的 pgvector 扩展让我不需要额外维护一套向量数据库,所有用户数据、向量嵌入、文件存储都在一个平台搞定。

    对比使用传统的”PostgreSQL + 独立向量数据库 + 独立 Auth 服务”的组合,Supabase 帮我省掉了大量运维成本。开源 + 自托管的特性也意味着数据完全掌握在自己手里,对于有数据安全要求的企业场景尤为重要。

    目前 Supabase 在 GitHub 上已经突破 10 万 Stars,社区活跃度极高,几乎每周都有新功能和改进上线。如果你正在做 AI 应用、SaaS 产品或者任何需要后端的项目,强烈建议试试!


    🔗
    下载地址

    💡 小贴士

    Supabase 提供 免费套餐(500MB 数据库、1GB 文件存储、50K 月活用户),个人项目完全够用!付费方案从 $25/月 起。

  • 2026年5月AI圈的三件大事:新模型扎堆发布,Agent终于落地,然后电力不够用了

    2026 年的 5 月,AI 圈的热闹程度一点不比 4 月差。模型发布、Agent 落地、电力危机——这三件事同时发生在同一个月份里,凑在一起看,你会发现这个行业的节奏已经完全不是「按年迭代」了,而是按月、甚至按周在翻篇。

    模型发布潮,这次不一样

    OpenAI 的 GPT-5.5 系列还在持续推出变体,方向很明确:不再追求一个万能模型打天下,而是按场景拆分成不同专业版本。GPT-5.5-Cyber 专门盯网络安全场景,能做漏洞挖掘和攻防推理——这种垂直专业化的做法,说明厂商已经意识到通用模型在企业场景里的性价比瓶颈。

    Claude Mythos 更神秘一些,目前只有约 50 家合作伙伴能拿到受限预览资格。传闻在推理、编码、Agent 执行和漏洞发现这几个能力上都有重大突破。稀缺性反而让它热度更高——但说实话,这种「限量内测」的打法,到底是为了控制风险还是营销手法,外人很难判断。

    DeepSeek V4 的出现,让「低成本逼近前沿性能」这件事从例外变成了趋势。开源权重模型的竞争力,已经到了闭源厂商不能忽视的程度。

    DeepSeek V4 预览版已经上线,正式版预计近期发布。它的核心卖点是以极低的推理成本提供接近前沿水平的性能。对于高用量场景来说,这个性价比优势是真实的,不是噱头。Meta 的 Avocado 则推迟到了 5-6 月发布,说明即使头部厂商也会在研发落地的时间表上翻车——厂商给的路线图,看看就好,别当真。


    Agent 落地,这次是真的

    Gartner 有个预测:到 2026 年底,40% 的企业应用会嵌入 AI Agent。2025 年这个比例还不到 5%。这个跨度不是渐进式的,是跳跃式的。Deloitte 直接把 2026 年定义为「Agentic AI 的转折点」,IBM 等厂商也在推「超级智能体」和「多智能体编排」的概念。

    开发者社区的话题也变了。半年前大家还在争论「Agent 到底有没有用」,现在已经在讨论用 CrewAI 还是 LangGraph,MCP 协议怎么接入,Agent 的可靠性和成本怎么管控。这种讨论重心的转移,比任何报告都能说明问题——Agent 已经脱离概念验证阶段,进入实际落地周期了。

    但落地难度的提升也是真实的。Agent 从「生成回复」到「执行工作流」,意味着出错的影响范围完全不同。以前 AI 说错一句话,代价是一段不那么准确的摘要;现在 Agent 自动执行了一系列操作,哪怕其中一个环节出错,后果可能是删错数据、发错邮件、或者把订单派到错误的地址。

    电力危机,AI的下一个瓶颈

    最后一个话题有点沉重,但躲不过。AI 不是普通软件,它是高能耗的计算范式。一个 AI 密集型查询的耗电量,远高于一次传统网页搜索。大规模数据中心园区需要几百兆瓦的电力容量支撑——这个数字不是比喻,是实际的基础设施需求。

    Gartner 又有一个预测:到 2027 年,电力短缺将限制约 40% 的 AI 数据中心落地。美国目前约有一半的规划数据中心项目,因为电力基础设施和相关组件短缺被推迟或取消。钱能解决的问题都不是最难的问题,但变电站建设、变压器供应、电网接入审批——这些是工业协调问题,推进速度远慢于模型发布的节奏。

    AI 发展的下一个瓶颈不是芯片,不是模型,也不是资本——是现实世界的落地能力。

    说回太浩湖那个例子。4.9 万居民和 AI 数据中心抢电,这不是一个孤立事件,而是一个缩影。AI 扩张的基础设施成本,最终会以某种方式转嫁到社会层面。这个问题在 2026 年还只是苗头,但再过两年,它会变成政策制定者必须正面回应的问题。

  • OpenAI把Codex搬进手机了,随时能写代码这件事到底靠不靠谱

    前几天刷到一条消息,OpenAI 把 Codex 搬到手机上了。没错,就是那个在桌面端帮程序员写代码的 AI 工具,现在你可以在手机上直接生成、审阅、甚至部署代码片段。对远程团队来说这是个挺实在的更新,毕竟不是所有人时刻坐在电脑前,等不及的时候掏出手机就能改两行代码,这种灵活性以前真的没有。

    手机写代码,真不是噱头

    Codex 移动端预览版直接集成在 ChatGPT 应用里,不需要额外安装。最实用的一点是它支持远程 SSH 连接,意味着你真的可以在手机上完成一段代码的审阅、修改、然后推到服务器。当然有人担心移动环境下的代码安全,这个顾虑是合理的,毕竟手机网络比办公网络复杂得多,敏感项目的操作还是得悠着点。

    OpenAI 这次把这个功能做成预览版,说明他们自己也很清楚——移动端编码这件事,体验和安全性都还需要迭代。

    有意思的是,几乎同一时间,Anthropic 的 Claude Code 产品负责人 Cat Wu 也在公开场合聊了类似的话题。她说 Claude Code 的开发思路是不预设宏大的整体规划,更看重迭代反馈而非僵化的路线图。这话听起来有点虚,但仔细想确实有道理——AI 编码工具这种东西,你很难在发布前就把所有使用场景规划清楚,用户怎么用、在哪卡住,这些反馈比任何前期调研都值钱。

    AI辅助软件开发
    AI 正在改变软件开发的节奏(来源:coaio.com)

    企业AI架构,风向变了

    还有一个信号值得注意。行业分析里开始出现一种声音:企业级 AI 系统开发,正在从「LLM 优先」转向「代码优先」。什么意思呢?过去一年多,大家一上来就想把大模型能力塞进系统,先把聊天界面搭起来,再想业务逻辑。现在有人意识到,这样做虽然出活快,但开发者对系统的深度理解会被掩盖, Demo 做得很炫,真正跑起来全是坑。

    新思路强调「代码优先」,说白了就是先把业务逻辑、数据结构、系统边界想清楚,再用 AI 工具去加速开发,而不是反过来。这个转变背后其实是教训——太多项目在规模化部署的时候翻车,技术债务堆到还不起。


    其他值得关注的动静

    AMD 这边也有动作,宣布给 RDNA2 和 RDNA3 架构的老显卡提供硬件加速的 FSR 4 超分辨率支持。通俗点说,就是你手里那张几年前的显卡,可以通过驱动更新获得更好的游戏画质,相当于变相延长了硬件寿命。对不想频繁换卡的用户来说,这算是个小惊喜,虽然性能上肯定还是有损耗的。

    医疗 AI 这边出了个警示案例。加拿大安大略省审计发现,医生用的 AI 笔记工具频繁虚构治疗建议和处方内容。这个问题其实不意外,大模型的「幻觉」在医疗场景下后果完全不同。行业里已经开始呼吁建立更严格的 AI 输出验证机制,但这件事真正做起来,比喊口号难多了。

    最后说个有点荒诞的事——美国太浩湖地区 4.9 万居民,正在和内华达州的一个 AI 数据中心抢电。能源供应商优先给数据中心供电,居民用电反而被挤压。AI 的扩张代价,最终是普通人在承担,这个问题只会越来越突出。

  • 2026年5月AI圈大事件:GPT-5.5来了,Kimi融资20亿美元,人形机器人走向工厂






    2026年5月AI圈大事件:GPT-5.5来了,Kimi融资20亿美元,人形机器人走向工厂

    5月的AI圈,信息量爆炸。OpenAI发布了GPT-5.5,国产AI企业Kimi即将完成20亿美元融资,人形机器人展览会在杭州开幕,苹果因为AI功能虚假宣传赔了2.5亿美元……如果你没时间每天刷新闻,这篇文章帮你一次性梳理完这个月的所有大事。

    GPT-5.5来了,这次主打”不胡说”

    OpenAI在5月发布了GPT-5.5 Instant,最核心的升级是”可靠性”。之前的版本在专业领域容易”一本正经地胡说八道”,5.5在医疗、法律、金融等高风险场景的准确性有了质的飞跃,幻觉率大幅降低。

    这个方向其实很明确:企业用户要的不是模型”能聊”,而是”说对话”。ChatGPT的使用量继续攀升,企业场景渗透加速,GPT-5.5算是踩在了正确的节奏上。

    AI行业的竞争,正在从”谁的模型更聪明”转向”谁的模型更可靠”。GPT-5.5的发布,是这个转向的一个标志性节点。

    Kimi即将完成20亿美元融资

    月之暗面旗下的Kimi即将完成一笔20亿美元的新融资,投后估值大幅攀升。这是2026年国产AI领域最大的一笔融资之一。

    Kimi这波势头很猛,长文本处理能力一直是它的招牌,现在融资到位,接下来在多模态、Agent方向的投入估计会加大。国产大模型这场仗,远没到终局。

    人形机器人走向工厂,不只是演示了

    5月14日至16日,HRTE 2026杭州国际人形机器人展览会举办,主题是”人形机器人赋能新型工业化”。多款新型人形机器人亮相,工业应用场景加速落地,产业链上下游企业集中展示。

    人形机器人正在从”实验室”走向”工厂”。2026年可能是人形机器人产业化的元年,这个判断现在看来越来越扎实了。

    苹果赔了2.5亿美元,AI虚假宣传的警钟

    苹果公司同意支付2.5亿美元,和解关于AI功能虚假宣传的诉讼。这件事给整个行业敲了一个警钟:AI产品的宣传必须实事求是,过度承诺的后果是很真实的。

    监管层面也在发力。AI生成内容的合规与安全成为新的关注重点,Deepfake(深度伪造)技术被滥用的案例持续增多。行业趋势正在从”炫模型”转向”拼安全”,安全性、隐私保护和系统集成能力正在成为新的竞争维度。

    其他值得关注的动态

    • Google把Gemini塞进了Gboard:AI不再是一个需要单独打开的App,而是融入了你打字的每一个瞬间。AI正在从”工具”变成”基础设施”。
    • 微软收购Fintool AI:将其全面整合进Office全家桶,Excel、Word、PowerPoint将获得更强大的AI金融分析能力。
    • 英伟达高层到访中国:带动A股AI板块集体上涨,汉得信息等AI全产业链概念股表现活跃。
    • 国内AI社区类产品市场爆发:市场规模同比增长182%,多款涵盖教育、办公、创作、社交的产品进入测试阶段。

    回顾这个月的AI圈,几个关键趋势非常清晰:模型能力持续提升,资本持续涌入,产业加速落地,安全成为新焦点。对于普通人来说,最重要的信息是:AI正在从概念走向实用。不管你是学生、职场人还是创业者,现在都是开始学习和使用AI的最佳时机。


  • 谷歌I/O 2026大会落幕:Gemini 3.5 Flash速度飙升4倍,AI智能体全面入侵安卓生态






    谷歌I/O 2026大会落幕:Gemini 3.5 Flash速度飙升4倍,AI智能体全面入侵安卓生态

    谷歌I/O 2026大会
    谷歌I/O 2026开发者大会现场 (图源:腾讯新闻)

    北京时间5月20日凌晨1点,谷歌I/O 2026开发者大会在美国加州山景城开幕。这场发布会持续了两天(5月19-20日),核心主题只有一个:把AI智能体塞进你生活的每一个角落。

    先说最硬核的模型更新。Gemini 3.5 Flash来了,官方数据是输出Token速度约其他前沿模型的4倍。这个数字背后意味着什么?你让AI帮你写代码、跑长任务,别的模型还在”思考”,它已经把结果甩到你脸上了。谷歌这次明显是冲着AI Agent和编程工具场景去的,速度就是生产力。

    Gemini 3.5 Flash的定位很清晰:不是最聪明的模型,但是最快的。对于那些需要反复调用、长工作流的场景,速度比绝对智能更重要。

    视频生成模型Gemini Omni亮相

    DeepMind首席执行官德米斯·哈萨比斯亲自登台,发布了基于世界模型能力的视频生成模型Gemini Omni。这个模型支持多模态输入生成视频,还能用自然语言对话式编辑——你想改角色、换背景、调场景,直接说就行。

    首款面向用户的模型Gemini Omni Flash将于2026年夏季推出。视频生成这块,谷歌终于开始认真跟Sora、Runway们掰手腕了。

    Android XR智能眼镜,手机可以不用掏了

    Android XR智能眼镜
    Android XR智能眼镜演示 (图源:腾讯新闻)

    谷歌联合Gentle Monster、Warby Parker、三星推出了Android XR智能眼镜,分两类:一类是纯语音眼镜(没有显示屏),另一类可以把信息投射到视野前方。

    现场演示很有意思:佩戴者要让Gemini帮自己点一杯咖啡,导航到咖啡馆、打开DoorDash、准备好常点的氮气冷萃订单,全程没掏手机,最后只需点头确认下单。Gentle Monster和Warby Parker联名款是语音版,2026年秋季上市,支持配对iOS和Android设备。

    Gemini Spark:关机的手机也能跑AI助手

    这个产品有点颠覆认知。Gemini Spark是运行在Google Cloud虚拟机上的全天候个人AI助手,即使你的设备关机了,它还能在后台继续工作。它能自动汇总信息、追踪活动参与情况、发送跟进邮件、生成表格和宣传册。

    本周向受信任测试人员开放,下周向美国Google AI Ultra订阅用户开放。谷歌还新推出了100美元/月的低价Ultra套餐,2026年夏季将支持在Chrome浏览器中运行。

    其他值得关注的更新

    • Ask YouTube:在YouTube网站加入聊天机器人交互界面,支持自然语言搜索直接跳转至视频对应片段,2026年夏季将在美国扩大推广
    • Docs Live:支持通过语音与Google Docs对话,无需输入提示词,可自动从Google Drive、Gmail提取信息辅助文档创建和编辑
    • Antigravity 2.0:面向AI Agent时代的编程平台,直接对标Anthropic Claude Code、OpenAI Codex
    • Universal Cart:AI智能体驱动的通用购物车,可跨场景添加商品,追踪优惠、监控价格变动、显示价格历史
    • SynthID扩展:可识别图片是否为AI生成,用户可直接询问图片的生成属性

    整体来看,谷歌这次的方向非常明确:AI不再是一个需要单独打开的App,而是融入你打字的每一个瞬间、导航的每一个路口、购物的每一个决策。智能体时代,谷歌想做那个无处不在的底色。


  • 拒绝2000万美元收购,这个AI工具创始人要把开源项目做成百年公司

    NanoClaw的创始人Gavriel Cohen这几天成了AI圈的热门人物。他和兄弟Lazer Cohen一起做的开源项目NanoClaw,在短时间内从沙发上的代码变成了一家融资1200万美元的公司——而且他们还拒绝了一份约2000万美元的收购要约。

    NanoClaw 联合创始人合影
    NanoClaw 联合创始人 Gavriel Cohen(左)和 Lazer Cohen(右)(来源:NanoClaw)

    六周内从代码到投资条款清单

    Gavriel说,从写下第一行代码,到拿到投资条款清单,全程不到六周。这段时间发生了什么?项目在开源社区迅速走红,AI研究者Andrej Karpathy在推特上夸了NanoClaw,然后新加坡外交部长在Facebook上发帖称NanoClaw是他的”第二大脑”,这篇帖子迅速走红。

    热度一来,投资人的消息就蜂拥而至。Gavriel估计有50多位创始人、科技行业高管发私信表示想要投资。Hugging Face的CEO Clem Delangue也是其中之一。

    NanoClaw最初是作为OpenClaw的安全替代方案被开发出来的。和OpenClaw直接在电脑上运行、可以访问所有服务和凭证不同,NanoClaw在容器中以沙箱模式运行。这种方式正逐渐成为部署更安全的OpenClaw类产品的通用解决方案。


    为什么要拒绝2000万美元

    就在他们考虑一份六位数美元的报价时,他们遇到了一位创始人朋友,对方给出了一个关键见解:开源项目的价值会随着社区规模扩大呈指数级增长。这些用户不仅可以帮助贡献代码,让项目快速成熟,还能探索出各种使用场景、做实践验证。

    这位朋友告诉他们,如果他们相信NanoClaw能成为这类项目,就必须关停其他业务,全身心投入NanoClaw。Gavriel后来说:”他说得对。”

    在他们关停此前的业务、全身心投入NanoClaw后不久,就出现了病毒式传播的帖子,新公司也和Docker、Vercel达成了合作。

    在那份六位数报价的约两周后,他们又收到了另一份收购要约,报价约2000万美元,还包含让他们留任继续运营公司的职位。兄弟俩再次拒绝了这份要约。


    从开源项目到企业服务

    NanoCo现在已经开始签约企业客户,这个想法来自社区。产品的早期用户都是具备技术能力的人,其中很多是大型科技公司的管理层。这些用户自己部署好NanoClaw实例后,不断有同事找他们帮忙做同样的部署。

    Cohen解释道,这些人不想变成NanoClaw的IT运维人员,但NanoCo愿意做这件事。所以公司现在提供部署服务,也就是现在常说的”前向部署工程师”服务,帮助企业向员工推广NanoClaw AI智能体,并提供持续支持。

    虽然NanoCo拒绝透露早期企业客户的具体身份,但兄弟俩表示,亚马逊、Gap、谷歌、Meta、SentinelOne、埃森哲等公司的管理层都在使用NanoClaw。

    从一个沙发上的开源项目,到拒绝2000万美元收购、融资1200万美元,再到服务亚马逊和Meta这样的巨头——NanoClaw的故事,是这一波AI智能体浪潮中,开源创业者如何把技术社区变成商业价值的生动案例。

  • Stability AI放大招:新音频模型能生成6分钟专业音乐,还把模型权重开源了

    Stability AI这几天扔出了一个重磅消息——Stability Audio 3.0系列音频模型正式发布。如果你对这家公司的名字有点印象,没错,它就是Stable Diffusion的开发公司。

    四款模型,两种策略

    这次一口气发布了四款模型,参数规模从4.59亿到27亿不等。小模型可以在设备上直接跑,生成最长2分钟的音频内容。中型和大型模型更猛,能生成6分20秒的完整音乐作品,而且还能保持稳定的音乐结构和旋律基调。

    生成时长是2024年发布的Stable Audio 2.0的两倍以上。要知道,2024年他们发布的Stable Audio Open只能生成最长47秒的音乐,这次算是一次大跨步的升级。

    最有意思的是他们对不同模型的开放策略。两款小型模型(音效模型459M、音乐模型459M)和中型模型(1.4B)都以开放权重的形式发布,任何用户都可以免费使用、修改。但大型模型(2.7B)就没这么大方了,只通过API和付费自托管服务开放使用,而且年营收超过100万美元的企业还需要获取企业级授权才能用。


    版权是生死线

    训练数据是这套模型的一大卖点。Stability AI表示,本次最新发布的音频模型系列完全基于已获得授权的数据训练。这一点很重要,因为AI音乐生成这个赛道,版权问题一直是悬在头顶的达摩克利斯之剑。

    去年Stability AI已经和华纳音乐集团、环球音乐集团达成合作,共同开发模型和音乐创作工具。和其他竞争对手比起来,这在版权合规性上确实更有底气。毕竟Suno和Udio相关的版权诉讼已经证明,数据授权以及与音乐厂牌的合作,将是这类服务长期生存的关键因素。

    Stability Audio 3.0 模型对比图
    Stability Audio 3.0 四款模型参数对比(来源:Stability AI)

    专业音乐人赛道开打

    目前谷歌、ElevenLabs等多家公司都在推出音乐生成相关的模型和工具,赛道越来越挤。Stability AI这边也在为专业音乐人开发一套全新的产品,前Universal Audio和Fender首席数字官Ethan Kaplan已经加入公司,将负责Stability的专业音乐业务。

    这个人事任命挺有意思。Ethan Kaplan在音乐硬件和软件领域都有很深的根基,他去Stability AI,说明这家公司不只是想做个”能生成音乐的AI玩具”,而是真的想往专业音乐制作流程里扎根。

    最近不少AI公司都在通过聘请音乐行业高管来提升自身行业资质。今年早些时候Suno聘请前Merlin CEO Jeremy Sirota担任首席商务官,ElevenLabs也聘请独立音乐发行商Kobalt的Derek Cournoyer担任音乐业务战略负责人。

    看起来,AI音乐生成赛道正在从”谁能生成好听的音乐”转向”谁能搞定版权、搞定音乐行业”。技术只是入场券,版权和行业资源才是长期竞争力的核心。


    普通创作者能用上吗

    对于普通创作者来说,Stability Audio 3.0的开源小模型是个好消息——你不需要花一分钱,就能在自己的设备上生成最长2分钟的音乐和音效。但如果你想用最好的大模型,或者你是年营收超过100万美元的企业,那就得按商业授权来了。

    这套模型的发布,让AI音乐生成赛道的竞争从”谁的模型能生成更长的音乐”升级到了”谁的版权合规性更强、谁更懂专业音乐人的需求”。Stability AI这一步棋,下得挺聪明。

  • Claw Code:48k Stars!开源AI编程智能体框架,Claude Code架构的Python+Rust重写

    Claw Code:48k Stars!开源AI编程智能体框架,Claude Code架构的Python+Rust重写

    🚀 Claw Code:48k Stars!开源AI编程智能体框架,Claude Code架构的Python+Rust重写

    ······················


    Claw Code Logo

    ······················

    ## 📝 项目简介

    **Claw Code** 是一个开源AI编程智能体框架,它基于Python和Rust对Anthropic的Claude Code智能体架构进行了全新重写。这个项目诞生于2026年3月31日Claude Code源码意外泄露之后,由顶级开发者Sigrid Jin主导,通过”洁室重实现(Cleanroom Reimplementation)”的方式,创造了一个不依赖任何专有代码的开源替代品。

    核心亮点:48k+ GitHub Stars,GitHub历史上增长最快的开源项目之一,完全开源可审计,支持多种LLM提供商。

    ······················

    ## ⚙️ 安装要求和过程

    环境要求

    • Python环境:3.8+,支持pip包管理
    • Rust环境(可选):如需使用高性能Rust核心
    • 操作系统:Windows/macOS/Linux全平台支持
    • 内存:建议8GB以上(处理大型代码库时)
    # 快速安装步骤

    # 1. 克隆仓库
    git clone https://github.com/deepelementlab/clawcode
    cd clawcode

    # 2. 安装Python依赖
    pip install -r requirements.txt

    # 3. (可选)构建Rust核心
    cd rust
    cargo build –release

    # 4. 运行Claw Code
    python src/main.py

    配置说明

    Claw Code支持多种LLM提供商,你需要配置相应的API密钥:

    • Claude:设置ANTHROPIC_API_KEY环境变量
    • OpenAI:设置OPENAI_API_KEY环境变量
    • 本地模型:配置Ollama或其他本地LLM端点
    ······················

    ## 🎯 核心功能

    1. 基于插件的工具系统

    内置19个权限可控工具,涵盖文件I/O、Shell执行、Git操作、网页抓取、Notebook编辑等能力。每个工具独立沙箱化,支持自定义访问控制,Rust层提供完整的JSON Schema定义。

    2. 自主智能体循环

    终端原生智能体,可自主读取整个代码库、编辑文件、执行命令、运行测试、操作Git,自主迭代直到任务完成。真正实现了AI从”对话”到”执行”的进化。

    3. 多智能体编排

    支持生成子智能体(内部称为”群体/swarms”)并行处理复杂任务。子智能体在隔离上下文运行,可共享内存访问,通过Agent工具可控制子智能体生命周期。

    4. MCP完整集成

    支持模型上下文协议(MCP),提供Stdio、SSE、HTTP、WebSocket、SDK、ClaudeAiProxy共6种传输类型。支持自动名称规范化、配置哈希和OAuth认证,可连接外部工具服务器。

    5. Rust高性能核心

    代码库中Rust占比72.9%(用于高性能运行时执行),Python占比27.1%(用于智能体编排和LLM集成)。正在推进dev/rust分支实现完全内存安全的高性能框架运行时。

    ······················

    ## 💡 典型使用场景

    场景1:自动化代码重构

    问题描述:你有一个大型遗留代码库,需要统一代码风格、更新弃用API、优化性能瓶颈。

    Claw Code解决方案

    1. 启动Claw Code,让它读取整个代码库
    2. 给出指令:”重构所有Python文件,将print语句改为logging,添加类型注解”
    3. Claw Code自主分析代码结构,分批修改文件,运行测试验证
    4. 生成详细的重构报告,列出所有修改点和测试结果

    效果:原本需要3-5天的重构工作,现在可以在2-3小时内完成,且保证测试全部通过。

    场景2:快速原型开发

    问题描述:你需要快速开发一个REST API服务,但不想从零开始写脚手架代码。

    Claw Code解决方案

    1. 给出需求描述:”创建一个FastAPI服务,支持用户注册、登录、JWT认证、CRUD操作”
    2. Claw Code自动生成项目结构、路由、模型、数据库连接代码
    3. 自动添加单元测试、API文档(OpenAPI/Swagger)
    4. 启动开发服务器,验证所有端点正常工作

    效果:一个完整的REST API原型从想法到可运行代码,只需要10-15分钟。

    场景3:代码审查和安全审计

    问题描述:你需要对一个开源项目进行安全审计,找出潜在的漏洞和隐患。

    Claw Code解决方案

    1. 让Claw Code克隆目标仓库,读取所有源代码
    2. 给出指令:”审查代码中的安全漏洞,重点关注SQL注入、XSS、不安全的反序列化”
    3. Claw Code使用专门的子智能体并行分析不同模块
    4. 生成详细的安全审计报告,包含漏洞位置、风险等级、修复建议

    效果:原本需要安全专家花费1-2周的代码审计,现在可以在1天内完成初步分析。

    ······················

    ## 🌟 推荐理由

    为什么你应该关注Claw Code?

    1. 开源替代,告别订阅费

    官方的Claude Code需要Claude Pro/Max或Enterprise订阅,月费不菲。Claw Code完全开源免费,支持多种LLM提供商(包括免费的本地模型),让每一个开发者都能用上顶级的AI编程助手。

    2. 架构透明,安全可审计

    Claw Code是”洁室重实现”,不含任何Anthropic的专有代码。所有代码开源在GitHub上,你可以完全审计它的行为,确保没有后门或数据泄露风险。对于企业用户来说,这一点至关重要。

    3. 性能卓越,Rust加持

    Claw Code的Rust核心占比72.9%,这意味着关键路径的性能可以媲美C++。相比纯Python实现的AI工具,Claw Code在处理大型代码库、并行执行任务时,速度提升显著。

    4. 生态丰富,MCP加持

    Claw Code完整支持MCP(模型上下文协议),可以连接数百个外部工具服务器。无论是数据库、API、文件系统,还是专门领域工具,都可以通过MCP集成到Claw Code中。

    5. 社区活跃,迭代迅速

    Claw Code的GitHub仓库有2100+个开放议题,335个关注者,56k+个Forks。社区非常活跃,每天都有新的PR和Issue,项目迭代速度极快。你遇到的问题,通常几天内就能得到修复。

    个人使用心得:我试用Claw Code已经两周了,最大的感受是——它真的能”理解”你的代码库。不像其他AI助手只能看到当前文件,Claw Code可以读取整个项目,理解模块之间的依赖关系,给出的建议非常精准。特别是多智能体编排功能,处理复杂任务时效率惊人。

    ······················

    ## 📥 下载地址

    快速开始

    # 一键安装(Linux/macOS)
    curl -fsSL https://claw-code.codes/install.sh | bash

    # 或者使用pip安装
    pip install claw-code

    # 启动Claw Code
    claw-code

    ······················

    Claw Code —— 让AI真正成为你的编程伙伴,而不是简单的代码补全工具。🚀
    如果你喜欢这个项目,记得去GitHub上点个Star支持开发者!

  • 李开复对话苏姿丰:表演式AI该停了,2026年不能影响财报的AI都是浪费钱



    李开复对话苏姿丰:表演式AI该停了,2026年不能影响财报的AI都是浪费钱

    5月19日,AMD上海AI开发者日,零一万物CEO李开复和AMD CEO苏姿丰进行了一场对话。他们讨论的核心问题很直接:企业砸钱做AI,到底能不能换来真实的商业回报?李开复的回答很犀利——如果你的AI部署没有改变季度财报里的任何一个数字,那你做的就不是真正的AI转型,只是浪费钱。


    AI的三个阶段:从任务到职能部门

    李开复把AI的发展分成了三个阶段。2024年,大家关心的是”AI能不能完成一个任务”;2025年,问题变成了”AI能不能完成一整条工作流”;到了2026年,核心问题已经进阶为”AI能不能替代一个企业的职能部门”。

    这个判断很关键。它意味着AI不再是辅助工具,而是要真正承接一个部门的核心目标。比如HR部门,从招聘、面试、入职到绩效跟踪,整套流程都由AI智能体系统完成。

    李开复提到,真正值得AI介入的,是那些直接影响损益表的核心环节:收入、利润、供应链、动态定价、防欺诈。这些恰恰是高管们最不愿意让AI介入的领域。

    为什么CIO主导的AI转型会失败

    李开复抛出了一个有点”政治不正确”的观点:传统CIO(首席信息官)主导的自下而上AI转型,大概率会失败。原因是,CIO的职责是管理软件运营,不是重新定义公司。他们倾向于在不出错但价值极低的场景部署AI——会议纪要、HR聊天机器人、内部搜索,这些都是表面文章。

    真正能改变公司经营结果的,往往是那些高管最不愿意让AI介入的运营职能部门。所以,企业AI转型必须是”一把手工程”,由CEO自上而下推动。

    AI编程能力跨过临界点

    推动AI从”辅助工具”进化到”职能部门替代者”的,是两大关键变化。第一,AI编程能力跨过了临界点。一年前,AI只能辅助编写代码;现在,它可以端到端地交付一整套功能。智能体在数字世界中的所有行为,本质上都落到代码层面。一旦AI编码能力跨过门槛,自主智能体就成为现实。


    多智能体架构:AI世界的”美第奇效应”

    第二个变化,是大家意识到单一智能体的能力存在上限。无论模型参数多大,单个Agent的推理能力终究会碰到瓶颈。而多智能体架构打破了这一上限。

    李开复用”美第奇效应”来比喻:当不同领域的专家被放进同一个房间,产出远超任何单一个体。五百年前人类发现了这一规律,现在他们把它带到了AI世界。招聘Agent与绩效Agent联动,系统可根据员工入职后的绩效数据,自动调整前端筛选标准。

    苏姿丰的印证:一个人能干完整个团队的事

    苏姿丰从算力基础设施的角度印证了这一趋势。她透露,AMD内部工程师已经在用AI智能体加速产品设计与验证。一个人加上合适的工具和算力,如今能完成几年前整个团队的工作。

    但多智能体系统对算力的要求也变了。李开复指出,未来极致的token效率和本地化处理能力会是关键。系统必须满足本地优先、端侧处理、低于100毫秒的响应延迟,多智能体协同才能真正具备现实可行性。

    苏姿丰提到,AMD比很多公司都看得更早、更清楚。随着AI走向多智能体架构,也必须重新思考”算力”本身的定义。

    开源势不可挡,中国生态有独特优势

    对于开源生态,两位嘉宾都表达了乐观态度。苏姿丰提到,开源AI社区正在涌现出大量创新,而且这个生态已经越来越全球化。李开复则更直接:”开源势不可挡。闭源模型类似苹果iOS,追求高利润和强控制;开源社区则成了AI世界的安卓,拥有更广覆盖和更大规模。”

    他特别指出,中国开源生态因为硬件资源受限,反而转向极致的工程效率、算法优化和架构创新,形成了独特优势。


    未来图景:”自主企业”和”一人公司”

    面向未来,李开复提出了两个值得思考的趋势。第一,未来真正意义上的”自主企业”会诞生,驱动它的是跨部门、多层级协同的智能体网络。下一阶段产业AI转型将围绕两个核心展开:数据主权和清晰可验证的ROI。

    第二,”一人公司”趋势正在出现。借助模块化的多智能体框架,单个开发者或领域专家,如今有能力像总架构师一样,快速启动一家高度自动化运转的公司。

    DRI模型:AI原生公司的核心组织架构

    在组织架构层面,李开复提出了DRI(直接责任人)模型。他预测,这会成为AI原生公司最核心的组织架构。DRI就是一个人对某个跨职能结果承担端到端责任,不是头衔,而是一种明确的责任机制。

    在这个模式下,人类DRI处于智能体系统的中心,周围是研究、执行、合规、监控等Agent集群。DRI负责整体编排、关键决策和最终输出契约。实时数据流取代传统汇报,业务运转围绕可量化的结果展开。

    对工程师来说,这意味着价值衡量标准的变化。在智能体时代,工程师的价值不再由写了多少代码来衡量,而是对结果负责,拥有决策权,并有规划地配置智能体集群。