标签: AI

  • FunClip:阿里出品的 AI 视频剪辑神器,语音识别 + LLM 智能裁剪,5.9K Stars 让视频剪辑自动化

    FunClip:阿里出品的 AI 视频剪辑神器,语音识别 + LLM 智能裁剪,5.9K Stars 让视频剪辑自动化

    FunClip 界面

    做自媒体的朋友一定有过这样的痛苦:一段两小时的直播回放,只想剪出几句高光金句,却要在时间轴上反复拖拽、听写、对齐字幕。阿里通义语音实验室开源的 FunClip,用语音识别 + 大语言模型把这件事彻底自动化了——上传视频,复制你想保留的文字,点一下,片段就出来了。

    📌 项目简介

    FunClip 是一个完全开源、可本地部署的自动化视频剪辑工具,基于阿里巴巴通义语音实验室开源的 FunASR Paraformer 系列模型对视频做语音识别,用户自由选择识别文本片段或说话人,一键生成对应视频片段,并提供本地 Gradio Web 界面,支持 LLM 辅助智能剪辑。

    ⚙️ 安装要求与过程

    环境要求:仅需 Python 环境(推荐 Python 3.8+);如需内嵌字幕剪辑,需额外安装 ffmpeg 与 imagemagick 及中文字体文件。

    快速安装:

    # 克隆仓库
    git clone https://github.com/modelscope/FunClip.git
    cd FunClip
    # 安装依赖
    pip install -r ./requirements.txt
    
    # 启动本地 Gradio 服务(默认中文 Paraformer)
    python funclip/launch.py
    # 可选:-m fun-asr-nano (31语种) | -m sensevoice (情绪+事件) | -l en (英文)
    #       -p 端口号 | -s True (公网访问)

    启动后访问 localhost:7860 即可使用 Web 界面:上传视频 → 复制需剪辑文本到 “Text to Clip” → 调整字幕 → 点击 “Clip” 或 “Clip and Generate Subtitles”。

    ✨ 核心功能

    • 工业级中文 ASR(Paraformer-Large):阿里开源的顶尖中文语音识别模型,Modelscope 下载超 1300 万次,可精准预测时间戳,自动返回全视频与目标段 SRT 字幕。
    • 热词定制(SeACo-Paraformer):在识别过程中指定实体词、人名等热词,显著提升专有名词识别准确率。
    • 说话人分离(CAM++):集成说话人识别模型,可自动识别 speaker ID,一键剪出特定人物的全部发言片段。
    • LLM 智能剪辑:支持 qwen、GPT 等大模型,结合视频字幕自动推理出高光片段的时间戳;还可选 TwelveLabs Pegasus 视频理解模型,直接“看懂”画面而非仅依赖字幕。
    • 多模型与多语言:2026 年新增 Fun-ASR-Nano(31 种语言高精度)、SenseVoice(情绪识别 + 音频事件检测),并支持英文视频识别剪辑。

    🎬 典型使用场景

    • 自媒体长视频提取金句:把一场发布会、一次访谈原片丢进去,复制想保留的台词,FunClip 自动精准裁出对应时段并生成字幕,做短视频切片效率翻倍。
    • 会议 / 演讲按说话人剪辑:开启说话人分离后,直接剪出某位嘉宾的全部发言,用于整理观点、制作人物集锦,无需手动对照音轨。
    • 视频自动加字幕:识别后一键生成全片 SRT,并可内嵌硬字幕导出,省去逐句听写的繁琐,特别适合教程、纪录片类内容。

    💡 推荐理由

    我自己的使用感受是:FunClip 把“语音识别 → 文本选择 → 视频裁剪”这条链路做到了极简。它不像一些云端剪辑工具那样把数据传上去,而是完全本地运行,隐私可控;Gradio 界面几乎零学习成本,命令行模式又能轻松写进自动化流水线。对做内容创作、知识整理的人来说,它是那种“装好就天天想用”的效率利器。尤其 LLM 智能剪辑的加入,让“我要这段关于乡村振兴的发言”变成一句自然语言指令就能完成。

    🔗 下载地址

    许可协议:MIT(可自由商用与修改)

  • AI诈骗盯上普通人:兄弟俩做了个App专防绑架勒索电话

    你大概也接过那种电话:对方一开口就急吼吼地说家里人出事了,要你马上转账。过去这种骗局门槛高,骗子得先摸清你的底细、还得搞到变声技术,所以主要盯着企业和政府这些”肥肉”。可现在,几秒钟的社交平台音频就能克隆出你亲人的声音,普通人也成了目标。一家叫 Savi Security 的初创公司,就是冲着这个来的。

    一个从自家妈妈被骗开始的念头

    Savi 的两个创始人是一对亲兄弟,Patrick 和 Ryan Coughlin。Patrick 的履历放在安全圈很硬:干过国家级网络防御,待过 Splunk,后来随着收购进了 Cisco,做到安全产品高级副总裁;弟弟 Ryan 则在做消费产品这条线上,先后待过 Apple 和 Spotify。兄弟俩做这家公司,直接导火索是两年前他们妈妈亲身经历的一通电话。

    那天老人家接到一个来电,屏幕上显示的是女儿的号码。电话里她”听见”女儿喊”妈,他们抓到我了”,紧接着一声撕心裂肺的尖叫,然后是威胁:不立刻转 1200 美元,就把人扔在本地 Walmart 停车场弄死。骗子连女儿常去的 Walmart 都报得出来,声音也一模一样。幸好老人家没慌,直接拨给真女儿确认——人才平安。可这一遭,把见过大场面的 Patrick 也震住了。

    手机盾牌保护家庭免受AI诈骗电话
    Savi 想用一层实时防护,挡住越来越逼真的 AI 诈骗

    便宜到离谱的犯罪成本

    Patrick 后来反复想一个问题:以前只用来对付政府和大企业的那套精密手段,怎么就落到普通老百姓头上了?答案大家都心知肚明——便宜又强悍的大模型和生成式 AI。现在从一段三秒钟的公开视频里就能克隆声音,我们随手发在网上的那些碎碎念、给孩子比赛录的像,全成了骗子的素材。

    Patrick 的原话很扎心:AI 正在”制造骗子”,因为它把骗人的门槛降到了地板价。不只是有组织的犯罪团伙,连普通人也被勾着下场。

    数字不会骗人。美国联邦贸易委员会上个月公布,2025 年民众在”冒充类”诈骗里总共损失了 35 亿美元,是 2020 年的三倍。被骗的主力虽然是老年人,但研究机构 Malwarebytes 的数据提醒,Z 世代在短信诈骗里中招率也不低,差不多四次里就信一次。

    先拿免费网站练手,再推付费 App

    兄弟俩的第一招,是做了一个叫 Scamwise 的免费网站,不用注册、完全匿名,你把可疑的短信、截图、邮件传上去,它就能判断大概率是真的还是骗局。这个网站跑了四个月就收到 5 万份提交,到现在累计冲到 10 万份,每周还在以一万多份的速度往上涨。这些真实样本,正好拿来喂 Savi 自家的诈骗识别模型。

    • 本周二,Savi 正式推出付费 App,iOS 和安卓都能用,可以筛查短信、语音留言和来电。
    • 最出彩的功能是”实时通话监听”——可疑电话进行中,你可以把 Savi 的 AI 助手拉进来旁听,它会在对话过程里捕捉骗子的行为破绽。
    • 价格也挺实在:一个月 8 美元,年付 63 美元,而且不限人数,全家人——孩子、配偶、父母甚至那个总找你修电脑的舅舅——都能塞进同一个套餐。

    这家公司刚拿下 700 万美元种子轮,领投的是 Acrew Capital。技术底层主要用 Google 的 Gemini,但架在了一个 AI 网关上,需要的时候随时能切去更专精声纹识别的模型。说白了,Savi 想做的,是新一代的”杀毒软件”——只不过这回,是用 AI 在坏人拿 AI 行骗的同一刻,把你护住。


  • 法国初创ZML发免费工具:让各家AI芯片跑得一样快

    过去几年,只要聊到跑大模型,大家脑子里默认就是英伟达的卡。这种局面短期内还结束不了,但挑战者确实从四面八方冒了出来。最近巴黎一家叫 ZML 的初创公司丢出了一件免费工具,想做的事情挺大胆:让同一套开源大模型,能在英伟达、AMD、谷歌 TPU、苹果 Metal 甚至英特尔 Arc 的芯片上都跑得一样快。

    一个被图灵奖得主点名的小团队

    ZML 的创始人叫 Steeve Morin,圈内人可能更熟悉他上一个作品——Zenly,那个被 Snapchat 在 2017 年砸了九位数美元收购的社交地图应用,Morin 当时是工程副总裁。这家新公司本身规模不大,只有 20 个人,却让图灵奖得主、AI 圈泰斗 Yann LeCun 都公开点过赞。光看阵容,ZML 不像临时起意凑热闹的团队。

    他们刚发布的产品叫 ZML/LLMD,本质上是一个大模型推理服务器。Morin 跟 TechCrunch 说,他们的野心是打破现在各家芯片各自为战的孤岛状态,让不同的芯片都能以自己最快的速度、甚至比原厂还快的速度去跑 AI 任务。

    异构AI芯片在统一软件层上协同推理
    ZML 想用一层软件把不同品牌的 AI 芯片连起来,跑同一套模型

    它到底在解决什么麻烦

    随着 AI 一点点渗进我们的工作和日常,怎么把模型”跑起来”(也就是推理、处理用户提问)这件事,重要性已经悄悄超过了训练模型本身。可现实中这块体验并不顺滑,软件架构的壁垒把大家锁死在单一供应商身上,想换芯片?成本高得劝退。

    Morin 的原话是:想法是”把创造自己系统的权力还给大家,让 AI 真正扩散开,而不是被几家大厂攥在手里”。

    对企业来说,这意味着可以混搭不同类型的芯片——有些更便宜,有些更省电。ZML 这套软件辅助,顺势也能帮一把那些名气没那么响的新锐芯片厂,Morin 一口气点了好几家欧洲的:Axelera、Fractile、Kalray、Q.ANT、SiPearl 等等。对他而言,产地其实没那么重要,关键是 ZML 能和他们一起做”全世界还没人做过的事”。

    为什么大厂都在盯着”推理”这块肥肉

    推理赛道早就是兵家必争之地,有人直接把它叫”推理淘金热”。ZML 的对手不算少:估值冲到 130 亿美元的 Baseten、脱胎于开源项目 vLLM 的 Inferact、背后是 SGLang 的 RadixArk。vLLM 和 SGLang 跟 LLMD 多少有些重叠,但 Morin 的胃口明显更大。

    • 他放话说,ZML 已经走到”和芯片一起做联合设计”的阶段,不只是写上层软件。
    • 团队虽小,钱却不少——早年就融了 2000 万美元,投资方里既有 Harry Stebbings 的 20VC,也有 Xavier Niel 的 Kima Ventures。
    • 股东名单也挺唬人:Docker 创始人 Solomon Hykes、Hugging Face 的 Clément Delangue 和 Julien Chaumond,还有 LeCun 本人。

    有意思的是,Morin 并不唱衰英伟达。他说双方关系其实不错,毕竟英伟达自己也在为推理时代的到来做准备。ZML 想做的是在英伟达之外,给大家多一个不绑死的选择。

    免费,但野心一点不小

    ZML 最早在 2024 年开源过一个机器学习框架,今年三月还更新过。但这次的 LLMD 没有走开源路线,而是以免费产品的形式推出,目的很实在——先看看大家怎么用,再决定怎么赚钱。”我宁愿先量一量,在最有价值的地方收钱,也不想一上来就贪心把增长憋死。”Morin 这么说。

    现在判断 LLMD 什么时候变成付费产品、又能拿下多少用户,显然还太早。但从资本和同行的反应看,欧洲确实开始长出能在家门口做成事的 AI 公司了。Morin 说得很直白:”除了巴黎,我哪儿都做不出 ZML。”


  • video-use:用 Claude Code 一句话剪辑视频,browser-use 团队出品,15.9K Stars 让 AI 成为你的剪辑师

    video-use:用 Claude Code 一句话剪辑视频,browser-use 团队出品,15.9K Stars 让 AI 成为你的剪辑师

    video-use

    把原始素材丢进文件夹,跟 Claude Code 聊两句,拿回成片 final.mp4 —— 这就是 video-use15.9K+ Stars,MIT 许可,100% 开源)。它由爆火的 browser-use 团队打造,把”对话式 AI 编程”的思路搬进了视频剪辑:不再和轨道、关键帧死磕,而是用自然语言描述你要的成片。


    🚀 项目简介

    video-use 是一个对话式视频编辑「技能(skill)」,让 LLM 通过阅读而非观看视频来完成剪辑。它把任意原始素材(口播、混剪、教程、旅行、采访)交给 Claude Code / Codex / Hermes 等任意带 shell 的 AI 编程智能体,自动产出可直接发布的成片,全程无需预设模板或复杂菜单。核心思想和 browser-use 一脉相承:给 LLM 一份结构化的「视频说明书」,而不是一堆看不懂的逐帧截图。


    ⚙️ 安装要求和过程

    环境要求

    • Python 3.12+(依赖 requests / librosa / matplotlib / pillow / numpy)
    • uv(推荐)或 pip 管理依赖
    • ffmpeg必需,渲染引擎)
    • yt-dlp(可选,用于下载在线素材)
    • ElevenLabs API Key(用于 Scribe 转写,按量计费)

    方式一:对话式安装(推荐)

    把官方 setup prompt 粘贴给 Claude Code / Codex / Hermes 等任意智能体,它会自动完成 clone、依赖安装、skill 注册,并在需要时提示你粘贴 ElevenLabs Key——你只需说”准备好了”等它通知。

    方式二:手动安装

    git clone https://github.com/browser-use/video-use ~/Developer/video-use
    ln -sfn ~/Developer/video-use ~/.claude/skills/video-use   # Claude Code
    # ln -sfn ~/Developer/video-use ~/.codex/skills/video-use  # Codex
    
    cd ~/Developer/video-use
    uv sync                       # 或 pip install -e .
    brew install ffmpeg           # 必需
    brew install yt-dlp           # 可选
    
    cp .env.example .env          # 填入 ELEVENLABS_API_KEY=...

    安装完成后,进入任意素材文件夹运行智能体,说一句”edit these into a launch video”,它就会盘点素材、给出剪辑策略、等你确认,再把 edit/final.mp4 生成在素材目录旁。


    💡 核心功能

    • 🧹 剔除填充词与死寂:自动删掉 umm / uh、假开场和片段间的空白,节奏立刻紧凑。
    • 🎨 自动调色:每段独立调色——暖色电影感 / 中性 punch / 任意自定义 ffmpeg 链,风格统一可控。
    • 🔇 无爆音剪辑:每个切点做 30ms 音频淡入淡出,彻底告别”咔哒”爆音。
    • 📝 烧录字幕:默认 2 词大写块样式,颜色、字体、排版完全可定制。
    • ✨ 动画叠层:通过 HyperFrames / Remotion / Manim / PIL 生成动画,每个动画派发并行子代理,互不阻塞。
    • 📖 「阅读」而非「观看」:LLM 只读转写文本 + 按需时间轴视图(约 12KB 文本 + 少量 PNG),而非逐帧分析 4500 万 token 噪声——这正是它又快又准的关键。
    • 🔁 自评估闭环:渲染后在每个切点自检画面跳变 / 音频爆音 / 字幕遮挡,最多自动重渲染 3 次,全部通过后你才看到预览。

    📦 典型使用场景

    🎤 场景一:口播 / 教程视频快速成片

    录完一镜到底的口播,丢给 video-use:它会自动剔除 umm、加好字幕、统一调色、消除爆音,几分钟产出可直接上传的成片,省掉 PR 里最枯燥的”听音修剪”。

    🎬 场景二:旅行 / 采访混剪

    多段原始素材自动编排成叙事线,配合 Remotion / Manim 生成的动画叠层,做出有质感的混剪,适合 Vlog、产品发布片、活动回顾。

    🤖 场景三:常驻远程剪辑

    通过 Browser Use Box 跑在自有 VPS 或 Telegram 上,随时丢素材、随时收成片,把剪辑变成一条常驻的消息流水线。


    ⭐ 推荐理由

    我特别欣赏它”给 LLM 一份视频说明书”的设计哲学——和 browser-use 把网页 DOM 喂给模型如出一辙,但对象换成了视频。传统”AI 剪辑”要么逐帧灌噪声、要么套预设模板;video-use 选择让模型读转写、按需看图,既省 token 又保精度,自评估闭环还兜住了质量下限。

    100% 开源、MIT 许可,能挂在任何 AI 编程智能体上,本地文件零上传(只有转写调用 ElevenLabs)。如果你已经用 Claude Code 写代码,顺手把它变成分身剪辑师,几乎零学习成本。唯一门槛是 ElevenLabs 转写按量计费,但换来的是真正”对话即剪辑”的体验。


    📧 下载地址

  • OpenAI首席未来学家离职:在AGI前夜,他选择走出围墙

    OpenAI首席未来学家离职:在AGI前夜,他选择走出围墙

    一家把”实现AGI”写进公司使命的企业,通常会安排一个人专门负责”想未来”。OpenAI给这个岗位起的名字很直白——首席未来学家(chief futurist)。而就在今天,担任这个角色九年的Joshua Achiam在X上宣布,他要走了。

    他没把话说死,也没甩出什么戏剧性的理由。原话大概是:离开没有某个具体的诱因,也不是因为此刻发生了什么特别的事,只是这件事他在心里盘桓了挺久。”在一家前沿实验室的围墙之外,似乎也有可能推进同样的使命。”而他在同一条动态里留下了一句分量更重的话:人类未来的走向,取决于我们围绕AGI和超级智能共同做出的选择。

    OpenAI首席未来学家离职
    Joshua Achiam在OpenAI的九年,恰好覆盖了这家公司从研究小组走向AI中心舞台的全过程

    他不是普通意义上”管未来”的人

    要在中文语境里讲清Achiam的分量,得回到2022年那篇名为《Training language models to follow instructions with human feedback》的论文。正是这篇后来被称为InstructGPT的工作,把”人类反馈强化学习”(RLHF)这套方法立成了ChatGPT的底座。Achiam是那篇论文的共同作者之一,也是OpenAI最早一批研究科学家里的关键人物。

    他还有另一件被整个AI圈记住的事:主导打造了开源项目”Spinning Up in Deep RL”。这是OpenAI当年推出的一套深度强化学习入门教材,把原本高门槛的RL知识摊开给普通人,培养了不少后来入行的人。一个既写得出奠基性论文、又愿意把知识免费撒出去的研究者,在一家以技术信仰立身的公司里,分量可想而知。

    “A chief futurist”这个头衔本身就耐人寻味——当一家公司的日常被产品、融资、诉讼填满时,总得有人专门抬头看远方。Achiam做的,正是这件容易被忽略的事。

    离开的时机,有点微妙

    Achiam最近一次公开露面,是在马斯克起诉Altman的庭审上作证,内容涉及OpenAI从非营利机构转向营利性公司的那段架构变迁。一个在内部待了九年、又刚在法庭上回顾过公司来路的人,转头宣布离开,时间点很难不让人多想。

    更微妙的是他选择留下的那句话——”在围墙之外也能推进使命”。这既像是一种体面的告别,也像是在暗示:今天的前沿实验室,或许已经不是承载那份初心最顺手的容器了。当模型越做越大、商业压力越来越重,那些最早抱着”为了全人类”想法进来的人,和这架高速运转的机器之间,摩擦只会越来越多。


    目前还不清楚Achiam下一步要去哪里,他也没透露。但一个细节值得留意:他说的是”从外部推进使命”,而不是”去另一家公司”。在AGI看似越来越近的当下,离开一家最靠近它的实验室,反倒可能是想离那个真正重要的命题更近一点。至于OpenAI会怎么填补这个专门”看未来”的空缺,恐怕比又发一个新产品更值得关注。

  • 微软开始省着花:Excel和Word里的AI,正悄悄换成自家模型

    微软开始省着花:Excel和Word里的AI,正悄悄换成自家模型

    过去这一年,硅谷最流行的一句话大概是”先猛烧再说”。不管是训练大模型、还是给员工配满AI工具,大家都在比谁花的钱多。可最近风向明显变了,连微软这种家底厚实的巨头,都开始精打细算起来。

    彭博社这周二(7月7日)报道了一件事:微软在自己最常用的两款产品——Excel和Word里,已经开始用自家的MAI模型去回应一部分用户提问,而不再完全依赖OpenAI和Anthropic的模型。换句话说,你打开Office让Copilot帮你写段话、做个表,背后接的很可能已经不是GPT,而是微软自己养的模型了。

    微软用自家MAI模型替代第三方AI
    微软正把Office里的第三方模型,逐步替换成自家的MAI系列

    曾经的卖点,如今成了要砍的成本

    这个动作有点打脸的意思。毕竟微软过去没少拿”我们的Office由OpenAI和Anthropic的模型驱动”当卖点,在2025年9月的那篇官方博客里,还专门强调过这套强强联手的配置。现在悄悄换成自家模型,说明账算不过来了——第三方模型的调用费,确实不便宜。

    微软嘴上没多说,被TechCrunch问到时只回了一句”暂无更多可分享的信息”。但行动上,它已经把”降本”摆上了台面。

    其实微软也没把第三方模型一脚踢开,目前仍是混着用。它更大的算盘,是趁这两年把自家AI能力立起来。就在上个月的Build开发者大会上,微软一口气发布了7个新的MAI模型,里头既有能写代码的agentic coder,也有能生图的text-to-image生成器。自己有粮,才不用总看别人脸色。

    不只是微软一个人在”抠门”

    把时间拉回到今年初,那会儿圈内流行的是”tokenmaxxing”——能烧多少烧多少,仿佛不把GPU跑满就输了。可才过了几个月,画风就转成了”tokenminimizing”。据各家媒体披露,Amazon、Uber、Meta、埃森哲这些大公司,都在不同程度地给员工的AI支出踩刹车。

    • Amazon据报开始管控内部AI用量,别让小任务把预算烧穿
    • Meta被曝限制员工使用AI的规模,相关开支已经到了几十亿美元的级别
    • 埃森哲也在教员工别拿大钱干小事,能省则省

    这股省钱风甚至把目光引向了大洋彼岸。硅谷有些公司开始盯上中国的便宜模型(比如GLM-5.2)来找agentic方案的替代,哪怕心里还惦记着潜在的安全风险。当一个行业开始认真比较”哪家模型更便宜”的时候,说明狂奔的阶段确实过去了。


    微软这步棋背后,其实是一个谁都绕不开的问题:当AI成了每家公司的水电煤,账单谁来扛?把核心能力攥回自己手里,既是为了省钱,也是为了别在关键时刻被供应链卡脖子。接下来的看点很简单——Office里的Copilot,到底还有多少比例会换成微软亲生的模型。

  • Discord 的 AI 审核翻车了:你发张棋盘图,账号可能就没了

    Discord AI 审核误封概念图
    Discord AI 审核误封用户事件(配图由 AI 生成)

    Discord 最近承认了一件事:它家 AI 审核系统出了 bug,过去两个月里误封了超过 8000 个用户。原因听着有点离谱——有人只是上传了电子表格、棋盘、游戏贴图,或者白底灰底的透明背景图,就被系统当成有害内容给判了「死刑」。

    这个 bug 从今年 5 月就开始影响账号了,上周末又额外误封了 200 人,直到 Discord 的团队发现并修好。现在所有受影响账号正在陆续恢复。

    它到底怎么判的

    Discord 在 X 上发长文解释,说它的自动安全系统会把用户上传的内容,跟一批已知的「有害材料」数据库做比对。设计初衷是抓非法内容,但系统偶尔会「误报」。本来按流程还有人工复核这一关,可这个 bug 让系统跳过了人审、直接把账号封了。Discord 自己也说,正在做更好的防护,保证这类事不再发生。

    方格图案成了「原罪」

    在 X 和 Reddit 上,不少用户吐槽自己只是传了张带方格网格的图就被永久封号。有人推测,Discord 的 AI 审核对网格状图案特别敏感——因为过去确实有人用网格来遮挡、伪装不良内容,好躲过自动检测。结果这套「宁可错杀」的逻辑,把一堆无辜的棋盘和表格一起误伤了。

    「因为一个这么不公平的理由丢掉 Discord 账号,可能极其毁灭性,每天都有上百万用户被 AI 误封,这必须停下来。」一位用户在 X 上写道。

    对很多用户来说,Discord 不是随便玩玩的聊天室,而是工作协作、游戏社群、远距离社交的据点。账号一封,连带着的社群关系全断。靠自动判定就永久封号,代价远比想象中大。

    翻车的又不止它一个

    Discord 不是第一个栽在自动审核上的。去年 Instagram、Facebook 群组都出现过大规模、原因不明的账号封禁,很多人怀疑是 AI 审核的锅,只是 Meta 从没公开认过账;Tumblr 也发生过类似的内容过滤误伤。如今 Meta 的监督委员会还在呼吁提高封号透明度。AI 帮平台扛起了海量内容审核的担子,可一旦误报,挨打的永远是真实用户。


  • Meta 新推的 Muse 图像生成器,最争议的功能是「拿你的照片做素材」

    Meta Muse AI 图像生成器概念图
    Meta 新推出的 Muse Image 图像生成器(配图由 AI 生成)

    Meta 今天把自家的 AI 图像生成器 Muse Image 正式放了出来,由 Meta 的超级智能实验室(Meta Superintelligence Labs)操刀,内部代号叫 Mango。它会通过 Meta AI 应用、Instagram Stories 和 WhatsApp 免费提供给用户使用。说白了就是又一个能让你输入一句话、吐出一张图的工具,能生成各种卡通、搞怪的画面。

    不靠你想 prompt,它先给你备好模板

    Meta 还怕你懒得想词,专门给 Muse 配了一批「预设」——也就是现成的提示词模板,帮你起头。其实 Muse 能干的事跟 Midjourney、DALL·E 那些老前辈差不多。你可以用它做广告图(过去一年 AI 已经大举入侵广告业了),也能拿它来捣鼓室内装修的灵感——比如视频里有人用 Muse 看看一张二手沙发摆到自己车库里是什么样。这个功能还打算跟 Facebook Marketplace 打通,也就是那个卖二手家具的地方。

    真正让人皱眉头的功能

    但有个功能挺让人不舒服:只要某个 Instagram 用户的资料是公开的,你 @ 一下 TA,就能直接拿 TA 的照片去生成新的 AI 图,而那个人根本不会收到任何通知。Wired 最早把这事点了出来——Meta 自己也说,别人「可能会用你的 Instagram 内容去创作 AI 内容」,而且你不会被通知。换句话说,你的脸、你的照片,成了别人随手可用的素材。

    Meta 的原话是:「人们可能会用你的 Instagram 内容,借助 Meta 的 AI 功能去创作内容」,而「你不会收到关于这些内容的通知」。

    Meta 的回应是「用户有控制权」,你可以去设置里把这个功能关掉。但问题在于,绝大多数人根本不知道有这回事,等你发现自己的照片被拿去生成了什么,往往已经晚了。这种「默认开启、手动退出」的设计,把保护隐私的责任一股脑推给了用户。

    免费只是开头

    Muse 对「日常创作」免费,但超过一定额度就得上 Meta 的订阅了。另外 Meta 还顺手在 Instagram Stories 里加了一批新的 AI 特效滤镜,支持各种自定义修改。至于视频版 Muse Video,据说已经在开发中。把 Muse 放进 Meta 这一年的产品清单里看,前面还有 Creator 助手、能 vibe coding 做小游戏的 Pocket,看起来很热闹,但华尔街一直吐槽 Meta 的 AI 战略「看不清主线」。不管怎么说,它在 AI 基础设施上的花钱速度一点没慢下来。


  • xAI正式消失了:马斯克把整个AI帝国并进了SpaceX

    火箭与AI神经网络融合的SpaceXAI概念图
    旧xAI标志折进新SpaceXAI标记,马斯克把AI帝国整个焊进了SpaceX

    马斯克名下那家AI公司xAI,从现在起正式不存在了——至少名字是没了。本周一,X平台上的xAI账号整体切换成了@SpaceXAI,配的一段动画很直白:旧的xAI标志慢慢折进新的SpaceXAI标记里,那个大家熟悉的X被直接焊进了SpaceX的身份中。

    这不是临时起意,而是一桩酝酿了快半年的合并,终于走完了最后一步。

    从2月收购,到5月”解散”

    整件事的起点是2月2日。SpaceX用一笔全股票交易把xAI买了下来,合并后公司估值大约在1.25万亿美元(其中SpaceX占1万亿,xAI占250亿),连社交平台X也一并收编进同一个屋檐下。

    到了5月,马斯克自己把话挑明了:”xAI会作为独立公司解散,以后就是SpaceXAI,也就是SpaceX的AI产品。”换句话说,Grok也好、其他模型也好,往后都只是SpaceX这条大船上的一个部门,不再是独立玩家。

    马斯克的原话很干脆:xAI不再是单独的公司,它只是SpaceXAI——SpaceX出品的AI产品。

    Grok没消失,只是换了招牌

    关心Grok的人可以放心,它没被砍掉。这个由xAI打造的主力模型,现在挂在SpaceXAI名下继续跑,和推理、语音、图像、视频生成等其他工具一起,服务消费级用户。合并的逻辑很清晰:把火箭、卫星和前沿AI塞进同一个组织,两边的资源调配就不用再跨公司扯皮。

    顺带一提,就在6月,SpaceX刚完成了史上规模最大的IPO,募资750亿美元,估值约1.77万亿美元。钱袋子鼓了,把AI业务彻底内化也就顺理成章。

    更野的念头:把AI算力搬上太空

    如果只是改个名,这件事不值得单独拿出来说。真正让外界侧目的,是合并背后的那个大设想:把AI基础设施搬出地球。

    SpaceX已经向美国FCC提交申请,打算发射能充当”轨道计算节点”的卫星;它还想用Starship在近地空间搭建数据中心,彻底绕开地球给AI设下的供电和散热天花板。地面上的机房再怎么扩建,电和冷却都是硬约束,而近地轨道理论上没有这两道紧箍咒。

    • 可重复使用的火箭,解决了往太空运设备的成本问题;
    • 庞大的卫星星座,本身就是现成的全球网络;
    • 前沿AI模型,则提供了”在天上跑什么”的内容。

    可重复使用火箭、巨型卫星网络、再加上最先进的AI,现在全被马斯克装进了一个壳里。他赌的那件事很简单:计算的未来,也许根本就不在地球上。

  • 三星利润暴涨19倍背后:AI数据中心把内存芯片买疯了

    堆叠的AI高带宽内存芯片与数据流动
    AI数据中心对高带宽内存(HBM)的渴求,正把三星的利润表彻底改写

    三星电子刚交出的二季度成绩单,把整个市场都看愣了。运营利润同比翻了大约19倍(折算下来就是1400%的涨幅),这个数字甚至超过了它过去三年的利润总和。你很难想象一家上年同期还在为内存价格探底发愁的巨头,能在一年的时间里完成这种级别的反弹。

    但别误会,这跟手机卖得多好没什么关系。真正把利润表顶上去的,是AI数据中心在疯狂扫货内存芯片。

    HBM,这场反弹的真正引擎

    核心角色叫HBM,高带宽内存。当英伟达、AMD这些GPU厂商拼命往外吐新一代显卡时,背后需要一种能在极短时间内吞吐海量数据的内存来配合。这种专用芯片单价高、工艺难,谁能量产谁就能吃下AI服务器的订单。

    有意思的是,三星在这块业务上曾经被老对手SK海力士压着打。但这一季它明显追了回来——靠着HBM3E和更新的HBM4拿下了关键供货协议。分析师们的判断很直接:需求已经不单纯来自亚马逊、谷歌这类传统云厂商了,几乎每个想把生成式AI塞进自家业务的行业都在抢内存。供给追不上需求,三星的议价权和利润率自然就上去了。

    有分析师点破得很直白:只要AI还是全世界企业的头等优先级,能造出最尖端内存的厂商,就站在了价值创造的正中央。

    不只是HBM,普通内存也回暖了

    除了高端的HBM,普通的DRAM和NAND闪存价格也结束了长期供过于求的状态,慢慢爬了回来。这两块业务的复苏叠在一起,才把整体业绩推到了这个高度。

    一个细节很能说明问题:三星内存芯片部门的员工,今年平均能拿到约34万美元的年终奖。一家公司愿意为某个部门开出这种级别的奖金,往往意味着那个部门正在替全公司赚大钱。

    三星的下一注:2纳米和端侧AI

    赚钱之外,三星也在为下一阶段铺路。它在代工业务上砸下重金,押注2纳米制程去跟台积电抢地盘;Galaxy手机则把”端侧AI”当成了核心卖点,想守住移动市场的底盘。

    • HBM4计划在2026年进入量产,支撑参数规模上万亿的AI模型;
    • 同步探索CXL和存内计算(PIM)等新架构,试图绕开数据传输的瓶颈;
    • 但中美出口管制和CHIPS法案要求在美国扩产,是绕不开的外部变量。

    三星这份成绩单,其实是AI基础设施狂热的一面镜子。它提醒我们,在这场看似关于模型和算法的竞赛里,最底层的那块硅片,同样能决定谁赚得盆满钵满。

    📎 原文来源:$am$ung. | The Verge(综合 Reuters 报道)