标签: 视频生成

  • 谷歌把Gemini Omni的免费体验又延了一周,AI视频这扇门正越开越大

    想玩AI视频又不想掏钱的人,谷歌又给了你一周机会。多家外媒报道,Google把Gemini Omni的免费体验期从原定的8月4日,延长到了太平洋时间8月11日中午。也就是说,只要你有个Gemini账号,不用订阅任何Google AI付费套餐,就能免费生成最多10条视频。

    它和普通文生视频工具有什么不一样

    大多数AI视频工具的逻辑是”写一句提示词、出一段片子”,不满意就得整段重写。Gemini Omni不一样,它把文字、图片和现成视频都当成输入,你先生成一段,然后可以接着用自然语言改:换风格、重剪、围绕同一段素材反复调,角色和画面连贯性还能保住。这种”对话式”的连续编辑,才是它真正有意思的地方。

    谷歌把Omni定义成”世界模型”,而不是单纯的视频生成器——它要理解物理规律和场景的连贯性,而不只是吐出一段好看的片子。

    背后是谷歌把工具收进一个入口

    这件事的另一层意思,是谷歌在把原本分散的几个工具合到一起。过去你想做图要用Imagen,做视频用Veo,修图用Nano Banana Pro,配乐用Lyria——现在Omni一个模型把这些活儿都揽了。它走的是和Gemini 3.5不同的路线:3.5负责agentic那种长任务执行,Omni专门做内容创作。

    免费入口也给得相当大方:除了Gemini App和Google Flow,它还通过YouTube Shorts和YouTube Create免费开放,所有生成视频都打了SynthID隐形水印,方便溯源是不是AI做的。

    为什么突然延期

    谷歌没解释延期的具体原因。但一个很直接的信号是:第一轮免费开放时,不少人在X上晒出自己用Omni做的片子,从把旅行片段改成超现实风,到给社交帖做视觉实验,五花八门。让人先免费用、先玩起来、先往外传,本身就是最好的推广——等大家习惯了这种创作方式,再谈付费就顺多了。

    对普通用户来说,这周是最好的上手窗口。10次额度不算多,但足够你把一个想法从文字或多张图,变成一段会动的视频,看看AI到底能把你的脑洞撑多大。等8月11日一过,这扇免费门大概率就要关上了。

    Gemini Omni 用图文视频生成AI视频
    文字、图片、视频都能当输入,对话式连续编辑是Omni的核心差异

    • Gemini Omni免费期延至8月11日,普通用户可免订阅生成最多10条视频
    • 支持文字/图片/视频混合输入,可对话式连续编辑,角色连贯
    • 谷歌把Veo/Imagen/Lyria等工具收进统一入口,视频带SynthID水印
  • 模型卷不动了就卖调度:Runway发布首个生成式媒体模型路由器

    Runway 不想再只当一家”卖模型的公司”了。周四,这家 AI 视频起家的明星创业公司通过本月刚上线的开发者平台 Runway Dev,发布了一个叫 Media Router 的新工具——号称是第一个专为生成式媒体打造的模型路由器。它的野心写在明面上:做整个生成式媒体行业的基础设施层。

    Runway Media Router 模型路由
    Runway Media Router 会按质量、速度或成本自动挑选最合适的生成模型(图源:Runway)

    模型太多挑花眼?那我来替你挑

    Media Router 干的事说来简单:开发者发一个图像、视频或音频的生成请求,它根据你更看重质量、速度还是成本,自动把请求分给最合适的模型——既包括 Runway 自家的,也包括接入平台的一堆第三方模型。模型路由在大语言模型圈早就是常规操作,但在生成式媒体这边,Runway 说自己是头一家。

    Runway 首席产品官 Anthony Maggio:大多数开发者根本没时间搞清楚每个模型在视频、图像、音频上各自强在哪。我们带来的独特价值,就是把这套”哪个模型最适合哪种场景”的判断力打包给你。

    这套判断力不是拍脑袋来的。Runway 内部创意团队常年评测各类模型——视频模型的运动表现、图像模型的构图水平、语音模型的口型同步,积累成了路由器背后的智能层。这层能力原本是为 5 月发布的 Runway Agent(对话式创意智能体)搭建的,现在直接打包卖给外部开发者。目前 Adobe、Cloudflare、ElevenLabs、Expedia、Shutterstock、Quora 都已经在通过 Runway Dev 的 API 把媒体生成能力嵌进自家产品。

    Token 账单疼了一年,路由就是止疼药

    Maggio 透露,客户最关心的路由维度就是 token 价格和质量。2026 年企业圈被智能体的天价 token 账单结结实实上了一课,按价格路由早成了大模型领域的显学,生成式媒体跟进只是时间问题。有意思的是,Runway 自己几周前刚把无限量订阅改成按 token 计费,还挨了不少用户的骂——一边挨骂一边顺势把”帮你省 token”做成新生意,这算盘打得不可谓不精。


    模型不再领跑,那就去做发牌的人

    转型背后有现实压力。Runway 上一款旗舰视频模型 Gen 4.5 还是去年 12 月发的,当时确实登顶过榜单,压过谷歌一头。但如今按 Artificial Analysis 的排名,它的文生视频和图生视频模型已经掉出领先位置,前 20 名里挤满了谷歌和中国大厂的模型,Gen 5 至今没有音讯。

    • Media Router 的底层假设很清醒:”最好的模型”会不断易主,与其赌自己永远领先,不如做那个替所有人分发请求的枢纽;
    • 联合创始人兼联合 CEO Anastasis Germanidis 直言,公司必须建起完整技术栈——开发者平台、创意工具套件、底层推理层缺一不可;
    • 在他看来,当客户开始用模型生产整套营销活动和多场景成片时,编排层的价值只会越来越大。

    当不成最强的模型,就去当最好的调度台——这条路 OpenRouter 们在大语言模型市场已经验证过一遍。生成式媒体这边格局更碎、模型更迭更快,路由生意理论上更有得做。剩下的悬念是:等谷歌、字节这些既有顶级模型又有平台野心的巨头也想通了这一层,Runway 的先发优势还能守多久。

  • 新加坡AI视频公司PixVerse融了4.39亿美元,估值冲破20亿,阿里入局

    做AI视频生成的公司这两年不算少,但真能拿到大钱、还被阿里看上的不多。新加坡的PixVerse刚宣布完成一轮C轮扩展融资,总额4.39亿美元,估值直接冲过20亿美元。这一轮由CDH Investments领投,新进来的名字里最扎眼的是阿里巴巴,此外还有Mirae Asset、BlueFocus、Eastern Bell Capital等。

    AI视频生成概念图
    AI视频生成正成为生成式AI里最烧钱、也最被资本追捧的赛道之一。

    三年、1.5亿用户、20亿估值

    这家公司2023年才成立,创始人是王昌虎和Jaden Xie。王昌虎之前在字节做计算机视觉,Xie做过投资。他们现在对外说,消费端产品已经有超过1.5亿注册用户、1500多万月活。至于其中多少是付费用户,他们没说——这是个留白,但也正常,很多AI应用都靠这个盘子撑起估值。

    三套模型,外加一个“世界模型”

    PixVerse不是只卖一个模型。它有V系列,面向普通用户和API调用;C系列,面向专业影视和广告工作流;今年早些时候还发布了R系列“世界模型”,专门给游戏和虚拟世界搭建用。用户能生成最高4K、还带声音的视频,图片转视频的价格是每分钟4.8美元。

    Xie对TechCrunch说:“关键差别不在数据,而在你怎么标注它,因为数据到处都是。”他的联合创始人王昌虎在字节搭过TikTok背后的视觉理解技术,靠精准标注撑起了推荐算法。

    一句大实话,点了一圈对手

    同行都在说自己“质量高”,这话没有信息量。Xie真正想强调的差别在“标注”:数据到处都是,谁标得好谁赢。他还很不客气地点了对手——OpenAI关掉Sora 2、等于退出了这个赛道;Meta和腾讯也做不出够质量的视频模型。所以能打到质量线的没几家。

    亚洲这边有字节的Seedance、Kling AI,以及前腾讯AI负责人危宇的Video Rebirth;西方则有Runway、Luma、Midjourney。世界模型这条更窄的赛道上,Yann LeCun和李飞飞也都在做。


    钱要花在哪,估值能不能站住

    这轮钱怎么花?扩世界模型、招研究员、铺全球企业销售。PixVerse目前150人,散布在新加坡、北京、上海,还跟投资人阿里签了部署合作,把视频生成功能接进阿里的体系。视频生成这条赛道热得发烫,但变现终究是硬仗——1500万月活里多少真付费、企业客户能不能持续掏钱,才是20亿估值能不能站稳的关键。Sora退场留下的空位,正在被亚洲公司抢。

    • 融资规模:C轮扩展4.39亿美元,估值突破20亿美元
    • 关键投资人:CDH Investments领投,阿里巴巴等新进
    • 产品矩阵:V系列(消费/API)、C系列(专业)、R系列(世界模型)
    • 用户盘子:1.5亿注册、1500万月活,付费率未披露
    📎 原文来源:Video generation startup PixVerse raises $439M, valuation soars past $2B(TechCrunch / Ivan Mehta)
  • OpenMontage:把 AI 编程助手变成「全自动视频制片厂」的开源智能体系统(37.4K★)

    OpenMontage:把 AI 编程助手变成「全自动视频制片厂」的开源智能体系统(37.4K★)

    OpenMontage 是全球首个开源的「智能体驱动(agentic)视频生产系统」,用 12 条生产流水线、52 个工具和 500+ 智能体技能,把 Claude Code / Cursor / Copilot 等 AI 编程助手直接变成一间完整的视频制片厂。

    项目简介

    一句话:把你的 AI 编程助手变成一间全自动视频制片厂。你只需用自然语言描述想法,OpenMontage 的流水线就会自动完成联网调研、脚本撰写、素材检索/生成、剪辑合成与质量自检,端到端产出成片。零付费 API Key 也能跑通完整链路。

    安装要求和过程

    环境要求

    • Python 3.10+(python.org 下载)
    • Node.js 18+(nodejs.org 下载)
    • 系统安装 FFmpeg(brew install ffmpeg / sudo apt install ffmpeg)
    • 一个能读取文件并运行代码的 AI 编程助手:Claude Code、Cursor、Copilot、Windsurf 或 Codex 任一即可
    • 可选 GPU:用于本地免费视频生成(make install-gpu,支持 wan2.1-1.3b 等模型)
    • API Key 全部可选:不付费也能出片,付费图像/视频商仅用于更高画质

    快速安装

    标准流程(需 make):

    git clone https://github.com/calesthio/OpenMontage.git
    cd OpenMontage
    make setup

    随后在 AI 编程助手中打开项目,输入需求即可,例如:

    "Make a 60-second animated explainer about how neural networks learn"

    无 make 环境可手动建虚拟环境(README 提供 macOS/Linux 与 Windows PowerShell 两套命令):

    python3 -m venv .venv
    source .venv/bin/activate
    pip install -r requirements.txt
    cd remotion-composer && npm install && cd ..
    pip install piper-tts
    cp .env.example .env

    make setup 后已自带 Piper 本地 TTS、Archive.org / NASA / Wikimedia 开放素材、Pexels / Unsplash / Pixabay、Remotion、HyperFrames、FFmpeg 与内置字幕。

    核心功能

    1. 端到端生产流水线:12 条预置流水线(科普解说、口播、纪录片混剪等),统一走 research → proposal → script → scene_plan → assets → edit → compose 七个阶段。
    2. 真实素材纪录片制作:无需付费视频模型,从 Archive.org / NASA / Wikimedia 等开放素材库语义检索并剪辑成片,而非仅仅把静态图做成动画。
    3. 参考驱动创作:贴一个你喜欢的视频,智能体会分析其节奏与钩子,生成差异化的制作方案(保留手法、替换主题)。
    4. 内置实时联网调研:写脚本前自动跑 15–25+ 次跨 YouTube / Reddit / 新闻 / 学术源的搜索,用真实数据支撑内容。
    5. 生产级质量门禁与预算治理:人工审批门、预合成验证、渲染后自检(ffprobe 抽帧 + 音频分析)、7 维打分选商、成本预估与上限(默认总预算 $10)。

    Backlot 制作工作台

    OpenMontage 内置 Backlot 可视化工作台,覆盖实时看板、故事板与素材库,让自然语言需求落到可逐帧审阅的制作流程:

    Backlot 实时制作看板(board-live)
    Backlot 实时制作看板(board-live)
    Backlot 故事板(storyboard)
    Backlot 故事板(storyboard)
    Backlot 素材库(library)
    Backlot 素材库(library)

    典型使用场景

    • 零 Key 科普 / 教学短片:一句 "Make a 45-second animated explainer about why the sky is blue" 即可生成带解说与字幕的动画片。
    • 免费真实素材纪录片:如 "Make a 90-second documentary montage about what a city feels like at 4am. Use real footage only",直接调用开放素材库剪辑,零成本成片。
    • 商业预告片(配置图像/视频商后约 $1–$3):科幻概念预告片、产品发布 Teaser 等;已展示案例成本最低 $0.02、最高数美元(如 Kling v3 成片 $1.33)。

    推荐理由

    OpenMontage 最打动我的是它把「做视频」从专业软件的高门槛,解放成一句自然语言需求。三点尤其值得一试:

    • 零 Key 也能跑通全链路:本地 Piper TTS + 开放素材 + Remotion 合成,对想低成本试水 AI 视频的人极友好。
    • 架构清爽、可扩展tools/ + pipeline_defs/ + skills/ 三层知识架构,可以自己加技能 / 工具;AGPL-3.0 开源、可自托管。
    • 内容有真实出处:「参考驱动 + 联网调研」让脚本不像纯生成那样空洞,预算门禁也让人敢放心把任务交给智能体跑。

    个人体会:第一次用 "Make a 60-second animated explainer about how neural networks learn" 跑通时,最惊艳的是它真的会先去查资料再写脚本——出来的东西有依据、有节奏,而不是随机拼接的炫技片段。

    下载地址

  • Google I/O 2026全记录:Gemini 3.5、AI搜索和智能眼镜全部到位

    Google I/O 2026的主题只有一个:把Gemini塞进你数字生活的每一个角落。这场发布会5月19日开幕,整整两天的议程里,几乎没有哪个产品没被AI重新做一遍。

    搜索的”十个蓝色链接”时代正式结束

    搜索率先被改造。新搜索框支持长对话式查询,还能给出AI驱动的查询建议,你甚至可以往搜索框里直接拖文档、图片、视频和Chrome标签页。AI Overviews(AI概览)的月活已经摸到25亿,对话式搜索模式的月活也有10亿。

    信息代理(information agents)会在后台7×24小时帮你跑任务,生成式UI即时生成交互式视觉内容,背后由Gemini Flash 3.5驱动。出版商的日子估计不太好过了——referral流量还会继续掉。

    Gemini Flash 3.5驱动的搜索,已经不再是”搜完给你十个链接”的逻辑,而是直接帮你把事情做完。

    Gmail现在能跟你对话了

    Gmail Live语音交互模式在I/O上亮相,直接说话就能查邮件、提取行程、找学校通知。不用再盯着列表一页页翻。Workspace这边还有个AI图像生成应用叫Google Pics,支持点击图片局部标注修改需求,不用把提示词全部重写一遍,背后跑的是Gemini和Nano Banana 2模型。

    Gemini Spark:常驻后台的AI代理

    最值得一提的是Gemini Spark。这不是你叫它才动一下的聊天机器人,而是一个常驻后台的AI代理,能自动写完邮件、生成学习指南、监控订阅费用,还能对接Workspace、Canva、OpenTable这些第三方应用。

    硬件:XR眼镜合作款全部亮相

    Android XR眼镜的合作款全部亮相——三星、Gentle Monster、Warby Parker的版本都出来了,计划2026年年内发布。谷歌自研的Project Aura眼镜也更新了,计算单元更强,加了指纹解锁,还有新的充电盒设计。

    Wear OS 7也有更新,加入了类似iPhone的”实时更新”功能,手表上能同步快递、赛事比分等动态信息,还能查看AI代理的自动化任务进度。

    定价:Ultra订阅拆分两档

    谷歌把AI订阅Ultra拆成了100美元/月和200美元/月两档,200美元那档包含Project Genie世界模型的访问权限。这个定价明显在对标OpenAI Pro,谷歌这次是真的在全栈铺开,而不只是做个 benchmark 冠军。


  • Google把20年街景数据喂给了Genie,AI现在能模拟你家门口的街道了

    你有没有在Google Maps的街景里「逛」过别人的 neighborhood?把那个小黄人往巴黎某条街上一扔,看看酒店是不是在安全的地段。Google现在想把这件事变得不止是「看看」,而是让你真正走进去、改天气、看暴风雪里的同一条街是什么样子。

    5月19日的Google I/O大会上,DeepMind宣布把Street View的数据接入Project Genie——Google的通用世界模型。简单来说,Genie可以根据文字或图片提示,生成可交互的游戏式三维环境。现在加上街景,它生成的就是真实世界的地方。

    Google Genie Street View 模拟展示
    Genie接入街景数据后,可生成纽约街景的交互式模拟(图源:TechCrunch)

    为什么这件事有意思

    DeepMind研究员Jack Parker-Holder举了一个很具体的例子:一个即将部署到伦敦的机器人,那边常年见不到什么太阳。用Genie,他们可以模拟阳光从维多利亚式房屋上反射下来的罕见场景,这样机器人真的遇到时就不会「懵掉」。

    「你可以说,我要去纽约,但不是这个季节,是下雪的时候。我想看看那条街在下雪时是什么样子。」

    街景数据积累,Google干了20年。背着摄像头的小车和塞了相机的背包,在全球110个国家和七大洲拍了超过2800亿张图片。这些数据的价值,过去主要体现在地图产品和广告上,现在DeepMind找到了新用法。


    不只是玩游戏

    Genie 3去年8月开放了研究预览,今年1月向美国的Google AI Ultra订阅用户开放。它的目标应用场景有三个:教育、游戏、机器人训练。接上街景之后,机器人训练这个场景立刻变得很实。

    Waymo已经在用Genie的模拟器来训练无人驾驶汽车应对「极罕见事件」——比如龙卷风,或者一头大象突然出现在路上。以前这种场景只能靠人工合成,现在有了街景作为基底,模拟出来的环境至少地理位置是真实的。

    和Waymo自己的模拟器相比,Genie的优势在于视角。Waymo的模拟都是从车载摄像头角度看的,而街景数据可以切换到任意视角——机器人视角、行人视角、甚至无人机视角。

    • 2800亿张街景图片覆盖全球110个国家
    • Waymo已用Genie模拟龙卷风、大象等极端场景
    • 支持任意视角切换(车载/行人/机器人/无人机)
    • 教育、游戏、机器人训练三大目标场景

    还差在哪里

    坦率说,现在的效果还没到「以假乱真」的程度。Google团队给我看的样片,包括我以前住过的一个街区的海底版本,识别度很高,但画质还是电子游戏水准,不是照片级真实。

    更大的问题是物理规律。现在的Genie模型还没有真正理解因果关系——比如在一个约书亚树国家公园的雪地场景模拟里,跑过去的人直接穿过了仙人掌和灌木丛。物理规则不是硬编码进去的,模型是通过被动观察自己「悟」出来的,这个过程还需要时间。

    「这类模型在准确度和质量上,可能比视频生成落后6到12个月。但我认为这是可以解决的。」——Jack Parker-Holder

    对比一下,Google自己的图像生成器Nano Banana已经能在信息图里生成完美的文字,视频生成器Veo也理解了纸船会跟着水流漂、烟会在空气中散开这些物理常识。Genie要追上这个水平,还得再跑一阵。

    目前,Street View in Genie已经向部分美国Ultra用户开放,接下来几周会逐步扩展到全球Ultra用户。DeepMind的产品经理Diego Rivas提醒说,这还是一个实验性的东西,准确度方面还有很多要改进的地方。

    但方向是清晰的。Google Maps的前总监Jonathan Herbert说,他们很早就在想怎么把地图数据用在新形式的AI研究上。Genie接入街景,是这个世界模型第一次真正摸到「真实世界的地基」。接下来会发生什么,值得盯着看。

  • 这家做AI视频的公司,想在世界模型赛道上赢过Google

    这家做AI视频的公司,想在世界模型赛道上赢过Google

    Runway可能是硅谷最不像硅谷公司的AI初创企业。没有斯坦福辍学生创始人,没有前谷歌员工光环,也没有动辄上亿美元的种子轮让他们有资本忽略营收。三个联合创始人里两个来自智利、一个来自希腊,在纽约大学Tisch艺术学院认识的,公司也诞生在纽约,不是帕洛阿尔托。

    但他们很可能成为当下最具影响力的AI公司之一——不是因为已经建成了什么,而是因为正在尝试构建的下一代技术。

    “我们本质上受限于自己对现实的理解。语言模型的训练数据是对现有人类知识的提炼,但要突破这个限制,我们需要利用更少偏见的数据。”——Runway联合创始人兼联席CEO阿纳斯塔西斯·杰曼尼迪斯

    押注世界模型,不走语言模型的老路

    过去几年,AI行业的主流假设是”智能存在于语言之中”。OpenAI的ChatGPT、Anthropic的Claude这些大火的大模型,都是这一思路的产物。但Runway和部分竞争对手押注了完全不同的方向:他们认为下一代AI智能不会从文本中诞生,而是来自视频和世界模型——这类模型学习的是世界的运行规律,而不只是人类描述世界的方式。

    Runway三位联合创始人
    Runway三位联合创始人(来源:TechCrunch)

    Runway成立于2018年,凭借视频生成模型和AI工具建立了行业声誉,旗下最新模型是Gen-4.5,用户可以通过文本提示生成可编辑的电影级内容。目前Runway的技术已经应用于电影制作人和广告公司的工作流,还与狮门影业、AMC电视网等大型媒体公司签署了合作协议。

    估值53亿,但真正的对手是谷歌

    Runway目前的估值为53亿美元,2026年第二季度公司新增了4000万美元的年度经常性收入。过去6个月里,公司已经将计划落地,业务从视频生成拓展至世界模型领域:2025年12月推出了首个世界模型,还计划2026年再推出一款新模型。

    但Runway并不是唯一一家走这条路线的企业,Luma、World Labs等初创公司也在做类似的事情,谷歌的Genie世界模型也指向了同一个方向。所有参与方追求的目标本质上是同一个:创造能够解决人类最棘手问题的AI。


    非典型背景,反而是优势

    Runway累计融资8.6亿美元,其中2026年2月完成了3.15亿美元的融资。这个融资规模和最直接的竞争对手Luma AI(9亿美元)、World Labs(12.9亿美元)大致相当。但Runway还要和OpenAI、谷歌等巨头竞争,后者在算力、资金上的优势非常明显。

    联席CEO巴伦苏埃拉说:”规则只是他们编造出来的。他们说硅谷就是初创公司该待的地方,为什么?那都是编造出来的规则。把所有规则都擦掉,重新来过。”这种不按常理出牌的文化,反而让Runway在巨头林立的AI赛道上找到了自己的位置。

  • 中国AI视频生成弯道超车:ByteDance和快手把美国对手甩在身后

    生成式AI打了一年半,大家都盯着力大砖飞的文本模型,结果视频生成这个关键赛道,被中国团队悄咪咪做到了世界前列。金融时报刚出的报道说,开发者圈子里已经有人在私下认了:ByteDance和快手在视频生成上的进展,比美国同行快不止一步。

    自家短视频库就是最好的训练场

    这事说穿了也不复杂。ByteDance手里有TikTok,快手手里有快手短视频,两家加起来的用户生成内容,是任何美国AI实验室都拿不到的数据宝藏。你让Sora团队去哪搞几百亿条真人的、带标注的、多语言的短视频?ByteDance和快手不需要”去哪搞”,数据就在自家服务器上。

    ByteDance推出的Seedance 2.0,快手的Kling 3.0,都是在这几百亿条视频的”喂养”下迭代出来的。美国实验室要训练视频生成模型,要么花钱买数据集(还不一定合法),要么自己拍(规模和多样性完全没法比)。中国这两家的优势,是天生的。

    “中国生成式AI团队已经在视频生成这个生成式AI的关键战场,走在了美国竞争对手前面。”——金融时报报道援引开发者评论

    美国实验室不是没反应,是追起来费劲

    OpenAI的Sora算是美国这边名头最响的视频生成模型,但一直没大规模开放。Google的Veo也在推,但进度和效果跟Seedance、Kling比,开发者群体里已经有不少人在转向中国模型了。不是说美国模型不好,是视频生成这个任务对数据量的依赖太强,而中国公司手里的数据,是美国公司 legally 拿不到的。

    还有一个容易被忽略的点:中国短视频平台上的内容,天生就是”多模态”的——视频、音频、文字评论、用户互动,全套的。用这些数据训练出来的模型,生成出来的视频在语义连贯性、节奏感、甚至”网感”上,都比只用公开数据集训练的模型要自然得多。

    这事的影响比看起来大

    视频生成不是”能不能让AI画会动的画”这么简单。它是通向世界模型(World Model)的必经之路——你想让AI理解物理世界是怎么运转的,先得让它能生成符合物理规律的视频。中国团队在这个方向上领先,意味着它们在”让AI理解真实世界”这个更大规模的竞赛中,已经抢到了一个有利位置。

    another angle是地缘AI竞争。美国一直在想办法限制中国拿到高端GPU,但数据这个维度,它是限制不了的。ByteDance和快手用自己的用户数据训练出来的模型,不需要英伟达最新款的卡也能迭代——当然有更好,但没有的话,靠数据和算法优化也能往前走。


    这个报道出来后,估计又有一波”中国AI威胁论”要冒头。但站在开发者角度,哪家的模型好用、成本低、生成速度快,就用哪家的。视频生成这个赛道,目前是中国团队在领跑,美国实验室需要加快速度了。

    📎 原文来源:USA Daily Dose – Builders say Chinese AI labs lead US rivals in video era(转引Financial Times报道,记者Eleanor Olcott)
  • 英伟达2.6B小模型跑赢行业巨兽:单卡生成1分钟720p视频的世界模型来了

    前两天NVIDIA的NVLabs悄悄丢了个炸弹——SANA-WM,一个只有2.6B参数的开源世界模型,能在一块H100上生成720p、1分钟长的可控视频。你没有看错,一块卡,一分钟。

    SANA-WM吞吐量比开源基线高36倍,动作跟随准确率超过所有现有开源方案,视觉质量却跟大规模工业模型差不多。

    混合线性注意力:让长视频不再OOM

    做长视频生成最头疼的问题就是显存爆炸。标准DiT用的Softmax Attention是O(n²)复杂度,生成60秒视频(约1800帧)时,纯Softmax方案大概跑到15秒就OOM了。

    SANA-WM的解法很巧妙——混合线性注意力。帧与帧之间用Gated DeltaNet做线性依赖(O(n)复杂度),每隔几帧再插一次Softmax Attention保长程一致性。这样既控制了显存,又没丢掉全局关联。效果就是:别人OOM的时候,它还在稳稳生成。

    双分支相机控制:6自由度精确驾驭

    世界模型跟普通文生视频最大的区别在于可控性。SANA-WM支持6自由度(6-DoF)相机轨迹控制,输入一张静态图+相机运动路径,就能生成对应的漫游视频。它用双分支架构:粗粒度全局位姿分支理解相机大致走向,细粒度像素对齐几何分支精确到像素级的几何变化。这让生成的视频不只是像,而是准。

    两阶段生成 + 极致训练效率

    生成流程分两步:2.6B基础模型先出60秒原始视频,再由17B精炼网络提升纹理和运动质量。有意思的是训练效率——只用了21.3万条公开视频片段(带6-DoF标注),64张H100跑15天就完事。对比同行动辄256+卡跑几个月,这个数据效率相当亮眼。

    • 蒸馏版 + RTX 5090:60秒720p视频34秒出片
    • 吞吐量:开源基线的36倍
    • 动作跟随准确率:超越所有开源方案
    • 视觉质量:对标LingBot-World等工业基线

    世界模型 vs 文生视频:两条路的分歧

    Sora、Kling这些文生视频模型走的是文字驱动路线,控制力偏弱;SANA-WM这类世界模型走的是图像+轨迹驱动路线,控制力强、物理合理性高。说白了,文生视频像是给AI一段描述让它自由发挥,世界模型像是给AI一张照片和运动指令让它精确执行。

    应用场景也很明确:自动驾驶仿真、机器人训练、游戏内容生成、影视预可视化、建筑漫游……任何需要如果相机这样动,世界会怎样的场景,都是世界模型的主场。

    2.6B参数就能做到这个程度,开源社区该兴奋了。代码已在GitHub放出(NVlabs/Sana-WM),权重按CC BY-NC-SA 4.0许可即将发布。

  • Runway不服硅谷规则:押注世界模型,要和Google正面对决

    Runway这家AI视频生成创业公司,没有典型的硅谷血统。没有斯坦福创始人,没有前Google员工,没有九位数的种子轮让你有资本无视收入。它的三个创始人——两个来自智利,一个来自希腊——在纽约大学Tisch艺术学院相遇,然后在纽约建立了这家公司。

    但Runway也可能是当今最重要的AI公司之一,这取决于你问谁。不是因为它已经构建了什么,而是因为它正在试图构建什么。

    “每个主要AI实验室都在押注语言。Runway押注他们都错了。”

    不同的赌注

    过去几年,AI行业基本在一个前提上运作:智能存在于语言中。OpenAI的ChatGPT和Anthropic的Claude这样的大语言模型反映了这个赌注。

    Runway和其他一些竞争对手正在做一个不同的赌注。它的创始人相信,下一代AI智能不会从文本中构建,而是从视频和世界模型中学习这个世界如何运作,而不仅仅是人类如何描述它。这个区别听起来很学术,但它的影响可不学术。

    Runway联合创始人兼联席CEO Anastasis Germanidis说,直接在来自世界的观察数据上训练模型是AI的下一个前沿。他认为,最先到达那里的公司,不会是那些完善了语言的公司。

    Runway三位创始人
    Runway三位创始人(左起:Cristóbal Valenzuela, Anastasis Germanidis, Alejandro Matamala Ortiz)

    从视频生成到世界模型

    Germanidis告诉TechCrunch:”我们基本上受限于自己对现实的理解。语言模型是在整个互联网上训练的,在留言板、社交媒体、教科书上——提炼现有的人类知识。但要超越这一点,我们需要利用更少偏见的数据。”

    成立于2018年的Runway以其视频生成模型(包括最新的Gen-4.5)和让人们将文本提示转换为可编辑的电影内容的AI工具建立了声誉。

    今天,Runway的技术为电影制作人和广告公司提供生产工作流程,并且该公司已与主要媒体公司如Lionsgate和AMC Networks签署了协议。它的工具甚至被用于像《Everything Everywhere All At Once》这样的电影中。


    商业表现与估值

    Runway现在的估值为53亿美元,并且根据其一位创始人的说法,在2026年第二季度增加了4000万美元的年度经常性收入(ARR)。

    如果Runway关于视频生成是通往世界模型的道路的赌注成功,其结果将从好莱坞影响到药物发现和机器人技术。如果不成功,Runway就有可能被资金远为雄厚的竞争对手——其中Google首当其冲——超越。

    世界模型:科学的数字基础设施

    在过去的六个月里,这家创业公司已经将其计划付诸行动,扩展到视频生成之外,在12月推出了它的第一个世界模型(AI系统可以足够好地模拟环境来预测它们将如何行为),并计划在今年推出另一个。

    Germanidis将世界模型视为科学基础设施。你在单个模型上训练的感觉数据和观察越多,你就越接近宇宙的工作数字孪生——一个你可以比任何实验室都快地运行实验的模型。

    “如果我们能建立一个比人类科学家更好的科学家,我们就能加速我们理解宇宙和解决问题的方式。” —— Anastasis Germanidis

    竞争加剧:不缺对手

    Runway在追求将物理感知的视频模型转化为世界模型方面并不孤单,近期应用案例包括交互式娱乐、游戏和机器人训练。初创公司Luma和World Labs也处于类似的轨迹上,Google也将其Genie世界模型指向同一方向。

    所有人都在追求某种版本的同一件事:解决人类最困难问题的AI。这与Runway的原始产品相去甚远,但这是技术中突现能力和创始人倾向于跟随它引导的结果。

    Runway能否将其视频主导地位带入世界模型还远未确定,竞争也不会等待。Runway是首批开发AI视频生成的公司之一,但世界模型是一场不同的竞赛,有资金雄厚且备受尊敬的竞争对手。Google、前Meta首席科学家Yann LeCun、AI的”教母”Fei-Fei Li,以及越来越多的初创公司都在追逐同一个目标。

    资源和挑战

    AI技能基准公司Workera的CEO兼斯坦福大学讲师Kian Katanforoosh指出,还没有人证明通过世界模型在视频智能和通用推理之间的跳跃,但这并不意味着不可能。他说,如果Runway想将其世界模型赌注变为现实,就需要继续收集资源——其中计算能力首当其冲。

    Runway与CoreWeave和Nvidia有协议,但不愿确认是否有专用的集群访问权限——这是训练前沿模型所需的有保障的大规模计算。

    “没有集群,你要如何建立基础模型?我不认为任何人能做到。” —— Kian Katanforoosh

    Runway迄今为止已筹集了8.6亿美元,包括2月份来自AMD Ventures和Nvidia等战略合作伙伴的3.15亿美元轮融资。根据PitchBook的数据,这与其最直接的竞争对手Luma AI和World Labs大致一致,后两者分别筹集了9亿美元和12.9亿美元。

    但Runway也要面对现任者如OpenAI(根据CEO Sam Altman的说法已筹集约1750亿美元)和科技巨头Google的竞争,其母公司的价值为4.86万亿美元。Google是Runway的最大威胁。该公司的Veo模型直接与Runway的视频生成业务竞争,而其Genie世界模型针对的是Runway正在冲刺的同一长期领域。


    Runway的优势:不按常理出牌

    Katanforoosh并没有把Runway排除在外。他指向AI音频初创公司ElevenLabs,该公司在自己的基准测试上超越了OpenAI和Google,尽管缺乏任一公司的资源和血统。他认为,Runway可以遵循类似的剧本。

    这种比较并没有失去Runway创始人的注意。Valenzuela说,创业公司缺乏湾区的”标准化”给了他们优势。他认为,他们不仅有思想的多样性,而且没有硅谷的关系,他们必须更加精明,缺乏许多同行可以获得的战争基金,这些基金本可以使他们不必在早期生成收入。

    根据Runway首席运营官Michelle Kwon的说法,尽管计算需求随着规模增加,公司并不急于筹集更多资金。

    早期投资者、Compound的管理合伙人Michael Dempsey告诉TechCrunch:”他们的背景让他们能够早早出发,比不更频繁地正确,并建立一种移动得非常快的文化。”

    对Valenzuela来说,这种文化始于他首先如何看待世界。他会把任何空闲时间——作为联席CEO和新父亲,时间不多——用来读书,包括智利诗人Nicanor Parra,他描述为Pablo Neruda的对立面:不那么正式,不那么学术,持有一种认为诗歌属于人民而不是规则的观点。

    “规则只是他们发明的规则。这是我们在Runway做事的一个驱动力。他们说硅谷在这里,初创公司就在这里。为什么?那些只是编造的规则。把它们都擦掉,重新开始。” —— Cristóbal Valenzuela

    📎 原文来源:Runway started by helping filmmakers — now it wants to beat Google at AI(TechCrunch, Rebecca Bellan, 2026-05-15)