标签: AI视频

  • 谷歌把Gemini Omni的免费体验又延了一周,AI视频这扇门正越开越大

    想玩AI视频又不想掏钱的人,谷歌又给了你一周机会。多家外媒报道,Google把Gemini Omni的免费体验期从原定的8月4日,延长到了太平洋时间8月11日中午。也就是说,只要你有个Gemini账号,不用订阅任何Google AI付费套餐,就能免费生成最多10条视频。

    它和普通文生视频工具有什么不一样

    大多数AI视频工具的逻辑是”写一句提示词、出一段片子”,不满意就得整段重写。Gemini Omni不一样,它把文字、图片和现成视频都当成输入,你先生成一段,然后可以接着用自然语言改:换风格、重剪、围绕同一段素材反复调,角色和画面连贯性还能保住。这种”对话式”的连续编辑,才是它真正有意思的地方。

    谷歌把Omni定义成”世界模型”,而不是单纯的视频生成器——它要理解物理规律和场景的连贯性,而不只是吐出一段好看的片子。

    背后是谷歌把工具收进一个入口

    这件事的另一层意思,是谷歌在把原本分散的几个工具合到一起。过去你想做图要用Imagen,做视频用Veo,修图用Nano Banana Pro,配乐用Lyria——现在Omni一个模型把这些活儿都揽了。它走的是和Gemini 3.5不同的路线:3.5负责agentic那种长任务执行,Omni专门做内容创作。

    免费入口也给得相当大方:除了Gemini App和Google Flow,它还通过YouTube Shorts和YouTube Create免费开放,所有生成视频都打了SynthID隐形水印,方便溯源是不是AI做的。

    为什么突然延期

    谷歌没解释延期的具体原因。但一个很直接的信号是:第一轮免费开放时,不少人在X上晒出自己用Omni做的片子,从把旅行片段改成超现实风,到给社交帖做视觉实验,五花八门。让人先免费用、先玩起来、先往外传,本身就是最好的推广——等大家习惯了这种创作方式,再谈付费就顺多了。

    对普通用户来说,这周是最好的上手窗口。10次额度不算多,但足够你把一个想法从文字或多张图,变成一段会动的视频,看看AI到底能把你的脑洞撑多大。等8月11日一过,这扇免费门大概率就要关上了。

    Gemini Omni 用图文视频生成AI视频
    文字、图片、视频都能当输入,对话式连续编辑是Omni的核心差异

    • Gemini Omni免费期延至8月11日,普通用户可免订阅生成最多10条视频
    • 支持文字/图片/视频混合输入,可对话式连续编辑,角色连贯
    • 谷歌把Veo/Imagen/Lyria等工具收进统一入口,视频带SynthID水印
  • 一张图给画师0.005美元,这家AI视频公司想证明生成式AI不必偷

    过去两三年,插画师说得最多的一句话是:你们的模型是拿我的画练出来的,没人问过我。这话在法庭上吵着,在社交平台上也吵着。现在有一批AI创业公司换了个姿势入场——不否认这笔账,而是提出把钱补上。Pippa 就是其中一家。

    Pippa 平台生成的动画画面(图片来自 Pippa / The Verge)
    Pippa 平台生成的动画画面(图片来自 Pippa / The Verge)

    它做的事:按张、按秒给画师打钱

    Pippa 的主营业务和别家没什么两样,文字生成短视频片段,用户把片段拼成故事。区别在结算方式:只要订阅者生成的那张图或那段视频,风格来自某位真人画师,这位画师就能从平台拿到钱。

    每生成一张图,画师拿到 0.005 美元;每一秒视频,0.003 美元。而平台自己的订阅价,是每月 14.99 美元到 99.99 美元。

    除了按量分成,平台还从整体订阅收入里划出 5% 做版税池,签约画师按比例分。Pippa 在新闻稿里把这套结构类比成 Spotify,这个类比选得挺冒险,毕竟这些年抱怨被流媒体分成榨干的音乐人排着队。

    眼下的体量:4 位画师,800 个订阅者

    公司 5 月才上线,目前大约 800 个付费用户,正式签下授权和训练协议的真人画师只有 4 位,另有 4 位在谈。想加入的画师要走一套多步验证流程,证明提交的作品确实出自本人之手;通过之后,基于其画风训练的模型才会开放给订阅者。平台还给每位画师配一个主页,可以往站外的作品导流。

    有个细节比数字更能说明现在的气氛:Pippa 允许签约画师用化名。联合创始人 Sean Wright 说,谈过的画师里不少人是这个态度——我喜欢这套东西,但我不想被同行孤立。在插画圈,公开跟AI公司合作,约等于越过纠察线。


    钱付了,数据来源就干净了吗

    问题恰恰卡在这儿。Pippa 说未来想全面切换到只用自家签约画师数据训练的模型,但当下的技术底座仍是开源模型,用他们自己的说法,这些模型“对更广泛的内容做过初始训练”。翻译成人话:网上扒来的画,它照样用了。

    “过去 18 个月里所有这些模型,都是在没有许可的情况下拿真人的画训练出来的,行业就是这么起来的。我会想到 Napster 那阵子,所有人都在偷音乐,后来苹果推出 99 美分单曲,Napster 关门,我们才找到让音乐人拿到钱的另一条路。”——Pippa 联合创始人 Sean Wright

    类比听着顺,但有一处对不上。苹果卖的是唱片公司授权过的曲子,而生成式模型的那些“底料”已经进了权重,卸不下来。付费只能覆盖增量,覆盖不了存量。这也不是 Pippa 一家的难题,凡是号称合乎伦理的AI公司,只要模型不是从零自建,都要面对同一道题。Ben Affleck 的 InterPositive 选了彻底自建数据集,代价是前期烧钱,做出来的往往是很窄的专业工具,不是给大众用的东西。

    更现实的麻烦:东西还不够好看

    The Verge 的记者翻了 Pippa 的作品站,结论有点扫兴:满屏都是模仿皮克斯质感但没学到位的儿童向内容,看不出哪一条像是从某位独立画师笔下长出来的。这倒也不难理解,平台目前调用的还是和竞品同一批云端模型。

    接下来 Pippa 打算接入字节跳动的 Seedance 2.5,卖点是能一口气生成 30 秒、还能局部微调不用推倒重来。可这个模型别家也能接,接完差异化就归零了。真正的护城河只剩一件事:签到足够多、足够有辨识度的画师。而这件事又反过来取决于公众对生成式AI的观感能不能回暖。

    分成这件事的真正意义

    • 0.005 美元一张图,单价低到接近象征性,杠杆其实在生成量和那 5% 的版税池上
    • 允许化名参与,说明“合作即背叛”的社群压力还很硬
    • 底座仍是开源模型,所谓合乎伦理目前更像方向声明,不是既成事实
    • 授权数据的成本最终会体现在订阅价和内容丰富度上,两边都得有人买单

    把这件事放长了看,Pippa 的价值可能不在它今天付了多少钱,而在于它给行业立了一份可以被追问的账本格式:谁的风格、被调用了多少次、分到了多少钱。以前这些数字压根不存在,画师连自己被用了都不知道。有了账本,才谈得上讨价还价。至于每张图 0.005 美元这个价合不合理,那是下一轮的事。

  • 拼不过就当裁判:Runway推首个生成式媒体模型路由器

    Runway 不想只做又一家 AI 模型公司了。它现在的野心是成为生成式媒体的基础设施层——说白了,就是想当那个所有人都绕不开的中间层。上周四,这家公司通过本月早些时候上线的开发者平台 Runway Dev,推出了一个叫 Media Router 的新工具。

    Runway Media Router
    Runway 推出面向生成式媒体的模型路由器(图片来源:TechCrunch)

    这个 Media Router 能干什么?简单讲,它会根据开发者更看重质量、速度还是成本,自动帮你挑出最合适的图像、视频或音频生成模型。模型路由器在大语言模型圈子里早就不新鲜了,但 Runway 说,这是头一个专门为生成式媒体打造的路由器。

    “路由这件事,正好契合我们的整体承诺——做开发者接入任何一种生成式媒体模型的最省心的一站式平台。”——Runway 首席产品官 Anthony Maggio

    从做视频到做”卖水人”

    这次发布,是 Runway 从一家 AI 视频初创公司往生成式媒体基础设施转型的又一步棋。通过 Runway Dev,包括 Adobe、Cloudflare、ElevenLabs、Expedia、Shutterstock 和 Quora 在内的客户,可以直接把媒体生成能力嵌进自己的产品里,而不用再把用户导到 Runway 的 App 或网站上去。

    路由器的推出赶上了一个特殊时点——生成式媒体模型的数量正在爆炸式增长,开发者想把每个新模型都评估一遍,越来越费时费力。Maggio 说,大多数开发者根本没工夫去真正搞懂每个模型的能力边界,而 Runway 端出来的独特价值,就是把”哪个模型最适合哪种活”的判断力,跟你业务场景里的偏好揉在一起。


    账单压力催生的路由生意

    开发者能设置哪些偏好?Maggio 举了几个例子。比如中国的生成式媒体模型越来越火,但不少做产品的企业未必愿意用中国出品的模型,那就可以设定优先选美国供应商——随着特朗普政府研究对中国开放模型加以限制,这类偏好可能会越来越常见。不过他也强调,客户最关心的其实还是按 token 定价和质量来做路由。

    token 账单在 2026 年成了热门话题,那些一头扎进智能体 AI 的企业,实打实尝到了高额账单的滋味。大模型圈里按 token 价格做路由早就普遍了,生成式媒体跟上这个趋势也就顺理成章。值得玩味的是,Media Router 上线前几周,Runway 刚把无限量套餐换成了按 token 计费,这一改还招来了部分用户的吐槽。

    • 质量判断是难点:生成式媒体不像语言模型那么容易评好坏,路由器靠的是 Runway 内部创意团队积累的评测经验;
    • 评测维度很具体,比如视频模型怎么处理运动、图像模型怎么处理构图、语音模型怎么对口型;
    • 这套智能层其实是 Runway 给自家 5 月上线的 Agent 产品打磨出来的,现在打包给外部开发者用。

    背后还有一层现实的考量。Runway 上一款专门的视频模型 Gen 4.5 还是去年 12 月发的,当时登顶排行榜、把谷歌等老牌玩家都甩在身后。可眼下除了 5 月给视频编辑模型 Aleph 2.0 做过升级,它已经好几个月没推新的前沿视频模型了。如今在文生视频、图生视频的榜单前二十里,坐着的是谷歌、字节跳动和阿里巴巴这些重量级选手。

    与其赌某一个模型能一直领先,Media Router 干脆假设”最好的模型会一直换人”,然后让 Runway 始终留在牌桌上。联合创始人兼联席 CEO Anastasis Germanidis 的说法很实在:底层需要好模型,但编排层的分量越来越重,因为大家现在是拿这些模型去搭整套营销战役、生成整段多镜头成片。做不成最好的模型,那就做最好的编排层。

  • 自研模型跟不上,Runway改当裁判:推出生成式媒体首个模型路由器

    Runway不想再只当一家做模型的公司了。这家靠AI视频起家的初创,最近想干的是给整个生成式媒体行业当”基础设施”。周四它上线了一个叫Runway Media Router的工具,本质上是个模型路由器——你提一个需求,它自动帮你挑出最合适的图像、视频或音频生成模型来干活。

    Runway Media Router 模型路由器
    Runway推出面向生成式媒体的模型路由器Media Router(图片来源:Runway / TechCrunch)

    模型太多了,开发者根本挑不过来

    这个路由器接在本月早些时候上线的开发者平台Runway Dev上,通过API能一次性接入一大堆第三方的图像、视频、音频模型,外加Runway自家的。路由器会根据你更看重质量、速度还是成本,自动选模型。模型路由在大语言模型圈子里早就不新鲜了,但Runway说,这是头一个专门为生成式媒体做的。

    “大多数开发者根本没时间去搞懂每个模型的能力边界,也说不清它们在视频、图像、音频各类输出上到底强在哪、差在哪。我们能提供的,就是这层判断力。”——Runway首席产品官 Anthony Maggio

    道理其实挺朴素。这两年生成式媒体模型多到爆炸,新品一个接一个,开发者光是评测就够呛。通过Runway Dev,Adobe、Cloudflare、ElevenLabs、Expedia、Shutterstock、Quora这些客户可以直接把媒体生成能力嵌进自己的产品里,不用再把用户往Runway的App上导。

    成本和质量,才是客户最在意的

    路由器能设的偏好不止一种。Maggio提到,不少企业对来自中国的生成式媒体模型不太放心,可以直接把偏好设成只用美国厂商——尤其眼下特朗普政府正在琢磨对中国开放AI模型的禁令和制裁,这种需求可能会越来越常见。不过他说,客户最关心的其实还是两件事:按token算的价格,和输出质量。2026年token账单成了热门话题,那些全押智能体AI的企业,被高昂的账单狠狠上了一课。


    当不了最强模型,那就当最强的调度层

    质量这块,生成式媒体比语言模型难判断得多——一段视频动作处理得好不好、一张图构图行不行、配音对不对得上口型,都不是跑个分就能说清的。Runway的底气来自它自家创意团队多年攒下的评测经验,这层”判断力”其实早就为它5月推出的智能体产品打磨过了,现在只是把同一套技术打包给外部开发者用。

    说到底,这步棋反映的是Runway的处境。它上一款自研视频模型Gen 4.5还是去年12月发的,当时确实登顶过榜单、压过谷歌;但之后除了5月给编辑模型Aleph 2.0做过升级,就再没扔出新的前沿视频模型(Gen 5至今没影)。如今在文生视频、图生视频的榜单前列,坐着的是谷歌、字节跳动、阿里这些大块头。

    • Media Router号称首个专为生成式媒体打造的模型路由器
    • 已接入客户:Adobe、Cloudflare、ElevenLabs、Expedia、Shutterstock、Quora
    • 可按质量、速度、成本,甚至模型产地设置偏好
    • Runway近期把无限订阅改成按token计费,曾引发用户不满

    联合创始人Anastasis Germanidis说得直白:底下得有好模型,但”编排”这层越来越重要,因为大家现在是拿模型做整套营销campaign、拼多镜头成片。与其赌某一个模型永远领先,不如假设最强的模型一直在换——路由器的思路正是这样,让Runway哪怕不是那个最强模型,也能稳稳留在牌桌上。

  • 新加坡AI视频公司PixVerse融了4.39亿美元,估值冲破20亿,阿里入局

    做AI视频生成的公司这两年不算少,但真能拿到大钱、还被阿里看上的不多。新加坡的PixVerse刚宣布完成一轮C轮扩展融资,总额4.39亿美元,估值直接冲过20亿美元。这一轮由CDH Investments领投,新进来的名字里最扎眼的是阿里巴巴,此外还有Mirae Asset、BlueFocus、Eastern Bell Capital等。

    AI视频生成概念图
    AI视频生成正成为生成式AI里最烧钱、也最被资本追捧的赛道之一。

    三年、1.5亿用户、20亿估值

    这家公司2023年才成立,创始人是王昌虎和Jaden Xie。王昌虎之前在字节做计算机视觉,Xie做过投资。他们现在对外说,消费端产品已经有超过1.5亿注册用户、1500多万月活。至于其中多少是付费用户,他们没说——这是个留白,但也正常,很多AI应用都靠这个盘子撑起估值。

    三套模型,外加一个“世界模型”

    PixVerse不是只卖一个模型。它有V系列,面向普通用户和API调用;C系列,面向专业影视和广告工作流;今年早些时候还发布了R系列“世界模型”,专门给游戏和虚拟世界搭建用。用户能生成最高4K、还带声音的视频,图片转视频的价格是每分钟4.8美元。

    Xie对TechCrunch说:“关键差别不在数据,而在你怎么标注它,因为数据到处都是。”他的联合创始人王昌虎在字节搭过TikTok背后的视觉理解技术,靠精准标注撑起了推荐算法。

    一句大实话,点了一圈对手

    同行都在说自己“质量高”,这话没有信息量。Xie真正想强调的差别在“标注”:数据到处都是,谁标得好谁赢。他还很不客气地点了对手——OpenAI关掉Sora 2、等于退出了这个赛道;Meta和腾讯也做不出够质量的视频模型。所以能打到质量线的没几家。

    亚洲这边有字节的Seedance、Kling AI,以及前腾讯AI负责人危宇的Video Rebirth;西方则有Runway、Luma、Midjourney。世界模型这条更窄的赛道上,Yann LeCun和李飞飞也都在做。


    钱要花在哪,估值能不能站住

    这轮钱怎么花?扩世界模型、招研究员、铺全球企业销售。PixVerse目前150人,散布在新加坡、北京、上海,还跟投资人阿里签了部署合作,把视频生成功能接进阿里的体系。视频生成这条赛道热得发烫,但变现终究是硬仗——1500万月活里多少真付费、企业客户能不能持续掏钱,才是20亿估值能不能站稳的关键。Sora退场留下的空位,正在被亚洲公司抢。

    • 融资规模:C轮扩展4.39亿美元,估值突破20亿美元
    • 关键投资人:CDH Investments领投,阿里巴巴等新进
    • 产品矩阵:V系列(消费/API)、C系列(专业)、R系列(世界模型)
    • 用户盘子:1.5亿注册、1500万月活,付费率未披露
    📎 原文来源:Video generation startup PixVerse raises $439M, valuation soars past $2B(TechCrunch / Ivan Mehta)
  • Google Photos 上线 Video Remix:几秒把废片改成水彩画

    谷歌给 Google 相册塞进了一个新玩具,叫 Video Remix。它背后是 Gemini Omni 模型,用法简单到有点离谱:在”Create”标签页里挑一段视频,选个模板,剩下的交给 AI。

    Google Photos Video Remix
    Video Remix 把视频编辑变成几步点击的模板游戏(图源:TechCrunch)

    它能干啥

    最核心的三类玩法:一是电影级重新打光,把拍暗了的片段自动提亮;二是换背景,把平淡的墙换成咖啡馆或者海滩日落;三是艺术滤镜,把视频涂成水彩、素描本或者油画的样子。你不用碰时间轴,也不用调色轮,点几下就出片。

    “做出好看的视频片段,不该需要专业技能,也不该耗费几个小时。”谷歌在博客里这么写,”现在用 Photos 里的 Video Remix,几步点击就能把普通视频变成值得分享的瞬间。”

    实际限制也挺明确:视频总长得在 60 秒以内,而且你只能挑其中 1 到 10 秒的片段来做变换;素材还得已经备份到 Google 相册里。

    门槛藏在订阅里

    这个功能只对成年人开放,而且不是免费用户能碰的——它绑在 Google AI Plus、Pro、Ultra 这几个付费档上,首批开放的市场包括美国、日本、韩国、印度等 14 个国家。免费相册用户暂时和它无缘。

    • AI Plus 每月 4.99 美元(今年 6 月刚从 7.99 降下来),带 400GB 存储,能用 Video Remix;
    • AI Pro 每月 19.99 美元,5TB 存储;
    • AI Ultra 每月 100 到 200 美元,面向重度用户。

    把”生成式视频”关在付费墙后面,说明谷歌的算盘和存储费一个逻辑:好用,但跑在云端烧钱,所以按量计费。此前 Magic Eraser、背景虚化这些相册 AI 工具都是免费的,这次是个明显的转向。

    谷歌想把相册变成创作入口

    Video Remix 不是孤立的。谷歌近半年往 Photos 里塞了一连串 AI:照片转动图、Photo Remix 把静图变成 3D 动画和漫画风、AI 修图、甚至一个数字衣橱帮你试穿搭。它的野心很清楚——相册不该只是备份仓库,而要成为你不用跳出谷歌生态就能修图、生成、玩创意的地方。这跟苹果 iOS 的回忆视频、Adobe 的 AI 剪辑、Meta 的 Muse Image,抢的是同一批想偷懒又想出片的人。

    顺带一提,用 Gemini Omni 生成的视频会打上 SynthID 水印,方便溯源是不是 AI 做的。


  • Character.AI杀入微短剧:看完还能拉住主角聊上两句

    Character.AI 自制微短剧 c.ai Series
    Character.AI 推出的 c.ai Series 让观众能和剧中 AI 角色直接对话(图:TechCrunch)

    微短剧这阵风刮得有多猛?现在几乎每个盯住「注意力」生意的公司都在做:专门的短剧 App 不用说,TikTok、Instagram 这些社交巨头下了场,连 Peacock、Amazon Prime、印度的 JioHotstar 都来分一杯羹。最近,以「和 AI 角色聊天」起家的 Character.AI 也进场了,但它玩了个不一样的花样。

    三部开篇,题材专挑能聊的

    Character.AI 自己制作了三档微短剧:爱情向的《最后一个夏天》、恐怖向的《夜间游戏》,还有一档类似《饥饿游戏》的生存题材《伊甸坠落》。这些剧都是用 AI 制作工具弄出来的。有意思的地方在后面——18 岁以上的用户不光能看,还能直接跟剧里的角色对话、提问,甚至换条故事线自己演一遍。公司说长远目标是把这套工作流变成创作工具,让普通用户也能拿自己捏的角色拍系列剧。

    它把「看剧」变成了「进剧」

    当下的竖屏短剧,本质上是你划一下、我看一段,全程被动。Character.AI 的 twist 在于,剧播完了你还能把主角拽住聊两句。这让它不像又一个短视频信息流,而更像把一个故事世界直接敞开给你。公司把这个项目叫 c.ai Series,先由内部工作室主导打磨格式和流程,等摸清楚了观众要什么,再把能力开放给创作者。

    他们自己有个判断:故事本身未必是最核心的资产,「可对话、可介入」的叙事框架才是。当用户厌倦了被动观看,控制感和参与感反而成了新的卖点。

    这不是临时起意追风口

    往回看,这家公司从去年就把重心往娱乐功能挪了。今年 4 月它预告了 Lorebook,让用户给角色搭世界观设定;又上了 Books,能把你自己塞进经典文学里扮演角色。现在它还在测 c.ai FM(音频剧)和 c.ai Reads(小说创作)。CEO 卡兰迪普·阿南德说得直白:短剧不是为赶热点临时加的业务,而是平台顺理成章的下一步。为了不像粗制滥造的 AI 视频那样翻车,他们特意请了好莱坞编剧团队先把剧本磨出来,首批每部约 10 集、单集不到两分钟,前 8 集免费、后 2 集付费。

    真正值钱的是那点黏性

    敢这么玩,底气来自用户停留。Sensor Tower 的数据说,2026 年上半年,Character.AI 的用户每个月花在上面的时间超过 950 分钟。放到流媒体行业里看,这是个吓人的数字。公司显然在赌一件事:把陪你聊天的 companion,转化成原创 IP,再靠能互动的角色把人留得更久。


    • 三档自制微短剧上线,题材覆盖爱情、恐怖、生存
    • 核心差异:看完能和剧中 AI 角色对话、改剧情
    • 先工作室主导,后续向创作者开放工具
    • 月均停留超 950 分钟,互动成新黏性点
  • 可灵 AI 单轮融了近 30 亿美元:全球视频大模型最大一笔钱

    可灵 AI 单轮融了近 30 亿美元:全球视频大模型最大一笔钱

    7月2日晚上,快手在港交所发了个公告——旗下的视频生成大模型“可灵 AI”要独立出来,单轮融资规模最高 30 亿美元,投后估值大概 180 亿美元。这个数字创下了全球视频大模型公司单轮融资的纪录,国内 AI 领域也就仅次于 DeepSeek 首轮的 70 亿美元。可灵这是要单飞了。

    30 亿美元约占可灵扩大后注册资本的 16.67%,对应投后估值约 180 亿美元——全球视频基础模型赛道迄今最大的一笔融资。

    钱是谁给的?

    这轮阵容挺豪华。领投的有 CPE 源峰、国方创投、来自阿布扎比的 BlueFive Capital、腾讯、中关村科学城基金和中信证券,一共 34 家机构认购。跟投里还有阿里云、百度这样的产业资本,华策影视、芒果系的厚为资本这些文娱产业方也进来了。值得一提的是,BlueFive 来自中东,这是中东资本头一回投中国的 AI 视频模型;而 CPE 源峰同时押了 Kimi 和可灵,等于在 AI 赛道上“通用+垂直”两头下注。整个交易分两步走:领投方先出 138.24 亿元人民币,15 家额外投资方再加 52.2 亿,60 天认购期里还能再进最多 14 亿,凑到上限 204.47 亿元。

    可灵 AI 单轮融资近 30 亿美元,创全球视频大模型公司融资纪录
    可灵 AI 单轮融资近 30 亿美元,创全球视频大模型公司融资纪录

    为什么现在要拆出来单干?

    说白了,是被算力开支和竞争逼的。快手这一年几乎把资本开支全砸在了 AI 基础设施上,调整后净利润因此被拖累。把可灵拆出来独立融资,既能给它输血,也能让母公司喘口气。数据其实很能打:可灵今年一季度收入超过 6.5 亿元,同比涨了 300% 多;3 月的年化收入(ARR)接近 5 亿美元,一年翻了四倍;全球用户已经破了 1 亿,而且大约四分之三的收入来自海外。对一个视频大模型来说,这样的海外变现能力不多见。

    拿到钱,仗才刚开始

    不过投资人现在的心态变了。以前看的是技术 demo 够不够炫,现在更盯着能不能赚钱、边际效率高不高。 30 亿美元砸研发是够了,但可灵得赶紧跟其他视频大模型拉开差距,把钱变成实打实的成本优势才行。协议里还写了回购条款:要是 2031 年 10 月底前没能完成 IPO,或者没按约定时间重组,投资人可以要求按原价加每年 8% 的单利回购,母公司还得连带担责。这压力可不小。


    快手已经放话,未来 12 个月内可能启动可灵 AI 赴港上市。视频大模型这条赛道,海外有 Runway、OpenAI 的 Sora,国内有一堆追兵,可灵手里多了 30 亿美元的弹药,但真正的较量,是把这笔钱花出效率来。

  • claude-video:让 Claude 真正“看懂”视频的 /watch 技能,6.4K Stars 把视频变成 AI 能读的输入

    claude-video:让 Claude 真正“看懂”视频的 /watch 技能,6.4K Stars 把视频变成 AI 能读的输入

    📌 项目简介

    claude-video 是一个让 Claude(以及 Codex、Cursor、Gemini CLI 等 50+ AI 编程工具)真正”看懂”视频的开源 Agent Skill。它的核心理念只有一句话:Claude 能读网页、能读 PDF、能读代码仓库,但默认它看不了视频——而 claude-video 把”看视频”这件事补上了。你丢给它一个 YouTube 链接或本地视频,它自动下载、抽帧、转写音频,再把画面帧 + 时间戳字幕一起喂给大模型,让 AI 基于真实视听觉内容来回答,而不是靠标题瞎猜。

    🛠 安装要求和过程

    环境要求:

    • Python 3.10+(核心脚本 watch.py / download.py / frames.py / transcribe.py 均为 Python 实现)
    • yt-dlp:负责从 YouTube、Loom、TikTok、X、Instagram 等站点下载视频(首次运行 macOS 上自动 brew 安装,Linux/Windows 会打印安装命令)
    • ffmpeg:负责抽帧、音频提取(同上,首次运行自动引导安装)
    • 带字幕的视频完全免费;无字幕时才需要 Whisper API Key(Groq whisper-large-v3 或 OpenAI whisper-1

    快速安装(三选一):

    方式一 · Claude Code(推荐):

    /plugin marketplace add bradautomates/claude-video
    /plugin install watch@claude-video

    方式二 · 任意 Agent Skills 宿主(Codex / Cursor / Copilot / Gemini CLI 等 50+ 工具):

    npx skills add bradautomates/claude-video -g

    方式三 · 手动 / 开发:

    git clone https://github.com/bradautomates/claude-video.git
    ln -s "$(pwd)/claude-video/skills/watch" ~/.claude/skills/watch
    # 或 ~/.codex/skills/watch

    首次运行会调用 scripts/setup.py --check 引导安装依赖,并在 ~/.config/watch/.env 中生成 GROQ_API_KEY / OPENAI_API_KEY 占位配置。

    ⚡ 核心功能

    1. 多源视频获取:支持 URL(yt-dlp 兼容的几乎所有视频站点)或本地路径(.mp4/.mov/.mkv/.webm),一条命令即可接入。
    2. 智能帧提取:用 ffmpeg 按细节模式抽帧——efficient(关键帧,约 0.5s)到 token-burner(场景切换检测);内置帧去重(默认开启,丢弃近重复帧)与自动 fps / token 预算控制。
    3. 双通道转写:优先用 yt-dlp 提取原生字幕(免费);无字幕时回退 Whisper API,并支持 >25MB 自动分块,确保长视频也能完整转写。
    4. 多模态交给大模型:脚本输出带 t=MM:SS 标记的帧路径 + 时间戳转写,Claude 并行 Read 图像,基于真实画面与声音作答。
    5. 细节模式可调节:--detail transcript|efficient|balanced|token-burner 权衡速度与 token 成本;支持 --start/--end 聚焦片段、--timestamps 指定时刻、--no-whisper 等精细控制。

    🎯 典型使用场景

    • 拆解爆款内容:把竞品发布会、广告片、干货视频丢给它,让它分析钩子结构、叙事节奏、真正的新功能,远快于 2x 倍速硬看。
    • 看录屏诊断 Bug:前端同学把屏幕录制喂给它,它能定位”出错的那一帧”,描述现象与可能原因,把视频变成可调试的输入。
    • 视频转结构化笔记:把一整个播放列表逐条摘要,自动构建可搜索的知识库;或剥离更新视频里的 hype,只提取”真正变了什么”。

    💡 推荐理由(个人使用心得)

    这是个”小而准”的工具,解决的痛点非常真实——我们天天让 AI 读文档读代码,但遇到一个视频链接就瞬间退化成”靠标题猜”。claude-video 最漂亮的设计是零配置起步:有字幕就白嫖字幕,没字幕才花一点点 Whisper 钱;帧去重 + 预算控制又避免了”把整个视频塞进上下文”的 token 爆炸。它本质上是在给 LLM 补上一双眼睛,而且是以”可复用技能包”的形式存在,Claude Code / Cursor / Codex 通吃。如果你经常需要让 AI 处理视频内容,这个 6.4K Star、MIT 协议、纯 Python 的小项目,值得一键装进你的工具箱。

    🔗 下载地址

    • GitHub:github.com/bradautomates/claude-video
    • 安装(Claude Code):/plugin marketplace add bradautomates/claude-video/plugin install watch@claude-video
    • 许可证:MIT(可自由商用、修改、分发)
  • Google Photos 上线「Video Remix」:你手机里那段糊视频,几秒钟被 AI 改头换面

    Google Photos Video Remix AI 视频重混功能示意图
    Google Photos 的 Video Remix 把 AI 视频编辑做成了相册里的一键按钮(配图由 AI 生成)

    你手机相册里那些拍得一般、光线很暗、背景很乱的视频,以前基本就躺在那儿吃灰了。现在 Google 想让你点一下,AI 把它们”重混”一遍。7 月 8 日,Photos 里上线了一个叫 Video Remix 的功能,它跑在 Gemini Omni 这套模型上,干的事很具体。

    几秒钟能改头换面

    给暗乎乎的片段补光(Google 管这叫 cinematic relighting),把平淡的背景换成别的场景,或者给整段视频套上水彩、速写本这类艺术风格。入口藏在 Photos 的 “Create” 标签页里,Google 把它定义成你的”创意中枢”。操作逻辑很简单:挑一段视频,选个效果,等几秒,出来一份被重新打过光的版本。

    这个功能不是给所有人开的。目前只面向 Google AI Plus、Pro、Ultra 这几个订阅档位的用户灰度推送,也不是全球同时铺开。换句话说,你如果还用着免费的 Photos,暂时看不到这个按钮。

    Google 自己的说明里反复强调,用 Video Remix 生成的视频会带上 SynthID 的隐形水印,标明”这是 AI 动手过的”。

    三个月塞了三个,相册快成工具箱了

    有意思的是,这已经不是 Google Photos 今年第一次往相册里塞 AI 生成类工具了。翻一翻时间线,短短三个月里它已经堆了至少三个功能相近的东西。用户打开相册,本意是找张旧照片,结果迎面撞上一堆”AI 帮你重做”的入口。功能多是好事,但当每个入口都在暗示”你原来的素材不够好、让我替你重造一遍”,体验就开始变味了。

    水印这事儿,真挡得住吗

    再说 SynthID。Google 一直把这套隐形水印当成”负责任 AI”的门面,意思是 AI 生成的内容能被溯源、被识别。理想很丰满:以后看到一段以假乱真的视频,系统能告诉你”这是 AI 改的”。但现实骨感——水印只对”在 Google 生态内生成”的内容有效。你导出视频、转码一遍、或者用别的工具再处理,水印就可能掉了。

    • 给暗光视频补光、换背景,门槛低到几乎零成本
    • 艺术风格迁移让”看起来像那么回事”变得特别容易
    • SynthID 只对原生生成内容生效,二次传播基本失效

    我倒不是说 Google 存了什么坏心。把专业级的视频调色、风格化能力下放到每个人的相册,确实是技术进步。但当一个日活几十亿的产品,把”AI 改写现实”做成一键按钮,它承担的就不只是”好玩”的责任了。水印是第一步,但远远不够。