标签: AI视频

  • 新加坡AI视频公司PixVerse融了4.39亿美元,估值冲破20亿,阿里入局

    做AI视频生成的公司这两年不算少,但真能拿到大钱、还被阿里看上的不多。新加坡的PixVerse刚宣布完成一轮C轮扩展融资,总额4.39亿美元,估值直接冲过20亿美元。这一轮由CDH Investments领投,新进来的名字里最扎眼的是阿里巴巴,此外还有Mirae Asset、BlueFocus、Eastern Bell Capital等。

    AI视频生成概念图
    AI视频生成正成为生成式AI里最烧钱、也最被资本追捧的赛道之一。

    三年、1.5亿用户、20亿估值

    这家公司2023年才成立,创始人是王昌虎和Jaden Xie。王昌虎之前在字节做计算机视觉,Xie做过投资。他们现在对外说,消费端产品已经有超过1.5亿注册用户、1500多万月活。至于其中多少是付费用户,他们没说——这是个留白,但也正常,很多AI应用都靠这个盘子撑起估值。

    三套模型,外加一个“世界模型”

    PixVerse不是只卖一个模型。它有V系列,面向普通用户和API调用;C系列,面向专业影视和广告工作流;今年早些时候还发布了R系列“世界模型”,专门给游戏和虚拟世界搭建用。用户能生成最高4K、还带声音的视频,图片转视频的价格是每分钟4.8美元。

    Xie对TechCrunch说:“关键差别不在数据,而在你怎么标注它,因为数据到处都是。”他的联合创始人王昌虎在字节搭过TikTok背后的视觉理解技术,靠精准标注撑起了推荐算法。

    一句大实话,点了一圈对手

    同行都在说自己“质量高”,这话没有信息量。Xie真正想强调的差别在“标注”:数据到处都是,谁标得好谁赢。他还很不客气地点了对手——OpenAI关掉Sora 2、等于退出了这个赛道;Meta和腾讯也做不出够质量的视频模型。所以能打到质量线的没几家。

    亚洲这边有字节的Seedance、Kling AI,以及前腾讯AI负责人危宇的Video Rebirth;西方则有Runway、Luma、Midjourney。世界模型这条更窄的赛道上,Yann LeCun和李飞飞也都在做。


    钱要花在哪,估值能不能站住

    这轮钱怎么花?扩世界模型、招研究员、铺全球企业销售。PixVerse目前150人,散布在新加坡、北京、上海,还跟投资人阿里签了部署合作,把视频生成功能接进阿里的体系。视频生成这条赛道热得发烫,但变现终究是硬仗——1500万月活里多少真付费、企业客户能不能持续掏钱,才是20亿估值能不能站稳的关键。Sora退场留下的空位,正在被亚洲公司抢。

    • 融资规模:C轮扩展4.39亿美元,估值突破20亿美元
    • 关键投资人:CDH Investments领投,阿里巴巴等新进
    • 产品矩阵:V系列(消费/API)、C系列(专业)、R系列(世界模型)
    • 用户盘子:1.5亿注册、1500万月活,付费率未披露
    📎 原文来源:Video generation startup PixVerse raises $439M, valuation soars past $2B(TechCrunch / Ivan Mehta)
  • Google Photos 上线 Video Remix:几秒把废片改成水彩画

    谷歌给 Google 相册塞进了一个新玩具,叫 Video Remix。它背后是 Gemini Omni 模型,用法简单到有点离谱:在”Create”标签页里挑一段视频,选个模板,剩下的交给 AI。

    Google Photos Video Remix
    Video Remix 把视频编辑变成几步点击的模板游戏(图源:TechCrunch)

    它能干啥

    最核心的三类玩法:一是电影级重新打光,把拍暗了的片段自动提亮;二是换背景,把平淡的墙换成咖啡馆或者海滩日落;三是艺术滤镜,把视频涂成水彩、素描本或者油画的样子。你不用碰时间轴,也不用调色轮,点几下就出片。

    “做出好看的视频片段,不该需要专业技能,也不该耗费几个小时。”谷歌在博客里这么写,”现在用 Photos 里的 Video Remix,几步点击就能把普通视频变成值得分享的瞬间。”

    实际限制也挺明确:视频总长得在 60 秒以内,而且你只能挑其中 1 到 10 秒的片段来做变换;素材还得已经备份到 Google 相册里。

    门槛藏在订阅里

    这个功能只对成年人开放,而且不是免费用户能碰的——它绑在 Google AI Plus、Pro、Ultra 这几个付费档上,首批开放的市场包括美国、日本、韩国、印度等 14 个国家。免费相册用户暂时和它无缘。

    • AI Plus 每月 4.99 美元(今年 6 月刚从 7.99 降下来),带 400GB 存储,能用 Video Remix;
    • AI Pro 每月 19.99 美元,5TB 存储;
    • AI Ultra 每月 100 到 200 美元,面向重度用户。

    把”生成式视频”关在付费墙后面,说明谷歌的算盘和存储费一个逻辑:好用,但跑在云端烧钱,所以按量计费。此前 Magic Eraser、背景虚化这些相册 AI 工具都是免费的,这次是个明显的转向。

    谷歌想把相册变成创作入口

    Video Remix 不是孤立的。谷歌近半年往 Photos 里塞了一连串 AI:照片转动图、Photo Remix 把静图变成 3D 动画和漫画风、AI 修图、甚至一个数字衣橱帮你试穿搭。它的野心很清楚——相册不该只是备份仓库,而要成为你不用跳出谷歌生态就能修图、生成、玩创意的地方。这跟苹果 iOS 的回忆视频、Adobe 的 AI 剪辑、Meta 的 Muse Image,抢的是同一批想偷懒又想出片的人。

    顺带一提,用 Gemini Omni 生成的视频会打上 SynthID 水印,方便溯源是不是 AI 做的。


  • Character.AI杀入微短剧:看完还能拉住主角聊上两句

    Character.AI 自制微短剧 c.ai Series
    Character.AI 推出的 c.ai Series 让观众能和剧中 AI 角色直接对话(图:TechCrunch)

    微短剧这阵风刮得有多猛?现在几乎每个盯住「注意力」生意的公司都在做:专门的短剧 App 不用说,TikTok、Instagram 这些社交巨头下了场,连 Peacock、Amazon Prime、印度的 JioHotstar 都来分一杯羹。最近,以「和 AI 角色聊天」起家的 Character.AI 也进场了,但它玩了个不一样的花样。

    三部开篇,题材专挑能聊的

    Character.AI 自己制作了三档微短剧:爱情向的《最后一个夏天》、恐怖向的《夜间游戏》,还有一档类似《饥饿游戏》的生存题材《伊甸坠落》。这些剧都是用 AI 制作工具弄出来的。有意思的地方在后面——18 岁以上的用户不光能看,还能直接跟剧里的角色对话、提问,甚至换条故事线自己演一遍。公司说长远目标是把这套工作流变成创作工具,让普通用户也能拿自己捏的角色拍系列剧。

    它把「看剧」变成了「进剧」

    当下的竖屏短剧,本质上是你划一下、我看一段,全程被动。Character.AI 的 twist 在于,剧播完了你还能把主角拽住聊两句。这让它不像又一个短视频信息流,而更像把一个故事世界直接敞开给你。公司把这个项目叫 c.ai Series,先由内部工作室主导打磨格式和流程,等摸清楚了观众要什么,再把能力开放给创作者。

    他们自己有个判断:故事本身未必是最核心的资产,「可对话、可介入」的叙事框架才是。当用户厌倦了被动观看,控制感和参与感反而成了新的卖点。

    这不是临时起意追风口

    往回看,这家公司从去年就把重心往娱乐功能挪了。今年 4 月它预告了 Lorebook,让用户给角色搭世界观设定;又上了 Books,能把你自己塞进经典文学里扮演角色。现在它还在测 c.ai FM(音频剧)和 c.ai Reads(小说创作)。CEO 卡兰迪普·阿南德说得直白:短剧不是为赶热点临时加的业务,而是平台顺理成章的下一步。为了不像粗制滥造的 AI 视频那样翻车,他们特意请了好莱坞编剧团队先把剧本磨出来,首批每部约 10 集、单集不到两分钟,前 8 集免费、后 2 集付费。

    真正值钱的是那点黏性

    敢这么玩,底气来自用户停留。Sensor Tower 的数据说,2026 年上半年,Character.AI 的用户每个月花在上面的时间超过 950 分钟。放到流媒体行业里看,这是个吓人的数字。公司显然在赌一件事:把陪你聊天的 companion,转化成原创 IP,再靠能互动的角色把人留得更久。


    • 三档自制微短剧上线,题材覆盖爱情、恐怖、生存
    • 核心差异:看完能和剧中 AI 角色对话、改剧情
    • 先工作室主导,后续向创作者开放工具
    • 月均停留超 950 分钟,互动成新黏性点
  • 可灵 AI 单轮融了近 30 亿美元:全球视频大模型最大一笔钱

    可灵 AI 单轮融了近 30 亿美元:全球视频大模型最大一笔钱

    7月2日晚上,快手在港交所发了个公告——旗下的视频生成大模型“可灵 AI”要独立出来,单轮融资规模最高 30 亿美元,投后估值大概 180 亿美元。这个数字创下了全球视频大模型公司单轮融资的纪录,国内 AI 领域也就仅次于 DeepSeek 首轮的 70 亿美元。可灵这是要单飞了。

    30 亿美元约占可灵扩大后注册资本的 16.67%,对应投后估值约 180 亿美元——全球视频基础模型赛道迄今最大的一笔融资。

    钱是谁给的?

    这轮阵容挺豪华。领投的有 CPE 源峰、国方创投、来自阿布扎比的 BlueFive Capital、腾讯、中关村科学城基金和中信证券,一共 34 家机构认购。跟投里还有阿里云、百度这样的产业资本,华策影视、芒果系的厚为资本这些文娱产业方也进来了。值得一提的是,BlueFive 来自中东,这是中东资本头一回投中国的 AI 视频模型;而 CPE 源峰同时押了 Kimi 和可灵,等于在 AI 赛道上“通用+垂直”两头下注。整个交易分两步走:领投方先出 138.24 亿元人民币,15 家额外投资方再加 52.2 亿,60 天认购期里还能再进最多 14 亿,凑到上限 204.47 亿元。

    可灵 AI 单轮融资近 30 亿美元,创全球视频大模型公司融资纪录
    可灵 AI 单轮融资近 30 亿美元,创全球视频大模型公司融资纪录

    为什么现在要拆出来单干?

    说白了,是被算力开支和竞争逼的。快手这一年几乎把资本开支全砸在了 AI 基础设施上,调整后净利润因此被拖累。把可灵拆出来独立融资,既能给它输血,也能让母公司喘口气。数据其实很能打:可灵今年一季度收入超过 6.5 亿元,同比涨了 300% 多;3 月的年化收入(ARR)接近 5 亿美元,一年翻了四倍;全球用户已经破了 1 亿,而且大约四分之三的收入来自海外。对一个视频大模型来说,这样的海外变现能力不多见。

    拿到钱,仗才刚开始

    不过投资人现在的心态变了。以前看的是技术 demo 够不够炫,现在更盯着能不能赚钱、边际效率高不高。 30 亿美元砸研发是够了,但可灵得赶紧跟其他视频大模型拉开差距,把钱变成实打实的成本优势才行。协议里还写了回购条款:要是 2031 年 10 月底前没能完成 IPO,或者没按约定时间重组,投资人可以要求按原价加每年 8% 的单利回购,母公司还得连带担责。这压力可不小。


    快手已经放话,未来 12 个月内可能启动可灵 AI 赴港上市。视频大模型这条赛道,海外有 Runway、OpenAI 的 Sora,国内有一堆追兵,可灵手里多了 30 亿美元的弹药,但真正的较量,是把这笔钱花出效率来。

  • claude-video:让 Claude 真正“看懂”视频的 /watch 技能,6.4K Stars 把视频变成 AI 能读的输入

    claude-video:让 Claude 真正“看懂”视频的 /watch 技能,6.4K Stars 把视频变成 AI 能读的输入

    📌 项目简介

    claude-video 是一个让 Claude(以及 Codex、Cursor、Gemini CLI 等 50+ AI 编程工具)真正”看懂”视频的开源 Agent Skill。它的核心理念只有一句话:Claude 能读网页、能读 PDF、能读代码仓库,但默认它看不了视频——而 claude-video 把”看视频”这件事补上了。你丢给它一个 YouTube 链接或本地视频,它自动下载、抽帧、转写音频,再把画面帧 + 时间戳字幕一起喂给大模型,让 AI 基于真实视听觉内容来回答,而不是靠标题瞎猜。

    🛠 安装要求和过程

    环境要求:

    • Python 3.10+(核心脚本 watch.py / download.py / frames.py / transcribe.py 均为 Python 实现)
    • yt-dlp:负责从 YouTube、Loom、TikTok、X、Instagram 等站点下载视频(首次运行 macOS 上自动 brew 安装,Linux/Windows 会打印安装命令)
    • ffmpeg:负责抽帧、音频提取(同上,首次运行自动引导安装)
    • 带字幕的视频完全免费;无字幕时才需要 Whisper API Key(Groq whisper-large-v3 或 OpenAI whisper-1

    快速安装(三选一):

    方式一 · Claude Code(推荐):

    /plugin marketplace add bradautomates/claude-video
    /plugin install watch@claude-video

    方式二 · 任意 Agent Skills 宿主(Codex / Cursor / Copilot / Gemini CLI 等 50+ 工具):

    npx skills add bradautomates/claude-video -g

    方式三 · 手动 / 开发:

    git clone https://github.com/bradautomates/claude-video.git
    ln -s "$(pwd)/claude-video/skills/watch" ~/.claude/skills/watch
    # 或 ~/.codex/skills/watch

    首次运行会调用 scripts/setup.py --check 引导安装依赖,并在 ~/.config/watch/.env 中生成 GROQ_API_KEY / OPENAI_API_KEY 占位配置。

    ⚡ 核心功能

    1. 多源视频获取:支持 URL(yt-dlp 兼容的几乎所有视频站点)或本地路径(.mp4/.mov/.mkv/.webm),一条命令即可接入。
    2. 智能帧提取:用 ffmpeg 按细节模式抽帧——efficient(关键帧,约 0.5s)到 token-burner(场景切换检测);内置帧去重(默认开启,丢弃近重复帧)与自动 fps / token 预算控制。
    3. 双通道转写:优先用 yt-dlp 提取原生字幕(免费);无字幕时回退 Whisper API,并支持 >25MB 自动分块,确保长视频也能完整转写。
    4. 多模态交给大模型:脚本输出带 t=MM:SS 标记的帧路径 + 时间戳转写,Claude 并行 Read 图像,基于真实画面与声音作答。
    5. 细节模式可调节:--detail transcript|efficient|balanced|token-burner 权衡速度与 token 成本;支持 --start/--end 聚焦片段、--timestamps 指定时刻、--no-whisper 等精细控制。

    🎯 典型使用场景

    • 拆解爆款内容:把竞品发布会、广告片、干货视频丢给它,让它分析钩子结构、叙事节奏、真正的新功能,远快于 2x 倍速硬看。
    • 看录屏诊断 Bug:前端同学把屏幕录制喂给它,它能定位”出错的那一帧”,描述现象与可能原因,把视频变成可调试的输入。
    • 视频转结构化笔记:把一整个播放列表逐条摘要,自动构建可搜索的知识库;或剥离更新视频里的 hype,只提取”真正变了什么”。

    💡 推荐理由(个人使用心得)

    这是个”小而准”的工具,解决的痛点非常真实——我们天天让 AI 读文档读代码,但遇到一个视频链接就瞬间退化成”靠标题猜”。claude-video 最漂亮的设计是零配置起步:有字幕就白嫖字幕,没字幕才花一点点 Whisper 钱;帧去重 + 预算控制又避免了”把整个视频塞进上下文”的 token 爆炸。它本质上是在给 LLM 补上一双眼睛,而且是以”可复用技能包”的形式存在,Claude Code / Cursor / Codex 通吃。如果你经常需要让 AI 处理视频内容,这个 6.4K Star、MIT 协议、纯 Python 的小项目,值得一键装进你的工具箱。

    🔗 下载地址

    • GitHub:github.com/bradautomates/claude-video
    • 安装(Claude Code):/plugin marketplace add bradautomates/claude-video/plugin install watch@claude-video
    • 许可证:MIT(可自由商用、修改、分发)
  • Google Photos 上线「Video Remix」:你手机里那段糊视频,几秒钟被 AI 改头换面

    Google Photos Video Remix AI 视频重混功能示意图
    Google Photos 的 Video Remix 把 AI 视频编辑做成了相册里的一键按钮(配图由 AI 生成)

    你手机相册里那些拍得一般、光线很暗、背景很乱的视频,以前基本就躺在那儿吃灰了。现在 Google 想让你点一下,AI 把它们”重混”一遍。7 月 8 日,Photos 里上线了一个叫 Video Remix 的功能,它跑在 Gemini Omni 这套模型上,干的事很具体。

    几秒钟能改头换面

    给暗乎乎的片段补光(Google 管这叫 cinematic relighting),把平淡的背景换成别的场景,或者给整段视频套上水彩、速写本这类艺术风格。入口藏在 Photos 的 “Create” 标签页里,Google 把它定义成你的”创意中枢”。操作逻辑很简单:挑一段视频,选个效果,等几秒,出来一份被重新打过光的版本。

    这个功能不是给所有人开的。目前只面向 Google AI Plus、Pro、Ultra 这几个订阅档位的用户灰度推送,也不是全球同时铺开。换句话说,你如果还用着免费的 Photos,暂时看不到这个按钮。

    Google 自己的说明里反复强调,用 Video Remix 生成的视频会带上 SynthID 的隐形水印,标明”这是 AI 动手过的”。

    三个月塞了三个,相册快成工具箱了

    有意思的是,这已经不是 Google Photos 今年第一次往相册里塞 AI 生成类工具了。翻一翻时间线,短短三个月里它已经堆了至少三个功能相近的东西。用户打开相册,本意是找张旧照片,结果迎面撞上一堆”AI 帮你重做”的入口。功能多是好事,但当每个入口都在暗示”你原来的素材不够好、让我替你重造一遍”,体验就开始变味了。

    水印这事儿,真挡得住吗

    再说 SynthID。Google 一直把这套隐形水印当成”负责任 AI”的门面,意思是 AI 生成的内容能被溯源、被识别。理想很丰满:以后看到一段以假乱真的视频,系统能告诉你”这是 AI 改的”。但现实骨感——水印只对”在 Google 生态内生成”的内容有效。你导出视频、转码一遍、或者用别的工具再处理,水印就可能掉了。

    • 给暗光视频补光、换背景,门槛低到几乎零成本
    • 艺术风格迁移让”看起来像那么回事”变得特别容易
    • SynthID 只对原生生成内容生效,二次传播基本失效

    我倒不是说 Google 存了什么坏心。把专业级的视频调色、风格化能力下放到每个人的相册,确实是技术进步。但当一个日活几十亿的产品,把”AI 改写现实”做成一键按钮,它承担的就不只是”好玩”的责任了。水印是第一步,但远远不够。


  • FunClip:阿里出品的 AI 视频剪辑神器,语音识别 + LLM 智能裁剪,5.9K Stars 让视频剪辑自动化

    FunClip:阿里出品的 AI 视频剪辑神器,语音识别 + LLM 智能裁剪,5.9K Stars 让视频剪辑自动化

    FunClip 界面

    做自媒体的朋友一定有过这样的痛苦:一段两小时的直播回放,只想剪出几句高光金句,却要在时间轴上反复拖拽、听写、对齐字幕。阿里通义语音实验室开源的 FunClip,用语音识别 + 大语言模型把这件事彻底自动化了——上传视频,复制你想保留的文字,点一下,片段就出来了。

    📌 项目简介

    FunClip 是一个完全开源、可本地部署的自动化视频剪辑工具,基于阿里巴巴通义语音实验室开源的 FunASR Paraformer 系列模型对视频做语音识别,用户自由选择识别文本片段或说话人,一键生成对应视频片段,并提供本地 Gradio Web 界面,支持 LLM 辅助智能剪辑。

    ⚙️ 安装要求与过程

    环境要求:仅需 Python 环境(推荐 Python 3.8+);如需内嵌字幕剪辑,需额外安装 ffmpeg 与 imagemagick 及中文字体文件。

    快速安装:

    # 克隆仓库
    git clone https://github.com/modelscope/FunClip.git
    cd FunClip
    # 安装依赖
    pip install -r ./requirements.txt
    
    # 启动本地 Gradio 服务(默认中文 Paraformer)
    python funclip/launch.py
    # 可选:-m fun-asr-nano (31语种) | -m sensevoice (情绪+事件) | -l en (英文)
    #       -p 端口号 | -s True (公网访问)

    启动后访问 localhost:7860 即可使用 Web 界面:上传视频 → 复制需剪辑文本到 “Text to Clip” → 调整字幕 → 点击 “Clip” 或 “Clip and Generate Subtitles”。

    ✨ 核心功能

    • 工业级中文 ASR(Paraformer-Large):阿里开源的顶尖中文语音识别模型,Modelscope 下载超 1300 万次,可精准预测时间戳,自动返回全视频与目标段 SRT 字幕。
    • 热词定制(SeACo-Paraformer):在识别过程中指定实体词、人名等热词,显著提升专有名词识别准确率。
    • 说话人分离(CAM++):集成说话人识别模型,可自动识别 speaker ID,一键剪出特定人物的全部发言片段。
    • LLM 智能剪辑:支持 qwen、GPT 等大模型,结合视频字幕自动推理出高光片段的时间戳;还可选 TwelveLabs Pegasus 视频理解模型,直接“看懂”画面而非仅依赖字幕。
    • 多模型与多语言:2026 年新增 Fun-ASR-Nano(31 种语言高精度)、SenseVoice(情绪识别 + 音频事件检测),并支持英文视频识别剪辑。

    🎬 典型使用场景

    • 自媒体长视频提取金句:把一场发布会、一次访谈原片丢进去,复制想保留的台词,FunClip 自动精准裁出对应时段并生成字幕,做短视频切片效率翻倍。
    • 会议 / 演讲按说话人剪辑:开启说话人分离后,直接剪出某位嘉宾的全部发言,用于整理观点、制作人物集锦,无需手动对照音轨。
    • 视频自动加字幕:识别后一键生成全片 SRT,并可内嵌硬字幕导出,省去逐句听写的繁琐,特别适合教程、纪录片类内容。

    💡 推荐理由

    我自己的使用感受是:FunClip 把“语音识别 → 文本选择 → 视频裁剪”这条链路做到了极简。它不像一些云端剪辑工具那样把数据传上去,而是完全本地运行,隐私可控;Gradio 界面几乎零学习成本,命令行模式又能轻松写进自动化流水线。对做内容创作、知识整理的人来说,它是那种“装好就天天想用”的效率利器。尤其 LLM 智能剪辑的加入,让“我要这段关于乡村振兴的发言”变成一句自然语言指令就能完成。

    🔗 下载地址

    许可协议:MIT(可自由商用与修改)

  • video-use:用 Claude Code 一句话剪辑视频,browser-use 团队出品,15.9K Stars 让 AI 成为你的剪辑师

    video-use:用 Claude Code 一句话剪辑视频,browser-use 团队出品,15.9K Stars 让 AI 成为你的剪辑师

    video-use

    把原始素材丢进文件夹,跟 Claude Code 聊两句,拿回成片 final.mp4 —— 这就是 video-use15.9K+ Stars,MIT 许可,100% 开源)。它由爆火的 browser-use 团队打造,把”对话式 AI 编程”的思路搬进了视频剪辑:不再和轨道、关键帧死磕,而是用自然语言描述你要的成片。


    🚀 项目简介

    video-use 是一个对话式视频编辑「技能(skill)」,让 LLM 通过阅读而非观看视频来完成剪辑。它把任意原始素材(口播、混剪、教程、旅行、采访)交给 Claude Code / Codex / Hermes 等任意带 shell 的 AI 编程智能体,自动产出可直接发布的成片,全程无需预设模板或复杂菜单。核心思想和 browser-use 一脉相承:给 LLM 一份结构化的「视频说明书」,而不是一堆看不懂的逐帧截图。


    ⚙️ 安装要求和过程

    环境要求

    • Python 3.12+(依赖 requests / librosa / matplotlib / pillow / numpy)
    • uv(推荐)或 pip 管理依赖
    • ffmpeg必需,渲染引擎)
    • yt-dlp(可选,用于下载在线素材)
    • ElevenLabs API Key(用于 Scribe 转写,按量计费)

    方式一:对话式安装(推荐)

    把官方 setup prompt 粘贴给 Claude Code / Codex / Hermes 等任意智能体,它会自动完成 clone、依赖安装、skill 注册,并在需要时提示你粘贴 ElevenLabs Key——你只需说”准备好了”等它通知。

    方式二:手动安装

    git clone https://github.com/browser-use/video-use ~/Developer/video-use
    ln -sfn ~/Developer/video-use ~/.claude/skills/video-use   # Claude Code
    # ln -sfn ~/Developer/video-use ~/.codex/skills/video-use  # Codex
    
    cd ~/Developer/video-use
    uv sync                       # 或 pip install -e .
    brew install ffmpeg           # 必需
    brew install yt-dlp           # 可选
    
    cp .env.example .env          # 填入 ELEVENLABS_API_KEY=...

    安装完成后,进入任意素材文件夹运行智能体,说一句”edit these into a launch video”,它就会盘点素材、给出剪辑策略、等你确认,再把 edit/final.mp4 生成在素材目录旁。


    💡 核心功能

    • 🧹 剔除填充词与死寂:自动删掉 umm / uh、假开场和片段间的空白,节奏立刻紧凑。
    • 🎨 自动调色:每段独立调色——暖色电影感 / 中性 punch / 任意自定义 ffmpeg 链,风格统一可控。
    • 🔇 无爆音剪辑:每个切点做 30ms 音频淡入淡出,彻底告别”咔哒”爆音。
    • 📝 烧录字幕:默认 2 词大写块样式,颜色、字体、排版完全可定制。
    • ✨ 动画叠层:通过 HyperFrames / Remotion / Manim / PIL 生成动画,每个动画派发并行子代理,互不阻塞。
    • 📖 「阅读」而非「观看」:LLM 只读转写文本 + 按需时间轴视图(约 12KB 文本 + 少量 PNG),而非逐帧分析 4500 万 token 噪声——这正是它又快又准的关键。
    • 🔁 自评估闭环:渲染后在每个切点自检画面跳变 / 音频爆音 / 字幕遮挡,最多自动重渲染 3 次,全部通过后你才看到预览。

    📦 典型使用场景

    🎤 场景一:口播 / 教程视频快速成片

    录完一镜到底的口播,丢给 video-use:它会自动剔除 umm、加好字幕、统一调色、消除爆音,几分钟产出可直接上传的成片,省掉 PR 里最枯燥的”听音修剪”。

    🎬 场景二:旅行 / 采访混剪

    多段原始素材自动编排成叙事线,配合 Remotion / Manim 生成的动画叠层,做出有质感的混剪,适合 Vlog、产品发布片、活动回顾。

    🤖 场景三:常驻远程剪辑

    通过 Browser Use Box 跑在自有 VPS 或 Telegram 上,随时丢素材、随时收成片,把剪辑变成一条常驻的消息流水线。


    ⭐ 推荐理由

    我特别欣赏它”给 LLM 一份视频说明书”的设计哲学——和 browser-use 把网页 DOM 喂给模型如出一辙,但对象换成了视频。传统”AI 剪辑”要么逐帧灌噪声、要么套预设模板;video-use 选择让模型读转写、按需看图,既省 token 又保精度,自评估闭环还兜住了质量下限。

    100% 开源、MIT 许可,能挂在任何 AI 编程智能体上,本地文件零上传(只有转写调用 ElevenLabs)。如果你已经用 Claude Code 写代码,顺手把它变成分身剪辑师,几乎零学习成本。唯一门槛是 ElevenLabs 转写按量计费,但换来的是真正”对话即剪辑”的体验。


    📧 下载地址

  • 字节的Seedance,正在悄悄“占领”好莱坞

    字节Seedance进入好莱坞
    从被点名批评到被拿进片场,Seedance只用了不到半年

    几个月前,好莱坞还把字节的Seedance当成“危险样本”。2月的时候,Seedance 2.0生成了一段布拉德·皮特和汤姆·克鲁斯在屋顶拳拳到肉的打斗视频,逼真到让整个行业紧张,美国电影协会MPA直接点名,说这类工具可能侵犯版权和明星肖像权,演员工会SAG-AFTRA也把矛头对准了AI生成演员形象的问题。

    结果才四个月,风向就变了。据《洛杉矶时报》报道,Seedance正在悄悄钻进洛杉矶的AI创作者圈、独立电影项目,以及好莱坞周边的工作流里。从被点名批评到被拿进片场,字节只用了不到半年。

    两部作品,已经真刀真枪地拍起来了

    最典型的例子是《Hell Grind》(地狱磨坊),一部95分钟的长片,由Higgisfield AI出品,主要用Seedance 2.0制作,一个15人的团队两周就搞定了。还有一部AI奇幻剧集《骸骨编年史》,制作人Kavan Cardoza同样基于Seedance打造,每月在YouTube上更新一集,单集平均观看量300万,Cardoza本人也已经攒了50万粉丝。

    这些片子的人物神态、光影落点、宏大背景,细腻到让人以为是《权游》那种大制作。但事实上,它们都来自好莱坞各路独立电影人的电脑,是Seedance一个一个镜头生成出来的。

    便宜,是“真香”的根本原因

    好莱坞为什么突然不抵触了?说到底,还是好用、爱用。

    根据Artificial Analysis的数据,Seedance生成“视频加音频”的成本大约是每分钟9美元,而Google的Veo要每分钟24美元。到了实际的AI片场,流程跟传统片场完全不一样。导演可以先写出详细大纲和角色设定,再用prompt生成画面,当天出样片、当天看效果、当天调整。

    Cardoza说得很直白:他请不起布拉德·皮特,因为那位明星出演他的电影要花500万、1000万甚至2000万美元。但有了AI之后,一切皆有可能。

    《鬼影实录》的制片人Steven Schneider今年5月宣布了一部混合AI恐怖片《Terrarium》,导演Jason Zada说会大量使用Seedance。他算了笔账:生成15秒高清画面的成本大概只要5美元。对独立电影人来说,过去许多必须花大钱试错的环节,现在可以先在桌面上反复跑出来。

    字节在好莱坞的“地面战”

    Seedance并没有先去敲Disney、Warner、Netflix这些大厂的大门,相反,它的目标直指独立电影人、AI filmmaker、低成本类型片创作者,以及那些被预算和周期卡住的人。字节今年春天在美国推出Seedance后,就开始主动接触电影人、独立艺术家和娱乐业高管。戛纳电影节期间,Seedance团队出现在周边行业活动里;5月,它的产品线Dreamina也登上了Amazon MGM Studios举办的“AI on the Lot”大会。

    有制作人私下说,业内很多工作室其实没批准使用Seedance,但大家心照不宣地都在用,有点像潜规则。

    中美视频模型的正面较量

    把视野拉到整个AI视频赛道,事情正在变得白热化。美国这边有Google的Veo、Runway和Luma,OpenAI的Sora曾经被视为最强王炸,如今视频工具已经停止运营,原本属于它的想象空间被其他玩家迅速填上。而Seedance正在快速逼近,在一些电影人眼里,它已经成了当下最强的视频模型。

    印度媒体公司JioStar的高级副总裁Stephan Vladimir Bugaj认为,Seedance崛起的关键在于它专注取悦电影制作人,做出更有电影质感的画面,还引入了基于时间轴的prompt能力,让制作人能选具体时刻微调。Zada也给Seedance开出了高达200万美元的特殊访问权限报价。

    按照State of Generative AI Media报告,媒体公司在AI上的支出预计会从2024年的26亿美元涨到2029年的125亿美元。蛋糕在变大,围绕AI视频工具的争夺只会更激烈。至于好莱坞的制作人,Zada说了一句大实话:我们不讲究忠诚,只要是最好的,我们就会用。


  • Google NotebookLM 现在能把你的研究变成60秒短视频

    Google NotebookLM 现在能把你的研究变成60秒短视频

    Google 的 NotebookLM 前几天上线了一个新功能——把你塞进去的研究资料,直接变成一段 60 秒的竖屏短视频。就是那种你在 TikTok 上刷到的格式,有画面、有旁白,一口气把重点讲完。

    NotebookLM AI视频生成
    NotebookLM 现在能生成 TikTok 风格的短视频摘要

    这个功能目前向 Google AI Ultra 和 Pro 订阅用户开放。你把资料上传到 NotebookLM,它就能基于这些内容生成一段 60 秒的竖屏视频,配上了 AI 生成的画面和自动旁白。

    Google 分享了一个例子:用澳大利亚历史上那场”鸸鹋战争”做演示。AI 用纸剪风格的图像,配上旁白,把这段荒诞历史讲得挺像回事。

    怎么用

    操作不复杂。在 NotebookLM 的网页端或 App 里打开一个笔记本,点右侧”Studio”栏里的”Video”,选”Short”,然后告诉它你想让视频聚焦哪个主题(也可以让它自己决定),点”Generate”就行。

    目前只支持英文输出,中文估计还得等一阵。Google 说免费用户”很快”也能用上,但没给具体时间。


    不止是视频

    NotebookLM 这两年一直在往”多模态”方向走。之前已经能生成 AI 播客对话、电影感的内容概览视频,还有各种视觉解释卡片。这次加了个短视频格式,显然是看准了大家现在习惯刷短视频、没耐心读长文的趋势。

    不过话说回来,60 秒能讲清楚多少东西,得看你喂给它的材料质量。垃圾进、垃圾出,这条规律在哪儿都适用。