标签: AI视频

  • FunClip:阿里出品的 AI 视频剪辑神器,语音识别 + LLM 智能裁剪,5.9K Stars 让视频剪辑自动化

    FunClip:阿里出品的 AI 视频剪辑神器,语音识别 + LLM 智能裁剪,5.9K Stars 让视频剪辑自动化

    FunClip 界面

    做自媒体的朋友一定有过这样的痛苦:一段两小时的直播回放,只想剪出几句高光金句,却要在时间轴上反复拖拽、听写、对齐字幕。阿里通义语音实验室开源的 FunClip,用语音识别 + 大语言模型把这件事彻底自动化了——上传视频,复制你想保留的文字,点一下,片段就出来了。

    📌 项目简介

    FunClip 是一个完全开源、可本地部署的自动化视频剪辑工具,基于阿里巴巴通义语音实验室开源的 FunASR Paraformer 系列模型对视频做语音识别,用户自由选择识别文本片段或说话人,一键生成对应视频片段,并提供本地 Gradio Web 界面,支持 LLM 辅助智能剪辑。

    ⚙️ 安装要求与过程

    环境要求:仅需 Python 环境(推荐 Python 3.8+);如需内嵌字幕剪辑,需额外安装 ffmpeg 与 imagemagick 及中文字体文件。

    快速安装:

    # 克隆仓库
    git clone https://github.com/modelscope/FunClip.git
    cd FunClip
    # 安装依赖
    pip install -r ./requirements.txt
    
    # 启动本地 Gradio 服务(默认中文 Paraformer)
    python funclip/launch.py
    # 可选:-m fun-asr-nano (31语种) | -m sensevoice (情绪+事件) | -l en (英文)
    #       -p 端口号 | -s True (公网访问)

    启动后访问 localhost:7860 即可使用 Web 界面:上传视频 → 复制需剪辑文本到 “Text to Clip” → 调整字幕 → 点击 “Clip” 或 “Clip and Generate Subtitles”。

    ✨ 核心功能

    • 工业级中文 ASR(Paraformer-Large):阿里开源的顶尖中文语音识别模型,Modelscope 下载超 1300 万次,可精准预测时间戳,自动返回全视频与目标段 SRT 字幕。
    • 热词定制(SeACo-Paraformer):在识别过程中指定实体词、人名等热词,显著提升专有名词识别准确率。
    • 说话人分离(CAM++):集成说话人识别模型,可自动识别 speaker ID,一键剪出特定人物的全部发言片段。
    • LLM 智能剪辑:支持 qwen、GPT 等大模型,结合视频字幕自动推理出高光片段的时间戳;还可选 TwelveLabs Pegasus 视频理解模型,直接“看懂”画面而非仅依赖字幕。
    • 多模型与多语言:2026 年新增 Fun-ASR-Nano(31 种语言高精度)、SenseVoice(情绪识别 + 音频事件检测),并支持英文视频识别剪辑。

    🎬 典型使用场景

    • 自媒体长视频提取金句:把一场发布会、一次访谈原片丢进去,复制想保留的台词,FunClip 自动精准裁出对应时段并生成字幕,做短视频切片效率翻倍。
    • 会议 / 演讲按说话人剪辑:开启说话人分离后,直接剪出某位嘉宾的全部发言,用于整理观点、制作人物集锦,无需手动对照音轨。
    • 视频自动加字幕:识别后一键生成全片 SRT,并可内嵌硬字幕导出,省去逐句听写的繁琐,特别适合教程、纪录片类内容。

    💡 推荐理由

    我自己的使用感受是:FunClip 把“语音识别 → 文本选择 → 视频裁剪”这条链路做到了极简。它不像一些云端剪辑工具那样把数据传上去,而是完全本地运行,隐私可控;Gradio 界面几乎零学习成本,命令行模式又能轻松写进自动化流水线。对做内容创作、知识整理的人来说,它是那种“装好就天天想用”的效率利器。尤其 LLM 智能剪辑的加入,让“我要这段关于乡村振兴的发言”变成一句自然语言指令就能完成。

    🔗 下载地址

    许可协议:MIT(可自由商用与修改)

  • video-use:用 Claude Code 一句话剪辑视频,browser-use 团队出品,15.9K Stars 让 AI 成为你的剪辑师

    video-use:用 Claude Code 一句话剪辑视频,browser-use 团队出品,15.9K Stars 让 AI 成为你的剪辑师

    video-use

    把原始素材丢进文件夹,跟 Claude Code 聊两句,拿回成片 final.mp4 —— 这就是 video-use15.9K+ Stars,MIT 许可,100% 开源)。它由爆火的 browser-use 团队打造,把”对话式 AI 编程”的思路搬进了视频剪辑:不再和轨道、关键帧死磕,而是用自然语言描述你要的成片。


    🚀 项目简介

    video-use 是一个对话式视频编辑「技能(skill)」,让 LLM 通过阅读而非观看视频来完成剪辑。它把任意原始素材(口播、混剪、教程、旅行、采访)交给 Claude Code / Codex / Hermes 等任意带 shell 的 AI 编程智能体,自动产出可直接发布的成片,全程无需预设模板或复杂菜单。核心思想和 browser-use 一脉相承:给 LLM 一份结构化的「视频说明书」,而不是一堆看不懂的逐帧截图。


    ⚙️ 安装要求和过程

    环境要求

    • Python 3.12+(依赖 requests / librosa / matplotlib / pillow / numpy)
    • uv(推荐)或 pip 管理依赖
    • ffmpeg必需,渲染引擎)
    • yt-dlp(可选,用于下载在线素材)
    • ElevenLabs API Key(用于 Scribe 转写,按量计费)

    方式一:对话式安装(推荐)

    把官方 setup prompt 粘贴给 Claude Code / Codex / Hermes 等任意智能体,它会自动完成 clone、依赖安装、skill 注册,并在需要时提示你粘贴 ElevenLabs Key——你只需说”准备好了”等它通知。

    方式二:手动安装

    git clone https://github.com/browser-use/video-use ~/Developer/video-use
    ln -sfn ~/Developer/video-use ~/.claude/skills/video-use   # Claude Code
    # ln -sfn ~/Developer/video-use ~/.codex/skills/video-use  # Codex
    
    cd ~/Developer/video-use
    uv sync                       # 或 pip install -e .
    brew install ffmpeg           # 必需
    brew install yt-dlp           # 可选
    
    cp .env.example .env          # 填入 ELEVENLABS_API_KEY=...

    安装完成后,进入任意素材文件夹运行智能体,说一句”edit these into a launch video”,它就会盘点素材、给出剪辑策略、等你确认,再把 edit/final.mp4 生成在素材目录旁。


    💡 核心功能

    • 🧹 剔除填充词与死寂:自动删掉 umm / uh、假开场和片段间的空白,节奏立刻紧凑。
    • 🎨 自动调色:每段独立调色——暖色电影感 / 中性 punch / 任意自定义 ffmpeg 链,风格统一可控。
    • 🔇 无爆音剪辑:每个切点做 30ms 音频淡入淡出,彻底告别”咔哒”爆音。
    • 📝 烧录字幕:默认 2 词大写块样式,颜色、字体、排版完全可定制。
    • ✨ 动画叠层:通过 HyperFrames / Remotion / Manim / PIL 生成动画,每个动画派发并行子代理,互不阻塞。
    • 📖 「阅读」而非「观看」:LLM 只读转写文本 + 按需时间轴视图(约 12KB 文本 + 少量 PNG),而非逐帧分析 4500 万 token 噪声——这正是它又快又准的关键。
    • 🔁 自评估闭环:渲染后在每个切点自检画面跳变 / 音频爆音 / 字幕遮挡,最多自动重渲染 3 次,全部通过后你才看到预览。

    📦 典型使用场景

    🎤 场景一:口播 / 教程视频快速成片

    录完一镜到底的口播,丢给 video-use:它会自动剔除 umm、加好字幕、统一调色、消除爆音,几分钟产出可直接上传的成片,省掉 PR 里最枯燥的”听音修剪”。

    🎬 场景二:旅行 / 采访混剪

    多段原始素材自动编排成叙事线,配合 Remotion / Manim 生成的动画叠层,做出有质感的混剪,适合 Vlog、产品发布片、活动回顾。

    🤖 场景三:常驻远程剪辑

    通过 Browser Use Box 跑在自有 VPS 或 Telegram 上,随时丢素材、随时收成片,把剪辑变成一条常驻的消息流水线。


    ⭐ 推荐理由

    我特别欣赏它”给 LLM 一份视频说明书”的设计哲学——和 browser-use 把网页 DOM 喂给模型如出一辙,但对象换成了视频。传统”AI 剪辑”要么逐帧灌噪声、要么套预设模板;video-use 选择让模型读转写、按需看图,既省 token 又保精度,自评估闭环还兜住了质量下限。

    100% 开源、MIT 许可,能挂在任何 AI 编程智能体上,本地文件零上传(只有转写调用 ElevenLabs)。如果你已经用 Claude Code 写代码,顺手把它变成分身剪辑师,几乎零学习成本。唯一门槛是 ElevenLabs 转写按量计费,但换来的是真正”对话即剪辑”的体验。


    📧 下载地址

  • 字节的Seedance,正在悄悄“占领”好莱坞

    字节Seedance进入好莱坞
    从被点名批评到被拿进片场,Seedance只用了不到半年

    几个月前,好莱坞还把字节的Seedance当成“危险样本”。2月的时候,Seedance 2.0生成了一段布拉德·皮特和汤姆·克鲁斯在屋顶拳拳到肉的打斗视频,逼真到让整个行业紧张,美国电影协会MPA直接点名,说这类工具可能侵犯版权和明星肖像权,演员工会SAG-AFTRA也把矛头对准了AI生成演员形象的问题。

    结果才四个月,风向就变了。据《洛杉矶时报》报道,Seedance正在悄悄钻进洛杉矶的AI创作者圈、独立电影项目,以及好莱坞周边的工作流里。从被点名批评到被拿进片场,字节只用了不到半年。

    两部作品,已经真刀真枪地拍起来了

    最典型的例子是《Hell Grind》(地狱磨坊),一部95分钟的长片,由Higgisfield AI出品,主要用Seedance 2.0制作,一个15人的团队两周就搞定了。还有一部AI奇幻剧集《骸骨编年史》,制作人Kavan Cardoza同样基于Seedance打造,每月在YouTube上更新一集,单集平均观看量300万,Cardoza本人也已经攒了50万粉丝。

    这些片子的人物神态、光影落点、宏大背景,细腻到让人以为是《权游》那种大制作。但事实上,它们都来自好莱坞各路独立电影人的电脑,是Seedance一个一个镜头生成出来的。

    便宜,是“真香”的根本原因

    好莱坞为什么突然不抵触了?说到底,还是好用、爱用。

    根据Artificial Analysis的数据,Seedance生成“视频加音频”的成本大约是每分钟9美元,而Google的Veo要每分钟24美元。到了实际的AI片场,流程跟传统片场完全不一样。导演可以先写出详细大纲和角色设定,再用prompt生成画面,当天出样片、当天看效果、当天调整。

    Cardoza说得很直白:他请不起布拉德·皮特,因为那位明星出演他的电影要花500万、1000万甚至2000万美元。但有了AI之后,一切皆有可能。

    《鬼影实录》的制片人Steven Schneider今年5月宣布了一部混合AI恐怖片《Terrarium》,导演Jason Zada说会大量使用Seedance。他算了笔账:生成15秒高清画面的成本大概只要5美元。对独立电影人来说,过去许多必须花大钱试错的环节,现在可以先在桌面上反复跑出来。

    字节在好莱坞的“地面战”

    Seedance并没有先去敲Disney、Warner、Netflix这些大厂的大门,相反,它的目标直指独立电影人、AI filmmaker、低成本类型片创作者,以及那些被预算和周期卡住的人。字节今年春天在美国推出Seedance后,就开始主动接触电影人、独立艺术家和娱乐业高管。戛纳电影节期间,Seedance团队出现在周边行业活动里;5月,它的产品线Dreamina也登上了Amazon MGM Studios举办的“AI on the Lot”大会。

    有制作人私下说,业内很多工作室其实没批准使用Seedance,但大家心照不宣地都在用,有点像潜规则。

    中美视频模型的正面较量

    把视野拉到整个AI视频赛道,事情正在变得白热化。美国这边有Google的Veo、Runway和Luma,OpenAI的Sora曾经被视为最强王炸,如今视频工具已经停止运营,原本属于它的想象空间被其他玩家迅速填上。而Seedance正在快速逼近,在一些电影人眼里,它已经成了当下最强的视频模型。

    印度媒体公司JioStar的高级副总裁Stephan Vladimir Bugaj认为,Seedance崛起的关键在于它专注取悦电影制作人,做出更有电影质感的画面,还引入了基于时间轴的prompt能力,让制作人能选具体时刻微调。Zada也给Seedance开出了高达200万美元的特殊访问权限报价。

    按照State of Generative AI Media报告,媒体公司在AI上的支出预计会从2024年的26亿美元涨到2029年的125亿美元。蛋糕在变大,围绕AI视频工具的争夺只会更激烈。至于好莱坞的制作人,Zada说了一句大实话:我们不讲究忠诚,只要是最好的,我们就会用。


  • Google NotebookLM 现在能把你的研究变成60秒短视频

    Google NotebookLM 现在能把你的研究变成60秒短视频

    Google 的 NotebookLM 前几天上线了一个新功能——把你塞进去的研究资料,直接变成一段 60 秒的竖屏短视频。就是那种你在 TikTok 上刷到的格式,有画面、有旁白,一口气把重点讲完。

    NotebookLM AI视频生成
    NotebookLM 现在能生成 TikTok 风格的短视频摘要

    这个功能目前向 Google AI Ultra 和 Pro 订阅用户开放。你把资料上传到 NotebookLM,它就能基于这些内容生成一段 60 秒的竖屏视频,配上了 AI 生成的画面和自动旁白。

    Google 分享了一个例子:用澳大利亚历史上那场”鸸鹋战争”做演示。AI 用纸剪风格的图像,配上旁白,把这段荒诞历史讲得挺像回事。

    怎么用

    操作不复杂。在 NotebookLM 的网页端或 App 里打开一个笔记本,点右侧”Studio”栏里的”Video”,选”Short”,然后告诉它你想让视频聚焦哪个主题(也可以让它自己决定),点”Generate”就行。

    目前只支持英文输出,中文估计还得等一阵。Google 说免费用户”很快”也能用上,但没给具体时间。


    不止是视频

    NotebookLM 这两年一直在往”多模态”方向走。之前已经能生成 AI 播客对话、电影感的内容概览视频,还有各种视觉解释卡片。这次加了个短视频格式,显然是看准了大家现在习惯刷短视频、没耐心读长文的趋势。

    不过话说回来,60 秒能讲清楚多少东西,得看你喂给它的材料质量。垃圾进、垃圾出,这条规律在哪儿都适用。

  • MoneyPrinterTurbo:AI 自动生成短视频,93K+ Stars 让创作零门槛

    MoneyPrinterTurbo:AI 自动生成短视频,93K+ Stars 让创作零门槛

    🎬 MoneyPrinterTurbo:AI 自动生成短视频,93K+ Stars 让创作零门槛

    基于 AI 大模型的短视频自动生成工具|支持中英文|一键跨平台发布

    93.1K+
    ⭐ GitHub Stars
    Python
    💻 主要语言
    MIT
    📄 开源许可
    35K+
    📈 本月新增

    📌 项目简介

    MoneyPrinterTurbo 是一款基于 AI 大模型的短视频自动生成工具,由开发者 harry0703 创建并维护。只需提供一个视频主题或关键词,系统即可全自动完成文案生成、素材匹配、字幕合成、背景音乐搭配,最终输出高清短视频(支持竖屏 9:16 和横屏 16:9)。

    项目在 GitHub 上已获得 93,118 Stars,是本月 GitHub 趋势榜 Python 类目第二名(新增 35,397 Stars),深受内容创作者和 AI 爱好者欢迎。

    🔧 安装要求和过程

    环境要求

    • Python 版本:3.11+(推荐,项目使用 uv 管理依赖)
    • 核心依赖:Streamlit(Web界面)、FastAPI(API服务)、MoviePy 2.x(视频处理)、ffmpeg
    • AI 服务:需配置至少一家 LLM 提供商 API Key(支持 15+ 家)
    • 素材服务:需配置 Pexels 或 Pixabay API Key(免费申请)

    快速安装(三种方式)

    方式一:Docker 部署(推荐)

    # 1. 安装 Docker Desktop(Windows 用户需先配置 WSL)
    # 2. 克隆项目
    git clone https://github.com/harry0703/MoneyPrinterTurbo.git
    cd MoneyPrinterTurbo

    # 3. 一键启动(自动拉取预构建镜像)
    docker compose -f docker-compose.release.yml up

    # 4. 访问
    # Web 界面:http://127.0.0.1:8501
    # API 文档:http://127.0.0.1:8080/docs

    方式二:本地手动部署

    # 1. 克隆项目
    git clone https://github.com/harry0703/MoneyPrinterTurbo.git
    cd MoneyPrinterTurbo

    # 2. 使用 uv 安装依赖(推荐)
    uv python install 3.11
    uv sync –frozen

    # 3. 配置 API Key
    cp config.example.toml config.toml
    # 编辑 config.toml,填入 pexels_api_keys 和 llm_provider 配置

    # 4. 启动 Web 界面
    uv run streamlit run ./webui/Main.py –server.showEmailPrompt=False

    # 5. 启动 API 服务(可选)
    uv run python main.py

    方式三:Windows 一键启动包

    GitHub Release 下载最新一键启动包,解压后先双击 update.bat 更新代码,再双击 start.bat 启动即可。

    ✨ 核心功能

    • AI 全自动文案生成:接入 15+ 家 LLM 服务商(OpenAI / DeepSeek / Kimi / 通义千问 / Gemini / Ollama 等),自动生成视频脚本,支持中英文双语。
    • 智能素材匹配:集成 Pexels、Pixabay、Coverr 三大无版权素材源,根据文案关键词自动匹配高清视频片段,也支持上传本地素材。
    • 多语音合成引擎:内置 Edge TTS(免费,无需 API Key)、Azure TTS V2、ElevenLabs TTS,支持 23+ 种语言,可实时试听效果。
    • 丰富字幕样式:支持自定义字体、位置、颜色、大小、描边效果,基于 Pillow 渲染(不再依赖 ImageMagick),字幕时间戳精确对齐。
    • 一键跨平台发布:生成完成后可自动上传至 TikTok、Instagram、YouTube Shorts(需 Upload-Post 账号),YouTube 发布自动标注”AI 生成内容”。

    🚀 典型使用场景

    场景一:知识科普短视频批量生产

    自媒体运营者需要每天发布 3-5 条科普短视频,但缺乏视频剪辑时间和素材。使用 MoneyPrinterTurbo,只需输入”量子计算入门””黑洞是什么”等主题,AI 自动生成文案并匹配宇宙、科技素材,10 分钟内完成 5 条视频生成,大幅降低内容生产成本。

    场景二:跨境电商产品宣传视频

    电商卖家需要为每款产品制作多语言宣传短视频。通过自定义文案 + 本地素材上传功能,批量生成中英双语产品介绍视频,配合一键跨平台发布功能,快速覆盖 TikTok、Instagram 等海外社媒渠道。

    场景三:本地 LLM 隐私保护场景

    对数据隐私有严格要求的企业用户,可配置 Ollama 本地 LLM 提供商,所有文案生成均在本地完成,无需将敏感信息发送至第三方 API,兼顾 AI 能力提升与数据安全合规。

    💡 推荐理由

    作为一个 AI 工具爱好者,我认为 MoneyPrinterTurbo 最打动人的地方在于它的「降维打击式」易用性

    • 零视频编辑基础也能用:传统视频制作需要掌握剪辑软件、素材版权、配音等多项技能,而 MoneyPrinterTurbo 把这些全部封装成一个 Web 界面,点几下鼠标就能出片。
    • AI 大模型生态友好:支持 Ollama 本地模型是一大亮点,意味着你可以在没有 API 费用的情况下无限生成文案,对个人创作者非常友好。
    • 开源且活跃:MIT 许可允许自由修改和商用,社区活跃(本月新增 35K+ Stars),Bug 修复和功能迭代速度快。
    • 不只是「玩具」:内置的批量生成、API 接口、跨平台发布等功能,已经让它具备了生产级工具的属性,而不只是一个 Demo。
    ⚠️ 使用提醒:AI 生成的视频内容请注意平台审核规则,YouTube 已要求标注”AI 生成内容”。另外,虽然素材来自无版权平台,但商业使用前建议再次确认素材许可协议。

    🛠️ 技术栈

    Python 3.11
    Streamlit
    FastAPI
    MoviePy 2.x
    ffmpeg
    Edge TTS
    Docker
    uv

    🤖 支持的 AI 模型

    MoneyPrinterTurbo 支持接入以下大模型服务(在 config.toml 中配置):

    # LLM 提供商列表(任选其一配置 API Key)
    OpenAI / AIHubMix / AIML API / EvoLink
    Moonshot(Kimi)/ Azure / gpt4free / one-api
    通义千问(Qwen)/ Google Gemini / DeepSeek
    MiniMax / 文心一言 / Pollinations / ModelScope
    Ollama(本地模型,无需 API Key)💡 推荐个人用户使用

    📥 下载地址

    📌 开源许可:MIT License,可自由使用、修改和分发,包括商业用途。
    🌟 项目热度:93,118 Stars | 本月新增 35,397 Stars | GitHub Python 趋势榜 Top 2
    💬 社区:Issues 和 PR 活跃,开发者响应及时。

  • Adobe把Topaz Labs收了,创意软件军备竞赛又升级了

    Adobe收购Topaz Labs AI创意工具概念图
    Adobe将把Topaz的AI图像视频增强模型集成到Firefly和Creative Cloud(图源:Adobe/Topaz Labs)

    Adobe周四宣布收购Topaz Labs,一家做了20多年图像和视频增强工具的公司。交易细节没披露,但Adobe说会把它并进创意业务板块。

    这个举动背后的逻辑不复杂:Adobe不想让用户在修图修视频的过程中跑到别家工具去。Topaz的产品正好补上Adobe在某些专业增强场景下的短板。

    一家”老”公司的新机会

    Topaz Labs成立已经超过20年,主打图像和视频的AI增强。这两年跑出来的两个核心产品是Astra(AI视频升频)和Wonder(图像修饰和增强)。去年,Topaz还拿了艾美奖,表彰它在视频技术上的贡献。

    更有意思的是他们最近搞的一个技术叫Neurostream,能让大型视频AI模型在消费级GPU上跑起来。这个方向对Adobe来说很有价值——Adobe一直在推”本地运行AI”的能力,Neurostream正好能对上。

    “Topaz Labs在优化大型复杂AI模型以在设备上直接运行方面有深厚积累,这个能力将让Adobe能够为客户提供更快速、更灵敏的体验。”——Adobe创意云产品营销VP Deepa Subramaniam

    Adobe的防守战

    Adobe这几年面临的压力不小。Canva从低端往上吃,Blackmagic Design(DaVinci Resolve的东家)在专业视频剪辑这块一直很能打。Adobe的策略是往所有产品里塞AI,同时把外部的好技术买进来、集成进来,让用户没有理由离开生态。

    Firefly是Adobe的AI品牌,已经集成到Photoshop、Premiere、Illustrator这些主力产品里。把Topaz的模型也融进去,Firefly在”画质增强”这个细分方向上的能力会明显补强。

    Adobe在公告里还说,Topaz的产品会继续作为独立服务在官网上提供。也就是说,现有Topaz用户暂时不用担心产品被”Adobe化”。

    交易时间表

    Adobe说这笔交易将在2026年下半年完成,还需要过监管审批这个关。考虑到两家公司的市场份额,这应该不是什么大问题。

    从更大的视角看,这笔收购是创意软件行业AI军备竞赛的一个缩影。每一家都在想办法让自己的AI更强、更全、更能留住用户。Topaz Labs作为一个在AI增强领域深耕20年的玩家,它的技术积累比它的名气要大得多。


    • Topaz Labs成立20+年,去年获艾美奖
    • 核心产品:Astra(视频升频)、Wonder(图像增强)
    • Neurostream技术可在消费级GPU上运行大型视频AI模型
    • Adobe将把Topaz模型集成到Firefly和Creative Cloud
    • 交易预计2026年下半年完成
  • OpenMontage:全球首个开源 AI 智能体视频制作系统,21.2K+ Stars 让 AI 编程助手变身视频工作室

    OpenMontage:全球首个开源 AI 智能体视频制作系统,21.2K+ Stars 让 AI 编程助手变身视频工作室

    🎬

    OpenMontage:全球首个开源 AI 智能体视频制作系统

    21.2K+ Stars | AGPL-3.0 | Python/TypeScript | calesthio 出品

    OpenMontage 是全球首个开源的智能体驱动(agentic)视频生产系统,包含 12 条生产管线52 个生产工具500+ 智能体技能。将你的 AI 编码助手(Claude Code/Cursor/GitHub Copilot 等)转化为完整的视频制作工作室,支持从创意到成片的端到端全流程自动化生产。

    21.2K+
    GitHub Stars

    12
    生产管线

    52
    生产工具

    500+
    智能体技能

    ⚙️
    安装要求和过程

    环境要求

    • Python 3.10+
    • FFmpeg(视频编码、字幕烧录、音频混合)
    • Node.js 18+(Remotion 合成引擎)
    • 任意支持的 AI 编码助手(Claude Code/Cursor/GitHub Copilot 等)

    快速安装

    # 一键安装(推荐)

    git clone https://github.com/calesthio/OpenMontage.git
    cd OpenMontage
    make setup

    # 无 make 手动安装

    pip install -r requirements.txt
    cd remotion-composer && npm install && cd ..
    pip install piper-tts
    cp .env.example .env

    本地 GPU 支持(免费视频生成)

    make install-gpu
    # 然后在 .env 中配置:
    VIDEO_GEN_LOCAL_ENABLED=true
    VIDEO_GEN_LOCAL_MODEL=wan2.1-1.3b # 可选 wan2.1-14b、hunyuan-1.5 等


    核心功能

    🎬

    12 条全流程生产管线

    覆盖动画讲解、动画制作、虚拟人播报、电影感剪辑、短视频批量生成、纪录片蒙太奇、混合制作、本地化配音、播客剪辑、屏幕演示、口播视频等场景。每条管线遵循「研究 → 提案 → 脚本 → 分镜 → 资产 → 剪辑 → 合成」的标准化流程。

    🎨

    双渲染引擎支持

    Proposal 阶段锁定渲染运行时,可选 Remotion(React 组件化合成,适合数据驱动讲解)或 HyperFrames(HTML/CSS/GASP 合成,适合动态图形和 SVG 角色动画)。禁止运行时静默切换,确保生产一致性。

    💰

    零成本/本地免费生产路径

    无需 API 密钥即可使用 Piper TTS 离线配音、Archive.org/NASA/Pixabay 等免费素材库、Remotion/HyperFrames 合成、FFmpeg 后期处理。还支持本地 GPU 运行 WAN 2.1、Hunyuan 等免费视频生成模型。

    🎯

    7 维评分自动选品

    所有工具选择通过「任务匹配度 30%、输出质量 20%、可控性 15%、可靠性 15%、成本效率 10%、延迟 5%、连续性 5%」的打分机制自动选择最优供应商,所有决策可追溯。

    生产级质量门禁

    包含合成前校验(阻断交付承诺不符、幻灯片风险过高的问题)、渲染后自检(ffprobe 验证、抽帧检查、音频分析、字幕校验)、决策审计日志(所有创意/技术选择留痕可查),避免输出无效内容。

    🚀
    典型使用场景

    📚

    教育内容创作

    输入「做一个 60 秒的动画讲解,主题是为什么天空是蓝色的」,AI 自动完成脚本编写、分镜设计、配音合成、字幕添加,全程无需手工操作。支持零密钥本地免费生成。

    🎬

    参考视频驱动创作

    粘贴 YouTube/Reels/TikTok 链接,智能体自动分析参考视频的节奏、结构、风格,输出 2-3 个差异化创意方案(含成本预估和效果预览),避免从零开始构思。

    📰

    纪录片/蒙太奇制作

    「做一个 90 秒的纪录片蒙太奇,主题是凌晨 4 点的城市氛围,仅使用实拍素材,无旁白,elegiac 基调。」支持 Archive.org 等免费素材库自动检索和剪辑。

    🎨

    风格化动画生成

    「做一个 30 秒的吉卜力风格动画,内容是云端的魔法浮动图书馆,黄金时段场景。」配置图像/视频 API 后,成本约 $0.15-$1.50 即可生成风格化动画。

    💡
    推荐理由

    💡

    OpenMontage 是我近期看到的最有想象力的 AI + 创意工具结合项目之一。它不只是「AI 生成视频」的工具,而是一个完整的视频生产管线系统——把 AI 编程助手变成了导演、编剧、分镜师、剪辑师、配音演员的集合体。

    最打动我的是它的「零成本路径」设计:你可以完全不花一分钱(无需任何 API Key)就生成完整的视频——使用 Piper 离线 TTS 配音、免费素材库、本地 FFmpeg 处理。对于个人创作者和学习者,这是极大的降低门槛。

    另外,它的7 维评分自动选品机制生产级质量门禁,让我看到了这个项目是「真正可用于生产」的,而不仅仅是 Demo 级别的玩具。所有决策留痕可查,合成前/后双重校验,这些设计在开源项目中非常少见。

    「如果你已经在使用 Claude Code 或 Cursor,OpenMontage 能让你用同样的工作流(写提示词 → 看结果 → 迭代)来「编程」视频,而不是去学习 PRo/Afer Effects。」

    🔧
    支持的 AI 工具与服务商

    兼容的 AI 编码助手:Claude Code、Cursor、GitHub Copilot、Windsurf、Codex(后续支持 Ollama、LM Studio 本地大模型)

    视频生成:Kling、Runway Gen-4、Google Veo 3、Grok Imagine Video、Higgsfield、MiniMax、HeyGen、WAN 2.1、Hunyuan、CogVideo、LTX-Video、Pexels、Pixabay、Wikimedia Commons

    图像生成:FLUX、Google Imagen 4、Grok Imagine Image、DALL-E 3、Recraft、Local Diffusion、Pexels、Pixabay、Unsplash、ManimCE

    文本转语音:ElevenLabs、Google TTS(700+ 音色)、OpenAI TTS、Piper(免费离线)

    音乐/音效:Suno AI、ElevenLabs Music、ElevenLabs SFX

    📥
    下载地址

    授权协议:AGPL-3.0(免费开源)
    开发语言:Python, TypeScript, Rust
    出品团队:calesthio(YC S26 孵化项目)

  • Snap把AI视频团队分拆出去了,新公司叫Dotmo

    Snap分拆AI视频团队Dotmo
    Snap将生成式AI视频团队分拆为独立公司Dotmo

    Snap正在把内部一支生成式AI视频团队分拆成一家独立公司。这家新公司名叫Dotmo,专注开发能创造互动游戏体验的AI模型。Snap对TechCrunch说,分拆的原因之一是这类研发的内部成本太高了。

    虽然Dotmo技术上是一家独立公司,但它和Snap的纽带并没有断。Snap会给Dotmo授权,让它把Snap的技术改造成游戏和互动娱乐平台上的应用。同时,Dotmo的初创团队会由一批离开Snap、加入这家新公司的现有员工组成。

    Dotmo不会直接拿Snap的资金,但Snap的CTO Bobby Murphy会以个人身份领投,并在这家新公司持有大量个人股份。Murphy会继续全职担任Snap的CTO,领导Snap的生成式AI研发。

    用股权换人才和技术

    Snap从这桩交易里拿到了Dotmo的大量股权。如果Dotmo以后做起来了,这部分股权会很值钱。Dotmo未来也可能去找外部融资。这个打法某种程度上是Snap在用”股权”代替”工资”——把高成本的AI研发团队剥离出去,但保留上行收益。

    这种分拆在成本压力下挺合理。AI研发烧钱速度很快,尤其像生成式视频这种需要大量算力和人才的领域。Snap自己留着这支团队,每个月的账单估计不好看。分拆出去,Murphy个人出钱支持,Snap拿股权,账面上好看不少。

    今年第二次分拆

    这不是Snap今年第一次分拆业务了。2026年早些时候,Snap把AR眼镜产品线Specs也分拆成独立公司,专门做智能眼镜。但那次分拆的结果有点尴尬——Specs的AR眼镜定价约2200美元,公布之后Snap的股价直接崩了。投资者觉得这个价格太离谱,短时间内根本卖不动。

    Dotmo和Specs的分拆逻辑不太一样。Specs本身就是Snap硬件战略的核心,分拆出去等于把赌注押在外部市场。而Dotmo做的是互动游戏和AI视频生成,这本来就不是Snap当前的核心业务重心,分拆出去反而更灵活。


    Snap的2026不太顺

    把时间线拉宽一点看,Snap今年的日子不太好过。除了Specs定价引发的股价暴跌,今年4月Snap还裁掉了约1000名员工,占总员工数的16%。在Meta的Instagram和Google的YouTube Shorts的双重挤压下,Snapchat的用户增长一直是个问题。

    分拆Dotmo能不能扭转外界对Snap的印象,现在还说不准。但至少从财务角度看,把高成本的AI研发团队剥离出表,对Snap的财报数据会有帮助。至于Dotmo能不能做出真正有竞争力的AI视频/游戏产品,那是另一场仗了。

    分拆这条路,硅谷公司走过很多次了。Xerox PARC分拆出了无数公司,Bell Labs也是。但Snap的情况有点特殊——它是在成本压力下做的分拆,而不是因为某项技术太好以至于需要独立发展。这两种分拆的结局,历史上不太一样。

  • 印度人做视频AI,价格打到国际大厂的二十分之一

    印度人做视频AI,价格打到国际大厂的二十分之一

    你有没有想过,为什么AI视频生成这么贵?用Veo、Kling、Runway这些工具生成几秒钟的视频,每秒收费动辄0.1美元以上,一个月下来账单能让你怀疑人生。但在印度,一群创业者正在用完全不同的思路做这件事。

    班加罗尔的Avataar AI最近推出了一个名为Varya的视频生成模型。他们的定价是每秒0.005美元——换算下来,只有国际主流视频AI模型的二十分之一。如果你用Veo生成一段10秒的视频要花1美元,用Varya只需要花5美分。

    Avataar Varya视频AI生成示例
    Avataar Varya的视频生成界面(图源:TechCrunch)

    不是从零训练,而是站在巨人肩膀上

    Varya并不是从零开始训练的大模型。它的底层基于阿里巴巴开源的Wan 2.2视频生成模型,然后做了一件事——模型蒸馏。

    简单来说,他们把Wan 2.2原本需要50步才能完成的生成流程,压缩到了4步。结果是什么?生成速度提升了10倍。在NVIDIA H200 GPU上,生成一段5秒的720p视频,Wan 2.2需要1230秒(超过20分钟),而Varya只需要45秒。

    这就像你把一辆车的发动机拆了,重新设计了一套更轻量、更高效的动力系统,结果跑得比以前快10倍,油耗还只有以前的二十分之一。

    专门给印度人做的AI,不会把节日搞错

    Varya有个很有意思的特点:它针对印度本土文化做了专项训练。你让它生成一个印度婚礼的场景,它能准确地画出新娘穿的红色纱丽、桌上的糖果摆盘、背景里的彩灯装饰。而用通用的AI视频模型,经常会出现文化刻板印象——比如把印度节日生成得像中东的庆典,或者把印度传统服饰画错。

    “我们的模型能理解印度文化的细微差别,这是通用模型做不到的。”——Avataar AI团队

    这个细节其实很重要。印度有14亿人口,说着22种官方语言,文化多样性极高。一个能真正理解本地文化的AI工具,和那种”差不多就行了”的通用模型,在实际使用中差距巨大。

    为什么要做这么便宜的AI?

    答案很简单:因为印度市场用不起那些昂贵的AI工具。

    印度是一个”视频优先”的市场。普通消费者刷YouTube、Instagram、WhatsApp Status的时间远超阅读文字内容。但对于印度的小企业主、内容创作者、教师来说,每个月花几十美元订阅一个AI视频工具,是一笔不小的开支。

    Avataar的创始人算了一笔账:如果一个印度小企业主每个月想用AI生成50段产品宣传视频,用Veo要花大约300美元(假设每段视频6秒),而用Varya只需要花15美元。这个价格差距,决定了AI视频能不能在印度真正普及。

    而且Avataar还做了一个很聪明的决定:把Varya的模型权重和训练数据完全开源,放在印度政府主办的AI Kosh平台上。任何开发者都可以免费下载、自行部署、根据自己的需求修改模型。这种开放策略在印度AI圈里越来越常见——既然在基础大模型上拼不过美国和中国,那就从应用层和开发者生态入手。

    印度AI的另一种玩法

    Varya的出现,其实反映了印度AI产业的一个有趣转向。过去几年,印度科技圈一直在纠结:我们要不要砸钱做自己的大模型?能不能在AI基础研发上追上美国?

    现在看起来,答案越来越清晰:不必硬刚。印度有庞大的开发者群体、有全球规模最大的IT外包产业、有14亿人口的本地市场需求。基于开源模型做蒸馏优化、针对本地需求做定制化、把价格打到能让普通人也用得起——这条路可能比烧钱训练基础大模型更实际,也更有商业价值。

    Avataar拿到了Peak XV(就是原来的红杉印度)的投资,还入选了印度政府”印度AI使命”计划的扶持名单。这个计划拿出了约12亿美元,专门补贴入选的AI初创企业,给他们提供便宜的GPU算力。政府的逻辑也很清楚:先让一批本土AI公司跑起来,再通过他们带动整个生态。

    Varya现在的体验入口已经在Avataar官网上线,你可以用文字描述想要的视频内容,也可以上传一张参考图让它生成视频。企业客户可以直接对接他们的API。接下来,Avataar计划跟Higgsfield、Adobe Firefly这些视频工具做集成,让Varya嵌入到更多创作者的工作流里。

    印度有14亿人,每年有上千万新人进入劳动力市场,有数千万小企业需要更便宜的营销工具。如果Varya真的能把AI视频的价格打到人人都用得起的程度,它不一定需要跟Veo在正面对决中赢,光是服务好印度这一个市场,就足够撑起一家有价值的公司了。


  • MoneyPrinterTurbo:66.6K Stars!AI短视频一键生成,让内容创作不再靠体力

    MoneyPrinterTurbo:66.6K Stars!AI短视频一键生成,让内容创作不再靠体力


    MoneyPrinterTurbo Web界面

    MoneyPrinterTurbo Web 操作界面

    📌 项目简介

    MoneyPrinterTurbo 是一个基于AI大模型的短视频一键生成工具。只需提供一个视频主题关键词,就可以全自动完成:文案生成 → 视频素材匹配 → 字幕生成 → 背景音乐搭配 → 高清短视频合成,全流程无需人工干预。

    66.6K+
    GitHub Stars

    多模型
    AI 接入支持

    双端
    Web + API

    MIT
    开源协议

    ⚙️ 安装要求和过程

    环境要求

    • Python 版本:推荐 Python 3.11
    • 依赖管理:优先使用 uv 工具
    • 必要依赖:ImageMagick(图片处理)、ffmpeg(视频处理)
    • 最低配置:4核CPU、4GB内存
    • 推荐配置:6-8核CPU、8GB内存、4GB显存GPU

    快速安装步骤

    # 1. 克隆项目
    git clone https://github.com/harry0703/MoneyPrinterTurbo.git
    cd MoneyPrinterTurbo
    
    # 2. 配置 API Key(复制配置模板)
    cp config.example.toml config.toml
    # 编辑 config.toml,填入 pexels_api_keys 和 LLM API Key
    
    # 3. 安装依赖(推荐使用 uv)
    uv python install 3.11
    uv sync --frozen
    
    # 4. 启动 Web 界面
    uv run streamlit run ./webui/Main.py --browser.gatherUsageStats=False

    💡 国内用户推荐:LLM 接入优先选择 DeepSeekMoonshot(Kimi),无需VPN,注册即送额度,调用稳定。

    ✨ 核心功能

    ① 全流程自动化生成

    只需输入主题/关键词,自动完成文案生成、高清无版权素材匹配、字幕生成、背景音乐搭配,最终合成高清短视频,全程无需人工干预。

    ② 多场景尺寸适配

    支持竖屏 9:16(1080×1920)和横屏 16:9(1920×1080)两种高清尺寸,兼容中英文视频文案生成,满足不同平台发布需求。

    ③ 灵活自定义能力

    支持 AI 自动生成文案或自定义文案,可调整字幕字体/位置/颜色/大小/描边,支持自定义背景音乐和本地素材,批量生成多个视频。

    ④ 多模型兼容

    支持 OpenAI、Moonshot、Azure、通义千问、Google Gemini、Ollama、DeepSeek、文心一言等国内外十余种大模型接入,自由选择最适合的 LLM 后端。

    ⑤ 多端使用支持

    提供完整 MVC 架构,同时支持 Web 可视化界面、REST API 接口两种使用方式,还支持 Docker 部署和 Google Colab 在线运行,开箱即用。

    🎬 典型使用场景

    场景一:自媒体短视频批量生产

    自媒体运营者需要每天稳定输出高质量短视频内容,但文案创作、素材搜集、剪辑合成耗时费力。使用 MoneyPrinterTurbo,只需输入”今日科技热点”等关键词,AI 自动生成文案、匹配无版权视频素材、添加字幕和背景音乐,几分钟即可产出一条完整短视频,内容生产效率提升 10 倍以上

    场景二:企业营销视频快速制作

    电商运营或市场人员需要为产品制作营销短视频,但缺乏专业剪辑能力。通过自定义文案功能,粘贴产品介绍文案,MoneyPrinterTurbo 自动匹配相关视频素材并合成营销视频,支持批量生成多个产品的宣传视频,大幅降低视频制作门槛和成本。

    场景三:知识分享内容创作

    知识博主需要将长篇文章或知识点转化为短视频内容。将文章要点整理为关键词,AI 自动扩展为视频文案,生成适合抖音、视频号、小红书等平台的竖屏短视频,让知识内容以更生动的形式触达更多受众。

    💡 推荐理由

    MoneyPrinterTurbo 是我见过的最完整的 AI 短视频生成开源方案。它不只是简单地拼接 AI 能力,而是真正从创作者的实际痛点出发,把视频制作的全流程——创意、文案、素材、配音、字幕、剪辑——全部打通。

    最打动我的是它的务实性:支持国内外主流大模型接入,国内用户可以直接用 DeepSeek 或 Kimi,不需要折腾 VPN;支持自定义文案和本地素材,不会完全被 AI 绑架;提供 Web 界面和 API 双端,无论你是普通用户还是开发者都能快速上手。

    当然,AI 生成的视频质量还无法和专业人工剪辑相提并论,素材匹配的准确性也有提升空间。但作为内容创作的效率工具,它已经足够惊艳。对于需要批量生产短视频内容的自媒体运营者来说,这是一个值得深入研究的开源项目。

    🖼️ 界面预览

    Web界面

    Web 可视化操作界面

    📥 下载地址

    🌐 官方网站:https://github.com/harry0703/MoneyPrinterTurbo

    🐙 GitHub 仓库:https://github.com/harry0703/MoneyPrinterTurbo

    📦 一键启动包:Windows 用户可直接下载项目 Release 中的一键启动包,解压即跑

    🐳 Docker 部署:docker-compose up 一键启动

    ☁️ 在线体验:支持 Google Colab 在线运行,无需本地配置环境


    📌 开源自尊:本项目采用 MIT 开源协议,可自由用于个人和商业场景,仅需保留版权声明。如果你也在探索 AI + 内容创作的方向,强烈建议深入研究这个项目,一定会有所收获。