标签: AI视频

  • MoneyPrinterTurbo:AI 自动生成短视频,93K+ Stars 让创作零门槛

    MoneyPrinterTurbo:AI 自动生成短视频,93K+ Stars 让创作零门槛

    🎬 MoneyPrinterTurbo:AI 自动生成短视频,93K+ Stars 让创作零门槛

    基于 AI 大模型的短视频自动生成工具|支持中英文|一键跨平台发布

    93.1K+
    ⭐ GitHub Stars
    Python
    💻 主要语言
    MIT
    📄 开源许可
    35K+
    📈 本月新增

    📌 项目简介

    MoneyPrinterTurbo 是一款基于 AI 大模型的短视频自动生成工具,由开发者 harry0703 创建并维护。只需提供一个视频主题或关键词,系统即可全自动完成文案生成、素材匹配、字幕合成、背景音乐搭配,最终输出高清短视频(支持竖屏 9:16 和横屏 16:9)。

    项目在 GitHub 上已获得 93,118 Stars,是本月 GitHub 趋势榜 Python 类目第二名(新增 35,397 Stars),深受内容创作者和 AI 爱好者欢迎。

    🔧 安装要求和过程

    环境要求

    • Python 版本:3.11+(推荐,项目使用 uv 管理依赖)
    • 核心依赖:Streamlit(Web界面)、FastAPI(API服务)、MoviePy 2.x(视频处理)、ffmpeg
    • AI 服务:需配置至少一家 LLM 提供商 API Key(支持 15+ 家)
    • 素材服务:需配置 Pexels 或 Pixabay API Key(免费申请)

    快速安装(三种方式)

    方式一:Docker 部署(推荐)

    # 1. 安装 Docker Desktop(Windows 用户需先配置 WSL)
    # 2. 克隆项目
    git clone https://github.com/harry0703/MoneyPrinterTurbo.git
    cd MoneyPrinterTurbo

    # 3. 一键启动(自动拉取预构建镜像)
    docker compose -f docker-compose.release.yml up

    # 4. 访问
    # Web 界面:http://127.0.0.1:8501
    # API 文档:http://127.0.0.1:8080/docs

    方式二:本地手动部署

    # 1. 克隆项目
    git clone https://github.com/harry0703/MoneyPrinterTurbo.git
    cd MoneyPrinterTurbo

    # 2. 使用 uv 安装依赖(推荐)
    uv python install 3.11
    uv sync –frozen

    # 3. 配置 API Key
    cp config.example.toml config.toml
    # 编辑 config.toml,填入 pexels_api_keys 和 llm_provider 配置

    # 4. 启动 Web 界面
    uv run streamlit run ./webui/Main.py –server.showEmailPrompt=False

    # 5. 启动 API 服务(可选)
    uv run python main.py

    方式三:Windows 一键启动包

    GitHub Release 下载最新一键启动包,解压后先双击 update.bat 更新代码,再双击 start.bat 启动即可。

    ✨ 核心功能

    • AI 全自动文案生成:接入 15+ 家 LLM 服务商(OpenAI / DeepSeek / Kimi / 通义千问 / Gemini / Ollama 等),自动生成视频脚本,支持中英文双语。
    • 智能素材匹配:集成 Pexels、Pixabay、Coverr 三大无版权素材源,根据文案关键词自动匹配高清视频片段,也支持上传本地素材。
    • 多语音合成引擎:内置 Edge TTS(免费,无需 API Key)、Azure TTS V2、ElevenLabs TTS,支持 23+ 种语言,可实时试听效果。
    • 丰富字幕样式:支持自定义字体、位置、颜色、大小、描边效果,基于 Pillow 渲染(不再依赖 ImageMagick),字幕时间戳精确对齐。
    • 一键跨平台发布:生成完成后可自动上传至 TikTok、Instagram、YouTube Shorts(需 Upload-Post 账号),YouTube 发布自动标注”AI 生成内容”。

    🚀 典型使用场景

    场景一:知识科普短视频批量生产

    自媒体运营者需要每天发布 3-5 条科普短视频,但缺乏视频剪辑时间和素材。使用 MoneyPrinterTurbo,只需输入”量子计算入门””黑洞是什么”等主题,AI 自动生成文案并匹配宇宙、科技素材,10 分钟内完成 5 条视频生成,大幅降低内容生产成本。

    场景二:跨境电商产品宣传视频

    电商卖家需要为每款产品制作多语言宣传短视频。通过自定义文案 + 本地素材上传功能,批量生成中英双语产品介绍视频,配合一键跨平台发布功能,快速覆盖 TikTok、Instagram 等海外社媒渠道。

    场景三:本地 LLM 隐私保护场景

    对数据隐私有严格要求的企业用户,可配置 Ollama 本地 LLM 提供商,所有文案生成均在本地完成,无需将敏感信息发送至第三方 API,兼顾 AI 能力提升与数据安全合规。

    💡 推荐理由

    作为一个 AI 工具爱好者,我认为 MoneyPrinterTurbo 最打动人的地方在于它的「降维打击式」易用性

    • 零视频编辑基础也能用:传统视频制作需要掌握剪辑软件、素材版权、配音等多项技能,而 MoneyPrinterTurbo 把这些全部封装成一个 Web 界面,点几下鼠标就能出片。
    • AI 大模型生态友好:支持 Ollama 本地模型是一大亮点,意味着你可以在没有 API 费用的情况下无限生成文案,对个人创作者非常友好。
    • 开源且活跃:MIT 许可允许自由修改和商用,社区活跃(本月新增 35K+ Stars),Bug 修复和功能迭代速度快。
    • 不只是「玩具」:内置的批量生成、API 接口、跨平台发布等功能,已经让它具备了生产级工具的属性,而不只是一个 Demo。
    ⚠️ 使用提醒:AI 生成的视频内容请注意平台审核规则,YouTube 已要求标注”AI 生成内容”。另外,虽然素材来自无版权平台,但商业使用前建议再次确认素材许可协议。

    🛠️ 技术栈

    Python 3.11
    Streamlit
    FastAPI
    MoviePy 2.x
    ffmpeg
    Edge TTS
    Docker
    uv

    🤖 支持的 AI 模型

    MoneyPrinterTurbo 支持接入以下大模型服务(在 config.toml 中配置):

    # LLM 提供商列表(任选其一配置 API Key)
    OpenAI / AIHubMix / AIML API / EvoLink
    Moonshot(Kimi)/ Azure / gpt4free / one-api
    通义千问(Qwen)/ Google Gemini / DeepSeek
    MiniMax / 文心一言 / Pollinations / ModelScope
    Ollama(本地模型,无需 API Key)💡 推荐个人用户使用

    📥 下载地址

    📌 开源许可:MIT License,可自由使用、修改和分发,包括商业用途。
    🌟 项目热度:93,118 Stars | 本月新增 35,397 Stars | GitHub Python 趋势榜 Top 2
    💬 社区:Issues 和 PR 活跃,开发者响应及时。

  • Adobe把Topaz Labs收了,创意软件军备竞赛又升级了

    Adobe收购Topaz Labs AI创意工具概念图
    Adobe将把Topaz的AI图像视频增强模型集成到Firefly和Creative Cloud(图源:Adobe/Topaz Labs)

    Adobe周四宣布收购Topaz Labs,一家做了20多年图像和视频增强工具的公司。交易细节没披露,但Adobe说会把它并进创意业务板块。

    这个举动背后的逻辑不复杂:Adobe不想让用户在修图修视频的过程中跑到别家工具去。Topaz的产品正好补上Adobe在某些专业增强场景下的短板。

    一家”老”公司的新机会

    Topaz Labs成立已经超过20年,主打图像和视频的AI增强。这两年跑出来的两个核心产品是Astra(AI视频升频)和Wonder(图像修饰和增强)。去年,Topaz还拿了艾美奖,表彰它在视频技术上的贡献。

    更有意思的是他们最近搞的一个技术叫Neurostream,能让大型视频AI模型在消费级GPU上跑起来。这个方向对Adobe来说很有价值——Adobe一直在推”本地运行AI”的能力,Neurostream正好能对上。

    “Topaz Labs在优化大型复杂AI模型以在设备上直接运行方面有深厚积累,这个能力将让Adobe能够为客户提供更快速、更灵敏的体验。”——Adobe创意云产品营销VP Deepa Subramaniam

    Adobe的防守战

    Adobe这几年面临的压力不小。Canva从低端往上吃,Blackmagic Design(DaVinci Resolve的东家)在专业视频剪辑这块一直很能打。Adobe的策略是往所有产品里塞AI,同时把外部的好技术买进来、集成进来,让用户没有理由离开生态。

    Firefly是Adobe的AI品牌,已经集成到Photoshop、Premiere、Illustrator这些主力产品里。把Topaz的模型也融进去,Firefly在”画质增强”这个细分方向上的能力会明显补强。

    Adobe在公告里还说,Topaz的产品会继续作为独立服务在官网上提供。也就是说,现有Topaz用户暂时不用担心产品被”Adobe化”。

    交易时间表

    Adobe说这笔交易将在2026年下半年完成,还需要过监管审批这个关。考虑到两家公司的市场份额,这应该不是什么大问题。

    从更大的视角看,这笔收购是创意软件行业AI军备竞赛的一个缩影。每一家都在想办法让自己的AI更强、更全、更能留住用户。Topaz Labs作为一个在AI增强领域深耕20年的玩家,它的技术积累比它的名气要大得多。


    • Topaz Labs成立20+年,去年获艾美奖
    • 核心产品:Astra(视频升频)、Wonder(图像增强)
    • Neurostream技术可在消费级GPU上运行大型视频AI模型
    • Adobe将把Topaz模型集成到Firefly和Creative Cloud
    • 交易预计2026年下半年完成
  • OpenMontage:全球首个开源 AI 智能体视频制作系统,21.2K+ Stars 让 AI 编程助手变身视频工作室

    OpenMontage:全球首个开源 AI 智能体视频制作系统,21.2K+ Stars 让 AI 编程助手变身视频工作室

    🎬

    OpenMontage:全球首个开源 AI 智能体视频制作系统

    21.2K+ Stars | AGPL-3.0 | Python/TypeScript | calesthio 出品

    OpenMontage 是全球首个开源的智能体驱动(agentic)视频生产系统,包含 12 条生产管线52 个生产工具500+ 智能体技能。将你的 AI 编码助手(Claude Code/Cursor/GitHub Copilot 等)转化为完整的视频制作工作室,支持从创意到成片的端到端全流程自动化生产。

    21.2K+
    GitHub Stars

    12
    生产管线

    52
    生产工具

    500+
    智能体技能

    ⚙️
    安装要求和过程

    环境要求

    • Python 3.10+
    • FFmpeg(视频编码、字幕烧录、音频混合)
    • Node.js 18+(Remotion 合成引擎)
    • 任意支持的 AI 编码助手(Claude Code/Cursor/GitHub Copilot 等)

    快速安装

    # 一键安装(推荐)

    git clone https://github.com/calesthio/OpenMontage.git
    cd OpenMontage
    make setup

    # 无 make 手动安装

    pip install -r requirements.txt
    cd remotion-composer && npm install && cd ..
    pip install piper-tts
    cp .env.example .env

    本地 GPU 支持(免费视频生成)

    make install-gpu
    # 然后在 .env 中配置:
    VIDEO_GEN_LOCAL_ENABLED=true
    VIDEO_GEN_LOCAL_MODEL=wan2.1-1.3b # 可选 wan2.1-14b、hunyuan-1.5 等


    核心功能

    🎬

    12 条全流程生产管线

    覆盖动画讲解、动画制作、虚拟人播报、电影感剪辑、短视频批量生成、纪录片蒙太奇、混合制作、本地化配音、播客剪辑、屏幕演示、口播视频等场景。每条管线遵循「研究 → 提案 → 脚本 → 分镜 → 资产 → 剪辑 → 合成」的标准化流程。

    🎨

    双渲染引擎支持

    Proposal 阶段锁定渲染运行时,可选 Remotion(React 组件化合成,适合数据驱动讲解)或 HyperFrames(HTML/CSS/GASP 合成,适合动态图形和 SVG 角色动画)。禁止运行时静默切换,确保生产一致性。

    💰

    零成本/本地免费生产路径

    无需 API 密钥即可使用 Piper TTS 离线配音、Archive.org/NASA/Pixabay 等免费素材库、Remotion/HyperFrames 合成、FFmpeg 后期处理。还支持本地 GPU 运行 WAN 2.1、Hunyuan 等免费视频生成模型。

    🎯

    7 维评分自动选品

    所有工具选择通过「任务匹配度 30%、输出质量 20%、可控性 15%、可靠性 15%、成本效率 10%、延迟 5%、连续性 5%」的打分机制自动选择最优供应商,所有决策可追溯。

    生产级质量门禁

    包含合成前校验(阻断交付承诺不符、幻灯片风险过高的问题)、渲染后自检(ffprobe 验证、抽帧检查、音频分析、字幕校验)、决策审计日志(所有创意/技术选择留痕可查),避免输出无效内容。

    🚀
    典型使用场景

    📚

    教育内容创作

    输入「做一个 60 秒的动画讲解,主题是为什么天空是蓝色的」,AI 自动完成脚本编写、分镜设计、配音合成、字幕添加,全程无需手工操作。支持零密钥本地免费生成。

    🎬

    参考视频驱动创作

    粘贴 YouTube/Reels/TikTok 链接,智能体自动分析参考视频的节奏、结构、风格,输出 2-3 个差异化创意方案(含成本预估和效果预览),避免从零开始构思。

    📰

    纪录片/蒙太奇制作

    「做一个 90 秒的纪录片蒙太奇,主题是凌晨 4 点的城市氛围,仅使用实拍素材,无旁白,elegiac 基调。」支持 Archive.org 等免费素材库自动检索和剪辑。

    🎨

    风格化动画生成

    「做一个 30 秒的吉卜力风格动画,内容是云端的魔法浮动图书馆,黄金时段场景。」配置图像/视频 API 后,成本约 $0.15-$1.50 即可生成风格化动画。

    💡
    推荐理由

    💡

    OpenMontage 是我近期看到的最有想象力的 AI + 创意工具结合项目之一。它不只是「AI 生成视频」的工具,而是一个完整的视频生产管线系统——把 AI 编程助手变成了导演、编剧、分镜师、剪辑师、配音演员的集合体。

    最打动我的是它的「零成本路径」设计:你可以完全不花一分钱(无需任何 API Key)就生成完整的视频——使用 Piper 离线 TTS 配音、免费素材库、本地 FFmpeg 处理。对于个人创作者和学习者,这是极大的降低门槛。

    另外,它的7 维评分自动选品机制生产级质量门禁,让我看到了这个项目是「真正可用于生产」的,而不仅仅是 Demo 级别的玩具。所有决策留痕可查,合成前/后双重校验,这些设计在开源项目中非常少见。

    「如果你已经在使用 Claude Code 或 Cursor,OpenMontage 能让你用同样的工作流(写提示词 → 看结果 → 迭代)来「编程」视频,而不是去学习 PRo/Afer Effects。」

    🔧
    支持的 AI 工具与服务商

    兼容的 AI 编码助手:Claude Code、Cursor、GitHub Copilot、Windsurf、Codex(后续支持 Ollama、LM Studio 本地大模型)

    视频生成:Kling、Runway Gen-4、Google Veo 3、Grok Imagine Video、Higgsfield、MiniMax、HeyGen、WAN 2.1、Hunyuan、CogVideo、LTX-Video、Pexels、Pixabay、Wikimedia Commons

    图像生成:FLUX、Google Imagen 4、Grok Imagine Image、DALL-E 3、Recraft、Local Diffusion、Pexels、Pixabay、Unsplash、ManimCE

    文本转语音:ElevenLabs、Google TTS(700+ 音色)、OpenAI TTS、Piper(免费离线)

    音乐/音效:Suno AI、ElevenLabs Music、ElevenLabs SFX

    📥
    下载地址

    授权协议:AGPL-3.0(免费开源)
    开发语言:Python, TypeScript, Rust
    出品团队:calesthio(YC S26 孵化项目)

  • Snap把AI视频团队分拆出去了,新公司叫Dotmo

    Snap分拆AI视频团队Dotmo
    Snap将生成式AI视频团队分拆为独立公司Dotmo

    Snap正在把内部一支生成式AI视频团队分拆成一家独立公司。这家新公司名叫Dotmo,专注开发能创造互动游戏体验的AI模型。Snap对TechCrunch说,分拆的原因之一是这类研发的内部成本太高了。

    虽然Dotmo技术上是一家独立公司,但它和Snap的纽带并没有断。Snap会给Dotmo授权,让它把Snap的技术改造成游戏和互动娱乐平台上的应用。同时,Dotmo的初创团队会由一批离开Snap、加入这家新公司的现有员工组成。

    Dotmo不会直接拿Snap的资金,但Snap的CTO Bobby Murphy会以个人身份领投,并在这家新公司持有大量个人股份。Murphy会继续全职担任Snap的CTO,领导Snap的生成式AI研发。

    用股权换人才和技术

    Snap从这桩交易里拿到了Dotmo的大量股权。如果Dotmo以后做起来了,这部分股权会很值钱。Dotmo未来也可能去找外部融资。这个打法某种程度上是Snap在用”股权”代替”工资”——把高成本的AI研发团队剥离出去,但保留上行收益。

    这种分拆在成本压力下挺合理。AI研发烧钱速度很快,尤其像生成式视频这种需要大量算力和人才的领域。Snap自己留着这支团队,每个月的账单估计不好看。分拆出去,Murphy个人出钱支持,Snap拿股权,账面上好看不少。

    今年第二次分拆

    这不是Snap今年第一次分拆业务了。2026年早些时候,Snap把AR眼镜产品线Specs也分拆成独立公司,专门做智能眼镜。但那次分拆的结果有点尴尬——Specs的AR眼镜定价约2200美元,公布之后Snap的股价直接崩了。投资者觉得这个价格太离谱,短时间内根本卖不动。

    Dotmo和Specs的分拆逻辑不太一样。Specs本身就是Snap硬件战略的核心,分拆出去等于把赌注押在外部市场。而Dotmo做的是互动游戏和AI视频生成,这本来就不是Snap当前的核心业务重心,分拆出去反而更灵活。


    Snap的2026不太顺

    把时间线拉宽一点看,Snap今年的日子不太好过。除了Specs定价引发的股价暴跌,今年4月Snap还裁掉了约1000名员工,占总员工数的16%。在Meta的Instagram和Google的YouTube Shorts的双重挤压下,Snapchat的用户增长一直是个问题。

    分拆Dotmo能不能扭转外界对Snap的印象,现在还说不准。但至少从财务角度看,把高成本的AI研发团队剥离出表,对Snap的财报数据会有帮助。至于Dotmo能不能做出真正有竞争力的AI视频/游戏产品,那是另一场仗了。

    分拆这条路,硅谷公司走过很多次了。Xerox PARC分拆出了无数公司,Bell Labs也是。但Snap的情况有点特殊——它是在成本压力下做的分拆,而不是因为某项技术太好以至于需要独立发展。这两种分拆的结局,历史上不太一样。

  • 印度人做视频AI,价格打到国际大厂的二十分之一

    印度人做视频AI,价格打到国际大厂的二十分之一

    你有没有想过,为什么AI视频生成这么贵?用Veo、Kling、Runway这些工具生成几秒钟的视频,每秒收费动辄0.1美元以上,一个月下来账单能让你怀疑人生。但在印度,一群创业者正在用完全不同的思路做这件事。

    班加罗尔的Avataar AI最近推出了一个名为Varya的视频生成模型。他们的定价是每秒0.005美元——换算下来,只有国际主流视频AI模型的二十分之一。如果你用Veo生成一段10秒的视频要花1美元,用Varya只需要花5美分。

    Avataar Varya视频AI生成示例
    Avataar Varya的视频生成界面(图源:TechCrunch)

    不是从零训练,而是站在巨人肩膀上

    Varya并不是从零开始训练的大模型。它的底层基于阿里巴巴开源的Wan 2.2视频生成模型,然后做了一件事——模型蒸馏。

    简单来说,他们把Wan 2.2原本需要50步才能完成的生成流程,压缩到了4步。结果是什么?生成速度提升了10倍。在NVIDIA H200 GPU上,生成一段5秒的720p视频,Wan 2.2需要1230秒(超过20分钟),而Varya只需要45秒。

    这就像你把一辆车的发动机拆了,重新设计了一套更轻量、更高效的动力系统,结果跑得比以前快10倍,油耗还只有以前的二十分之一。

    专门给印度人做的AI,不会把节日搞错

    Varya有个很有意思的特点:它针对印度本土文化做了专项训练。你让它生成一个印度婚礼的场景,它能准确地画出新娘穿的红色纱丽、桌上的糖果摆盘、背景里的彩灯装饰。而用通用的AI视频模型,经常会出现文化刻板印象——比如把印度节日生成得像中东的庆典,或者把印度传统服饰画错。

    “我们的模型能理解印度文化的细微差别,这是通用模型做不到的。”——Avataar AI团队

    这个细节其实很重要。印度有14亿人口,说着22种官方语言,文化多样性极高。一个能真正理解本地文化的AI工具,和那种”差不多就行了”的通用模型,在实际使用中差距巨大。

    为什么要做这么便宜的AI?

    答案很简单:因为印度市场用不起那些昂贵的AI工具。

    印度是一个”视频优先”的市场。普通消费者刷YouTube、Instagram、WhatsApp Status的时间远超阅读文字内容。但对于印度的小企业主、内容创作者、教师来说,每个月花几十美元订阅一个AI视频工具,是一笔不小的开支。

    Avataar的创始人算了一笔账:如果一个印度小企业主每个月想用AI生成50段产品宣传视频,用Veo要花大约300美元(假设每段视频6秒),而用Varya只需要花15美元。这个价格差距,决定了AI视频能不能在印度真正普及。

    而且Avataar还做了一个很聪明的决定:把Varya的模型权重和训练数据完全开源,放在印度政府主办的AI Kosh平台上。任何开发者都可以免费下载、自行部署、根据自己的需求修改模型。这种开放策略在印度AI圈里越来越常见——既然在基础大模型上拼不过美国和中国,那就从应用层和开发者生态入手。

    印度AI的另一种玩法

    Varya的出现,其实反映了印度AI产业的一个有趣转向。过去几年,印度科技圈一直在纠结:我们要不要砸钱做自己的大模型?能不能在AI基础研发上追上美国?

    现在看起来,答案越来越清晰:不必硬刚。印度有庞大的开发者群体、有全球规模最大的IT外包产业、有14亿人口的本地市场需求。基于开源模型做蒸馏优化、针对本地需求做定制化、把价格打到能让普通人也用得起——这条路可能比烧钱训练基础大模型更实际,也更有商业价值。

    Avataar拿到了Peak XV(就是原来的红杉印度)的投资,还入选了印度政府”印度AI使命”计划的扶持名单。这个计划拿出了约12亿美元,专门补贴入选的AI初创企业,给他们提供便宜的GPU算力。政府的逻辑也很清楚:先让一批本土AI公司跑起来,再通过他们带动整个生态。

    Varya现在的体验入口已经在Avataar官网上线,你可以用文字描述想要的视频内容,也可以上传一张参考图让它生成视频。企业客户可以直接对接他们的API。接下来,Avataar计划跟Higgsfield、Adobe Firefly这些视频工具做集成,让Varya嵌入到更多创作者的工作流里。

    印度有14亿人,每年有上千万新人进入劳动力市场,有数千万小企业需要更便宜的营销工具。如果Varya真的能把AI视频的价格打到人人都用得起的程度,它不一定需要跟Veo在正面对决中赢,光是服务好印度这一个市场,就足够撑起一家有价值的公司了。


  • MoneyPrinterTurbo:66.6K Stars!AI短视频一键生成,让内容创作不再靠体力

    MoneyPrinterTurbo:66.6K Stars!AI短视频一键生成,让内容创作不再靠体力


    MoneyPrinterTurbo Web界面

    MoneyPrinterTurbo Web 操作界面

    📌 项目简介

    MoneyPrinterTurbo 是一个基于AI大模型的短视频一键生成工具。只需提供一个视频主题关键词,就可以全自动完成:文案生成 → 视频素材匹配 → 字幕生成 → 背景音乐搭配 → 高清短视频合成,全流程无需人工干预。

    66.6K+
    GitHub Stars

    多模型
    AI 接入支持

    双端
    Web + API

    MIT
    开源协议

    ⚙️ 安装要求和过程

    环境要求

    • Python 版本:推荐 Python 3.11
    • 依赖管理:优先使用 uv 工具
    • 必要依赖:ImageMagick(图片处理)、ffmpeg(视频处理)
    • 最低配置:4核CPU、4GB内存
    • 推荐配置:6-8核CPU、8GB内存、4GB显存GPU

    快速安装步骤

    # 1. 克隆项目
    git clone https://github.com/harry0703/MoneyPrinterTurbo.git
    cd MoneyPrinterTurbo
    
    # 2. 配置 API Key(复制配置模板)
    cp config.example.toml config.toml
    # 编辑 config.toml,填入 pexels_api_keys 和 LLM API Key
    
    # 3. 安装依赖(推荐使用 uv)
    uv python install 3.11
    uv sync --frozen
    
    # 4. 启动 Web 界面
    uv run streamlit run ./webui/Main.py --browser.gatherUsageStats=False

    💡 国内用户推荐:LLM 接入优先选择 DeepSeekMoonshot(Kimi),无需VPN,注册即送额度,调用稳定。

    ✨ 核心功能

    ① 全流程自动化生成

    只需输入主题/关键词,自动完成文案生成、高清无版权素材匹配、字幕生成、背景音乐搭配,最终合成高清短视频,全程无需人工干预。

    ② 多场景尺寸适配

    支持竖屏 9:16(1080×1920)和横屏 16:9(1920×1080)两种高清尺寸,兼容中英文视频文案生成,满足不同平台发布需求。

    ③ 灵活自定义能力

    支持 AI 自动生成文案或自定义文案,可调整字幕字体/位置/颜色/大小/描边,支持自定义背景音乐和本地素材,批量生成多个视频。

    ④ 多模型兼容

    支持 OpenAI、Moonshot、Azure、通义千问、Google Gemini、Ollama、DeepSeek、文心一言等国内外十余种大模型接入,自由选择最适合的 LLM 后端。

    ⑤ 多端使用支持

    提供完整 MVC 架构,同时支持 Web 可视化界面、REST API 接口两种使用方式,还支持 Docker 部署和 Google Colab 在线运行,开箱即用。

    🎬 典型使用场景

    场景一:自媒体短视频批量生产

    自媒体运营者需要每天稳定输出高质量短视频内容,但文案创作、素材搜集、剪辑合成耗时费力。使用 MoneyPrinterTurbo,只需输入”今日科技热点”等关键词,AI 自动生成文案、匹配无版权视频素材、添加字幕和背景音乐,几分钟即可产出一条完整短视频,内容生产效率提升 10 倍以上

    场景二:企业营销视频快速制作

    电商运营或市场人员需要为产品制作营销短视频,但缺乏专业剪辑能力。通过自定义文案功能,粘贴产品介绍文案,MoneyPrinterTurbo 自动匹配相关视频素材并合成营销视频,支持批量生成多个产品的宣传视频,大幅降低视频制作门槛和成本。

    场景三:知识分享内容创作

    知识博主需要将长篇文章或知识点转化为短视频内容。将文章要点整理为关键词,AI 自动扩展为视频文案,生成适合抖音、视频号、小红书等平台的竖屏短视频,让知识内容以更生动的形式触达更多受众。

    💡 推荐理由

    MoneyPrinterTurbo 是我见过的最完整的 AI 短视频生成开源方案。它不只是简单地拼接 AI 能力,而是真正从创作者的实际痛点出发,把视频制作的全流程——创意、文案、素材、配音、字幕、剪辑——全部打通。

    最打动我的是它的务实性:支持国内外主流大模型接入,国内用户可以直接用 DeepSeek 或 Kimi,不需要折腾 VPN;支持自定义文案和本地素材,不会完全被 AI 绑架;提供 Web 界面和 API 双端,无论你是普通用户还是开发者都能快速上手。

    当然,AI 生成的视频质量还无法和专业人工剪辑相提并论,素材匹配的准确性也有提升空间。但作为内容创作的效率工具,它已经足够惊艳。对于需要批量生产短视频内容的自媒体运营者来说,这是一个值得深入研究的开源项目。

    🖼️ 界面预览

    Web界面

    Web 可视化操作界面

    📥 下载地址

    🌐 官方网站:https://github.com/harry0703/MoneyPrinterTurbo

    🐙 GitHub 仓库:https://github.com/harry0703/MoneyPrinterTurbo

    📦 一键启动包:Windows 用户可直接下载项目 Release 中的一键启动包,解压即跑

    🐳 Docker 部署:docker-compose up 一键启动

    ☁️ 在线体验:支持 Google Colab 在线运行,无需本地配置环境


    📌 开源自尊:本项目采用 MIT 开源协议,可自由用于个人和商业场景,仅需保留版权声明。如果你也在探索 AI + 内容创作的方向,强烈建议深入研究这个项目,一定会有所收获。

  • YouTube开始自动标注AI视频,不申报就替你标

    AI生成的视频越来越逼真,YouTube决定不再只靠创作者自觉标注了。这家谷歌旗下的视频平台本周宣布,将用内部系统自动检测并标注使用了「重要拟真AI」的视频内容。

    从自愿标注到主动执法

    这套标注机制其实已经上线两年多了。早在2024年3月,YouTube就更新了AI政策,要求创作者在Creator Studio里主动披露那些可能被误认为真实人物、地点或事件的AI内容。只不过之前完全靠自觉——如果你不标,平台也不会拿你怎么样。

    现在不一样了。YouTube明确表示,5月起将使用新的内部信号来识别AI生成内容并自动打标。当然,平台仍然鼓励创作者自觉申报,但如果你忘了标,YouTube会替你标上。

    YouTube AI标注界面截图
    YouTube 新的 AI 内容标注样式(来源:TechCrunch)

    有意思的是,如果视频是用YouTube自己的AI工具(比如Veo或Dream Screen)生成的,创作者连删除标签的权限都没有——标签会永久附着在视频上。

    AI生成内容如果包含C2PA元数据(表明其为完全AI生成),标签同样会被自动附加且无法移除。最近OpenAI也承诺采纳C2PA标准,跟Nvidia、Kakao、ElevenLabs站到了一起。

    标签展示位置大调整

    以前AI标签藏得挺深——除非视频涉及健康或新闻等敏感话题,否则标签只出现在展开的视频描述里。大多数观众根本不会注意到。

    现在YouTube把标签挪到了更显眼的位置:长视频的标签直接展示在视频播放器下方、描述区上方;Shorts的标签则直接叠在视频画面上。平台的说法是,这样观众在刷到拟真AI内容时能第一时间意识到「这不是真的」。

    至于那些只是轻微修改、动画化或明显不真实的AI视频(比如那个经典的「独角兽在奇幻世界奔跑」示例),标签仍然只出现在展开的描述里,不会在画面上干扰观看。


    deepfake检测同步扩张

    自动标注功能上线前不久,YouTube刚刚扩展了其AI深伪检测能力。最初只对名人、公众人物、政客和其他创作者开放人脸匹配扫描,现在任何成年用户都可以主动扫描平台上是否有冒用自己的AI生成视频。

    YouTube特别强调,AI标签不会影响视频的推荐权重,也不会影响变现能力。这一点对于创作者来说应该是个定心丸——标注AI内容不再意味着被限流。

    这套自动标注系统上线的时间点很微妙。上周谷歌在I/O开发者大会上刚刚发布了Gemini Omni,这个多模态AI模型家族能输出高质量视频,并且展现出对物理、文化、历史和科学的真实理解。换句话说,AI生成视频的「以假乱真」程度又上了一个台阶,YouTube不得不提前筑坝。

  • 我用Google的新AI模型Omni把自己P进了埃菲尔铁塔前,效果好到让我不安

    去年我用AI把孩子的毛绒玩具”深度伪造”成了一只去度假的小鹿,当时只是想验证一下Google在Gemini广告里承诺的功能到底靠不靠谱。视频没给孩子看,但那个实验让我开始认真思考:生成式AI的”无害娱乐”和”纯垃圾内容”之间,到底有没有界限?

    也许这两个圆圈完全重叠呢。也许不是。但有一件事我很确定:做出逼真的AI视频,需要的努力和知识少得令人惊讶。而这个趋势,在Gemini进入Omni时代之后,还在继续。

    Omni到底是什么

    Omni是Google新推出的一套生成式模型家族,号称有一天能把任何类型的输入——照片、视频、文字——变成任何其它东西。不过目前阶段,它还只是个视频生成工具。

    Omni Flash是这套模型里第一个正式发布的版本,现在已经可以在Google的AI视频生成和编辑平台Flow上用。如果你愿意,当然也可以继续用旧的Veo模型——但Omni在几个维度上确实比Veo进了一步。

    Google声称Omni在生成视频时会融入更多”现实世界知识”,因此能更好地保持角色在整个视频中的一致性。

    于是我把那只AI小鹿又请了出来,让它收拾行李再去冒险——看看Omni是不是真的如Google说的那样。

    结果:好得让人困惑

    怎么说呢,结果非常两极分化,甚至可以用”令人困惑”来形容。有些片段做得很好——比我五个月前测试Veo的时候一致性和还原度都高得多。但即使是最好的片段,也还是会有一些典型的”AI惊吓时刻”:比如小鹿在跳伞的时候突然换了朝向。

    我给了Omni更多创作空间:”做一个蒙太奇,展示小鹿打包行李、登上邮轮去热带度假的过程。氛围要可爱、好玩。小鹿在行李箱里塞了件搞笑的东西,后面会在片段里派上用场。”

    结果小鹿塞了一罐蜂蜜进去;后面确实有段情节是小鹿去够那罐蜂蜜,把它当成防晒霜在挤。说实话,这个桥段还不错。问题在于那瓶蜂蜜的外观在整个视频里一直在变:从玻璃罐,变成透明的挤压瓶,又变回装蜂蜜的挤压瓶。而我甚至不知道该怎么描述模型对视频最后一帧的处理——就好像它把刚才生成的所有元素一股脑吐出来就完事了。

    AI generated content label example
    Google Omni生成的AI内容会有标注 / The Verge

    编辑功能:有进步,但还不够

    你可以用文字提示词来建议对视频进行修改。实话实说,这方面Omni确实比Veo好用。但Veo的结果本来就烂得可以——我发现每次想改点什么,直接重新生成一个新视频反而更快。Omni确实会”听进”你的修改建议,但结果并不总是能打中你想要的点。

    我让它强调小鹿在度假片段里的面部反应,结果出来的东西看起来很怪异。它还时不时给小鹿加上鹿角——但小鹿根本没有鹿角,它还是个宝宝呢,谢谢。当我提示它去掉某个场景里突然出现的鹿角时,它照做了——然后在所有其他场景里都加上了鹿角。

    这一切都不是免费的

    生成视频是要消耗”积分”的,根据场景长度和起始”素材”的不同,一次消耗15到40积分不等。一轮编辑要花40积分。我订的是每月20美元的AI Pro方案,每月给1000积分。生成了大约20个片段、其中几个做了编辑之后,我的积分就只剩145了。

    如果你对想要生成的视频有比较具体的想法,那你可能要做好心理准备:跟模型来回拉锯很多轮才能得到一个接近你想象的视频,而每一轮都要烧积分。

    然后我把自己深度伪造了

    Omni号称的强项之一是把AI生成的内容叠加到真实视频上,所以我让小鹿休息了一下,转而深度伪造了我自己。我给Omni喂了一段自拍视频,表情很中性,然后让它生成我吃一盘意面、坐在飞机座位上、站在埃菲尔铁塔前咬一口法棍的视频。说实话,我没准备好面对我看到的东西。

    我的深度伪造视频里有一些”AI痕迹”:叉子碰到意面碗的那个声音有点太”做作”了;飞机视频的背景里有个女人出现了两次;但除了这些小故障和一种说不清的”诡异感”之外,它们逼真得要命。

    我把吃意面的片段给我丈夫看了。他知道我在测试AI视频工具,但我没告诉他场景里哪些部分是AI生成的。在不知道哪些是AI的情况下,他完全相信我就是坐在镜头前吃意面——他唯一的疑点是那个碗看起来不太眼熟。至于吃意面这个动作本身,逼真到足以让我丈夫信服——一个在过去十年里几乎每天看着我吃东西的男人。

    我的其他深度伪造视频有不同程度的”好到能在社交媒体上骗到人”。有几段埃菲尔铁塔的片段看起来有点卡通化,但其中一段逼真到你可能要反复看几次才能发现是AI。我知道那不是我,因为AI版本的我转过头时露出了扎成马尾的头发——但我不觉得其他任何人能看出区别,而这让我感觉很怪。


    我得诚实地说,我有点被这一切整累了。当初测试Veo 3的时候,我被它能产生的真实感震惊了。过去几年里,我一次又一次地被”用AI造出假人”有多容易而震惊。我可能也应该被Omni震惊,我想我确实震惊了,但那种”震惊感”已经磨掉了。

    要用AI做出一部”电影级杰作”,其实还没有Google想让你相信的那么容易。但Omni确实在某些可辨认的维度上比Veo有进步。如果你有一个Google账号和一张信用卡,那你只需要微不足道的努力,就能把一段自己坐在家里的视频变成看起来像在飞往毛伊岛的飞机上的画面。我不觉得我们正好站在”奇点的山麓”——但我们肯定已经深深陷入了诡异谷。