标签: 图像生成

  • 谷歌把文生图价格打下来了:Nano Banana 2 Lite 四秒出图

    谷歌 Nano Banana 2 Lite 高速文生图概念图
    谷歌新发布的 Nano Banana 2 Lite 主打高速、低成本的文生图能力

    如果你最近在折腾 AI 画图,应该对”又慢又贵”这四个字不陌生。想要一张能用的图,等上二三十秒是常事,批量出图更是烧钱。谷歌这周悄悄把这个问题往前推了一步——6 月 30 日,它发布了 Nano Banana 2 Lite,定位很直白:快,而且便宜。

    四秒一张,价格低到可以忽略

    按照谷歌的说法,这个新模型生成一张图只要大约四秒,比上一代 Nano Banana 2 快了不止一点。价格更夸张,每生成 1000 张图只要 0.034 美元。什么概念?你拿它来反复试稿、批量产出,成本几乎可以当它不存在。它并不是来替代旗舰的——谷歌另外还有更贵的 Nano Banana Pro,以及性能更强的 Nano Banana 2。Lite 干的是另一件事:把”高频、海量、要快”这条路补齐。

    “Building with generative media is often about creative iteration,” 谷歌在博客里写道,”有了这两个模型,开发者能把快速出图和视频创作串成一条完整的流水线。”

    不是更聪明,是更合适

    Lite 牺牲了多分辨率和一些重型能力(只输出 1K 分辨率),把全部算力压在了速度和单位成本上。对电商素材、广告创意快速迭代、自动化内容流水线这类场景来说,这恰恰是痛点。它已经通过 Google AI Studio、Gemini API 和 Gemini Enterprise Agent Platform 上线,并且直接取代了初代 Nano Banana——谷歌现在把初代叫做”legacy model”(遗留模型)。

    图片只是起点,视频才是下一步

    同一天,谷歌还把 Gemini Omni Flash 的开放范围扩大了。这个模型能把静态图直接变成视频,每秒输出收费 0.10 美元。谷歌顺手展示了个叫 Omni Product Studio 的演示应用,能把 Nano Banana 生成的图转成”电影感的电商视频”。换句话说,先用 Lite 极速出图,再喂给 Omni Flash 做视频,一条龙。


    热闹背后,争议没停

    当然,这事没那么干净。AI 生成图被骂成”AI slop”(AI 垃圾内容)的声音一直没断,有研究说 TikTok 上六成视频、YouTube 上两成多的内容都是 AI 生成的。可即便如此,大厂还在往里砸钱。

    谷歌自己也在靠近好莱坞——它刚和文艺片厂牌 A24 签了 7500 万美元的合作,粉丝那边反弹不小。一边是创作社区的警惕,一边是资本和效率的推力,文生图这条赛道只会更挤。

    • 速度:单张 1K 图约 4 秒,是上一代的五分之一
    • 成本:每 1000 张 0.034 美元,规模化出图几乎零边际成本
    • 定位:取代初代 Nano Banana,专注高吞吐工作流
    • 生态:与 Gemini Omni Flash 打通,图生视频一气呵成
  • OpenMontage:把 AI 编程助手变成「全自动视频制片厂」的开源智能体系统(37.4K★)

    OpenMontage:把 AI 编程助手变成「全自动视频制片厂」的开源智能体系统(37.4K★)

    OpenMontage 是全球首个开源的「智能体驱动(agentic)视频生产系统」,用 12 条生产流水线、52 个工具和 500+ 智能体技能,把 Claude Code / Cursor / Copilot 等 AI 编程助手直接变成一间完整的视频制片厂。

    项目简介

    一句话:把你的 AI 编程助手变成一间全自动视频制片厂。你只需用自然语言描述想法,OpenMontage 的流水线就会自动完成联网调研、脚本撰写、素材检索/生成、剪辑合成与质量自检,端到端产出成片。零付费 API Key 也能跑通完整链路。

    安装要求和过程

    环境要求

    • Python 3.10+(python.org 下载)
    • Node.js 18+(nodejs.org 下载)
    • 系统安装 FFmpeg(brew install ffmpeg / sudo apt install ffmpeg)
    • 一个能读取文件并运行代码的 AI 编程助手:Claude Code、Cursor、Copilot、Windsurf 或 Codex 任一即可
    • 可选 GPU:用于本地免费视频生成(make install-gpu,支持 wan2.1-1.3b 等模型)
    • API Key 全部可选:不付费也能出片,付费图像/视频商仅用于更高画质

    快速安装

    标准流程(需 make):

    git clone https://github.com/calesthio/OpenMontage.git
    cd OpenMontage
    make setup

    随后在 AI 编程助手中打开项目,输入需求即可,例如:

    "Make a 60-second animated explainer about how neural networks learn"

    无 make 环境可手动建虚拟环境(README 提供 macOS/Linux 与 Windows PowerShell 两套命令):

    python3 -m venv .venv
    source .venv/bin/activate
    pip install -r requirements.txt
    cd remotion-composer && npm install && cd ..
    pip install piper-tts
    cp .env.example .env

    make setup 后已自带 Piper 本地 TTS、Archive.org / NASA / Wikimedia 开放素材、Pexels / Unsplash / Pixabay、Remotion、HyperFrames、FFmpeg 与内置字幕。

    核心功能

    1. 端到端生产流水线:12 条预置流水线(科普解说、口播、纪录片混剪等),统一走 research → proposal → script → scene_plan → assets → edit → compose 七个阶段。
    2. 真实素材纪录片制作:无需付费视频模型,从 Archive.org / NASA / Wikimedia 等开放素材库语义检索并剪辑成片,而非仅仅把静态图做成动画。
    3. 参考驱动创作:贴一个你喜欢的视频,智能体会分析其节奏与钩子,生成差异化的制作方案(保留手法、替换主题)。
    4. 内置实时联网调研:写脚本前自动跑 15–25+ 次跨 YouTube / Reddit / 新闻 / 学术源的搜索,用真实数据支撑内容。
    5. 生产级质量门禁与预算治理:人工审批门、预合成验证、渲染后自检(ffprobe 抽帧 + 音频分析)、7 维打分选商、成本预估与上限(默认总预算 $10)。

    Backlot 制作工作台

    OpenMontage 内置 Backlot 可视化工作台,覆盖实时看板、故事板与素材库,让自然语言需求落到可逐帧审阅的制作流程:

    Backlot 实时制作看板(board-live)
    Backlot 实时制作看板(board-live)
    Backlot 故事板(storyboard)
    Backlot 故事板(storyboard)
    Backlot 素材库(library)
    Backlot 素材库(library)

    典型使用场景

    • 零 Key 科普 / 教学短片:一句 "Make a 45-second animated explainer about why the sky is blue" 即可生成带解说与字幕的动画片。
    • 免费真实素材纪录片:如 "Make a 90-second documentary montage about what a city feels like at 4am. Use real footage only",直接调用开放素材库剪辑,零成本成片。
    • 商业预告片(配置图像/视频商后约 $1–$3):科幻概念预告片、产品发布 Teaser 等;已展示案例成本最低 $0.02、最高数美元(如 Kling v3 成片 $1.33)。

    推荐理由

    OpenMontage 最打动我的是它把「做视频」从专业软件的高门槛,解放成一句自然语言需求。三点尤其值得一试:

    • 零 Key 也能跑通全链路:本地 Piper TTS + 开放素材 + Remotion 合成,对想低成本试水 AI 视频的人极友好。
    • 架构清爽、可扩展tools/ + pipeline_defs/ + skills/ 三层知识架构,可以自己加技能 / 工具;AGPL-3.0 开源、可自托管。
    • 内容有真实出处:「参考驱动 + 联网调研」让脚本不像纯生成那样空洞,预算门禁也让人敢放心把任务交给智能体跑。

    个人体会:第一次用 "Make a 60-second animated explainer about how neural networks learn" 跑通时,最惊艳的是它真的会先去查资料再写脚本——出来的东西有依据、有节奏,而不是随机拼接的炫技片段。

    下载地址

  • 谷歌又甩出一颗“轻量香蕉”:4秒出图,单张成本压到3分钱

    谷歌这两天悄悄把 Nano Banana 家族里最便宜的一颗“香蕉”推到了台前。名字叫 Nano Banana 2 Lite,6月30号上线,主打就两个字:快、便宜。

    它到底有多快多便宜?官方说法是,生成一张图大约4秒钟,单张1K分辨率的图像成本只要0.034美元——算下来一千张图才34美元。对于要做广告素材、电商图、A/B测试这种需要批量生产的活儿,这个价格和速度确实挺诱人。谷歌把它定位成“高吞吐工作流”的首选,专门给那些要一口气甩出成百上千张图的人用。

    从“香蕉”到“香蕉 Lite”,谷歌在搭一个三层货架

    其实 Nano Banana 这条产品线已经迭代好几轮了。最早的 Nano Banana 去年夏天跟着 Gemini 3.1 Flash 一起出来;今年2月又发了 Nano Banana 2,图像更真实;现在再加上一颗 Lite,还有一颗更贵更强的 Pro 专门给专业场景。谷歌现在明摆着是搭了个三层货架:Lite 管速度和成本,2 是“全能主力”,Pro 管精度和4K画质。

    顺带一提,初代 Nano Banana 已经被谷歌自己划进了“legacy(旧版)”行列,官方建议还在用的人直接换成 Lite。这种产品线的重新分类,平时没人注意,但对每一个要付账单的开发者来说,差别可大了。

    和 Lite 同一天来的还有个 Gemini Omni Flash,做视频的,0.1美元一秒。谷歌的算盘很清楚:你先用 Lite 飞快出图,再丢给 Omni Flash 把静态图变成能继续改的视频,一条图像到视频的流水线就串起来了。

    背后是一场和字节的价格肉搏

    别看谷歌发得低调,这步棋直接冲着字节跳动去的。第三方数据一对比就明白:字节的 Seedream 5.0 Lite 单张大概0.035美元、出图要45秒出头;Lite 这边0.034美元、4秒出图。单张差那一美分可以忽略,可一旦调用量上去了,延迟和成本会被成倍放大。文生图这个赛道,价格战是真的打响了。

    有意思的是,尽管外界对“AI 垃圾图”(AI slop)的吐槽没停过,大厂往图像和视频生成里砸的钱一点没少。谷歌特别爱把自家的模型包装成“帮你做广告”的顺手工具。


    谷歌 Nano Banana 2 Lite 图像模型
    谷歌新发布的 Nano Banana 2 Lite 图像生成模型(图源:TechCrunch)

    不过这里头有个拧巴的地方。就在这颗 Lite 上线的同时,谷歌刚跟独立电影厂牌 A24 签了7500万美元的合作,粉丝那边已经骂声一片。好莱坞和 AI 公司的关系越来越紧,创作者社区和普通观众的不安也在跟着涨。

    • 对开发者:4秒出图+极低单价,适合做素材工厂和实时预览
    • 对竞争对手:直接贴着字节 Seedream 打,价格战进入肉搏阶段
    • 对普通人:AI 生图会更便宜,但“AI 味”的内容也会更泛滥
  • Meta的AI生图刚上线就翻车:默认能拿你的公开照片去拼图

    Meta 超级智能实验室这周高调推出了图像生成模型 Muse Image,本想秀一把“把 AI 创作塞进 Instagram”的肌肉,结果其中一个功能刚露面就被用户和经纪公司围攻,不到三天就灰溜溜地撤了。

    问题出在那个“@一下”的功能

    Muse Image 可以让人在提示词里 @ 某个公开 Instagram 账号,模型就会去参考那个人的公开照片来生成图像。听起来是个挺聪明的社交创作玩法,但 Meta 压根没设计“通知对方”的机制——也就是说,别人拿了你的脸去生图,你可能完全不知情。公开账号默认是开启状态,想不被用,得自己进设置手动关掉。

    “我们的初衷是提供一个好用的创作工具,也给大家控制自己公开内容是否被引用的权利。但反馈告诉我们,这个功能没踩准点,所以已经下线了。”——Meta 官方博客

    经纪公司先急了

    第一个把 Meta 撤功能的决定捅出来的是 Puck News 的 Dylan Byers。据他转述,真正让 Meta 松手的,是用户和 talent agency(包括 CAA 这样的大牌经纪公司)的双重施压。想想也不意外:明星的公开照片本来就是被深伪色情内容盯得最狠的,平台再开个“一键拿脸”的口子,等于把火引到自己身上。

    这锅 AI 生图背了不止一次

    把公开照片默认纳入 AI 生成,Meta 不是头一个踩雷的。Google 刚把 Gemini 的 Nano Banana 接到 Google Photos 上,同样引发了“我的私人内容怎么被用了”的争议。区别是,Meta 这回连个提醒都没给,直接默认开启,激怒大家也就不奇怪了。

    • Muse Image 由 Meta 超级智能实验室(MSL)打造,支持提示词生图与局部修改
    • 提示词里 @ 公开账号即可引用其照片,默认不通知本人
    • 上线约三天后,在用户与经纪公司(含 CAA)施压下被移除
    Meta Muse Image 隐私争议概念图
    Muse Image 能融合公开 Instagram 照片生成图像,但“默认可用、不通知本人”的设计引发了隐私反弹。

    TechCrunch 还专门写了篇教程,教用户怎么关掉这个开关。一个功能需要媒体出科普帖教人“如何不被用”,本身就说明默认设置有多离谱。好在 Meta 这次认错挺快,但下一次“默认开启、事后道歉”的剧本,用户大概不会再买账了。

  • ComfyUI-Manager:ComfyUI 必备的插件管家,15.3K+ Stars 让节点安装一键搞定

    ComfyUI-Manager:ComfyUI 必备的插件管家,15.3K+ Stars 让节点安装一键搞定

    ComfyUI-Manager 主菜单

    项目简介

    ComfyUI-Manager 是 ComfyUI 生态的官方扩展「插件管家」,让你在图形界面里一键安装、更新、禁用、启用上千个自定义节点与模型,是每位 ComfyUI 用户都离不开的「应用商店」。项目由社区发起,现由 Comfy-Org 官方维护,已接入 registry.comfy.org 官方节点仓库,累计 15.3K+ Stars、2.3K+ Forks,采用 GPL-3.0 许可。

    安装要求和过程

    环境要求:已安装 ComfyUI;系统具备 Python 3Git 即可(无需额外依赖,纯 Python 实现)。

    方式一 · 通用安装(推荐)

    # 进入 ComfyUI 的自定义节点目录
    cd ComfyUI/custom_nodes
    git clone https://github.com/Comfy-Org/ComfyUI-Manager comfyui-manager
    # 重启 ComfyUI 即可在菜单看到 Manager 按钮

    方式二 · Windows 便携版:下载 install-manager-for-portable-version.bat 放入 ComfyUI_windows_portable 目录,右键「另存为」后双击运行。

    方式三 · comfy-cli 一并安装(最省心)

    python -m venv venv
    venv\Scripts\activate      # Linux/macOS 用 . venv/bin/activate
    pip install comfy-cli
    comfy install            # 同时装好 ComfyUI + ComfyUI-Manager

    方式四 · Linux + venv 脚本:下载 install-comfyui-venv-linux.sh 赋可执行权限后运行,自动完成 ComfyUI 与 Manager 的 venv 部署。

    核心功能

    • 一键管理自定义节点:内置 2000+ 节点库,图形界面中搜索、安装、更新、禁用、启用、卸载全部点点鼠标完成,告别手动 git clone + pip install
    • 模型一键下载与管理:集成模型库,直接在界面拉取常用模型权重,并可通过 extra_model_paths.yaml 统一管理模型路径。
    • 快照(Snapshot)管理:一键保存当前「节点 + 模型 + 配置」的完整状态,随时还原,是应对环境崩坏、多机一致的「救命功能」。
    • 缺失节点自动识别:导入他人工作流时,自动列出缺失的自定义节点并一键补齐,彻底解决「换个机器工作流就跑不起来」的问题。
    • 工作流分享 + 命令行 + 安全策略:支持分享到 comfyworkflows / OpenArt 等平台;提供 cm-cli 供高级用户脱离界面使用;security_level 与独立安装开关保障公共部署安全(V3.38 已迁移到受保护系统路径)。

    ComfyUI-Manager 安装对话框

    典型使用场景

    1. 新手快速搭建 AI 绘画工作流:刚装好 ComfyUI 不知道装什么?打开 Manager 搜索 ControlNet、AnimateDiff、IP-Adapter 等热门节点,一键安装即可开始出图。
    2. 团队 / 多机环境一致性:在一台机器调好所有节点后用快照保存,其他机器直接还原,杜绝「在我电脑上能跑」的玄学问题。
    3. 复现他人分享的工作流:从社区下载 .json 工作流,Manager 自动检测并安装其中缺失的节点,秒级复现大佬的节点组合。

    ComfyUI-Manager 模型安装

    推荐理由

    如果你用过 ComfyUI,一定体会过「满屏红字找不到节点」的痛苦。ComfyUI-Manager 把原本繁琐的命令行操作全部收敛为一个图形化面板,安装、更新、回滚一条龙,极大降低了 AI 绘画的入门门槛。个人最离不开的是它的快照功能——折腾节点把环境搞崩后,一个还原就能满血复活;而「缺失节点自动安装」让复现别人的工作流从半小时缩短到几秒钟。如今项目归入 Comfy-Org 官方维护、接入官方节点仓库,并更新了安全补丁,稳定性与可信度都上了一个台阶。一句话:装 ComfyUI 不装 Manager,等于买了手机不装应用商店。

    下载地址

  • Google Photos 上线「Video Remix」:你手机里那段糊视频,几秒钟被 AI 改头换面

    Google Photos Video Remix AI 视频重混功能示意图
    Google Photos 的 Video Remix 把 AI 视频编辑做成了相册里的一键按钮(配图由 AI 生成)

    你手机相册里那些拍得一般、光线很暗、背景很乱的视频,以前基本就躺在那儿吃灰了。现在 Google 想让你点一下,AI 把它们”重混”一遍。7 月 8 日,Photos 里上线了一个叫 Video Remix 的功能,它跑在 Gemini Omni 这套模型上,干的事很具体。

    几秒钟能改头换面

    给暗乎乎的片段补光(Google 管这叫 cinematic relighting),把平淡的背景换成别的场景,或者给整段视频套上水彩、速写本这类艺术风格。入口藏在 Photos 的 “Create” 标签页里,Google 把它定义成你的”创意中枢”。操作逻辑很简单:挑一段视频,选个效果,等几秒,出来一份被重新打过光的版本。

    这个功能不是给所有人开的。目前只面向 Google AI Plus、Pro、Ultra 这几个订阅档位的用户灰度推送,也不是全球同时铺开。换句话说,你如果还用着免费的 Photos,暂时看不到这个按钮。

    Google 自己的说明里反复强调,用 Video Remix 生成的视频会带上 SynthID 的隐形水印,标明”这是 AI 动手过的”。

    三个月塞了三个,相册快成工具箱了

    有意思的是,这已经不是 Google Photos 今年第一次往相册里塞 AI 生成类工具了。翻一翻时间线,短短三个月里它已经堆了至少三个功能相近的东西。用户打开相册,本意是找张旧照片,结果迎面撞上一堆”AI 帮你重做”的入口。功能多是好事,但当每个入口都在暗示”你原来的素材不够好、让我替你重造一遍”,体验就开始变味了。

    水印这事儿,真挡得住吗

    再说 SynthID。Google 一直把这套隐形水印当成”负责任 AI”的门面,意思是 AI 生成的内容能被溯源、被识别。理想很丰满:以后看到一段以假乱真的视频,系统能告诉你”这是 AI 改的”。但现实骨感——水印只对”在 Google 生态内生成”的内容有效。你导出视频、转码一遍、或者用别的工具再处理,水印就可能掉了。

    • 给暗光视频补光、换背景,门槛低到几乎零成本
    • 艺术风格迁移让”看起来像那么回事”变得特别容易
    • SynthID 只对原生生成内容生效,二次传播基本失效

    我倒不是说 Google 存了什么坏心。把专业级的视频调色、风格化能力下放到每个人的相册,确实是技术进步。但当一个日活几十亿的产品,把”AI 改写现实”做成一键按钮,它承担的就不只是”好玩”的责任了。水印是第一步,但远远不够。


  • Meta 新推的 Muse 图像生成器,最争议的功能是「拿你的照片做素材」

    Meta Muse AI 图像生成器概念图
    Meta 新推出的 Muse Image 图像生成器(配图由 AI 生成)

    Meta 今天把自家的 AI 图像生成器 Muse Image 正式放了出来,由 Meta 的超级智能实验室(Meta Superintelligence Labs)操刀,内部代号叫 Mango。它会通过 Meta AI 应用、Instagram Stories 和 WhatsApp 免费提供给用户使用。说白了就是又一个能让你输入一句话、吐出一张图的工具,能生成各种卡通、搞怪的画面。

    不靠你想 prompt,它先给你备好模板

    Meta 还怕你懒得想词,专门给 Muse 配了一批「预设」——也就是现成的提示词模板,帮你起头。其实 Muse 能干的事跟 Midjourney、DALL·E 那些老前辈差不多。你可以用它做广告图(过去一年 AI 已经大举入侵广告业了),也能拿它来捣鼓室内装修的灵感——比如视频里有人用 Muse 看看一张二手沙发摆到自己车库里是什么样。这个功能还打算跟 Facebook Marketplace 打通,也就是那个卖二手家具的地方。

    真正让人皱眉头的功能

    但有个功能挺让人不舒服:只要某个 Instagram 用户的资料是公开的,你 @ 一下 TA,就能直接拿 TA 的照片去生成新的 AI 图,而那个人根本不会收到任何通知。Wired 最早把这事点了出来——Meta 自己也说,别人「可能会用你的 Instagram 内容去创作 AI 内容」,而且你不会被通知。换句话说,你的脸、你的照片,成了别人随手可用的素材。

    Meta 的原话是:「人们可能会用你的 Instagram 内容,借助 Meta 的 AI 功能去创作内容」,而「你不会收到关于这些内容的通知」。

    Meta 的回应是「用户有控制权」,你可以去设置里把这个功能关掉。但问题在于,绝大多数人根本不知道有这回事,等你发现自己的照片被拿去生成了什么,往往已经晚了。这种「默认开启、手动退出」的设计,把保护隐私的责任一股脑推给了用户。

    免费只是开头

    Muse 对「日常创作」免费,但超过一定额度就得上 Meta 的订阅了。另外 Meta 还顺手在 Instagram Stories 里加了一批新的 AI 特效滤镜,支持各种自定义修改。至于视频版 Muse Video,据说已经在开发中。把 Muse 放进 Meta 这一年的产品清单里看,前面还有 Creator 助手、能 vibe coding 做小游戏的 Pocket,看起来很热闹,但华尔街一直吐槽 Meta 的 AI 战略「看不清主线」。不管怎么说,它在 AI 基础设施上的花钱速度一点没慢下来。


  • Stable Diffusion WebUI:最流行的AI图像生成工具,163K+ Stars让你在浏览器里玩转Stable Diffusion

    Stable Diffusion WebUI:最流行的AI图像生成工具,163K+ Stars让你在浏览器里玩转Stable Diffusion

    Stable Diffusion WebUI 界面截图

    🎨 项目简介

    Stable Diffusion WebUI 是由 AUTOMATIC1111 开发的基于 Gradio 框架的 Stable Diffusion 浏览器交互界面,是 AI 图像生成领域最流行、功能最完整的开源工具。只需简单部署,即可在浏览器中完成文生图、图生图、模型训练、参数微调等全流程 AI 绘画操作。

    🟣 163K+ Stars
    📦 最流行 AI 绘画工具
    🔧 丰富扩展生态
    💻 本地私有部署

    ⚙️ 安装要求和过程

    环境要求

    • Python 3.10.6(更高版本可能不兼容 torch)
    • Git
    • NVIDIA 显卡(推荐 4GB+ 显存,2GB 也可运行)
    • 或 AMD 显卡 / Intel 核显 / Apple Silicon(需参考对应安装指南)

    Windows 快速安装(推荐方式)

    # 方式1:一键包(最简单)
    下载 v1.0.0-pre 版本的 sd.webui.zip
    解压后依次运行 update.bat 和 run.bat 即可

    # 方式2:源码安装
    1. 安装 Python 3.10.6(勾选 “Add Python to PATH”)
    2. 安装 Git
    3. 克隆仓库:
    git clone https://github.com/AUTOMATIC1111/stable-diffusion-webui.git
    4. 双击运行 webui-user.bat

    Linux 安装

    # Debian/Ubuntu
    sudo apt install wget git python3 python3-venv libgl1 libglib2.0-0
    git clone https://github.com/AUTOMATIC1111/stable-diffusion-webui.git
    cd stable-diffusion-webui
    ./webui.sh

    🚀 核心功能

    🖼️ 文生图 / 图生图
    支持 txt2img 和 img2img 核心模式,内置参数调节、分辨率控制、批处理

    🎭 Inpainting / Outpainting
    支持局部重绘(内绘)和扩展画布(外绘),智能补全图像内容

    🔧 模型与扩展
    支持 Textual Inversion、LoRA、Hypernetworks,兼容数千个社区扩展插件

    🎨 后期处理与超分
    集成 GFPGAN、CodeFormer 人脸修复,RealESRGAN 超分辨率,批处理工具

    🎯 Attention 精准控制
    支持 ((keyword)) 和 (keyword:weight) 语法精确控制模型对提示词的关注度

    💡 典型使用场景

    🎬 场景一:AI 艺术创作

    输入自然语言提示词(如 “a fantasy castle on a floating island, digital art, trending on ArtStation”),即可生成高质量 AI 艺术作品。通过 Negative Prompt 排除不想要的元素,使用 X/Y/Z plot 批量测试不同参数组合,快速找到最佳生成配置。

    🔄 场景二:图生图风格转换

    上传参考图片,配合提示词进行风格转换(如将照片转为动漫风格、油画风格)。支持 Denoising strength 控制与原图的相似度,配合 Inpainting 可精确重绘指定区域(如更换人物服装、修改背景)。

    🏋️ 场景三:LoRA 模型微调与训练

    使用 Training 标签页训练自己的 Textual Inversion 嵌入或 LoRA 模型,只需几十张样本图片即可学习特定人物、风格或物品特征。训练完成后一键加载,在生成中调用自定义概念,实现个性化 AI 绘画。

    🌟 推荐理由

    Stable Diffusion WebUI 是 AI 绘画领域毫无争议的标杆工具。作为 GitHub 上 Star 数最多的 Stable Diffusion 界面(163K+),它不仅功能全面,更重要的是拥有最活跃的社区和扩展生态——目前已有数千个自定义脚本和扩展插件,覆盖从人脸修复、批量处理到 ComfyUI 工作流集成的各类需求。

    与云端 AI 绘画服务(如 Midjourney)相比,WebUI 的最大优势是完全本地运行,无需付费订阅,数据隐私有保障,且支持任意开源 Stable Diffusion 模型(SD1.5/SD2.0/SDXL/SD3 等)。对显存的要求也相当亲民——4GB 显存即可流畅运行,甚至 2GB 也有成功案例。

    无论你是 AI 艺术创作者、游戏美术设计师,还是仅仅对 AI 绘画感兴趣的爱好者,Stable Diffusion WebUI 都是最好的起点。一键安装脚本让部署变得异常简单,丰富的教程资源和社区支持也能帮助你快速上手。

    AI绘画
    Stable Diffusion
    图像生成
    本地部署
    开源
  • ComfyUI – 最强大的模块化AI内容创作引擎,节点式工作流颠覆传统AI生成

    ComfyUI Logo

    ComfyUI – 模块化AI内容创作引擎

    📦 项目简介

    ComfyUI 是最强大、最模块化的AI内容创作引擎,提供图形化节点界面来构建和执行AI生成工作流。支持图像、视频、3D模型、音频等多类型内容生成,无需编写代码即可搭建复杂的AI生成流程。

    ⭐ GitHub热门
    🎨 AI图像生成
    🎬 视频生成
    🎵 音频生成

    🔧 安装要求和过程

    环境要求

    组件 要求
    操作系统 Windows / Linux / macOS
    Python版本 推荐 3.13+(3.14存在部分兼容问题)
    PyTorch版本 推荐 2.4+(优先使用最新CUDA版本)
    GPU显存 最低 1GB(智能内存管理)

    快速安装(NVIDIA GPU)

    # 克隆仓库
    git clone https://github.com/Comfy-Org/ComfyUI.git
    cd ComfyUI

    # 安装PyTorch(CUDA 13.0)
    pip install torch torchvision torchaudio –extra-index-url https://download.pytorch.org/whl/cu130

    # 安装依赖
    pip install -r requirements.txt

    # 启动服务
    python main.py

    一键安装(推荐)

    🚀 Windows便携包:下载解压即用(NVIDIA版)

    📦 comfy-clipip install comfy-cli && comfy install

    🖥️ 桌面客户端:官网下载一键安装

    ☁️ 云端部署:Comfy Cloud(无本地硬件用户)

    ✨ 核心功能

    🎨

    多模态模型支持

    支持SD1.x/2.x、SDXL、SD3/3.5、Flux、Qwen Image、Hunyuan等图像模型;Stable Video Diffusion、Wan 2.1等视频模型;Stable Audio等音频模型;Hunyuan3D等3D模型

    异步队列+智能显存

    仅重新执行工作流中发生变化的部分,大幅提升运行效率;智能内存管理,最低支持1GB显存GPU运行大模型

    🔗

    节点式工作流

    图形化节点界面,灵活搭建复杂工作流;支持工作流保存/加载为JSON;App模式将复杂工作流封装为简易UI

    📦

    扩展生态丰富

    支持LoRA、Embedding、超网络加载;支持ControlNet、T2I-Adapter、GLIGEN等扩展;ComfyUI-Manager一键安装扩展

    🔒

    离线运行+完整复现

    核心功能不会自动下载额外内容,保护隐私;支持从生成的PNG、WebP、FLAC文件中加载完整工作流(包含种子参数),实现结果完整复现

    🎯 典型使用场景

    场景一:AI图像生成与工作流复用

    通过节点式工作流搭建复杂的图像生成流程(如:文生图+高清放大+面部修复),保存为JSON文件或PNG图片。下次直接加载工作流即可复现相同效果,大幅提升创作效率。支持LoRA微调模型,实现个性化风格生成。

    场景二:视频生成与编辑

    集成Stable Video Diffusion、Wan 2.1等视频生成模型,通过节点工作流实现文本生成视频、图片生成视频、视频风格转换等功能。支持视频帧插值、超分辨率等后处理节点。

    场景三:企业级AI内容生产流水线

    通过ComfyUI的API模式,将复杂的AI生成工作流封装为简易UI,供非技术团队成员使用。结合ComfyUI-Manager批量安装扩展,快速搭建企业内部的AI内容生产平台,实现批量图像/视频生成自动化。

    💡 推荐理由

    ComfyUI彻底改变了AI内容生成的工作方式——从”写提示词等待结果”进化到”可视化搭建AI生成流水线”。

    为什么值得尝试?
    灵活性无敌:节点式工作流让你可以精确控制AI生成的每一个环节,从模型选择、提示词处理、采样参数到后处理,全部可视化调整。
    社区生态强大:ComfyUI-Manager让扩展安装一键完成,数千个自定义节点覆盖各种需求(ControlNet、IP-Adapter、AnimateDiff等)。
    资源占用优化:智能显存管理让低显存用户也能跑大模型,异步队列提升生成效率。
    结果可复现:工作流嵌入PNG图片,分享作品的同时分享完整生成流程,AI创作的”开源”精神。

    如果你觉得WebUI”不够灵活”,或者想搭建自动化的AI内容生产流水线,ComfyUI绝对是最佳选择。节点式工作流的学习曲线稍陡,但一旦掌握,创作效率将大幅提升!

    📥 下载地址

    支持Windows / Linux / macOS | 最低1GB显存 | 开源免费

    🏷️ 标签:ComfyUI · 节点式 · AI绘画 · 图像生成 · Stable Diffusion · 工作流

    📌 归类:开源项目

  • 两千亿参数、原生全模态,智象未来把图像大模型卷到了新维度

    5月19日,智象未来在北京办了首届开放日,主题叫「Imagining the World」。会上最重磅的消息,是发布了参数超两千亿的图像大模型HiDream-O1-Image-Pro。

    告别「拼接味」,原生全模态才是正路

    现在市面上的图像生成模型,大多还是「拼接路线」——图像走一条路,文本走另一条路,最后拼在一起。这种做法在复杂语义理解、精准文字渲染上总是差点意思。

    HiDream-O1-Image-Pro换了个思路:把图像像素、文本标记和任务条件统一放进一个连续共享的标记空间,从底层就开始「混着学」。这个架构叫Unified Transformer(UiT),智象未来管它叫「原生全模态」。

    「当前很多『多模态大模型』,本质上还是『单模态拼接』。而原生多模态,是从一开始就把『世界的规则』刻进模型里——它知道物理定律、空间关系、因果逻辑,所以它能真正理解世界、推理世界,而不只是『生成内容』。」

    —— 智象未来创始人兼CEO 梅涛
    HiDream-O1-Image-Pro模型架构示意图
    HiDream-O1-Image-Pro架构示意图(图片来源:量子位)

    开源版已经打遍榜上无敌手

    其实在这之前,智象未来已经把8B参数的开源版本HiDream-O1-Image放到了全球评测平台Artificial Analysis上,结果在文生图开源模型里排到了全球第一,超过了Z-Image Turbo、Qwen-Image、FLUX.2这些主流对手。

    这次发布的Pro版是闭源版本,参数直接干到了两千亿以上,在复杂文本渲染、指令编辑、多主体个性化这些任务上全面刷新了SOTA纪录。

    半月内连融两轮,资本用脚投票

    开放日上还透露了一个信号:公司融资在提速。不久之前刚完成超5亿元融资,半月之内又敲定了新一轮,投资方包括深创投、金浦投资、财鑫资本、复聚资本等。

    现在的阵容很有意思:安徽、上海、湖南、杭州的多方产业基金在跟,深创投、东方富海、峰华资本这些头部市场化VC也在押注。这个资本组合,摆明了是要在「原生全模态」这个方向上重仓。

    商业化落地:三个智能体产品已经跑起来

    光有模型不够,智象未来同时亮出了三条产品线:

    • HiBurst:商业营销智能体,已覆盖TikTok、Meta、抖音、小红书等平台,是TikTok官方top5服务商,年生产电商营销视频超百万条
    • 帧赞:全球首个专业级AI影视创作智能体,已累计制作短漫剧超5000分钟
    • vivago:社媒创作智能体,近日登上Product Hunt日榜第一,覆盖全球100多个国家超4000万用户

    从视觉生成走向世界模型,这条路还长。但智象未来至少证明了一件事:原生全模态架构不是空中楼阁,它已经能打商业仗了。