标签: AI工具

  • NotebookLM 改名 Gemini Notebook:Google 把笔记本变成会写代码的分析终端

    Google 又改名字了。这次轮到 NotebookLM——那个最早因为”用资料生成播客”火出圈的研究工具。7 月 16 日,Google 正式把它改名为 Gemini Notebook。名字变了,能用的东西也多了一截:每个笔记本现在都是一个带安全隔离的容器,里面能直接写代码、跑数据分析。

    Google 将 NotebookLM 更名为 Gemini Notebook
    Google 将 NotebookLM 更名为 Gemini Notebook,并加入代码执行能力。(图源:TechCrunch)

    从 Project Tailwind 到 Gemini Notebook

    往前倒三年,2023 年 Google I/O 上它还没名字,叫 Project Tailwind,定位是”帮你读资料的 AI”。后来改叫 NotebookLM,一路加功能:让两个虚拟主播就着你的文档聊天的音频概览、视频摘要、更多文件格式、企业版套餐。到今天,它已经坐拥 3000 万用户,超过 60 万家组织在用。

    Google 这几年有个习惯:实验期先用个独立名字试水,等跑顺了就收进 Gemini 大旗。Bard 变 Gemini、Duet AI 变 Gemini for Workspace,现在轮到 NotebookLM。说白了,它不想让用户在好几个牌子里迷路。

    真正的变化:笔记本里能跑代码了

    改名只是门面,核心更新是每个笔记本变成一个独立的安全容器。用户可以在里面生成并运行代码,把多个来源的资料拉到一起做复杂的分析,结果直接在工具里呈现,不用再导出到别的环境里折腾。

    Google 表示,借助代码执行能力,用户能够接入多个来源,并在工具内部直接完成复杂的数据分析。

    这套玩法现在优先开放给 Google AI Ultra 付费用户,以及开了 AI Ultra Access、AI Expanded Access 的 Workspace 企业客户。普通 Pro 用户会在接下来几周内陆续拿到。

    它想成为你工作流里的那一层

    现在你已经在 Gemini App 里能翻看自己的笔记本,Google 还放话,很快就能在搜索的 AI Mode 里直接调出笔记本内容。换句话说,NotebookLM 当年是个独立的研究沙盒,Gemini Notebook 想做的是贯穿 Google 整个产品线的分析层。

    • 每个笔记本都是独立安全容器,代码和数据不出隔离环境
    • 多来源数据可在工具内直接跑分析,省去导出到外部环境的环节
    • Ultra 与企业客户先用,Pro 用户几周后跟进
    • 笔记本将接入 Gemini App 与搜索 AI Mode,打通使用场景

    对普通用户来说,名字怎么改无所谓,关键是它能把”读资料—想清楚—出结果”这件事压缩在同一个界面里。当研究工具开始自己写代码跑数,AI 助手的边界又往外推了一步。

  • Ollama 融了 6500 万美元:给 AI 做个「Docker」,月活逼近 900 万开发者

    Ollama 这个开源小工具,最近把 B 轮融到了 6500 万美元,由 Theory Ventures 领投。加上之前 Benchmark 的 Peter Fenton 领投的 1500 万 A 轮,公司到现在一共拿了 8800 万美元。

    Ollama 2023 年出来,干的事很实在:帮开发者在自己电脑上跑开源权重的大模型,几分钟就能跑起来。它在 GitHub 上攒了 17.6 万 star、快 1.7 万 fork,也被无数教程和视频夸过。

    Ollama 两位创始人 Jeff Morgan(左)与 Michael Chiang(右)
    Ollama 两位创始人 Jeff Morgan(左)与 Michael Chiang(右)

    两个做过 Docker 的人,想给 AI 也做个「容器」

    创始人 Jeff Morgan 和搭档 Michael Chiang 之前参与做过 Docker Desktop,就是那个把云端应用搬来搬去变得轻松的工具。Docker 后来收购了他们上一家公司 Kitematic。所以 Ollama 干的事,本质上就是「AI 版的 Docker」:把烦人的硬件配置、环境依赖全部藏起来。

    Morgan 说,2023 年开源模型刚冒头的时候特别难用,那时候它们是给研究者准备的,不是给程序员准备的。想跑起来真的费劲。三年过去,现在 Ollama 每个月被超过 890 万开发者使用,进了 85% 的财富 500 强,而公司只有 14 个人。

    真正的拐点,是智能体带火了开源模型

    Morgan 把公司的转折放到今年 1 月前后,那时候 OpenClaw 这类智能体突然变热,更大的开源模型忽然能干活了,比如写代码。他发现,愿意付钱的用户,尤其是兜里有钱的企业和快速成长的 AI 应用公司,开始越来越多地转向更便宜的开源模型,只在必要的时候才去碰 Anthropic 这种闭源模型。

    我觉得大多数人辩论时都搞错了一点。这不是二选一。开源和闭源都有大把生意可做,但凡是推理成本高的公司,都有个关乎生死的项目在推着他们往开源权重模型挪。

    不是所有人都买账

    当然,也不是每个 Ollama 粉丝都高兴它开始赚钱。大概一年前,一堆博客和社交帖子抱怨它的云服务抢了免费项目的风头,把它当成开发工具「糊化」的典型。Morgan 的回应是:那些太大的开源模型本来就没法在个人电脑上跑,所以我们说,那我们来帮你找算力。Fenton 也补了一句:桌面端那个免费产品一点没变,你照样能发现、能跑本地模型。

    • Ollama 想做的不是又一个模型,而是模型和开发者之间的那层基础设施
    • 开源模型的性价比,正在把企业从闭源 API 手里一点点撬走
    • vLLM、SGLang、NanoClaw 这些开源项目也在长成公司,VC 开始追这一类
    • 14 个人、890 万月活,这个人均产出数字挺吓人

  • X推出官方MCP服务器,AI助手现在能直接连上社交平台了

    马斯克的X平台这两天上线了一个新功能,可能会改变AI助手使用社交网络的方式。

    简单说,X现在提供了一个”托管版MCP服务器”。MCP全称是Model Context Protocol,是一个开放标准,定义了AI模型怎么连接外部工具和服务。以前,如果你要让Claude或Cursor这类AI助手去读取X上的内容,开发者得自己搭一个MCP服务器、自己托管、自己搞定X API的接入和鉴权——挺麻烦的一件事。

    现在X把这件事包了。开发者不需要再操心基础设施,只要让用户用自己的X账号授权,AI工具就能直接连上X平台。

    X MCP服务器概念图
    X推出托管版MCP服务器,AI工具可直接连接平台

    这不是第一个,但可能是最重要的一个

    MCP标准出来之后,不少公司都跟着推出了自己的官方MCP服务器或者接入点。GitHub、Slack、Notion、Stripe、Salesforce——这些平台的用户量加起来,基本覆盖了知识工作者的全部工作流。

    X现在也加入了这个名单。但X的特殊之处在于,它不是一个”生产力工具”——它是一个实时信息网络。AI助手如果能直接、顺畅地读取X上的讨论、趋势和链接,那它的”实时性”会提升一大截。

    X在这件事上的算盘很清楚:它不想只做一个”社交 Hangout”,它想成为AI应用赖以运行的实时信息层。

    有个关键限制:不能发帖

    看到这里,你可能会想:那以后AI助手是不是可以替我在X上发帖了?答案是否定的。

    X明确澄清了,这次上线的MCP工具不支持写操作。也就是说,AI可以帮你搜索、读帖、分析趋势,但不能替你发帖。这其实是个挺明智的决定——如果开放了发帖权限,后果可能是灾难性的。

    事实上,X今年以来一直在跟AI生成的垃圾内容打交道。平台更新了API v2,专门应对程序化的自动回复。同时,X还提高了发帖的API定价——发一条带链接的帖子现在要花20美分,比之前贵了不少。用X自己的话说,涨价是为了”遏制滥用向量”。

    对开发者意味着什么

    对开发者来说,X提供托管MCP之后,集成X数据到AI应用的门槛低了很多。你不需要再维护一套MCP服务器的基础设施,只需要处理用户授权和后续的数据处理逻辑。

    这也意味着,接下来可能会出现一批新的AI工具,它们能实时”感知”X上的讨论热点,然后基于这些信息做摘要、分析、甚至辅助决策。想象一下:一个研究助手,不仅能读论文,还能同时捕捉学界在X上的最新争论——这比单纯搜论文要快得多。


  • AI agent 进了手机键盘,以后打字就能直接办事

    你每天在手机上敲的字,背后藏着的意图,有没有可能直接变成行动?新加坡一个创业团队正在做这件事——他们把 AI agent 塞进了手机键盘里。

    Acti AI智能键盘概念图
    Acti 把 AI agent 直接嵌入手机键盘

    键盘才是最佳的 AI 入口

    Acti 的创始人兼 CEO Young Wang 有个很直接的观察:今天用 AI 最麻烦的地方在于,你的上下文散落在无数个 App 里。和朋友聊到某家餐厅,想查评价,得切出去打开点评软件;聊到某只股票,想看实时价格,又得切到行情软件。

    他说,现在的 AI agent 从根本上就受限,因为用户的上下文是碎片化的。Acti 的思路是:键盘是你和手机交互最基础的界面,它横跨所有 App,如果能在这里建一层属于用户自己的上下文,AI agent 才能真正发挥作用。

    键盘是所有人每天用得最多的软件,但它一直只是个输入工具。到了 AI 时代,它应该成为意图和行动之间的桥梁。

    长按一个键,触发一串操作

    Acti 的核心功能叫”Skills”,类似自定义快捷键。用户可以给某个按键设定一个多步任务——比如长按字母 T,整段消息就被翻成英文;长按 C,会议链接直接发出去。

    不需要会写代码。你想要什么功能,用自然语言描述一下,Acti 帮你生成这个 Skill。内测阶段,用户在不到两周的时间里就自己造了超过 1000 个 Skills。有人做了查世界杯实时数据的,有人做了拉 Polymarket 赔率的,都放在 Skill 市场里给别人用。

    底层模型用的是 Google 的 Gemini,选它的理由是综合平衡了智能水平、响应速度、多语言表现和成本。Gemini 支持多模态,也适合驱动 Skills 这种需要理解用户意图然后触发动作的功能。

    隐私怎么算

    把键盘换成 AI 驱动的,最自然的担心是隐私。Acti 的说法是”本地优先”——个人上下文默认存在设备上,除非用户主动触发需要云端处理的功能,否则私人消息和对话内容不会被上传。

    这个承诺够不够,取决于你信不信。但至少从产品设计上看,他们意识到了这个问题。

    创始人做过 3 亿日活的键盘

    Young Wang 不是第一次做键盘。他在百度待了十年,把 Facemoji 键盘做到了 3 亿日活。那是表情包和主题皮肤的生意,但积累了对键盘这个特殊场景的理解——怎么在方寸之间做输入体验,怎么处理多语言,怎么在资源受限的移动端跑模型。

    Acti 的 CTO Mike Sun 也不简单,他是百度云相册平台 Yike Album 的创始技术负责人,那个产品峰值时也有 1000 万日活。CSO Junbo Yang 之前在 HashKey Capital 做消费赛道投资。

    这帮人刚完成了一笔 530 万美元的种子轮,由 BITKRAFT Ventures 领投。投资方的逻辑很直接:人机交互的下一个阶段,入口可能在键盘。

    Acti 目前还在早期,商业模式打算走订阅——付钱能用更强的模型、更多的每日调用次数。Skill 市场将来也可能分成。但所有这些的前提是,用户愿意换掉自己用了好几年的键盘,为一个”AI 能帮你做事”的承诺。

    这个前提成不成立,接下来几个月就能看到。


  • MoneyPrinterTurbo:AI 自动生成短视频,93K+ Stars 让创作零门槛

    MoneyPrinterTurbo:AI 自动生成短视频,93K+ Stars 让创作零门槛

    🎬 MoneyPrinterTurbo:AI 自动生成短视频,93K+ Stars 让创作零门槛

    基于 AI 大模型的短视频自动生成工具|支持中英文|一键跨平台发布

    93.1K+
    ⭐ GitHub Stars
    Python
    💻 主要语言
    MIT
    📄 开源许可
    35K+
    📈 本月新增

    📌 项目简介

    MoneyPrinterTurbo 是一款基于 AI 大模型的短视频自动生成工具,由开发者 harry0703 创建并维护。只需提供一个视频主题或关键词,系统即可全自动完成文案生成、素材匹配、字幕合成、背景音乐搭配,最终输出高清短视频(支持竖屏 9:16 和横屏 16:9)。

    项目在 GitHub 上已获得 93,118 Stars,是本月 GitHub 趋势榜 Python 类目第二名(新增 35,397 Stars),深受内容创作者和 AI 爱好者欢迎。

    🔧 安装要求和过程

    环境要求

    • Python 版本:3.11+(推荐,项目使用 uv 管理依赖)
    • 核心依赖:Streamlit(Web界面)、FastAPI(API服务)、MoviePy 2.x(视频处理)、ffmpeg
    • AI 服务:需配置至少一家 LLM 提供商 API Key(支持 15+ 家)
    • 素材服务:需配置 Pexels 或 Pixabay API Key(免费申请)

    快速安装(三种方式)

    方式一:Docker 部署(推荐)

    # 1. 安装 Docker Desktop(Windows 用户需先配置 WSL)
    # 2. 克隆项目
    git clone https://github.com/harry0703/MoneyPrinterTurbo.git
    cd MoneyPrinterTurbo

    # 3. 一键启动(自动拉取预构建镜像)
    docker compose -f docker-compose.release.yml up

    # 4. 访问
    # Web 界面:http://127.0.0.1:8501
    # API 文档:http://127.0.0.1:8080/docs

    方式二:本地手动部署

    # 1. 克隆项目
    git clone https://github.com/harry0703/MoneyPrinterTurbo.git
    cd MoneyPrinterTurbo

    # 2. 使用 uv 安装依赖(推荐)
    uv python install 3.11
    uv sync –frozen

    # 3. 配置 API Key
    cp config.example.toml config.toml
    # 编辑 config.toml,填入 pexels_api_keys 和 llm_provider 配置

    # 4. 启动 Web 界面
    uv run streamlit run ./webui/Main.py –server.showEmailPrompt=False

    # 5. 启动 API 服务(可选)
    uv run python main.py

    方式三:Windows 一键启动包

    GitHub Release 下载最新一键启动包,解压后先双击 update.bat 更新代码,再双击 start.bat 启动即可。

    ✨ 核心功能

    • AI 全自动文案生成:接入 15+ 家 LLM 服务商(OpenAI / DeepSeek / Kimi / 通义千问 / Gemini / Ollama 等),自动生成视频脚本,支持中英文双语。
    • 智能素材匹配:集成 Pexels、Pixabay、Coverr 三大无版权素材源,根据文案关键词自动匹配高清视频片段,也支持上传本地素材。
    • 多语音合成引擎:内置 Edge TTS(免费,无需 API Key)、Azure TTS V2、ElevenLabs TTS,支持 23+ 种语言,可实时试听效果。
    • 丰富字幕样式:支持自定义字体、位置、颜色、大小、描边效果,基于 Pillow 渲染(不再依赖 ImageMagick),字幕时间戳精确对齐。
    • 一键跨平台发布:生成完成后可自动上传至 TikTok、Instagram、YouTube Shorts(需 Upload-Post 账号),YouTube 发布自动标注”AI 生成内容”。

    🚀 典型使用场景

    场景一:知识科普短视频批量生产

    自媒体运营者需要每天发布 3-5 条科普短视频,但缺乏视频剪辑时间和素材。使用 MoneyPrinterTurbo,只需输入”量子计算入门””黑洞是什么”等主题,AI 自动生成文案并匹配宇宙、科技素材,10 分钟内完成 5 条视频生成,大幅降低内容生产成本。

    场景二:跨境电商产品宣传视频

    电商卖家需要为每款产品制作多语言宣传短视频。通过自定义文案 + 本地素材上传功能,批量生成中英双语产品介绍视频,配合一键跨平台发布功能,快速覆盖 TikTok、Instagram 等海外社媒渠道。

    场景三:本地 LLM 隐私保护场景

    对数据隐私有严格要求的企业用户,可配置 Ollama 本地 LLM 提供商,所有文案生成均在本地完成,无需将敏感信息发送至第三方 API,兼顾 AI 能力提升与数据安全合规。

    💡 推荐理由

    作为一个 AI 工具爱好者,我认为 MoneyPrinterTurbo 最打动人的地方在于它的「降维打击式」易用性

    • 零视频编辑基础也能用:传统视频制作需要掌握剪辑软件、素材版权、配音等多项技能,而 MoneyPrinterTurbo 把这些全部封装成一个 Web 界面,点几下鼠标就能出片。
    • AI 大模型生态友好:支持 Ollama 本地模型是一大亮点,意味着你可以在没有 API 费用的情况下无限生成文案,对个人创作者非常友好。
    • 开源且活跃:MIT 许可允许自由修改和商用,社区活跃(本月新增 35K+ Stars),Bug 修复和功能迭代速度快。
    • 不只是「玩具」:内置的批量生成、API 接口、跨平台发布等功能,已经让它具备了生产级工具的属性,而不只是一个 Demo。
    ⚠️ 使用提醒:AI 生成的视频内容请注意平台审核规则,YouTube 已要求标注”AI 生成内容”。另外,虽然素材来自无版权平台,但商业使用前建议再次确认素材许可协议。

    🛠️ 技术栈

    Python 3.11
    Streamlit
    FastAPI
    MoviePy 2.x
    ffmpeg
    Edge TTS
    Docker
    uv

    🤖 支持的 AI 模型

    MoneyPrinterTurbo 支持接入以下大模型服务(在 config.toml 中配置):

    # LLM 提供商列表(任选其一配置 API Key)
    OpenAI / AIHubMix / AIML API / EvoLink
    Moonshot(Kimi)/ Azure / gpt4free / one-api
    通义千问(Qwen)/ Google Gemini / DeepSeek
    MiniMax / 文心一言 / Pollinations / ModelScope
    Ollama(本地模型,无需 API Key)💡 推荐个人用户使用

    📥 下载地址

    📌 开源许可:MIT License,可自由使用、修改和分发,包括商业用途。
    🌟 项目热度:93,118 Stars | 本月新增 35,397 Stars | GitHub Python 趋势榜 Top 2
    💬 社区:Issues 和 PR 活跃,开发者响应及时。

  • Stable Diffusion WebUI:最流行的AI图像生成工具,163K+ Stars让你在浏览器里玩转Stable Diffusion

    Stable Diffusion WebUI:最流行的AI图像生成工具,163K+ Stars让你在浏览器里玩转Stable Diffusion

    Stable Diffusion WebUI 界面截图

    🎨 项目简介

    Stable Diffusion WebUI 是由 AUTOMATIC1111 开发的基于 Gradio 框架的 Stable Diffusion 浏览器交互界面,是 AI 图像生成领域最流行、功能最完整的开源工具。只需简单部署,即可在浏览器中完成文生图、图生图、模型训练、参数微调等全流程 AI 绘画操作。

    🟣 163K+ Stars
    📦 最流行 AI 绘画工具
    🔧 丰富扩展生态
    💻 本地私有部署

    ⚙️ 安装要求和过程

    环境要求

    • Python 3.10.6(更高版本可能不兼容 torch)
    • Git
    • NVIDIA 显卡(推荐 4GB+ 显存,2GB 也可运行)
    • 或 AMD 显卡 / Intel 核显 / Apple Silicon(需参考对应安装指南)

    Windows 快速安装(推荐方式)

    # 方式1:一键包(最简单)
    下载 v1.0.0-pre 版本的 sd.webui.zip
    解压后依次运行 update.bat 和 run.bat 即可

    # 方式2:源码安装
    1. 安装 Python 3.10.6(勾选 “Add Python to PATH”)
    2. 安装 Git
    3. 克隆仓库:
    git clone https://github.com/AUTOMATIC1111/stable-diffusion-webui.git
    4. 双击运行 webui-user.bat

    Linux 安装

    # Debian/Ubuntu
    sudo apt install wget git python3 python3-venv libgl1 libglib2.0-0
    git clone https://github.com/AUTOMATIC1111/stable-diffusion-webui.git
    cd stable-diffusion-webui
    ./webui.sh

    🚀 核心功能

    🖼️ 文生图 / 图生图
    支持 txt2img 和 img2img 核心模式,内置参数调节、分辨率控制、批处理

    🎭 Inpainting / Outpainting
    支持局部重绘(内绘)和扩展画布(外绘),智能补全图像内容

    🔧 模型与扩展
    支持 Textual Inversion、LoRA、Hypernetworks,兼容数千个社区扩展插件

    🎨 后期处理与超分
    集成 GFPGAN、CodeFormer 人脸修复,RealESRGAN 超分辨率,批处理工具

    🎯 Attention 精准控制
    支持 ((keyword)) 和 (keyword:weight) 语法精确控制模型对提示词的关注度

    💡 典型使用场景

    🎬 场景一:AI 艺术创作

    输入自然语言提示词(如 “a fantasy castle on a floating island, digital art, trending on ArtStation”),即可生成高质量 AI 艺术作品。通过 Negative Prompt 排除不想要的元素,使用 X/Y/Z plot 批量测试不同参数组合,快速找到最佳生成配置。

    🔄 场景二:图生图风格转换

    上传参考图片,配合提示词进行风格转换(如将照片转为动漫风格、油画风格)。支持 Denoising strength 控制与原图的相似度,配合 Inpainting 可精确重绘指定区域(如更换人物服装、修改背景)。

    🏋️ 场景三:LoRA 模型微调与训练

    使用 Training 标签页训练自己的 Textual Inversion 嵌入或 LoRA 模型,只需几十张样本图片即可学习特定人物、风格或物品特征。训练完成后一键加载,在生成中调用自定义概念,实现个性化 AI 绘画。

    🌟 推荐理由

    Stable Diffusion WebUI 是 AI 绘画领域毫无争议的标杆工具。作为 GitHub 上 Star 数最多的 Stable Diffusion 界面(163K+),它不仅功能全面,更重要的是拥有最活跃的社区和扩展生态——目前已有数千个自定义脚本和扩展插件,覆盖从人脸修复、批量处理到 ComfyUI 工作流集成的各类需求。

    与云端 AI 绘画服务(如 Midjourney)相比,WebUI 的最大优势是完全本地运行,无需付费订阅,数据隐私有保障,且支持任意开源 Stable Diffusion 模型(SD1.5/SD2.0/SDXL/SD3 等)。对显存的要求也相当亲民——4GB 显存即可流畅运行,甚至 2GB 也有成功案例。

    无论你是 AI 艺术创作者、游戏美术设计师,还是仅仅对 AI 绘画感兴趣的爱好者,Stable Diffusion WebUI 都是最好的起点。一键安装脚本让部署变得异常简单,丰富的教程资源和社区支持也能帮助你快速上手。

    AI绘画
    Stable Diffusion
    图像生成
    本地部署
    开源
  • OpenCut:开源CapCut替代品,免费视频剪辑工具,58,936+ Stars让创作者不再被绑架

    OpenCut:开源CapCut替代品,免费视频剪辑工具,58,936+ Stars让创作者不再被绑架

    OpenCut

    开源 CapCut 替代品,免费视频剪辑工具

    ⭐ 58,936+ Stars
    🍴 6,420+ Forks
    📅 2025-06 创建
    📄 MIT 许可

    OpenCut Logo

    OpenCut 项目组织头像

    📌 项目简介

    OpenCut 是一款免费开源的视频剪辑工具,定位为 CapCut(剪映国际版)的开源替代品。项目支持 Web、桌面和移动端三端,基于 Rust 核心 + TypeScript/Next.js 构建,MIT 许可确保永久免费。项目在 GitHub 上仅用不到一年时间就获得了近 6 万星标,是 2026 年最受关注的开源创意工具之一。

    58,936+
    GitHub Stars

    6,420+
    Forks

    328
    Open Issues

    TypeScript
    主要语言

    ⚙️ 安装要求和过程

    环境要求

    • Node.js / Bun 运行时(项目使用 Bun 作为包管理器)
    • proto 工具链管理器(用于管理 Bun 和 moon 版本)
    • Rust 编译环境(核心模块,正在重写中)
    • Git

    快速安装步骤

    # 1. 安装 proto 工具链管理器
    bash <(curl -fsSL https://moonrepo.dev/install/proto.sh)

    # 2. 克隆仓库
    git clone https://github.com/OpenCut-app/OpenCut.git
    cd OpenCut

    # 3. 安装依赖(proto 会自动安装 bun + moon)
    proto use
    bun install

    # 4. 启动开发服务器
    moon run web:dev # Web 端 → localhost:5173
    moon run api:dev # API 端 → localhost:8787

    💡 当前项目正在从零重写(rewrite 分支),经典版本可在 opencut-classic 仓库获取。

    ✨ 核心功能

    1

    三端统一,随处剪辑

    基于 Rust 核心 + TypeScript/Next.js 构建,同一套代码库同时支持 Web 浏览器、桌面应用(Windows/macOS/Linux)和移动端(iOS/Android),随时随地继续你的剪辑项目。

    2

    插件优先架构,无限扩展

    正在重写中的版本采用插件优先(plugin-first)架构,支持一等公民第三方插件。官方将提供 Editor API,让开发者可以深度定制剪辑功能,打造专属工作流。

    3

    MCP 服务器支持,AI 智能体就绪

    重写的 OpenCut 将内置 MCP(Model Context Protocol)服务器,允许 AI 智能体直接调用剪辑功能。这意味着未来可以用自然语言描述剪辑需求,由 AI 自动完成视频编辑。

    4

    无头模式,批量自动化渲染

    支持 Headless 模式(无界面运行),可用于自动化批处理、模板化视频生成等场景。结合脚本功能(编辑器内直接编写脚本),可实现复杂的自动化剪辑流程。

    5

    隐私优先,MIT 永久免费

    MIT 许可协议确保项目永远免费、永远开源。与 CapCut 不断加锁基础功能、强制水印不同,OpenCut 承诺永不收费、永不加水印,所有数据本地处理,隐私完全掌控在自己手中。

    🎬 典型使用场景

    📱 场景一:短视频创作者

    抖音、快手、B站短视频创作者可以用 OpenCut 替代 CapCut,完成剪辑、字幕、转场、滤镜等全套操作。MIT 许可意味着你可以商用、可以二次开发,不用担心版权问题。Web 端无需安装,打开浏览器就能剪。

    🤖 场景二:AI 辅助视频生产

    利用即将上线的 MCP 服务器功能,可以将 OpenCut 接入 AI 智能体工作流。例如:用 LLM 生成视频脚本 → AI 自动匹配素材库 → 调用 OpenCut MCP 接口自动剪辑 → 批量生成多语言版本。这对于内容电商、教育培训等需要大量视频内容的场景极具价值。

    🏢 场景三:企业内网部署

    OpenCut 支持自托管部署,企业可以在内网搭建私有视频剪辑平台,供市场部、培训部等团队使用。不同于 CapCut 需要联网、有数据出境风险,OpenCut 完全离线运行,满足金融、政府等行业的数据合规要求。

    💡 推荐理由

    CapCut 无疑是当前最好用的免费视频剪辑工具之一,但它的”免费”正在逐步缩水 —— 高级功能不断收归付费墙后,导出视频强制加水印,这一切都让创作者感到被绑架。

    OpenCut 的出现,给了创作者一个真正的选择。它不只是”另一个剪辑工具”,而是从根本上重新思考了视频编辑软件的商业模式 —— 软件本身应该免费,开发者通过企业赞助和高级服务盈利(fal.ai 已是赞助商)。这种模式下,普通用户永远免费,企业用户获得专业支持,开发者有可持续的收入来源。

    特别值得关注的是它的 MCP 服务器计划。当大多数剪辑软件还在思考如何整合 AI 时,OpenCut 直接把剪辑能力暴露为 MCP 接口,让任何 AI 智能体都能调用。这意味着不久的将来,你可能对 AI 说”帮我把这段素材剪成 30 秒的抖音风格视频”,AI 就会直接调用 OpenCut 完成剪辑。

    当然,项目目前处于重写阶段(rewrite 分支),经典版本功能已经可用,但新架构带来的插件系统、MCP 支持等还需要等待。如果你等不及,可以先使用 opencut.app 的在线版本。

    🔧 技术架构

    核心语言 Rust(核心模块)+ TypeScript(前端/后端)
    前端框架 Next.js(React 生态)
    包管理器 Bun(高性能 JS 运行时)
    构建工具 moon(monorepo 任务编排)
    许可协议 MIT License(永久免费开源)
    托管平台 GitHub(OpenCut-app/OpenCut)

    📥 下载地址

    当前经典版本可直接使用,重写版本请关注 new.opencut.app 上线通知

    OpenCut 正在重新定义视频剪辑软件的可能性 —— 免费不代表低质,开源不代表难用。

    项目处于活跃开发阶段,建议 Star 收藏以跟进最新进展 🌟

  • LobeChat —— 72K+ Stars 开源 AI 聊天框架,比 ChatGPT 更自由的选择

    LobeChat —— 72K+ Stars 开源 AI 聊天框架,比 ChatGPT 更自由的选择

    🤯 LobeChat

    开源 AI 聊天框架,72K+ Stars,比 ChatGPT 更自由的 AI 客户端

    ⭐ GitHub 72K+ Stars  | 
    🌐 在线体验  | 
    MIT 开源

    📌 项目简介

    LobeChat 是 LobeHub 团队开发的开源 AI 聊天框架,也是 GitHub 上 Star 数最多的开源 AI 客户端之一(72K+ Stars)。它支持 Web 和桌面两种形式,在一个界面里同时接入 GPT、Claude、Gemini、DeepSeek、Ollama 等 80+ 模型,还内置插件市场、RAG 知识库、多模型对比等实用功能。最重要的是——完全免费开源,数据可完全本地化

    72K+
    GitHub Stars

    🤖
    80+
    支持模型

    🔌
    40+
    内置插件

    💻
    3 平台
    Web/桌面/Docker

    1
    安装要求和过程

    环境要求

    部署方式 环境要求
    Web 版 浏览器访问,无需安装
    桌面版 Windows/macOS/Linux,下载安装包
    Docker Docker + Docker Compose
    本地开发 Node.js 18+, pnpm, Git

    快速安装(桌面版)

    # 1. 从 GitHub Releases 下载对应平台安装包

    https://github.com/lobehub/lobe-chat/releases

    # Windows: LobeChat-win.exe

    # macOS: LobeChat-mac.dmg

    # Linux: LobeChat-linux.AppImage

    Docker 部署(自托管推荐)

    # 拉取镜像并启动

    docker run -d -p 3210:3210 \

    -e OPENAI_API_KEY=your-key \

    –name lobechat lobehub/lobe-chat

    2
    核心功能

    🤖 多模型统一接入

    支持 OpenAI、Claude、Gemini、DeepSeek、Kimi、智谱、Ollama 等 80+ 模型,一个界面随意切换。自定义 Base URL,可接入任何兼容 OpenAI 协议的 API。

    🔌 插件市场 + MCP 集成

    内置 40+ 插件,联网搜索、代码执行、图片生成开箱即用。支持 MCP 协议,可一键接入 AI Agent 工具链,扩展能力无上限。

    📚 RAG 知识库

    上传 PDF、Word、网页,自动建立向量索引。基于个人知识库问答,适合企业文档、技术手册、合同条款等场景。本地向量数据库,数据不出门。

    ⚡ 多模型对比 + 语音对话

    同一问题多模型同时回答,横向对比 Claude/GPT/Gemini 差异。内置 TTS/STT,支持语音对话。还有「助手市场」,几百个预设专业助手直接可用。

    🏠 完全自托管 + 隐私优先

    Docker 一键部署,数据全留本地。MIT 开源,可自由修改分发。对比 ChatGPT Plus $20/月,LobeChat 客户端免费,只需按 API 用量付费。

    3
    典型使用场景

    🎯 场景一:多模型对比选型

    在模型选型阶段,同一个 Prompt 同时发给 Claude Opus、GPT-5.4、Gemini 2.5 Pro,直接对比输出质量,不再靠猜。LobeChat 的多模型对比功能让选型决策有数据支撑。

    📚 场景二:企业知识库问答

    将公司技术文档、产品手册、合同模板上传到 LobeChat 知识库,基于 RAG 检索增强生成,精准回答内部问题。支持 Docker 私有化部署,数据完全不出企业内网。

    💻 场景三:开发者日常助手

    配置 DeepSeek V3(中文代码能力强,价格低)+ Claude Sonnet(复杂逻辑)+ GPT-5.4(多模态),不同任务自动切换最合适模型。助手市场里的「代码审查」「SQL 优化」等预设助手,开箱即用。

    💡 推荐理由

    我用过不少 AI 客户端,LobeChat 是最顺手的选择之一,原因如下:

    • 真的免费:客户端 MIT 开源,桌面版零成本,只需付 API 费用(比 ChatGPT Plus 灵活太多)
    • 真的开放:不绑定任何厂商,自定义 Base URL 接入任何兼容 API,甚至支持本地 Ollama
    • 真的好用:界面现代美观,多模型对比、知识库、插件市场一应俱全,功能深度足够
    • 真的私密:Docker 一键自托管,数据 100% 本地,适合对隐私有要求的企业和个人

    如果你同时用多个 AI 模型,或者不想把数据交给 OpenAI,LobeChat 是目前最好的开源替代方案

    📥 下载地址

    许可协议:MIT License  |  语言:TypeScript  |  支持平台:Web / Windows / macOS / Linux / Docker

    ⚠️ 本文基于公开资料整理,项目数据截至 2026 年 6 月。LobeChat 与 LobeHub 为同一团队产品,功能持续迭代中。

  • ComfyUI – 最强大的模块化AI内容创作引擎,节点式工作流颠覆传统AI生成

    ComfyUI Logo

    ComfyUI – 模块化AI内容创作引擎

    📦 项目简介

    ComfyUI 是最强大、最模块化的AI内容创作引擎,提供图形化节点界面来构建和执行AI生成工作流。支持图像、视频、3D模型、音频等多类型内容生成,无需编写代码即可搭建复杂的AI生成流程。

    ⭐ GitHub热门
    🎨 AI图像生成
    🎬 视频生成
    🎵 音频生成

    🔧 安装要求和过程

    环境要求

    组件 要求
    操作系统 Windows / Linux / macOS
    Python版本 推荐 3.13+(3.14存在部分兼容问题)
    PyTorch版本 推荐 2.4+(优先使用最新CUDA版本)
    GPU显存 最低 1GB(智能内存管理)

    快速安装(NVIDIA GPU)

    # 克隆仓库
    git clone https://github.com/Comfy-Org/ComfyUI.git
    cd ComfyUI

    # 安装PyTorch(CUDA 13.0)
    pip install torch torchvision torchaudio –extra-index-url https://download.pytorch.org/whl/cu130

    # 安装依赖
    pip install -r requirements.txt

    # 启动服务
    python main.py

    一键安装(推荐)

    🚀 Windows便携包:下载解压即用(NVIDIA版)

    📦 comfy-clipip install comfy-cli && comfy install

    🖥️ 桌面客户端:官网下载一键安装

    ☁️ 云端部署:Comfy Cloud(无本地硬件用户)

    ✨ 核心功能

    🎨

    多模态模型支持

    支持SD1.x/2.x、SDXL、SD3/3.5、Flux、Qwen Image、Hunyuan等图像模型;Stable Video Diffusion、Wan 2.1等视频模型;Stable Audio等音频模型;Hunyuan3D等3D模型

    异步队列+智能显存

    仅重新执行工作流中发生变化的部分,大幅提升运行效率;智能内存管理,最低支持1GB显存GPU运行大模型

    🔗

    节点式工作流

    图形化节点界面,灵活搭建复杂工作流;支持工作流保存/加载为JSON;App模式将复杂工作流封装为简易UI

    📦

    扩展生态丰富

    支持LoRA、Embedding、超网络加载;支持ControlNet、T2I-Adapter、GLIGEN等扩展;ComfyUI-Manager一键安装扩展

    🔒

    离线运行+完整复现

    核心功能不会自动下载额外内容,保护隐私;支持从生成的PNG、WebP、FLAC文件中加载完整工作流(包含种子参数),实现结果完整复现

    🎯 典型使用场景

    场景一:AI图像生成与工作流复用

    通过节点式工作流搭建复杂的图像生成流程(如:文生图+高清放大+面部修复),保存为JSON文件或PNG图片。下次直接加载工作流即可复现相同效果,大幅提升创作效率。支持LoRA微调模型,实现个性化风格生成。

    场景二:视频生成与编辑

    集成Stable Video Diffusion、Wan 2.1等视频生成模型,通过节点工作流实现文本生成视频、图片生成视频、视频风格转换等功能。支持视频帧插值、超分辨率等后处理节点。

    场景三:企业级AI内容生产流水线

    通过ComfyUI的API模式,将复杂的AI生成工作流封装为简易UI,供非技术团队成员使用。结合ComfyUI-Manager批量安装扩展,快速搭建企业内部的AI内容生产平台,实现批量图像/视频生成自动化。

    💡 推荐理由

    ComfyUI彻底改变了AI内容生成的工作方式——从”写提示词等待结果”进化到”可视化搭建AI生成流水线”。

    为什么值得尝试?
    灵活性无敌:节点式工作流让你可以精确控制AI生成的每一个环节,从模型选择、提示词处理、采样参数到后处理,全部可视化调整。
    社区生态强大:ComfyUI-Manager让扩展安装一键完成,数千个自定义节点覆盖各种需求(ControlNet、IP-Adapter、AnimateDiff等)。
    资源占用优化:智能显存管理让低显存用户也能跑大模型,异步队列提升生成效率。
    结果可复现:工作流嵌入PNG图片,分享作品的同时分享完整生成流程,AI创作的”开源”精神。

    如果你觉得WebUI”不够灵活”,或者想搭建自动化的AI内容生产流水线,ComfyUI绝对是最佳选择。节点式工作流的学习曲线稍陡,但一旦掌握,创作效率将大幅提升!

    📥 下载地址

    支持Windows / Linux / macOS | 最低1GB显存 | 开源免费

    🏷️ 标签:ComfyUI · 节点式 · AI绘画 · 图像生成 · Stable Diffusion · 工作流

    📌 归类:开源项目

  • Agent-Reach:给AI Agent装上「全网眼睛」,30K+ Stars的免费互联网接入神器

    Agent-Reach:给AI Agent装上「全网眼睛」,30K+ Stars的免费互联网接入神器

    Agent-Reach - 给AI Agent装上全网眼睛

    项目简介

    Agent-Reach 是一个为 AI 智能体(AI Agent)提供全网内容读取与搜索能力的开源工具。它让 AI Agent 能够一键读取 Twitter、Reddit、YouTube、B站、小红书、GitHub 等 15+ 平台的内容——完全免费、无需付费 API,只需一行命令安装。

    项目目前拥有 30K+ GitHub Stars,是当前 AI Agent 基础设施领域最热门的项目之一。由开发者 Panniantong 开发并持续维护,采用 MIT 开源协议。

    为什么需要 Agent Reach?

    AI Agent 已经能帮你写代码、改文档、管项目——但你让它去网上找点东西,它就抓瞎了:

    • 📺 让 AI 看 YouTube 教程 → 拿不到字幕
    • 🐦 让 AI 搜推特产品评价 → Twitter API 要付费
    • 📖 让 AI 去 Reddit 找同类 bug → 返回 403
    • 📕 让 AI 看小红书商品口碑 → 必须登录才能打开
    • 📺 让 AI 总结 B 站技术视频 → 被风控拦截
    • 🔍 让 AI 搜索最新 LLM 框架对比 → 没有好用的免费工具

    安装要求与环境配置

    环境要求 说明
    Python 版本 Python 3.10 及以上
    操作系统 macOS / Linux / Windows 全平台支持
    兼容 Agent Claude Code、OpenClaw、Cursor、Windsurf、Codex 等所有能执行命令的 Agent
    网络代理 本地电脑不需要;服务器部署可能需要(~$1/月)

    快速安装步骤

    方法一:一键安装(推荐)
    # 复制这句话给你的 AI Agent:
    帮我安装 Agent Reach:https://raw.githubusercontent.com/Panniantong/agent-reach/main/docs/install.md
    
    # 或手动执行:
    pip install agent-reach
    agent-reach install --env=auto
    方法二:安全模式(生产环境推荐)
    pip install agent-reach
    agent-reach install --env=auto --safe

    安装完成后,运行诊断命令查看各渠道状态:

    agent-reach doctor

    核心功能

    🌐 网页阅读

    基于 Jina Reader 免费读取任意网页内容,自动清洗 HTML 标签,输出干净文本。无需 API Key。

    🐦 Twitter/X 读取

    通过 Cookie 认证免费读取和搜索推文,支持单条推文、时间线浏览、长文阅读。无需 Twitter API 付费。

    📺 YouTube 字幕提取

    基于 yt-dlp(154K Stars)提取视频字幕和元数据,支持多语言,无需 API Key。

    📺 B站搜索与阅读

    使用 bili-cli 无需登录即可搜索视频、获取详情。支持字幕提取(需 OpenCLI 配置)。

    🔍 全网语义搜索

    集成 Exa AI 语义搜索引擎(MCP 接入),支持自然语言查询,免费无需 Key。

    完整平台支持列表

    平台 零配置功能 配置后解锁
    🌐 网页 阅读任意网页
    📺 YouTube 字幕 + 搜索
    📡 RSS 解析任意源
    📦 GitHub 公开仓库 + 搜索 私有仓库 / Issue / PR
    🐦 Twitter/X 读单条推文 搜索 / 时间线 / 长文
    📖 Reddit 搜索 + 读帖子和评论
    📕 小红书 搜索 / 阅读 / 评论
    💼 LinkedIn Jina Reader 公开页 Profile / 公司页面
    💻 V2EX 热门帖子 + 详情
    📈 雪球 行情 + 搜索 + 热榜 高级数据

    典型使用场景

    🎯 场景一:AI 产品调研助手

    让 AI Agent 同时搜索 Twitter 用户对竞品的真实评价、Reddit 上的讨论帖、YouTube 上的评测视频,再汇总成调研报告。以前需要人工切换多个平台的操作,现在一句话搞定:

    "帮我调研一下 Cursor vs Windsurf 的用户反馈,
    搜一下 Twitter 和 Reddit 上的讨论"

    🎯 场景二:技术视频学习加速器

    把 YouTube/B站的技术教程链接丢给 Agent,它会自动提取字幕、总结要点、生成笔记。再也不用花 2 小时看完一个视频才知道讲的是什么:

    "总结一下这个 YouTube 视频的核心内容:
    https://youtube.com/watch?v=xxx"

    🎯 场景三:全网信息监控与聚合

    设置定时任务让 Agent 监控特定关键词在 Twitter、Reddit、V2EX 等平台的最新动态,汇总后推送给你。特别适合追踪技术趋势、竞品动态或舆情监测:

    "每天早上搜一下 RAG 相关的最新讨论,
    看看 Twitter 和 Reddit 上有什么新进展"

    推荐理由

    💡 个人使用心得:

    作为一个每天和各种 AI Agent 打交道的人,Agent-Reach 解决了我最大的痛点——Agent 的「互联网盲区」。以前让 Claude Code 去查个资料,它只能靠内置知识或者我手动复制粘贴;现在装上 Agent-Reach 后,它能自己去看 Twitter 讨论、读 Reddit 帖子、甚至总结 YouTube 视频内容。

    最让我印象深刻的是它的「能力层」设计理念:它不自己造轮子,而是帮你在底层选好、装好、配好各个平台的最佳开源工具(twitter-cli、bili-cli、OpenCLI 等)。而且当某个工具失效时(比如 yt-dlp 被 B 站风控封了),它会自动切换备选方案,用户几乎无感。

    另一个亮点是 `agent-reach doctor`——一条命令告诉你每个渠道通不通、走的是哪个后端、怎么修。这种「体检」设计在开源工具里非常少见。

    如果你正在使用 Claude Code、Cursor 或任何 AI 编程助手,强烈建议试试 Agent-Reach。它会让你的 Agent 从「只能写代码的程序员」进化为「能联网调研的全栈工程师」。

    技术架构亮点

    • 多后端路由机制:每个平台维护「首选 + 备选」有序后端列表,某条路失效自动切下一条
    • 零包装层设计:Agent 直接调用上游工具,没有中间封装层,性能损耗最小化
    • SKILL.md 注册制:安装后在 Agent skills 目录注册使用指南,Agent 自动知道该调什么
    • 安全优先:Cookie 仅存本地(权限 600)、支持安全模式和 Dry Run、代码完全可审计
    • 跨平台兼容:macOS / Linux / Windows 全平台支持,兼容所有主流 AI Agent

    下载地址

    GitHub 仓库 github.com/Panniantong/Agent-Reach
    PyPI 安装 pip install agent-reach
    开源协议 MIT License
    Star 数量 ⭐ 30K+ Stars