标签: AI Agent

  • AI智能体开始”套娃”:让AI监督AI,这个循环能一直跑下去吗?

    当AI开始监督AI

    上週五,Meta办了一场@Scale技术大会。会上有一个环节,登场的是Anthropic旗下Claude Code的负责人Boris Cherny。问答环节刚开始,观众席上就有人问了一个看起来有点奇怪的问题:「Loops是下一个炒作周期,还是来真的?」

    Cherny的回答很干脆:「来真的。」

    他接着解释了一下为什么。他说,两年前我们还手写源代码。后来过渡到让AI智能体帮我们写代码。现在正处在下一个过渡期:让智能体去提示其他智能体,再由那些智能体来写代码。「从源代码到智能体这一步有多大,loops这一步就有多大。」

    这段话在会场里可能听起来很自然,但跳出来看,它描述了一个相当激进的变化。我们过去对AI智能体的想象,基本上是一个人下指令、AI执行、然后回报结果。Cherny描述的却是一个没有终点的过程:一群智能体在背景里不停工作,永远不会停止。

    AI智能体循环概念图
    AI智能体相互提示的循环结构(概念图)

    Cherny自己就在跑的loop

    Cherny在演讲后面(YouTube视频32分左右)具体讲了他自己在用的loops。他有一个智能体专门负责寻找改进代码架构的方法,另一个智能体负责寻找可以统一的重复抽象。它们像任何一个程序员一样提交pull request,而且因为代码在不断变化,它们永远不会停止运行。

    这个想法很有意思。过去几个月,大家讨论AI智能体的时候,重点一直是怎样把智能体管理好:设定清楚的目标、检查进度、别让它跑太远。Loop把这件事往前推了一步:授权一群智能体在背景里持续工作,没有尽头。这需要对于AI有很大的信任,但随着模型进步得越来越快,这可能是让AI真正处理实际工作的下一步。

    「从源代码到智能体这一步有多大,loops这一步就有多大。」—— Boris Cherny,Anthropic Claude Code 负责人

    技术上来说,这不算是全新的东西

    递归循环(recursive loops)——函数调用自己来重复一个动作,再加上一个停止条件——是计算机科学入门课程的标准内容。只不过这些loop遵循的是非决定论逻辑:由一个子智能体来决定什么时候停止循环,而不是一个清楚的条件。但基本方法是一样的。程序员一开始用AI来完成任务,某种版本的递归循环(由AI监督AI)迟早会出现。

    跟传统计算不一样的地方在于,智能体loop可以简单得让人抓狂。现在最流行的技巧之一叫「Ralph Loop」(以Ralph Wiggum命名),原理基本上就是把模型做过的所有工作总结一下,然后问它有没有达成目标。这是在处理AI模型跑太久之后迷路的问题——本质上就是不断让模型来回反弹,直到任务完成。

    跟test-time compute的关系

    另一个理解loop的方式是把它看成「增加test-time compute」这股大趋势的一部分。OpenAI研究员Noam Brown本月初观察到,当代模型只要砸足够的算力进去,几乎可以解决任何问题。这意味着确保一个问题被解决的方法之一,就是不断砸算力进去直到它完成。

    对于像改进代码库这种「爬山」问题来说尤其如此,模型可以一直做增量改进直到达到某个阈值。或者,像Cherny的例子一样,只要有算力可以花,它就可以一直做增量改进。

    成本是个大问题

    如果这听起来很贵,那是因为它真的很贵。跟agentic AI一样,AI loops烧token的速度比简单的问答聊天机器人快得多——而且因为重点是让loop一直跑下去,你能花多少钱是没有上限的。对Anthropic来说这没问题,因为它本质上就是在卖token。但对其他所有人来说,这可能是一种很贵的工作方式。

    话说回来,只要智能体loop要解决的问题值得,而且有适当的设置来监控token支出、漂移和其他典型的AI问题,好处可能大到足以抵消成本。


    这篇文章让我思考一个问题:我们到底要让AI跑到多远?当智能体开始监督其他智能体,当loop可以永远跑下去,人类在这个过程里还扮演什么角色?Cherny显然认为这是下一步,而且他说这话的时候很有说服力。但成本问题不解决,这可能只是大公司才能玩得起的游戏。

  • Haystack:构建生产级 LLM 应用的首选 AI 编排框架,25K+ Stars 让 RAG 和 Agent 工作流完全透明可控

    Haystack:构建生产级 LLM 应用的首选 AI 编排框架,25K+ Stars 让 RAG 和 Agent 工作流完全透明可控

    Haystack Banner

    Haystack 是由 deepset 团队(已被 Cohere 收购)开发的开源 AI 编排框架,专为构建生产级 LLM 应用而设计。它让开发者以显式控制的方式设计模块化 Pipeline 和 Agent 工作流,覆盖 RAG、多模态、语义搜索、问答系统和自主智能体等场景。

    📦 安装要求和过程

    环境要求

    • Python >= 3.9(推荐 3.10+)
    • pip 包管理器
    • 可选:Docker(用于容器化部署)
    • 可选:GPU(用于本地模型推理加速)

    快速安装

    # 安装稳定版
    pip install haystack-ai

    # 安装 nightly 预览版(尝鲜最新功能)
    pip install –pre haystack-ai

    # 验证安装
    python -c “import haystack; print(haystack.__version__)”

    💡 可选依赖:pip install haystack-ai[openai,anthropic,mistral] 可一次性安装主流模型提供商支持。

    🚀 核心功能

    🧠

    上下文工程优先

    显式控制信息检索、排序、过滤、组合、结构化和路由的全流程。Pipeline 和 Agent 工作流完全透明、可追踪。

    🔄

    模型与厂商无关

    集成 OpenAI、Mistral、Anthropic、Cohere、HuggingFace、Azure、AWS Bedrock、本地模型等。切换模型或基础设施无需重写系统。

    🧩

    模块化与可定制

    内置检索、索引、工具调用、记忆、评估等组件,也可自定义。支持循环、分支和条件逻辑,精确控制上下文流转。

    🌐

    可扩展生态系统

    通过统一接口构建和共享自定义组件,社区和第三方可轻松扩展 Haystack。支持 Hayhooks 将 Pipeline 包装为 REST API 或 MCP 服务器。

    💡 典型使用场景

    1

    企业级 RAG 知识库系统

    某德国联邦部委使用 Haystack 构建了面向公众的语义搜索系统,支持多语言文档检索和精准问答。通过 Haystack 的混合检索(稠密+稀疏向量)和重排序功能,实现了比传统关键词搜索高出 3 倍的准确率。系统部署在私有云上,数据完全合规。

    2

    多模态 AI 客服助手

    某欧洲航空公司使用 Haystack 构建了支持文本+图片输入的客服 Agent,客户可以上传行李损坏照片,Agent 自动检索相关政策文档并生成处理建议。Haystack 的多模态 Pipeline 设计让文本和视觉信息在统一框架下协同工作,大幅缩短了投诉处理周期。

    🌟 推荐理由

    💬 笔者心得

    在尝试了 LangChain、LlamaIndex 等多个 LLM 应用框架后,Haystack 给我留下的印象是「透明」和「可控」。与 LangChain 的「黑盒」链式调用不同,Haystack 的 Pipeline 是显式定义的——每个组件的输入输出、数据流向都一目了然,调试起来非常直观。

    特别值得一提的是 Haystack 对上下文工程(Context Engineering)的重视。在 RAG 系统中,如何精准控制检索策略、如何组合多路召回结果、如何设计记忆机制,这些才是决定效果的关键。Haystack 把这些控制权交给了开发者,而不是封装成不可见的「魔法」。

    另外,Haystack 的企业级基因也很突出——它诞生于 deepset 的商业化实践,从第一天就考虑了生产部署、可观测性、访问控制等现实需求。现在 deepset 被 Cohere 收购,Haystack 企业版(Haystack Enterprise Platform)更是提供了托管化生产 setup,对的企业用户来说是很好的选择。

    📥 下载地址

    🌐 官方网站

    haystack.deepset.ai

    🐙 GitHub 仓库

    github.com/deepset-ai/haystack

    25,730+ Stars · 2,884+ Forks

    📚 官方文档

    docs.haystack.deepset.ai

    💬 Discord 社区

    discord.gg/qZxjM4bAHU

    🐍 PyPI 安装

    pip install haystack-ai

    🍳 Cookbook 食谱

    haystack.deepset.ai/cookbook

    📊 项目速览
    ⭐ Stars:25,730+
    🍴 Forks:2,884+
    📅 创建时间:2019-11
    🔄 最近更新:2026-06-26
    📝 开源许可:Apache-2.0
    💻 主要语言:Python
    🏢 维护团队:deepset(Cohere 旗下)
    🌟 用户案例:Apple、Meta、NVIDIA、Netflix、Airbus 等

  • Notion Mail宣布关闭,AI智能体正在吃掉独立应用的地盘

    AI智能体接管邮件管理
    Notion Mail的退场,折射出AI智能体对软件交互方式的根本性重塑

    Notion本周宣布,将于9月22日关闭其邮件产品Notion Mail。表面上看,这是一个产品的退场;实际上,它折射出的是AI智能体对软件交互方式的一次根本性重塑。

    一半用户不打开收件箱了

    Notion在X上发帖解释了关闭原因:随着Notion的智能体能力越来越强,他们观察到越来越多用户把邮件工作流直接交给智能体处理,超过一半的Notion Mail用户管理邮件时根本不会打开收件箱

    一个邮件客户端的产品,有一半用户不打开收件箱——那他们还用什么?用智能体。智能体帮他们分类、帮他们起草回复、帮他们决定哪些邮件需要人工介入。收件箱这个存在了几十年的概念,正在被智能体架空。

    Notion的决定很直接:既然用户已经不怎么开收件箱了,那就别维护一个独立的邮件客户端了,全力做智能体。

    从收购Skiff到关闭Mail,只用了两年

    Notion Mail这个产品本身的历史并不长。2024年,Notion收购了注重安全的生产力创业公司Skiff,随后在同年10月以预览模式推出了邮件产品,2025年4月才正式开放给用户使用。

    它的卖点是把邮件和Notion AI打通,自动标签、智能过滤、帮你安排日程。对手也不少:Superhuman在做”最快的邮件体验”,Fyxer在用AI帮你写邮件,现在又冒出来一个AgentMail,今年3月刚融了600万美元,专门做”给AI智能体用的邮件服务”。

    Notion Mail从推出到关闭,满打满算也就两年。这个节奏在AI时代已经不算短了——但跟智能体的发展速度比起来,还是慢了一拍。

    “智能体优先”正在成为现实

    以前的产品逻辑是:做一个应用,用户打开应用,在应用里完成操作。现在的逻辑正在变成:智能体在后台跑,用户只在需要的时候才介入。收件箱、日历、待办列表——这些”控制台”式的界面,存在的必要性正在被质疑。

    另一个是独立AI邮件工具的生存空间问题。Notion有智能体底层,可以顺势把邮件功能整合进去。但那些专门做AI邮件的工具呢?Superhuman还在坚持做”更快的邮件体验”,但它最近收购了GPTZero——一个用来检测AI生成内容的工具。这个动作本身就在说明,Superhuman也在重新思考自己的定位。


    AgentMail的思路更激进:它要做”给智能体用的邮件服务”,人类用户不是目标用户。这个方向跟Notion Mail的关闭其实是一回事——邮件作为人类直接操作的界面,价值正在缩水。

    从更大的视角看,这件事不只是邮件客户端的问题。AI智能体正在逐步接管用户在各个应用里的操作。记事本、日历、项目管理工具——这些工具的”入口”属性都在被削弱。用户跟系统的交互方式,从”打开应用-操作-关闭应用”,变成”告诉智能体想要什么-智能体搞定”。

    这个转变对创业公司的启示很直接:做一个好用的独立应用仍然有价值,但更重要的可能是,你的产品能不能被智能体调用。能被智能体整合的工具,比不能被整合的工具活得久。

    Notion Mail的关闭不是第一个,也不会是最后一个。AI智能体对软件形态的重塑,才刚刚开始。

  • Voicebox:开源AI语音工作室,本地替代ElevenLabs+WisprFlow,34K+Stars让AI开口说话

    Voicebox:开源AI语音工作室,本地替代ElevenLabs+WisprFlow,34K+Stars让AI开口说话

    🎙️ Voicebox:开源 AI 语音工作室

    免费替代 ElevenLabs + WisprFlow 的全栈 AI 语音解决方案,34K+ Stars,MIT 许可

    34K+
    GitHub Stars
    7种
    TTS 引擎
    23
    支持语言
    500+
    开发者
    关注者
    MIT
    开源许可

    📌 项目简介

    Voicebox 是一个开源的 AI 语音工作室,由独立开发者 jamiepine 打造,旨在提供完全本地运行的 AI 语音解决方案。它将”语音生成(替代 ElevenLabs)”和”语音输入(替代 WisprFlow)”二合一,所有模型和数据完全在本地运行,无需上传云端,是隐私优先的 AI 语音工具首选。

    项目基于 Tauri (Rust) 桌面端 + React/TypeScript 前端 + FastAPI Python 后端架构,支持 macOS、Windows 和 Docker 部署,内置 7 种 TTS 引擎、Whisper STT、本地 Qwen3 LLM,并原生支持 MCP 协议,让 AI 智能体也能”开口说话”。

    ⚙️ 安装要求和过程

    环境要求

    • macOS:Apple Silicon (M1+) 或 Intel Mac,推荐 16GB 内存
    • Windows:Windows 10+,支持 CUDA GPU 加速(NVIDIA)或 DirectML(任意 GPU)
    • Linux:从源码构建,支持 CUDA/ROCm GPU 加速
    • 通用:Python 3.11+,Rust(开发构建),Bun (JS 运行时)

    快速安装(预编译包)

    # macOS (Apple Silicon)
    curl -L https://voicebox.sh/download/mac-arm -o Voicebox.dmg

    # macOS (Intel)
    curl -L https://voicebox.sh/download/mac-intel -o Voicebox.dmg

    # Windows
    # 下载 MSI:https://voicebox.sh/download/windows

    # Docker 一键启动
    git clone https://github.com/jamiepine/voicebox.git
    cd voicebox
    docker compose up

    从源码开发构建

    # 克隆仓库
    git clone https://github.com/jamiepine/voicebox.git
    cd voicebox

    # 安装 just 命令工具(任务运行器)
    brew install just # macOS
    # 或 cargo install just

    # 一键安装依赖并启动开发服务器
    just setup
    just dev

    # 构建生产版本
    just build # CPU 版本
    just build-local # Windows + CUDA 版本

    🌟 核心功能

    🎤 7 种 TTS 引擎,覆盖全场景

    Voicebox 集成了 7 种开源 TTS 引擎,从超轻量的 Kokoro (82M) 到高质量的 HumeAI TADA (3B),满足不同场景需求:

    引擎 语言数 模型大小 核心优势
    Qwen3-TTS 10 0.6B/1.7B 高质量多语言克隆,支持发音指令
    Chatterbox Multilingual 23 ~1GB 语言覆盖最广,支持阿拉伯语/芬兰语等
    Chatterbox Turbo 英语 350M 超快速度,支持 [laugh]/[sigh] 表情标签
    Kokoro 8 82M 极小模型,CPU 实时 10x+ 速度
    LuxTTS 英语 ~1GB 48kHz 输出,CPU 150x 实时速度
    HumeAI TADA 10 1B/3B 语音语言模型,支持 700s+ 连贯音频
    Qwen CustomVoice 10 自然语言控制发音,无需参考音频

    🗣️ 语音克隆 + 无限长度生成

    支持从几秒音频进行零样本语音克隆,同时内置 Kokoro 和 Qwen CustomVoice 的 50+ 精选预设语音。独创”无限长度生成”机制——自动按句子拆分文本,分块生成后交叉淡入淡出拼接,最大支持 50,000 字符的文本输入,彻底打破 TTS 长度限制。

    🎧 全局语音输入(Dictation)

    支持全局热键语音输入,macOS 支持自动粘贴到当前文本框(按住说话/切换模式)。内置 Whisper STT,支持可选 LLM 优化去除口癖、停顿,让语音输入更流畅自然。相当于开源版的 WisprFlow!

    🤖 AI 智能体语音输出(MCP 支持)

    内置本地 MCP 服务器,支持 Claude Code、Cursor、Cline 等 AI 编程助手通过 voicebox.speak 工具调用,让 AI 智能体用克隆的语音”开口说话”。支持为不同智能体绑定不同语音,实现个性化语音输出。

    # Claude Code 一键配置 MCP
    claude mcp add voicebox –transport http –url http://127.0.0.1:17493/mcp –header “X-Voicebox-Client-Id: claude-code”

    🎬 语音故事编辑器 + 音频后处理

    内置多轨道时间线编辑器,支持对话、播客、叙事内容制作,支持拖拽、音频裁剪、同步播放。基于 Spotify pedalboard 库提供 8 种音频后处理效果(音调偏移、混响、延迟、合唱、压缩等),并内置”机器人”、”电台”、”回声室”、”低音”4 种预设效果链。

    💡 典型使用场景

    场景一:AI 编程助手语音通知

    长时间运行的编程任务(如模型训练、测试套件)完成后,通过 Voicebox MCP 集成,让 Claude Code 或 Cursor 用你喜欢的语音播报结果:”测试全部通过,共 42 个用例,耗时 3 分 12 秒”。不用盯着屏幕,声音告诉你进度!

    场景二:多语言内容创作

    使用 Chatterbox Multilingual 引擎(支持 23 种语言),配合语音克隆功能,内容创作者可以用自己(或任何)的声音生成多语言版本的视频配音、播客内容。Qwen3-TTS 还支持输入发音指令(如”慢点说”、”小声说”),让生成语音更自然。

    场景三:本地隐私优先的语音输入替代

    替代 WisprFlow 等云端语音输入工具,所有语音识别和转录均在本地运行(Whisper STT),语音数据不上传任何云端服务器。对隐私敏感的用户、企业内网环境,或者需要离线使用的场景,Voicebox 是最佳选择。

    💬 推荐理由

    为什么推荐 Voicebox?

    1. 隐私优先,本地全栈。模型、语音数据、录音内容完全本地存储,不依赖任何云服务。对于关注数据隐私的开发者来说,这一点至关重要。

    2. 二合一解决方案。一个工具同时替代 ElevenLabs(语音生成)和 WisprFlow(语音输入),不需要订阅两个服务,省心省钱。

    3. 引擎覆盖全面。7 种 TTS 引擎从 82M 到 3B 参数,从 CPU 到 GPU 加速,从英语到 23 种语言,几乎覆盖了所有使用场景。

    4. MCP 原生支持。AI 智能体生态正在爆发,Voicebox 率先支持 MCP 协议,让 AI 智能体具备语音输出能力,这在开源项目中非常前瞻。

    5. 活跃开发中。485 个开放 Issues 说明社区非常活跃,项目在快速迭代。MIT 许可允许自由修改和分发,适合二次开发。

    个人使用感受:Voicebox 的 MCP 集成体验非常顺滑,配置一次后,Claude Code 就能直接调用语音输出。用它来做长时间编程任务的语音通知,比盯着终端看进度条优雅太多。唯一的小遗憾是 Linux 目前还没有预编译包,需要自己从源码构建。

    📥 下载地址

    项目信息:
    ⭐ GitHub Stars: 34,192
    📜 开源许可: MIT License
    💻 技术栈: Tauri (Rust) + React/TypeScript + FastAPI (Python)
    🌐 官网: voicebox.sh
    📦 Docker: docker compose up
    最近更新: 2026 年 6 月

  • AI智能体要上线,先在一个人造世界里被折磨一遍——Patronus AI的生意经

    Patronus AI数字世界测试AI智能体
    图片来源:AI生成概念图

    AI智能体越来越能干,从回答问题到自主执行多步骤复杂任务,进展快得让人有点慌。但有一个问题一直没被很好解决:你怎么在智能体上线之前,确信它在各种奇怪场景下都不会搞砸?

    Benchmark分数再高,也不等于真实世界能用。这就是Patronus AI在做的事情——他们给AI智能体造”数字世界”,让智能体在里面被压力测试,直到开发者有信心把它放出来。

    两个前Meta AI研究员,盯上了AI安全测试这个坑

    Patronus AI成立于2023年,创始人是两位前Meta AI研究员Anand Kannappan和Rebecca Qian。他们的判断很直接:AI实验室用来展示实力的benchmark,跟智能体真实表现之间的关系,远没有大家以为的那么紧密。一个智能体在benchmark上拿了高分,放到真实环境里可能犯一些你完全没预料到的错误——而且它犯错了你还可能不知道。

    Patronus的做法是造”数字世界模型”——把网站和内部系统做成可交互的仿真环境,让智能体在里面跑,用强化学习的方式迭代:做对了给奖励,做错了罚。这个过程可以跑很久,Kannappan说他们想让智能体在环境里跑10小时、10天甚至10周。

    他们拿Waymo做类比:Waymo在真实道路上测试之前,先用合成世界模拟了无数种极端场景——暴雨、小孩追球冲上马路——这些在真实世界里可能几年才碰到一次,但在仿真里可以批量生成。

    智能体最擅长的事,是走捷径

    Patronus的投资方Notable Capital的Glenn Solomon说了一句话很到位:智能体最擅长的事,是走捷径。它们会找到一种表面上完成任务、实际上偷工减料的方式,然后你就以为它工作了。Patronus的价值就在于能发现这些”hack”,逼模型真正把任务做对。

    目前他们主攻软件和金融科技这两个方向。选这两个领域不是偶然的:任务是否完成是可以被验证的(verifiable),你跑一段代码看能不能编译、下一笔单看账户余额对不对,都是有客观标准的。Kannappan说,那些”很难验证”的领域(比如创意写作、开放式对话)他们暂时还没碰。

    营收一年涨15倍,几乎每个前沿AI实验室都是客户

    这种需求有多旺盛?Patronus的营收过去一年涨了15倍。这轮5000万美元的B轮由Greenfield Partners领投,Notable Capital、Lightspeed、Datadog、三星跟投。加上之前的融资,总共融了7000万美元。

    Solomon说,几乎所有前沿AI实验室和很多AI创业公司都是他们的客户,需求几乎吃不饱。这个数字听着夸张,但想想现在每家做AI智能体的公司都面临同一个问题:怎么向上面交差,证明自家的智能体”可靠”?如果这个需求是真实的,Patronus确实踩在了正确的时间点。

    竞争对手方面,Patronus主要不是在跟另一家公司抢客户,而是在跟AI实验室自己的内部评估团队抢。每家AI大厂其实都在做自己的测试框架,只是做得够不够好另说。另外一些人肉数据公司(比如Mercor和Surge)也在做跟强化学习相关的数据服务,但Patronus的区别是”不需要人参与”——评估过程完全自动化。


  • 估值23亿美元,这家公司用电子游戏训练能走进现实的AI智能体

    走进General Intuition纽约办公室的研发区,31岁的联合创始人兼CEO Pim de Witte让你看一台显示器。屏幕上有人在玩类似Fortnite的游戏。仔细一看,操控角色的不是一个真人。

    “我们的agent已经连续玩了100个小时。”公司首席产品官Kent Rollins笑着说。

    还没从这个画面里回过神,就听到电子脚步声逼近——一台大型四足机器人走了过来。

    AI智能体游戏训练概念图
    从游戏训练到真实世界的AI智能体 | 图:AI生成

    同一个大脑,游戏和现实都能用

    de Witte说:”驱动那个游戏agent的同一个大脑,现在也在驱动这台机器人。”

    机器人走到你面前,绕了一圈,继续往办公室深处走。偶尔会撞到椅子腿或者垃圾桶,像一个还没搞清楚身体怎么运作的小孩。数据工程师Josh Duplantis说,这台四足机器人只用了8分钟的真实世界数据就完成了模型微调——而且这些数据是在街上采集的,不是办公室里。

    这就是General Intuition要做的事:一个能在游戏、模拟环境和真实世界之间通用的智能体模型。

    我们有一个单一模型,既能响应Fortnite屏幕上的信息并采取行动,也能理解真实世界的动态,这是大语言模型做不到的。

    23亿美元估值的底气

    本周,公司确认完成3.2亿美元新一轮融资,估值23亿美元。本轮由Khosla Ventures领投,Jeff Bezos、Eric Schmidt、尼科·罗斯伯格均参与,DeepMind和MIT的研究人员也以个人身份跟投。General Intuition累计融资已达4.54亿美元。

    de Witte的上一家公司叫Medal,是一个游戏视频剪辑分享平台。上面有数百亿小时的游戏录像——但这还不是最关键的。Medal的录像里带有操作记录:玩家在什么时间点按了什么键。de Witte认为,这种”动作标签”才是训练空间推理能力的关键数据,光看视频是不够的。

    “这是一个单一模型,既能响应Fortnite屏幕上的信息并采取行动,也能理解真实世界的动态,这是大语言模型做不到的。”de Witte说。

    世界模型是”健身房”

    公司有一个”世界模型”,是一个逐帧生成的模拟环境(不是传统游戏引擎渲染的)。在这个环境里测试时,agent不会穿墙——它从数百亿小时的游戏画面里学会了墙是墙、梯子是用来爬的。

    这个世界模型不是最终产品,而是训练环境(公司内部叫它”健身房”)。General Intuition真正想卖的是智能体模型本身。

    大部分融资将用于扩大算力。General Intuition跟CoreWeave签了合作协议,重点放在下一版模型的预训练上。到今年夏末,他们的API会对更多开发者开放。

    欧洲人的AI伦理

    Khosla Ventures的Vinod Khosla说,他押注de Witte的愿景。”在大语言模型里,推理能力的出现是一个量子跃迁。在世界模型里,量子跃迁是AI直觉能力的出现。游戏里的人类动作和反应数据,是这种直觉出现的关键。”

    de Witte是荷兰人,团队很大一部分是欧洲人。他对硅谷把AI军事化的倾向保持距离,明确说不会把agent用于伤害人类的目的。”如果说我跑出来说我们要做致命自主武器,你觉得其他国家会怎么做?”他说。

    他还做了一个叫Nerve的平台,让游戏玩家通过数据标注、机器人远程操控等任务赚钱。Medal的用户恰好是最容易被AI冲击的一代人,de Witte想让他们在接下来的事情里有份。

    从游戏画面到真实世界,这条路能不能在规模上成立,目前还没有人完全回答。但General Intuition已经把筹码压上去了。


  • OpenClaw – 跨平台个人AI助手,支持30+通讯平台集成

    OpenClaw – 跨平台个人AI助手,支持30+通讯平台集成

    ⭐ GitHub Stars: 380,430
    🍴 Forks: 79,687
    📅 最后更新: 2026-06-25
    💻 主要语言: TypeScript

    📝 项目简介

    OpenClaw 是一款可本地部署的跨平台个人AI助手,支持在任何操作系统和通讯平台上运行,采用”龙虾之道”🦞的设计理念,让用户完全掌控自己的数据和隐私。

    💻 安装要求和过程

    环境要求

    • Node.js: 24版本(推荐)或 22.19+
    • 包管理器: npm 或 pnpm
    • 操作系统: macOS, Linux, Windows

    快速安装步骤

    方式一:全局安装(推荐)

    # 使用npm全局安装最新版
    npm install -g openclaw@latest
    
    # 或使用pnpm安装
    pnpm add -g openclaw@latest
    
    # 运行引导式安装,同时安装Gateway守护进程(保证服务常驻)
    openclaw onboard --install-daemon
    

    引导式安装会一步步帮你配置Gateway、工作区、通讯渠道和技能,支持macOS、Linux、Windows系统。

    方式二:Windows原生应用

    Windows用户可以下载原生的 Windows Hub 应用完成配置。

    方式三:源码开发安装

    # 克隆仓库
    git clone https://github.com/openclaw/openclaw.git
    cd openclaw
    
    # 安装依赖(注意:源码部署必须使用pnpm)
    pnpm install
    
    # 初始化本地配置和工作区
    pnpm openclaw setup
    
    # 启动开发模式,源码修改后自动重载
    pnpm gateway:watch
    

    ✨ 核心功能

    1. 本地优先Gateway架构

    统一管理会话、通讯渠道、工具和事件的控制平面,所有数据本地存储,保障隐私安全。

    2. 多渠道支持(30+平台)

    覆盖WhatsApp、Telegram、Slack、Discord、微信、QQ、飞书等主流通讯平台,在常用聊天工具中直接使用AI助手。

    3. 多智能体路由

    可将不同渠道/账号/联系人的请求路由到独立的智能体,实现隔离的工作区和会话,适合多角色协作场景。

    4. 语音交互与实时Canvas

    支持macOS/iOS语音唤醒、Android端连续语音对话,智能体可驱动可视化工作区(Canvas面板),支持A2UI交互。

    5. 技能扩展体系

    支持通过ClawHub安装、管理自定义技能,内置/管理/工作区技能开箱即用,快速扩展AI助手能力边界。

    🎯 典型使用场景

    场景一:个人本地AI助手

    在本地设备部署OpenClaw,无需上传数据到第三方服务,保障数据隐私。通过WhatsApp、Telegram等常用通讯工具随时调用AI助手,实现:

    • 快速查询信息、总结文档
    • 设置定时提醒和任务
    • 管理个人日程和待办事项
    • 本地文件处理和代码辅助

    场景二:开发者工作流集成

    将OpenClaw集成到日常开发工作流中,通过命令行或通讯工具快速完成:

    • 代码审查和bug分析
    • 自动化测试和部署
    • 文档生成和代码注释
    • 项目管理和进度跟踪
    # 向助手发送请求,设置高思考等级
    openclaw agent --message "分析这个bug的根本原因" --thinking high
    
    # 发送消息到指定联系人
    openclaw message send --target +1234567890 --message "代码已修复,请审查"
    

    💡 推荐理由

    为什么推荐OpenClaw?

    • 🏠 真正本地化:数据完全存储在本地,无需担心隐私泄露,符合”own-your-data”理念
    • 🔌 无缝集成:支持30+通讯平台,无需切换应用即可使用AI助手
    • 🚀 活跃社区:380K+ Stars,79K+ Forks,迭代速度快,问题响应及时
    • 🛠️ 高度可扩展:基于ClawHub的技能系统,快速添加自定义功能
    • 🔒 安全沙箱:非主会话默认运行在Docker沙箱,避免安全风险

    个人使用心得:

    OpenClaw最大的优势在于其”本地优先”的设计理念。与依赖云服务的AI助手不同,OpenClaw让你完全掌控自己的数据。通过将其集成到WhatsApp等日常使用的通讯工具中,可以实现真正无缝的AI助手体验。多智能体路由功能特别适合需要隔离不同工作场景的用户,比如将工作和个人助手分开。此外,ClawHub技能生态系统使得扩展功能变得非常简单,社区已经贡献了大量实用技能。

    📥 下载地址

    官方资源链接:

    📊 项目统计

    指标 数据
    ⭐ GitHub Stars 380,430
    🍴 Forks 79,687
    👁️ Watchers 1,792
    ❗ Open Issues 6,634
    💻 主要语言 TypeScript
    📅 最后更新 2026-06-25
    📜 开源协议 MIT License

    本文档持续更新,最后更新时间: 2026-06-26 01:37:21

  • Anthropic给Slack装了个永远在线的Claude,企业AI助手变队友了

    Claude Tag在Slack中的概念图
    Anthropic推出Claude Tag,让AI以队友身份常驻Slack频道 | 概念图

    Anthropic本周悄悄上线了一个新功能,可能会改变人们在企业里使用AI的方式。它叫Claude Tag,简单来说就是在Slack里放了一个永远在线的Claude,不是那种你问一句它答一句的工具,而是真的像个队友一样待在频道里,看着大家聊天,记住上下文,甚至主动跳出来提醒你。

    以前你也能在Slack里@Claude问问题,或者用Claude Code处理编程任务,但那些都是按需触发的。Claude Tag不一样的地方在于持久记忆和环境感知——它跟着频道走,慢慢学到你们团队是怎么工作的,而且如果你授权了,它还能去读别的频道,把跨组织的信息串起来。

    随着Claude跟着频道走,它对这份工作的了解会越来越多。如果获得授权,Claude还能自动从组织的其他地方收集信息。Anthropic在声明里这么写。这家公司的意思是,AI不应该只是一个工具,而应该是一个能积累上下文的协作者。

    一个频道,一个Claude身份

    Claude Tag最有意思的设计是:每个Slack频道里只有一个Claude身份,频道里所有人都能看到它之前做了什么,也能接着上一个人留下的对话继续。这和企业里现在常见的每人有自己的AI助手模式很不一样。

    管理员可以设定这个Claude能访问哪些工具、哪些频道、哪些信息。不同频道的Claude是隔离的——法务频道的Claude看不到工程频道的记忆,这算是给企业数据安全留了一道边界。


    会主动插话的AI

    Claude Tag有一个环境模式,可以主动在聊天里跳出来——比如提醒你某个跨部门的任务还没跟进,或者把组织里别的地方跟当前讨论相关的事情搬出来。Anthropic的说法是,这让你感觉是在和一个真实的同事合作,而不只是一个工具。

    当然,一个AI助手在Slack频道里主动说话,这件事本身也需要拿捏分寸。太吵了大家会烦,太沉默又失去了永远在线的意义。Anthropic现在把它放在beta阶段,应该也是在观察企业的实际使用反馈。

    这个方向不只是Anthropic在押。微软有Graph加Copilot,Snowflake和Databricks把自己定位成企业知识的后台,Glean在做模型和企数据之间的理解层。大家都在抢同一件事:让AI真正懂一家公司的上下文,而不只是会回答问题的聊天框。

  • OpenMontage:全球首个开源 AI 智能体视频制作系统,21.2K+ Stars 让 AI 编程助手变身视频工作室

    OpenMontage:全球首个开源 AI 智能体视频制作系统,21.2K+ Stars 让 AI 编程助手变身视频工作室

    🎬

    OpenMontage:全球首个开源 AI 智能体视频制作系统

    21.2K+ Stars | AGPL-3.0 | Python/TypeScript | calesthio 出品

    OpenMontage 是全球首个开源的智能体驱动(agentic)视频生产系统,包含 12 条生产管线52 个生产工具500+ 智能体技能。将你的 AI 编码助手(Claude Code/Cursor/GitHub Copilot 等)转化为完整的视频制作工作室,支持从创意到成片的端到端全流程自动化生产。

    21.2K+
    GitHub Stars

    12
    生产管线

    52
    生产工具

    500+
    智能体技能

    ⚙️
    安装要求和过程

    环境要求

    • Python 3.10+
    • FFmpeg(视频编码、字幕烧录、音频混合)
    • Node.js 18+(Remotion 合成引擎)
    • 任意支持的 AI 编码助手(Claude Code/Cursor/GitHub Copilot 等)

    快速安装

    # 一键安装(推荐)

    git clone https://github.com/calesthio/OpenMontage.git
    cd OpenMontage
    make setup

    # 无 make 手动安装

    pip install -r requirements.txt
    cd remotion-composer && npm install && cd ..
    pip install piper-tts
    cp .env.example .env

    本地 GPU 支持(免费视频生成)

    make install-gpu
    # 然后在 .env 中配置:
    VIDEO_GEN_LOCAL_ENABLED=true
    VIDEO_GEN_LOCAL_MODEL=wan2.1-1.3b # 可选 wan2.1-14b、hunyuan-1.5 等


    核心功能

    🎬

    12 条全流程生产管线

    覆盖动画讲解、动画制作、虚拟人播报、电影感剪辑、短视频批量生成、纪录片蒙太奇、混合制作、本地化配音、播客剪辑、屏幕演示、口播视频等场景。每条管线遵循「研究 → 提案 → 脚本 → 分镜 → 资产 → 剪辑 → 合成」的标准化流程。

    🎨

    双渲染引擎支持

    Proposal 阶段锁定渲染运行时,可选 Remotion(React 组件化合成,适合数据驱动讲解)或 HyperFrames(HTML/CSS/GASP 合成,适合动态图形和 SVG 角色动画)。禁止运行时静默切换,确保生产一致性。

    💰

    零成本/本地免费生产路径

    无需 API 密钥即可使用 Piper TTS 离线配音、Archive.org/NASA/Pixabay 等免费素材库、Remotion/HyperFrames 合成、FFmpeg 后期处理。还支持本地 GPU 运行 WAN 2.1、Hunyuan 等免费视频生成模型。

    🎯

    7 维评分自动选品

    所有工具选择通过「任务匹配度 30%、输出质量 20%、可控性 15%、可靠性 15%、成本效率 10%、延迟 5%、连续性 5%」的打分机制自动选择最优供应商,所有决策可追溯。

    生产级质量门禁

    包含合成前校验(阻断交付承诺不符、幻灯片风险过高的问题)、渲染后自检(ffprobe 验证、抽帧检查、音频分析、字幕校验)、决策审计日志(所有创意/技术选择留痕可查),避免输出无效内容。

    🚀
    典型使用场景

    📚

    教育内容创作

    输入「做一个 60 秒的动画讲解,主题是为什么天空是蓝色的」,AI 自动完成脚本编写、分镜设计、配音合成、字幕添加,全程无需手工操作。支持零密钥本地免费生成。

    🎬

    参考视频驱动创作

    粘贴 YouTube/Reels/TikTok 链接,智能体自动分析参考视频的节奏、结构、风格,输出 2-3 个差异化创意方案(含成本预估和效果预览),避免从零开始构思。

    📰

    纪录片/蒙太奇制作

    「做一个 90 秒的纪录片蒙太奇,主题是凌晨 4 点的城市氛围,仅使用实拍素材,无旁白,elegiac 基调。」支持 Archive.org 等免费素材库自动检索和剪辑。

    🎨

    风格化动画生成

    「做一个 30 秒的吉卜力风格动画,内容是云端的魔法浮动图书馆,黄金时段场景。」配置图像/视频 API 后,成本约 $0.15-$1.50 即可生成风格化动画。

    💡
    推荐理由

    💡

    OpenMontage 是我近期看到的最有想象力的 AI + 创意工具结合项目之一。它不只是「AI 生成视频」的工具,而是一个完整的视频生产管线系统——把 AI 编程助手变成了导演、编剧、分镜师、剪辑师、配音演员的集合体。

    最打动我的是它的「零成本路径」设计:你可以完全不花一分钱(无需任何 API Key)就生成完整的视频——使用 Piper 离线 TTS 配音、免费素材库、本地 FFmpeg 处理。对于个人创作者和学习者,这是极大的降低门槛。

    另外,它的7 维评分自动选品机制生产级质量门禁,让我看到了这个项目是「真正可用于生产」的,而不仅仅是 Demo 级别的玩具。所有决策留痕可查,合成前/后双重校验,这些设计在开源项目中非常少见。

    「如果你已经在使用 Claude Code 或 Cursor,OpenMontage 能让你用同样的工作流(写提示词 → 看结果 → 迭代)来「编程」视频,而不是去学习 PRo/Afer Effects。」

    🔧
    支持的 AI 工具与服务商

    兼容的 AI 编码助手:Claude Code、Cursor、GitHub Copilot、Windsurf、Codex(后续支持 Ollama、LM Studio 本地大模型)

    视频生成:Kling、Runway Gen-4、Google Veo 3、Grok Imagine Video、Higgsfield、MiniMax、HeyGen、WAN 2.1、Hunyuan、CogVideo、LTX-Video、Pexels、Pixabay、Wikimedia Commons

    图像生成:FLUX、Google Imagen 4、Grok Imagine Image、DALL-E 3、Recraft、Local Diffusion、Pexels、Pixabay、Unsplash、ManimCE

    文本转语音:ElevenLabs、Google TTS(700+ 音色)、OpenAI TTS、Piper(免费离线)

    音乐/音效:Suno AI、ElevenLabs Music、ElevenLabs SFX

    📥
    下载地址

    授权协议:AGPL-3.0(免费开源)
    开发语言:Python, TypeScript, Rust
    出品团队:calesthio(YC S26 孵化项目)

  • Weaviate:AI 开发者最爱的开源向量数据库,语义搜索与 RAG 的首选数据底座

    Weaviate:AI 开发者最爱的开源向量数据库,语义搜索与 RAG 的首选数据底座

    📦 项目简介

    Weaviate 是一款开源、云原生的向量数据库,同时存储对象和向量,支持大规模语义搜索。它将向量相似度搜索、关键词过滤、检索增强生成(RAG)和重排序功能整合到单个查询接口中,是构建 AI 应用的理想数据底座。

    Weaviate Logo

    ⚙️ 安装要求和过程

    环境要求

    • Docker 20.10+(推荐方式)
    • 内存:最低 4GB RAM,生产环境建议 8GB+
    • 客户端:Python 3.8+、Node.js 16+、Java 11+、Go 1.18+

    快速安装(Docker 本地部署)

    第一步:创建 docker-compose.yml

    services:
      weaviate:
        image: cr.weaviate.io/semitechnologies/weaviate:1.36.0
        ports:
          - "8080:8080"
          - "50051:50051"
        environment:
          ENABLE_MODULES: text2vec-model2vec
          MODEL2VEC_INFERENCE_API: http://text2vec-model2vec:8080
      text2vec-model2vec:
        image: cr.weaviate.io/semitechnologies/model2vec-inference:minishlab-potion-base-32M
    

    第二步:启动 & 安装客户端

    docker compose up -d
    pip install -U weaviate-client
    

    也可使用 Weaviate Cloud 免费试用,或部署到 Kubernetes/AWS/GCP。

    🚀 核心功能

    ⚡ 毫秒级十亿向量搜索

    基于 Go 构建,HNSW 索引,十亿级向量语义搜索毫秒返回。

    🔀 混合检索(向量+关键词+过滤)

    单接口同时支持语义搜索、BM25 关键词搜索、图像搜索,内置 hybrid 查询自动融合分数。

    🤖 内置 RAG & 重排序

    无需额外工具,直接支持生成式搜索(RAG)和重排序,快速构建 Q&A、聊天机器人。

    📈 生产级可扩展性

    支持水平扩展、多租户隔离、副本、RBAC 权限控制,Kubernetes 原生编排。

    💾 向量压缩 & TTL

    内置标量/二进制/产品量化,大幅降低内存占用;支持对象 TTL 自动清理过期数据。

    💡 典型使用场景

    场景一:RAG 检索增强生成系统

    将企业文档导入 Weaviate,结合 LLM 构建精准问答系统,大幅降低幻觉率。

    import weaviate
    from weaviate.classes.query import Filter
    
    client = weaviate.connect_to_local()
    results = client.collections.get("Document").query.near_text(
        query="如何申请退款?", limit=5,
        filters=Filter.by_property("category").equal("help")
    )
    for obj in results.objects:
        print(obj.properties["content"])
    

    场景二:语义搜索 & 推荐引擎

    电商/内容平台实现”理解意图”的搜索,支持多模态(文本+图像)检索。

    📌 推荐理由

    • 生态最完整:Python/JS/Java/Go/C# 五大官方 SDK
    • AI Agent 集成:官方提供 Agent Skills,支持 Claude Code/Cursor
    • 商业友好:BSD-3-Clause 许可,可自由修改和分发
    • 云原生架构:存储计算分离,Kubernetes 原生,水平扩展无忧

    📥 下载地址 & 相关链接

    ✝️ BSD 3-Clause License | Go | 2016年发布