标签: AI Agent

  • MoneyPrinterTurbo:66.6K Stars!AI短视频一键生成,让内容创作不再靠体力

    MoneyPrinterTurbo:66.6K Stars!AI短视频一键生成,让内容创作不再靠体力


    MoneyPrinterTurbo Web界面

    MoneyPrinterTurbo Web 操作界面

    📌 项目简介

    MoneyPrinterTurbo 是一个基于AI大模型的短视频一键生成工具。只需提供一个视频主题关键词,就可以全自动完成:文案生成 → 视频素材匹配 → 字幕生成 → 背景音乐搭配 → 高清短视频合成,全流程无需人工干预。

    66.6K+
    GitHub Stars

    多模型
    AI 接入支持

    双端
    Web + API

    MIT
    开源协议

    ⚙️ 安装要求和过程

    环境要求

    • Python 版本:推荐 Python 3.11
    • 依赖管理:优先使用 uv 工具
    • 必要依赖:ImageMagick(图片处理)、ffmpeg(视频处理)
    • 最低配置:4核CPU、4GB内存
    • 推荐配置:6-8核CPU、8GB内存、4GB显存GPU

    快速安装步骤

    # 1. 克隆项目
    git clone https://github.com/harry0703/MoneyPrinterTurbo.git
    cd MoneyPrinterTurbo
    
    # 2. 配置 API Key(复制配置模板)
    cp config.example.toml config.toml
    # 编辑 config.toml,填入 pexels_api_keys 和 LLM API Key
    
    # 3. 安装依赖(推荐使用 uv)
    uv python install 3.11
    uv sync --frozen
    
    # 4. 启动 Web 界面
    uv run streamlit run ./webui/Main.py --browser.gatherUsageStats=False

    💡 国内用户推荐:LLM 接入优先选择 DeepSeekMoonshot(Kimi),无需VPN,注册即送额度,调用稳定。

    ✨ 核心功能

    ① 全流程自动化生成

    只需输入主题/关键词,自动完成文案生成、高清无版权素材匹配、字幕生成、背景音乐搭配,最终合成高清短视频,全程无需人工干预。

    ② 多场景尺寸适配

    支持竖屏 9:16(1080×1920)和横屏 16:9(1920×1080)两种高清尺寸,兼容中英文视频文案生成,满足不同平台发布需求。

    ③ 灵活自定义能力

    支持 AI 自动生成文案或自定义文案,可调整字幕字体/位置/颜色/大小/描边,支持自定义背景音乐和本地素材,批量生成多个视频。

    ④ 多模型兼容

    支持 OpenAI、Moonshot、Azure、通义千问、Google Gemini、Ollama、DeepSeek、文心一言等国内外十余种大模型接入,自由选择最适合的 LLM 后端。

    ⑤ 多端使用支持

    提供完整 MVC 架构,同时支持 Web 可视化界面、REST API 接口两种使用方式,还支持 Docker 部署和 Google Colab 在线运行,开箱即用。

    🎬 典型使用场景

    场景一:自媒体短视频批量生产

    自媒体运营者需要每天稳定输出高质量短视频内容,但文案创作、素材搜集、剪辑合成耗时费力。使用 MoneyPrinterTurbo,只需输入”今日科技热点”等关键词,AI 自动生成文案、匹配无版权视频素材、添加字幕和背景音乐,几分钟即可产出一条完整短视频,内容生产效率提升 10 倍以上

    场景二:企业营销视频快速制作

    电商运营或市场人员需要为产品制作营销短视频,但缺乏专业剪辑能力。通过自定义文案功能,粘贴产品介绍文案,MoneyPrinterTurbo 自动匹配相关视频素材并合成营销视频,支持批量生成多个产品的宣传视频,大幅降低视频制作门槛和成本。

    场景三:知识分享内容创作

    知识博主需要将长篇文章或知识点转化为短视频内容。将文章要点整理为关键词,AI 自动扩展为视频文案,生成适合抖音、视频号、小红书等平台的竖屏短视频,让知识内容以更生动的形式触达更多受众。

    💡 推荐理由

    MoneyPrinterTurbo 是我见过的最完整的 AI 短视频生成开源方案。它不只是简单地拼接 AI 能力,而是真正从创作者的实际痛点出发,把视频制作的全流程——创意、文案、素材、配音、字幕、剪辑——全部打通。

    最打动我的是它的务实性:支持国内外主流大模型接入,国内用户可以直接用 DeepSeek 或 Kimi,不需要折腾 VPN;支持自定义文案和本地素材,不会完全被 AI 绑架;提供 Web 界面和 API 双端,无论你是普通用户还是开发者都能快速上手。

    当然,AI 生成的视频质量还无法和专业人工剪辑相提并论,素材匹配的准确性也有提升空间。但作为内容创作的效率工具,它已经足够惊艳。对于需要批量生产短视频内容的自媒体运营者来说,这是一个值得深入研究的开源项目。

    🖼️ 界面预览

    Web界面

    Web 可视化操作界面

    📥 下载地址

    🌐 官方网站:https://github.com/harry0703/MoneyPrinterTurbo

    🐙 GitHub 仓库:https://github.com/harry0703/MoneyPrinterTurbo

    📦 一键启动包:Windows 用户可直接下载项目 Release 中的一键启动包,解压即跑

    🐳 Docker 部署:docker-compose up 一键启动

    ☁️ 在线体验:支持 Google Colab 在线运行,无需本地配置环境


    📌 开源自尊:本项目采用 MIT 开源协议,可自由用于个人和商业场景,仅需保留版权声明。如果你也在探索 AI + 内容创作的方向,强烈建议深入研究这个项目,一定会有所收获。

  • 谷歌I/O 2026全记录:Gemini Spark永久在线,智能眼镜今秋开卖

    5月19日,谷歌I/O大会开幕。主题演讲持续了两个小时,核心信息只有一句话:Gemini不再是聊天工具,而是要替你干活。

    这次大会发布的东西不少,但有一条主线贯穿全场——把AI智能体塞进你每天用的所有谷歌产品里:搜索、Gmail、YouTube、Docs、Chrome,一个不落。

    谷歌说现在有9亿人在用Gemini,人们已经用它生成了超过500亿张图像。2026年的目标是让Gemini成为你互联网的”执行层”。

    搜索的25年来最大重构

    搜索框变成了”智能搜索框”——AI代理直接嵌在里面,当天就向全量用户推送。你搜”黑洞”,搜索结果页不是十蓝色链接,而是AI直接生成一个可视化解释视频,嵌在结果页里播放。

    夏天还会上线”生成式UI”功能:搜索结果根据你查的内容类型自动调整布局。查新闻、查视频、查图片,每种场景下搜索结果的呈现方式都不一样,是AI实时生成的界面。

    Gemini Spark:谷歌版OpenClaw

    这是本次大会最值得关注的产品之一。Gemini Spark是一个永久在线的个人AI代理,跑在谷歌云上——就算你关了电脑、手机没电,它还在云端继续跑任务。

    它能读取你的谷歌硬盘文件,知道你的日历安排,理解你的生活节奏。你跟它说”帮我策划街区派对”,它会自己发邮件、追踪采购进度、发跟进邮件,全程不需要你盯着。涉及付款的关键节点才会来问你确认。

    目前Spark只支持谷歌自家服务,夏天会接入Chrome浏览器和第三方服务。这个产品的定位很清晰:跟OpenClaw正面竞争。

    智能眼镜今年秋天就卖

    谷歌联合三星和眼镜品牌Warby Parker、Gentle Monster做两款智能眼镜,属于Android XR平台。

    • 音频版:今年秋季上市,镜腿有扬声器,有摄像头,能看见你看见的东西,支持实时跨语言翻译
    • 带显示屏版:还在研发,上市时间更晚,可以在镜片上显示短信、导航、搜索结果

    两款都支持调用谷歌的图像生成工具Nano Banana——你拍一下眼前的场景,AI可以在画面上叠加虚拟物体或特效,没显示屏的版本会把生成内容推到你的手机或安卓手表上。

    其他值得关注的发布

    Gemini Omni:对标Sora 2的视频生成模型,特色是”真实感”——可以把你拍的自拍视频换背景、换风格、换环境,人物表演保留,场景全部AI重绘。轻量版OmniFlash当天就向Pro和Ultra订阅用户开放了。

    通用购物车:谷歌要做跨网站的购物车,你在不同电商网站逛,把想买的东西都加进这个统一购物车,AI帮你比价、提醒降价、推送新配色。结账时谷歌的安全支付系统可以一次性结清跨店铺订单。

    第八代TPU:训练性能提升3倍,推理专用版本每秒能生成1500个token。谷歌2026年在算力基建上的投入预计达到1900亿美元。


  • Asana 75亿美元收购无代码AI智能体平台 StackAI

    工作效率平台 Asana 宣布以75亿美元收购无代码 AI 智能体构建器 StackAI,这是它向”AI原生工作平台”转型的关键一步。StackAI 的两位创始人 Tony Rosinol 和 Bernard Aceituno 将随收购加入 Asana。

    Asana AI workflow
    (图源:Getty Images / TechCrunch)

    Asana 把这次收购定位为”人类与 Agent 团队协作操作系统”路线图的一部分。StackAI 做的事其实挺有意思——它让没有技术背景的人也能搭建能在企业现有系统里跑的 AI Agent,可以接入 Salesforce、Slack、GSuite 这些数据源。

    StackAI 是 YC 2023年冬季批次孵化的项目,累计融资约2000万美元,最近一轮1600万美元的A轮投资方包括 Gradient、Epaklon Capital、Lobby VC、LifeX Ventures 以及 Vercel CEO Guillermo Rauch。

    为什么要买它

    Asana 过去几年陆续推出了 AI Studio(Agent 构建器)和 AI Teammates(预制自动化流程)等产品,但面对 OpenAI、Anthropic 这些大模型公司的”降维打击”,光靠自己的技术积累有点吃力。StackAI 的价值在于它已经打通了企业常用系统的数据管道,而且不需要写代码——这对 Asana 的核心用户群(项目经理、运营团队)来说门槛刚刚好。

    当然竞争也不小。Zapier 这类老牌自动化工具在拼命加 AI 功能,大模型公司也在推自己的 Agent 平台。Asana 的优势是它已经嵌进了成千上万家公司的日常工作流里,这是 OpenAI 没有的数据上下文。

    Asana 自己的坎


    但这家公司日子并不好过。ChatGPT 问世以来,Asana 的市值跌了一半还多。今年3月创始人 Dustin Moskovitz 卸任 CEO,由 Dan Rogers 接手。新管理层的赌注就是”人+Agent”协作这个方向——今天这笔收购是这个战略的最新落地动作。

    Dan Rogers 在声明里说:”这次收购加速了我们的路线图,把我们带进人机协作的下一个阶段。AI Teammates 和 AI Studio 已经让我们看到了势头,StackAI 现在能让用户走得更远——把最复杂的业务流程端到端地’Agent 化’。”

    75亿美元的价格不便宜,但对一家想在工作流 AI 赛道翻盘的公司来说,这可能是不得不下的注。

  • Cursor Composer 2.5 发布:不换底座、1/10成本追平Claude Opus 4.7

    过去几个月,AI 编程工具的用户有个普遍感受:Claude Code 用起来越来越顺手,Cursor 反而有点掉队。这个局面在5月19日变了——Cursor 发布了 Composer 2.5,直接把基准测试成绩拉到了和 Claude Opus 4.7 同一个水平线。

    有意思的是,这次 Cursor 没有换底座模型,仍然用的是月之暗面开源的 Kimi K2.5 权重,只是把85%的计算量砸进了后训练。换句话说,同样的底座,靠训练手法把成绩硬拉了上去。

    Composer 2.5 在 SWE-Bench Multilingual 拿到79.8%,和 Claude Opus 4.7 的80.5% 只差0.7个百分点。成本却只有后者的约1/10。

    价格才是真正的杀手锏

    具体定价:输入0.5美元/百万token,输出2.5美元/百万token。作为对比,Claude Opus 4.7 的输入定价大约在20美元/百万token量级。差距是数量级的。

    Cursor 为什么要走这条路?直接原因很现实:Cursor 调用 Anthropic 的模型需要付推理费,成本结构是跟着 Anthropic 走的,它没法把 Claude Code 的价格打下来。自研模型是唯一能打出差异化的路径。


    长任务能力是这次的重点

    AI 编程工具的一个核心痛点是:短任务表现都不错,但任务一拉长(多文件修改、跨步骤依赖、几十轮工具调用),模型就容易失忆或者犯低级错误。

    Composer 2.5 针对这个场景做了专项优化。训练方法里有个细节值得说:「功能删除」训练——从可运行代码库里随机删掉某项功能,让模型重新实现并通过测试验证。这种方式生成的训练数据质量远高于人工标注,因为它自带可验证的正确性信号。

    另一个训练技巧是带文本反馈的强化学习。不是等整个任务结束才给一个奖励信号(那样太稀疏,模型很难学到东西),而是在模型执行出错的位置直接插入局部提示——比如工具调用失败时,提示可用工具列表——让模型从错误位置开始就能得到针对性反馈。

    透明性这块,这次学乖了

    上次发布 Composer 2 的时候,Cursor 没有披露模型底座来自 Kimi K2.5,结果被社区扒出来后在 Hacker News 上引发了一轮讨论。这次 Composer 2.5 的发布公告里直接写明了底座来源,算是吃一堑长一智。

    目前 Cursor 内部35%的合并 PR 已经由自主 Agent 创建。这个数据背后意思是:模型不只是给人提供代码建议,而是能独立跑完一个功能分支的开发-测试-提 PR 全流程。Composer 2.5 发布首周,Cursor 用户的模型调用量就翻了一倍。


    下一步是什么

    Cursor 已经宣布正在和 SpaceX AI 合作训练下一代模型,使用 Colossus 2 的百万 H100 等效算力,总计算量会是 Composer 2.5 的10倍。按这个节奏,下一代模型的基准测试成绩还会再往上走一截。

    顺带一提,马斯克在 X 上转了 Composer 2.5 的发布推文,确认了 Colossus 2 参与了部分训练。这条转发本身比任何公关稿都更有分量——意味着这家公司的训练基础设施已经得到了业界最挑剔的那批人的认可。

  • crawl4AI:66.7K Stars!LLM友好型网页爬虫,让AI直接读懂网页内容

    crawl4AI:66.7K Stars!LLM友好型网页爬虫,让AI直接读懂网页内容

    crawl4ai logo
    ─ ✦ ─ ✦ ─ ✦ ─ ✦ ─

    ## 🚀 一句话介绍

    crawl4ai 是一个专为 LLM 和大模型应用设计的开源网页爬虫与数据抓取工具,能把任意网页转换成大模型可直接读取的干净 Markdown,是 RAG、AI Agent、数据采集管道的绝佳搭档。

    66.7K+GitHub Stars
    Apache 2.0开源协议
    5万+开发者社区
    Python主要语言
    ─ ✦ ─ ✦ ─ ✦ ─ ✦ ─

    ## 🔧 安装要求与步骤

    crawl4ai 对环境的依赖相当克制,核心只需 Python 3.9+ 即可运行。

    第一步:安装核心包
    pip install -U crawl4ai
    安装后执行 crawl4ai-setup 完成浏览器依赖初始化
    第二步:验证安装
    crawl4ai-doctor 可一键检查环境完整性
    第三步(可选):启用高级特性
    pip install crawl4ai[torch] — 启用 PyTorch 语义增强
    pip install crawl4ai[transformer] — 启用 Transformer 特性
    pip install crawl4ai[all] — 安装全部可选依赖
    💡 提示:如遇到 Playwright 浏览器相关问题,可手动执行 python -m playwright install --with-deps chromium 修复。
    ─ ✦ ─ ✦ ─ ✦ ─ ✦ ─

    ## ⚡ 核心功能

    📝 智能 Markdown 生成

    自动将网页内容转换为结构化、干净的 Markdown 格式,支持启发式过滤生成 Fit Markdown(对 LLM 最友好的格式),自动将链接转换为引用格式,支持 BM25 算法过滤无关内容。

    📊 结构化数据提取

    支持接入所有主流 LLM(开源/闭源)进行结构化数据提取,提供多种分块策略(主题/正则/句子级),支持基于余弦相似度的语义内容匹配,并允许通过 CSS/XPath 选择器精准提取指定区域。

    🖥️ 浏览器精细控制

    支持托管用户自有浏览器,可通过 Chrome DevTools 协议实现远程控制,支持持久化浏览器 Profile(保存登录态/Cookie),支持会话复用和代理认证,兼容 Chromium/Firefox/WebKit。

    🚀 生产级部署能力

    提供优化后的 Docker 镜像 + FastAPI 服务,内置 JWT 认证,支持 API 网关一键部署,支持大规模并发爬取,同时即将推出成本远低于同类方案的 云 API 服务

    ─ ✦ ─ ✦ ─ ✦ ─ ✦ ─

    ## 🏗️ 典型使用场景

    场景一:RAG 应用的数据供给

    在构建基于 RAG(检索增强生成)的 AI 应用时,crawl4ai 可以批量抓取目标网站内容并转换为干净的 Markdown,直接作为知识库输入。相比传统爬虫,它输出的 Fit Markdown 去除了导航栏、广告、页脚等噪音,大幅提升 RAG 召回质量。

    场景二:AI Agent 实时网页数据获取

    当你的 AI Agent 需要实时获取网页信息(如查最新新闻、抓取电商价格、获取文档更新)时,crawl4ai 可作为 Agent 的工具函数接入,让 Agent 具备”浏览网页”的能力。

    场景三:大规模数据采集管道

    企业需要构建竞品价格监控、舆情分析、市场情报采集等系统时,crawl4ai 的 Docker 部署模式 + API 服务可以支撑高并发的数据采集需求,内置的缓存机制和错误处理让生产环境更稳定。

    ─ ✦ ─ ✦ ─ ✦ ─ ✦ ─

    ## 💡 推荐理由

    **这是我目前在 Python 生态里用过的最适合 LLM 场景的爬虫工具,没有之一。**

    三个让我印象最深的亮点:

    ① Fit Markdown 真的能打。 传统爬虫抓下来的网页全是噪音(导航、广告、相关推荐……),丢给 LLM 既浪费 Token 又影响效果。crawl4ai 的 Fit Markdown 通过启发式算法自动过滤无关内容,输出几乎可以直接喂给大模型的好内容。

    ② 对开发者极度友好。 一行 pip install crawl4ai 就能跑起来,CLI 命令 crwl 让非 Python 场景也能快速验证效果。更难得的是它提供了 Playground 交互式测试页面,调试爬虫策略不用写一行代码。

    ③ 架构设计有前瞻性。 它不只是一个爬虫,而是一个完整的数据采集基础设施:支持连接自有浏览器(保留登录态)、支持会话复用、支持代理池、支持 Docker 化部署,甚至即将推出云 API。这种”既能单机玩,又能上生产”的定位非常难得。

    📦 项目地址:github.com/unclecode/crawl4ai

    🌐 官方网站:crawl4ai.com

    📖 文档中心:docs.crawl4ai.com

    ─ ✦ ─ ✦ ─ ✦ ─ ✦ ─

    WorkBuddy AI 自动采集撰写 · 开源项目第40期 · 2026-05-28

  • Robinhood 上线 AI Agent 炒股功能:可自主交易股票,亏损自负

    Robinhood 让 AI Agent 帮你炒股,赚了算你的,亏了也算你的

    AI Agent 能做越来越多的事——写代码、订机票、帮你回邮件。现在,Robinhood 想让它再多做一件:帮你买卖股票。

    这家在线券商本周宣布,用户可以为 AI Agent 开设独立账户,存入一笔资金,然后让 Agent 在市场上自主交易。听起来很酷,但公司自己也赶紧补了一句:这事风险很大,亏完了别怪我们。

    Robinhood AI Agent 交易示意图
    Robinhood 的 AI 交易代理功能演示 | 图片来源:The Verge

    AI 炒股,到底靠不靠谱?

    现在让 AI Agent 替你炒股,胆子真的要很大。Google、微软、OpenAI、Anthropic 这些公司都在吹 AI Agent 是未来方向,但现实是:这技术目前还没达到宣传里那么厉害。

    写代码确实还行,但让 Agent 替你在网上买东西或者填表格,经常出错,效率也不高。拿真金白银去试,风险不是一般的大。

    “代理交易涉及重大风险,包括可能损失全部投资。AI驱动的策略在某些市场条件下可能表现不佳,交易速度快,且可能难以实时监控或停止。”——Robinhood 官方风险提示

    你能做什么,不能做什么

    目前这个功能还在 Beta 阶段,首先支持股票交易。Robinhood 的计划是后续扩展到期权、加密货币、事件合约和期货。

    用户每次收到 Agent 完成交易的推送通知,可以在 App 内查看实时活动流,随时可以暂停 AI 交易。连接的方式是通过模型上下文协议(MCP)——这是个连接 AI 系统和应用的开放标准,Anthropic 推出来的那个。

    除了炒股,Robinhood 还给了 Agent 另一项能力:连接虚拟信用卡。Gold Card 用户可以让 Agent 拿着一张限额的卡去网上买东西——比如告诉它”Nike 新品低于300美元就买”,或者”帮我找评分5星、低于30美元的狗玩具”。每笔消费你可以选择手动批准,Agent 也会在交易前给你预览。


    让 AI 替你做投资决策,这个概念本身不新鲜。但真正把 Agent 和实际券商账户打通,Robinhood 可能是头一个吃螃蟹的大平台。至于你敢不敢把账户交给它,那就是另一个问题了。

  • IBM搞了个企业IT基准测试,结果把前沿AI模型全 underneath 50%分数线

    大语言模型在各种排行榜上吊打人类已经不是新闻了。编码、数学、逻辑推理,GPT和Claude们基本想考多少考多少。但IBM研究院和Artificial Analysis最近联合推出了一个专门面向企业IT场景的基准测试ITBench-AA,把这批”优等生”拉回现实——得分全部低于50%。

    这个测试的核心区别在于:它不考”答题”,而是考”做事”。

    ITBench-AA评估的是AI Agent在企业IT环境中自主行动的能力——不是回答问题,而是真正去排查故障、管理配置、处理工单。

    为什么通用基准测不出来?

    通用的AI基准测试有个通病:题目是干净的,输入是结构化的,正确答案是明确的。但真实的企业IT环境完全不是这样。

    想象一下:某个生产环境报警了,日志分散在三台服务器和一个云服务上,错误信息是模糊的,相关文档散落在内部Wiki的废弃页面里。一个合格的IT工程师会知道先查什么、忽略什么、什么时候需要升级工单。而当前的前瞻模型,即使逻辑推理能力很强,在这种”脏”环境里的表现就掉下来了。

    ITBench-AA试图模拟的就是这种复杂度。它要求AI Agent不仅能”理解”问题,还要能规划多步行动、在过程中根据新信息调整策略、并且在不确定时知道停止而非瞎猜。

    50%意味着什么?

    低于50%的意思不是说这些模型”不能用”,而是说它们还没达到”可以无人监督地自主处理企业IT任务”的水平。这个门槛其实挺高的——企业环境里一个错误的自动化操作可能导致服务中断甚至数据丢失,所以准确率要求天然就高。

    但这个结果的另一层含义是:AI Agent要真正进入企业核心运维流程,还有相当距离。现在的Agent更适合做”辅助”角色——给IT工程师提供建议、帮忙查文档、生成脚本草稿——而不是直接接管。


    这个基准测试会改变什么?

    ITBench-AA的出现至少会带来两个变化。第一,它给AI公司和中国企业提供了一个清晰的改进方向——不再是模糊的”提升推理能力”,而是具体的”在多步IT运维场景中减少错误率”。

    第二,它会推动更多行业建立自己的”Agent能力基准”。IT运维只是第一个,类似的基准测试很可能出现在法律、医疗、金融合规等领域。这些领域的共同点是:任务复杂、容错率低、需要多步推理。

    对从事AI Agent开发的团队来说,这个基准测试是个很有价值的参考。它告诉你:别只盯着MMLU和HumanEval了,去看看你的Agent在”脏”环境里到底行不行。

  • Robinhood 让 AI Agent 帮你炒股,亏了也算你的

    AI Agent 今年最火的应用方向之一,是替你干活——包括替你花钱。Robinhood 昨天宣布,平台即将支持用户让自己的 AI Agent 直接下单交易股票,同时还推出了一张专门给 AI Agent 用的虚拟信用卡。

    AI 代理有独立账户,但每笔交易你都能看见

    具体怎么运作?Robinhood 的用户可以给自己的 AI Agent 开一个独立的子账户,绑定专用的钱包。这个 Agent 能读取和分析你的投资组合,自己制定交易策略、给出投资建议,但它只能用这个专属钱包里预充值的余额来下单,动不了你主账户里的钱。

    Robinhood AI Agent 交易功能
    Robinhood 推出的 AI Agent 交易功能界面(图源:TechCrunch)

    每笔交易执行前,你会收到提醒。有些场景下,Agent 会先给你看订单预览,你点了批准才会真正下单。Robinhood 说他们内置了欺诈检测机制,可疑交易会由人工团队审核,帮你处理纠纷。

    「我们收到很多用户的需求,希望可以接入他们自己的工具、大语言模型和 Agent,与 Robinhood 连接。这就是我们推出新产品的初衷。」——Robinhood 产品副总裁 Abhishek Fatehpuria

    还能分析研报、识别投资机会

    Agent 的能力不限于下单。用户可以把它连接到自己的 MCP(模型上下文协议)服务,让它分析投资组合的行业集中度风险、执行交易、浏览分析师研报来识别不同行业的新投资机会。

    目前这个功能还在测试阶段,暂时只支持股票交易。Robinhood 表示很快会加上对期权、加密货币、事件合约、期货和预测市场的支持。

    同步推出的还有一张 AI Agent 专用的虚拟信用卡。用户可以把自己的 Agent 连到 Robinhood 的银行 MCP 服务器,让 Agent 帮你在网上买东西付钱。这张虚拟卡目前只对 Robinhood Gold 黄金卡持卡人开放,用户可以设每月消费上限,也可以选择让 Agent 每笔支付前都来问你一声。


    不止 Robinhood 一家在搞

    让 AI Agent 代表用户付钱这件事,Robinhood 不是独一家。Stripe 早就发布了 Agent 支付接口,亚马逊和谷歌也在做类似的东西,初创公司 Prva Pay 也在冲这个方向。整个行业都在预判:下一步,用户的 Agent 会像现在的 App 一样普遍。

    Robinhood 过去几年一直在往 AI 方向投。2024 年收购了 AI 驱动的研究平台 Pluto,去年还给平台加了能给出投资建议的 AI 助手。这次把 Agent 交易做进来,算是把「AI 帮你理财」这件事又往前推了一步。

    当然,把交易权交给 AI Agent 意味着什么,每个人心里都有杆秤。Agent 能读研报、能分析组合风险,但它下的每一单最终都是你的钱在买单。Robinhood 给了用户监控和审批的机制,但「Agent 炒股」这件事本身,距离真正普及还有不少路要走。

    • AI Agent 有独立子账户和预充值钱包,无法直接动用主账户资金
    • 每笔交易可设置需用户审批,平台内置欺诈检测保护
    • 目前仅支持股票,期权、加密货币等功能即将上线
    • 同步推出 AI Agent 虚拟信用卡,支持设置月度消费限额
  • AI编程独角兽Cognition融资10亿美元,估值250亿美元,Devin年化收入逼近5亿

    做AI编程助手的创业公司里,Cognition是个异类。别人都在想着怎么把自己的工具塞进VS Code或者GitHub,它直接搞了个能自己干活儿的”AI软件工程师”Devin。结果就是:成立没几年,最新一轮融资超过10亿美元,估值250亿美元(融资前)。

    八个月前,Cognition刚以102亿美元的投后估值完成4亿美元融资。八个月后,估值翻了一倍还多。这速度,就算在AI创投圈里也是相当炸裂的。

    Cognition CEO Scott Wu
    Cognition CEO Scott Wu / TechCrunch

    投资人为什么这么敢押?

    这一轮由Lux Capital和General Catalyst领投,Founders Fund、8VC这些老股东继续跟投,还新进了Ribbit Capital、Atreides、Layer Global。阵容豪华,说明顶级VC在用真金白银投票——他们认为,独立的AI编程创业公司还有生存空间,不会被模型厂商直接吃掉。

    AI编程这个赛道,去年看起来像是模型厂商的囊中之物——Anthropic的Claude Code、OpenAI的Codex,还有谷歌收购Windsurf团队后搞的Jules,哪个不是自带模型、直接集成?Cognition能融到这个量级,本身就是在证明:专注做”AI agent自己写代码”这件事,有它独特的价值。

    客户和收入数据说话

    Cognition说自己已经拿下了奔驰、NASA、高盛、桑坦德银行这些大客户。更关键的是收入数据:过去六个月,企业客户使用Devin的规模每月环比增长50%,目前年化收入运行率已经达到4.92亿美元。

    这个增速,如果属实,确实能支撑250亿美元的估值。对比一下:Anthropic最新季度营收约翻了一番达到109亿美元年化,估值才到这个量级。当然,创业公司的”运行率”数字要打个折扣看,但方向是对的。


    Windsurf收购的后续

    去年Cognition收购了Windsurf的剩余资产(在谷歌挖走Windsurf团队之后)。这个操作挺有意思——Windsurf的核心团队去了谷歌做Jules,Cognition拿下了剩下的IP和产品。现在看来,这笔交易让Cognition在AI编程工具的产品积累上补了一课。

    Devin到底好不好用,开发者社区里评价两极。有人觉得它确实能处理一些完整的开发任务,也有人觉得它还是太容易跑偏,需要人一直盯着。但投资人的逻辑可能是:哪怕Devin现在还不够成熟,这个方向——完全自主的AI软件工程师——值得提前下重注。

  • mem0:给AI装上”长期记忆”,AI Agent记忆层首选方案

    mem0:给AI装上”长期记忆”,AI Agent记忆层首选方案

    🧠 给AI装上”长期记忆”:mem0 项目深度解析

    mem0 banner

    mem0 – 面向AI智能体的通用记忆层

    📌 项目简介

    mem0 是一个面向AI智能体的通用记忆层(Universal Memory Layer),解决了当前大模型最致命的短板之一:没有长期记忆。每次对话都是全新开始,AI记不住你是谁、喜欢什么、上次聊到哪。

    mem0 的出现让AI拥有了跨会话、跨平台、跨智能体的持久记忆能力,被 Y Combinator S24 孵化,目前在GitHub已获得 39,000+ Stars,是AI Agent基础设施赛道最热门的开源项目之一。

    ⚙️ 安装要求与过程

    环境要求:

    • Python 3.9+ 或 Node.js 16+
    • OpenAI / Anthropic / Ollama 等LLM API密钥(可选,也可用内置模型)
    • Docker(自托管模式需要)

    快速安装(Python):

    # 基础安装
    pip install mem0ai
    
    # 如需BM25关键词匹配 + 实体提取(推荐)
    pip install mem0ai[nlp]
    python -m spacy download en_core_web_sm

    快速安装(Node.js):

    npm install mem0ai

    CLI快速上手:

    # 全局安装CLI
    npm install -g @mem0/cli
    
    # 初始化(交互式配置)
    mem0 init
    
    # 添加用户记忆
    mem0 add "Prefers dark mode and vim keybindings" --user-id alice
    
    # 检索记忆
    mem0 search "What does Alice prefer?" --user-id alice

    🚀 核心功能

    1. 多层级记忆管理

    支持用户级会话级智能体状态级三层记忆隔离与融合,同一个用户在不同场景下的记忆可以独立管理,也可以按需共享。

    2. 自适应个性化

    随着交互次数增加,mem0会自动学习用户偏好、习惯用语、决策风格,并在后续对话中主动应用这些记忆,实现真正的个性化AI体验。

    3. 多信号融合检索(2026年4月重大升级)

    同时支持语义检索(向量相似度)、BM25关键词匹配实体链接匹配三种信号并行打分融合,检索准确率大幅提升。在 LoCoMo 基准测试中得分 91.6(较旧版提升20分)。

    4. 时间感知推理

    mem0 能理解时间维度——「我上周说过什么」和「我去年说过什么」的权重完全不同。支持基于时间的检索,完美适配待办计划、历史事件追溯等场景。

    5. 三种部署方式,灵活适配

    库调用(pip/npm安装,适合原型开发);② 自托管服务(Docker部署,数据完全私有);③ 全托管云平台(零运维,直接注册即用)。

    💡 典型使用场景

    场景一:AI助手个性化陪聊

    想象你有一个AI助手,它记得你上次说「正在学TypeScript」、「不喜欢太官方的解释」、「喜欢用代码示例说明问题」。下次你问「如何实现防抖」,它会直接给你TypeScript代码,并用轻松的口吻解释——而不是从头介绍你是谁。mem0让这种体验成为可能。

    场景二:企业客服智能体

    用户打来电话,AI客服能立刻调出他三个月前报过的故障、偏好的解决方案、甚至他的情绪标签(「这位用户比较急躁,需要快速响应」)。mem0让企业AI从「每次都像第一次」变成「老朋友一样了解你」。

    场景三:医疗健康追踪

    AI健康助手跟踪患者的历史症状、用药偏好、过敏记录,并在每次交互中主动引用这些记忆,提供真正个性化的护理建议。这在欧盟AI Act生效后,对「可解释AI」的合规要求也极其重要。

    🌟 推荐理由

    我第一次用 mem0 的时候,说实话是被它的简单震撼到了。

    只需要 pip install mem0ai,然后几行代码,你的AI就有了记忆。不需要部署向量数据库,不需要设计Embedding流程,不需要操心记忆的增删改查——mem0 全帮你搞定了

    但真正让我决定在用生产环境用它的,是2026年4月的那次算法大升级。新算法在 LongMemEval 上拿到 94.8分,记忆召回率提升了 53.6%。这意味着:它不只是「能存记忆」,而是「存对了、取准了」。

    另外不得不提的是,mem0 的全托管云平台(app.mem0.ai)对独立开发者非常友好,免费额度够用,付费版也比自己搭建维护便宜得多。

    如果你正在做AI Agent开发,mem0 是目前最值得接入的记忆层方案,没有之一


    📦 下载地址

    GitHub(开源,Apache 2.0协议):
    https://github.com/mem0ai/mem0 ⭐ 39K+ Stars

    官网(全托管云平台):
    https://mem0.ai

    PyPI(Python包):
    https://pypi.org/project/mem0ai/

    npm(Node.js包):
    https://www.npmjs.com/package/mem0ai

    研究论文:
    https://mem0.ai/research


    📌 本文由 WorkBuddy AI 自动采集撰写,开源项目第12期