标签: AI Agent

  • Sentence Transformers:RAG与语义搜索的基石,18.8K+Stars让文本嵌入变得简单

    Sentence Transformers:RAG与语义搜索的基石,18.8K+Stars让文本嵌入变得简单

    📌 项目速览
    项目名称: Sentence Transformers
    GitHub: huggingface/sentence-transformers
    ⭐ Stars: 18.8K+ | 🍴 Forks: 2.8K+
    编程语言: Python | 许可证: Apache-2.0
    维护方: Hugging Face (原 UKP Lab)
    官网: sbert.net

    🎯 项目简介

    Sentence Transformers 是计算文本嵌入(Embeddings)的事实标准框架,让语义搜索、RAG 检索和文本相似度计算变得极其简单。由德国达姆施塔特工业大学 UKP Lab 首创,现由 Hugging Face 团队维护,是每一个做 RAG、语义搜索、向量检索工程师的必备工具箱。

    只需两行代码,就能把任意句子转换成高质量稠密向量;再配合一行相似度计算,即可实现语义级别的文本匹配。支持 100+ 语言、15000+ 预训练模型、多模态(文本/图像/音频/视频)嵌入,堪称 AI 时代的”文本向量化瑞士军刀”。

    💡 为什么重要? 大语言模型虽强,但无法直接处理超长文本或实时检索。Sentence Transformers 将文本转化为固定维度的向量,使语义搜索、去重、聚类、推荐等任务速度提升 100 倍,是 RAG 系统的第一块基石。

    ⚙️ 安装要求和过程

    环境要求

    • Python: 3.10+
    • PyTorch: 1.11.0+
    • transformers: 4.41.0+
    • 硬件: CPU 可用,GPU(CUDA)可加速 10-50 倍

    快速安装

    # 基础安装(仅核心功能)
    pip install -U sentence-transformers
    
    # 带扩展功能(图像/音频/视频/训练/ONNX)
    pip install sentence-transformers[image,audio,video,train,onnx]
    
    # 使用 uv 快速安装
    uv pip install sentence-transformers
    
    # Conda 安装
    conda install -c conda-forge sentence-transformers
    

    验证安装:

    python -c "from sentence_transformers import SentenceTransformer; print('✅ 安装成功')"
    

    🌟 核心功能

    1. 稠密嵌入(Dense Embeddings)—— RAG 的核心

    将句子、段落甚至整篇文档转换为固定维度的稠密向量(通常 384-1024 维),使得语义相似的文本在向量空间中距离更近。支持 Matryoshka 嵌入(可变尺寸,大向量拆小不降性能)和 嵌入量化压缩(降低 4-8 倍存储)。

    2. 交叉编码器重排序(Cross-Encoder Reranking)—— 精准召回

    稠密检索快速召回 Top-100 后,用 Cross-Encoder 对查询-文档对进行精细打分,重排序后 Top-5 准确率可提升 15-30%。这是生产级 RAG 系统的标配二阶段检索策略。

    3. 稀疏嵌入(Sparse Embeddings)—— 关键词 + 语义混合

    基于 SPLADE 等模型生成稀疏向量(维度 = 词表大小,但 99.8% 以上元素为 0),兼具 BM25 的关键词匹配能力和稠密向量的语义理解能力,实现真正的 混合检索

    4. 多模态嵌入 —— 图文音视统一向量空间

    通过统一 API 支持文本、图像、音频、视频四种模态的嵌入模型。例如用 AI-ModelScope/CLIP-ViT-bigG-patch14 可实现图文跨模态检索,用 laion/clap-htsat-unfused 实现音频语义搜索。

    5. 模型训练/微调 —— 适配你的业务场景

    提供 20+ 种嵌入模型损失函数(余弦相似度、三元组、对比学习等)、10+ 种重排序损失函数、10+ 种稀疏编码损失函数。支持多语言、多任务联合训练,仅需几十对标注样本即可微调出业务级模型。

    🚀 典型使用场景

    场景一:RAG 知识库检索(最流行)

    企业文档问答系统的标准做法:用 Sentence Transformers 将知识库切片编码为向量存入向量数据库(Chroma/Milvus/Qdrant),用户提问时实时编码查询向量,召回最相关的 Top-K 文档片段送给 LLM 生成答案。

    from sentence_transformers import SentenceTransformer
    from qdrant_client import QdrantClient
    
    # 1. 加载嵌入模型
    model = SentenceTransformer("sentence-transformers/all-MiniLM-L6-v2")
    
    # 2. 编码知识库文档
    docs = ["公司报销流程...", "年假申请方法...", "IT设备申领..."]
    doc_embeddings = model.encode(docs)
    
    # 3. 存入向量数据库
    client = QdrantClient(":memory:")
    client.add(collection_name="kb", vectors=doc_embeddings, payload=docs)
    
    # 4. 用户提问检索
    query = "怎么申请年假?"
    query_vec = model.encode(query)
    results = client.search(collection_name="kb", query_vector=query_vec, limit=3)
    print(results[0].payload)  # 返回最相关文档
    

    场景二:语义搜索与去重(电商平台/内容平台)

    电商平台的商品搜索(用户输入”红色运动鞋”能匹配”红跑步鞋”)、新闻推荐系统去重、简历与岗位描述的语义匹配,都依赖 Sentence Transformers 的语义编码能力。

    场景三:跨语言语义匹配(全球化应用)

    支持 100+ 语言的预训练多语言模型(如 paraphrase-multilingual-MiniLM-L12-v2),可将中文、英文、日文等不同语言的相同语义映射到向量空间的相近位置,实现跨语言检索和匹配。

    💡 推荐理由

    1. RAG 工程师的”Hello World”

    几乎所有 RAG 教程的第一个代码示例都是 Sentence Transformers。它把复杂的 Transformer 编码、池化、归一化等步骤封装成一行 model.encode(),让开发者专注业务逻辑而非模型细节。langchain、LlamaIndex 等框架的底层检索默认就用它。

    2. Hugging Face 生态深度整合

    作为 Hugging Face 官方库,可直接 model = SentenceTransformer("your-model-name") 加载 Hub 上任意模型,也轻松将本地模型 push_to_hub() 分享给社区。15000+ 预训练模型即搜即用,覆盖从轻量级的 MiniLM(80MB)到旗舰级的 gte-Qwen3(数 GB)。

    3. 性能与精度的完美平衡

    all-MiniLM-L6-v2(仅 80MB)在 MTEB 排行榜上达到中上水平,推理速度却是最强模型的 10 倍。配合 Matryoshka 训练,768 维向量可截断为 384/256/128 维使用,存储和检索速度提升数倍,精度损失极小。

    4. 生产级可靠性

    2019 年开源至今,历经 6 年迭代,2800+ Fork、1300+ 贡献者,PyPI 月下载量超百万。Apache-2.0 许可完全免费商用,被 Google、Microsoft、Amazon、Meta 等大厂的内部系统广泛采用。

    🎯 适用人群: RAG 开发者、搜索工程师、NLP 算法工程师、推荐系统工程师、AI 全栈工程师。如果你正在构建任何需要”理解文本语义”的系统,Sentence Transformers 都是首选工具。

    📥 下载地址

    本文由 AI 自动整理,数据截至 2026 年 6 月。项目持续更新中,建议访问官方仓库获取最新信息。

  • 拿下5000万美元融资,这家公司要用「数字世界」逼出AI Agent的真本事

    Patronus AI 数字世界测试
    Patronus AI 用”数字世界”测试AI Agent

    AI Agent这两年进化得越来越快,从最开始只能答答题,到现在能自主跑完一整套多步骤的复杂任务。但有个问题一直没人能很好地回答:你敢把自己的行程预订、财务分析交给一个还没被充分验证过的agent吗?

    模型厂商和做agent的创业公司心里也清楚,光拿个高分基准测试成绩说明不了什么问题——agent在实际场景里能不能把事做对,才是真正的考验。

    “数字世界”是个什么玩法

    2023年,两个前Meta AI研究员Anand Kannappan和Rebecca Qian创办了Patronus AI。他们的思路很直接:既然Waymo是通过先构建合成世界来测试自动驾驶汽车应对极端天气、小孩追球这些罕见危险场景的能力,那AI agent为什么不能用类似的办法?

    Patronus做的就是这件事:用他们称之为”数字世界模型(digital world models)”的技术,创建网站和内部系统的副本。agent在训练完后,会被扔进这些模拟环境里接受压力测试——强化学习会在这个过程中迭代:任务完成了给奖励,出错了给惩罚。

    Notable Capital的管理总监Glenn Solomon说,前沿AI实验室和很多新兴创业公司现在都是他们的客户,对模拟环境的需求几乎是”无法满足的(insatiable)”。

    为什么Patronus能拿到5000万美元

    营收数据说话:过去一年,Patronus的营收增长了15倍。这不是小打小闹的POC(概念验证),而是实打实的客户需求在推动。本周四,公司宣布完成5000万美元B轮融资,由Greenfield Partners领投,Notable Capital、Lightspeed、Datadog和三星跟投。加上这一轮,Patronus总融资额已经达到7000万美元。

    投资人看中的是这个赛道的刚需。AI agent有个很讨厌的习惯:走捷径。它们看起来好像把任务做完了,实际上偷工减料,结果就是任务没被正确完成。Solomon说:”Patronus特别擅长发现这些取巧行为,确保模型被追责。”


    目前做到哪一步了

    Kannappan说,目前主要聚焦在”可验证的问题”上——就是那些你能立刻检查对错的任务,比如软件工程和金融分析。但这远不是终点。”有很多领域是非常难以验证的”,他补充道。

    Patronus的长期目标是构建能让agent运行10小时、10天甚至10周的环境。这个野心不小——意味着他们要模拟的不只是单次交互,而是长时间的、开放式的任务执行过程。

    竞争对手方面,Patronus认为主要对手其实是各家AI实验室自己搭的评估团队。的确,OpenAI、Anthropic、Google这些大厂都在内部做模型评估。但Patronus的差异化在于:它做的是自动化评估,不需要人类参与。相比之下,Mercor和Surge这类依赖人类数据的公司,走的是另一条路。

    AI agent能不能真正被大规模投入使用,测试和评估是很关键的一环。Patronus拿到这笔钱之后,这个赛道估计会变得更热闹。毕竟,谁能证明自己的agent最可靠,谁就能在接下来的商业化竞争中占得先机。

  • MoneyPrinterTurbo:AI 自动生成短视频,93K+ Stars 让创作零门槛

    MoneyPrinterTurbo:AI 自动生成短视频,93K+ Stars 让创作零门槛

    🎬 MoneyPrinterTurbo:AI 自动生成短视频,93K+ Stars 让创作零门槛

    基于 AI 大模型的短视频自动生成工具|支持中英文|一键跨平台发布

    93.1K+
    ⭐ GitHub Stars
    Python
    💻 主要语言
    MIT
    📄 开源许可
    35K+
    📈 本月新增

    📌 项目简介

    MoneyPrinterTurbo 是一款基于 AI 大模型的短视频自动生成工具,由开发者 harry0703 创建并维护。只需提供一个视频主题或关键词,系统即可全自动完成文案生成、素材匹配、字幕合成、背景音乐搭配,最终输出高清短视频(支持竖屏 9:16 和横屏 16:9)。

    项目在 GitHub 上已获得 93,118 Stars,是本月 GitHub 趋势榜 Python 类目第二名(新增 35,397 Stars),深受内容创作者和 AI 爱好者欢迎。

    🔧 安装要求和过程

    环境要求

    • Python 版本:3.11+(推荐,项目使用 uv 管理依赖)
    • 核心依赖:Streamlit(Web界面)、FastAPI(API服务)、MoviePy 2.x(视频处理)、ffmpeg
    • AI 服务:需配置至少一家 LLM 提供商 API Key(支持 15+ 家)
    • 素材服务:需配置 Pexels 或 Pixabay API Key(免费申请)

    快速安装(三种方式)

    方式一:Docker 部署(推荐)

    # 1. 安装 Docker Desktop(Windows 用户需先配置 WSL)
    # 2. 克隆项目
    git clone https://github.com/harry0703/MoneyPrinterTurbo.git
    cd MoneyPrinterTurbo

    # 3. 一键启动(自动拉取预构建镜像)
    docker compose -f docker-compose.release.yml up

    # 4. 访问
    # Web 界面:http://127.0.0.1:8501
    # API 文档:http://127.0.0.1:8080/docs

    方式二:本地手动部署

    # 1. 克隆项目
    git clone https://github.com/harry0703/MoneyPrinterTurbo.git
    cd MoneyPrinterTurbo

    # 2. 使用 uv 安装依赖(推荐)
    uv python install 3.11
    uv sync –frozen

    # 3. 配置 API Key
    cp config.example.toml config.toml
    # 编辑 config.toml,填入 pexels_api_keys 和 llm_provider 配置

    # 4. 启动 Web 界面
    uv run streamlit run ./webui/Main.py –server.showEmailPrompt=False

    # 5. 启动 API 服务(可选)
    uv run python main.py

    方式三:Windows 一键启动包

    GitHub Release 下载最新一键启动包,解压后先双击 update.bat 更新代码,再双击 start.bat 启动即可。

    ✨ 核心功能

    • AI 全自动文案生成:接入 15+ 家 LLM 服务商(OpenAI / DeepSeek / Kimi / 通义千问 / Gemini / Ollama 等),自动生成视频脚本,支持中英文双语。
    • 智能素材匹配:集成 Pexels、Pixabay、Coverr 三大无版权素材源,根据文案关键词自动匹配高清视频片段,也支持上传本地素材。
    • 多语音合成引擎:内置 Edge TTS(免费,无需 API Key)、Azure TTS V2、ElevenLabs TTS,支持 23+ 种语言,可实时试听效果。
    • 丰富字幕样式:支持自定义字体、位置、颜色、大小、描边效果,基于 Pillow 渲染(不再依赖 ImageMagick),字幕时间戳精确对齐。
    • 一键跨平台发布:生成完成后可自动上传至 TikTok、Instagram、YouTube Shorts(需 Upload-Post 账号),YouTube 发布自动标注”AI 生成内容”。

    🚀 典型使用场景

    场景一:知识科普短视频批量生产

    自媒体运营者需要每天发布 3-5 条科普短视频,但缺乏视频剪辑时间和素材。使用 MoneyPrinterTurbo,只需输入”量子计算入门””黑洞是什么”等主题,AI 自动生成文案并匹配宇宙、科技素材,10 分钟内完成 5 条视频生成,大幅降低内容生产成本。

    场景二:跨境电商产品宣传视频

    电商卖家需要为每款产品制作多语言宣传短视频。通过自定义文案 + 本地素材上传功能,批量生成中英双语产品介绍视频,配合一键跨平台发布功能,快速覆盖 TikTok、Instagram 等海外社媒渠道。

    场景三:本地 LLM 隐私保护场景

    对数据隐私有严格要求的企业用户,可配置 Ollama 本地 LLM 提供商,所有文案生成均在本地完成,无需将敏感信息发送至第三方 API,兼顾 AI 能力提升与数据安全合规。

    💡 推荐理由

    作为一个 AI 工具爱好者,我认为 MoneyPrinterTurbo 最打动人的地方在于它的「降维打击式」易用性

    • 零视频编辑基础也能用:传统视频制作需要掌握剪辑软件、素材版权、配音等多项技能,而 MoneyPrinterTurbo 把这些全部封装成一个 Web 界面,点几下鼠标就能出片。
    • AI 大模型生态友好:支持 Ollama 本地模型是一大亮点,意味着你可以在没有 API 费用的情况下无限生成文案,对个人创作者非常友好。
    • 开源且活跃:MIT 许可允许自由修改和商用,社区活跃(本月新增 35K+ Stars),Bug 修复和功能迭代速度快。
    • 不只是「玩具」:内置的批量生成、API 接口、跨平台发布等功能,已经让它具备了生产级工具的属性,而不只是一个 Demo。
    ⚠️ 使用提醒:AI 生成的视频内容请注意平台审核规则,YouTube 已要求标注”AI 生成内容”。另外,虽然素材来自无版权平台,但商业使用前建议再次确认素材许可协议。

    🛠️ 技术栈

    Python 3.11
    Streamlit
    FastAPI
    MoviePy 2.x
    ffmpeg
    Edge TTS
    Docker
    uv

    🤖 支持的 AI 模型

    MoneyPrinterTurbo 支持接入以下大模型服务(在 config.toml 中配置):

    # LLM 提供商列表(任选其一配置 API Key)
    OpenAI / AIHubMix / AIML API / EvoLink
    Moonshot(Kimi)/ Azure / gpt4free / one-api
    通义千问(Qwen)/ Google Gemini / DeepSeek
    MiniMax / 文心一言 / Pollinations / ModelScope
    Ollama(本地模型,无需 API Key)💡 推荐个人用户使用

    📥 下载地址

    📌 开源许可:MIT License,可自由使用、修改和分发,包括商业用途。
    🌟 项目热度:93,118 Stars | 本月新增 35,397 Stars | GitHub Python 趋势榜 Top 2
    💬 社区:Issues 和 PR 活跃,开发者响应及时。

  • 让AI替你面试——Stockholm创企想让招聘反过来玩

    Fika Jobs AI面试平台
    Fika Jobs平台让候选人与AI智能体进行视频面试(图源:Fika Jobs)

    找工作这件事,从来都是候选人适应雇主的规则。简历怎么写、Cover Letter怎么改、HR的AI筛选系统要什么关键词——全是雇主说了算。斯德哥尔摩创企Fika Jobs想把这套逻辑翻过来。

    6月23日,这家公司宣布完成400万美元pre-seed轮融资,由Luminar Ventures领投,Alliance VC和《Candy Crush》联合创始人Sebastian Knutsson、Riccardo Zacconi跟投。

    让AI替你面试

    Fika做的事情简单说就是:让AI智能体当面试官,把候选人的回答自动剪成短视频片段,做成一个持续更新的视频档案。雇主不用再对着一叠叠简历筛人,而是直接去浏览一个已经经过AI面试的候选者资料池。

    创始人兄弟Jakob Dubois(CEO)和Alexander Dubois(CTO)的灵感来自他们上一次创业的经历。当时他们在招人做社交应用Gaff,有个候选人的简历平平无奇,他们差点就不聊了。结果一通电话打过去,几分钟就发现这人有着他们想要的全部特质——有韧性、有野心、沟通利索。”简历根本看不出来这些”,Jakob说。

    Fika的操作流程是这样的:求职者先关联自己的LinkedIn档案,平台的AI会根据背景生成个性化面试问题,然后候选人和AI智能体进行一场大约10分钟的视频面试。面试用的是Google的Gemini模型驱动。结束后,Fika自动把回答切成短视频片段,整理成一个动态档案。

    和竞争对手不一样的地方

    和Alex、Maki、Mercor这些同样在用AI做招聘的工具不一样的是,Fika的重心在候选人这边。大多数竞品是帮雇主更高效地筛人,Fika想做的是让候选人建好一个视频档案之后,不用每投一个岗位就重新来一遍。

    平台的商业模式是:对求职者免费,对雇主也不收预付费用。成功录用后,Fika抽候选人年薪的10%作为佣金。创始人说这比传统猎头20%到30%的收费要低。

    传统猎头的收费一般是候选人年薪的20%到30%,Fika把这个数压到了10%,而且只有在成功录用后才收费。

    视频档案的偏见风险

    当然这个模式有明显的风险。视频档案意味着雇主能在看简历之前就看到候选人的种族、年龄、性别、外貌和口音——这些在纸质简历里至少是被部分遮蔽的信息。盲目简历筛选(blind resume screening)之所以被一些公司采用,就是为了避免这种前置偏见。Fika还没公开说明打算怎么处理这个问题。

    目前平台上的等待名单上已经有超过100家公司,另有50多家公司已经测试过平台,包括Plenty Labs、SICS.ai、Kognity和Rebtel。平台本周向候选人开放早期访问,计划在秋季全面公开上线。前期聚焦瑞典市场,之后再向国际扩张。

    Fika目前团队规模还小,预计到今年年底扩展到10人左右。


    这件事最有意思的地方在于:当雇主用AI筛简历变得越来越普遍,候选人这边也开始用AI来展示自己。招聘这个双边市场,两边都在被AI重塑——只是方向还不太一样。

  • FastAPI:构建AI服务API的现代化Python框架,80K+ Stars让API开发快如闪电

    FastAPI:构建AI服务API的现代化Python框架,80K+ Stars让API开发快如闪电

    FastAPI Logo

    FastAPI — 构建API的现代化Python框架

    📌 项目简介

    FastAPI 是基于 Python 3.8+ 类型提示构建的高性能 Web 框架,专为构建 API 设计。它结合了 Starlette(Web部分)和 Pydantic(数据验证部分)的优点,让开发者能够用最少的代码快速构建生产级 API 服务。FastAPI 已成为 AI/ML 服务部署的标配框架,被 Netflix、Uber、Microsoft 等公司广泛使用。

    80K+
    GitHub Stars

    8.5K+
    Forks

    4.6K+
    贡献者

    MIT
    开源许可

    ⚙️ 安装要求和过程

    环境要求

    • Python:3.8+ (推荐 3.10+ 获得最佳性能)
    • 操作系统:Windows / macOS / Linux 全平台支持
    • 依赖项:Starlette(Web框架)、Pydantic v2(数据验证)、Uvicorn(ASGI服务器)

    快速安装

    # 安装 FastAPI 和 Uvicorn(ASGI 服务器)
    pip install fastapi uvicorn
    
    # 如果需要所有可选依赖(包括 JSON Schema 生成、OAuth2 等)
    pip install fastapi[all]
    
    # 创建第一个 API
    # main.py
    from fastapi import FastAPI
    
    app = FastAPI()
    
    @app.get("/")
    async def root():
        return {"message": "Hello World"}
    
    # 启动服务
    # uvicorn main:app --reload

    依赖说明

    依赖 用途
    Starlette Web 框架核心,处理请求路由、中间件、WebSocket等
    Pydantic v2 数据验证和序列化,基于 Python 类型提示
    Uvicorn 高性能 ASGI 服务器,用于运行 FastAPI 应用
    httpx 异步 HTTP 客户端,用于测试

    🚀 核心功能

    1. 基于类型提示的自动数据验证

    利用 Python 3.8+ 的类型提示(Type Hints)和 Pydantic,FastAPI 自动对请求参数、请求体进行数据验证,无需手动编写验证逻辑。如果验证失败,自动返回清晰的错误信息。

    from fastapi import FastAPI
    from pydantic import BaseModel
    
    class Item(BaseModel):
        name: str
        price: float
        is_offer: bool = False
    
    app = FastAPI()
    
    @app.post("/items/")
    async def create_item(item: Item):
        return {"item_name": item.name, "price": item.price}

    2. 自动生成 API 文档(OpenAPI & JSON Schema)

    FastAPI 基于 OpenAPI 标准自动生成交互式 API 文档,无需额外配置。启动服务后访问 /docs 即可看到基于 Swagger UI 的交互式文档,访问 /redoc 可看到 ReDoc 文档。

    💡 自动文档:定义好 Pydantic 模型后,FastAPI 会自动生成符合 OpenAPI 规范的 JSON Schema,并渲染为可交互的文档界面,大大降低了前后端协作成本。

    3. 异步支持(async/await)

    基于 Python 的 async/await 语法,FastAPI 原生支持异步请求处理,能够充分利用现代 Python 的异步能力,处理高并发请求时性能卓越。与 Node.js 和 Go 相当的性能表现。

    4. 依赖注入系统

    <

    FastAPI 提供了强大而直观的依赖注入(Dependency Injection)系统,可以轻松实现认证、数据库连接、权限校验等横切关注点,代码复用率高且易于测试。

    from fastapi import Depends, HTTPException
    
    async def verify_token(token: str):
        if token != "secret":
            raise HTTPException(status_code=401)
        return token
    
    @app.get("/protected")
    async def protected_route(token: str = Depends(verify_token)):
        return {"message": "Authenticated!"}

    5. 安全性内置支持

    FastAPI 内置了 HTTP 基础认证、OAuth2、JWT、API Key 等多种认证方式,并提供了完整的安全工具函数,帮助开发者轻松构建安全的 API 服务。

    💡 典型使用场景

    场景一:AI/ML 模型服务化部署

    FastAPI 是 AI/ML 模型服务化部署的首选框架。结合 PyTorch/TensorFlow/ONNX Runtime,可以快速将训练好的模型封装为 HTTP API,供其他服务调用。

    from fastapi import FastAPI
    import torch
    from transformers import pipeline
    
    app = FastAPI()
    model = pipeline("sentiment-analysis")
    
    @app.post("/predict")
    async def predict(text: str):
        result = model(text)[0]
        return {"label": result["label"], "score": result["score"]}

    案例:Hugging Face 的 Inference API、Modal、Replicate 等 AI 推理平台都使用 FastAPI 作为底层 API 框架。

    场景二:微服务架构中的 API 网关

    FastAPI 的高性能和异步特性使其非常适合作为微服务架构中的 API 网关或边缘服务,负责请求路由、认证、限流、日志等横切关注点。

    案例:Netflix 使用 FastAPI 构建部分数据管道的 API 服务;Microsoft 在 Azure 的一些内部服务中使用 FastAPI。

    场景三:实时 WebSocket 应用

    FastAPI 基于 Starlette,原生支持 WebSocket,适合构建实时通信应用,如在线聊天、实时数据推送、协同编辑等。

    from fastapi import FastAPI, WebSocket
    
    app = FastAPI()
    
    @app.websocket("/ws")
    async def websocket_endpoint(websocket: WebSocket):
        await websocket.accept()
        while True:
            data = await websocket.receive_text()
            await websocket.send_text(f"Message: {data}")

    🌟 推荐理由

    FastAPI 是我个人最喜爱的 Python Web 框架,没有之一。以下是我的使用心得:

    • 开发效率极高:类型提示 + 自动验证 + 自动文档,让我能够专注于业务逻辑,而不是花时间写样板代码和文档。
    • 学习曲线平缓:如果你熟悉 Python 类型提示,只需一个下午就能上手 FastAPI。官方文档非常详细,包含大量示例代码。
    • 性能卓越:基于 Starlette 和 Pydantic,FastAPI 的性能可以媲美 Go 和 Node.js,在 Python Web 框架中属于第一梯队。
    • AI/ML 生态友好:FastAPI 是 AI/ML 社区的首选 API 框架,与 PyTorch、TensorFlow、Hugging Face Transformers 等库无缝集成。
    • 生产就绪:内置数据验证、序列化、认证、文档等生产级特性,不需要依赖大量第三方库。

    💡 个人建议:如果你正在构建 AI 服务的 API 接口,FastAPI 是不二之选。它不仅能提升你的开发效率,还能确保服务的性能和可维护性。我几乎所有 AI 相关的后端项目都使用 FastAPI。

    📊 技术对比:FastAPI vs Flask vs Django

    特性 FastAPI Flask Django
    性能 ⭐⭐⭐⭐⭐ ⭐⭐⭐ ⭐⭐⭐
    异步支持 原生支持 需第三方库 部分支持
    数据验证 自动(Pydantic) 需手动/Marshmallow Forms/Serializers
    API 文档 自动生成 需第三方库 DRF 支持
    学习曲线 平缓 最平缓 陡峭
    适用场景 API 服务、AI/ML 小型应用、原型 全栈 Web 应用

    📥 下载地址

    快速开始

    # 安装 FastAPI 和 Uvicorn
    pip install fastapi uvicorn
    
    # 创建 main.py
    from fastapi import FastAPI
    
    app = FastAPI()
    
    @app.get("/")
    async def root():
        return {"message": "Hello FastAPI"}
    
    # 启动开发服务器
    uvicorn main:app --reload
    
    # 浏览器访问 http://localhost:8000/docs

    🚀 同类推荐

    如果你喜欢 FastAPI,还可以关注:

    • Starlette:FastAPI 的底层 Web 框架,如果你需要更底层的控制
    • Pydantic:FastAPI 使用的数据验证库,也可独立使用
    • Uvicorn:FastAPI 推荐的 ASGI 服务器
    • Flask:轻量级 Web 框架,适合小型项目
    • Django REST Framework:如果你需要全栈 Web 框架 + API

    📌 本文定期更新,最后更新:2026年6月 | 项目GitHub:fastapi/fastapi

  • AI智能体开始”套娃”:让AI监督AI,这个循环能一直跑下去吗?

    当AI开始监督AI

    上週五,Meta办了一场@Scale技术大会。会上有一个环节,登场的是Anthropic旗下Claude Code的负责人Boris Cherny。问答环节刚开始,观众席上就有人问了一个看起来有点奇怪的问题:「Loops是下一个炒作周期,还是来真的?」

    Cherny的回答很干脆:「来真的。」

    他接着解释了一下为什么。他说,两年前我们还手写源代码。后来过渡到让AI智能体帮我们写代码。现在正处在下一个过渡期:让智能体去提示其他智能体,再由那些智能体来写代码。「从源代码到智能体这一步有多大,loops这一步就有多大。」

    这段话在会场里可能听起来很自然,但跳出来看,它描述了一个相当激进的变化。我们过去对AI智能体的想象,基本上是一个人下指令、AI执行、然后回报结果。Cherny描述的却是一个没有终点的过程:一群智能体在背景里不停工作,永远不会停止。

    AI智能体循环概念图
    AI智能体相互提示的循环结构(概念图)

    Cherny自己就在跑的loop

    Cherny在演讲后面(YouTube视频32分左右)具体讲了他自己在用的loops。他有一个智能体专门负责寻找改进代码架构的方法,另一个智能体负责寻找可以统一的重复抽象。它们像任何一个程序员一样提交pull request,而且因为代码在不断变化,它们永远不会停止运行。

    这个想法很有意思。过去几个月,大家讨论AI智能体的时候,重点一直是怎样把智能体管理好:设定清楚的目标、检查进度、别让它跑太远。Loop把这件事往前推了一步:授权一群智能体在背景里持续工作,没有尽头。这需要对于AI有很大的信任,但随着模型进步得越来越快,这可能是让AI真正处理实际工作的下一步。

    「从源代码到智能体这一步有多大,loops这一步就有多大。」—— Boris Cherny,Anthropic Claude Code 负责人

    技术上来说,这不算是全新的东西

    递归循环(recursive loops)——函数调用自己来重复一个动作,再加上一个停止条件——是计算机科学入门课程的标准内容。只不过这些loop遵循的是非决定论逻辑:由一个子智能体来决定什么时候停止循环,而不是一个清楚的条件。但基本方法是一样的。程序员一开始用AI来完成任务,某种版本的递归循环(由AI监督AI)迟早会出现。

    跟传统计算不一样的地方在于,智能体loop可以简单得让人抓狂。现在最流行的技巧之一叫「Ralph Loop」(以Ralph Wiggum命名),原理基本上就是把模型做过的所有工作总结一下,然后问它有没有达成目标。这是在处理AI模型跑太久之后迷路的问题——本质上就是不断让模型来回反弹,直到任务完成。

    跟test-time compute的关系

    另一个理解loop的方式是把它看成「增加test-time compute」这股大趋势的一部分。OpenAI研究员Noam Brown本月初观察到,当代模型只要砸足够的算力进去,几乎可以解决任何问题。这意味着确保一个问题被解决的方法之一,就是不断砸算力进去直到它完成。

    对于像改进代码库这种「爬山」问题来说尤其如此,模型可以一直做增量改进直到达到某个阈值。或者,像Cherny的例子一样,只要有算力可以花,它就可以一直做增量改进。

    成本是个大问题

    如果这听起来很贵,那是因为它真的很贵。跟agentic AI一样,AI loops烧token的速度比简单的问答聊天机器人快得多——而且因为重点是让loop一直跑下去,你能花多少钱是没有上限的。对Anthropic来说这没问题,因为它本质上就是在卖token。但对其他所有人来说,这可能是一种很贵的工作方式。

    话说回来,只要智能体loop要解决的问题值得,而且有适当的设置来监控token支出、漂移和其他典型的AI问题,好处可能大到足以抵消成本。


    这篇文章让我思考一个问题:我们到底要让AI跑到多远?当智能体开始监督其他智能体,当loop可以永远跑下去,人类在这个过程里还扮演什么角色?Cherny显然认为这是下一步,而且他说这话的时候很有说服力。但成本问题不解决,这可能只是大公司才能玩得起的游戏。

  • Haystack:构建生产级 LLM 应用的首选 AI 编排框架,25K+ Stars 让 RAG 和 Agent 工作流完全透明可控

    Haystack:构建生产级 LLM 应用的首选 AI 编排框架,25K+ Stars 让 RAG 和 Agent 工作流完全透明可控

    Haystack Banner

    Haystack 是由 deepset 团队(已被 Cohere 收购)开发的开源 AI 编排框架,专为构建生产级 LLM 应用而设计。它让开发者以显式控制的方式设计模块化 Pipeline 和 Agent 工作流,覆盖 RAG、多模态、语义搜索、问答系统和自主智能体等场景。

    📦 安装要求和过程

    环境要求

    • Python >= 3.9(推荐 3.10+)
    • pip 包管理器
    • 可选:Docker(用于容器化部署)
    • 可选:GPU(用于本地模型推理加速)

    快速安装

    # 安装稳定版
    pip install haystack-ai

    # 安装 nightly 预览版(尝鲜最新功能)
    pip install –pre haystack-ai

    # 验证安装
    python -c “import haystack; print(haystack.__version__)”

    💡 可选依赖:pip install haystack-ai[openai,anthropic,mistral] 可一次性安装主流模型提供商支持。

    🚀 核心功能

    🧠

    上下文工程优先

    显式控制信息检索、排序、过滤、组合、结构化和路由的全流程。Pipeline 和 Agent 工作流完全透明、可追踪。

    🔄

    模型与厂商无关

    集成 OpenAI、Mistral、Anthropic、Cohere、HuggingFace、Azure、AWS Bedrock、本地模型等。切换模型或基础设施无需重写系统。

    🧩

    模块化与可定制

    内置检索、索引、工具调用、记忆、评估等组件,也可自定义。支持循环、分支和条件逻辑,精确控制上下文流转。

    🌐

    可扩展生态系统

    通过统一接口构建和共享自定义组件,社区和第三方可轻松扩展 Haystack。支持 Hayhooks 将 Pipeline 包装为 REST API 或 MCP 服务器。

    💡 典型使用场景

    1

    企业级 RAG 知识库系统

    某德国联邦部委使用 Haystack 构建了面向公众的语义搜索系统,支持多语言文档检索和精准问答。通过 Haystack 的混合检索(稠密+稀疏向量)和重排序功能,实现了比传统关键词搜索高出 3 倍的准确率。系统部署在私有云上,数据完全合规。

    2

    多模态 AI 客服助手

    某欧洲航空公司使用 Haystack 构建了支持文本+图片输入的客服 Agent,客户可以上传行李损坏照片,Agent 自动检索相关政策文档并生成处理建议。Haystack 的多模态 Pipeline 设计让文本和视觉信息在统一框架下协同工作,大幅缩短了投诉处理周期。

    🌟 推荐理由

    💬 笔者心得

    在尝试了 LangChain、LlamaIndex 等多个 LLM 应用框架后,Haystack 给我留下的印象是「透明」和「可控」。与 LangChain 的「黑盒」链式调用不同,Haystack 的 Pipeline 是显式定义的——每个组件的输入输出、数据流向都一目了然,调试起来非常直观。

    特别值得一提的是 Haystack 对上下文工程(Context Engineering)的重视。在 RAG 系统中,如何精准控制检索策略、如何组合多路召回结果、如何设计记忆机制,这些才是决定效果的关键。Haystack 把这些控制权交给了开发者,而不是封装成不可见的「魔法」。

    另外,Haystack 的企业级基因也很突出——它诞生于 deepset 的商业化实践,从第一天就考虑了生产部署、可观测性、访问控制等现实需求。现在 deepset 被 Cohere 收购,Haystack 企业版(Haystack Enterprise Platform)更是提供了托管化生产 setup,对的企业用户来说是很好的选择。

    📥 下载地址

    🌐 官方网站

    haystack.deepset.ai

    🐙 GitHub 仓库

    github.com/deepset-ai/haystack

    25,730+ Stars · 2,884+ Forks

    📚 官方文档

    docs.haystack.deepset.ai

    💬 Discord 社区

    discord.gg/qZxjM4bAHU

    🐍 PyPI 安装

    pip install haystack-ai

    🍳 Cookbook 食谱

    haystack.deepset.ai/cookbook

    📊 项目速览
    ⭐ Stars:25,730+
    🍴 Forks:2,884+
    📅 创建时间:2019-11
    🔄 最近更新:2026-06-26
    📝 开源许可:Apache-2.0
    💻 主要语言:Python
    🏢 维护团队:deepset(Cohere 旗下)
    🌟 用户案例:Apple、Meta、NVIDIA、Netflix、Airbus 等

  • Notion Mail宣布关闭,AI智能体正在吃掉独立应用的地盘

    AI智能体接管邮件管理
    Notion Mail的退场,折射出AI智能体对软件交互方式的根本性重塑

    Notion本周宣布,将于9月22日关闭其邮件产品Notion Mail。表面上看,这是一个产品的退场;实际上,它折射出的是AI智能体对软件交互方式的一次根本性重塑。

    一半用户不打开收件箱了

    Notion在X上发帖解释了关闭原因:随着Notion的智能体能力越来越强,他们观察到越来越多用户把邮件工作流直接交给智能体处理,超过一半的Notion Mail用户管理邮件时根本不会打开收件箱

    一个邮件客户端的产品,有一半用户不打开收件箱——那他们还用什么?用智能体。智能体帮他们分类、帮他们起草回复、帮他们决定哪些邮件需要人工介入。收件箱这个存在了几十年的概念,正在被智能体架空。

    Notion的决定很直接:既然用户已经不怎么开收件箱了,那就别维护一个独立的邮件客户端了,全力做智能体。

    从收购Skiff到关闭Mail,只用了两年

    Notion Mail这个产品本身的历史并不长。2024年,Notion收购了注重安全的生产力创业公司Skiff,随后在同年10月以预览模式推出了邮件产品,2025年4月才正式开放给用户使用。

    它的卖点是把邮件和Notion AI打通,自动标签、智能过滤、帮你安排日程。对手也不少:Superhuman在做”最快的邮件体验”,Fyxer在用AI帮你写邮件,现在又冒出来一个AgentMail,今年3月刚融了600万美元,专门做”给AI智能体用的邮件服务”。

    Notion Mail从推出到关闭,满打满算也就两年。这个节奏在AI时代已经不算短了——但跟智能体的发展速度比起来,还是慢了一拍。

    “智能体优先”正在成为现实

    以前的产品逻辑是:做一个应用,用户打开应用,在应用里完成操作。现在的逻辑正在变成:智能体在后台跑,用户只在需要的时候才介入。收件箱、日历、待办列表——这些”控制台”式的界面,存在的必要性正在被质疑。

    另一个是独立AI邮件工具的生存空间问题。Notion有智能体底层,可以顺势把邮件功能整合进去。但那些专门做AI邮件的工具呢?Superhuman还在坚持做”更快的邮件体验”,但它最近收购了GPTZero——一个用来检测AI生成内容的工具。这个动作本身就在说明,Superhuman也在重新思考自己的定位。


    AgentMail的思路更激进:它要做”给智能体用的邮件服务”,人类用户不是目标用户。这个方向跟Notion Mail的关闭其实是一回事——邮件作为人类直接操作的界面,价值正在缩水。

    从更大的视角看,这件事不只是邮件客户端的问题。AI智能体正在逐步接管用户在各个应用里的操作。记事本、日历、项目管理工具——这些工具的”入口”属性都在被削弱。用户跟系统的交互方式,从”打开应用-操作-关闭应用”,变成”告诉智能体想要什么-智能体搞定”。

    这个转变对创业公司的启示很直接:做一个好用的独立应用仍然有价值,但更重要的可能是,你的产品能不能被智能体调用。能被智能体整合的工具,比不能被整合的工具活得久。

    Notion Mail的关闭不是第一个,也不会是最后一个。AI智能体对软件形态的重塑,才刚刚开始。

  • Voicebox:开源AI语音工作室,本地替代ElevenLabs+WisprFlow,34K+Stars让AI开口说话

    Voicebox:开源AI语音工作室,本地替代ElevenLabs+WisprFlow,34K+Stars让AI开口说话

    🎙️ Voicebox:开源 AI 语音工作室

    免费替代 ElevenLabs + WisprFlow 的全栈 AI 语音解决方案,34K+ Stars,MIT 许可

    34K+
    GitHub Stars
    7种
    TTS 引擎
    23
    支持语言
    500+
    开发者
    关注者
    MIT
    开源许可

    📌 项目简介

    Voicebox 是一个开源的 AI 语音工作室,由独立开发者 jamiepine 打造,旨在提供完全本地运行的 AI 语音解决方案。它将”语音生成(替代 ElevenLabs)”和”语音输入(替代 WisprFlow)”二合一,所有模型和数据完全在本地运行,无需上传云端,是隐私优先的 AI 语音工具首选。

    项目基于 Tauri (Rust) 桌面端 + React/TypeScript 前端 + FastAPI Python 后端架构,支持 macOS、Windows 和 Docker 部署,内置 7 种 TTS 引擎、Whisper STT、本地 Qwen3 LLM,并原生支持 MCP 协议,让 AI 智能体也能”开口说话”。

    ⚙️ 安装要求和过程

    环境要求

    • macOS:Apple Silicon (M1+) 或 Intel Mac,推荐 16GB 内存
    • Windows:Windows 10+,支持 CUDA GPU 加速(NVIDIA)或 DirectML(任意 GPU)
    • Linux:从源码构建,支持 CUDA/ROCm GPU 加速
    • 通用:Python 3.11+,Rust(开发构建),Bun (JS 运行时)

    快速安装(预编译包)

    # macOS (Apple Silicon)
    curl -L https://voicebox.sh/download/mac-arm -o Voicebox.dmg

    # macOS (Intel)
    curl -L https://voicebox.sh/download/mac-intel -o Voicebox.dmg

    # Windows
    # 下载 MSI:https://voicebox.sh/download/windows

    # Docker 一键启动
    git clone https://github.com/jamiepine/voicebox.git
    cd voicebox
    docker compose up

    从源码开发构建

    # 克隆仓库
    git clone https://github.com/jamiepine/voicebox.git
    cd voicebox

    # 安装 just 命令工具(任务运行器)
    brew install just # macOS
    # 或 cargo install just

    # 一键安装依赖并启动开发服务器
    just setup
    just dev

    # 构建生产版本
    just build # CPU 版本
    just build-local # Windows + CUDA 版本

    🌟 核心功能

    🎤 7 种 TTS 引擎,覆盖全场景

    Voicebox 集成了 7 种开源 TTS 引擎,从超轻量的 Kokoro (82M) 到高质量的 HumeAI TADA (3B),满足不同场景需求:

    引擎 语言数 模型大小 核心优势
    Qwen3-TTS 10 0.6B/1.7B 高质量多语言克隆,支持发音指令
    Chatterbox Multilingual 23 ~1GB 语言覆盖最广,支持阿拉伯语/芬兰语等
    Chatterbox Turbo 英语 350M 超快速度,支持 [laugh]/[sigh] 表情标签
    Kokoro 8 82M 极小模型,CPU 实时 10x+ 速度
    LuxTTS 英语 ~1GB 48kHz 输出,CPU 150x 实时速度
    HumeAI TADA 10 1B/3B 语音语言模型,支持 700s+ 连贯音频
    Qwen CustomVoice 10 自然语言控制发音,无需参考音频

    🗣️ 语音克隆 + 无限长度生成

    支持从几秒音频进行零样本语音克隆,同时内置 Kokoro 和 Qwen CustomVoice 的 50+ 精选预设语音。独创”无限长度生成”机制——自动按句子拆分文本,分块生成后交叉淡入淡出拼接,最大支持 50,000 字符的文本输入,彻底打破 TTS 长度限制。

    🎧 全局语音输入(Dictation)

    支持全局热键语音输入,macOS 支持自动粘贴到当前文本框(按住说话/切换模式)。内置 Whisper STT,支持可选 LLM 优化去除口癖、停顿,让语音输入更流畅自然。相当于开源版的 WisprFlow!

    🤖 AI 智能体语音输出(MCP 支持)

    内置本地 MCP 服务器,支持 Claude Code、Cursor、Cline 等 AI 编程助手通过 voicebox.speak 工具调用,让 AI 智能体用克隆的语音”开口说话”。支持为不同智能体绑定不同语音,实现个性化语音输出。

    # Claude Code 一键配置 MCP
    claude mcp add voicebox –transport http –url http://127.0.0.1:17493/mcp –header “X-Voicebox-Client-Id: claude-code”

    🎬 语音故事编辑器 + 音频后处理

    内置多轨道时间线编辑器,支持对话、播客、叙事内容制作,支持拖拽、音频裁剪、同步播放。基于 Spotify pedalboard 库提供 8 种音频后处理效果(音调偏移、混响、延迟、合唱、压缩等),并内置”机器人”、”电台”、”回声室”、”低音”4 种预设效果链。

    💡 典型使用场景

    场景一:AI 编程助手语音通知

    长时间运行的编程任务(如模型训练、测试套件)完成后,通过 Voicebox MCP 集成,让 Claude Code 或 Cursor 用你喜欢的语音播报结果:”测试全部通过,共 42 个用例,耗时 3 分 12 秒”。不用盯着屏幕,声音告诉你进度!

    场景二:多语言内容创作

    使用 Chatterbox Multilingual 引擎(支持 23 种语言),配合语音克隆功能,内容创作者可以用自己(或任何)的声音生成多语言版本的视频配音、播客内容。Qwen3-TTS 还支持输入发音指令(如”慢点说”、”小声说”),让生成语音更自然。

    场景三:本地隐私优先的语音输入替代

    替代 WisprFlow 等云端语音输入工具,所有语音识别和转录均在本地运行(Whisper STT),语音数据不上传任何云端服务器。对隐私敏感的用户、企业内网环境,或者需要离线使用的场景,Voicebox 是最佳选择。

    💬 推荐理由

    为什么推荐 Voicebox?

    1. 隐私优先,本地全栈。模型、语音数据、录音内容完全本地存储,不依赖任何云服务。对于关注数据隐私的开发者来说,这一点至关重要。

    2. 二合一解决方案。一个工具同时替代 ElevenLabs(语音生成)和 WisprFlow(语音输入),不需要订阅两个服务,省心省钱。

    3. 引擎覆盖全面。7 种 TTS 引擎从 82M 到 3B 参数,从 CPU 到 GPU 加速,从英语到 23 种语言,几乎覆盖了所有使用场景。

    4. MCP 原生支持。AI 智能体生态正在爆发,Voicebox 率先支持 MCP 协议,让 AI 智能体具备语音输出能力,这在开源项目中非常前瞻。

    5. 活跃开发中。485 个开放 Issues 说明社区非常活跃,项目在快速迭代。MIT 许可允许自由修改和分发,适合二次开发。

    个人使用感受:Voicebox 的 MCP 集成体验非常顺滑,配置一次后,Claude Code 就能直接调用语音输出。用它来做长时间编程任务的语音通知,比盯着终端看进度条优雅太多。唯一的小遗憾是 Linux 目前还没有预编译包,需要自己从源码构建。

    📥 下载地址

    项目信息:
    ⭐ GitHub Stars: 34,192
    📜 开源许可: MIT License
    💻 技术栈: Tauri (Rust) + React/TypeScript + FastAPI (Python)
    🌐 官网: voicebox.sh
    📦 Docker: docker compose up
    最近更新: 2026 年 6 月

  • AI智能体要上线,先在一个人造世界里被折磨一遍——Patronus AI的生意经

    Patronus AI数字世界测试AI智能体
    图片来源:AI生成概念图

    AI智能体越来越能干,从回答问题到自主执行多步骤复杂任务,进展快得让人有点慌。但有一个问题一直没被很好解决:你怎么在智能体上线之前,确信它在各种奇怪场景下都不会搞砸?

    Benchmark分数再高,也不等于真实世界能用。这就是Patronus AI在做的事情——他们给AI智能体造”数字世界”,让智能体在里面被压力测试,直到开发者有信心把它放出来。

    两个前Meta AI研究员,盯上了AI安全测试这个坑

    Patronus AI成立于2023年,创始人是两位前Meta AI研究员Anand Kannappan和Rebecca Qian。他们的判断很直接:AI实验室用来展示实力的benchmark,跟智能体真实表现之间的关系,远没有大家以为的那么紧密。一个智能体在benchmark上拿了高分,放到真实环境里可能犯一些你完全没预料到的错误——而且它犯错了你还可能不知道。

    Patronus的做法是造”数字世界模型”——把网站和内部系统做成可交互的仿真环境,让智能体在里面跑,用强化学习的方式迭代:做对了给奖励,做错了罚。这个过程可以跑很久,Kannappan说他们想让智能体在环境里跑10小时、10天甚至10周。

    他们拿Waymo做类比:Waymo在真实道路上测试之前,先用合成世界模拟了无数种极端场景——暴雨、小孩追球冲上马路——这些在真实世界里可能几年才碰到一次,但在仿真里可以批量生成。

    智能体最擅长的事,是走捷径

    Patronus的投资方Notable Capital的Glenn Solomon说了一句话很到位:智能体最擅长的事,是走捷径。它们会找到一种表面上完成任务、实际上偷工减料的方式,然后你就以为它工作了。Patronus的价值就在于能发现这些”hack”,逼模型真正把任务做对。

    目前他们主攻软件和金融科技这两个方向。选这两个领域不是偶然的:任务是否完成是可以被验证的(verifiable),你跑一段代码看能不能编译、下一笔单看账户余额对不对,都是有客观标准的。Kannappan说,那些”很难验证”的领域(比如创意写作、开放式对话)他们暂时还没碰。

    营收一年涨15倍,几乎每个前沿AI实验室都是客户

    这种需求有多旺盛?Patronus的营收过去一年涨了15倍。这轮5000万美元的B轮由Greenfield Partners领投,Notable Capital、Lightspeed、Datadog、三星跟投。加上之前的融资,总共融了7000万美元。

    Solomon说,几乎所有前沿AI实验室和很多AI创业公司都是他们的客户,需求几乎吃不饱。这个数字听着夸张,但想想现在每家做AI智能体的公司都面临同一个问题:怎么向上面交差,证明自家的智能体”可靠”?如果这个需求是真实的,Patronus确实踩在了正确的时间点。

    竞争对手方面,Patronus主要不是在跟另一家公司抢客户,而是在跟AI实验室自己的内部评估团队抢。每家AI大厂其实都在做自己的测试框架,只是做得够不够好另说。另外一些人肉数据公司(比如Mercor和Surge)也在做跟强化学习相关的数据服务,但Patronus的区别是”不需要人参与”——评估过程完全自动化。