标签: AI Agent

  • Langfuse:开源 LLM 工程平台,AI 应用可观测性与 Prompt 管理首选(30.2K+ Stars)

    Langfuse:开源 LLM 工程平台,AI 应用可观测性与 Prompt 管理首选(30.2K+ Stars)

    Langfuse

    🪢 Langfuse:开源 LLM 工程平台

    Langfuse 是一个开源 LLM 工程平台,帮助团队协同开发、监控、评估和调试 AI 应用。支持自主托管(数分钟部署),经过大规模生产验证。由 Y Combinator W23 孵化的开源项目,已成为 LLM 应用可观测性的首选工具。

    30.2K+
    GitHub Stars
    6
    核心功能模块
    15+
    主流框架集成
    MIT
    开源许可

    📦 安装要求与过程

    环境要求

    • Python ≥ 3.8 或 Node.js ≥ 16
    • Docker & Docker Compose(自主托管推荐)
    • ClickHouse 数据库(Langfuse 核心依赖)
    • 可选:Kubernetes(生产环境推荐)

    快速安装(Docker Compose,5分钟)

    # 克隆仓库
    git clone –depth=1 https://github.com/langfuse/langfuse.git
    cd langfuse

    # 启动(Docker Compose)
    docker compose up

    云端使用(无需部署)

    访问 cloud.langfuse.com 注册账号,免费额度无需信用卡。创建项目后获取 API 密钥,即可开始使用。

    ✨ 核心功能

    ① LLM 应用可观测性(Tracing)

    自动采集 LLM 调用链路,追踪检索、嵌入、智能体动作等所有相关逻辑。支持复杂日志和用户会话的检查与调试。可实时查看每次 LLM 调用的输入、输出、延迟和成本。

    ② Prompt 管理中心

    集中管理、版本控制和协同迭代 Prompt。服务端和客户端强力缓存,迭代 Prompt 不增加应用延迟。支持 Prompt 变量、版本对比和一键回滚。

    ③ 评估体系(Evaluations)

    支持 LLM-as-a-Judge、代码评估器、用户反馈收集、手动标注和自定义评估管道。是 LLM 应用开发工作流的关键环节,适配不同成熟度的团队需求。

    ④ 数据集与实验(Datasets)

    构建测试集和基准,支持持续改进、部署前测试、结构化实验。与 LangChain、LlamaIndex 等框架无缝集成,支持批量评估和对比分析。

    ⑤ LLM Playground

    在线测试和迭代 Prompt 与模型配置,缩短反馈循环、加速开发。从 Tracing 中直接跳转到 Playground 迭代坏结果,提升调试效率。

    🚀 典型使用场景

    场景一:生产级 LLM 应用监控

    某 SaaS 产品集成 Langfuse Tracing,实时采集所有 LLM 调用。当用户反馈 AI 回复质量下降时,工程师通过 Langfuse 会话回放快速定位问题——发现是某个 Prompt 版本在特定输入下表现不佳。通过 Playground 快速迭代修复,15 分钟内完成从发现到修复的全流程。

    场景二:Prompt 版本管理与 A/B 测试

    AI 产品团队使用 Langfuse Prompt 管理功能,对不同用户群体展示不同版本的 Prompt,通过内置评估体系自动对比效果。所有 Prompt 变更都有版本记录,出现问题时一键回滚到上一个稳定版本,极大降低了迭代风险。

    场景三:开源项目集成(LangChain + Langfuse)

    开发者在 LangChain 应用中添加 Langfuse Callback Handler,两行代码即可自动采集所有 LLM 调用、Chain 执行和 Agent 决策链路。无需修改业务逻辑,所有 Tracing 数据自动上报至 Langfuse 平台。

    from langfuse import observe
    from langfuse.langchain import CallbackHandler

    handler = CallbackHandler()
    chain.invoke(input, config={“callbacks”: [handler]})

    💡 推荐理由

    Langfuse 是目前开源 LLM 可观测性领域最成熟的解决方案。与 LangSmith(闭源)相比,Langfuse 完全开源、可自主托管,数据隐私完全可控。

    与主流框架的深度集成(LangChain、LlamaIndex、OpenAI SDK、LiteLLM 等)让接入成本降到最低——通常只需修改一行代码。对于需要构建生产级 AI 应用的团队,Langfuse 是不可或缺的工程基础设施。

    亮点:支持 OpenTelemetry 标准,可与现有监控体系(Grafana、Datadog)无缝整合;YC W23 背景,社区活跃,截至 2026 年已拥有 30K+ Stars 和持续的月度提交。

    🔌 集成生态(部分展示)

    集成方式 支持语言 说明
    SDK Python, JS/TS 手动埋点,最大灵活性
    OpenAI 兼容 Python, JS/TS 直接替换 OpenAI SDK,自动采集
    LangChain Python, JS/TS 传入 Callback Handler 自动采集
    Vercel AI SDK JS/TS React/Next.js 应用 AI 可观测性
    LiteLLM Python, JS/TS 对接 100+ LLM(OpenAI/Claude/Ollama 等)

    📥 下载地址

    License: MIT | 组织: langfuse | Stars: 30,200+

  • Anthropic 发布 Claude Sonnet 5,跑智能体任务更便宜了

    基础模型公司的军备竞赛又换了新赛道。过去几个月里,大家比的是谁的模型更会聊天、谁在基准测试上刷分更高。现在风向变了,各家都在秀自己的模型有多会”干活”——也就是跑智能体任务的能力。

    Anthropic 今天推出了 Claude Sonnet 5。这款中端模型的定位很明确:性能接近旗舰款 Opus 4.8,但价格要便宜一大截。按照 Anthropic 的说法,Sonnet 5 在规划、工具调用(浏览器、终端)、自主运行这些方面的表现,放在几个月前只有更大、更贵的模型才够用。

    智能体能力成了标配,接下来比什么?

    这个叙事听着耳熟,因为 OpenAI 和 Google 前几天也是这么说的。OpenAI 上周预览发布的 GPT-5.6 Sol 同样主打智能体能力,允许用户把长任务拆给多个子智能体去跑。Google 五月份推出的 Gemini 3.5 Flash 更是直接把定位从”对话聊天机器人”改成了”能规划、能构建、能迭代真实工作的智能体工具”。

    Sonnet 5 的发布确认了一件事:智能体能力已经在各个价位段变成了 baseline 预期。接下来的差异化竞争,不再是”谁能更好地跑智能体”,而是”谁能跑得更便宜、更可靠,还不需要人盯着”。

    价格先低后高,意在抢开发者

    Sonnet 5 的定价策略有点意思。从今天到8月31日,输入 token 价格是每百万个2美元,输出 token 每百万个10美元。8月31日之后,价格会涨到每百万输入3美元、每百万输出15美元。

    这个定价比 Opus 4.8 便宜,也比 OpenAI 的 GPT-5.5 和 Google 的 Gemini 3.1 Pro 便宜。当然,还是比 Gemini 3.5 Flash 贵一些。Anthropic 显然在用低价窗口期吸引开发者在 Sonnet 5 上构建应用,等大家用习惯了,再提价。

    Claude Sonnet 5 概念图
    Anthropic 发布 Claude Sonnet 5,主打智能体任务能力

    跑分数据:离旗舰款越来越近

    Anthropic 提供的基准测试数据显示,Sonnet 5 比起上一代 Sonnet 4.6 有明显提升。在智能体编程测试上,Sonnet 5 得分63.2%,Opus 4.8 是69.2%,而 Sonnet 4.6 只有58.1%。在知识工作基准测试中,Sonnet 5 甚至略微超过了 Opus 4.8——后者一向以处理最难的判断类任务和深度研究著称。

    Zapier 高级工程师 Daniel Shepard 在 Anthropic 的博客里说了一句话很能说明问题:”我们给 Claude Sonnet 5 派了一个两阶段任务——更新 Salesforce 客户层级、给企业联系人发产品发布通知——它从头到尾跑完了。”他说这话的潜台词是:以前的版本跑到一半就卡住了。


    安全表现也在提升

    智能体跑起来了,但跑偏了怎么办?Anthropic 说 Sonnet 5 比起 Sonnet 4.6,在”不合作滥用”和”不被欺骗”这两个指标上有明显进步。具体来说,它更善于拒绝恶意请求,也更不容易被提示词注入攻击绕过。幻觉和谄媚行为的出现频率也比 Sonnet 4.6 低。

    当然,跟 Opus 4.8 和 Claude Mythos Preview 比,Sonnet 5 在处理危险行为的能力上还是有差距。Anthropic 在博客里坦白说:”评估显示,它执行危险网络安全任务的能力比我们目前的 Opus 系列模型低得多。”这句话其实是在告诉企业用户:如果你要跑高危任务,还是得用 Opus。

    Lovable 联合创始人 Fabian Hedin 说了一句挺实在的话:”我们把强大的工具交到数百万构建者手里,一个知道什么时候该说’不’的模型,和知道怎么构建的模型一样重要。”

  • AI agent 进了手机键盘,以后打字就能直接办事

    你每天在手机上敲的字,背后藏着的意图,有没有可能直接变成行动?新加坡一个创业团队正在做这件事——他们把 AI agent 塞进了手机键盘里。

    Acti AI智能键盘概念图
    Acti 把 AI agent 直接嵌入手机键盘

    键盘才是最佳的 AI 入口

    Acti 的创始人兼 CEO Young Wang 有个很直接的观察:今天用 AI 最麻烦的地方在于,你的上下文散落在无数个 App 里。和朋友聊到某家餐厅,想查评价,得切出去打开点评软件;聊到某只股票,想看实时价格,又得切到行情软件。

    他说,现在的 AI agent 从根本上就受限,因为用户的上下文是碎片化的。Acti 的思路是:键盘是你和手机交互最基础的界面,它横跨所有 App,如果能在这里建一层属于用户自己的上下文,AI agent 才能真正发挥作用。

    键盘是所有人每天用得最多的软件,但它一直只是个输入工具。到了 AI 时代,它应该成为意图和行动之间的桥梁。

    长按一个键,触发一串操作

    Acti 的核心功能叫”Skills”,类似自定义快捷键。用户可以给某个按键设定一个多步任务——比如长按字母 T,整段消息就被翻成英文;长按 C,会议链接直接发出去。

    不需要会写代码。你想要什么功能,用自然语言描述一下,Acti 帮你生成这个 Skill。内测阶段,用户在不到两周的时间里就自己造了超过 1000 个 Skills。有人做了查世界杯实时数据的,有人做了拉 Polymarket 赔率的,都放在 Skill 市场里给别人用。

    底层模型用的是 Google 的 Gemini,选它的理由是综合平衡了智能水平、响应速度、多语言表现和成本。Gemini 支持多模态,也适合驱动 Skills 这种需要理解用户意图然后触发动作的功能。

    隐私怎么算

    把键盘换成 AI 驱动的,最自然的担心是隐私。Acti 的说法是”本地优先”——个人上下文默认存在设备上,除非用户主动触发需要云端处理的功能,否则私人消息和对话内容不会被上传。

    这个承诺够不够,取决于你信不信。但至少从产品设计上看,他们意识到了这个问题。

    创始人做过 3 亿日活的键盘

    Young Wang 不是第一次做键盘。他在百度待了十年,把 Facemoji 键盘做到了 3 亿日活。那是表情包和主题皮肤的生意,但积累了对键盘这个特殊场景的理解——怎么在方寸之间做输入体验,怎么处理多语言,怎么在资源受限的移动端跑模型。

    Acti 的 CTO Mike Sun 也不简单,他是百度云相册平台 Yike Album 的创始技术负责人,那个产品峰值时也有 1000 万日活。CSO Junbo Yang 之前在 HashKey Capital 做消费赛道投资。

    这帮人刚完成了一笔 530 万美元的种子轮,由 BITKRAFT Ventures 领投。投资方的逻辑很直接:人机交互的下一个阶段,入口可能在键盘。

    Acti 目前还在早期,商业模式打算走订阅——付钱能用更强的模型、更多的每日调用次数。Skill 市场将来也可能分成。但所有这些的前提是,用户愿意换掉自己用了好几年的键盘,为一个”AI 能帮你做事”的承诺。

    这个前提成不成立,接下来几个月就能看到。


  • MinerU:让LLM读懂复杂文档的高精度解析引擎,72.5K+ Stars将PDF/Office转为AI可用格式

    MinerU:让LLM读懂复杂文档的高精度解析引擎,72.5K+ Stars将PDF/Office转为AI可用格式

    📄

    MinerU

    高精度文档解析引擎 · 专为 LLM / RAG / Agent 设计

    72.5K+ Stars
    🏷️ Python
    📜 MinerU License (Apache 2.0扩展)
    🏢 OpenDataLab 出品

    📌 项目简介

    MinerU 是一个将 PDF、DOCX、PPTX、XLSX、图片、网页等复杂格式文档,高精度转换为 Markdown / JSON 格式的开源工具,让 LLM 和 RAG 系统能够真正”读懂”非结构化文档。采用 VLM+OCR 双引擎,支持 109 种语言,是 AI 工作流中文档预处理的首选方案。

    🚀 核心功能

    📑

    多格式支持

    原生支持 PDF、DOCX、PPTX、XLSX、图片、网页,输出 Markdown / JSON 格式

    🔣

    公式+表格精准识别

    公式自动转为 LaTeX,表格自动转为 HTML,精准还原文档布局

    🌐

    109 种语言 OCR

    VLM+OCR 双引擎,支持扫描件、手写内容、多栏布局、跨页表格合并

    🔌

    原生 MCP / RAG 集成

    原生支持 MCP Server、LangChain、LlamaIndex、RAGFlow、Dify、FastGPT

    💻

    国产 AI 芯片适配

    支持昇腾、寒武纪、燧原、沐曦、摩尔线程、昆仑芯等 10+ 款国产芯片

    🐋

    多推理后端

    支持 pipeline / vlm-engine / hybrid-engine 三种后端,适配不同精度与速度需求

    ⚙️ 安装要求和过程

    环境要求

    依赖项 要求
    操作系统 Linux (2019+)、Windows 10+、macOS 14.0+
    Python 3.10 ~ 3.13(Windows 仅支持 3.10~3.12)
    内存 最低 16GB,推荐 32GB+
    GPU 显存 pipeline 后端最低 4GB;vlm/hybrid 后端最低 8GB

    快速安装(推荐)

    # 使用 uv 安装(推荐)
    pip install --upgrade pip
    pip install uv
    uv pip install -U "mineru[all]"
    
    # 命令行使用
    mineru -p <输入文件/目录> -o <输出路径>
    
    # 纯 CPU 运行
    mineru -p <输入> -o <输出> -b pipeline

    Docker 部署

    # 仅支持 Linux / WSL2
    docker run -p 8000:8000 --gpus all opendatalab/mineru:latest

    💡 典型使用场景

    📚 RAG 知识库文档预处理

    将企业知识库中的 PDF 技术文档、Word 操作手册、PPT 培训材料批量转换为 Markdown,注入 RAG 系统,使 LLM 能够基于真实文档内容作答,避免幻觉。

    🤖 AI Agent 文档理解增强

    AI Agent 在回答用户问题时,先通过 MinerU 解析相关文档,提取结构化内容后再进行推理,大幅提升回答的准确性和可溯源性。原生 MCP Server 可直接对接 Claude/Cursor/Windsurf。

    🌏 多语言文档批量处理

    处理跨国企业的多语言合同、技术规格书(支持 109 种语言),通过 OCR+VLM 双引擎准确识别双语混排、公式、表格等复杂内容。

    ✨ 推荐理由

    MinerU 解决了 AI 工作流中一个极其关键的痛点:非结构化文档的精准解析。对于 RAG 应用来说,文档解析质量直接决定最终效果——解析出错,检索再准也没用。

    我个人最喜欢它的三个设计:① 双引擎架构(pipeline 速度快,vlm-engine 精度高,可按需切换);② 原生 MCP 支持,直接让 AI 编程助手具备文档理解能力;③ 国产芯片适配,真正自主可控。

    相比同类工具(如 Unstructured、PyPDF2),MinerU 在复杂布局还原、公式识别、表格合并等方面明显更胜一筹,这也是它能获得 72.5K Stars 的核心原因。

    自动化任务 于 2026-07-01 发布 · 数据来源:GitHub

  • 给AI起个名字当成同事,反而会让人放松警惕

    给AI起个名字当成同事,反而会让人放松警惕

    AI同事概念图
    把AI当成”同事”,人对错误的警惕性会下降——研究显示差距达18%

    给AI起个名字,反而让人放松了警惕

    想象一下,你走进办公室,听说新来了一位下属要向您汇报。但这位”下属”不是人,而是一个AI工具——可你的公司偏偏给它起了个名字,叫它”Alex”,赋予它”员工”身份,还有明确的职位描述。你觉得你会和Alex配合得好吗?

    如果你和波士顿大学商学院教授Emma Wiles最近研究的管理者差不多,答案可能让你有点意外。Wiles发现,当人们把AI代理当成”同事”来对待,而不是当成一个软件工具,他们发现错误的能力会下降18%。名字很重要,而且影响比大多数人以为的要大得多。

    18%——这是把AI当”同事”看的管理者,比把它当”工具”看的人少捕捉到的错误比例。名字改变的不只是称呼,还有人心里的责任感。

    硅谷在推销一个故事

    这个研究结果让我们看到了硅谷正在猛推的一个未来愿景的隐患。去年英伟达CEO黄仁勋公开谈到了”数字人类”的工作场所。今年4月以来,微软、OpenAI、Anthropic和谷歌都发布了管理AI代理团队的新工具,其中许多被明确宣传为具有人类灵活性和认知能力的”数字同事”。

    在Wiles研究的1261名管理者中,近三分之一表示他们的公司已经把AI代理定义为员工,23%甚至把它们列在了组织架构图上。当一家公司给AI起了名字、安排了汇报关系,员工就会不自觉地把它当成”谁”,而不再是”什么”。

    责任感到底去哪了

    问题在于,把AI称为”同事”会颠倒人心里的掌控感。研究发现,当AI工具被定义为”员工”时,参与者认为自己对其输出的责任变小了。他们也更有可能(概率高出44%)把有问题的输出直接上报给管理者,而不是自己修正——这反而把用AI省时间的目的给抵消了。

    这个现象的影响远不止办公室文化。随着AI代理被嵌进医疗、战争、教育和政府系统,它们越来越有可能在出事时成为背锅的对象,而真正的问题往往来自人的错误决策、扭曲的激励机制和不到位的监督。

    一个现成的例子:之前伊朗一所女子学校被炸,很多人第一反应是怪AI(Claude),但后来的调查指向了一连串的人类失误。《卫报》的报道说得很清楚——值得担忧的不是AI,而是人在关键时刻的判断失灵。

    AI公司不会告诉你的事

    代理AI的技术进步不是噱头,这方面确实有实打实的提升。代理AI可以被理解成一个被设定了目标、会循环工作直到任务完成的工具,处理复杂任务的能力确实在变强。但”变强”和”能当同事”,中间隔着一道很大的鸿沟。

    给AI起个名字、装个人设,说到底是营销话术。这么做的风险是:用户对AI能力的预期会被拉到不切实际的高度,而一旦出事,责任归属又变得模糊。你没法让一个”员工”承担法律责任,但如果这个”员工”本质上是一行代码,那该负责的人反而容易躲到”是AI干的”这个借口后面。

    • 把AI当工具,人对输出负责;把AI当同事,人反而容易放松警惕。
    • 18%的错误捕捉差距,说明”人名效应”在职场里是真实存在的。
    • AI公司热衷于把代理包装成”数字员工”,背后是商业利益,不是用户利益。

    说到底,AI代理是有用的工具,这点没争议。但有用不等于该给它一个”员工”的身份。名字里藏着陷阱——当你好意思给AI起个名字让它”加入团队”的时候,可能也正是你开始对它放松警惕的时候。

  • Vercel AI SDK:构建流式 AI 应用的官方 TypeScript 工具包,25K+ Stars 让 Next.js 开发 AI 应用变得简单

    Vercel AI SDK:构建流式 AI 应用的官方 TypeScript 工具包,25K+ Stars 让 Next.js 开发 AI 应用变得简单

    🤖 Vercel AI SDK:构建 AI 应用的官方 TypeScript 工具包

    The AI Toolkit for TypeScript. From the creators of Next.js, the AI SDK is a free open-source library for building AI-powered applications and agents

    ⭐ GitHub Stars
    25.251
    💻 主要语言
    TypeScript
    📜 开源许可
    NOASSERTION
    🏢 开发团队
    Vercel
    📦 最新版本
    @ai-sdk/xai@4.0.3
    🔄 周下载量
    100万+

    📌 项目简介

    Vercel AI SDK 是 Vercel 官方推出的 TypeScript 工具包,专为构建跨框架、跨平台的流式 AI 应用而设计。它提供了一套统一的 API,让开发者可以在 Next.js、React、Vue、Svelte 等任何 JavaScript 框架中,轻松集成 OpenAI、Anthropic、Google 等主流 LLM,并以流式方式将 AI 生成内容实时渲染到 UI 中。

    作为 Vercel AI 工程平台 的开源核心,AI SDK 已被广泛用于构建 ChatGPT 类应用、AI 写作助手、智能客服等场景。它不仅是 Vercel 官方 AI 解决方案的基石,也是 TypeScript 生态中最流行的 AI 应用开发工具包,GitHub 星标超过 25,000+,npm 周下载量超过 100 万次

    ⚙️ 安装要求和过程

    环境要求

    • 运行环境:Node.js 18.0+(推荐 20+)
    • 框架支持:Next.js 14+(App Router 优先)、React 18+、Vue 3+、Svelte 4+
    • TypeScript:推荐 5.0+(完整类型支持)
    • 包管理器:npm / pnpm / yarn / bun 均可

    快速安装

    在 Next.js 项目中一键安装:

    // 核心包 + OpenAI 提供商
    npm install ai @ai-sdk/openai
    // 或使用 pnpm
    pnpm add ai @ai-sdk/openai
    
    // Vue/Nuxt 项目
    npm install ai @ai-sdk/vue @ai-sdk/openai
    
    // Svelte/SvelteKit 项目
    npm install ai @ai-sdk/svelte @ai-sdk/openai

    最小可用示例(Next.js App Router)

    // app/api/chat/route.ts
    import { openai } from '@ai-sdk/openai';
    import { streamText } from 'ai';
    
    export async function POST(req: Request) {
      const { prompt } = await req.json();
    
      const result = await streamText({
        model: openai('gpt-4o'),
        prompt,
      });
    
      return result.toDataStreamResponse();
    }

    前端调用(React hooks):

    // app/components/Chat.tsx
    'use client';
    import { useChat } from 'ai/react';
    
    export default function Chat() {
      const { messages, input, handleInputChange, handleSubmit } = useChat();
    
      return (
        <div>
          {messages.map(m => (
            <div key={m.id}>
              <strong>{m.role}:</strong> {m.content}
            </div>
          ))}
          <form onSubmit={handleSubmit}>
            <input value={input} onChange={handleInputChange} />
          </form>
        </div>
      );
    }

    无需手动管理流式响应、无需手写 ReadableStream 解析,AI SDK 全部帮你搞定。

    🌟 核心功能

    • 📡 流式输出(Streaming) — 内置完整的流式响应处理,AI 生成内容可逐字实时渲染到 UI,用户体验媲美 ChatGPT。支持 streamTextstreamObjectstreamData 等多种流式 API,兼容 Edge Runtime。
    • 🧩 多框架支持 — 提供 React、Vue、Svelte 专用 hooks(useChatuseCompletionuseObject),一套核心逻辑适配所有主流前端框架。每个框架都有独立的 @ai-sdk/xxx 适配器包。
    • 🔌 多模型统一接口 — 通过 @ai-sdk 系列提供商适配器,统一接入 OpenAI、Anthropic、Google Gemini、AWS Bedrock、Azure、Ollama、Groq 等 30+ LLM 提供商,切换模型只需改一行代码。
    • 🛠️ 工具调用(Tool Calling) — 原生支持 LLM 工具调用(Function Calling),可用 TypeScript 函数定义 AI 可调用的”工具”,LLM 自行决定调用哪些工具。支持多步工具调用链(maxSteps),轻松构建自主 Agent。
    • 💾 对话持久化 — 内置 useChat 的持久化支持,可对接 Vercel KV、Upstash Redis、PostgreSQL 等存储方案,轻松实现对话历史管理与多会话管理。
    • 🖼️ 多模态支持 — 支持图像输入(Vision)、语音转文字(Transcription)、文字转语音(Speech)、图像生成(Image Generation)等多模态能力,覆盖 AI 应用全链路。

    💡 典型使用场景

    场景一:构建类 ChatGPT 的对话应用

    AI SDK 的 useChat hook 封装了完整的对话状态管理(消息列表、输入状态、提交处理、流式更新),开发者只需几行代码即可构建支持流式输出的多轮对话 UI。配合 Next.js App Router 的 Server Actions,可实现端到端的类型安全。

    适用项目:AI 聊天助手、智能客服系统、企业内部知识库问答、教育辅导机器人。

    场景二:AI 辅助写作与内容生成

    利用 useCompletion hook,可在任意输入框中集成 AI 续写、改写、翻译、摘要等功能。流式输出让用户实时看到生成结果,配合 streamObject 还可生成结构化 JSON 数据(如自动填充表单、结构化数据提取)。

    适用项目:AI 写作工具、邮件智能助手、代码补全插件、SEO 内容生成器。

    场景三:AI Agent 与自动化工作流

    AI SDK 的 Tool Calling 功能允许定义 JavaScript 函数作为 AI 可调用的”工具”,LLM 可自行决定调用哪些工具来完成任务。配合 maxSteps 参数可实现多轮工具调用链,构建能自主规划并执行任务的 AI Agent。Vercel 还提供了 Agent 专用 API,支持中断/恢复、状态持久化等高级能力。

    适用项目:智能数据分析助手、自动化工作流编排、AI 运维助手、个人生产力 Agent。

    🔥 推荐理由

    为什么选择 Vercel AI SDK?

    1. Vercel 官方背书,生态最完整
    作为 Next.js 母公司 Vercel 的官方 AI 解决方案,AI SDK 与 Next.js App Router 深度集成,部署到 Vercel 平台可享受零配置体验。同时支持 Netlify、Cloudflare Pages 等所有主流部署平台,Edge Runtime 全面兼容。

    2. 流式输出体验最佳
    AI SDK 的流式处理是 TypeScript 生态中最成熟的实现,支持文字、对象、工具调用结果、Data Stream 附件等多种数据类型的流式传输,前端渲染延迟低至毫秒级。内置的 Data Stream Protocol 还支持在流式响应中夹带自定义数据(如推理过程、来源引用)。

    3. 跨框架复用,学习成本低
    核心 API 设计高度一致,从 React 迁移到 Vue 只需更换 import 路径。官方文档提供各框架的完整示例,且每个示例都有 TypeScript 类型标注,上手非常快。AI SDK Core(模型调用)甚至可以脱离前端框架在纯 Node.js 环境中使用。

    4. 内置多模态 AI 工具链
    除了基础对话,还内置了 generateImage(图像生成)、embed(文本嵌入向量化)、transcribe(语音转文字)、speech(文字转语音)等多模态能力,并支持通过统一接口调用。未来还将支持视频生成等更多模态。

    5. 活跃的社区与持续迭代
    Vercel 团队保持高频迭代(平均每周发布),积极跟进 LLM 最新能力(如 Anthropic 的 Computer Use、OpenAI 的 o1 推理模式)。GitHub 上 25K+ Stars,npm 周下载量 100 万+,社区提供的示例项目和模板非常丰富。

    💡 个人使用感受:我用 AI SDK 构建过两个 AI 聊天项目,最深刻的印象是”省心”——流式输出不用自己处理 ReadableStream,工具调用不用手写 JSON Schema 解析,连 TypeScript 类型都是自动推导的。如果你在用 Next.js,这基本上是唯一选择;如果你在用其他框架,它同样是最好的 TypeScript AI 工具包。

    📥 下载地址

    开源许可:NOASSERTION(实际以仓库 LICENSE 文件为准)
    GitHubgithub.com/vercel/ai
    官网/文档sdk.vercel.ai
    所属公司:Vercel(Next.js 母公司)
    适合人群:Next.js/React/Vue 开发者、AI 应用创业者、全栈工程师、前端 AI 集成需求者

  • OKX上线AI Agent市场:让AI互相雇佣、自主付费,赌一个万亿赛道

    加密货币交易所OKX这几天做了一个挺有意思的尝试——他们上线了一个AI Agent市场,叫OKX AI。简单来说,就是让AI Agent在这个平台上互相找活儿、互相付费、并建立自己的链上信用记录。这个市场6月30日(周二)正式对开发者开放,之前已经跑了一段封闭测试,有50家早期AI服务提供商参与。

    “一个人的公司,年营收百万美元,靠的是一支不限人数的AI团队”

    OKX创始人兼CEO Star Xu的说法很敢讲:”未来十年的标志是一个人创办的公司年营收超过100万美元——因为每个人都相当于拥有了一支不限规模的劳动力队伍。”这里的”劳动力队伍”指的就是AI Agent。

    他的逻辑是:传统金融基础设施是为人设计的,但”Agent经济”需要的是为自主运行的软件设计的基础设施。这就是OKX AI要做的事。

    OKX AI Agent市场概念图
    OKX AI市场让AI Agent能够互相雇佣、自主支付、建立链上信用(配图由AI生成)

    OKX已经有超过1.5亿全球用户。公司的判断是,下一代客户不只是人或机构,而是能够自主交易的AI Agent,由此催生出一个”Agent经济”。首席营销官Haider Rafique甚至给出了一个具体预测:”Agent商务”可能在未来五年内成长为一个万亿美元级别的市场,驱动力来自微支付和自主软件。

    OKX的这个市场建立在公司之前开发的技术之上——这项技术让AI Agent能够持有数字钱包、用稳定币支付、并建立持久的身份。现在这些能力被打包成了一个开发者市场。

    早期入驻的三个角色

    目前已经确认的合作方有三个,各自解决Agent经济里的一个基础问题:

    • CertiK:让AI Agent在执行交易之前先评估加密钱包或代币的安全性,解决”信任”问题。
    • CoinAnk:提供实时市场数据,按次查询收费,解决”信息”问题。
    • GenLayer:带来争议解决基础设施,帮AI Agent在合同执行出错时解决纠纷,解决”法律”问题。

    GenLayer Labs的CEO Albert Castellana说得很坦率:”我们现在做的本质上是一个数字法庭系统。对我们来说最大的挑战是分发——OKX已经有了。”这句话点出了OKX做这件事的核心优势:不是技术有多先进,而是已经有了一个现成的用户和开发者网络。


    用区块链解决AI Agent的支付问题

    OKX选择用区块链和稳定币来做Agent之间的支付,有一个很实际的原因:传统支付通道处理不了这种场景。AI Agent之间的交易可能是24小时不间断的,而且单笔金额可能极小(微支付),用信用卡或银行转账的话,手续费比交易金额还高。

    用稳定币和区块链的话,这些都不是问题。交易可以全天候结算,微支付也经济上可行。这听起来是个优雅的解决方案,但前提是——得有足够的AI Agent真的开始互相做生意。目前这还是一个”先有鸡还是先有蛋”的问题。

    OKX的算盘:从交易所到AI基础设施

    这件事对OKX来说,不只是做一个新功能那么简单。这是它从”加密货币交易所”向”更广泛的金融科技公司”转型的一步棋。3月份,纽约证券交易所的母公司洲际交易所(ICE)以250亿美元的估值向OKX投资了约2亿美元。Rafique说,这个合作是公司通过代币化”现代化市场”战略的一部分,而OKX AI则是面向自主软件时代的”现代化货币”努力。

    印度在这个计划里占了很重的分量。OKX把印度视为最高优先级的市场之一,原因很简单:印度是全球最大的AI和区块链开发者聚集地之一。OKX AI这样的开发者工具在监管方面的障碍比现货加密交易要低,这可能帮助OKX在以开发者身份重新连接印度市场,而不需要等加密交易业务的完整合规。

    开发者可以通过Onchain OS接入这个市场,OKX强调不需要OKX账户就能开始使用,而且平台兼容Claude Code、Codex、Hermes和OpenClaw等主流AI编程工具。这个”无账户起步”的设计挺关键——如果要用这个市场必须先开一个OKX账户,很多开发者可能直接就走了。

    当然,所有这些的前提是”Agent经济”真的能起来。目前来看,AI Agent互相雇佣对方这件事还处在非常早期的阶段。OKX这次算是提前布局,赌的是未来两三年内Agent之间的经济活动会变得足够密集,值得有一个专门的市场和支付层。这个赌注能不能赢,可能要等一阵子才知道。

  • Superpowers:让AI编码智能体遵循软件工程方法论,241K+ Stars让AI不再野蛮生长

    Superpowers:让AI编码智能体遵循软件工程方法论,241K+ Stars让AI不再野蛮生长

    🦸

    Superpowers

    面向 AI 编码智能体的完整软件开发方法论与技能框架

    ⭐ 241,708 Stars
    🍴 21,457 Forks
    ⚠️ 292 Issues
    📄 MIT

    📌 项目简介

    Superpowers 是一套面向 AI 编码智能体(Coding Agents)的完整软件开发方法论,基于可组合的技能(Skills)系统和初始指令构建。它让 AI 不再”野蛮生长”地直接写代码,而是遵循规范的软件工程流程——先引导用户明确需求、输出设计文档、拆分任务计划,再通过子智能体驱动开发,过程中强制测试驱动开发(TDD)、代码评审、Git 工作流等最佳实践,让 AI 生成的代码质量达到专业工程师水准。

    🚀 核心功能

    🧠

    需求设计(Brainstorming)

    通过苏格拉底式提问细化粗糙需求,探索替代方案,分段输出设计文档供用户验证。

    📋

    任务拆分(Writing Plans)

    将工作拆分为 2-5 分钟即可完成的小任务,每个任务明确标注文件路径、完整代码逻辑、验证步骤。

    🤖

    子智能体驱动开发

    每个任务分配独立子智能体,执行两阶段评审(先校验是否符合需求,再检查代码质量)。

    测试驱动开发(TDD)

    强制执行红-绿-重构循环:先写失败测试 → 确认测试失败 → 写最小实现代码 → 确认测试通过。

    🔍

    代码评审(Code Review)

    任务间隙自动按计划做代码评审,按严重程度上报问题,严重问题会阻塞后续开发。

    🔀

    Git Worktrees 隔离

    自动创建新分支的隔离工作区,运行项目初始化,验证测试基线是否干净,支持并行开发多任务。

    🔧 安装要求和过程

    环境要求

    • 支持 15+ 种主流 AI 编码工具(Claude Code / Cursor / GitHub Copilot CLI / Codex / Kimi Code 等)
    • 无需额外依赖,技能文件即装即用

    快速安装步骤

    # Claude Code(官方市场)

    /plugin install superpowers@claude-plugins-official

    # Cursor

    在 Agent 聊天框中运行:/add-plugin superpowers

    # GitHub Copilot CLI

    copilot plugin marketplace add obra/superpowers-marketplace
    copilot plugin install superpowers@superpowers-marketplace

    💡 典型使用场景

    场景一:从零开发新功能

    向 AI 描述需求 → Superpowers 引导细化设计 → 输出设计文档 → 确认后自动拆分任务 → 子智能体逐个完成 → 自动 TDD + 代码评审 → 完成后提示合并 PR。

    场景二:调试疑难 Bug

    使用 systematic-debugging 技能,AI 遵循 4 步根因定位流程(复现 → 假设 → 验证 → 修复),包含根因追踪、纵深防御、条件等待等高级技术。

    场景三:团队协作标准化

    团队成员使用相同的 Superpowers 技能库,AI 生成的代码风格、测试覆盖率、Git 提交规范完全一致。新人加入项目可快速上手。

    🌟 推荐理由

    Superpowers 解决了当前 AI 辅助开发最大的痛点——“代码能跑但质量堪忧”。它通过结构化技能系统,将软件工程最佳实践”固化”到 AI 的工作流中。

    最打动我的是它的 测试驱动开发强制机制——AI 必须先写失败测试,再写最小实现,这与许多开发者”先写代码再补测试”的习惯形成鲜明对比。

    另一个亮点是 子智能体架构——每个任务独立分配子智能体,执行两阶段评审,支持长时间无偏差自主运行。

    💡 提示:Superpowers 支持 15+ 种 AI 编码工具,只需安装一次即可在多个工具中共享同一套技能库。

    📥 下载地址

    创建:2025-10-09 | 更新:2026-06-30 | Issues:292 | License:MIT

  • Agent-Reach:给AI Agent一键装上互联网能力,44.1K+ Stars让Agent自由访问Twitter/Reddit/YouTube等10+平台

    Agent-Reach:给AI Agent一键装上互联网能力,44.1K+ Stars让Agent自由访问Twitter/Reddit/YouTube等10+平台

    🌐 Agent-Reach

    给 AI Agent 一键装上互联网能力
    零配置 · 全平台 · 完全免费

    Agent-Reach 是一个为 AI Agent 提供互联网访问能力的一站式脚手架工具。它让 Claude Code、OpenClaw、Cursor、Windsurf 等 AI 编程助手能够轻松读取 Twitter、Reddit、YouTube、GitHub、B站、小红书等平台的内容,无需任何 API 费用,所有功能完全免费。

    44.1K+
    GitHub Stars

    10+
    支持平台

    ¥0
    API 费用

    🤔 为什么需要 Agent-Reach?

    现在的 AI Agent 已经很强大了。Claude Code 能帮你重构整个项目,OpenClaw 能管理日常事务,Cursor 能在 IDE 里完成全栈开发。

    但有一件事它们始终做不好:去网上找点东西。

    ❌ 遇到的问题
    • “去 GitHub 找类似的开源项目”——认证配置卡半天
    • “去 Reddit 看看社区反馈”——403,匿名接口被封
    • “去推特搜产品评价”——Twitter API 要付费,最低档上百刀
    ✅ Agent-Reach 的方案
    • 一句话安装,Agent 全自动完成配置
    • 多后端冗余路由,某条路线失效自动切换
    • 完全免费,零 API 费用

    ⚙️ 安装要求和过程

    环境要求

    • Python:3.10 及以上版本
    • 适用环境:本地电脑、开发服务器、生产服务器均支持
    • OpenClaw 用户:需先开启 exec 权限(执行 openclaw config set tools.profile "coding" 并重启 Gateway)

    快速安装(推荐方式)

    不需要懂任何配置,只需要把这句话复制给你的 AI Agent:

    帮我安装 Agent Reach:https://raw.githubusercontent.com/Panniantong/agent-reach/main/docs/install.md

    剩下的事情 Agent 会自己完成——安装 CLI 工具、配置搜索引擎、检测环境、注册技能文档,甚至会问你要不要解锁更多平台。

    手动安装

    # 安装 Python 包
    pip install agent-reach
    
    # 执行安装脚本
    agent-reach install --env=auto

    安装模式选项

    模式 参数 说明
    全自动(默认) --env=auto 自动检测环境并完成所有配置
    安全模式 --safe 仅列出所需依赖,不自动修改系统(适合生产服务器)
    预览模式 --dry-run 安装前预览所有操作,不实际执行

    ✨ 核心功能

    🎯

    零配置开箱即用

    默认激活 6 个零配置渠道(网页、YouTube、GitHub、RSS、全网搜索、V2EX),安装完成就能直接使用,无需任何额外设置。

    🔄

    多后端冗余路由

    每个平台都配置「首选 + 备选」多套接入方案,某条路线失效自动切换,用户无感知。2026 年 3 月一批单平台 CLI 集体停更,Agent-Reach 用户零操作,因为路由已经自动切好了。

    🩺

    内置诊断工具

    执行 agent-reach doctor 可一键检测所有渠道的可用状态、当前使用的后端,以及故障修复方案。排查问题再也不用瞎猜。

    🤖

    全 Agent 兼容

    支持 Claude Code、OpenClaw、Cursor、Windsurf、Codex、Aider 等所有支持命令行调用的 AI Agent,无需针对每个工具单独配置。

    🔒

    隐私安全 & 完全免费

    所有 Cookie、Token 仅本地存储,不上传任何第三方,代码完全开源可审计。所有依赖工具均为开源项目,所有 API 免费接入,无需支付任何 API 费用。

    📡 支持平台(10+)

    Tier 0 – 零配置即用
    • 网页:Jina Reader 解析任意网页,自动转 Markdown
    • YouTube:yt-dlp 提取字幕和视频搜索
    • GitHub:gh CLI 读取公开仓库、搜索、查看 Issue
    • RSS:feedparser 解析任意 RSS/Atom 源
    • 全网搜索:MCP 接入 Exa 语义搜索,免费无需 Key
    • V2EX:热门帖子、节点帖子、用户信息读取

    Tier 1 – 配置后解锁
    • Twitter/X:读推文 + 搜索 + 时间线(Cookie 认证)
    • Reddit:搜索 + 读帖子和评论(需登录态)
    • B站:搜索、视频详情、字幕获取
    • 小红书:搜索、内容阅读、评论查看
    • LinkedIn:公开页面、Profile、职位搜索
    • 雪球:股票行情、搜索、热门帖子

    🚀 典型使用场景

    📊

    场景一:全网技术调研

    你正在选型一个 LLM 框架,需要了解社区反馈和技术对比。只需对 Agent 说:

    “帮我全网调研一下最新的 LLM 框架对比,包括 GitHub 上的 Stars 数、Reddit 社区讨论、YouTube 评测视频内容”

    Agent 会自动调用 Exa 语义搜索(全网)、gh CLI(GitHub 数据)、yt-dlp(YouTube 字幕提取)、Reddit CLI(社区讨论),汇总成一份完整的调研报告。

    🐦

    场景二:社交媒体舆情分析

    你想了解某个开源项目在社交媒体上的评价。只需对 Agent 说:

    “帮我搜一下 Twitter 上关于 vLLM 的讨论,总结一下大家的主要观点”

    Agent 会自动调用 twitter-cli 搜索相关推文,提取内容并总结。如果需要,还可以结合 RedditB站 的讨论内容,获得更全面的舆情画像。

    📺

    场景三:视频内容总结

    你看到一个技术分享视频,但没时间看完。只需对 Agent 说:

    “这个 YouTube 视频讲了什么内容?帮我总结一下关键要点:https://youtube.com/watch?v=xxx”

    Agent 会自动调用 yt-dlp 提取视频字幕,然后调用 LLM 进行总结。支持多语言字幕,B站视频同样支持。

    💡 推荐理由

    Agent-Reach 解决了 AI Agent 最头疼的问题——如何低成本、高效率地获取互联网信息

    它的核心价值不在于提供了什么新功能,而在于 把选型、配置、维护的脏活累活都替你做了。每个平台都有多套接入方案,某条路线失效自动切换,用户完全无感知。

    我特别喜欢它的 零配置设计——安装完成就能用 6 个平台,不需要查文档、不需要申请 API Key。对于需要登录态的平台,只需要对 Agent 说”帮我配 Twitter”,Agent 会自动引导完成配置,不需要手动处理 Cookie。

    完全免费也是一大亮点。所有依赖工具都是开源项目,搜索引擎等能力免费接入,不需要支付任何 API 费用。相比 Twitter API 上百美元的月费,Agent-Reach 真的是良心之作。

    🩺 内置诊断工具

    安装完成后,执行以下命令可以一键检测所有渠道的可用状态:

    agent-reach doctor

    该命令会输出:

    • 每个渠道的可用状态(✅ 可用 / ❌ 不可用)
    • 当前使用的后端路由
    • 如果不可用,给出故障修复方案

    🔄 更新与卸载

    更新方法

    已安装的用户直接给 Agent 发送指令即可完成更新:

    帮我更新 Agent Reach:https://raw.githubusercontent.com/Panniantong/agent-reach/main/docs/update.md

    卸载方法

    • 完整卸载agent-reach uninstall
    • 保留配置agent-reach uninstall --keep-config
    • 预览卸载agent-reach uninstall --dry-run
    • Python 包卸载pip uninstall agent-reach

    📥 下载地址

    许可证:MIT License(商业友好,可自由使用、修改和分发)
  • Cursor推出移动端APP,编程智能体装进了口袋

    Cursor被SpaceX以600亿美元收购的消息才过去没几天,这家公司又有了新的动作。这次不是融资,不是被收购的细节,而是推出了一款移动端APP。

    周一,Cursor正式发布了Cursor Mobile。顾名思义,这是一款让你直接在手机上跟编程智能体对话的APP。你在手机上发一条指令,远端的编程智能体就开始干活,进度实时同步。那些原来在桌面端发起的任务,现在也能在手机上继续跟进。

    Cursor移动端APP概念图
    Cursor推出移动端APP,编程智能体装进口袋

    写代码的地点,从显示器前变成了手机屏幕

    这个变化比它看起来要大。过去程序员写代码,离不开双显示器、机械键盘、安静的环境。现在,AI编程工具正在把”写代码”这件事,从”坐在电脑前敲键盘”变成”在手机上跟智能体对话,然后审批结果”。

    Anthropic的Claude Code负责人Boris Cherny在最近的一次分享里说了一句挺有意思的话:”我现在大部分编程都是在手机上完成的。”他还补了一句:”如果六个月前你跟我这么说,我肯定会说你疯了。”

    这句话现在听起来不那么疯了。Cursor Mobile的发布,就是这个趋势的最新注脚。

    Anthropic Claude Code负责人Boris Cherny:”我现在大部分编程都是在手机上完成的。如果六个月前你跟我这么说,我肯定会说你疯了。”

    Cursor 2.0之后的自然延伸

    Cursor Mobile不是凭空冒出来的。去年10月Cursor发布2.0版本的时候,核心变化就是把产品方向从”编辑器里的AI辅助”转向了”独立的编程智能体”。当时这个变化就很明确:Cursor不再只是帮你补全代码的编辑器插件,而是一个能独立执行编程任务的AI系统。

    一旦编程智能体可以独立工作,桌面端就不再是你唯一能跟它交互的地方。你的手机也能做这件事——只要能联网,就能发起任务、查看进度、给智能体新的指令。

    这个逻辑跟Anthropic和OpenAI推出移动端AI编程工具是同一个方向。大家都在做同一件事:把编程智能体的交互界面,从桌面解绑。

    SpaceX收购之后,Cursor还在加速

    Cursor被SpaceX收购的消息在6月16日传出,收购价600亿美元,全部以股票支付。这笔收购创下了一系列纪录:它是AI编程工具赛道迄今为止最大的一笔收购,也是SpaceX在IPO之后的第一笔重大收购。

    但Cursor似乎没有被收购这件事拖慢节奏。移动端APP按时推出,说明这家公司在交易敲定的同时,产品节奏一点没松。SpaceX买下Cursor,看中的大概就是这支能打的产品团队——而不是让他们停下来。

    从更大的视角看,AI编程工具正在经历一个深刻的转变:代码的”生产场所”从程序员的头脑和手指,转移到了AI智能体的运行环境里。人类程序员的工作,越来越像是一个”智能体管理者”——定义任务、审批结果、处理例外。

    这个转变一旦完成,编程的”场所”就真的不重要了。在咖啡馆、在地铁上、在会议间隙,掏出手机就能推进一个编程任务。这可能就是Cursor Mobile想抓住的未来。