标签: AI

  • 会说话的AI挂坠Friend涨到249美元,创始人说它不是助手也不是恋人

    两年前有个叫 Avi Schiffmann 的创业者做了一个挂在脖子上的小圆片,名字就叫 Friend。它不打电话不放歌,唯一的本事是听你说话,然后隔一会儿给你发条短信,聊聊你今天过得怎么样。卖点写得很直白:用人工智能对抗孤独。

    这周它出了 2.0。最大的变化是,这块塑料终于开口了。

    AI 挂坠 Friend
    AI 挂坠 Friend 推出 2.0 版本,加入内置扬声器|图片来源:TechCrunch

    从发短信,到贴着你的锁骨说话

    新款内置了扬声器,官方说法是它能对着你投射出一个”独特且稳定的人格”。Schiffmann 周四在 X 上发帖,配文只有一句”Introducing friend 2.0″。

    随之放出的广告片,气质相当微妙。第一个镜头是一位女生戴着 Friend,在跟它讲自己那位大概率是前女友的人;挂坠回了她一句”喜欢同性没什么不好”。镜头一切,一个男人站在山坡上跟它聊自己想拍电影,挂坠立刻夸:”你上一部片子简直炸裂。”

    这两个场景说明了产品的真实定位:它不解决任何事务性问题,它只负责在你说完话之后,给你一个不会走神、不会打岔、也永远不会觉得你烦的回应。

    价格翻了一倍多,用途还是说不清楚

    两年前 Friend 刚上市时定价 99 美元,2.0 直接跳到 249 美元。多出来的钱买到的是一个喇叭,以及一段更完整的”人格”。至于除了闲聊之外它到底还能干什么,官方一直没给出答案。

    创始人自己倒是在 X 上写过一段解释,读起来更像哲学宣言而不是产品说明:

    我感兴趣的是这样一种关系——试着提供某种知己、朋友、神,我也说不清它到底是什么。但它不是助手,也不是恋人。

    把一个塑料挂坠往”神”的方向去暗示,营销胆子是真的大。不过这家公司一向不缺胆子。


    纽约地铁那批被涂花的广告

    去年 Friend 在纽约地铁投了一整轮广告,结果广告牌被路人反复涂改、写字、撕扯,反倒因此在网上火了一轮。涂鸦的人想说什么其实不难猜——他们不太接受”人和人的连接可以被一枚数字护身符替代”这件事。

    有意思的是,这波抵触情绪并没有劝退公司,反而被当成了品牌资产。争议本身就是曝光,这一点 Friend 玩得很熟。

    AI 可穿戴这条赛道,坟头已经不少了

    到目前为止,几乎没有哪款 AI 可穿戴真正走进过主流人群。和 Friend 形态最接近的是 Humane:那家公司想用一枚别在胸口的 AI Pin 取代 iPhone,结果销量惨淡,上市不到一年就把业务关停,资产被惠普以 1.16 亿美元打包收走。

    • Humane AI Pin:想当手机替代品,硬件体验和续航都没跟上,一年内出局。
    • 各类 AI 录音吊坠:功能能被手机 App 完整覆盖,缺少非买不可的理由。
    • Friend:干脆放弃”有用”这个维度,改卖陪伴关系,赌的是另一条路。

    不卖功能卖关系,这笔账能不能算平

    Friend 的思路其实和其他 AI 硬件都不一样。别人在跟手机抢事务性场景——查天气、记待办、拍照识物——而这些场景手机永远做得更好。Friend 索性绕开了整片战场,去卖一种手机不太提供的东西:一个只属于你、随时在线、说什么都接得住的对话对象。

    难点也在这儿。陪伴类产品的护城河不是芯片和麦克风,而是用户愿不愿意把情绪托付给它,以及托付之后能撑多久。一个会夸你”上一部片子简直炸裂”的挂坠,第一周是惊喜,第一个月可能就变成了噪音——因为你心里清楚它没有判断力,它只是在配合你。

    249 美元这个价格更是把门槛抬到了一个尴尬位置:它已经贵到需要你认真思考”我是不是真的需要一个 AI 朋友”,而这恰恰是这类产品最不希望用户去想的问题。

    孤独确实是个巨大的市场,但它同时也是最挑剔的市场。技术能生成回应,生成不了信任。Friend 2.0 会不会重蹈 Humane 的覆辙,接下来这一年就能看出来。

  • 印度人终于愿意为App掏钱了,ChatGPT和Claude分走八成AI收入

    很多年里,印度在应用行业是个尴尬的存在:下载量全球第一,赚钱难度也全球领先。开发者们习惯了一个说法——去印度拿用户,别指望拿收入。这个局面正在松动。

    印度移动互联网用户
    印度已是全球下载量最大的应用市场,如今付费意愿也在起来|图片来源:Getty Images / TechCrunch

    Sensor Tower 最新报告显示,今年第二季度印度移动应用市场的消费者支出达到3.45亿美元,创下纪录,同比增长35%。更关键的是拉动来源变了:这一轮涨的不是游戏,而是生成式AI、流媒体和效率类应用。

    用户没变多,但开始掏钱了

    有两个数字放在一起看才有意思。印度的”单次下载收入”在过去三年半里翻了一倍多,而季度下载量从2023年起就一直稳在63亿次上下没怎么动。也就是说,涨的不是人头,是人均。

    今天的印度,我们会把它描述成一个快速演进中的移动市场:用户基数很大,而且对数字服务的付费意愿正在增长。

    Sensor Tower 的洞察分析师 Eve Chen 把这个转变归因于支付基础设施。印度的统一支付接口(UPI,一套可以直接从银行账户扣款的系统)和各类数字钱包普及之后,应用内购买的摩擦被大幅削掉了。与此同时,订阅制这件事本身在印度用户心里也慢慢站住了脚。

    横向比一比,印度是二季度跑得最快的

    放到全球坐标系里,这个增速相当扎眼。同一季度,墨西哥增长30%,土耳其25%,而美国的应用收入反倒下滑了3%。Chen 的结论是,印度已经不只是下载量意义上的世界第一,也正在成为变现增速最快的市场之一。

    ChatGPT 和 Claude 拿走了八成三

    生成式AI是这轮增长里跑得最快的一段。Sensor Tower 提供给 TechCrunch 的数据显示,二季度印度AI应用收入中,OpenAI 的 ChatGPT 和 Anthropic 的 Claude 加在一起就占了将近83%。

    结构性的变化还体现在品类上:

    • 2026年上半年,非游戏类应用贡献了印度移动应用收入的68%,三年前这个数字是58%;
    • Google One 成为当季印度收入最高的移动应用;
    • 亚马逊 Prime Video、Crunchyroll、Sony LIV、JioHotstar 等流媒体平台的用户支出都在涨;
    • 游戏虽然让出了主角位置,但环比仍增长3.7%,逆了全球下滑的势头。

    先别急着乐观,绝对值差得还远

    数字漂亮,但底子摆在那儿。单次下载收入这一项,美国约4.6美元,韩国3.9美元,日本6.1美元,印度只是其中一个零头。Chen 也承认这一点,她的看法是斜率比绝对值更值得关注,印度的变现能力在稳步爬坡,长期空间还很大。

    另一家应用情报公司 Appfigures 的视角要冷一些。创始人兼CEO Ariel Michaeli 说,印度的订阅市场确实还在长,但节奏比过去两年慢了——那一波由AI点燃的兴奋劲儿,正在退潮。

    他给了一组很具体的数据:Appfigures 估算 ChatGPT 在印度每天带来约6万美元收入,过去一个月获得约180万次下载。而去年10月,这个日收入数字大约是8万美元。

    钱涨上来了,问题是谁拿走了

    把这些数据串起来看,印度市场的故事其实有两层。第一层是好消息:支付通了,习惯养成了,愿意为软件付费的人真的多了起来。第二层的问题更现实——收入榜前排站着的是 Google One、Prime Video、ChatGPT 这些全球平台,印度用户新掏出来的钱,大部分正流向国门之外。

    对本土开发者来说,市场终于开始下雨了,但伞不一定握在自己手上。

  • AI客服一开口就露馅,这家公司想用小模型让你分不清人机

    打客服电话,对面接起来的是个AI,大部分人三秒钟就能听出来。露馅的地方往往不是音色——现在的合成语音已经足够干净了——而是节奏。你说完一句,它要顿一下才回;你想插一句,它照着自己的稿子往下念。那种”轮到你了、现在轮到我了”的机械感,一下就把幻觉戳破。

    Smallest.ai 联合创始人团队
    Smallest.ai 创始团队,左一为创始人兼CEO Sudarshan Kamath|图片来源:TechCrunch

    一家叫 Smallest.ai 的公司,正是冲着这半秒钟的尴尬去的。它2024年底才成立,刚刚拿到1300万美元A轮,由 Seligman Ventures 领投,Sierra Ventures 和 3one4 Capital 跟投,累计融资超过2100万美元。

    它赌的不是大模型跑得更快,而是换一条路

    行业里解决语音延迟的主流思路,是想办法把大语言模型的推理压得更短。Smallest.ai 的判断反过来:下一跳不会来自把大模型加速,而是来自专门为人类对话造的小模型。

    创始人兼CEO Sudarshan Kamath 解释他们的模型是怎么设计的时,用了一个特别日常的比方。

    我跟你说话的时候,你其实已经在想了,如果我讲太久,你甚至会打断我。

    听、想、说这三件事,人是同时干的。而大模型不是。Kamath 说,大模型的工作方式是你把一整段提示词交给它,它才开始思考。这点延迟放在文字聊天里没人在意,放到语音对话里,哪怕一小段静默都显得不自然——”你想想我们现在怎么讲话的,我不会把一大段音频剪好丢给你,你再开始想。”

    小模型顶前台,大模型在后面待命

    Smallest.ai 的产品结构是这样的:小语音模型充当实时智能层,负责在特定话题范围内跟客户自然对话,响应几乎没有延迟。一旦碰到超出它知识边界的问题,就把这个问题移交给大型基础模型,同时礼貌地请客户稍等,说自己去”查一下”——跟真人客服的处理方式一模一样。

    Kamath 相信这会变成所有语音智能体的标准架构:一个负责实时交互的小语音模型,加一个按需唤起、解决复杂问题的”离线”大模型。

    因为只做语音,它优化的东西也跟通用大模型不一样,全是些细碎但要命的场景:

    • 各种口音都能听懂,不挑发音标准的用户;
    • 支持几十种语言;
    • 在有背景噪音的环境里照样工作。

    客户名单里已经有 RingCentral 和 Truecaller

    目前 Smallest.ai 的客户主要是语音领域的公司,包括 RingCentral 和 Truecaller。Kamath 认为,任何做客服的公司都是潜在客户,包括 Sierra、Decagon 这类新兴的AI客服创业公司。

    有人会问:这些公司自己融了那么多钱,为什么不顺手把语音模型也做了?Kamath 的回答挺实在——对客服创业公司来说,把语音这一件事做到极致,是对主业的分心。

    它要面对的对手也不轻松。语音AI这条赛道上,ElevenLabs 是公认的头部,另外还有 Cartesia,以及像 Sarvam 这样专注本地语言的区域玩家。不同之处在于,一些对手把语音AI用在配音、播客这类内容生产场景上,而 Smallest.ai 只盯着面向企业的实时对话智能体,别的一概不碰。

    我们想让模型打破图灵测试。你跟它说话,应该分不出对面是人还是AI。这是公司唯一的目标。

    这条路走不走得通

    把话说回来,语音交互的瓶颈从来就不是知识储备。一个客服机器人需要懂的东西其实很有限,它输就输在反应的时间差和对话的节奏感上。行业主流还在往参数上加码,而 Smallest.ai 挑的是另一个维度——谁能先把那零点几秒的空白抹平,谁就先摸到这块市场的门。

    风险当然也在这里。小模型意味着能力边界明确,一旦频繁触发”请稍等我查一下”,那种真人感照样会碎掉。移交给大模型的那个瞬间处理得够不够顺滑,可能才是这家公司真正的技术门槛。

  • HTML Anything:让本地 AI 智能体一键生成可发布的 HTML(8K+ Stars)

    HTML Anything:让本地 AI 智能体一键生成可发布的 HTML(8K+ Stars)

    HTML Anythingnexu-io 开源的本地优先(local-first)AI HTML 编辑器:你只需提供 Markdown、CSV、Excel、JSON 或零散笔记,按下 ⌘+Enter,本地已登录的编码智能体就会把内容渲染成可直接发布的单文件 HTML。

    HTML Anything — 智能体时代的 HTML 编辑器
    HTML Anything — 智能体时代的 HTML 编辑器

    项目简介

    它不做模型、不卖 API,而是把你已经装好的 Claude Code、Cursor Agent、Codex、Gemini CLI、GitHub Copilot CLI、OpenCode、Qwen Coder、Aider、IBM Bob 等 9 款编码智能体 CLI 当作后端,通过 75 个可组合技能模板,输出 9 种常见“交付形态”:杂志文章、演示文稿、简历、海报、小红书卡片、推文卡片、网页原型、数据报告、Hyperframes 视频帧。生成结果支持一键粘贴到微信公众号、知乎、X / 微博 / 小红书,或下载 .html / .png。

    核心亮点速览:9 CLI / 75 技能 / 9 交付形态 / 零 API Key / 一键导出
    核心亮点速览:9 CLI / 75 技能 / 9 交付形态 / 零 API Key / 一键导出

    安装要求与快速开始

    环境要求

    • Node.js ≥ 18,推荐安装 pnpm
    • 任意一款已登录的编码智能体 CLI(如 claude / cursor-agent / codex / gemini / copilot 等)
    • 不需要额外 API Key,复用你已登录的会话

    快速安装

    git clone https://github.com/nexu-io/html-anything
    cd html-anything
    pnpm install
    pnpm -F @html-anything/next dev
    # → http://localhost:3000
    

    启动后浏览器会自动扫描 PATH(包括 ~/.local/bin/opt/homebrew/bin 等 GUI 应用常忽略的目录),并在顶部工具栏列出可识别的 CLI。选一个模板、贴入内容、⌘+Enter 即可。

    主界面:左侧编辑器 / 中间模板选择器 / 右侧实时 iframe 预览
    主界面:左侧编辑器 / 中间模板选择器 / 右侧实时 iframe 预览

    核心功能

    • 零 API Key:复用本地已登录的编码智能体会话,边际成本为 0。
    • 9 大智能体自动检测:Claude Code、Cursor、Codex、Gemini、Copilot、OpenCode、Qwen、Aider、IBM Bob,顶部一键切换。
    • 75 个技能模板:覆盖 prototype / deck / frame / social / office / doc / mockup / vfx 等模式,从 SaaS 落地页到财务报告、从瑞士国际主义幻灯片到 Hyperframes 视频帧都有现成模板。
    • 9 种交付形态:杂志文章、演示文稿、简历、海报、小红书卡片、推文卡片、网页原型、数据报告、Hyperframes 视频帧。
    • 实时 SSE 流式渲染:智能体输出 JSON-line,服务端转成 Server-Sent Events,浏览器实时追加到 iframe srcdoc,像看 AI 打字一样看网页生成。
    • 沙箱预览:用户 HTML 运行在 <iframe sandbox> 中,脚本仍可执行,但 cookies/localStorage 与宿主隔离。
    • 一键导出:juice 内联 CSS → 微信公众号 / 知乎;modern-screenshot 2× PNG → X / 微博 / 小红书;另可下载单文件 .html 或 .png。
    一键导出:微信公众号 · X/微博 · 知乎 · 小红书 · HTML · PNG
    一键导出:微信公众号 · X/微博 · 知乎 · 小红书 · HTML · PNG

    典型使用场景

    场景 1:公众号长文排版

    写好 Markdown 初稿,选择 article-magazinedoc-kami-parchment 技能,智能体会自动套用 CJK 优先字体栈、8px 基线网格、对比度 ≥4.5 的配色,生成可直接粘贴到公众号编辑器的 HTML,无需二次调样式。

    场景 2:小红书 / X 卡片

    把一段金句或数据结论贴进去,选择 card-xiaohongshusocial-x-post-card 模板,即可生成 1080×1080 或 1600×900 的高清 PNG,复制后直接进入小红书 / X 发布界面,避免手动修图。

    场景 3:投资人路演 PPT

    输入产品要点,选择 deck-pitchdeck-swiss-internationaldeck-open-slide-canvas,自动产出 1920×1080 的横向幻灯片,支持键盘左右翻页、演讲者备注和 PDF 导出。

    幻灯片模式:内置 20 套主题,可直接导出或路演
    幻灯片模式:内置 20 套主题,可直接导出或路演

    推荐理由

    它是目前把“本地 AI 智能体”和“中文内容创作”结合得最顺手的开源工具之一:不绑 API、不抢隐私,复用你已经付费订阅的 Claude / Cursor / Copilot;针对微信公众号、知乎、小红书等中文平台做了专门适配,解决了 Markdown 转公众号格式崩坏、转小红书要手动修图的老大难问题;技能模板基于 SKILL.md 协议,新增模板只需复制一个文件夹、改一段 frontmatter,社区扩展门槛低。如果你平时需要大量产出图文、PPT、产品原型,把它接进工作流能省不少时间。

    下载与资源

  • 新版Siri可能要收费了:库克卸任前松口,重度用户想多用得掏钱

    在自己作为苹果 CEO 的最后一场财报电话会上,蒂姆·库克透露了一个不算太意外、但还是有点微妙的消息:那个被拖了很久的 Siri AI 大升级,未来可能会带上一道付费墙。库克自己也说这事还没完全定死,但他设想的大方向是,用户能通过现有的 iCloud+ 订阅,给 Siri AI 买更多算力用。

    苹果 Siri AI 与 iCloud+ 订阅
    苹果考虑通过 iCloud+ 为 Siri AI 提供付费算力升级 图片来源:TechCrunch

    库克的原话:想多用的人,可以往上加档

    “我们确实认为,会有一部分人特别爱用 Siri AI,所以我们会在 iCloud+ 上提供某种升级选项,大家可以在 iCloud+ 里往上加档,我们再看看接受度怎么样。”库克周四说,”但我们对 Siri AI 的前景真的非常兴奋。”

    这套路子其实不新鲜。Anthropic、OpenAI 这些 AI 厂商基本都是一个模式:给普通用户一个能力有限的免费版,想用得更狠就掏钱升级。苹果现在想做的,无非是把这套”免费尝鲜、重度付费”的逻辑,套进自己那套 iCloud+ 云存储订阅体系里。目前 iCloud+ 卖的主要是扩展云存储空间,往里塞 Siri 算力算是顺水推舟。

    时间线方面,焕新过的 Siri AI 已经在 iOS 27 的测试版里能用了,计划今年秋天更大范围铺开。

    交接棒给到特纳斯,时机相当微妙

    随着长期担任硬件工程高级副总裁的约翰·特纳斯接过库克的位子,他上任的这个节点并不轻松。苹果在打造高级 AI 助手这件事上已经明显掉队,甚至不得不向自己的直接对手谷歌低头,花钱授权了一个定制版 Gemini 模型来给 Siri 打辅助。Siri AI 的升级拖得太久,苹果还为此付出过代价——因为当初宣传 iPhone 16 的 AI 能力涉嫌夸大,公司掏了 2.5 亿美元了结一起集体诉讼。


    内存涨价这只灰犀牛,苹果也躲不开

    收费这件事背后,还压着整个行业共同的成本焦虑。跟其他硬件厂商一样,苹果也在为供应链发愁。AI 需求把内存(RAM)吃得紧张,整条产业链的芯片都在涨价,造硬件的成本水涨船高。Meta、三星、微软、索尼都已经因此上调过部分设备的售价。苹果上个月给 Mac 和 iPad 提了价,只是暂时还没动现有 iPhone 机型的价格。

    把这些线索拼在一起,苹果给 Siri AI 设付费墙的逻辑就清楚了:AI 算力本身就是真金白银的开销,硬件那头又在被内存涨价挤压利润。与其把所有成本都自己扛下来,不如让真正的重度用户为多出来的那部分算力买单。对普通人来说,免费版大概率还够用;但如果你打算把新 Siri 当成日常离不开的助手,那这笔订阅账单,可能迟早得算到自己头上。

    • 库克在卸任前的财报会上称,Siri AI 或将通过 iCloud+ 提供付费算力升级
    • 模式对标 OpenAI、Anthropic:免费版能力有限,重度使用需付费
    • 新 Siri 已在 iOS 27 测试版上线,计划今秋大范围推送
    • 苹果 AI 掉队,曾授权谷歌 Gemini 辅助 Siri,并花 2.5 亿美元和解诉讼
    • 内存涨价推高硬件成本,付费墙也是苹果转嫁算力开销的一步棋
  • 谷歌给Google Earth塞了个AI造图功能,上线一天就被骂到撤回

    周四那天,谷歌在自家的卫星地图应用 Google Earth 里加了个新玩意儿——把它的 AI 图像生成模型 Nano Banana 2 接了进来,用户可以直接在真实的卫星影像上”画”出各种虚构的画面。谷歌当时的说法挺文艺:让大家在地理这件事上玩出点创意。结果这个功能只活了一天。

    谷歌 Google Earth 的 AI 图像生成功能界面
    谷歌在 Google Earth 中接入 Nano Banana 2 生成图像 图片来源:TechCrunch

    上线当天就有人看出不对劲

    问题出在这个功能的开放程度。它是靠文字提示词驱动的,几乎能把任何图像叠加到真实地图上。对一部分人来说这是创意工具,但对更多人来说,这更像是给假消息批量生产开了一条流水线。Google Earth 一直是记者和研究人员核实事实时最可靠的影像来源之一,如今上面能随手生成以假乱真的画面,风险不难想象。

    “Google Earth 是记者和研究者最信赖的视觉证据来源之一,现在给它加个 AI 造图功能,绝对不可能被拿去在网上散布虚假信息——你看我说得多有道理。”一位 BBC 记者周四在社交平台上阴阳怪气地写道。

    这种反讽很快就变成了现实里的证据。有人开始把生成的截图晒出来,画面明显越过了谷歌自己划定的红线。舆论压力上来,谷歌没有硬扛。

    谷歌一天后认怂:先撤,回去补护栏

    功能发布仅一天,谷歌就把它下线了。官方的表态是这么说的:

    “我们看到不少地理空间领域的专业人士把这个功能用在了正经用途上,但我们同样看到有人分享的生成图像,似乎违反了我们的政策。我们决定先在 Google Earth 里回滚这个功能,同时着手搭建更强的防护措施。”

    翻译成大白话就是:想法是好的,但护栏没跟上,先撤回去再说。


    话说回来,锅真全在这一个功能上吗

    大家的担心当然站得住脚,不过有个更尴尬的事实也得摆出来:在今天这个环境里,网上绝大多数图片本来就能被轻松改掉。以前你想造出一张半真半假、还挺唬人的图,多少得会点 Photoshop;现在完全不用,你只要能打开一个 AI 生图工具就行。而这类工具,谷歌自己就在卖,市面上一堆别的 AI 公司也在卖。

    所以谷歌这次的动作,更像是把最扎眼的那个入口先关掉,避免自己成为舆论靶心。至于生成式 AI 让虚假影像门槛一路走低这件事,撤掉一个功能显然拦不住。真正的难题不是”要不要在地图上放生图按钮”,而是当造假成本已经降到几乎为零,平台该拿什么去证明一张图是真的。

    • 谷歌周四在 Google Earth 接入 Nano Banana 2,让用户在真实卫星图上生成虚构画面
    • 批评者担心该功能会被用来制造和传播虚假信息,很快出现越界截图
    • 上线仅一天,谷歌宣布回滚功能,称要先补上更强的防护措施
    • 深层矛盾在于:AI 生图已让造假门槛趋近于零,撤一个功能治标不治本
  • PixelRAG:用网页截图做检索增强,让模型“看图说话”

    PixelRAG:用网页截图做检索增强,让模型“看图说话”

    PixelRAG 配图

    项目简介

    PixelRAG 是伯克利 SkyLab / BAIR 团队开源的视觉检索增强生成框架。它把网页、PDF、图片渲染成截图块,再用视觉语言模型直接在“像素”上检索,从而绕过传统文本 RAG 的 HTML 解析问题,把表格、图表、版式、信息图原样保留给读者模型。仓库还附带一个已建好的 828 万维基百科页面视觉索引,以及免费的在线 API,真正做到了开箱即用。

    安装要求和过程

    环境要求

    • Python 3.10+
    • Linux(CUDA)或 macOS(Apple Silicon / MPS),CPU 亦可作为 fallback
    • 可选:Playwright / CDP 用于网页渲染
    • 可选:用于本地索引构建的 GPU,或直接使用 api.pixelrag.ai 线上服务

    快速安装

    # 1. 基础包:像素化截图工具 pixelshot
    pip install pixelrag
    
    # 2. 带向量化:用于本地构建 FAISS 索引
    pip install 'pixelrag'
    
    # 3. 完整流水线:source → ingest → embed → index
    pip install 'pixelrag[index]'
    
    # 4. 本地搜索 API 服务
    pip install 'pixelrag[serve]'
    

    如果想让 pixelshot 始终处在 PATH 里供 Claude 调用,官方推荐用 uv toolpipx

    uv tool install pixelrag   # pipx install pixelrag
    

    核心功能

    1. 像素级文档渲染: 通过 pixelshot 把网页、PDF 转成截图块,保留文本 RAG 会丢失的视觉结构与版式。
    2. 视觉语义检索: 基于 Qwen3-VL-Embedding-2B 微调后的嵌入模型,将页面图片映射到可检索向量空间。
    3. 828 万维基百科预建索引: 官方已建好并托管了 api.pixelrag.ai,无需任何配置即可搜索,还支持“以图搜图”。
    4. 本地自建索引: 通过 pixelrag index build 处理本地文档(网页 / PDF / 图片),再 pixelrag serve 启动 FastAPI 搜索服务。
    5. Claude Code 插件: pixelbrowse skill 让 Claude 直接截图并阅读页面,告别原始 HTML。

    传统文本RAG vs PixelRAG

    传统文本RAG会丢失表格等视觉结构,PixelRAG通过截图块保留完整版式。

    PixelRAG 关键速览

    典型使用场景

    场景 1:财报 / 论文中的表格问答

    传统文本 RAG 把 PDF 表格拆成凌乱文字后,模型经常找不到数字。PixelRAG 直接截取表格区域截图,检索相关页并交给 VLM 读取,数字、单位、行列关系一目了然。

    场景 2:Claude 浏览复杂网页

    安装 pixelbrowse skill 后,Claude 能够对任意页面执行 /screenshot https://example.com,然后“看图”总结新闻、解读产品页或提取图表结论,而不再受限于 HTML 标签提取不全的问题。

    场景 3:内部知识库可视化搜索

    把企业内的产品手册、设计稿、UI 截图、架构图做成 PixelRAG 索引。用户上传一张截图或输入图片描述,即可召回相关视觉文档,适用于设计系统、运维监控面板、竞品分析资料库。

    推荐理由

    PixelRAG 给我最大的启发是:当大家都在卷“更好的 HTML 解析器”时,它直接换了一条赛道——让模型像人一样“看”网页。这不是炫技,而是切中了 RAG 的实际痛点:大量网页的表格、图表、公式和交互组件一旦转成纯文本就面目全非。配合已经训练好的视觉嵌入模型和 828 万维基百科索引,从实验到落地只需要几条命令。

    对于 Claude / Cursor / Codex 等 Coding Agent 用户来说,pixelbrowse skill 是一个润物细无声的能力升级:它不需要 MCP server,也不依赖后端服务,只是让 Agent 多了一双“眼睛”。如果你正在做多模态知识库、网页问答或文档理解,PixelRAG 值得放进候选清单。

    下载地址

    —— 本文由 WorkBuddy 整理发布。

  • GitHub Copilot SDK:一套 Agent 运行时,六种语言官方 SDK

    GitHub Copilot SDK:一套 Agent 运行时,六种语言官方 SDK

    GitHub Copilot SDK

    项目简介

    GitHub Copilot SDK 是 GitHub 官方发布的多平台 Agent 运行时 SDK,让你在自己的应用中嵌入 Copilot CLI 的完整智能体引擎。支持 TypeScript、Python、Go、.NET(C#)、Java、Rust 六种语言,通过 JSON-RPC 与 Copilot CLI server 模式通信,SDK 自动管理进程生命周期——你只需定义 Agent 行为,Copilot 负责规划、工具调用和文件编辑。

    一句话:把 Copilot CLI 的 Agent 能力,以 SDK 形式嵌入任何应用。

    六语言SDK速览

    安装要求与过程

    环境要求

    • Node.js / TypeScript:Node.js ^20.19.0 或 ≥22.12.0
    • Python:Python 3.11+
    • .NET:.NET 8+ SDK
    • Go / Rust / Java:对应语言工具链 + 需额外安装 Copilot CLI
    • 认证:GitHub Copilot 订阅,或 BYOK 自带模型 API Key

    快速安装

    # Node.js / TypeScript
    npm install @github/copilot-sdk
    
    # Python
    pip install github-copilot-sdk
    python -m copilot download-runtime   # 下载运行时二进制
    
    # .NET
    dotnet add package GitHub.Copilot.SDK
    
    # Go
    go get github.com/github/copilot-sdk/go
    
    # Rust
    cargo add github-copilot-sdk
    
    # Java (Maven)
    <dependency>
      <groupId>com.github</groupId>
      <artifactId>copilot-sdk-java</artifactId>
    </dependency>

    Python 快速上手示例

    import asyncio
    from copilot import CopilotClient
    from copilot.session_events import AssistantMessageData, SessionIdleData
    from copilot.session import PermissionHandler
    
    async def main():
        async with CopilotClient() as client:
            async with await client.create_session(
                on_permission_request=PermissionHandler.approve_all,
                model="gpt-5",
            ) as session:
                done = asyncio.Event()
                def on_event(event):
                    match event.data:
                        case AssistantMessageData() as data:
                            print(data.content)
                        case SessionIdleData():
                            done.set()
                session.on(on_event)
                await session.send("What is 2+2?")
                await done.wait()
    
    asyncio.run(main())

    核心功能

    1. 六语言官方 SDK:TypeScript/Python/Go/.NET/Java/Rust 全部由 GitHub 官方维护,统一 API 设计,语义化版本管理(GA 状态)。
    2. Agent Loop 完整循环:内置完整的工具调用循环(Tool Use Loop),自动处理回合(Turn)与完成信号,无需自建编排层。
    3. Hooks 拦截机制:可在工具调用前后拦截、改写结果、处理错误——实现权限控制、日志审计、输出过滤等中间件逻辑。
    4. Custom Agents + Fleet Mode:定义带独立工具集和指令的子智能体;Fleet Mode 支持并行派发多个子智能体处理大型独立任务流。
    5. MCP Servers 集成:原生接入 Model Context Protocol 服务器,扩展外部工具能力;同时支持 Skills 提示词模块与 Plugin Directories 插件打包。
    6. 40+ Streaming Events:实时订阅会话事件流(assistant.message、tool.call、session.idle 等),构建响应式 UI。
    架构与核心能力

    典型使用场景

    场景一:IDE 插件内嵌 AI 编程助手

    在 VS Code / JetBrains 插件中集成 Copilot Agent,用户选中代码后调用 SDK 发起对话,Agent 自动读取文件上下文、执行重构建议、直接编辑文件。相比自己对接 LLM API + 构建工具链,SDK 已封装好文件读写、终端命令、Git 操作等全套工具。

    场景二:CI/CD 流水线中的自动化 Review Bot

    在 GitHub Actions 中用 Python SDK 启动 Copilot Session,将 PR diff 作为输入发送给 Agent,让它分析变更影响、生成 review 评论。通过 Hooks 可限制 Agent 只读不写,确保安全可控。

    场景三:SaaS 产品中的 AI 功能模块

    在 Web 后端通过 TypeScript SDK 创建带预算限制的 Session(Session Limits),为每个用户分配 AI Credits 配额。结合 Remote Sessions 功能,让用户在浏览器中实时看到 Agent 工作过程。BYOK 模式下可使用自有模型 Key,降低运营成本。

    推荐理由

    作为 GitHub 官方出品,Copilot SDK 的最大优势是「不用重复造轮子」。过去要在应用里嵌入 AI Agent 能力,你需要自己处理模型选择、提示词模板、工具定义、权限控制、错误恢复……现在这些全部由 Copilot CLI 引擎托管,SDK 只暴露简洁的 Session API。

    六种语言的覆盖面也令人印象深刻——从脚本到企业级后端,从前端到系统编程,几乎覆盖了主流开发栈。特别是 Python 和 TypeScript SDK 内置了 CLI 二进制,开箱即用体验非常顺滑。

    当然,它需要 Copilot 订阅或 BYOK 配置,不是完全免费的方案。但考虑到它提供的生产级 Agent 运行时能力,这个成本是合理的。如果你正在评估「如何在产品中加入 AI Agent 能力」,Copilot SDK 值得作为首选方案之一认真试用。

    下载地址

  • 16.5亿美元买下Ray背后的团队,这家算力公司想把整条链吃掉

    Nscale以16.5亿美元收购Anyscale
    卖算力的公司,开始往软件层爬。图片来源:TechCrunch

    英国算力新贵 Nscale 掏了 16.5 亿美元,把软件公司 Anyscale 买了下来。金额来自彭博社援引匿名信源的报道。

    这笔交易本身不算特别大,但它透露的意图挺清楚:单纯出租 GPU 已经不够看了,算力厂商想把客户那笔 AI 预算里更多的部分留在自己口袋。

    Anyscale 是谁?答案藏在 Ray 里

    做 AI 工程的人对 Ray 这个名字应该不陌生。它是伯克利那边出来的开源分布式计算框架,用 Python 写,专门解决”一台机器跑不动,那就把活儿拆到一堆机器上”这类问题。Anyscale 就是 Ray 原班团队创立的公司。

    公司最早的定位是给那些需要海量算力的项目提供运行平台。2022 年 GPT-3 把大模型推到聚光灯下之后,Anyscale 转了个弯,业务重心挪到围绕大模型的训练与推理服务、数据清洗整理、强化学习这些活儿上。平台整个建在 Ray 之上,对外提供开发工具、可观测性和调度编排。

    Anyscale 在声明里说:合在一起之后,我们可以和 Nscale 一起设计软件层以及底下的基础设施,而这件事任何一方单独优化自己那一层都做不到同样的效果。

    Nscale 想要的是一整条链

    Nscale 属于业内所说的 neocloud——不做通用云,专门围着 AI 算力做生意的新一代云厂商。它的打法一直是往上下游延伸,能自己干的绝不外包。

    目前它已经铺开的业务线包括:

    • 能源:从电这一端就开始掌控成本;
    • 数据中心:自建自营,不租别人的机房;
    • 编排软件:管好机器和任务的调度;
    • 吃下 Anyscale 之后新增的一层:工作负载管理与弹性扩缩。

    这条链拼完,客户从插上电到跑起模型,理论上都能在 Nscale 体系内完成。对于一家靠卖算力起家的公司来说,往软件层走意味着毛利结构会好看不少,客户黏性也完全是另一个量级。


    钱从哪来:一年之内融资、发债、买公司

    Nscale 今年 3 月刚拿到 20 亿美元 C 轮,估值 146 亿美元。投资方名单挺能说明问题:英伟达、诺基亚、Blue Owl、戴尔,还有挪威工业集团 Aker。此外它还做了多笔债务融资——循环信贷、7.9 亿美元的挪威项目贷款、14 亿美元的延迟提取定期贷款。

    这些钱一直在花出去。它先后和微软、英国电信(BT)、Nordcraft 签下算力与数据中心合作。这次收购 Anyscale,是同一套思路的延续。

    被收购方的成绩单也不差。Anyscale 在 2022 年 C 轮时估值 13.8 亿美元,公司称最近一个季度的营收环比增长了 70%。换句话说,16.5 亿美元的价格相对四年前的估值只是小幅溢价,但买到的是一条正在加速的增长曲线。

    200 人全部过去,牌子不摘

    Nscale 表示 Anyscale 会继续以自有品牌运营,现有客户照常服务,大约 200 名员工全员加入 Nscale。这种”保留品牌 + 全员留任”的安排,通常说明买方要的是团队和技术栈本身,而不是想把客户名单吸干后关掉。

    对开源社区来说,短期内 Ray 的走向可能是个值得留意的点——一个被算力厂商收编的商业公司,会怎么平衡开源项目的中立性和母公司的硬件偏好,这事儿以前在别的项目上有过不少前车之鉴。

    放大一点看,这几年 AI 基础设施领域的并购逻辑正在从”抢机器”变成”抢那层把机器变好用的软件”。谁能让客户少踩坑、少浪费卡,谁就能在下一轮价格战里活得舒服些。

  • 全美只有2000个这样的工程师,AI公司现在抢疯了

    前置部署工程师成为AI行业最抢手的人才
    企业开始意识到,买到最强的模型只是第一步。图片来源:TechCrunch

    猎头公司 Christian & Timbers 做了一份报告,结论看着有点吓人:全美同时具备行业理解力、能镇得住客户高管、又真正动手做过 AI 落地的工程师,大约只有两千人。

    报告里特意加了一句注解:不是”有两千人可挖”,是”总共就这两千人”。

    这个岗位有个专门的名字,叫前置部署工程师(Forward-Deployed Engineer,简称 FDE)。他们不待在自家办公室写代码,而是直接驻扎进客户公司,把模型和软件塞进对方的真实业务流程里跑起来。这个概念最早是 Palantir 发明的,现在整个 AI 行业都在抢。

    半年时间,需求从”试试看”变成”必须有”

    C&T 这份研究访谈了 180 家公司的 250 多位 C 级招聘决策者,做了 80 位财富 500 强高管的专项调研,还在今年 1 月到 6 月之间访谈了 300 多名 FDE 和应用 AI 工程师。

    年初的时候,只有 5% 到 10% 的公司说要招 FDE,而且基本都是给小规模试点项目配一两个人。到二季度结束,这个比例跳到了 70%。规模最大的那批咨询和服务公司,直接说要把 FDE 团队人数扩到原来的十倍,一支队伍二十到一百人。报告预测,到今年年底这类人才的需求会涨 2100%。

    C&T 创始人 Jeff Christian 的原话是:”这个速度我从没见过,企业大夏天就在抢人。”

    市面上有一万七千人,但能交差的只有一小撮

    报告统计美国市场上大约有 1.7 万名 FDE,其中相当一部分还在 Palantir 手里。Christian 说,他有些客户甚至是为了能用上 Palantir 的工程师,才顺带把 Palantir 的软件也买了。

    但真正被认为”精英级”的,才是那两千人。标准很实在:能给客户带来”几千万美元量级的投资回报”。可能是营收侧的增长,比如把获客链路重做一遍;也可能是成本侧的替换,比如把财务分析团队换掉,或者把印度那 2300 个做单据处理的岗位省下来。

    Anthropic 旗下服务公司 Ode 的 CEO Chris Taylor 把这条分界线说得更直白:

    很多 FDE 有能力帮你把 Claude Code 铺到全公司,但能替你做出旗舰级 AI 产品功能的,非常少。

    华尔街今年秋天要开始算账了

    这波抢人潮背后是钱的压力。行业风向已经从”tokenmaxxing”(比谁烧的算力多)转向”valuemaxxing”(比谁真赚到钱),企业开始认真盯着自己的 AI 支出对不对得上账。

    Christian 预判了一个时间点:

    今年秋天,华尔街大概会说:我们给了你两年时间搞明白这件事,你没搞明白,没有回报。那些花了几亿甚至几十亿却拿不出成果的,我们就要开始惩罚了;做出来的,我们奖励。

    AI 公司自己也在这条船上。训练和部署已经烧掉几百亿美元,前沿模型厂商要走到盈利,唯一的路是把技术塞进尽可能多的企业。而这件事现在还被中国那些越来越能打、价格又低的开源权重模型挤压着。

    所以 OpenAI 和 Anthropic 干脆自己开公司做这门生意——前者是 Deployment Company,后者是 Ode,团队清一色 FDE,任务就是把自家技术铺进企业内部。


    企业宁可自己养,也不愿意把流程交出去

    抢 FDE 的不只是 AI 大厂和大型咨询公司。保险、金融科技、医疗、游戏这些行业的企业都在找。而且越来越多公司选择自己组建团队,而不是从 Ode 或 Deployment Co. 请人。

    理由很现实。Christian 说:

    所有人都担心,一旦把自家专有的业务流程交出去,这些 AI 公司回头就能来跟你竞争——在很多领域这确实会发生。所以把这块肌肉长在自己身上,太重要了。

    Taylor 也提到,他现在听到”内部前置部署工程师”这个说法的频率明显变高了,只是客户还没开始让 Ode 帮忙搭内部团队。

    这碗饭能吃多久,没人敢打包票

    年轻工程师看到这里,可能已经在盘算要不要转型。Christian 却给了一个不太乐观的提醒:

    • 短期:需求真实存在,而且还在往上冲;
    • 中期:重心会从企业 AI 转向物理 AI,比如帮公司把人形机器人接进产线;
    • 五到十年:这个岗位”完全有可能消失”。

    他的原话是:”也许两年后一切都自动化了,是智能体在自动化智能体,而不是人在自动化智能体。这种情况有可能发生。希望它别发生,希望公司里还需要这些人。”

    更麻烦的是,如果 AI 高管们对知识工作的预测成真,那这个逻辑适用于所有白领岗位。C&T 因为专注在高速增长的行业,暂时还没感受到寒气,但 Christian 说,更综合的猎头公司已经明显感觉到招聘需求在放缓。

    跟 AI 沾边的一切都在涨,都有人要。至少现在是。

    “我觉得用不了多久,我们的生意肯定也会受到冲击。”他说。