标签: 无障碍

  • Page Agent:阿里巴巴开源的“住在网页里的”GUI 智能体,一行脚本让网页自己动起来

    Page Agent:阿里巴巴开源的“住在网页里的”GUI 智能体,一行脚本让网页自己动起来

    Page Agent 项目横幅

    项目简介

    Page Agent 是阿里巴巴开源的一个运行在网页内部的 JavaScript GUI 智能体。只需一行脚本,就能让任意网页拥有自己的 AI 代理,用自然语言直接控制 Web 界面——点击按钮、填写表单、跳转页面,全部交给 AI 完成。项目当前已收获约 2.6 万 Star,采用 MIT 协议,主要使用 TypeScript 编写,运行时以纯前端 JavaScript 注入。

    “The GUI Agent Living in Your Webpage. One script gives any web page its own AI agent.”

    安装要求和过程

    环境要求

    • 任意支持 <script> 标签或 npm 的网页环境即可;
    • 无需浏览器扩展、Python 或无头浏览器,纯前端运行;
    • 如需自托管大模型,需一个可访问的模型 API(如通义千问 Qwen、本地模型等);
    • 使用 npm 安装 / 二次构建时需要 Node.js 环境。

    快速安装(三种方式)

    方式一:CDN 一行接入

    <script
        src="https://cdn.jsdelivr.net/npm/page-agent@1.12.1/dist/iife/page-agent.demo.js"
        crossorigin="anonymous"
    ></script>

    国内镜像:https://registry.npmmirror.com/page-agent/1.12.1/files/dist/iife/page-agent.demo.js

    方式二:NPM 安装

    npm install page-agent
    import { PageAgent } from 'page-agent'
    
    const agent = new PageAgent({
        model: 'qwen3.5-plus',
        baseURL: 'https://dashscope.aliyuncs.com/compatible-mode/v1',
        apiKey: 'YOUR_API_KEY',
        language: 'en-US',
    })
    
    await agent.execute('Click the login button')

    方式三:Chrome 扩展 —— 从 Chrome 网上应用店安装 Page Agent 扩展,用于跨多标签页的多页面任务。

    核心功能

    • 🎯 极简集成:纯页面内 JavaScript,不需要浏览器扩展、Python 或无头浏览器,几行代码即可嵌入。
    • 📖 基于文本的 DOM 操作:无需截图、不依赖多模态大模型或特殊权限,通过结构化 DOM 文本理解页面并执行操作。
    • 🧠 自带 LLM(BYO):支持绝大多数主流模型(含本地部署),模型选择完全自由。
    • 🐙 可选 Chrome 扩展:支持跨标签页的多页面任务编排。
    • 🔌 MCP Server(Beta):允许外部 Agent 客户端(如 Claude Code / Cursor)从外部控制你的浏览器。

    典型使用场景

    • SaaS AI Copilot:几行代码为自家产品嵌入 AI 助手,无需重写后端,立刻获得“对话式操作界面”能力。
    • 智能表单填充:把原本需要 20 步点击的流程压缩成一句话,特别适合 ERP / CRM / 后台管理系统等高频重复操作。
    • 无障碍访问:通过自然语言让任何 Web 应用变得可操作,配合语音 / 读屏为行动不便的用户打开大门。
    • 多页面自动化 / MCP 控制:借助 Chrome 扩展或 MCP Server,让 AI 跨页面完成复杂工作流(如比价、数据搬运)。

    推荐理由

    我第一次看到 Page Agent 时最直接的感受是:它把“浏览器自动化”这件事做得太轻了。传统方案(如 Playwright / Puppeteer 脚本、或无头浏览器方案)要么要写一堆选择器、要么要吃截图走多模态,门槛和成本都不低。Page Agent 反其道而行——它就活在页面里,用文本化的 DOM 理解来“读懂”界面,再用自然语言驱动操作,心智负担几乎为零。

    对前端 / 产品同学尤其友好:你想给后台加个“AI 帮我导这份报表”的入口,挂一段脚本就行,不用动架构。再加上它支持 BYO 模型、可接本地大模型,数据不出内网也能玩。如果你正琢磨怎么给产品接一个“会自己点页面”的 AI,Page Agent 是目前最省心、最贴近生产的选择之一。

    下载地址

  • Meta给13万失明退伍军人送AI眼镜,这事比它看起来更有分量

    Meta本周宣布,将向美国超过13万名失明退伍军人免费捐赠AI智能眼镜,同时提供配套的操作培训。这个项目是通过美国失明退伍军人协会(Blinded Veterans Association)和TechSoup平台落地的,覆盖的产品主要是Ray-Ban Meta智能眼镜。

    Meta AI眼镜捐赠给失明退伍军人
    Ray-Ban Meta智能眼镜已成为视障人士的重要辅助工具 | 来源:The Verge

    为什么是AI眼镜

    Ray-Ban Meta眼镜除了拍照片和录视频,核心能力其实是”看见并描述”——眼镜上的摄像头捕捉画面,AI实时告诉你眼前是什么。对视力正常的人来说这是个”锦上添花”的功能,对失明人士来说,这是一根”数字拐杖”。

    它可以帮你识别面前的障碍物、读出菜单上的字、描述迎面走来的人穿了什么颜色的衣服。这些事情以前需要专门的助视设备才能做,现在一副看起来跟普通墨镜差不多的眼镜就能搞定。

    Meta在官方新闻稿里用了”The Future Is for Everyone”作为标题。这句话听起来像营销口号,但对收到眼镜的退伍军人来说,可能不是。

    不只是捐东西

    这次捐赠的特别之处,在于Meta不光是”把眼镜寄过去”就完事了。他们和合作伙伴会为每位拿到眼镜的退伍军人提供实际操作培训——怎么唤醒AI助手、怎么让它描述周围环境、怎么用它来读取文字。

    申请渠道也已经搭建好了:退伍军人可以通过美国失明退伍军人协会的专门页面或者TechSoup的专属申请页面提交申请。这个流程设计得比较完整,不是一次性的公关活动。

    科技公司做公益的算盘

    当然,这事也不是纯粹做慈善。Meta的AI眼镜目前年销量已经在百万级别,但要让更多人接受”把摄像头架在脸上”这件事,最需要的是使用场景的说服力。视障人士辅助这个角度,既正当,又容易引发共鸣。

    而且,这笔捐赠的规模——13万副眼镜——如果按每副眼镜300美元左右的零售价计算,总价值接近4000万美元。这个数字足够上新闻,也足够让”Meta AI眼镜=助残科技”这个印象被更多人记住。

    比起单纯打广告,这种”捐赠+培训+媒体报道”的组合拳,对品牌形象的加成可能更持久。


    AI辅助设备的市场才刚起步

    把视角拉远一点,这件事其实透露出一个更大的趋势:AI可穿戴设备正在从”科技玩具”向”辅助设备”转型。苹果的自适应音频、谷歌的Live Translate、Meta的视觉描述,这些功能的第一个大规模应用场景,可能都不是给普通人提供”便利”,而是给有特殊需求的人提供”可能”。

    13万失明退伍军人是一个开始。如果这个项目跑通了,接下来类似的捐赠可能会扩展到其他视障群体、听障群体,甚至行动不便的老年人。到那时候,AI眼镜的市场逻辑就彻底变了——它卖的不再是一个”有趣的小玩意”,而是一个真正有用的工具。