标签: Google

  • 你用Google搜索,也在帮它训练AI——好消息是你可以退出

    你每次用Google搜索,用Google Lens拍张照片识别,或者用语音搜索问个问题,这些操作产生的内容,可能正在帮Google训练它的AI模型。

    大多数人不知道这件事,因为Google没有大张旗鼓地通知你。它在2026年6月悄悄更新了隐私设置,把”Search Services History”和”Personalized Recommendations”两个选项默认打开了。其中包括一个叫”Save Media”的子选项——你的图片、音频、视频录音,现在都可能被用来改进Google的AI模型。

    Google AI隐私设置
    Google的隐私设置更新后,用户媒体数据可能被用于AI训练(插图)

    不只是搜索历史,连你的照片和语音也不放过

    这次更新的影响范围比很多人想象的广。它不只涉及Google Search,还包括Google Maps、Shopping、Flights、Hotels、Translate、News——基本上所有带搜索功能的Google服务都在内。

    具体场景是这样的:你用Google Lens拍了一张花的照片识别品种,这张照片可能被保存下来用于AI训练;你用Google app里的Search Live功能语音提问,那段录音也可能被保存;你用Google Translate练习口语,录音同样会被留存。Google在自己的帮助文档里写得很直白:“我们用你的历史记录来开发和改进服务(比如训练生成式AI模型)。”

    Google在给客户的邮件里直接承认:”像你的搜索服务历史记录一样,你保存的媒体也被用于开发和改进Google服务及技术,包括AI模型和安全措施。”

    不是只有Google在这么做

    把用户数据拿来训练AI,Google不是独一家。Meta也在大规模做同样的事——用用户上传到Facebook和Instagram的图片训练AI,甚至想访问用户手机相册里还没发出的照片。Ray-Ban Meta智能眼镜录制的音视频,同样也可能被用于AI训练。

    这背后是整个行业的变化。以前AI公司主要靠抓取公开网页来训练模型,现在这条路的数据差不多用完了,它们开始从自己服务的用户身上找”燃料”。你用它们的产品,产生数据,它们用这些数据让AI变得更聪明,然后卖更好的AI服务——这个循环正在成为AI时代的标准商业模式。

    怎么退出?

    好消息是,Google给了用户选择权,只是没怎么宣传。你可以去这两个页面调整设置:

    还有一点值得注意:这次更新把原来的”Web & App Activity”拆分成了两个设置——原来的Web & App Activity,和新的Search data。也就是说,即使你之前关闭了Web & App Activity的数据存储,Search data那边可能还是开着的,需要单独检查。


    这次隐私设置的更改,再次提醒了一个事实:用免费服务,代价是你的数据。AI时代这个交换变得更加直接——你产生的内容,正在成为别人训练AI的养料。如果你在意这件事,现在就去检查一下自己的Google账号设置。

  • Google拍了一支AI写独立宣言的广告,网友:这就有点尴尬了

    谷歌刚拍了一支国庆日广告,脑洞开得有点大——假如1776年的开国元勋们有Google Workspace,他们会不会用AI来写《独立宣言》?

    Google AI广告概念图
    Google想象中的”1776年小组作业”

    这支广告的标语是”小组作业,1776版本”。画面里托马斯·杰斐逊正在起草文稿,突然收到本·富兰克林发来的催稿短信,然后一整套Google式协作流程就展开了:用Google Docs改稿、用Google Calendar约会议、用Google Meet远程开会(与会者全部关闭了摄像头),最后用电子签名定稿。烟花绽放下,一切显得那么”现代”。

    毕竟是2026年的科技公司广告,AI当然要露个面。广告里的”建国者们”用Google的”帮我可视化”工具给国玺设计动物图案,让Gemini做会议记录,还在拒绝英王乔治三世的文件访问请求之前,先问了聊天机器人一波建议。

    整体调性算是半开玩笑的那种——山姆·亚当斯甚至冒出一句”咱们边喝啤酒边把这事解决了行不行?”。跟今年超级碗期间那一堆AI广告比起来,这支广告的AI evangelism还算克制。

    网友买账吗?

    YouTube和Instagram上的评论大致是正向的,但Bluesky上的反应就完全是另一个故事了。网友们的评价包括”尴尬癌犯了”、”令人震惊的 tone deaf”,其中最集中的火力还是对准了AI这个角度。

    历史学家Angus Johnston在Bluesky上发帖指出,这支广告”惊人地几乎没有真正用到AI”——换句话说,连AI都没怎么用,却已经被骂了一轮。他的结论是:”哪怕在一个搞笑的奇幻玩笑里,你也没法让人信服AI是政治组织、写作或人类协作的有用工具。”


    说起来,这跟2024年那支Gemini广告如出一辙——那支广告里,一个父亲用Gemini帮女儿写粉丝信,播出后遭遇了大规模吐槽。谷歌好像还没完全学会怎么让AI广告不让人觉得别扭。

  • agents-cli:Google 官方 AI Agent 构建 CLI,让编程助手变身 Google Cloud 专家(4,723 Stars)

    agents-cli:Google 官方 AI Agent 构建 CLI,让编程助手变身 Google Cloud 专家(4,723 Stars)

    G

    agents-cli:Google 官方 AI Agent 构建 CLI

    让任何编程助手都成为 Google Cloud AI Agent 专家

    📌 项目简介

    agents-cli 是 Google 官方出品的 CLI 工具与技能包,将任意编程助手(Claude Code、Codex、Antigravity CLI 等)转化为 Google Cloud 上构建、评估、部署企业级 AI Agent 的专家。2026年4月刚发布,已在 AI 开发者社区引起广泛关注。

    4,723
    GitHub Stars

    506
    Forks

    Python
    主要语言

    Apache 2.0
    开源许可

    ⚙️ 安装要求与过程

    环境要求

    • Python 3.11+ (推荐 3.11 或 3.12)
    • uv (Python 包管理器,类似 pip 但更快)
    • Node.js (用于 npx skills add 方式安装)
    • Google Cloud 账号(如需部署到 Google Cloud)

    快速安装(推荐方式)

    # 一键安装 CLI + 技能包到编程助手
    uvx google-agents-cli setup
    
    # 或者只安装技能包(让编程助手自己处理)
    npx skills add google/agents-cli

    验证安装

    # 查看已安装的技能
    agents-cli --help
    
    # 创建新 Agent 项目
    agents-cli scaffold my-agent

    🚀 核心功能

    ① 全栈 Agent 开发工作流

    从项目脚手架创建、代码编写、评估测试到云端部署,agents-cli 提供完整的 Agent 开发生命周期支持。无需手动学习每款 CLI 和云服务,编程助手通过技能包自动掌握最佳实践。

    ② 七大专业技能包

    内置 7 个精心设计的技能包,覆盖 Agent 开发全流程:

    • google-agents-cli-workflow:开发周期、代码保留规则、模型选择
    • google-agents-cli-adk-code:ADK Python API(Agent、Tools、编排、回调、状态)
    • google-agents-cli-scaffold:项目脚手架(create、enhance、upgrade)
    • google-agents-cli-eval:评估方法论(指标、数据集、LLM-as-judge、自适应评分)
    • google-agents-cli-deploy:部署(Agent Runtime、Cloud Run、GKE、CI/CD、密钥管理)
    • google-agents-cli-publish:Gemini Enterprise 注册
    • google-agents-cli-observability:可观测性(Cloud Trace、日志、第三方集成)

    ③ 多编程助手无缝集成

    原生支持 Antigravity CLI、Claude Code、Codex 以及其他遵循 MCP 协议的编程助手。安装后,编程助手自动获得 Google Cloud AI Agent 开发能力,无需额外配置。

    ④ 企业级部署与治理

    支持部署到 Google Cloud 多种运行环境:Agent Runtime(专用 Agent 托管平台)、Cloud Run(无服务器容器)、GKE(Kubernetes)。内置 CI/CD 集成、密钥管理和版本控制,满足企业级安全要求。

    ⑤ 内置评估与可观测性

    提供完整的 Agent 评估框架(数据集管理、自动评分、LLM-as-judge)和开箱即用的可观测性工具(Cloud Trace 分布式追踪、结构化日志、第三方 APM 集成),让 Agent 质量可度量、问题可定位。

    💡 典型使用场景

    场景一:快速构建客服 Agent 并部署到云端

    开发者在 Claude Code 中安装 agents-cli 技能包后,直接描述需求:”构建一个客服 Agent,接入公司知识库,支持订单查询和退换货处理,然后部署到 Cloud Run”。Claude Code 自动调用 agents-cli 技能,完成项目创建、代码生成、测试评估和云端部署全流程,全程无需手动操作 gcloud CLI。

    场景二:企业 Agent 性能评估与持续优化

    使用 agents-cli eval 生成评估数据集,对 Agent 进行自动化测试。通过 LLM-as-judge 自适应评分机制,全面评估 Agent 的回答质量、工具调用准确性、多轮对话连贯性。测试结果自动生成报告,指导后续优化方向。

    场景三:将开源 Agent 发布到 Gemini Enterprise 平台

    完成 Agent 开发后,使用 agents-cli publish gemini-enterprise 命令,一键将 Agent 注册到 Gemini Enterprise Agent Platform,让企业内其他团队可以发现、调用和组合你的 Agent,实现 Agent 能力的内部共享与治理。

    🌟 推荐理由

    agents-cli 的最大价值在于“技能转移”——它将 Google Cloud AI Agent 开发的最佳实践封装成技能包,让任何编程助手都能立即获得专家级 Agent 构建能力。对于已经在使用 Claude Code 或 Codex 的开发者,安装 agents-cli 相当于免费聘请了一位精通 Google Cloud 的 Agent 架构师。

    项目虽然刚发布不久(2026年4月),但作为 Google 官方出品,其架构设计和工程质量有充分保障。七大技能包覆盖了从开发到部署的完整生命周期,特别是评估(eval)和部署(deploy)技能,解决了 AI Agent 工程化落地的最大痛点。

    如果你正在使用 Google Cloud 或考虑将 Agent 部署到云端,agents-cli 是目前最完整、最官方的一站式解决方案。即使暂时不用 Google Cloud,其技能包中蕴含的 Agent 工程最佳实践也值得深入学习。

    📥 下载地址

    快速安装:uvx google-agents-cli setup
     | 
    仅安装技能:npx skills add google/agents-cli

    数据来源:GitHub API | 更新时间:2026-07-05 | 由 AI 自动整理

  • Gemini个性化图像生成向美国用户免费开放,7.5亿人都在用

    谷歌这周一(6月29日)悄悄改了一条规则:Gemini 的个性化图像生成功能,现在对所有符合条件的美国用户免费开放。在此之前,这套由 Nano Banana 驱动的工具只给付费订阅用户使用。

    这件事看起来只是一次”降费”,但背后有点意思。个性化图像生成的意思是,Gemini 会参考它对你的了解——比如你平时在 Gmail、Google Photos、YouTube、搜索里的痕迹——然后直接生成”像你的”图片。你不用在提示词里写”我喜欢咖啡和烘焙”,只要说”画一张我和我喜欢的东西在一起”,它就知道该画什么。

    Gemini个性化AI图像生成
    Gemini 个性化图像生成功能现已向美国用户免费开放

    “个人智能”铺了三个月,终于到免费这一步

    这套功能的正式名字叫”个人智能”(Personal Intelligence),谷歌今年3月就向全美用户推开了,但图像生成这块一直锁给付费用户。4月的时候,谷歌先把这套能力开放给了印度和日本市场,现在终于回到美国本土,把图像生成这层墙也拆了。

    用起来其实挺直接的。Gemini 可以从你的 Google Photos 里直接拉取你的照片,所以不用手动上传参考图,它知道你长什么样。当然,这一切的前提是你主动打开了”个人智能”开关——这是个需要手动开启的功能,不是默认打开的。打开之后,它会在每次对话里默认启用,但你随时可以在工具菜单里关掉。

    谷歌在公告里说,Gemini 月度活跃用户已经突破7.5亿。这个数字让它稳住了”ChatGPT 之外第二大 AI 聊天工具”的位置。

    不止是图像生成

    图像生成免费只是这次更新的一部分。上个月,谷歌还给 Gemini 应用塞了一堆新东西:一个叫”每日简报”(Daily Brief)的功能、重新设计的界面、AI 视频模型 Gemini Omni 的接入权限,还有一个叫 Gemini Spark 的个人 AI 代理。

    把这些动作连起来看,谷歌的思路其实很清楚:它想把 Gemini 从”一个可以聊天的 AI”变成”一个真正了解你、能主动帮你的 AI 助手”。个性化图像生成是这块拼图里很小的一块,但它是让用户”感受到”AI 了解自己的那种功能——比单纯聊天要直观得多。


    目前这个功能只向美国用户开放。谷歌没有说其他市场什么时候能跟上,但考虑到印度和日本已经在4月用上了”个人智能”的其他功能,估计不会等太久。

  • 谷歌一周丢了两位AI大牛,诺奖得主也去了Anthropic

    AI人才大战:谷歌顶级人才流向OpenAI和Anthropic
    AI人才大战:顶级研究者的流动方向,正在重塑整个行业的格局

    北京时间6月20日,一条消息在AI圈炸开了:AlphaFold核心领导者、2024年诺贝尔化学奖得主John Jumper正式宣布,结束在Google DeepMind近9年的职业生涯,加入AI初创公司Anthropic。两天前,Transformer架构八人核心成员之一的Noam Shazeer,也从谷歌离职加入了OpenAI。

    一周之内,谷歌丢了两位重量级AI大牛。而且这还不是第一次。

    Jumper的离开,DeepMind失去了什么

    Jumper这个人,在结构生物学和AI交叉的领域里,基本是天花板级别的存在。2017年博士毕业即加入DeepMind,入职半年就牵头AlphaFold项目,带着团队完成三代模型迭代,把困扰结构生物学数十年的蛋白质折叠难题给解了。

    2024年10月,他和DeepMind创始人Demis Hassabis一起站上诺贝尔化学奖的领奖台。近九年时间,AlphaFold数据库累计释放了超过2亿种蛋白质预测结构,向全球190个国家的200多万科研人员免费开放。

    Hassabis的回应很体面:”感谢John过去九年的非凡合作。”但业界都看得到,DeepMind失去了AI生物赛道最核心的技术领军者。有网友在Jumper的离职宣言下面问:为什么总是谷歌在失去最优秀的人?

    Shazeer出走,大模型底层架构的奠基人也走了

    跟Jumper前后脚离开的Noam Shazeer,分量一点不轻。2017年,他作为八人核心团队成员发布《Attention Is All You Need》,提出了Transformer架构——整个大语言模型时代底层的那块基石。

    2024年,谷歌花了27亿美元买下Character.AI的模型授权,把Shazeer重新纳入Google DeepMind,让他担任Gemini大模型联席技术负责人。结果只待了两年,又走了,这次去向是OpenAI,专职做底层架构的前沿探索。

    这两位先后出走,不是孤立事件。SignalFire的统计数据显示,DeepMind人才流向Anthropic和反向回流的比例,是10.8比1——人才流动是单向的,而且倾斜得很厉害。

    Anthropic加码AI+生物,路线碰撞开始了

    Jumper选择Anthropic,不是随便挑了一家初创公司。2025年,Anthropic推出了AI for Science程序,给高影响力的生物研究提供免费API额度,重点支持药物发现和遗传数据分析。同年还设立了医疗健康与生命科学独立部门,单独配预算、算力和招聘通道。

    2026年4月,Anthropic用大约4亿美元的全股票交易收购了Coefficient Bio,把它整合进”Claude for Life Sciences”。现在Jumper带着三代AlphaFold的全部技术经验和诺奖背书加入,Anthropic在AI生物计算这个方向上的押注已经非常明确了。

    • 此前Anthropic的核心聚焦在通用大模型Claude系列和AI对齐安全研究
    • Jumper的加盟意味着公司开始全面加码AI生物计算,这跟DeepMind的AlphaFold路线正面碰撞
    • AI+生物被普遍认为是继语言、视觉之后,AI最有可能产生颠覆性商业和社会价值的领域

    硅谷的人才流动像一场高频迭代的实验:大厂提供平台和资源,初创公司注入速度和愿景。Jumper和Shazeer的离职提醒整个行业,技术突破归根结底靠人,而留住顶尖人才,需要的不只是高薪。

    未来几年,跨学科人才、专有数据集和伦理治理,会成为AI公司之间最核心的竞争力。这场人才战争,可能比芯片战争更决定胜负。

  • 出版商想拦AI爬虫却不敢拦Google:这场猫鼠游戏越来越难玩了

    出版商想拦AI爬虫却不敢拦Google:这场猫鼠游戏越来越难玩了

    内容出版商和AI公司之间的张力,最近在法国戛纳的一个舞台上爆发了。People Inc.(前身Dotdash Meredith)的CEO Neil Vogel在Cannes Lions创意节上公开指责Google”滥用市场力量”——理由很简单,也很棘手:Google用同一个爬虫程序同时做搜索索引和AI训练数据采集,出版商根本没法单独屏蔽AI训练而不失去搜索流量。

    这不是一个小问题。People Inc.是美国最大的出版商之一,旗下有《People》、《InStyle》等知名刊物。Vogel在Axios的访谈中说得很直白:”我们实际上没法屏蔽Google,因为Google用同一个爬虫做搜索和AI,这是对市场力量的极度滥用。”

    “我们很想跟他们达成建设性的合作,但大概率会走向对抗,而不是合作。”—— Neil Vogel, People Inc. CEO

    搜索流量 vs AI训练:出版商的两难

    这件事的核心矛盾在于:搜索流量对出版商来说是流量变现的核心渠道,而AI训练需要抓取同样的内容。如果出版商想保护自己的内容不被用于AI训练,技术上可以屏蔽AI爬虫,但一旦屏蔽Google的爬虫,搜索排名就会受影响。

    出版商与Google AI爬虫
    内容出版商正在与Google就AI爬虫问题展开博弈

    其他AI公司就没这个问题。Vogel透露,People Inc.已经跟Meta、OpenAI和微软签署了AI内容授权协议。这些公司的爬虫是可以单独屏蔽或授权的。但Google不行——它的爬虫是”一鱼两吃”。

    Google的回应:你可以选择退出

    Google对Vogel的指责给出了回应:出版商可以通过”Google-Extended”来控制自己的内容是否被用于训练Gemini模型,而这不会影响搜索索引。

    但这个回应没解决根本问题。Vogel的抱怨是:出版商”不得不”让Google爬虫访问,因为搜索流量太重要了。

    Cloudflare的”许可模式”

    People Inc.是第一批加入Cloudflare”AI爬虫许可模式”的出版商之一。这个模式的思路是:默认屏蔽所有AI爬虫,只有付费授权的公司才能访问。Vogel说,这个模式上线后,”所有人立刻都急了”。

    Vogel说:”AI需要三样东西:模型、算力、输入——而出版商掌握着输入。稀缺性是关键。”


    📎 原文来源:The Verge | Axios
  • Google DeepMind一周跑了5个顶级研究员,Alphabet市值蒸发2700亿美元

    6月22日,Alphabet的股价一天之内跌了7%。这不是因为财报暴雷,也不是因为监管重锤,而是因为Google DeepMind在一个星期之内,有5位顶级研究员先后宣布离职。

    市值蒸发了大约2700亿美元。相当于跌掉了一个Netflix,或者两个Uber。

    走的都是什么人

    这份名单读起来像AI研究界的”名人录”:

    • John Jumper——2024年诺贝尔化学奖得主,AlphaFold项目的负责人。他领导的团队用AI预测了超过2亿个蛋白质结构,全球190个国家的200多万研究人员正在使用这套系统。
    • Noam Shazeer——Transformer架构的共同作者之一,这个架构几乎是每一个现代大语言模型的地基。他离开Google加入了OpenAI。
    • Jonas Adler——深耕AI编程领域,对Gemini有直接贡献,去向是Anthropic。
    • Alexander Pritzel——预训练专家,同样去了Anthropic。
    • Arthur Conmy——Gemini 2.5的核心贡献者之一,研究方向是AI安全的可解释性,也加入了Anthropic。
    Google DeepMind人才流失概念图
    Google DeepMind一周内5位顶级研究员离职,引发Alphabet市值暴跌

    为什么是现在

    这5个人在同一周宣布离职,不太可能是巧合。背后有几件事正在同时发生。

    第一件事是IPO窗口打开了。Anthropic在6月1日向SEC提交了保密的S-1文件,估值9650亿美元,历史上第一次超过了OpenAI。OpenAI一周之后也跟进提交了。对于顶级研究员来说,在IPO之前加入这两家公司,拿到的是不对称的下注机会——哪怕Google给的RSU再慷慨,也很难跟一家准上市公司的股权升值空间相比。

    根据创投机构SignalFire 2025年的分析,DeepMind的工程师加入Anthropic的可能性,是反向流动的11倍。这个不对称性一直存在,但这一周,它变得肉眼可见了。

    第二件事是算力内耗。Bloomberg报道说,在Shazeer宣布加入OpenAI前不久,他负责的一个项目的算力被重新分配给了DeepMind在伦敦的团队。在一家有19.47万员工的公司里,GPU使用权的内部竞争造成的摩擦,是小而聚焦的实验室不会遇到的问题。

    Gemini 3.5 Pro推迟到7月

    在这个节骨眼上,Business Insider报道说Gemini 3.5 Pro的发布从6月推迟到了7月。Google CEO Sundar Pichai在Google I/O上说过”下个月发布”,但现在公司正在Antigravity平台和LMArena基准测试服务上收集早期测试者的反馈。

    Google没有正式确认推迟。但Adler(AI编程)和Pritzel(预训练)的离职,在Gemini 3.5 Pro最需要表现竞争力的两个领域,留下了具体的人才缺口。

    市场在怕什么

    Jefferies的分析师维持了对Alphabet的买入评级,目标价445美元,认为人才离职是噪音。Google的总员工数是19.47万,走了5个研究员,统计上可以忽略不计。

    但D.A. Davidson的分析师Gil Luria给了一个更尖锐的评估:Google整体上仍然位置很好,但”当前前沿的竞争看起来是在Anthropic和OpenAI之间进行的”。

    市场担心的可能不是这5个人本身,而是他们代表的东西:诺贝尔奖得主、Transformer的共同作者、旗舰模型的核心工程师,这些人用脚投票,去了一家估值9650亿美元、正在准备IPO的竞争对手。


  • 谷歌限制Meta使用Gemini,AI算力短缺连大客户也照顾不过来

    谷歌限制Meta使用Gemini
    谷歌对Meta实施Gemini使用限制,AI算力短缺凸显

    一件挺有意思的事发生了:谷歌告诉Meta,你们用我们Gemini用太多了,得限一限。这件事背后,其实是整个AI行业都在面对的一个尴尬现实——即便你是有钱有势的大客户,也不一定能买到足够的AI算力。

    三月的一通电话改变了什么

    根据《金融时报》的报道,今年3月左右,谷歌告知Meta,无法满足其全部Gemini算力需求。这让Meta有些措手不及——毕竟这两家公司虽说是对手,但在AI算力这块,Meta一直依赖谷歌的云服务。

    结果就是,Meta的一些内部AI项目因为算力短缺而被迫延期或者调整计划。受影响的不止Meta一家,谷歌的其他客户也遇到了类似情况,只不过Meta受到的冲击最大,因为它的需求量实在太惊人了。

    据FT报道,由于受到限制,Meta已经开始鼓励员工更”节约”地使用AI token——那些用来衡量AI使用量的计算单位。

    谷歌自己的麻烦也不小

    这件事其实也暴露了谷歌的一个软肋。今年第一季度,谷歌云的收入增长到200亿美元,看起来很亮眼对吧?但CEO Sundar Pichai承认,算力限制阻止了更高的增长,而且直接导致云业务积压订单几乎翻了一番。

    也就是说,即便像谷歌这样的巨头,在AI算力需求暴涨的当下,也感到力不从心。他们一边在芯片和数据中心上砸几百亿美元,一边还是跟不上需求的增长速度。

    AI算力短缺会成为新常态吗

    这件事其实预示了一个趋势:AI算力可能会像石油一样,成为战略资源。谁能拿到足够的算力,谁就能在AI竞赛中占据主动。

    对于Meta来说,这次被谷歌”卡脖子”,说不定会加速他们自建算力基础设施的决心。毕竟扎克伯格已经在AI上投入巨资,如果再被供应商限制,那确实有点被动。

    而对于其他依赖第三方AI服务的公司来说,这件事也是一个提醒:如果你的核心业务建立在别人的AI能力上,那你可能需要在某个时候认真考虑一下备选方案了。


    • 谷歌今年3月告知Meta,无法满足其全部Gemini算力需求
    • Meta的一些内部AI项目因此延期或调整
    • 谷歌云Q1收入200亿美元,但算力限制阻止了更高增长
    • Meta鼓励员工更节约地使用AI token
    • AI算力短缺可能成为新常态,影响大客户优先级

  • LangExtract:Google 出品的 LLM 结构化信息提取利器,精准溯源让 AI 抽取结果可验证

    LangExtract:Google 出品的 LLM 结构化信息提取利器,精准溯源让 AI 抽取结果可验证

    LangExtract Logo

    📌 项目简介

    LangExtract 是 Google 开源的 Python 库,基于大语言模型从非结构化文本中精准提取结构化信息,并映射到原文精确位置,让 LLM 的信息抽取结果可验证、可溯源。

    ⭐ 36.8K+ Stars
    📝 Apache 2.0
    🐍 Python
    🏢 Google 出品

    ⚙️ 安装要求与过程

    📦 环境要求

    • Python:3.10 及以上版本
    • 依赖:自动安装(pydantic, tenacity, tqdm 等)
    • API 密钥:使用 Gemini 需配置 LANGEXTRACT_API_KEY 环境变量
    • 本地模型:可选,需提前安装 Ollama

    🚀 快速安装(3种方式)

    方式一:PyPI 安装(推荐)

    pip install langextract

    方式二:虚拟环境安装(避免依赖冲突)

    python -m venv langextract_env
    # Linux/Mac:
    source langextract_env/bin/activate
    # Windows:
    langextract_env\Scriptsctivate
    pip install langextract

    方式三:Docker 部署

    docker build -t langextract .
    docker run –rm -e LANGEXTRACT_API_KEY=”你的API密钥” langextract

    🎯 核心功能

    🔍 1. 精准溯源 — 提取结果可验证

    所有提取结果都会映射到源文本中的精确字符位置,支持可视化高亮展示。你可以直观看到每个提取实体在原文中的具体出处,彻底解决 LLM 幻觉问题。

    📐 2. 稳定的结构化输出

    基于用户提供的少样本示例(Few-shot Examples)强制执行输出格式,在 Gemini 等支持约束生成的模型中可保证输出格式 100% 合规,无需繁琐的 Prompt 调试。

    📚 3. 长文档优化 — 解决”大海捞针”

    通过文本分块 + 并行处理 + 多轮抽取的组合策略,有效解决长文档中关键信息难以完整抽取的痛点,大幅提升召回率。支持直接从 URL 读取长文本。

    🖥️ 4. 交互式 HTML 可视化

    自动生成自包含的交互式 HTML 文件,可在浏览器中直观查看数千个提取实体在原文中的高亮上下文,支持点击跳转,让审核效率倍增。

    🌐 5. 多模型支持 — 云端 + 本地全覆盖

    原生支持 Gemini 系列(默认)、OpenAI 系列(需额外安装)、Ollama 本地模型(无需 API 密钥),并通过插件系统支持任意自定义模型后端,真正模型无关。


    💡 典型使用场景

    🏥 场景一:医疗文本结构化

    从自由书写的临床笔记、出院小结中精准提取药物名称、剂量、频次、诊断结果等结构化信息,并溯源到原文位置,辅助医疗信息化系统建设。(注:医疗场景需遵守 Google Health AI Developer Foundations 使用条款)

    📄 场景二:长文档知识抽取

    处理数千页的研究论文、法律合同、财报,自动提取关键实体、关系、事件,生成可交互的 HTML 报告。多轮抽取 + 并行处理让长文档召回率大幅提升。

    🔒 场景三:本地隐私数据提取

    通过 Ollama 接入本地开源模型(如 Gemma 2),在完全离线环境下对敏感文本(法律、金融、个人数据)进行结构化提取,数据不出本地,满足严苛的隐私合规要求。


    🌟 推荐理由

    为什么值得关注?

    作为 Google 官方开源项目,LangExtract 解决了 LLM 信息抽取领域最痛的两个问题:结果不可验证格式不稳定

    它的设计哲学非常务实:

    • 🎯 精准溯源让每次提取都可验证,这在医疗、法律等高风险场景中是刚需
    • 📐 少样本示例驱动,无需微调模型,换个领域只需改示例,极大降低适配成本
    • 🖥️ 交互式 HTML 可视化是杀手级功能,让非技术用户也能直观审核抽取结果
    • 🌐 模型无关设计,从 Gemini 到 Ollama 随意切换,不被任何厂商锁定

    相比同类工具(如原生 LLM API 直接抽取),LangExtract 在准确性、可解释性、工程化落地三个维度都有明显优势。如果你正在做 RAG、知识图谱构建、文档智能处理,LangExtract 应该成为你的标配工具。

    ⭐ 推荐指数:5/5


    📥 下载地址

    📌 许可证:Apache 2.0 | 开发语言:Python | 维护方:Google

  • ElevenLabs全面接入SynthID水印,AI声音内容终于有迹可循

    AI声音越来越像真人,水印成了最后的防线

    以前AI生成的声音一听就知道是机器——语调平、没感情、偶尔还卡壳。现在不一样了。ElevenLabs、Google、OpenAI的语音模型出来的效果,打电话过去很多人根本分不出来对面是真还是假。这让”声音深伪”从一个技术问题变成了一个社会问题——诈骗电话、假录音、伪造名人发言,这些事已经在发生。

    ElevenLabs这周做了一个实质动作:把Google DeepMind的SynthID水印技术接入了自己的文字转语音生成流程。免费用户已经能用上,接下来几周会覆盖所有音频生成。这个水印是直接嵌进音频里的,人耳听不到,但用ElevenLabs的音频检测器可以识别出来。哪怕音频被裁剪、加速、转格式、删掉元数据,水印还在。

    AI生成音频水印示意图
    SynthID水印:嵌在音频里、人耳听不见、但可以检测 | 图片来源:ElevenLabs

    SynthID是什么,为什么是Google在推

    SynthID是Google DeepMind在2023年推出的AI内容水印系统,最初用于图片,后来扩展到音频和视频。原理是在生成内容里嵌入一个人类无法感知的模式,专门的检测器可以把它找出来,从而判断这段内容是不是AI生成的、是哪个平台生成的。

    今年5月的Google I/O上,Google宣布了一个”SynthID联盟”——OpenAI、英伟达、ElevenLabs、Kakao都承诺采用这个标准。这是AI行业少有的”主动给自己套绳子”的时刻:大家同意在自己的输出里加标记,让外界能追溯来源。当时这还只是一个承诺,ElevenLabs现在是第一个真正把这件事跑通的上线案例。

    “人们应该知道自己在和AI互动。随着我们的语音、音乐和音效模型越来越好,我们希望人们能够识别一段音频是否由AI生成,而且不需要专业工具。”——ElevenLabs产品团队

    水印能解决什么问题

    最直接的用途是溯源。如果有一段可疑的音频在传播,用ElevenLabs的免费音频检测器(Audio Detector)扫一下,就能知道是不是ElevenLabs生成的。这对打击深伪诈骗和虚假音视频有直接帮助。

    但这事也有局限性。水印只能证明”这段音频是ElevenLabs生成的”,不能证明”这段音频是某某人说过的”。如果有人用ElevenLabs克隆某人的声音去诈骗,水印能告诉你是ElevenLabs生成的,但没法直接告诉你克隆的是谁。要真正解决问题,还需要平台、法律、用户教育一起上。

    另一个现实问题是:水印只覆盖愿意加它的人。如果有人用没有水印的开源模型生成音频,这套体系就失效了。所以SynthID联盟的意义在于,让主流平台都加入,至少大部分商业AI音频是有标记的。

    ElevenLabs在博客里还提到,他们正在推动把SynthID加入C2PA的软绑定列表。C2PA是一个内容来源认证标准,能让被删掉元数据的内容重新”找回”自己的来源信息。这两个标准如果能打通,AI内容的溯源体系会更完整。

    监管压力是背后的推手

    越来越多的司法管辖区要求AI生成内容必须以机器可读的方式标注为”合成内容”。欧盟AI法案里有相关条款,美国各州也在推类似立法。对ElevenLabs来说,提前把水印做好,比事后被监管强制要求要主动得多。

    而且ElevenLabs本身也面临过滥用问题。2024年有过一波用ElevenLabs克隆名人声音制作深度伪造音频的事件,当时公司加强了安全审核。水印是又一层防护——就算有人绕过审核生成了不当内容,至少事后能追查来源。

    接下来,OpenAI、英伟达那边什么时候跟上,是业界最关注的。Google说它们都会用SynthID,但承诺和实际落地之间还有距离。ElevenLabs先走了一步,对其他平台是个压力,也是个参考。