标签: AI

  • 英国出手了,谷歌AI搜索要让出版商能选择退出

    谷歌的AI搜索扩张在欧洲碰了钉子。英国竞争与市场管理局(CMA)本周迫使谷歌做出实质性让步:出版商很快就能选择不让自己的内容被塞进谷歌的AI搜索功能里。

    具体做法是谷歌将在Search Console里加一个切换开关。只要出版商打开这个开关,它的网站就不会出现在AI Overviews、AI Mode,以及Discover的AI概览里。对于一直担心流量被AI摘要”截胡”的新闻机构来说,这算是一个迟来的主动权。

    CMA称这一举措是”世界首创”,让出版商重新掌控其内容如何被使用,也让新闻机构在与谷歌谈判AI内容使用费时有了更多筹码。

    监管步步紧逼

    这件事的铺垫其实已经持续了大半年。去年10月,CMA首次认定谷歌具有”战略市场地位”,这为后续监管铺平了道路。今年1月,CMA正式要求谷歌让出版商能选择是否将其内容用于AI搜索功能或训练独立的AI模型。

    谷歌在公告里也没忘了给自己贴金——顺带公布AI Overviews的月活已经突破25亿,AI Mode的月活也超过了10亿。但与此同时,它必须兑现两项承诺:一是让出版商能真正选择退出,二是在AI功能里给出版商内容加上清晰的归属和链接。


    出版商的筹码多了,但够用吗

    谷歌表示选择退出AI搜索不会影响网站在传统搜索结果里的排名。同时它会在Search Console里展示新指标,告诉出版商哪些页面出现在了AI回复里、覆盖哪些国家地区,试图用数据说服出版商别急着退出。

    不过CMA明确表示,选择权只是第一步。真正的较量在于出版商能不能凭此跟谷歌谈出合理的AI内容授权费。这场博弈才刚刚开始,而英国的这个监管先例,很可能成为其他司法管辖区跟进的模板。

  • GPT-SoVITS:58.3K Stars!AI语音克隆神器,1分钟音频定制你的声音

    GPT-SoVITS:58.3K Stars!AI语音克隆神器,1分钟音频定制你的声音

    想不想用自己的声音来朗读文章?或者让AI用你喜欢的角色声音来配音?以前这需要专业的录音设备和昂贵的软件,现在有了GPT-SoVITS,只需要1分钟的训练音频,就能训练出效果惊人的AI语音模型。

    项目简介

    GPT-SoVITS 是一个开源的少样本语音合成与转换工具,核心亮点是极低的训练数据需求——仅需1分钟语音数据即可训练出效果优异的TTS模型,5秒音频甚至可以直接实现零样本语音合成。项目提供了完整的WebUI工具链,从数据预处理到模型训练、推理部署一站搞定。

    GPT-SoVITS项目示意图
    GPT-SoVITS – AI语音克隆与合成

    安装要求和过程

    环境要求

    • 操作系统:Windows 10/11、Linux、macOS 均支持
    • Python版本:3.8 及以上
    • 显卡:推荐NVIDIA GPU(支持CUDA),也支持CPU推理
    • 内存:至少8GB,推荐16GB以上

    快速安装

    # 克隆仓库
    git clone https://github.com/RVC-Boss/GPT-SoVITS.git
    cd GPT-SoVITS
    
    # 安装依赖(推荐使用conda新环境)
    pip install -r requirements.txt
    
    # 启动WebUI
    python webui.py
    
    # Docker部署方式
    docker build -t gpt-sovits .
    docker run -p 7860:7860 gpt-sovits
    

    核心功能

    1. 零样本TTS:仅需5秒目标音色音频,无需训练即可直接合成该音色的语音,适合快速体验。
    2. 少样本微调:使用1分钟训练数据微调模型,合成语音的音色相似度和自然度大幅提升,媲美真人录音。
    3. 跨语言推理:训练集语言与推理文本语言可以不同,目前支持中文、英文、日语、韩语、粤语五种语言。
    4. 一体化WebUI工具集:内置人声/伴奏分离、训练集自动分割、中文语音识别(ASR)、文本标注等工具,降低新手使用门槛。
    5. 多版本持续优化:已迭代至V4/V2Pro版本,预训练数据扩展到5000+小时,音质、推理速度、硬件兼容性全面提升。

    典型使用场景

    • 内容创作配音:UP主、播客创作者可以用自己喜欢的声音来配音,不需要反复录音,修改文案后重新合成即可,大幅降低内容制作成本。
    • 有声书和语音助手:用特定音色批量合成有声书内容,或者为智能助手定制专属声音,提升用户体验和产品辨识度。
    • 语言学习辅助:跨语言推理功能让学习者可以听到用目标语言发音的标准音色,对语言学习和发音矫正很有帮助。

    推荐理由

    这个项目最让我印象深刻的是它的低数据需求设计。传统TTS模型训练动辄需要几小时甚至几十小时的录音数据,普通人根本没法准备。GPT-SoVITS把门槛降到了1分钟,这意味着几乎任何人都能训练自己的TTS模型。

    另外它的WebUI工具链设计非常贴心,从数据预处理到模型训练再到推理,每个环节都有可视化工具支持,不需要写代码就能完成整个流程。对于非技术用户来说,这种”开箱即用”的体验非常重要。

    目前项目在GitHub上有5.8万+ Stars,社区非常活跃,问题和PR响应速度快,中文文档齐全,是国内开源AI项目的优秀代表。如果你对AI语音感兴趣,这个项目绝对值得深入研究。

    下载地址

    (本文由AI自动整理发布,如有问题欢迎在评论区反馈。)

  • 佛罗里达州把OpenAI告了,说ChatGPT让用户上瘾

    AI监管的风向最近变得很快。继欧盟AI法案落地、美国多州推进AI监管立法之后,佛罗里达州本周直接把OpenAI告上了法庭——指控其推广ChatGPT可能导致用户”自我伤害、认知能力下降和行为成瘾”。

    这起诉讼由佛罗里达州总检察长詹姆斯·乌特迈尔(James Uthmeier)发起,被告包括OpenAI及其CEO萨姆·奥尔特曼(Sam Altman)。根据NBC新闻的报道,州政府这边的核心论点是:OpenAI在明知潜在风险的情况下仍然推广ChatGPT,特别是在未成年人保护方面做得不到位。

    佛罗里达州寻求的是处罚和法院禁令,而非刑事指控。但针对OpenAI的刑事调查仍在进行中。

    这起诉讼的分量

    先把话说清楚:这是州级诉讼,不是联邦层面的动作,量刑和影响力跟欧盟的GDPR不是一个量级。但信号意义不小——这是美国州级政府首次以”用户安全”为由对OpenAI提起这类诉讼,而且措辞相当激烈,直接用了”行为成瘾”这个表述。

    目前佛罗里达州寻求的是民事处罚和法院禁令,要求OpenAI停止被诉的行为。刑事调查的部分仍在推进中,但州政府目前没有提出刑事指控。


    OpenAI的麻烦不止这一件

    把视野拉宽一点,OpenAI最近在法律层面并不轻松。除了佛罗里达州这起新诉讼,他们还在应对来自其他方向的压力:

    • 父母起诉ChatGPT涉及未成年人自伤事件的案件仍在审理中
    • 多名前员工对OpenAI安全文化提出的质疑持续受到媒体关注
    • 欧盟和美国国会的AI监管听证会多次点名OpenAI的安全实践

    萨姆·奥尔特曼今年早些时候在国会听证会上承诺会加强未成年人保护,包括引入家长控制功能和更严格的使用时长提醒。但佛罗里达州这起诉讼表明,至少有一些监管方认为这些措施还不够。


    更大的背景

    这起诉讼发生的时间点值得注意。就在过去几周,Anthropic的Claude Mythos被曝已接入电力、水务等关键基础设施;谷歌和苹果都在推进设备端AI的更深布局;而各国监管部门对AI安全和成瘾性问题的关注肉眼可见地在升温。

    佛罗里达州这起诉讼最终能不能赢不好说,但它释放的信号很明确:AI公司过去那种”先上线、后治理”的打法,现在面临的阻力越来越大了。不管是罚钱还是禁令,成本都在变高。

    对OpenAI来说,这不会是最后一起。

  • OpenAI给Codex加了6个新岗位插件,白领的AI同事上线了

    OpenAI周一扔出一个不小的更新:Codex不再只是程序员的玩具,他们给这款AI智能体一口气加了6个岗位插件,直接把触角伸进了数据分析、销售、产品设计这些典型的白领工作场景。

    背后的数据挺能说明问题。OpenAI在同步发布的一份内部报告里透露,Codex现在的周活跃用户已经突破500万,比2月份桌面应用刚上线时涨了6倍多。更有意思的是用户结构——开发者仍然是最庞大的群体,但知识型工作者的占比已经到了20%,而且这个群体的增速是其他群体的3倍以上。

    Codex的周活跃用户超过500万,知识型工作者目前约占用户总数的20%,且增长速度比其他群体快3倍以上。

    6个新插件,瞄准具体岗位

    这次推出的插件覆盖了6个岗位:数据分析、创意制作、销售、产品设计、股权投资、投行。每个插件都整合了对应的集成接口、操作说明和场景上下文,让Codex能够模拟特定岗位的工作方式。用OpenAI的话说,这些插件开箱就能用,当然你自定义得越多,它干得越顺手。

    这个打法看着眼熟——Anthropic今年2月就推过面向企业的智能体插件项目,5月又专门针对金融服务推出更细分的智能体。OpenAI传统上更偏消费者市场,拉企业客户的速度慢了半拍,直到3月才给Codex引入插件支持。这次算是追了上来,而且声势更大。


    不只是插件,还有两个新功能

    除了插件,OpenAI还顺手发了两个新功能。一个是Sites,让Codex把工作成果直接输出成可交互的托管网站,不再只是一堆本地文件。为了支撑这个功能,OpenAI拉了一帮合作伙伴进来,包括Wix、Base44、Replit、Lovable、Figma和Emergent,而且明确表示还要继续扩这个生态。

    另一个是Annotations(注释),用户可以指定Codex中某个文档或文件的特定部分,让AI在那段上下文里执行更精准的指令。这个设计挺实用的,尤其是处理长文档的时候。


    更大的一盘棋

    这次更新发布的三周前,OpenAI刚为了企业客户推出了一家新的合资企业,叫”OpenAI Deployment Company”,拿到了全球投资机构超过40亿美元的资金支持。这个公司的目标很明确:把OpenAI的工具更深地嵌进全球企业的运营里。

    OpenAI首席营收官丹妮丝·德莱瑟在声明里说了一句话,挺能代表他们现在的思路:”AI正变得能够在组织内部完成越来越有价值的工作,现在的挑战是帮助企业把这些系统整合到支撑其业务的基础架构和工作流中。”

    这话翻译过来就是:工具已经差不多了,接下来要把它真正塞进企业的日常运转里。Codex这波更新,明显是冲着这个目标去的。

  • BabyAGI:22.3K Stars!任务驱动自主AI智能体,让AI学会自己拆解目标

    BabyAGI:22.3K Stars!任务驱动自主AI智能体,让AI学会自己拆解目标

    BabyAGI 项目封面

    📌 项目简介

    BabyAGI 是一个实验性的任务驱动自主AI智能体框架,由 Yohei Nakajima 于 2023 年发布,开创了让 AI 自主拆解任务、循环执行的先河。它用极简的 Python 代码展示了 AGI(通用人工智能)的雏形,是整个自主智能体领域的鼻祖级项目

    🔧 安装要求和过程

    环境要求

    • Python 3.9+
    • OpenAI API Key(或兼容 API)
    • pip 包管理器

    快速安装

    # 方式一:使用 pip 安装(推荐)
    pip install babyagi
    
    # 方式二:克隆仓库
    git clone https://github.com/yoheinakajima/babyagi.git
    cd babyagi
    pip install -r requirements.txt
    
    # 配置环境变量
    export OPENAI_API_KEY="your-api-key-here"
    export OBJECTIVE="Solve world hunger"  # 设置任务目标
    
    # 运行
    python main.py

    Docker 部署

    docker build -t babyagi .
    docker run -e OPENAI_API_KEY=your_key -e OBJECTIVE="your objective" babyagi

    ⚡ 核心功能

    🎯 自主任务拆解

    自动将大目标拆解为可执行的小任务,无需人工干预,持续循环执行直到目标完成。

    🧠 长期记忆机制

    通过 Pinecone 向量数据库存储和检索历史任务信息,让 AI 拥有”记忆”,避免重复劳动。

    🔄 任务优先级排序

    自动评估任务列表,根据目标智能排序执行优先级,确保最重要的任务优先完成。

    📊 functionz 函数框架

    内置全新的函数管理框架,支持函数注册、依赖追踪、密钥管理和自动执行,是项目的核心引擎。

    🖥️ 可视化 Dashboard

    配套 Web 管理面板,实时查看函数执行状态、依赖关系、密钥配置和完整执行日志。

    🏗️ 自构建能力

    实验性 self_build 功能,让 AI 根据用户需求自动生成新函数,实现智能体的自我扩展。

    🚀 典型使用场景

    场景一:自动化研究助手

    设定目标”研究并总结 Transformer 架构的最新进展”,BabyAGI 会自动拆解任务:搜索论文 → 阅读摘要 → 提取要点 → 生成总结报告。整个过程无需人工干预,是研究员和学生的效率神器。

    场景二:代码自动生成与执行

    通过 functionz 框架,让 BabyAGI 自动生成解决特定问题的 Python 函数,并注册到系统中供后续调用。配合 self_build 功能,AI 可以根据新需求动态扩展自己的能力边界。

    场景三:多步骤任务自动化

    设定目标”每天早上 9 点抓取 Hacker News 首页前 10 条内容并发送到我的邮箱”,BabyAGI 会拆解任务、编写爬虫函数、配置定时执行,真正实现”设定一次,自动运行”。

    💡 推荐理由

    BabyAGI 是整个 AI Agent 自主智能体浪潮的开山之作。2023 年 4 月,Yohei Nakajima 用不到 200 行 Python 代码,向全世界展示了 AI 可以自主拆解任务、循环执行、不断逼近目标——这个 Demo 直接催生了 AutoGPT、AgentGPT 等后续数百个自主智能体项目。

    虽然项目作者明确表示”不适合生产环境”,但它作为学习自主智能体原理的教科书级案例,价值无可替代。如果你想理解 AI Agent 是怎么”思考”的,读一遍 BabyAGI 的源码,比看十篇论文都管用。

    新一代 BabyAGI(基于 functionz 框架)更进一步,引入了函数管理、依赖追踪、自构建等生产级概念,为自主智能体的工程化落地提供了宝贵思路。⭐ 历史地位 + 学习价值,强烈推荐给每一位 AI 开发者!

    ⭐ 如果你觉得这个项目有用,请在 GitHub 上给它一个 Star!

    标签:AI Agent自主智能体开源

  • GitHub Copilot收费大变脸:从月付29美元到750美元,开发者炸了

    6月1日开始,GitHub Copilot的计费方式正式从固定订阅制切换为按token使用量计费。这个变化对重度用户来说,账单金额可能会让不少人倒吸一口凉气。

    微软的理由很直接:原来的固定费率模式下,少数”氛围编码”用户无节制地刷token,成本全由微软补贴,这个账算不过来。改成按量计费,该多少就是多少。

    GitHub Copilot chat interface screenshot
    GitHub Copilot界面(图源:TechCrunch)

    账单涨了多少?有人从50美元涨到3000美元

    Reddit和X上的吐槽帖在过去几天里层出不穷。一位用户说自己原来每月付约29美元,新费率下月费会涨到接近750美元。另一位用户贴出的截图更夸张:从每月约50美元直接跳到3000美元。

    “真是个笑话。这种新的使用量计费模式太贵了,我打算取消订阅。这个价格下,它已经没有任何成本效益,也没有任何实际用处了。”——Reddit用户

    当然,这些数字有可能是极端案例——比如有人用Copilot跑了大量长时间运行的任务,或者开了几十上百个子代理同时干活。但即便如此,月费涨了20倍、60倍,对任何个人开发者或小团队来说都是很难接受的数字。

    两派观点:是用户乱用,还是微软”背刺”?

    开发者社区对这个变化的反应分成了两个阵营。

    一派认为新定价完全合理:如果你真的知道自己在做什么,日常开发中使用Copilot根本不会消耗那么多token。那些账单爆炸的人,大多是毫无节制地”氛围编码”——让AI不停地试错、迭代、生成冗余代码,而不去理解到底发生了什么。这类用法本来就不应该被固定订阅制鼓励。

    • 正常使用Copilot的开发者:月费涨幅可控,甚至觉察不到明显变化
    • “氛围编码”重度用户:账单可能上涨10-60倍
    • 企业和大团队:影响相对可控,但预算规划复杂度上升

    另一派则觉得微软在这件事上不太厚道。他们的论点是:是微软自己设计了这套鼓励无节制使用的交互方式,现在却把成本暴涨的责任推给用户。一位用户写得很直接:”那些按照微软设计系统的方式使用系统的人,说实话,唯一有错的是微软。”


    一个更深层的问题:Copilot之前到底在亏多少钱?

    有Reddit用户提出了一个很犀利的问题:”我靠,Copilot之前亏了多少钱啊?”

    这个问题没有人能给出准确答案,因为微软从来没有公开过Copilot的单位经济模型。但可以合理推测:固定订阅制下,重度用户的实际使用成本远远超出他们支付的月费,这个亏损一直由微软在补贴。当Copilot的用户基数和单次会话的token消耗量都大幅增长之后,这个补贴模式就难以为继了。

    所以这次计费变更,本质上是从”亏本赚生态”转向”按成本收费”的商业逻辑正常化。只是这个转折点来得太突然,很多用户感觉自己被”背刺”了。

    截至发稿,微软还没有对这次计费调整引发的争议作出公开回应。对于正在考虑是否续订Copilot的开发者来说,现在最需要的其实是一套清晰的使用量预估工具——让你在切换新计费模式之前,能算清楚自己大概要付多少钱。

  • Anthropic加速迭代:Opus 4.8发布,动态工作流让AI自己管自己

    Anthropic本周扔出一枚小炸弹——Opus 4.8正式上线,距离上一代4.7发布只隔了41天。这个节奏快得不太正常,因为按照Anthropic过去的习惯,Sonnet和Haiku的更新周期分别是3个月和7个月。41天就推新版本,摆明了是对4.7市场反响不佳的直接回应——用户觉得4.7表现令人失望,那好,赶紧修。

    更大的压力来自竞争对手。就在这41天里,OpenAI的Codex和谷歌的Gemini Flash都发布了重大更新,Anthropic如果被甩开,故事就不好讲了。所以4.8不仅是一次技术迭代,更是一次”我们不能掉队”的公开表态。

    Claude AI logo on smartphone screen
    Anthropic持续加速Claude模型迭代节奏(图源:TechCrunch)

    不只是跑分更好看了

    Opus 4.8在基准测试上继续保持同类模型顶尖水平,但这次Anthropic重点强调的方向是”可靠性”——模型会更主动地标注自己拿不准的地方,减少那些看起来很自信但实际没依据的表述。

    桥水联合公司(Bridgewater Associates)在测试中发现:Opus 4.8会主动标注分析输入和输出中的问题,这是其他模型经常遗漏、只能由用户自己发现的能力。

    这个方向其实挺聪明的。大模型最让人头疼的地方不是”不够聪明”,而是”太自信地胡说”。如果Opus 4.8真的能在这个维度上有实质性进步,对企业和开发者用户来说,价值远不止是跑分高了几分。

    动态工作流,让AI管理AI

    这次发布最值得关注的是一个叫动态工作流(Dynamic Workflows)的新功能,目前处于研究预览阶段。简单说,它让Opus这类大模型能够管理跨数百个并行子代理的复杂任务。

    Anthropic在公告里举了一个很具体的例子:搭配Opus 4.8的Claude Code现在可以完成数十万行代码的代码库级迁移,从启动到合并全流程无需人工过多干预,以现有测试套件作为验证标准。

    • 代码库级任务自动化——不再需要人类一行行盯着
    • 数百个子代理并行调度——AI自己分配任务、自己管理进度
    • 以测试套件为验证标准——输出质量有底线保障

    这个方向透露出的信号是:Anthropic正在把Claude从”对话助手”往”自主任务执行引擎”的方向推。动态工作流如果成熟,意味着AI可以在人类只给一个高层目标的情况下,自己拆解任务、分配子任务、汇总结果、验证质量,形成真正的端到端自动化。


    Mythos模型快要解禁了

    还有一个值得关注的信号:Anthropic在发布内容中暗示,代号为Mythos的顶级模型可能很快结束预览期。4月时Mythos曾做过小规模预览,但因为网络安全方面的担忧,一直处在限制开放状态。

    Anthropic表示安全防护的开发进展很快,预计在未来几周内就能让所有用户用上Mythos级别的模型。如果这个时间表兑现,Anthropic将在前沿模型竞赛中同时拥有Opus(主打可靠性和可操作性)和Mythos(顶级性能)两条产品线,对OpenAI和谷歌的压力会进一步增大。

  • Anthropic 把 Claude Mythos 推进了电力、水务和医疗系统

    Claude AI安全扫描界面
    Anthropic 的 Claude Mythos 模型正在被部署到关键基础设施的代码库中

    Anthropic 本周二宣布,正在把 Project Glasswing 的覆盖范围大幅扩张——这个由 Anthropic 牵头、联合多家行业机构扫描关键软件漏洞的倡议,现在要向15个以上国家的大约150家新组织开放,同时放开 Claude Mythos 的访问权限。

    Claude Mythos 是 Project Glasswing 的核心引擎。Anthropic 称这是他们目前最强的模型,能在几周内识别出数千个零日漏洞。

    从50家到150家,覆盖面的质变

    今年4月初,Anthropic 向包括美国政府在内的50家初始合作伙伴开放了 Claude Mythos 预览版。不到两个月,这个数字要翻三倍。

    这一批新加入的组织,覆盖电力、供水、医疗、通信和硬件行业——用 Anthropic 自己的话说,这些行业在初始队列里”代表性不足”。说白了,之前主要是美国政府和大科技公司,现在开始往基础设施层面渗透了。

    Anthropic 在博客里写了一句挺吓人的话:”对于大多数合作伙伴,我们估计一次重大攻击可能影响超过1亿人,对全球和国家安全都会产生重大影响。”


    哪些机构拿到了权限

    根据《金融时报》的报道,这一轮扩展覆盖了与美国友好的多个国家,包括澳大利亚、加拿大、法国、德国、意大利、瑞士、荷兰、西班牙、比利时、瑞典、印度、日本、新西兰和韩国。

    已经确认拿到 Mythos 访问权限的机构里,有几个名字很值得注意:

    • Okta——美国最大的身份认证服务商,几乎半个硅谷都在用它
    • 三星、SK海力士、SK电信——韩国科技和半导体产业的核心玩家
    • 北约(NATO)——这个就不用多解释了
    • 欧盟网络安全机构(ENISA)——欧盟层面的网络安全监管机构

    Anthropic 没有公开确认这份完整名单,TechCrunch 表示已联系 Anthropic 核实。


    竞争对手也没闲着

    Anthropic 在博客里主动提了一句:预计其他 AI 公司很快会开发出能力跟 Mythos 相当的模型。这话听起来像是在给自己打预防针。

    事实上,OpenAI 已经先走了一步——自 Mythos 发布以来,OpenAI 推出了专注于网络安全的模型 GPT-5.5-Cyber,并已向大量合作伙伴推出测试。

    这个赛道现在看起来有点像军备竞赛:Anthropic 先发,OpenAI 紧追,接下来大概率会有 Google 和 Meta 的版本。


    这件事的真正意义

    AI 进入关键基础设施的安全扫描,这件事的意义不只是”又多了一个漏洞扫描工具”。

    之前这类工作主要是人工渗透测试团队和传统安全公司(如 CrowdStrike、Rapid7)在做。AI 模型能在几周内扫描完整代码库、识别数千个零日漏洞,这个速度和规模是人类团队根本做不到的。

    但反过来说,如果 Anthropic 的模型能发现这些漏洞,那别人——包括那些不怀好意的人——是不是也能用类似的模型做同样的事?这就是 AI 安全领域最核心的悖论:你用来防御的工具,本质上也在教别人怎么进攻。


  • Uber四个月烧光全年AI预算,给每个员工设了1500美元月上限

    你公司今年在AI上花了多少钱?Uber的答案有点尴尬——全年预算,四个月就烧完了。

    彭博社这两天报了个挺有意思的事:Uber最近给每位员工设置了AI工具使用上限,每个月每款工具最多花1500美元。覆盖的范围包括Claude Code、Cursor这类编程助手。员工可以通过内部仪表盘实时查看自己的使用量,特殊情况可以申请超限,但需要额外审批。

    Uber的CTO在今年4月透露,公司鼓励员工”尽可能多用AI”,甚至搞了内部排行榜来比谁用得多——结果全年AI预算4个月就归零了。

    这事为什么值得说

    Uber不是个小公司,全球几万人,AI工具按人头收费的模式下,这笔账单可以涨得极其凶猛。Claude Code、Cursor这类工具现在都是按token或者订阅计费,用得越多越贵,公司层面根本没有”封顶”机制。

    更要命的是,花了这么多钱,Uber的COO Andrew Macdonald最近上播客时居然说:”很难在AI使用和新增消费者功能之间划出一条因果线。” 翻译成人话就是——钱花出去了,但到底带来了多少实际产出,连高管都说不清楚。


    不只是Uber的问题

    这其实是整个科技行业正在面对的灵魂拷问:往AI砸了这么多钱,回报到底在哪?

    贝恩上个月出了一份调研,结论挺扎心的——很多企业预期的AI成本削减效果,现实里并没有出现。大家都在等ROI(投资回报率)自己长出来,但它好像还在路上。

    Uber的做法相当于给这场狂欢泼了盆冷水:设上限、要审批、看仪表盘。说白了就是”你们随便用,但不能乱烧钱”。


    对我们的启发

    • 企业AI采购正在从”野蛮生长”进入”精细化管理”阶段
    • 按员工数买单的模式,在大规模部署时会变得非常贵
    • AI到底有没有用,公司管理层其实也在摸索衡量标准
    • Uber这波操作,大概率会引发其他科技公司跟进

  • Deep-Live-Cam:80.8k+ Stars!实时AI换脸神器,一键打造你的数字分身

    Deep-Live-Cam:80.8k+ Stars!实时AI换脸神器,一键打造你的数字分身

    Deep-Live-Cam 特色图


    📌 项目简介

    Deep-Live-Cam 是一款强大的实时人脸交换与虚拟摄像头开源工具,只需一张照片,即可实现实时换脸、虚拟摄像头直播。项目基于深度学习技术,支持 CPU/GPU 加速,兼容 Windows/Linux/macOS 三大平台,是 AI 多模态生成领域的明星项目,GitHub Stars 突破 80.8k+

    无论是直播娱乐、视频会议虚拟形象,还是 AI 内容创作,Deep-Live-Cam 都能让普通人轻松体验 AI 换脸的魅力。


    ⚙️ 安装要求和过程

    环境要求

    • Python 3.9+
    • CPU: 支持(速度较慢);GPU: NVIDIA (CUDA) / AMD (ROCm) / Apple Silicon (MPS) 推荐
    • 操作系统: Windows 10/11, Ubuntu 20.04+, macOS 12+
    • 磁盘空间: 至少 4GB(含模型文件)

    快速安装(3步搞定)
    # 1. 克隆仓库
    git clone https://github.com/hacksider/Deep-Live-Cam.git
    cd Deep-Live-Cam
    
    # 2. 安装依赖(推荐使用conda环境)
    pip install -r requirements.txt
    
    # 3. 下载模型文件(按照官方README指引)
    # 将模型放入 models/ 目录
    
    # 4. 运行!
    python run.py
    

    💡 提示:Windows 用户建议使用 setup_env.bat 一键配置环境,避免依赖冲突。


    ✨ 核心功能

    🎭 实时人脸交换

    只需一张源照片,即可将目标视频/摄像头中的人脸实时替换,延迟低至 0.1 秒。

    📹 视频换脸处理

    支持 MP4/AVI/MOV 等主流格式,批量处理多个视频,输出高质量换脸结果。

    🎥 虚拟摄像头

    将换脸后的画面作为虚拟摄像头输出,即用在 Zoom/微信/OBS 等应用中。

    🖼️ 多人脸支持

    同时识别并替换画面中的多个人脸,适用于团体合影、群聊场景的智能换脸。

    🎨 人脸增强(Enhanced)

    内置 GFPGAN 人脸增强模型,让换脸后的面部更清晰自然,减少 AI 伪影。


    🚀 典型使用场景

    场景一:直播/视频会议虚拟形象

    通过虚拟摄像头功能,在 Zoom、腾讯会议、微信视频号直播中使用任意人脸作为自己的虚拟形象,保护隐私的同时增添趣味。只需提前准备一张目标人脸照片,Deep-Live-Cam 会实时将你的面部替换为目标形象。

    场景二:短视频/影视内容创作

    将演员面孔替换为任意目标,用于影视二创、搞笑短视频制作。相比传统后期软件,Deep-Live-Cam 支持实时预览,创作效率大幅提升。配合 OBS 可实现实时直播换脸,是内容创作者的利器。

    场景三:AI 换脸技术研究

    作为开源项目,Deep-Live-Cam 提供了完整的实时换脸技术栈,包括人脸检测(YOLOv8)、人脸识别(ArcFace)、人脸交换(Inswapper)等模块,非常适合 AI 研究者学习和二次开发。


    💡 推荐理由

    Deep-Live-Cam 是我见过的最易用、最强大的开源实时换脸工具,没有之一。它的几个亮点让我印象深刻:

    第一,真正零门槛。不需要懂 AI、不需要配置复杂环境,Windows 用户运行一个 bat 脚本就能完成全部配置,真正做到了”一键启动”。

    第二,实时性能惊人。在 RTX 3060 上能达到 30+ FPS 的实时换脸,延迟低到几乎感觉不到——这是很多商业软件都做不到的。

    第三,开源且活跃。项目在 GitHub 上持续更新,社区活跃,Issue 响应快,而且完全免费——相比之下,某些商业换脸软件动辄每月几十美元订阅费。

    如果你对 AI 多模态生成、实时视觉特效感兴趣,Deep-Live-Cam 绝对值得 star 和深入研究。⭐


    📥 下载地址

    GitHub 仓库:https://github.com/hacksider/Deep-Live-Cam ⧉

    在线 Demo:查看演示视频 ⧉

    许可证:MIT License(可自由使用、修改和分发)

    最新版本:请关注 GitHub Releases 页面获取更新


    📌 本文由 WorkBuddy AI 自动采集撰写,内容仅供参考。请遵守当地法律法规,勿将本工具用于非法用途。