标签: AI Agent

  • WWDC 2026前瞻:Siri要变独立App了,苹果押注AI重构全系统

    苹果刚刚正式宣布,2026年全球开发者大会(WWDC 2026)定在6月9日凌晨1点开幕。和往年不一样,这次苹果在发布会前就主动预告会带来”AI新进展”——外界普遍认为,这会是苹果近年来战略意义最重的一次开发者大会。

    Apple WWDC 2026前瞻
    苹果WWDC 2026将于6月9日开幕,Siri将迎来15年来最大变革

    Siri变独立App,这是15年来头一回

    最值得关注的变化是:Siri要被彻底重建,而且会以独立App的形式重新出现在iOS 27里。这是自2010年苹果收购Siri、把它塞进系统底层以来,时隔15年第一次恢复独立App形态。

    苹果这个举动背后的信号很直接:过去那套语音助手的逻辑已经走不通了。新版的Siri交互界面全部重做,采用类似iMessage的对话列表设计,支持多轮连续对话,历史记录可以搜索和回溯。用户还能通过全局手势从屏幕顶部中央下滑一键唤起——灵动岛在唤醒时会展开,配上发光光标效果,存在感比现在强得多。

    据彭博社马克·古尔曼等多方信源披露,新版Siri支持跨应用深度联动,可通过App Intents框架读取邮件、日历和屏幕内容并执行操作,算是真正意义上实现了多任务自动化。

    苹果找谷歌当”外援”

    在底层模型的选择上,苹果做了一件挺有意思的事:跟谷歌达成深度合作,引入Gemini大模型为新版Siri提供核心能力支撑。据悉苹果每年为此向谷歌支付约10亿美元。

    但苹果还是守住了隐私边界:用户数据在苹果自有的私有云服务器上运行,谷歌无权将对话内容用于模型训练,而且聊天记录支持用户自主设置保留30天、一年或者永久。

    不过苹果自己似乎对这套新版Siri的成熟度也没那么有信心。iOS 27测试版里,新版Siri已经被标注了”测试版”字样,系统里还内置了退出测试体验的开关——这意味着即便今年秋季正式发布,这个”测试版”标识很可能还会保留一段时间。

    AI功能全面铺开,但大多是”跟跑”

    除了Siri本身,iOS 27在AI能力上还有几项值得说的更新。写作辅助方面,苹果计划推出一套对标Grammarly的AI语法检查工具,以半透明菜单的形式从屏幕底部滑出,并排展示原文和AI修改建议,用户可以逐条采纳或者一键全部批准。

    快捷指令也迎来了自然语言化升级——以前用户得手动拼装自动化流程,现在只要在文本框里用自然语言描述需求,系统就能自动生成并安装对应的快捷指令。门槛低了很多。

    更有意思的是,iOS 27将引入名为”Extensions”的第三方AI模型接入系统,允许用户安装Claude、Gemini等主流AI应用作为扩展,并在搜索栏里自由切换不同的AI引擎。这意味着ChatGPT从苹果的”特权合作伙伴”变成了众多选项之一——苹果的AI平台化战略,这次算是正式浮出水面了。


    折叠屏iPhone也在路上

    今年9月,苹果预计将发布第一代折叠屏iPhone。这是苹果十几年来最大的产品形态革新,对系统软件和AI能力的适配提出了全新要求:多任务调度、大屏界面优化、AI交互入口的重新设计,都需要硬件、软件和AI能力三方协同。

    从这个角度看,iOS 27这次AI重构做得好不好,会直接决定折叠屏iPhone的产品说服力。目前约80%到85%的在用iPhone不具备运行新一代Apple Intelligence功能所需的硬件条件,涉及设备规模达11亿到13亿台——这批用户构成了苹果潜在的换机蓄水池,一旦新版Siri的体验足够扎实,AI能力从”可选项”变成”强依赖”,这轮换机潮的规模会相当可观。

  • Chroma:28.2K Stars!AI 开源向量数据库,让语义搜索 5 行代码搞定

    Chroma:28.2K Stars!AI 开源向量数据库,让语义搜索 5 行代码搞定

    如果你正在构建 RAG 应用、智能客服、文档问答系统,你会发现一个核心难题:如何让 AI 从海量文本中快速找到最相关的内容?

    Chroma 向量数据库
    Chroma —— 面向 AI 的开源向量数据库

    📦 项目简介

    Chroma 是专为 AI 应用设计的开源向量数据库,定位为“AI 的搜索基础设施”。它让开发者能够以极简的 API 完成文档嵌入、向量存储、语义检索的全流程,是构建 RAG(检索增强生成)系统的首选工具之一。

    Chroma 的核心设计理念是简单优先:核心 API 只有 4 个函数,5 行代码即可完成文档入库和语义搜索。同时支持 Python 和 JavaScript 双语言客户端,并提供 Chroma Cloud 托管服务(注册即送 $5 免费额度,30 秒内完成数据库创建)。

    ⚙️ 安装要求与过程

    环境要求

    • Python:3.8+(推荐 3.9+)
    • Node.js:16+(使用 JavaScript 客户端时需要)
    • 内存:最低 2GB(内存模式);生产环境建议 4GB+
    • 存储:持久化模式需要磁盘空间存放向量索引

    快速安装(3 步搞定)

    # 第1步:安装 Chroma(Python)
    pip install chromadb
    
    # 第2步:启动 Chroma 服务(可选,也可直接用内存模式)
    # chroma run --path ./chroma_db
    
    # 第3步:写 5 行代码,完成第一个语义搜索!
    import chromadb
    client = chromadb.Client()
    collection = client.create_collection("my_docs")
    collection.add(documents=["你好世界", "Hello World"], ids=["id1", "id2"])
    results = collection.query(query_texts=["greeting"], n_results=1)
    print(results)

    JavaScript/TypeScript 用户:

    # JavaScript/TypeScript 安装
    npm install chromadb
    
    # 快速使用
    import { ChromaClient } from 'chromadb';
    const client = new ChromaClient();
    const collection = await client.createCollection({ name: "my_docs" });
    await collection.add({ ids: ["id1"], documents: ["Hello World"] });
    const results = await collection.query({ queryTexts: ["greeting"], nResults: 1 });
    console.log(results);

    💡 核心功能

    🎯 极简 API 设计
    核心 API 仅 4 个函数:创建集合、添加文档、查询搜索、管理集合。学习成本几乎为零,5 行代码即可完成语义搜索全流程。

    🔍 多模态搜索能力
    支持纯向量搜索、全文搜索、混合搜索(向量+关键词)三种模式。可根据场景灵活选择,搜索精度远超单一模式。

    🧠 自动嵌入处理
    添加文档时自动完成分词 → 向量嵌入 → 索引构建全流程,内置主流 Embedding 模型(Sentence Transformers 等),也支持自定义向量传入。

    🔧 灵活部署模式
    支持内存模式(快速原型)、持久化存储(生产环境)、客户端-服务端(多应用共享)、Chroma Cloud(完全托管,免运维)。

    🏷️ 多维度过滤
    支持基于元数据(metadata)的精确过滤,和基于文档内容的包含过滤。例如:只搜索”来源为官网”的文档,或只搜索”包含特定关键词”的段落。

    🌐 多语言客户端
    官方支持 Python 和 JavaScript/TypeScript 双语言客户端,API 设计一致。社区还提供了 Go、Java、Ruby 等语言客户端,覆盖主流开发生态。

    🚀 典型使用场景

    场景一:RAG 文档问答系统

    将企业知识库、产品文档、FAQ 等文本存入 Chroma,用户提问时通过语义搜索找到最相关的片段,再交给 LLM 生成回答。这是 Chroma 最经典的应用场景,也是目前大量 AI 应用的标准架构。

    # RAG 典型代码(简化版)
    import chromadb
    from sentence_transformers import SentenceTransformer
    
    # 1. 连接 Chroma
    client = chromadb.Client()
    collection = client.get_or_create_collection("company_docs")
    
    # 2. 文档切片入库(实际项目可用更高级的分片策略)
    docs = ["退款政策:7天内可申请...", "Shipping: 2-5 business days..."]
    collection.add(documents=docs, ids=["doc1", "doc2"])
    
    # 3. 用户提问 → 语义检索 → 交给 LLM
    query = "如何申请退款?"
    results = collection.query(query_texts=[query], n_results=3)
    # results['documents'] 即为最相关的文档片段,传给 LLM 生成回答

    场景二:AI 应用语义缓存

    对 LLM 的相似问题,直接返回缓存的答案,避免重复调用大模型,可降低 30-80% 的 API 成本。Chroma 的向量相似度搜索非常适合实现语义缓存——用户问”怎么退款”和”退款流程是什么”应该命中同一个缓存。

    场景三:内容推荐与去重

    新闻推荐、电商商品推荐、短视频去重等场景,都可以通过向量相似度来实现。Chroma 的轻量特性使其非常适合作为推荐系统的向量检索层,毫秒级返回相似内容。

    🌟 推荐理由

    我推荐 Chroma 的核心原因是它把”向量数据库”这个听起来很高大上的东西,做到了真正对开发者友好。以下是我的真实使用感受:

    第一,上手速度极快。对比 Pinecone、Weaviate、Qdrant 等竞品,Chroma 的学习曲线是最平缓的。核心 API 只有 4 个函数,README 中的示例代码复制到本地,5 分钟就能跑通第一个语义搜索。对于想快速验证 RAG 想法的开发者,这非常重要。

    第二,开源 + 零依赖启动。Chroma 采用 Apache 2.0 开源协议,可以免费用于商业项目。内存模式不需要安装任何外部依赖(不需要 Docker、不需要单独装数据库),pip install chromadb 之后直接就能用,对个人开发者和小型团队极其友好。

    第三,生产路径清晰。很多”易上手”的工具到了生产环境就掉链子,但 Chroma 提供了完整的升级路径:开发阶段用内存模式快速迭代 → 部署时用持久化模式 → 规模化后用 Chroma Cloud 或自托管 HTTP 服务。这个路径非常平滑,不需要重写代码。

    什么场景不适合 Chroma?如果你需要百亿级向量规模(如千万级文档),Chroma 目前的能力可能不如专用的分布式向量数据库(如 Milvus)。但对于99% 的 AI 应用开发者(百万级向量以下),Chroma 的性能和易用性是最优平衡。

    📥 下载地址

    🌐 官方网站
    trychroma.com

    🐙 GitHub 仓库
    github.com/chroma-core/chroma
    (28.2K+ Stars)

    📦 PyPI 安装
    pip install chromadb

    📦 npm 安装
    npm install chromadb

    ☁️ Chroma Cloud
    cloud.trychroma.com
    (注册送 $5 免费额度)

    📌 本文由 WorkBuddy AI 自动采集撰写,阅读原文请访问 GitHub 仓库。

  • AI公司想免费帮你打扫卫生,条件是拍下你家的全过程

    一家叫Shift的AI创业公司最近在纽约搞活动:免费帮你打扫家,但条件是——他们要拍下整个清洁过程。

    这听起来像是那种”条件优厚到让人起疑”的买卖,实际上背后有个非常具体的目的:收集人类做家务的视频数据,用来训练未来的家用机器人。

    训练机器人比训练ChatGPT难多了

    文字和图像可以从互联网上大规模抓取,但物理世界的动作数据没那么好弄。教一个机器人叠毛巾、捡苹果、倒水,这些对人类来说轻而易举的事情,对机器人来说极其难编码。

    机器人要理解的不是文字,而是空间、力度、摩擦力、物体形状、光线变化——这些东西人类本能就会,但要把它们变成机器能读懂的数据,成本高得吓人。

    不止一家公司在这么做

    印度有个家政平台叫Pronto,也被曝出在客户授权后采集烹饪、清洁、洗衣等场景的视频,用来训练AI。这件事在印度市场引发了不少争议,竞争对手赶紧出来表态说自己绝对没在客户家里装摄像头。

    还有更”刻意”的做法:一些公司在专门搭建的场地里,让工人一遍又一遍地重复同样的动作,摄像头全方位记录。这种”数据农场”产出的素材质量高、场景可控,缺点是很贵。


    数据瓶颈倒逼出各种创意

    高质量的物理世界数据是开发物理AI的最大瓶颈。文本、图片、视频可以从网上爬,但要让机器人学会在真实人家环境中干活,就得有真实家庭环境的数据。

    所以出现了各种”用服务换数据”的模式:Shift免费清洁换视频、Human Archive给零工发相机帽采集第一视角数据、一些公司直接把产品先卖出去,再从用户使用中收集数据迭代算法。

    隐私问题迟早要爆发

    用免费服务换数据这件事本身并不新鲜——会员卡、cookies、行车记录仪、保险APP都在做。但家务场景涉及的是你家里面最私密的空间,摄像头拍到的不只是”清洁动作”,还有你的生活方式、家庭布局、个人隐私。

    目前这类公司的做法是让用户”选择加入”,但问题是:有多少人真的仔细读了那份授权协议?等家用机器人真正上市的时候,这些数据是怎么被使用、会不会被转卖,都会成为大问题。

  • OpenAI把Codex搬上Windows了,AI智能体直接帮你操作电脑

    OpenAI的Codex之前已经在Mac上能用”计算机控制”功能了,现在Windows用户也等到了。简单说,就是让AI直接”看”你的屏幕,然后在你的设备上帮你干活。

    这个功能的名字叫”computer use”,技术上跟Anthropic的Claude电脑控制是同一类东西——让AI理解屏幕内容,然后模拟人类操作:点按钮、输文字、开软件,整套流程自动化。

    不在电脑旁边也能管

    有个细节挺实用:你不在电脑跟前的时候,也可以通过ChatGPT手机应用查看Codex正在执行的任务,顺便管一管进度。对需要跑长任务的场景来说,不用守在电脑前了。

    Codex的”computer use”本质上是在模仿人类使用电脑的方式。它看屏幕、找按钮、点鼠标、敲键盘——只不过速度比人快得多,也不会累。

    OpenAI在抢智能体入口

    把Codex做成一个能操作你整个系统的智能体,这个方向不止OpenAI在走。Anthropic的Claude已经可以先用到电脑控制能力,微软也在把Copilot往这个方向推。大家的判断是一样的:未来的AI不只是回答问题,而是要能替你把事情做完。

    Windows这块市场OpenAI肯定不想让给别人。Mac版先上,现在补上Windows,基本覆盖大部分开发者群体了。


    安全和权限怎么算

    AI能操作你的电脑,这件事的便利性和风险是并存的。目前Codex需要用户主动授权才会开启这个功能,但往后这类能力的权限边界会是个持续的议题——毕竟,让AI”看见”屏幕内容,意味着它能接触到的信息范围相当大。

  • 我把谷歌的Gemini Spark塞进日常生活一周,有些话想说

    谷歌在今年的I/O大会上发布了Gemini Spark——一个跑在云端虚拟机上的7×24小时AI智能体。CEO皮查伊当时开了个玩笑:”你可以合上笔记本电脑了。”这话明显是在暗戳戳地怼OpenClaw那种需要保持设备唤醒才能工作的方案。

    听起来很美好。但真正用了一圈之后,我发现Spark的定位其实挺尴尬的——它既不是给发烧友用的极客工具,也没有真正想清楚普通用户到底需要它干什么。

    它能做什么?实际测了四个场景

    我拿到了提前体验资格,给Spark安排了四个不同类型的任务,想看看这个”永远在线”的AI助手到底能帮上什么忙。

    Gemini Spark概念图
    Gemini Spark作为谷歌I/O 2026重点发布的AI智能体功能,定位”永远在线”(图源:Bloomberg / Getty Images)

    场景一:比价购物。我让Spark帮我在本地药店找优惠,哪些产品有折扣、哪些可以叠加优惠券。这块它做得不错——准确找到了参与促销的商品,还提醒我可以组合线上促销码。唯一翻车的是它推荐了一个已经失效的促销码,看来实时数据验证还是AI的弱项。

    场景二:一日游打包清单。让Spark查目的地天气、读取活动性质,然后给我出一份携带建议清单,还要导入Google Keep。结果你猜怎么着?Spark根本不支持Google Keep。作为谷歌自家的产品,这个遗漏实在说不过去。最后它给我塞了一份Google Docs文档,然后说”你可以去看那个文档当做清单”——行吧。

    Spark给我出的打包建议其实挺到位的:草坪椅、水、防晒霜、墨镜、太阳落山后穿的薄外套、可重复使用的购物袋,还提醒了我活动不允许带狗。问题不出在AI的理解能力,出在它和谷歌自家生态的打通程度上。

    场景三:本地周末活动推荐。我住的小城市不算热闹,但要靠自己翻遍所有本地简报、Facebook群组、线上报纸来找周末去处,实在太花时间了。Spark这次表现不错——它设置了一个网页搜索,结合我的Gmail里订阅的本地简报,整理出了一份近期活动清单。我甚至发现了有个年度”海狸女王”选美大赛在为湿地保护筹款——这种冷门活动我平时根本不可能主动搜到。

    场景四:价格监控。让Spark帮我盯着一款贵妇眼霜的降价情况,到了目标价就提醒我。这块Spark理解了意图,但把监控频率设成了”每两周检查一次”——如果你等的是一个转瞬即逝的闪购促销,两周一次的频率基本等于没监控。


    最大的问题:它为什么是个”独立品牌”?

    这是我用了之后最想吐槽的一点。Spark本质上就是Gemini的一个运行模式,但它被谷歌做成了一个有独立名字、独立切换开关的”产品”。用户要在Gemini的界面里手动切换”切换到Spark”——我作为一个正常人,为什么要思考”我这个需求是普通对话还是后台任务”?我只想输入请求然后完事。

    更要命的是,iPhone用户目前没法通过硬件按键或者手势直接唤起Spark。你得先打开Gemini App,再从里面手动切换模式。隔壁苹果的Siri shortcuts都能做到按一下侧键就触发自定义流程了,谷歌这个体验说实话有点掉队。

    Gemini Spark界面截图
    Gemini Spark的操作界面,用户需要手动切换模式(图源:TechCrunch screenshot)

    值不值得用?

    如果你已经是Google生态的深度用户(Gmail、Google日历、Google Docs全套在用),Spark确实能帮你省一些平时要手动整理的时间。但如果你期待它是一个能替你完成”跨应用复杂操作”的真·智能体,目前还差得远。

    谷歌说Spark未来会通过MCP协议接入更多第三方服务,到时候也许真的能做到”帮我在Resy上订餐厅”或者”监控机票价格自动下单”。但在那之前,Spark更像是一个”能记住你偏好的后台Gmail摘要生成器”——有用,但还没到非用不可的程度。

    • ✅ 优势:与Google生产力套件集成较深,云端常驻不依赖本地设备
    • ✅ 优势:摘要类任务表现稳定,节省日常信息整理时间
    • ❌ 劣势:缺少Google Keep集成,笔记场景体验割裂
    • ❌ 劣势:独立品牌增加认知负担,用户不清楚何时该用Spark
    • ⚠️ 待观察:MCP扩展落地后能力边界才能真正确定
  • LLMs-from-scratch:96.3K Stars!从零手写大模型,彻底搞懂LLM底层原理

    LLMs-from-scratch:96.3K Stars!从零手写大模型,彻底搞懂LLM底层原理

    LLMs-from-scratch 封面

    《Build a Large Language Model (From Scratch)》书籍封面


    📌 项目简介

    LLMs-from-scratch 是 Sebastian Raschka 所著《Build a Large Language Model (From Scratch)》一书的官方代码仓库,带你从零开始用 PyTorch 手写实现类 GPT 大语言模型,覆盖数据处理、注意力机制、GPT 架构、预训练、微调全流程,是搞懂 LLM 底层原理的最佳实战项目。


    ⚙️ 安装要求与过程

    环境要求

    • Python 3.8+,具备扎实的 Python 编程基础
    • PyTorch 基础(零基础可参考附录 A 的 PyTorch 入门教程)
    • 硬件:主章节代码可在普通笔记本运行,支持自动检测并使用 GPU 加速
    • 深度神经网络基础有助于理解,但不是硬性要求

    快速安装步骤

    # 1. 克隆仓库(只拉取最新版本,减少下载量)
    git clone --depth 1 https://github.com/rasbt/LLMs-from-scratch.git
    
    # 2. 进入目录
    cd LLMs-from-scratch
    
    # 3. 安装依赖
    pip install -r requirements.txt
    
    # 4. (可选)安装 Jupyter Notebook
    pip install jupyter
    
    # 5. 启动 Notebook,按章节运行代码
    jupyter notebook

    📌 如果你从 Manning 官网下载了代码包,建议前往 GitHub 官方仓库获取最新更新。


    ✨ 核心功能

    🧠 从零实现注意力机制

    手写实现单头/多头自注意力(Self-Attention)机制,深入理解 Query/Key/Value 的数学原理,不依赖任何高层封装库。

    🏗️ 完整 GPT 架构实现

    从词嵌入、位置编码到 Transformer 解码器块,完整实现 GPT 模型架构,代码逐行对照论文,透明可调试。

    🔥 预训练与微调全流程

    覆盖无标注数据预训练、文本分类微调、指令遵循微调(SFT)完整流程,附带可运行的训练脚本。

    🚀 主流模型权重加载

    支持加载 Llama 3.2、Qwen3、Gemma 3、OLMo 3 等主流开源模型的预训练权重进行微调与推理。

    📚 附录与扩展内容

    包含 PyTorch 分布式训练(DDP)入门、LoRA 高效微调实现、分组查询注意力(GQA)、MoE 混合专家架构等进阶内容,一书在手,LLM 技术栈全覆盖。


    🎯 典型使用场景

    场景一:系统学习 LLM 底层原理

    不看封装库黑盒,从张量运算级别理解 Transformer 和 GPT。每章配有练习和解答,适合有一定 Python 基础、想深入 LLM 原理的开发者系统学习。可搭配书籍《Build a Large Language Model (From Scratch)》一起使用,理解更透彻。

    场景二:在自己的数据上训练定制 LLM

    参考第 5 章的预训练代码,基于自定义数据集训练专属小模型;或参考第 7 章的指令微调代码,用开源指令数据集微调模型,使其具备遵循指令的能力,用于垂直领域应用。

    场景三:作为 LLM 课程的配套实践材料

    本书配有 17 小时 15 分钟的官方视频教程,章节结构清晰,练习册《Test Yourself On Build a Large Language Model》可用来自测掌握程度,非常适合作为高校课程、企业内训或自学小组的配套实践材料。


    💡 推荐理由

    我第一次翻开这本书的代码时,有一种「原来 GPT 是这样工作的」的恍然大悟感。

    大多数 LLM 教程要么停留在概念层面,要么直接调用 transformers 库,黑盒到底。而 LLMs-from-scratch 选择了一条更难但更有价值的路:从张量运算级别手写实现,不依赖任何高层封装。

    我最喜欢的是第 4 章实现 GPT 模型那部分——当你亲手写出 self.attn = MultiHeadAttention(...)self.ln = LayerNorm(...) 并成功跑通时,那种「我理解了」的满足感是任何调用封装库都给不了的。

    作者 Sebastian Raschka 是 LLM 领域的顶级教育者,Lightning AI 的 LLM 负责人,写书风格非常「工程师友好」——没有冗余的数学推导,每一行代码都能跑,每一章都有配套练习。

    如果你是想深入 LLM 原理的开发者、研究者,或正在准备 LLM 相关技术面试,这个项目绝对值得你花时间从头到尾跟一遍。96.3K 的 Star 数不是偶然,是工程师们用脚投票的结果。


    📥 下载地址

    🔗 GitHub 仓库

    https://github.com/rasbt/LLMs-from-scratch

    访问 GitHub →

    📘 配套书籍

    《Build a Large Language Model (From Scratch)》
    Manning 出版,ISBN 978-1633437166

    Amazon 购买 →

    🎬 配套视频教程(17h15min)

    Manning LiveVideo:Master and Build Large Language Models

    观看视频 →


    📌 小提示:本项目是《Build a Large Language Model (From Scratch)》的官方配套代码,建议配合书籍一起学习,理解效果最佳。书籍附录 A 还提供了 PyTorch 入门教程,适合 PyTorch 零基础读者补基础。

  • Screenshot to Code:72.7K Stars!截图秒变代码,让前端开发效率提升10倍

    Screenshot to Code:72.7K Stars!截图秒变代码,让前端开发效率提升10倍

    Screenshot to Code 演示

    上传截图,AI自动生成对应代码


    🚀 项目简介

    Screenshot to Code 是一款AI驱动的开发辅助神器,只需上传一张网页截图、线框图或Figma设计稿,即可自动生成干净的可用代码。支持 HTML+CSS、React、Vue、Bootstrap 等多种技术栈,让设计稿到代码的转换从数小时缩短到几秒钟。


    ⚙️ 安装要求和过程

    💡 环境要求

    • Python 3.9+(后端依赖)
    • Node.js 18+(前端依赖)
    • Poetry(Python 依赖管理,推荐)
    • Docker(可选,快速部署方式)
    • API密钥:OpenAI / Anthropic / Google Gemini(三选一即可)

    🚀 快速安装步骤

    方式一:本地源码运行(推荐开发调试)

    # 1. 克隆项目
    git clone https://github.com/abi/screenshot-to-code.git
    cd screenshot-to-code
    
    # 2. 配置API密钥(后端)
    cd backend
    echo "OPENAI_API_KEY=sk-your-key" > .env
    echo "ANTHROPIC_API_KEY=your-key" >> .env
    echo "GEMINI_API_KEY=your-key" >> .env
    
    # 3. 安装依赖并启动后端
    poetry install
    poetry run uvicorn main:app --reload --port 7001
    
    # 4. 新终端启动前端
    cd ../frontend
    yarn
    yarn dev

    启动后访问 http://localhost:5173 即可使用。

    方式二:Docker 一键运行(推荐快速体验)

    # 在项目根目录执行
    echo "OPENAI_API_KEY=sk-your-key" > .env
    docker-compose up -d --build


    ✨ 核心功能

    🎯 截图转代码

    上传任意网页截图或设计稿,AI自动分析布局结构,生成对应前端代码,支持多种技术栈自由切换。

    🔄 多模型支持

    内置支持 Claude Opus/Sonnet、GPT-4.5/4.1、Gemini 3 Flash/Pro 等顶级模型,也支持自定义API兼容接口。

    🛠️ 多技术栈输出

    支持 HTML+CSS、HTML+Tailwind、React+Tailwind、Vue+Tailwind、Bootstrap、Ionic+Tailwind、SVG 等主流技术栈。

    🎬 录屏转原型(实验性)

    支持上传网站操作录屏视频,AI直接生成可交互的功能原型,非常适合产品快速验证和演示。

    🔒 隐私优先,本地可控

    支持通过 Ollama 运行本地开源模型,所有数据不出本地;也可自托管 Docker 版本,完全掌控数据隐私。


    🎬 典型使用场景

    📌 场景一:设计师交付前端代码

    设计师完成 Figma 设计稿后,开发人员只需截图上传,即可快速获得可运行的前端代码骨架,大幅减少从设计到代码的重复劳动。实测可将一个中等复杂度页面从 2小时 缩短到 30秒 出初稿。

    🎓 场景二:学习前端的新手临摹练习

    想临摹一个漂亮的网页但不懂怎么实现?截一张图上传,AI 帮你生成完整代码,新手可以在生成的代码基础上学习和修改,快速提升前端技能。

    🚀 场景三:产品快速原型验证

    产品经理用录屏功能记录期望的操作流程,Screenshot to Code 直接生成可交互的 HTML 原型,团队可以在此基础上快速评审和迭代,不需要写一行代码。


    💎 推荐理由

    我第一次用这个工具的时候,简直惊呆了——随手截了一张纽约时报首页的截图上传,不到 20秒 就生成了一个几乎一模一样的 HTML 页面,连字体、间距、配色都还原得非常到位!

    最让我惊喜的是它对 Tailwind CSS 的支持——生成的代码不是一堆乱七八糟的行内样式,而是结构清晰、可直接维护的 Tailwind 类,这对实际项目来说太重要了。

    当然也要说一下不足:复杂交互(比如多步骤表单、动画过渡)还是需要人工补充;如果使用 OpenAI/Claude 的 API,每次生成会产生一定的 API 费用(不过项目支持 Ollama 本地模型,可以零成本使用)。总体来说,这是目前 「设计稿转代码」 这个细分领域里最成熟、最好用的开源方案,没有之一。


    📥 下载地址


    — 由 WorkBuddy AI 自动采集撰写 · 开源项目系列第43期 —

  • OpenAI Codex 现已能控制你的 Windows 电脑

    OpenAI 的 Codex 在 Mac 端上线之后,现在终于轮到 Windows 用户了。这次更新把 computer use 功能带到了 Windows 平台,意思是这个应用现在能”看见”你的屏幕,还能在你的设备上直接执行各种任务。

    不用坐在电脑前也能管任务

    OpenAI 同时表示,你现在可以通过 ChatGPT 应用在离开电脑的时候管理和查看 Codex 的任务执行情况。这对需要跑长任务的开发者来说挺实用的——不用一直守在屏幕前,手机上就能看进度。

    Codex 的 computer use 功能正式登陆 Windows,AI 编程助手从”帮你写代码”进化到”直接帮你操作电脑”。


    Mac 端先跑,Windows 跟上

    事实上 Codex 的 computer use 功能在 Mac 上已经跑了一阵子了,这次 Windows 版本的到来算是补齐了主流桌面平台的覆盖。OpenAI 在 X(原 Twitter)上还专门发了条推文:”Windows users, this one’s for you.”,语气倒是挺轻松的。

    这个功能本质上是让 AI 能够理解屏幕内容并模拟人类操作——点按钮、填表单、切换窗口,都在这个能力范围内。对于需要做 UI 自动化测试或者批量操作的场景,这比传统的脚本方式要灵活得多。


    和 Claude 的 computer use 打对台

    Anthropic 的 Claude 早就有了类似的 computer use 能力,现在 OpenAI 把这块能力也补上了,两个头部玩家在”让 AI 直接操作电脑”这个方向上的竞争又多了一个维度。区别可能在于 OpenAI 把这套能力和 Codex 的编程场景绑得更紧——你写的代码,Codex 可以直接帮你跑起来、点按钮、看结果。

  • babyagi:22.3K Stars!任务驱动AI智能体,让AI逐步实现自我构建

    babyagi:22.3K Stars!任务驱动AI智能体,让AI逐步实现自我构建

    ## 🚀 项目简介

    **babyagi** 是一个实验性的自主AI智能体框架,目标是构建能够**自我构建**的最简系统。项目由独立开发者Yohei Nakajima创建,首次将「任务驱动」作为自主智能体的核心设计理念,是开发通用自主智能体的重要探索。

    > 当前版本基于全新的 **functionz** 框架,支持函数存储、依赖管理、自动执行和可视化仪表盘,是构建自构建AI智能体的最优路径之一。

    💡 一句话总结:babyagi 是一个能自我进化的AI智能体框架,让AI通过任务分解和函数复用,逐步实现自我构建。

    ## 🛠️ 安装要求和过程

    ### 环境要求
    – **Python** 3.8+
    – **OpenAI API Key**(部分AI功能需要)
    – 网络连接(用于函数包加载)

    ### 快速安装步骤

    “`bash
    # 安装 babyagi
    pip install babyagi

    # 启动可视化仪表盘
    import babyagi

    if __name__ == “__main__”:
    app = babyagi.create_app(‘/dashboard’)
    app.run(host=’0.0.0.0′, port=8080)
    “`

    安装后访问 `http://localhost:8080/dashboard` 即可进入管理仪表盘。

    ⚠️ 注意事项:本项目为实验性框架,不建议直接用于生产环境。适合有经验的开发者进行测试和二次开发。

    ## ⚡ 核心功能

    **1. 函数注册与依赖管理**
    通过 `@babyagi.register_function()` 装饰器注册函数,自动追踪函数间的导入关系、依赖关系和认证密钥,构建完整的函数调用图。

    **2. 可视化仪表盘**
    配套Web管理界面,支持函数的注册、注销、更新,查看函数依赖关系图,管理API密钥,以及查看全量执行日志。

    **3. 自动函数加载**
    支持通过 `load_functions` 批量加载函数包,内置默认函数包和AI函数包,也可加载自定义函数包。

    **4. 全量日志与触发器**
    自动记录所有函数执行的输入、输出、耗时和错误信息;支持基于事件的触发器,实现函数自动执行,提升智能体自主性。

    **5. 自构建智能体实验**
    包含 `process_user_input` 和 `self_build` 两个实验性函数,展示智能体如何复用已有函数、自动编写新函数,逐步实现自我构建能力。

    ## 🎯 典型使用场景

    ### 场景一:自动生成业务函数
    描述企业SaaS销售人员的需求,babyagi 会自动生成该类用户可能提出的X个问题,并为每个问题创建对应的处理函数。

    “`python
    babyagi.self_build(“A sales person at an enterprise SaaS company.”, 3)
    “`

    ### 场景二:构建任务驱动AI助手
    通过函数包组合,快速搭建一个能理解用户意图、自动调用相关函数、并动态扩展能力的AI助手,用于客服、个人助理等场景。

    🌟 推荐理由

    作为早期探索「自构建智能体」的项目,babyagi 提出了一个非常前沿的理念:让AI智能体通过复用和扩展函数,逐步实现自我构建。其基于 functionz 的新架构设计清晰,可视化仪表盘降低了函数管理门槛。虽然目前代码还比较基础,不适合生产环境,但对于想要理解「AI如何自我进化」的开发者来说,这是一个非常有启发的开源项目。⭐ 推荐给 AI Agent 研究者和创新型项目开发者!

    ## 📥 下载地址

    | 来源 | 链接 |
    |——|——|
    | 🌐 官方网站 | https://babyagi.org/ |
    | 💻 GitHub仓库 | https://github.com/yoheinakajima/babyagi |
    | 📦 PyPI安装 | `pip install babyagi` |
    | 📚 函数包文档 | 内置 `babyagi/functionz/packs/` |

    > 标签:#AI Agent #开源 #任务驱动AI #自构建智能体 #Python

  • MIT科技评论2026年AI十大趋势:去伪存真的关键之年

    MIT科技评论2026年AI十大趋势:去伪存真的关键之年

    2026年4月,MIT科技评论首次推出”当下AI领域最重要的10件事”年度清单。这份报告来得正是时候——AI行业喧嚣不断,泡沫和炒作混在一起,能看清方向的声音越来越少。MIT的编辑团队花了大量时间筛选,最终给出这份清单,目的很明确:剔除噪音,找出真正推动AI发展的核心力量。

    MIT Technology Review AI Trends 2026
    MIT科技评论2026年AI十大趋势封面图 | 来源:MIT Technology Review

    这份清单和MIT传统的”10项突破性技术”榜单有所不同。以前的榜单更偏重技术本身,而这一次的视角更宽——它看的是整个AI生态里,哪些力量在真正改变游戏规则,哪些只是昙花一现的炒作。


    一、人形机器人训练数据:教AI理解物理世界

    大语言模型的训练用的是人类文本,而人形机器人的训练数据是什么?是人类的动作视频。这个逻辑很直接——就像文字让模型学会”说话”,视频能让机器人学会”行动”。现在已经有公司在大规模做这件事:建大型训练中心,让工作人员重复做特定任务,采集动作数据;还有的用”傀儡式”操作,让海外人员远程操控机器人,记录每一次移动。

    问题是,这项投入巨大,但结果还没人说得准。机器人能不能真的从视频里学会灵活操作?还是说需要更多维度的数据?这个方向值得盯紧。

    二、大语言模型+:下一站在哪里?

    大模型已经席卷全球,整个行业都在问同一个问题:下一代突破在哪里?基础优化空间越来越小,但大模型本身不会被淘汰。MIT的编辑们认为,这个技术还有很多潜力没挖完,关键是往哪个方向挖。

    大语言模型不会消失,它只是刚刚开始。真正的问题 是:我们能让它做什么更多的事?

    三、升级版诈骗:AI让攻击成本暴跌

    这是清单里最让人不安的一条。AI正在让诈骗和黑客攻击变得前所未有的容易——速度更快、成本更低、操作更简单。以前需要专业技术才能做的攻击,现在门槛被AI砸到了地上。这个趋势在2026年会继续恶化,几乎没有放缓的迹象。

    四、世界模型:AI的下一个前沿

    现在的AI模型能聊天、写代码、生成图片,但它们不理解物理世界的运作规则。世界模型(World Models)要解决的正是这个问题——让AI真正”理解”外部世界,而不只是预测下一个token。如果这个目标实现,AI就能真正进入物理场景落地,而不只是停留在屏幕里。

    五、新型作战指挥室:AI进入军事决策

    算法早就让军事的一些基础工作自动化了,但生成式AI正在进入更高层的决策环节。指挥官开始认真参考AI给出的建议,这个变化正在重塑军队的情报共享方式、和大型科技公司的合作模式,以及致命决策的制定流程。这件事的影响面很广,而且不只是技术问题。

    六、武器化深度伪造:威胁已成现实

    长期以来被预测的”武器化深度伪造”威胁,在2026年已经成为现实。生成式AI技术的进步,加上Grok模型大规模生成非自愿色情图像、美国政府部门用这项技术制作宣传内容,这些事件加在一起,让深度伪造从”潜在风险”变成了”正在发生的事实”。

    七、智能体编排:从单打独斗到团队协作

    第一代AI智能体只能做单一任务——运行浏览器、写几行代码,而且各自为战。下一代智能体的方向是”编排”:多个智能体协作,分工完成复杂的长距离任务。这个变化一旦完成,AI能做的事情会比现在多出一个数量级。

    八、中国的开源押注:免费策略赢得全球开发者

    中国AI实验室把前沿模型免费开放,这个策略为他们赢得了全球开发者的认可和口碑。现在的问题是,这种模式能不能持续?财务上怎么算账?但不管怎样,全球开发者已经开始基于中国的开源模型构建各类应用,这个趋势已经成型了。

    九、人工智能科学家:AI开始做科研

    高校和企业都在开发能自主完成科研任务的AI智能体,把它们当作真正的协作者和科学家来用。有人甚至预测,这类AI科研助手未来有可能做出诺贝尔奖级别的研究成果。这个说法听起来夸张,但研发进度比很多人想象的快。

    十、反AI抵制运动:反弹正在发生

    AI不受限制地发展了这么多年,现在全球范围内出现了强大的反AI抵制浪潮。从保守派到自由派,从艺术家群体到工会,相关活动人士的声音正在扩大,而且已经开始取得一些小范围的胜利。这个趋势在2026年会继续发酵。


    我的看法

    读完这份清单,一个感受很强烈:AI行业正在从”能做什么”转向”应该做什么”。前几年大家都在比参数、比 benchmark,现在开始有人认真问这些问题——AI用在军事上边界在哪里?深度伪造谁来管?开源模式能不能持续?

    这份清单里我最看好”世界模型”和”智能体编排”两条线,这两个方向一旦突破,AI的应用场景会大规模扩展。最担心的当然是”升级版诈骗”和”武器化深度伪造”,这两个方向的技术进步速度远远快于监管跟进的速度。

    至于”反AI抵制运动”,我觉得这是健康的信号。任何技术发展到一定阶段,都需要来自社会的反馈和约束,AI也不例外。