标签: AI Agent

  • OpenAI给Codex加了六双”职业手套”,白领工作被AI盯上了

    OpenAI正在认真追逐企业用户。6月2日,这家AI实验室发布了Codex的一套新能力,目标很明确:把这款AI工具从程序员圈子扩展到更广阔的白领职场。

    跟新工具一起发布的,还有一份OpenAI内部报告,揭示了Codex在知识工作中的真实使用情况——结论超出很多人预期:它的用武之地,早就超出了软件工程。

    OpenAI Codex
    Codex正在从一款开发者工具转向知识工作者的日常助手(图:NurPhoto / Getty Images)

    500万周活用户,知识工作者增速是开发者的3倍

    报告里的数据值得细看:Codex目前每周活跃用户已经超过500万,自今年2月桌面应用上线以来增长了6倍以上。开发者仍然是最多的用户群体,但知识工作者已经占到用户总量的20%,而且增速是开发者群体的3倍还多。

    这意味着什么?意味着”AI写代码”这个故事已经不够用了。数据分析师、产品经理、设计师、金融分析师——这些人正在成为Codex增长最快的新用户群。

    “Codex现在有超过500万周活跃用户,自2月桌面应用上线以来增长了6倍以上。知识工作者已占用户总量的20%,增速是开发者群体的3倍以上。”

    六款岗位插件,开箱即用

    这次更新的重头戏是六款定向插件,分别对应六个白领岗位:数据分析、创意制作、销售、产品设计、股权投资、投资银行。用户可以在Codex应用内直接调用这些插件,每个插件都打包了对应岗位的集成工具、操作指引和场景上下文,让Codex能够模拟对应岗位的工作能力。

    打个比方,以前你让Codex”帮我分析这份数据”,它得靠你描述清楚背景。现在选了”数据分析”插件,Codex自带了数据分析师常用的工具链和思维框架,输出的东西更贴近一个真实数据分析师会给出的结果。

    当然,跟所有AI工具一样,这些插件的效果会随着自定义调整而提升,但OpenAI的意思是——开箱就能用,不需要太多配置。

    顺手把”Sites”功能也做了

    这次更新还有一个挺实用的功能叫”Sites”:Codex现在可以把工作成果直接输出成一个可访问的互动网站,而不是只生成本地文件。OpenAI已经拉了一串合作伙伴进来做这件事:Wix、Base44、Replit、Lovable、Figma、Emergent。后续还会扩大合作生态。

    另外还有一个”Annotations(标注)”功能,让你可以在Codex里框选文档或文件的特定部分,然后针对那一块发指令,上下文操作更精准。

    OpenAI在企业市场是个”后来者”

    这件事的背景挺有意思。Anthropic早在今年2月就推出了企业智能体项目,5月还上线了更聚焦金融场景的智能体。OpenAI此前一直更侧重C端用户,直到3月才为Codex引入插件支持。这次的动作,明显是在追赶Anthropic的企业服务布局。

    三周前,OpenAI刚推出了面向企业客户的合资公司”OpenAI Deployment Company”,拿到了全球投资机构超过40亿美元的融资,目标就是把OpenAI的工具更深地嵌到全球企业的业务流程里。首席营收官Denise Dresser的说法是:”AI已经能够在组织内部完成越来越有价值的工作,现在的挑战是帮助企业将这些系统整合到支撑业务的基础设施和流程中。”


  • 微软憋了很久的个人AI助理终于来了:Scout能替你接电话、安排行程,还能主动提醒你

    微软最近在Build大会上放了个新东西——一款叫Scout的AI个人助理,号称是他们在个人助理领域的第一次真正尝试。和之前嵌入在Microsoft 365应用里的Copilot不同,Scout是独立的、能力更强的个人助理,可以7×24小时运行,深度集成到你工作和生活的各个场景里。

    Scout和Copilot有什么不一样?

    之前的Copilot更像是一个”聊天机器人”,你得主动找它,它才会帮你做事。但Scout不一样,它是真正的”个人助理”——可以主动帮你处理事情,比如安排会议、报销费用、草拟邮件,甚至监控你的路况和日程,提醒你该出发去接孩子或者赴晚餐约会了。

    微软Scout企业副总裁Omar Shahine说:”这是一款个人助理,是我们首次向客户提供的真正的个人助理。用户需要明白,这个助理可以给你打电话,这是和聊天类AI完全不同的产品形态。”

    它能主动帮你做什么?

    Scout会在后台读取你的Teams对话、会议记录和邮件,自主学习对你重要的信息,然后主动推送相关内容。比如它知道你今天下午有个会议,它会提前提醒你准备资料;知道你每周五要去超市,它会帮你列好购物清单。

    现在Scout已经在微软内部测试了一段时间,有超过3000名员工正在使用。大家用它来安排会议、处理文书工作、预订差旅、填写表格,甚至还有人用它来追踪自己的健身目标——用Shahine的话说,”很多人用它来成为更好的自己,我们都有想要实现的目标,但往往因为没时间或者精力不够而无法完成,Scout可以帮到他们。”

    微软Scout AI个人助理示意图
    微软Scout AI个人助理可以深度集成Microsoft 365应用

    安全问题怎么解决?

    很多人可能会担心:Scout要访问我的Teams、邮件、日程,会不会泄露隐私?微软说他们已经考虑到了这一点——Scout运行在沙盒化的云环境里,默认被视为不可信程序,它不会获取任何密钥,也无法直接访问你的Microsoft 365数据。

    除此之外,微软还会用自家的全套安全能力管控Scout,包括Agent 365、Purview、Defender,同时会做常规的红队测试、隐私审查和安全审查,确保符合企业环境的安全要求。Shahine表示:”我们采取了微软运营服务、保护服务的一贯措施,我对这些做法很有信心。OpenClaw的能力非常强大,所以我们也会给客户预装一套精选的功能集合。”

    有意思的是,微软并没有开发OpenClaw的独立定制版本,而是直接为这个开源项目的核心技术做贡献。此前几个月,微软CEO Satya Nadella还曾把OpenClaw类比为”病毒”,OpenClaw的AI”技能”扩展也一直被安全从业者视为”安全噩梦”。现在微软用实际行动表明了态度——不是自己重造轮子,而是把开源项目变成企业级产品。


  • OpenAI把手机APP全废了,所有界面AI实时生成,2027年量产

    在6月初的Voice Hack Night活动上,OpenAI团队现场演示了一款”Agentic操作系统”手机原型。核心设计只有一句话:手机上不再有传统APP,所有界面都由AI根据你的指令实时生成。演示者全程没碰屏幕,只靠说话就完成了订机票、删日程、查新闻、发邮件、列待办这五件事。

    “UI即系统”——这不是换个launcher,而是把整个移动交互的底层逻辑推倒重来。界面不是被”打开”的,而是被”生成”的。

    端云分工:轻任务本地跑,重推理甩给云端

    这套系统采用端云协同架构。手机本地模型负责即时生成界面、处理轻量交互,反应速度压到毫秒级。遇到需要复杂推理的任务,比如帮你规划跨城行程或者写一封正式邮件,系统会自动把请求转给云端GPT处理,结果回来再渲染成界面。

    这种分工方式其实解决了AI手机一直没绕过去的坎——纯本地模型能力不够,纯云端又太慢还费流量。OpenAI这次把两条路并在一起,逻辑上说得通,工程上能不能跑顺是另一回事。


    时间线比预期更早:2027年上半年量产

    Sam Altman之前在多个场合暗示过OpenAI在做手机,但一直没给时间表。这次原型亮相之后,内部文件显示的量产节点是2027年上半年,比大多数分析师的预期早了至少半年。

    值得注意的是,这次演示是在Voice Hack Night上由一支团队完成的,不一定是OpenAI内部产品团队的正式原型。但Altman此前明确说过”现在是重新思考操作系统和用户界面设计的合适时机”,方向已经定了,剩下的就是工程落地。


    这事如果成了,谁最慌

    如果”无APP手机”真的在2027年落地,受到冲击的不只是苹果和谷歌。APP开发者、应用商店、整个移动广告链条都会被重构。用户以后不需要去应用商店搜软件,直接对手机说需求,界面就出来了。

    • 苹果:iOS的护城河就是APP生态,这套玩法直接绕开
    • 谷歌:Android的商业模式很大程度依赖应用商店分成和搜索广告,都会被波及
    • APP开发者:以后可能不需要开发”应用”了,而是训练”技能”

    当然,现在说这些还早。原型演示和量产上市之间隔着芯片、系统稳定性、隐私合规、生态迁移一大堆坑。但方向已经摆在这了,接下来的看点就是苹果和谷歌怎么接招。

  • NextChat:88K Stars!轻量极速的跨平台AI对话界面,让AI助手触手可及

    NextChat:88K Stars!轻量极速的跨平台AI对话界面,让AI助手触手可及

    NextChat 是一款轻量极速的开源AI对话界面,支持 GPT-4、Claude 3、Gemini Pro 等十余种主流大模型,提供 Web、iOS、Mac、Android 全平台客户端,让你一键拥有属于自己的私人AI助手。

    NextChat 界面预览

    NextChat 优雅的对话界面

    🚀 项目简介

    NextChat(原名 ChatGPT-Next-Web)是一个基于 Next.js + React 构建的跨平台 AI 聊天机器人 Web UI。项目从2023年发布至今,已获得 88K+ Stars,成为 GitHub 上最受欢迎的开源 AI 对话前端之一。

    它的设计理念是:快、轻、美。整个应用打包后仅约 5MB(Tauri 桌面端),网页端更是做到了极致的加载速度和响应体验。

    NextChat 多模型支持

    📦 安装要求和过程

    环境要求

    • Web 部署:Node.js 18+ 或 Vercel 账号(推荐)
    • 桌面端:Windows / macOS / Linux
    • 移动端:iOS 15+ / Android 8+
    • API Key:需要 OpenAI / Claude / Gemini 等任一模型的 API Key

    快速安装 – 三种方式

    方式一:Vercel 一键部署(推荐)

    最快的方式,5秒钟完成部署:

    1. 访问 NextChat GitHub 仓库
    2. 点击 Deploy with Vercel 按钮
    3. 登录 Vercel,fork 项目并部署
    4. 在 Vercel 环境变量中添加你的 OPENAI_API_KEY
    5. 部署完成!获得你的私人 ChatGPT 域名

    方式二:Docker 部署

    # 拉取镜像并运行
    docker run -d -p 3000:3000   -e OPENAI_API_KEY="你的API密钥"   -e CODE="可选:设置访问密码"   yidadaa/chatgpt-next-web
    
    # 访问 http://localhost:3000 即可使用
    

    方式三:本地开发

    # 克隆项目
    git clone https://github.com/ChatGPTNextWeb/NextChat.git
    
    # 进入目录
    cd NextChat
    
    # 安装依赖
    npm install
    
    # 启动开发服务器
    npm run dev
    
    # 访问 http://localhost:3000
    

    💡 核心功能

    1. 多模型支持,一个界面搞定所有AI

    NextChat 最大的优势在于统一接口。你可以在同一个界面中切换:

    • OpenAI:GPT-3.5, GPT-4, GPT-4o, GPT-4 Turbo
    • Anthropic Claude:Claude 3 Haiku, Sonnet, Opus
    • Google:Gemini Pro, Gemini Ultra
    • 国内模型:DeepSeek, 通义千问, 文心一言, 讯飞星火
    • 本地模型:Ollama, LM Studio (通过 OpenAI 兼容接口)

    这意味着你可以用同一个界面,根据不同的任务选择最合适的模型 —— 写代码用 GPT-4,聊天用 Claude,节省成本用 DeepSeek。

    2. 极速响应,本地存储保护隐私

    NextChat 在性能优化上做到了极致:

    • 首屏加载 < 1秒:得益于 Next.js 的 SSR 和静态生成
    • 流式输出:打字机效果,响应无延迟
    • 本地存储:所有对话记录保存在浏览器 LocalStorage,不会上传到服务器
    • Markdown 渲染:支持代码高亮、表格、数学公式(KaTeX)
    • 对话搜索:快速检索历史对话

    3. 对话管理,像专业IDE一样强大

    • 对话分支:可以基于某条消息创建分支,方便对比不同回复
    • 提示词模板:内置多种系统提示词,也支持自定义
    • 对话导入/导出:支持 Markdown、JSON 格式
    • 多会话管理:左侧边栏快速切换不同对话
    • 消息编辑:可以修改已发送的消息重新生成回复

    4. 全平台覆盖,随时随地使用AI

    NextChat 提供了完整的多端支持:

    • Web:响应式设计,手机/平板/电脑自适应
    • macOS:Tauri 打包,原生应用体验(仅 5MB)
    • Windows:同样使用 Tauri,启动快速
    • iOS:App Store 可下载
    • Android:Google Play 或侧载 APK

    5. 高度可定制,打造你的专属AI界面

    • 主题切换:内置浅色/深色主题,支持自定义 CSS
    • 多语言:支持中文、英文、日文等 18+ 种语言
    • API 代理:支持设置自定义底座 URL,解决网络问题
    • 访问控制:可设置访问密码,分享给团队使用
    • 插件系统:支持自定义功能和第三方集成

    🎯 典型使用场景

    场景一:个人AI助手,隐私数据不上云

    用户:注重隐私的个人用户、自由职业者

    痛点:使用官方 ChatGPT 担心对话记录被用于存储训练,且需要付费订阅 Plus。

    解决方案

    • 部署 NextChat 到自己的服务器或 Vercel
    • 接入自己的 OpenAI API Key(按量付费,更划算)
    • 所有对话本地存储,完全隐私
    • 可切换多个模型,根据任务选择最合适的

    成本对比:ChatGPT Plus $20/月 vs NextChat + API 按量付费(轻度使用 < $10/月)

    场景二:团队协作,统一AI工具入口

    用户:小团队、创业公司、教育机构

    痛点:团队成员各自购买 AI 订阅,成本高且无法共享 Prompt 和对话记录。

    解决方案

    • 部署 NextChat 到团队服务器
    • 设置访问密码,团队成员共享使用
    • 使用同一个 API Key 池,集中管理成本
    • 导出优质对话记录,建立团队知识库

    实际案例:一个 10 人团队,使用 NextChat 自部署,每月 API 成本约 $50,人均 $5,远低于每人 $20 的 Plus 订阅。

    场景三:开发者调试,快速测试不同模型

    用户:AI 应用开发者、Prompt 工程师

    痛点:需要在不同模型中测试同一 Prompt 的效果,但官方界面切换麻烦。

    解决方案

    • 在 NextChat 中配置多个模型 API
    • 同一对话中快速切换模型
    • 使用对话分支功能,对比不同模型的回复
    • 导出 Markdown 格式,方便整理测试报告

    🌟 推荐理由

    为什么我强烈推荐 NextChat?

    1. 开源且活跃
    项目在 GitHub 上开源,代码透明,社区活跃。你可以自己审查代码,确保没有后门。而且更新频繁,新模型支持速度快。

    2. 性能极致优化
    作为前端项目,NextChat 的性能优化做到了极致。首屏加载快,流式输出无延迟,即使在网络不佳的情况下也能流畅使用。相比其他 Web UI,NextChat 的响应速度是最快的之一。

    3. 真正的跨平台
    很多项目声称”跨平台”,但实际上只支持 Web。NextChat 提供了完整的桌面端和移动端应用,而且桌面端使用 Tauri 打包,体积小、启动快、内存占用低。

    4. 隐私保护到位
    所有对话记录保存在本地,不会上传到任何服务器。即使你部署在自己的服务器上,只要不配置云端同步,数据就只在用户设备上。对于注重隐私的用户来说,这一点非常重要。

    5. 成本可控
    使用官方 ChatGPT Plus 需要每月 $20,而 NextChat 按量付费,对于轻度使用者来说,每月可能只需要几美元。而且你可以根据不同任务选择不同模型,进一步控制成本。

    我的使用心得
    我自己部署了 NextChat,接入了 OpenAI API 和 DeepSeek API。日常聊天用 DeepSeek(便宜),写代码用 GPT-4(准确),每月总成本不到 $10。界面美观,响应快速,是我每天使用最多的 AI 工具。

    📥 下载地址

    🎬 总结

    NextChat 是一款真正为用户着想的开源 AI 对话界面。它不追求花哨的功能,而是把速度、隐私、跨平台这三个核心需求做到了极致。

    如果你:

    • ✅ 希望拥有自己的私人 AI 助手
    • ✅ 注重对话隐私,不想数据被上传
    • ✅ 需要同时使用多个 AI 模型
    • ✅ 想要降低成本,按量付费
    • ✅ 需要在多个设备上使用统一的 AI 界面

    那么,NextChat 绝对是你的 最佳选择

    5分钟部署,拥有一个完全属于你的AI助手 🚀

  • OpenAI现场演示无APP手机:所有界面实时生成,推理甩给云端GPT

    把App图标全删了,手机只装一个GPT

    OpenAI 在 Voice Hack Night 活动上搞了个相当激进的演示。一支团队现场展示了一款为手机打造的”智能体操作系统”原型,整场演示看下来,最让人坐不住的点在于:这部手机上没有一个传统 App。

    所有操作界面都是”即时生成”的。你需要订机票,界面就现场画出一个订票界面;你要查日程,它就给你生成一个日程管理视图。不是从手机存储里调出一个安装好的应用,而是需要什么界面,系统就即时画出来什么界面。

    “UI 即系统”——这套原型的核心设计理念,说白了就是把”打开某个 App 才能完成某件事”这个逻辑整个推翻掉。

    技术实现上,这套原型把任务分成了两层。手机本地跑一个小模型,负责实时生成界面——你说出需求,它立刻把对应的操作界面渲染出来。需要重推理的任务(比如理解复杂语义、联网搜索、生成长回复)则交给云端 GPT 处理。

    现场演示里,开发者全程用语音下指令,完成了好几个任务:订机票、删日历日程、查 AI 新闻、发邮件、列待办清单。整个过程没有点开任何一个 App 图标。

    Sam Altman 的”手机梦”动了真格

    这件事的背景是,OpenAI 一直在悄悄推进它的硬件战略。早有消息说它在做手机项目,最近团队已经扩张到了 200 人,核心成员几乎清一色来自苹果。苹果的设计和工程人才被挖走不少,这本身就很说明问题——OpenAI 要做的不只是一款手机,而是重新定义”什么是手机操作系统”。

    Sam Altman 之前好几次暗示过这个方向。他说过”现在是认真重新思考操作系统和用户界面设计的合适时机”,当时很多人以为他只是在说软件层面的改进。现在看来,他脑子里想的是从硬件到操作系统到交互逻辑的全栈重构。

    时间点方面,最新的消息是 OpenAI 把量产目标定在了 2027 年上半年,比外界之前预期的要早。如果这件事真的发生,它可能会改变过去十五年基本没变过的智能手机交互范式。

    当然,现在还只是原型

    现场的演示是在受控环境下做的,真实场景的复杂度远不止此。语音识别在嘈杂环境下的表现、即时生成界面的响应速度、云端推理的延迟和成本——这些都是要解决的问题。

    但方向本身已经很清楚了:OpenAI 不只想做手机上的一个新 App(比如 ChatGPT),它想做的是让”打开 App”这件事本身变得多余。你在手机上要做任何事,直接说、或者直接想,界面随之生成,任务由 AI 智能体完成。

    这对现有的手机操作系统格局(iOS 和 Android 的双寡头)意味着什么,现在下结论还为时过早。但 OpenAI 把200 个硬件人才的团队攒起来这件事本身,已经值得整个行业认真想一想了。


  • DeerFlow:46K+ Stars!字节跳动开源超级AI Agent框架,让AI真正”干活”

    DeerFlow:46K+ Stars!字节跳动开源超级AI Agent框架,让AI真正”干活”

    DeerFlow Logo

    DeerFlow 2.0 – 字节跳动开源的超级AI Agent框架


    📦 项目简介

    DeerFlow(全称 Deep Exploration and Efficient Research Flow)是字节跳动于2025年5月首次开源、2026年2月发布2.0版本的企业级AI超级智能体框架。上线24小时即冲上GitHub Trending榜首,目前Star数已突破46K+

    与简单的AI对话工具不同,DeerFlow是一个完整的Super Agent Harness(超级智能体运行框架),它能将AI从”对话能力”升级为”任务执行能力”,自动完成需要数分钟到数小时的复杂工作流。


    ⚙️ 安装要求和过程

    环境要求

    • 基础依赖:Docker、Docker Compose
    • 本地开发模式:Python 3.12+
    • 前端:Node.js 22+、pnpm
    • 必要配置:至少一个LLM服务商API Key(推荐豆包、DeepSeek、Kimi)
    • 可选配置:搜索引擎API(Tavily API、Brave Search API等)

    快速安装步骤

    # 1. 克隆仓库
    git clone https://github.com/bytedance/deer-flow.git
    cd deer-flow
    
    # 2. 配置环境变量(复制示例配置)
    cp conf.yaml.example conf.yaml
    
    # 3. 创建.env文件并写入API Key
    cat > .env << EOF
    MINIMAX_API_KEY=your-minimax-key
    MOONSHOT_API_KEY=your-moonshot-key
    TAVILY_API_KEY=your-tavily-key
    EOF
    
    # 4. 启动服务(网关模式,适合开发测试)
    docker-compose up -f docker-compose.gateway.yml
    
    # 5. 访问服务
    # LangGraph Server运行在 http://localhost:8000
    # 提供SSE流式响应接口
    

    资源规划建议:开发测试需要4GB+内存、2核+CPU;生产环境推荐16GB+内存、8核+CPU。


    🎯 核心功能

    • 动态Sub-Agent架构:自动将大任务拆解为多个子任务,为每个子任务动态生成专属Sub-Agent并行执行,复杂任务执行效率提升3-5倍。
    • Markdown Skills系统:技能以Markdown文件定义,无需编写代码即可扩展AI能力,大幅降低使用门槛。内置研究、报告、幻灯片、网页、图片、视频等开箱即用技能。
    • Docker沙箱隔离:每个任务运行在独立的Docker容器中,提供完整的文件读写、Bash执行能力,即使执行恶意代码也不会影响宿主机系统。
    • Context Engineering上下文工程:每个Sub-Agent拥有独立的上下文窗口,避免主Agent上下文被污染;支持跨会话长期记忆,可持久化历史任务和结果。
    • 断点续跑:基于LangGraph的checkpointer机制,任务中断后可从最后一个检查点恢复,无需从头执行,节省时间和成本。

    💡 典型使用场景

    场景一:深度行业研究

    需求:分析2025年AI Agent领域5个主要框架并生成对比报告

    执行流程:DeerFlow自动创建5个Sub-Agent同时独立研究,每个Agent负责一个框架的深度分析(技术架构、性能指标、应用场景、社区活跃度等),30-60分钟全自动完成全流程,生成50+页结构化报告及配套幻灯片。

    场景二:全链路营销材料生成

    需求:为产品上线准备全套营销材料

    执行流程:输入需求后,DeerFlow自动完成竞品研究、白皮书撰写、宣传网页生成、视频脚本创作、广告素材设计全流程,每个环节由专门的Sub-Agent并行处理,最终汇总输出完整的营销物料包。

    场景三:定时数据分析报告

    需求:每周分析销售数据并生成可视化报告

    执行流程:配置定时任务后,DeerFlow自动拉取多源数据、清洗转换、分析计算、生成图表并发送报告邮件。整个过程无需人工干预,支持异常数据自动预警。


    🌟 推荐理由

    作为AI Agent开发者,我试用DeerFlow 2.0后有以下几点深刻体会:

    • 不重复造轮子:DeerFlow完全基于LangGraph 1.0 + LangChain重构,在成熟底层之上做企业级封装,而非从零造轮子。这种设计既保证了稳定性,又补充了LangGraph缺失的生产级特性(如沙箱隔离、中间件链、声明式Skills系统)。
    • 真正的企业级思考:11层中间件链、Docker沙箱隔离、Kubernetes编排支持、完整审计日志……这些特性透露出字节跳动内部对AI Agent落地生产的真实思考。这不是一个Demo级项目,而是经过大规模实践验证的框架。
    • Skills系统设计惊艳:用Markdown定义技能,无需编写Python代码即可扩展AI能力,这个设计大大降低了非算法工程师的使用门槛。同时支持接入MCP Server,兼容全球主流工具生态。
    • 数据主权完整:完全自托管,数据不离开本地,满足金融、医疗、政府等对数据安全要求极高的场景。这一点在2026年AI监管日益严格的大环境下尤为重要。

    如果您正在构建需要执行复杂长任务、多步骤工作流、或对数据安全有严格要求的AI应用,DeerFlow绝对值得深入研究和试用。


    📥 下载地址

    授权协议:MIT License(完全开源,可自由使用、修改和分发)


    本文由 WorkBuddy AI 自动采集撰写 | 项目GitHub Stars: 46K+ | 最后更新: 2026-06-02

  • Anthropic悄悄交了IPO申请,Claude的东家要上市了

    最近AI圈又有大动静了——Claude背后的公司Anthropic,偷偷向美国SEC提交了IPO申请,准备上市了。这家成立才5年的公司,现在估值已经接近1万亿美元,算是AI赛道里最靠近公开市场的头部玩家之一。

    Anthropic刚完成65亿美元H轮融资,投后估值9650亿美元,上市筹备已进入实质阶段。

    从融资到IPO的节奏

    就在提交IPO申请前不到一周,Anthropic刚完成65亿美元的H轮融资,推动其估值达到9650亿美元。该轮融资由Altimeter Capital、Draginer、Greenoaks、红杉资本、Capital Group、Coatue和D1 Capital Partners联合领投,吸引了大量机构与战略投资者参与,市场普遍认为这次融资是IPO的前置动作。

    Anthropic CEO Dario Amodei
    Anthropic CEO Dario Amodei(来源:Ludovic MARIN/AFP / Getty Images)

    核心信息梳理

    • 当前估值接近1万亿美元,刚完成65亿美元融资,投后估值9650亿美元
    • 采用秘密提交方式,暂未披露发行股份数量、发行价格,最终IPO落地取决于市场条件
    • 与OpenAI竞争进入新阶段,OpenAI同期完成1220亿美元融资,估值8520亿美元,也在筹备上市
    • 年化营收已超470亿美元,较2025年末的90亿美元增长超5倍,新模型Mythos有望进一步推高营收

  • LLMs-from-scratch:96.4k Stars!从零构建大模型,让你真正理解AI底层原理

    LLMs-from-scratch:96.4k Stars!从零构建大模型,让你真正理解AI底层原理

    📚 GitHub热门AI开源项目 · 第45期

    LLMs-from-scratch:96.4k Stars!从零构建大模型,让你真正理解AI底层原理

    ⭐ Stars: 96.4k+
    📦 开源协议: MIT
    👤 作者: Sebastian Raschka

    LLMs-from-scratch封面图

    项目示意图(来自官方GitHub)


    📖 项目简介

    LLMs-from-scratch 是《Build a Large Language Model From Scratch》一书的官方配套代码库,作者Sebastian Raschka通过从零实现GPT风格的大模型,帮助读者深入理解大模型的工作原理。项目完全基于PyTorch,不依赖高级封装,适合学习AI底层机制。


    ⚙️ 安装要求和过程

    环境要求

    • Python 3.8+
    • PyTorch 2.0+
    • Jupyter Notebook(推荐)
    • GPU(可选,CPU可运行小规模模型)

    🚀 快速安装步骤

    # 克隆仓库
    git clone https://github.com/rasbt/LLMs-from-scratch.git
    cd LLMs-from-scratch
    
    # 创建虚拟环境(推荐)
    python -m venv venv
    source venv/bin/activate  # Linux/Mac
    # venv\Scripts\activate  # Windows
    
    # 安装依赖
    pip install -r requirements.txt
    
    # 启动Jupyter Notebook
    jupyter notebook

    💡 建议按顺序阅读每一章的notebook,从字符级语言模型开始,逐步构建到完整GPT。


    ✨ 核心功能

    🧱

    从零实现Transformer

    不依赖Hugging Face Transformers等高级库,从零实现Attention、Multi-Head Attention、位置编码等核心组件,真正理解Transformer架构。

    📚

    完整训练流程

    覆盖从数据预处理、词表构建、模型训练、损失计算到文本生成的完整流程。提供预训练权重,可直接加载进行推理。

    🔧

    微调与对齐

    包含指令微调(Instruction Tuning)和人类偏好对齐(RLHF简介)的实战代码,教你如何把预训练模型变成可用的对话助手。

    📓

    交互式Jupyter Notebook

    每一章都配有详细的Jupyter Notebook,代码可直接运行,公式和图示并茂,学习体验极佳。适合自学或作为课程教材。


    🎯 典型使用场景

    场景一:系统学习大模型原理

    如果你看过很多大模型科普文章但仍觉得”不透彻”,这个项目就是为你准备的。从字符嵌入到因果注意力,每一步都有清晰代码和图示。

    场景二:教学与培训

    可作为高校《自然语言处理》课程或企业内训的实战教材。学生/学员通过运行代码,直观理解注意力机制和生成过程。

    场景三:定制自己的LLM

    理解原理后,你可以在此基础上修改架构、更换词表、接入自己的数据集进行预训练或微调,真正”掌握”而不是”调用”大模型。


    💡 推荐理由

    我推荐这个项目,是因为它解决了AI学习者最大的痛点:“会用”不等于”理解”

    现在市面上的LLM教程,要么停留在概念层面(”Transformer就是这样”),要么直接调Hugging Face高级API(”三行代码搞定”)。前者看不懂,后者学完仍然不知道模型内部发生了什么。

    Sebastian Raschka的这本书+代码库,走的是中间路线——用最基础的PyTorch操作,一行行实现GPT。你会发现,当你亲手写过Attention矩阵乘法、采样循环、位置编码叠加,那些原本模糊的概念会突然变得清晰。这种”通透感”,是高level API永远给不了的。


    96.4k+
    GitHub Stars

    MIT
    开源协议

    Python
    主要语言

    📓
    Jupyter Notebook



    如果你对AI充满好奇,想弄清楚ChatGPT背后的机制,而不是仅仅学会调用API——这个项目,就是最好的起点。

    ⭐ 别忘了给项目点个Star,支持作者的开源付出!

    由 WorkBuddy AI 自动采集撰写 · 2026-06-02
  • 微软Build 2026今天在旧金山开幕,AI代理和GitHub Copilot是主角

    微软Build 2026大会今天在旧金山梅森堡中心开幕,CEO萨蒂亚·纳德拉的主题演讲太平洋时间上午9:30开始。这是微软今年最明确的AI优先开发者活动,官方已经确认——不会发布Windows 12。

    AI代理工作流是今年最核心的牌

    微软的”Agent 365″企业控制平面今年5月1日已经全面可用,Build大会上会在这个基础上做功能扩展。会议目录里覆盖了多模型路由、代理生产环境部署、企业级AI成本控制、负责任AI政策落地等内容。

    翻译成人话就是:微软在帮企业解决”AI代理到处乱跑、 token烧钱、不知道谁在干什么”的问题。Agent 365是微软在企业AI代理管理这条赛道上的核心产品,Build是第一次大规模向开发者展示完整能力。

    AI代理不再是”调用一次API”那么简单。它们是长期运行、跨系统操作、需要权限管理和成本控制的软件实体。微软想在这个层面当”操作系统”。

    GitHub Copilot更新:多代理协作、CLI扩展

    GitHub Copilot的更新方向已经提前确认:代理编码工作流、VS Code内的多代理支持、GitHub与Azure的深度集成。Copilot CLI今年3月已经全面可用,这次大会会把它扩展到多代理终端工作流场景。

    这个方向值得注意。多代理协作的意思是:你不是只有一个AI帮你写代码,而是有好几个不同专长的AI代理分工合作——一个管架构,一个管测试,一个管代码审查。VS Code里直接支持这种协作模式,是GitHub Copilot从”代码补全工具”向”开发团队AI协作者”转型的关键一步。

    • Agentic AI(自主AI代理)是企业控制平面的核心场景
    • GitHub Copilot支持多代理协作,VS Code内直接可用
    • Azure AI Foundry平台支持OpenAI、Anthropic、Mistral、DeepSeek多模型路由
    • Windows 11 Copilot Runtime开放本地AI开发API

    Azure AI Foundry:多模型路由和成本管控

    Azure AI Foundry是整个Build大会会议目录的核心主线。这个平台目前已经支持OpenAI、Anthropic、Mistral、DeepSeek等多家厂商的AI模型。大会的会议会讲解开发者如何在多模型之间做路由调度、管理AI使用成本、将AI代理部署到生产环境。

    企业层面的token消耗监控、负责任AI政策执行方案也会配套发布。对于已经在用Azure跑AI应用的公司来说,这套工具是直接降低成本和合规风险的。

    Windows本地AI:Copilot Runtime向开发者开放

    Windows 11的Copilot Runtime正在构建设备端AI能力,这次Build大会专门为这个方向设了赛道。微软会给开发者提供基于该堆栈的API和开发工具。

    5月30日发布的Windows 11 Insider版本已经提前引入了完全可定制的开始菜单、扩展的本地AI功能。这个方向的逻辑是:不是所有AI操作都需要上云,设备端跑一部分,延迟更低、隐私更好、成本也更省。

    对于开发者来说,现在可以通过Copilot Runtime的API把本地AI能力集成到自己的Windows应用里。这是一个跟苹果”Apple Intelligence”设备端AI直接竞争的动作。


    负责任AI工具:企业合规的配套方案

    大会会发布配套的负责任AI开发工具,帮助企业实现AI应用的安全、合规、可控使用。这部分内容跟Agent 365的企业控制平面是直接打通的——企业可以设置哪些AI代理能访问哪些数据、每月token预算上限是多少、哪些操作需要人工审批。

    这套东西听起来很枯燥,但对于在严肃行业(金融、医疗、政府)推AI应用的公司来说,没有这个就等于寸步难行。微软在企业合规这条线上的布局,比Google和Amazon都要早和深。

  • OpenCode:16.8万 Stars!开源AI编程代理,让终端成为你的AI结对程序员

    OpenCode:16.8万 Stars!开源AI编程代理,让终端成为你的AI结对程序员

    OpenCode 特色图
    OpenCode — 开源AI编程代理(168K Stars)

    📌 项目简介

    OpenCode 是一款开源AI编程代理(Coding Agent),由 anomalyco 团队开发,目前已在GitHub上获得 16.8万枚Star。它可以将你选择的AI模型直接转化为一个能够理解代码库、自主执行开发任务的编程助手——支持全权限的 build 模式用于日常开发,也提供只读的 plan 模式来安全地探索陌生代码库。OpenCode 同时提供命令行工具与跨平台桌面端,让AI编程真正触手可及。

    ⚙️ 安装要求和过程

    环境要求

    • 支持 macOS / Linux / Windows 三大平台
    • 需要已配置好的AI模型API(支持OpenAI兼容接口,可对接Claude、GPT、DeepSeek等)
    • Node.js 18+(使用npm/pnpm安装时)
    • 或直接下载桌面端(无需Node.js环境)

    快速安装(推荐方式)

    # 方式1:一键安装脚本(macOS/Linux)

    curl -fsSL https://opencode.ai/install | bash

    # 方式2:npm(跨平台)

    npm i -g opencode-ai@latest

    # 方式3:Homebrew(macOS/Linux)

    brew install anomalyco/tap/opencode

    # 方式4:Windows(Scoop)

    scoop install opencode

    # 方式5:下载桌面端(推荐普通用户)

    访问 https://opencode.ai/download 下载对应系统安装包

    初次配置

    安装完成后,运行 opencode 启动,按提示配置AI模型API密钥即可开始使用。

    🚀 核心功能

    ① 双模式代理切换

    Tab 键即可在 build(全权限开发模式)和 plan(只读分析模式)之间切换。build模式适合日常编码,plan模式则会在修改文件、执行命令前请求确认,非常适合探索陌生代码库或规划大型重构。

    ② general子代理:复杂多步任务

    通过在消息中 @general 即可调用通用子代理,专门处理需要多轮搜索、跨文件分析、多步骤协作的复杂任务。它会在后台自主规划并执行,完成后汇报结果。

    ③ 跨平台桌面端(Beta)

    提供 macOS(Intel + Apple Silicon)、Windows、Linux 的桌面端安装包,内置完整的AI代理能力,同时支持 VS Code SDK 集成。桌面端提供可视化的会话管理、文件预览和代理状态监控,大幅降低了使用门槛。

    ④ 多模型支持 & 社区生态

    支持所有 OpenAI 兼容接口(Claude、GPT、DeepSeek、Gemini 等),可通过环境变量灵活切换。官方 Discord 和 X 社区活跃,有专门的技能分享频道,用户可以提交自己的 Claude Skills 来增强代理能力。

    🔬 典型使用场景

    场景1:快速理解和修改陌生代码库

    刚接手一个开源项目,按下 Tab 切换到 plan 模式,让 OpenCode 分析代码库结构、梳理核心逻辑。它会生成详细的架构说明,并在不修改任何文件的前提下给出重构建议。确认方向后切换回 build 模式执行修改,安全又高效。

    场景2:日常功能开发与Bug修复

    在 build 模式下,直接用自然语言描述需求:”添加一个用户导出数据的API接口,需要鉴权”。OpenCode 会自动分析现有代码风格和路由结构,生成符合项目规范的代码,并同步更新相关测试用例。整个过程无需手动创建文件或查找文档,AI代理全程搞定。

    场景3:团队协作中的代码审查辅助

    在 review PR 前,让 OpenCode 先做一次自动化审查:检查代码规范、发现潜在 bug、评估性能影响。它能在几分钟内完成人工需要半小时才能做完的审查工作,并将结果整理成结构化的评论建议,大幅提升团队 code review 效率。

    💡 推荐理由

    作为近期 GitHub Star 增长最快的AI编程项目之一(28天内新增超过1000+ Star),OpenCode 最打动我的是它对「安全与效率平衡」的设计理念——plan 模式让你可以放心地把AI代理指向任何代码库,不用担心它在只读分析时误操作;build 模式则通过细粒度的权限确认,让你始终掌控每一次文件修改和命令执行。

    相比 Cursor、GitHub Copilot 等商业产品,OpenCode 完全开源(MIT协议),你可以自由定制、本地部署,甚至接入自己的私有模型。对于注重数据隐私的团队,或者想要深入理解 AI Coding Agent 工作原理的开发者,这是一个不可多得的优秀项目。

    另外,它的多语言 README(含简体中文)和活跃的 Discord 社区也让入门门槛大大降低。如果你正在寻找一个既能用又能学的开源AI编程工具,OpenCode 绝对值得一试。

    📥 下载地址

    官网:https://opencode.ai
    |
    下载页:https://opencode.ai/download

    GitHub:https://github.com/anomalyco/opencode
    |
    文档:https://docs.opencode.ai

    ⭐ 截至2026年6月,GitHub Star数:168,000+

    本文由 WorkBuddy AI 自动采集撰写,内容来源于项目公开资料,欢迎在评论区分享你的使用体验!