作者: hiyoho

  • Claude Cowork登陆手机和网页:Anthropic把AI代理带出代码圈

    Claude Cowork 跨设备办公AI代理
    Claude Cowork 想当那个「在后台帮你把杂事干完」的同事(配图由 AI 生成)

    Anthropic 把 Claude Cowork 从桌面搬到了手机和网页上。这款长得像 Claude Code、但面向「通用知识工作」的 AI 代理,今年 1 月先以桌面App的形式上线;从 7 月 7 日这天起,Max 订阅用户能在网页和手机上用上它。也就是说,你可以在办公桌前开个任务,路上用手机看进度,哪怕笔记本合着,回头也能拿到成品。

    这个动作背后的意思很清楚:Anthropic 不想让 Cowork 给人「给小白用的编程工具」的印象,它更想把它做成那种能在后台默默干活、跟着你在不同设备间切换、遇到只有你拍板的事才跳出来问你的「行政搭档」。一句话,写代码的代理大战,正顺着办公区一路烧进其他工位。

    聊天框之外,抢的是「干活的那块地」

    这股劲头不只在 Anthropic 一家身上。OpenAI 的 Codex 走的也是同一条路——它本来是个软件开发工具,现在越来越多被非程序员拿去写报告、理表格、做PPT、搞研究、分析数据。对这两家实验室来说,赌注正从「谁的聊天机器人最聪明」悄悄变成「谁占住了大家真正干活的那块屏幕」。

    Anthropic 没把 Cowork 局限在独立App里。之前它刚推出 Claude Tag——一个常驻在 Slack 里的 Claude,像队友一样待在群里。把 Cowork 做成跨平台应用还有一个实际好处:代理能在后台继续跑任务,不要求某台设备一直在线。

    「把周一的客户准备设在早上 6 点:Claude 过一遍邮件串、会议记录和最近的新闻,把简报文档搭好,跟进邮件也写好但先不发出去。你喝咖啡的时候审一遍就行。」

    Anthropic 自己举了上面这个例子。深活儿还是留在桌面App里干——那里 Claude 能碰本地文件和浏览器;但网页和手机版让没装App的人也能用。聊天和 Cowork 在网页、桌面端先打通,项目和数据产物在两端共享。

    数据说了大实话:它八成不是在写代码

    Anthropic 顺手放出了 Cowork 的早期数据,挺能说明问题。他们抽样了 5 月最后两周、来自 60 多万家组织的 120 万次匿名会话,想看看大家到底拿它干什么。

    • 最大的一块占 33.4%,是「业务流程运转」:把散落的进展汇总成一份报告、做入职清单、对齐表格。这类活儿在财务、人事、行政岗最常见。
    • 排第二的 16.4% 是内容创作和文案:草稿、幻灯片、社媒帖子、方案书,通常是市场和管理的活。
    • 软件开发呢?只占 8.7%。

    Anthropic 自己的总结是:写代码虽然最吸睛,但 AI 在日常业务里的使用正在往上走,而且大家觉得最有用的那类任务,画像越来越清楚。他们把 Cowork 最对味的场景叫做「工作之外的工作」——那些撑起一家公司运转、却往往不是某个人核心职责的杂事。

    所以别被「Claude Code 的亲戚」这个标签带偏了。Cowork 真正想抢的,是每天淹没我们的那堆准备、汇总、草稿和跟进。它能后台跑、跨设备跟人走,这恰恰戳中了很多职场人最头疼的地方。接下来要看的,是它能不能真的把「喝咖啡时顺手审一遍」这件事,做得比人自己动手还省心。

  • SambaNova再融10亿美元、估值110亿:AI芯片烧到了银行金库

    SambaNova AI推理芯片与本地数据中心
    SambaNova 押注「本地推理」,把大模型放进企业的自有机柜里(配图由 AI 生成)

    AI 芯片公司 SambaNova 又拿到钱了。这轮 F 轮融资刚完成「首关」,金额 10 亿美元,估值冲到 110 亿美元,领投方是 General Atlantic。公司 CEO 兼联合创始人 Rodrigo Liang 跟 TechCrunch 说,接下来几周还会有更多投资人进来,第二关很快收尾。距离上一轮 3.5 亿美元的 E 轮,才过去五个月。

    这家 2017 年在加州帕罗奥图成立、如今九岁的公司,节奏明显在加快。今年 2 月它刚发布了新一代芯片 SN50,当时顺手拿了 E 轮的钱;现在 F 轮又来了。Liang 对「要不要一直独立」这个问题打起了太极——他说公司一直有人来打听收购,门没关死,但眼前的势头和增长「大概率会把它推向上市」。

    和英特尔越绑越紧

    SambaNova 跟英特尔的关系,比外界以为的更深。英特尔从 C 轮就是股东,这一轮也跟进了,两边还签了多年的合作,基于英特尔的至强(Xeon)芯片一起做 AI 推理产品,共同开发、共同卖。「这让我们能借英特尔的体量,放大自己的技术」,Liang 是这么说的。去年底彭博还报过英特尔想以约 16 亿美元收购 SambaNova 的消息,谈判最后黄了。

    「摩根大通决定用 SambaNova 做推理方案,这是件大事。它给银行业放了句话:是时候别完全依赖云服务了,这些银行想要的是异构的基础设施。」

    这话说的是一桩新买卖:摩根大通选了 SambaNova 当「推理基础设施伙伴」,用它的 SN40L 和 SN50 系统在银行内部跑安全、私有的 AI 推理。在 Liang 看来,像摩根大通这种级别的银行开始自建私有、安全的推理环境,是一个会超出金融业本身的信号——企业和政府「才刚刚踏上 AI 这条路」,之前的增长都集中在模型公司和前沿实验室手里,剩下的「大把收入」还在桌上。

    把万亿参数模型塞进一个机柜

    SambaNova 给自己找的差异化定位是「高端推理」——专门跑最大的模型,而且跑得快。现在的前沿模型动辄上万亿参数,SambaNova 的卖点就是能把多万亿参数的模型装进单个机柜,从而跑出速度。SN40L 在 2023 年 9 月发布,云上和本地都能用;SN50 今年 2 月亮相,计划 2026 年下半年开始给客户发货,软银是它的第一个部署伙伴。


    Liang 把客户分成三类:一是主权云(政府出钱扶本地伙伴建私有云),二是新锐云(neocloud),三是自己搭设施用的企业。除了摩根大通,沙特阿美、英特尔和一些日本企业也在客户名单上。

    这 10 亿美元主要用来两件事:把生意做大规模,以及在这波「难以置信的需求浪潮」里把供应链锁住。Liang 的原话是,钱要用来确保供应链,好兑现订单、买齐未来 12 个月要交付的材料。本轮跟投的名单很长,Seligman Ventures、T. Rowe Price、Capital Group,还有黑石、卡塔尔投资局(QIA)、Vista Equity Partners 等等都在里面。

    看下来,SambaNova 赌的其实是一个正在发生的转向:当云上的通用算力越来越贵、也越让人不放心,大机构开始想把最关键、最敏感的模型搬回自己的机房。芯片、合作、客户订单,都朝着这个方向摆。至于它最后是被收购还是敲钟上市,Liang 留了个活口——但这个市场里,「总有人来敲门」本身就是一种底气。

  • FunClip:阿里出品的 AI 视频剪辑神器,语音识别 + LLM 智能裁剪,5.9K Stars 让视频剪辑自动化

    FunClip:阿里出品的 AI 视频剪辑神器,语音识别 + LLM 智能裁剪,5.9K Stars 让视频剪辑自动化

    FunClip 界面

    做自媒体的朋友一定有过这样的痛苦:一段两小时的直播回放,只想剪出几句高光金句,却要在时间轴上反复拖拽、听写、对齐字幕。阿里通义语音实验室开源的 FunClip,用语音识别 + 大语言模型把这件事彻底自动化了——上传视频,复制你想保留的文字,点一下,片段就出来了。

    📌 项目简介

    FunClip 是一个完全开源、可本地部署的自动化视频剪辑工具,基于阿里巴巴通义语音实验室开源的 FunASR Paraformer 系列模型对视频做语音识别,用户自由选择识别文本片段或说话人,一键生成对应视频片段,并提供本地 Gradio Web 界面,支持 LLM 辅助智能剪辑。

    ⚙️ 安装要求与过程

    环境要求:仅需 Python 环境(推荐 Python 3.8+);如需内嵌字幕剪辑,需额外安装 ffmpeg 与 imagemagick 及中文字体文件。

    快速安装:

    # 克隆仓库
    git clone https://github.com/modelscope/FunClip.git
    cd FunClip
    # 安装依赖
    pip install -r ./requirements.txt
    
    # 启动本地 Gradio 服务(默认中文 Paraformer)
    python funclip/launch.py
    # 可选:-m fun-asr-nano (31语种) | -m sensevoice (情绪+事件) | -l en (英文)
    #       -p 端口号 | -s True (公网访问)

    启动后访问 localhost:7860 即可使用 Web 界面:上传视频 → 复制需剪辑文本到 “Text to Clip” → 调整字幕 → 点击 “Clip” 或 “Clip and Generate Subtitles”。

    ✨ 核心功能

    • 工业级中文 ASR(Paraformer-Large):阿里开源的顶尖中文语音识别模型,Modelscope 下载超 1300 万次,可精准预测时间戳,自动返回全视频与目标段 SRT 字幕。
    • 热词定制(SeACo-Paraformer):在识别过程中指定实体词、人名等热词,显著提升专有名词识别准确率。
    • 说话人分离(CAM++):集成说话人识别模型,可自动识别 speaker ID,一键剪出特定人物的全部发言片段。
    • LLM 智能剪辑:支持 qwen、GPT 等大模型,结合视频字幕自动推理出高光片段的时间戳;还可选 TwelveLabs Pegasus 视频理解模型,直接“看懂”画面而非仅依赖字幕。
    • 多模型与多语言:2026 年新增 Fun-ASR-Nano(31 种语言高精度)、SenseVoice(情绪识别 + 音频事件检测),并支持英文视频识别剪辑。

    🎬 典型使用场景

    • 自媒体长视频提取金句:把一场发布会、一次访谈原片丢进去,复制想保留的台词,FunClip 自动精准裁出对应时段并生成字幕,做短视频切片效率翻倍。
    • 会议 / 演讲按说话人剪辑:开启说话人分离后,直接剪出某位嘉宾的全部发言,用于整理观点、制作人物集锦,无需手动对照音轨。
    • 视频自动加字幕:识别后一键生成全片 SRT,并可内嵌硬字幕导出,省去逐句听写的繁琐,特别适合教程、纪录片类内容。

    💡 推荐理由

    我自己的使用感受是:FunClip 把“语音识别 → 文本选择 → 视频裁剪”这条链路做到了极简。它不像一些云端剪辑工具那样把数据传上去,而是完全本地运行,隐私可控;Gradio 界面几乎零学习成本,命令行模式又能轻松写进自动化流水线。对做内容创作、知识整理的人来说,它是那种“装好就天天想用”的效率利器。尤其 LLM 智能剪辑的加入,让“我要这段关于乡村振兴的发言”变成一句自然语言指令就能完成。

    🔗 下载地址

    许可协议:MIT(可自由商用与修改)

  • AI诈骗盯上普通人:兄弟俩做了个App专防绑架勒索电话

    你大概也接过那种电话:对方一开口就急吼吼地说家里人出事了,要你马上转账。过去这种骗局门槛高,骗子得先摸清你的底细、还得搞到变声技术,所以主要盯着企业和政府这些”肥肉”。可现在,几秒钟的社交平台音频就能克隆出你亲人的声音,普通人也成了目标。一家叫 Savi Security 的初创公司,就是冲着这个来的。

    一个从自家妈妈被骗开始的念头

    Savi 的两个创始人是一对亲兄弟,Patrick 和 Ryan Coughlin。Patrick 的履历放在安全圈很硬:干过国家级网络防御,待过 Splunk,后来随着收购进了 Cisco,做到安全产品高级副总裁;弟弟 Ryan 则在做消费产品这条线上,先后待过 Apple 和 Spotify。兄弟俩做这家公司,直接导火索是两年前他们妈妈亲身经历的一通电话。

    那天老人家接到一个来电,屏幕上显示的是女儿的号码。电话里她”听见”女儿喊”妈,他们抓到我了”,紧接着一声撕心裂肺的尖叫,然后是威胁:不立刻转 1200 美元,就把人扔在本地 Walmart 停车场弄死。骗子连女儿常去的 Walmart 都报得出来,声音也一模一样。幸好老人家没慌,直接拨给真女儿确认——人才平安。可这一遭,把见过大场面的 Patrick 也震住了。

    手机盾牌保护家庭免受AI诈骗电话
    Savi 想用一层实时防护,挡住越来越逼真的 AI 诈骗

    便宜到离谱的犯罪成本

    Patrick 后来反复想一个问题:以前只用来对付政府和大企业的那套精密手段,怎么就落到普通老百姓头上了?答案大家都心知肚明——便宜又强悍的大模型和生成式 AI。现在从一段三秒钟的公开视频里就能克隆声音,我们随手发在网上的那些碎碎念、给孩子比赛录的像,全成了骗子的素材。

    Patrick 的原话很扎心:AI 正在”制造骗子”,因为它把骗人的门槛降到了地板价。不只是有组织的犯罪团伙,连普通人也被勾着下场。

    数字不会骗人。美国联邦贸易委员会上个月公布,2025 年民众在”冒充类”诈骗里总共损失了 35 亿美元,是 2020 年的三倍。被骗的主力虽然是老年人,但研究机构 Malwarebytes 的数据提醒,Z 世代在短信诈骗里中招率也不低,差不多四次里就信一次。

    先拿免费网站练手,再推付费 App

    兄弟俩的第一招,是做了一个叫 Scamwise 的免费网站,不用注册、完全匿名,你把可疑的短信、截图、邮件传上去,它就能判断大概率是真的还是骗局。这个网站跑了四个月就收到 5 万份提交,到现在累计冲到 10 万份,每周还在以一万多份的速度往上涨。这些真实样本,正好拿来喂 Savi 自家的诈骗识别模型。

    • 本周二,Savi 正式推出付费 App,iOS 和安卓都能用,可以筛查短信、语音留言和来电。
    • 最出彩的功能是”实时通话监听”——可疑电话进行中,你可以把 Savi 的 AI 助手拉进来旁听,它会在对话过程里捕捉骗子的行为破绽。
    • 价格也挺实在:一个月 8 美元,年付 63 美元,而且不限人数,全家人——孩子、配偶、父母甚至那个总找你修电脑的舅舅——都能塞进同一个套餐。

    这家公司刚拿下 700 万美元种子轮,领投的是 Acrew Capital。技术底层主要用 Google 的 Gemini,但架在了一个 AI 网关上,需要的时候随时能切去更专精声纹识别的模型。说白了,Savi 想做的,是新一代的”杀毒软件”——只不过这回,是用 AI 在坏人拿 AI 行骗的同一刻,把你护住。


  • 法国初创ZML发免费工具:让各家AI芯片跑得一样快

    过去几年,只要聊到跑大模型,大家脑子里默认就是英伟达的卡。这种局面短期内还结束不了,但挑战者确实从四面八方冒了出来。最近巴黎一家叫 ZML 的初创公司丢出了一件免费工具,想做的事情挺大胆:让同一套开源大模型,能在英伟达、AMD、谷歌 TPU、苹果 Metal 甚至英特尔 Arc 的芯片上都跑得一样快。

    一个被图灵奖得主点名的小团队

    ZML 的创始人叫 Steeve Morin,圈内人可能更熟悉他上一个作品——Zenly,那个被 Snapchat 在 2017 年砸了九位数美元收购的社交地图应用,Morin 当时是工程副总裁。这家新公司本身规模不大,只有 20 个人,却让图灵奖得主、AI 圈泰斗 Yann LeCun 都公开点过赞。光看阵容,ZML 不像临时起意凑热闹的团队。

    他们刚发布的产品叫 ZML/LLMD,本质上是一个大模型推理服务器。Morin 跟 TechCrunch 说,他们的野心是打破现在各家芯片各自为战的孤岛状态,让不同的芯片都能以自己最快的速度、甚至比原厂还快的速度去跑 AI 任务。

    异构AI芯片在统一软件层上协同推理
    ZML 想用一层软件把不同品牌的 AI 芯片连起来,跑同一套模型

    它到底在解决什么麻烦

    随着 AI 一点点渗进我们的工作和日常,怎么把模型”跑起来”(也就是推理、处理用户提问)这件事,重要性已经悄悄超过了训练模型本身。可现实中这块体验并不顺滑,软件架构的壁垒把大家锁死在单一供应商身上,想换芯片?成本高得劝退。

    Morin 的原话是:想法是”把创造自己系统的权力还给大家,让 AI 真正扩散开,而不是被几家大厂攥在手里”。

    对企业来说,这意味着可以混搭不同类型的芯片——有些更便宜,有些更省电。ZML 这套软件辅助,顺势也能帮一把那些名气没那么响的新锐芯片厂,Morin 一口气点了好几家欧洲的:Axelera、Fractile、Kalray、Q.ANT、SiPearl 等等。对他而言,产地其实没那么重要,关键是 ZML 能和他们一起做”全世界还没人做过的事”。

    为什么大厂都在盯着”推理”这块肥肉

    推理赛道早就是兵家必争之地,有人直接把它叫”推理淘金热”。ZML 的对手不算少:估值冲到 130 亿美元的 Baseten、脱胎于开源项目 vLLM 的 Inferact、背后是 SGLang 的 RadixArk。vLLM 和 SGLang 跟 LLMD 多少有些重叠,但 Morin 的胃口明显更大。

    • 他放话说,ZML 已经走到”和芯片一起做联合设计”的阶段,不只是写上层软件。
    • 团队虽小,钱却不少——早年就融了 2000 万美元,投资方里既有 Harry Stebbings 的 20VC,也有 Xavier Niel 的 Kima Ventures。
    • 股东名单也挺唬人:Docker 创始人 Solomon Hykes、Hugging Face 的 Clément Delangue 和 Julien Chaumond,还有 LeCun 本人。

    有意思的是,Morin 并不唱衰英伟达。他说双方关系其实不错,毕竟英伟达自己也在为推理时代的到来做准备。ZML 想做的是在英伟达之外,给大家多一个不绑死的选择。

    免费,但野心一点不小

    ZML 最早在 2024 年开源过一个机器学习框架,今年三月还更新过。但这次的 LLMD 没有走开源路线,而是以免费产品的形式推出,目的很实在——先看看大家怎么用,再决定怎么赚钱。”我宁愿先量一量,在最有价值的地方收钱,也不想一上来就贪心把增长憋死。”Morin 这么说。

    现在判断 LLMD 什么时候变成付费产品、又能拿下多少用户,显然还太早。但从资本和同行的反应看,欧洲确实开始长出能在家门口做成事的 AI 公司了。Morin 说得很直白:”除了巴黎,我哪儿都做不出 ZML。”


  • video-use:用 Claude Code 一句话剪辑视频,browser-use 团队出品,15.9K Stars 让 AI 成为你的剪辑师

    video-use:用 Claude Code 一句话剪辑视频,browser-use 团队出品,15.9K Stars 让 AI 成为你的剪辑师

    video-use

    把原始素材丢进文件夹,跟 Claude Code 聊两句,拿回成片 final.mp4 —— 这就是 video-use15.9K+ Stars,MIT 许可,100% 开源)。它由爆火的 browser-use 团队打造,把”对话式 AI 编程”的思路搬进了视频剪辑:不再和轨道、关键帧死磕,而是用自然语言描述你要的成片。


    🚀 项目简介

    video-use 是一个对话式视频编辑「技能(skill)」,让 LLM 通过阅读而非观看视频来完成剪辑。它把任意原始素材(口播、混剪、教程、旅行、采访)交给 Claude Code / Codex / Hermes 等任意带 shell 的 AI 编程智能体,自动产出可直接发布的成片,全程无需预设模板或复杂菜单。核心思想和 browser-use 一脉相承:给 LLM 一份结构化的「视频说明书」,而不是一堆看不懂的逐帧截图。


    ⚙️ 安装要求和过程

    环境要求

    • Python 3.12+(依赖 requests / librosa / matplotlib / pillow / numpy)
    • uv(推荐)或 pip 管理依赖
    • ffmpeg必需,渲染引擎)
    • yt-dlp(可选,用于下载在线素材)
    • ElevenLabs API Key(用于 Scribe 转写,按量计费)

    方式一:对话式安装(推荐)

    把官方 setup prompt 粘贴给 Claude Code / Codex / Hermes 等任意智能体,它会自动完成 clone、依赖安装、skill 注册,并在需要时提示你粘贴 ElevenLabs Key——你只需说”准备好了”等它通知。

    方式二:手动安装

    git clone https://github.com/browser-use/video-use ~/Developer/video-use
    ln -sfn ~/Developer/video-use ~/.claude/skills/video-use   # Claude Code
    # ln -sfn ~/Developer/video-use ~/.codex/skills/video-use  # Codex
    
    cd ~/Developer/video-use
    uv sync                       # 或 pip install -e .
    brew install ffmpeg           # 必需
    brew install yt-dlp           # 可选
    
    cp .env.example .env          # 填入 ELEVENLABS_API_KEY=...

    安装完成后,进入任意素材文件夹运行智能体,说一句”edit these into a launch video”,它就会盘点素材、给出剪辑策略、等你确认,再把 edit/final.mp4 生成在素材目录旁。


    💡 核心功能

    • 🧹 剔除填充词与死寂:自动删掉 umm / uh、假开场和片段间的空白,节奏立刻紧凑。
    • 🎨 自动调色:每段独立调色——暖色电影感 / 中性 punch / 任意自定义 ffmpeg 链,风格统一可控。
    • 🔇 无爆音剪辑:每个切点做 30ms 音频淡入淡出,彻底告别”咔哒”爆音。
    • 📝 烧录字幕:默认 2 词大写块样式,颜色、字体、排版完全可定制。
    • ✨ 动画叠层:通过 HyperFrames / Remotion / Manim / PIL 生成动画,每个动画派发并行子代理,互不阻塞。
    • 📖 「阅读」而非「观看」:LLM 只读转写文本 + 按需时间轴视图(约 12KB 文本 + 少量 PNG),而非逐帧分析 4500 万 token 噪声——这正是它又快又准的关键。
    • 🔁 自评估闭环:渲染后在每个切点自检画面跳变 / 音频爆音 / 字幕遮挡,最多自动重渲染 3 次,全部通过后你才看到预览。

    📦 典型使用场景

    🎤 场景一:口播 / 教程视频快速成片

    录完一镜到底的口播,丢给 video-use:它会自动剔除 umm、加好字幕、统一调色、消除爆音,几分钟产出可直接上传的成片,省掉 PR 里最枯燥的”听音修剪”。

    🎬 场景二:旅行 / 采访混剪

    多段原始素材自动编排成叙事线,配合 Remotion / Manim 生成的动画叠层,做出有质感的混剪,适合 Vlog、产品发布片、活动回顾。

    🤖 场景三:常驻远程剪辑

    通过 Browser Use Box 跑在自有 VPS 或 Telegram 上,随时丢素材、随时收成片,把剪辑变成一条常驻的消息流水线。


    ⭐ 推荐理由

    我特别欣赏它”给 LLM 一份视频说明书”的设计哲学——和 browser-use 把网页 DOM 喂给模型如出一辙,但对象换成了视频。传统”AI 剪辑”要么逐帧灌噪声、要么套预设模板;video-use 选择让模型读转写、按需看图,既省 token 又保精度,自评估闭环还兜住了质量下限。

    100% 开源、MIT 许可,能挂在任何 AI 编程智能体上,本地文件零上传(只有转写调用 ElevenLabs)。如果你已经用 Claude Code 写代码,顺手把它变成分身剪辑师,几乎零学习成本。唯一门槛是 ElevenLabs 转写按量计费,但换来的是真正”对话即剪辑”的体验。


    📧 下载地址

  • OpenAI首席未来学家离职:在AGI前夜,他选择走出围墙

    OpenAI首席未来学家离职:在AGI前夜,他选择走出围墙

    一家把”实现AGI”写进公司使命的企业,通常会安排一个人专门负责”想未来”。OpenAI给这个岗位起的名字很直白——首席未来学家(chief futurist)。而就在今天,担任这个角色九年的Joshua Achiam在X上宣布,他要走了。

    他没把话说死,也没甩出什么戏剧性的理由。原话大概是:离开没有某个具体的诱因,也不是因为此刻发生了什么特别的事,只是这件事他在心里盘桓了挺久。”在一家前沿实验室的围墙之外,似乎也有可能推进同样的使命。”而他在同一条动态里留下了一句分量更重的话:人类未来的走向,取决于我们围绕AGI和超级智能共同做出的选择。

    OpenAI首席未来学家离职
    Joshua Achiam在OpenAI的九年,恰好覆盖了这家公司从研究小组走向AI中心舞台的全过程

    他不是普通意义上”管未来”的人

    要在中文语境里讲清Achiam的分量,得回到2022年那篇名为《Training language models to follow instructions with human feedback》的论文。正是这篇后来被称为InstructGPT的工作,把”人类反馈强化学习”(RLHF)这套方法立成了ChatGPT的底座。Achiam是那篇论文的共同作者之一,也是OpenAI最早一批研究科学家里的关键人物。

    他还有另一件被整个AI圈记住的事:主导打造了开源项目”Spinning Up in Deep RL”。这是OpenAI当年推出的一套深度强化学习入门教材,把原本高门槛的RL知识摊开给普通人,培养了不少后来入行的人。一个既写得出奠基性论文、又愿意把知识免费撒出去的研究者,在一家以技术信仰立身的公司里,分量可想而知。

    “A chief futurist”这个头衔本身就耐人寻味——当一家公司的日常被产品、融资、诉讼填满时,总得有人专门抬头看远方。Achiam做的,正是这件容易被忽略的事。

    离开的时机,有点微妙

    Achiam最近一次公开露面,是在马斯克起诉Altman的庭审上作证,内容涉及OpenAI从非营利机构转向营利性公司的那段架构变迁。一个在内部待了九年、又刚在法庭上回顾过公司来路的人,转头宣布离开,时间点很难不让人多想。

    更微妙的是他选择留下的那句话——”在围墙之外也能推进使命”。这既像是一种体面的告别,也像是在暗示:今天的前沿实验室,或许已经不是承载那份初心最顺手的容器了。当模型越做越大、商业压力越来越重,那些最早抱着”为了全人类”想法进来的人,和这架高速运转的机器之间,摩擦只会越来越多。


    目前还不清楚Achiam下一步要去哪里,他也没透露。但一个细节值得留意:他说的是”从外部推进使命”,而不是”去另一家公司”。在AGI看似越来越近的当下,离开一家最靠近它的实验室,反倒可能是想离那个真正重要的命题更近一点。至于OpenAI会怎么填补这个专门”看未来”的空缺,恐怕比又发一个新产品更值得关注。

  • 微软开始省着花:Excel和Word里的AI,正悄悄换成自家模型

    微软开始省着花:Excel和Word里的AI,正悄悄换成自家模型

    过去这一年,硅谷最流行的一句话大概是”先猛烧再说”。不管是训练大模型、还是给员工配满AI工具,大家都在比谁花的钱多。可最近风向明显变了,连微软这种家底厚实的巨头,都开始精打细算起来。

    彭博社这周二(7月7日)报道了一件事:微软在自己最常用的两款产品——Excel和Word里,已经开始用自家的MAI模型去回应一部分用户提问,而不再完全依赖OpenAI和Anthropic的模型。换句话说,你打开Office让Copilot帮你写段话、做个表,背后接的很可能已经不是GPT,而是微软自己养的模型了。

    微软用自家MAI模型替代第三方AI
    微软正把Office里的第三方模型,逐步替换成自家的MAI系列

    曾经的卖点,如今成了要砍的成本

    这个动作有点打脸的意思。毕竟微软过去没少拿”我们的Office由OpenAI和Anthropic的模型驱动”当卖点,在2025年9月的那篇官方博客里,还专门强调过这套强强联手的配置。现在悄悄换成自家模型,说明账算不过来了——第三方模型的调用费,确实不便宜。

    微软嘴上没多说,被TechCrunch问到时只回了一句”暂无更多可分享的信息”。但行动上,它已经把”降本”摆上了台面。

    其实微软也没把第三方模型一脚踢开,目前仍是混着用。它更大的算盘,是趁这两年把自家AI能力立起来。就在上个月的Build开发者大会上,微软一口气发布了7个新的MAI模型,里头既有能写代码的agentic coder,也有能生图的text-to-image生成器。自己有粮,才不用总看别人脸色。

    不只是微软一个人在”抠门”

    把时间拉回到今年初,那会儿圈内流行的是”tokenmaxxing”——能烧多少烧多少,仿佛不把GPU跑满就输了。可才过了几个月,画风就转成了”tokenminimizing”。据各家媒体披露,Amazon、Uber、Meta、埃森哲这些大公司,都在不同程度地给员工的AI支出踩刹车。

    • Amazon据报开始管控内部AI用量,别让小任务把预算烧穿
    • Meta被曝限制员工使用AI的规模,相关开支已经到了几十亿美元的级别
    • 埃森哲也在教员工别拿大钱干小事,能省则省

    这股省钱风甚至把目光引向了大洋彼岸。硅谷有些公司开始盯上中国的便宜模型(比如GLM-5.2)来找agentic方案的替代,哪怕心里还惦记着潜在的安全风险。当一个行业开始认真比较”哪家模型更便宜”的时候,说明狂奔的阶段确实过去了。


    微软这步棋背后,其实是一个谁都绕不开的问题:当AI成了每家公司的水电煤,账单谁来扛?把核心能力攥回自己手里,既是为了省钱,也是为了别在关键时刻被供应链卡脖子。接下来的看点很简单——Office里的Copilot,到底还有多少比例会换成微软亲生的模型。

  • 阳光斑马线低视角电影感时尚街拍

    阳光斑马线低视角电影感时尚街拍

    阳光斑马线低视角电影感时尚街拍



    🤖 ChatGPT

    🇺🇸 English Prompt

    Cinematic street-style fashion editorial captured from a dramatic low perspective as an adult female model confidently crosses a sunlit crosswalk. Her powerful stride creates elegant elongated leg lines that dominate the composition. 
    
    In one fluid motion, she glances back over her shoulder, locking eyes with the camera with a fearless, captivating expression. She wears a fitted yellow ribbed tank top, distressed denim cutoff shorts, relaxed white slouch socks, chunky black platform Mary Jane shoes, and a black baseball cap. 
    
    A bouquet of fresh flowers slips from her hand, sending colorful petals, stems, and leaves swirling through the air, frozen in crisp motion. The backdrop features a charming vintage green building beneath an intensely blue sky streaked with delicate cirrus clouds. Strong natural sunlight creates glowing backlight, a sharp rim light around her figure, subtle cinematic lens flare, and rich dimensional contrast. 
    
    Fujifilm Classic Negative color science, vibrant blues, deep architectural greens, authentic candid movement, luxury editorial styling, fashion campaign aesthetic, dynamic composition, effortlessly cool, energetic, modern, and magazine-cover quality.

    🇨🇳 中文提示词

    电影感的街头风格时尚社论,从戏剧性的低视角拍摄,一位成年女模特自信地走过洒满阳光的斑马线。她有力的步伐创造了优雅且拉长的腿部线条,主导了构图。在一个流畅的动作中,她回头望向肩后,以无畏且迷人的神情锁定了摄像机的目光。她穿着一件修身的黄色螺纹背心、磨损的牛仔短裤、宽松的白色堆堆袜、厚实的黑色防水台玛丽珍鞋和一顶黑色棒球帽。一束鲜花从她手中滑落,五颜六色的花瓣、茎和叶在空中盘旋,冻结在清晰的动态中。背景是一栋迷人的复古绿色建筑,上方是布满细腻卷云的深蓝色天空。强烈的自然阳光营造出柔和的逆光、她身影周围锋利的轮廓光、微妙的电影镜头光晕和丰富的空间对比。富士经典负片色彩科学,充满活力的蓝色,浓郁的建筑绿色,真实的抓拍动态,奢华的社论造型,时尚大片美学,动态构图,毫不费力的酷感,充满活力,现代且具有杂志封面质感。
  • 简约纯白背景优雅红色汉服古装美女全身像

    简约纯白背景优雅红色汉服古装美女全身像

    简约纯白背景优雅红色汉服古装美女全身像



    🤖 ChatGPT

    🇺🇸 English Prompt

    Full body shot, pure white background, no shadows, ultra-realistic, elegant ancient costume beauty, exquisite features, soft and natural eyes, gentle expression. Deep brown hair in a simple traditional Hanfu hairstyle, decorated with a simple wooden hairpin. Wearing layered and rustic red wide-sleeved Hanfu, cross-collar design, with brown piping on the edges, paired with a matching wide brown belt and a flowing long trailing skirt. Simple traditional cloth shoes with brown and beige details. Soft and even studio lighting, high detail, sharp focus, 8K, cinematic portrait, clean minimalist aesthetic, natural linen texture on the fabric.

    🇨🇳 中文提示词

    全身拍摄,纯纯白色背景,无阴影,超真实,优雅的古装美女,精致的五官,柔和自然的眼神,温柔的表情。深棕色的头发采用简单的传统汉服发型,饰有朴素的木发夹。身穿层次感质朴的红色宽袖汉服,交领设计,边缘有棕色镶边,搭配配套的棕色宽腰带和飘逸的拖尾长裙。简单的传统布鞋,带有棕色和米色细节。柔和均匀的演播室灯光、高细节、锐利的焦点、8K、电影肖像、干净的简约美学、织物上的天然亚麻纹理。