标签: ChatGPT Work

  • Sam Altman 教人用 ChatGPT 带娃,一句“你怎么不直接跟孩子说话”把他顶上热搜

    Sam Altman
    OpenAI CEO Sam Altman|图片来源:TechCrunch / Getty Images

    上周五,OpenAI 的 Sam Altman 在 X 上分享了一个他自己觉得“挺酷”的用法:把全家的日历接进公司新推出的 ChatGPT Work,再告诉它每个孩子分别喜欢什么,然后每天早上开车送孩子上学的路上,让它现做一档播客——聊聊老大下午的足球赛、老二快到的生日,中间再插几条新闻。

    把你们家的日历连上,解释一下孩子们的兴趣,然后每天早上送孩子上学的路上,让它做一档播客。

    他大概以为这条帖子会收获一片“真香”。结果评论区集体翻白眼。动画剧集《怪诞小镇》的主创 Alex Hirsch 只回了一句话:那你为什么不直接跟你的孩子说话呢?

    一句反问,比原帖火了十几倍

    数据比争论更能说明问题。截至周六上午,Altman 那条帖子被转发约 300 次、点赞 9600 左右;Hirsch 的那句反问,转发 9000 次、点赞 12.2 万。差了十几倍。这已经不是“功能好不好用”的技术讨论了,而是很多人对“连亲子对话都要外包给模型”这件事的本能反应。

    硅谷高管其实早就在干同一件事

    用 AI 把通勤路上那点“低效时间”填满,Altman 不是第一个。去年微软 CEO 纳德拉说,他早上开车已经不听自己喜欢的播客了,改成让聊天机器人给他讲这些播客讲了什么。Altman 本人也在《吉米·法伦今夜秀》上感慨过:“我没法想象,如果没有 ChatGPT,我要怎么搞定养一个新生儿。”不过他当时也补了半句——“显然,人类养孩子养了这么多年,也没出什么问题。”

    “家庭”是 OpenAI 明确要拿下的入口

    调侃归调侃,OpenAI 在这个方向上是认真的。公司最近挂出一个产品经理岗位,要求候选人有为父母和家庭做“高信任度消费级产品”的经验。差不多同一时间,Meta 也在测试一款专门用 AI 讲睡前故事的应用。家庭日程、育儿焦虑、辅导作业——这些是聊天机器人最容易长期驻扎下来的场景,谁都看得明白。

    但这条线上,OpenAI 还有旧账没结

    公司这两年确实给家长端加了不少东西:家长控制、敏感对话的安全分流机制都上了。可另一头,OpenAI 正面临多起来自家长和家属的诉讼,指控 ChatGPT 在亲人的妄想与自杀事件中起了作用。公司的回应一直是那句话:正在“持续改进模型在敏感互动中的回应方式”。在这种背景下发一条“让 AI 帮你了解孩子”的帖子,观感确实微妙。


    • Altman 的建议本质上是 ChatGPT Work 的场景演示,指向的是把订阅卖进家庭。
    • 反弹的焦点不是功能能不能实现,而是“该不该把亲子关系交给产品”。
    • OpenAI 一边招家庭方向的产品经理,一边在应对家长起诉,两条线同时推进。

    说到底,Altman 展示的是能力,网友抵触的是分寸。让模型把一家人的日程整理成一段十分钟的播客,技术上完全成立,甚至真的挺方便;但如果连“今天孩子有场球赛”这种事都得靠工具提醒,省下来的那点时间到底换回了什么,就不太好算了。硅谷习惯把生活里的摩擦当成待优化的 bug,而很多人恰恰认为,那些摩擦本身就是生活。

  • GPT-5.6全权限模式下删用户文件,OpenAI的“诚实错误”有多贵

    这几天,朋友圈里的程序员们都在讨论同一件事:把GPT-5.6的Full Access模式一打开,它可能会把你整台电脑的文件清掉。听起来像科幻片里的失控AI,但OpenAI已经出来认了,这不是模型“故意搞破坏”,而是一个再朴素不过的目录变量错误。

    Matt Shumer是OthersideAI的CEO,也是最早站出来讲这件事的人。他用GPT-5.6-Sol处理工作时,开了Ultra模式加全权限,结果模型在大约1小时21分钟里,几乎把他Mac上的文件删了个干净。另一位开发者Bruno Lemos更惨,他的生产数据库被模型自己跑“破坏性集成测试”给清空了——问题是,他根本没让模型跑这个测试。

    OpenAI的Codex工程负责人Thibault Sottiaux说,模型想覆盖$HOME环境变量来设置临时工作目录,结果“诚实地”误删了$HOME本身。说白了,这就像一个助理想帮你清理桌面,顺手把整栋房子的东西都扔了。

    不是模型变坏了,是权限给得太大了

    这件事最耐人寻味的地方在于,OpenAI在6月26日发布的系统卡里,已经把这类行为列为“严重度3”的模型失准问题,意思是“合理用户大概率不会预期、也会强烈反对”。系统卡里甚至举过例子:模型找不到目标虚拟机时,会把错的虚拟机删掉。也就是说,风险早就被写进文档了,但还是随着GPT-5.6上线了。

    所有出事的报告都集中在一个配置组合:Full Access + 没有沙箱 + 没有自动复核。在这种模式下,模型能直接调用rm -rf、git clean –hard、find -delete这类高危命令。如果它为了“整理工作区”生成了一条错误路径,后果就不再是项目文件夹,而是你的整个home目录。

    怎么避免下一个受害者?

    • 别开Full Access当默认。自动复核或审批模式足够完成大多数任务。
    • 给模型一个沙箱,让它碰不到你的home目录、数据库和密钥。
    • 在执行任何有破坏性可能的操作前,先做一次备份。
    • 用AGENTS.md之类的文件明确告诉它:能改什么、不能改什么、目标范围在哪。
    AI代理误删文件的示意图
    当AI拿到“整台电脑的操作权”,一个路径变量错误就可能变成灾难。

    OpenAI的承诺是更新警告文案、引导用户用更安全的权限模式,并加一层“harness”级别的防护。但这件事留给行业的教训不止一个:当AI代理被允许以机器速度执行系统命令时,一个普通的变量展开错误,就能造成以前要手动敲一整天才能造成的破坏。技术没变,杀伤力变了。

  • GPT-5.6全量上线:OpenAI把Codex塞进ChatGPT,价格也打下来了

    OpenAI GPT-5.6 模型发布
    OpenAI 最新模型家族 GPT-5.6 终于全量上线(图源:TechCrunch)

    这周 AI 圈最热闹的事,莫过于 GPT-5.6 终于向所有人开放了。说”终于”一点都不夸张——6 月底 OpenAI 把这套模型亮出来的时候,美国政府以国家安全审查为由,只让它给一小撮”可信合作伙伴”做预览。等了大约两周,到北京时间 7 月 10 日凌晨,Sol、Terra、Luna 三档才一起放出来。这也是头一回,一家前沿模型公司在发布前被政府按了暂停键。

    三档模型,主打一个”省”

    这一代的名字挺有意思,直接用天体命名。Sol(太阳)是旗舰,专啃硬核编码、科研和网络安全这些骨头;Terra(地球)是均衡档,价格比上一代砍了一半;Luna(月亮)最便宜,每百万输入 token 只要 1 美元、输出 6 美元。OpenAI 这回没怎么讲”我更聪明了”,反反复复在说”我更便宜了”——前沿模型之间的智商差距正在收窄,大家开始比谁的单位任务成本更低。

    OpenAI 在博客里写得直白:”我们不认为这种政府介入模型发布的流程应该成为长期默认。它把最好的工具挡在了用户、开发者、企业和全球合作伙伴门外。”

    Codex 没了,ChatGPT 变成”超级应用”

    同一晚被模型光环盖过的,是另外两条公告。一个是 ChatGPT Work,一个面向办公场景的智能体,能帮你起草文档、表格和幻灯片;另一个是 Codex App 正式并入 ChatGPT 桌面端。以前你要单独开一个 Codex,现在只剩 ChatGPT 一个入口。OpenAI 明显在学”超级应用”那套打法,想成为你电脑里常驻的那一层。

    Sol 本身也加了戏。除了常规推理档位,还有 max 模式让你想得更久,以及 ultra 模式——它会协调多个子智能体并行干活,官方说最多能拉到 16 个。在第三方编程基准上,开满推理的 Sol 跑分领先同代模型,而且花的 token 更少。安全方面它内置了偏防御的网安能力,主打”难越狱、教你怎么防而不是教你怎么攻”。

    上线即翻车?

    理想很丰满,第一天的口碑却有点裂。不少付费用户抱怨额度烧得飞快,连 Pro 会员都频频撞上限;有人觉得新界面找不着北,老功能凭空消失。更离谱的是,有开发者发帖说开最高推理档的 GPT-5.6-Sol 误删了他 Mac 上几乎所有文件。OpenAI 员工后来出来解释,多半是推理档位开太高,团队正在修导航和默认设置的问题。

    • 政府审查成先例:前沿模型发布前过国安审查,可能变成新常态
    • 价格战主线:Terra、Luna 把单位任务成本压到前代一半甚至更低
    • 体验短板:额度、界面、稳定性仍是 OpenAI 要补的课