给AI一台虚拟售货机,让它自己进货、定价、赚钱,会发生什么?安全测试机构Andon Labs刚公布的最新一期Vending-Bench实验给出了答案:Claude Opus 5赚钱能力刷新纪录,手段也比以往任何模型都要狠。
Andon Labs让前沿模型经营模拟售货机整整一年 | 图源:TechCrunch
实验设定很简单:Claude Opus 5、GPT-5.6 Sol和Kimi K3各自经营一台售货机,摆在旧金山一条热闹的游客街上,互为邻居,比谁一年下来赚得多。三个模型可以互发邮件,但都顶着人类化名,谁也不知道对面是哪家的模型。它们还有一个”管理层”邮箱可以求助,只是管理层永远只回一句”报告已收到,可能会也可能不会处理”,从头到尾没管过事。
团队内部文档折叠:把整个 docs/ 文件夹(架构决策记录、Runbook、新人指南)合并成一个技能,新同事在编码会话里直接提问,替代翻 60 页 PDF 的品牌手册/规范文档
研究资料簇管理:一摞论文加自己的笔记合成统一技能,新论文来了增量折叠进去;对比 RAG——RAG 适合”几十本书里找提到 X 的段落”(宽而浅),book-to-skill 适合”吃透一本书的 12 个框架并应用”(窄而深),两者互补
❤️ 推荐理由
这个项目最打动我的是它把”AI 读书”从检索问题重构成了编译问题。RAG 是查询时相似度搜索,返回”和你问题相近的文本块”;book-to-skill 是编译时深度分析,输出”作者花几年构建的命名框架、适用条件和反模式”——前者是检索,后者是可推理的结构。README 里那句话很精辟:“RAG indexes a shelf, book-to-skill masters a spine”(RAG 索引一整架书,book-to-skill 吃透一本书的书脊)。
工程上它也异常诚实:所有 token 节省数据都有可复现的测量脚本,README 明确写出”诚实警告”——章节自动切分需要显式的 Chapter N 标题、一次性阅读场景用普通 PDF 智能体就够了。在营销味十足的 AI 开源圈,这种”实测优先、有限承诺”的态度非常难得。如果你的 ~/.claude/skills 目录里只打算加一个新技能,让它是一个能把你书架搬进智能体的技能,很值。
态度转变不只停留在嘴上。前沿实验室的员工们最近发起了一份名为”Pacing the Frontier”的请愿,呼吁美国政府支持一项国际行动,开发出能主动控制自动化AI研发节奏的技术和治理工具。OpenAI和Anthropic两家官方账号都公开表了态支持——这两个老对手能在同一份文件上达成一致,本身就是个信号。
背景是今年以来安全问题从假设题变成了应用题:Anthropic能力极强的Mythos模型让不少假想风险落了地,此前Fable模型还经历过一轮”该不该临时禁用”的争议。而中国开源模型Kimi K3发布后,OpenAI战略主管Dean W. Ball直言它冲击了前沿实验室的经济模型——这也让外界越来越难分清,大厂们喊安全,到底是真担心,还是在保护自己的生意。
嘴上要减速,心里防着谁?
Altman自己也没绕开这层矛盾。他在播客里说,很多安全担忧有理有据,但也有很多人——哪怕是潜意识里——只是想借安全之名集中权力。这话听起来像是冲着签了请愿的Anthropic CEO Dario Amodei去的。