作者: hiyoho

  • 机场候机厅时尚女性俯拍真实街拍

    机场候机厅时尚女性俯拍真实街拍

    机场候机厅时尚女性俯拍真实街拍



    🤖 ChatGPT

    🇺🇸 English Prompt

    A highly realistic snapshot of an airport waiting hall, vertical composition, 9:16, high-angle top-down perspective, like a real street photography shot from the second floor or a surveillance position. The main subject is a young East Asian woman walking in the waiting hall, positioned from the lower left to the center of the frame. She is slender with an elegant and calm temperament, pale skin, and short hair hidden under a black wide-brimmed hat. The brim is low, covering her eyes and revealing only the exquisite lower half of her face, red lipstick, wearing a white pearl necklace and pearl earrings. She wears a black off-the-shoulder slim-fit short-sleeved top, showing her collarbone and necklines, with a white high-waisted fluffy draped midi umbrella skirt on the bottom, the hem fluttering naturally, and black pointed-toe high heels on her feet. Her right hand holds the silver telescopic handle of a black trolley suitcase. The large black suitcase is in the lower right of the frame, made of hard-shell material, with subtle wear, zipper, wheel, and handle details, realistic reflections but not excessively shiny. Her left hand is naturally placed by her skirt side or behind her, with a composed posture, as if walking through the waiting area. The background is an airport or high-speed rail waiting hall, with gray-white granite flooring featuring dense black and white grain textures, very clear and realistic. In the top right, there is a row of blue plastic seats and silver metal armrests. A young East Asian woman sits on a blue waiting chair, wearing a loose white T-shirt and light blue denim wide-leg pants, cream-white sneakers, leaning her body with legs naturally bent, holding a black phone blocking part of her face as if taking a photo or looking at the phone. The chair structure is clear, with cool reflections on the metal frame. In the top left corner, there are partial legs of passengers, gray pants, sneakers, and a brown vintage leather suitcase on the floor nearby, adding a sense of real waiting hall life. Overall realistic photography style, not staged, not studio shot, no interaction between characters, like a fashionable traveler moment caught by chance. Natural indoor cool white lighting, uniform lighting from the airport hall ceiling, soft shadows, slight reflections on the floor. Rich details, fabric textures, pearl luster, suitcase material, floor tile grains, and metal seat edges are all clearly visible. Uses a telephoto lens to compress spatial sense, slight downward perspective, clear subject, background slightly naturally blurred but still recognizable. Realistic colors, low saturation, high-end contrast between the cool gray environment and black and white clothing, documentary street photography, high-end fashion sense, ultra-realistic, cinematic realism, 8K, sharp details, real skin texture, real human proportions, real light and shadow.

    🇨🇳 中文提示词

    一张高度逼真的机场候机厅抓拍照片,竖构图,9:16,高角度俯拍视角,像从二楼或监控位拍摄的真实街拍照片。画面主体是一位年轻东亚女性正在候机厅中行走,位于画面左下到中央区域,她身材纤细,气质优雅冷静,皮肤白皙,短发藏在黑色宽檐帽下,帽檐压低遮住眼睛,只露出精致的下半张脸,红色口红,佩戴白色珍珠项链和珍珠耳环。她穿着黑色一字肩修身短袖上衣,露出锁骨和肩颈线条,下身是白色高腰蓬松垂坠感中长伞裙,裙摆自然飘动,脚穿黑色尖头高跟鞋。
    
    她右手握着黑色拉杆箱的银色伸缩拉杆,黑色大号行李箱位于画面右下方,箱体为硬壳材质,带有细微磨损、拉链、轮子和把手细节,真实反光但不过度发亮。她左手自然放在裙侧或身后,姿态从容,像正在穿过候机区。
    
    背景是机场或高铁站候机大厅,灰白色花岗岩地面,密集黑白颗粒纹理,非常清晰真实。右上方有一排蓝色塑料座椅和银色金属扶手,一位年轻东亚女性坐在蓝色候机椅上,穿宽松白色 T 恤和浅蓝色牛仔阔腿裤,米白色运动鞋,身体斜靠,腿部自然弯曲,手持黑色手机挡住部分脸部,像正在拍摄或看手机。座椅结构清晰,金属边框有冷色反光。画面左上角有局部乘客腿部、灰色裤子、运动鞋,以及一个棕色复古皮质手提箱放在地面旁边,增加真实候机厅生活感。
    
    整体为真实摄影风格,非摆拍,非棚拍,人物之间没有互动,像偶然捕捉到的时尚旅客瞬间。自然室内冷白光照明,机场大厅顶部灯光均匀,阴影柔和,地面有轻微反射。画面细节丰富,服装布料纹理、珍珠光泽、行李箱材质、地砖颗粒、金属座椅边缘都清晰可见。使用长焦镜头压缩空间感,轻微俯视透视,主体清晰,背景略微自然虚化但仍可辨认。真实色彩,低饱和度,冷灰色环境与黑白服装形成高级对比,纪实街拍,高端时尚感,超写实,电影级真实感,8K,细节锐利,真实皮肤纹理,真实人体比例,真实光影。
  • TencentDB Agent Memory:腾讯开源的 AI Agent 本地长期记忆引擎(7.8K+ Stars)

    TencentDB Agent Memory:腾讯开源的 AI Agent 本地长期记忆引擎(7.8K+ Stars)

    TencentDB Agent Memory

    TencentDB Agent Memory 是腾讯云开源的、为 AI Agent 提供完全本地化长期记忆的方案,通过四层渐进式记忆流水线让 Agent「记得住、说得清」,且零外部 API 依赖。它把散落的对话逐步蒸馏成结构化、可追溯的长期记忆,是当下少见的、能直接落地的 Agent 记忆引擎。

    安装要求和过程

    环境要求

    • Node.js ≥ 22.16(官方徽章要求)
    • 需配合 OpenClawHermes Agent 使用
    • 默认本地后端:SQLite + sqlite-vec(无需额外数据库服务)
    • 短上下文压缩需插件版本 ≥ 0.3.4;Hermes 的 Docker 部署需 Docker,Gateway 监听 :8420

    快速安装(OpenClaw,最常用)

    openclaw plugins install @tencentdb-agent-memory/memory-tencentdb
    openclaw gateway restart

    零配置启用,写入 ~/.openclaw/openclaw.json

    {
      "memory-tencentdb": { "enabled": true }
    }

    可选开启短上下文压缩(版本 ≥ 0.3.4):

    {
      "memory-tencentdb": { "config": { "offload": { "enabled": true } } }
    }

    Hermes Docker 部署

    cd docker/opensource
    docker build -f Dockerfile.hermes -t hermes-memory .
    docker run -d --name hermes-memory --restart unless-stopped -p 8420:8420 \
      -e MODEL_API_KEY="your-api-key" \
      -e MODEL_BASE_URL="https://api.lkeap.cloud.tencent.com/v1" \
      -e MODEL_NAME="deepseek-v3.2" \
      -e MODEL_PROVIDER="custom" \
      -v hermes_data:/opt/data hermes-memory
    curl http://localhost:8420/health

    核心功能

    1. 四层记忆架构(L0→L1→L2→L3):原始对话(L0)逐步蒸馏为原子事实(L1)、场景块(L2)、人物画像(L3),从宏观抽象一路保留到可追溯的真相证据。
    2. 符号化短期记忆(Symbolic Short-term Memory):把冗长的工具日志压缩成 Mermaid 符号图,并卸载历史,大幅降低 token 消耗。
    3. 白盒可调试(White-Box Debuggability):每一层都是可读文件——L2 场景是纯 Markdown、L3 画像在 persona.md、短任务画布是 Mermaid,原始负载通过 result_ref / node_id 可回溯,记忆不再是黑盒。
    4. 生产级工程(Production-Ready):OpenClaw 插件自动捕获/提取/召回 + Hermes Gateway 适配器(TdaiCore + HostAdapter)+ 本地 SQLite 后端 + BM25/向量/RRF 混合检索 + tdai_memory_search / tdai_conversation_search Agent 工具。
    5. 完全本地、零外部依赖:记忆全部存本地,隐私可控,不依赖任何外部 API 或云服务即可运行。

    典型使用场景

    • 长程连续任务:如 SWE-bench 单会话连续 50 个任务,Agent 跨会话记住项目背景与 SOP,无需反复解释。集成 OpenClaw 后 token 用量最高降 61.38%,成功率相对提升 51.52%,PersonaMem 长期记忆准确率从 48% 提升到 76%。
    • 个性化 AI 助手:跨会话持续沉淀用户画像(L3)、场景块(L2)、原子事实(L1),让 Agent「越用越懂你」,而非每次都从零开始。
    • 长任务上下文压缩:搜索结果、代码片段、错误栈等冗长日志通过 Mermaid 符号图卸载,显著降低 token 成本——基准上 WideSearch 成功率 33%→50%,SWE-bench 58.4%→64.2%,AA-LCR 44.0%→47.5%。

    推荐理由

    这是目前少数把「Agent 记忆」做成可落地工程、而非论文玩具的项目。四层金字塔设计既保留了宏观人物画像,又保留了可追溯的证据链(result_ref / node_id),白盒可调试对排查「它为什么记错了」极其友好。本地优先 + MIT 许可意味着可以放心用在私有数据场景,接入 OpenClaw / Hermes 几分钟就能跑起来。对做 AI 产品的团队来说,几乎是「给 Agent 装上长期记忆」的最低成本方案。

    架构一览

    TencentDB Agent Memory 检索下沉链路

    下载地址

  • 成立不到三年估值翻倍到132亿美元,Lovable做对了什么

    Lovable 氛围编程创业公司
    用大白话描述需求,软件自己就长出来了——这正是氛围编程的卖点

    一家瑞典的”vibe-coding”(氛围编程)创业公司 Lovable,正在谈一轮 3 亿美元的融资,估值直接冲到 132 亿美元——正好是他们去年 12 月 66 亿美元估值的两倍。据 Sifted 报道,领投的是 Menlo Ventures,就是上个月刚宣布募了 30 亿美元新基金的那家。不到一年估值翻一倍,这速度在 AI 应用层里也算扎眼。

    收入跑得比名气还快

    这家成立还不到三年的公司,今年 6 月年化收入跑到了 5 亿美元。它的用户群挺杂:有创始人、独立设计师、做销售的人,拿它来搭网站和电商落地页;它也把工具卖给大公司,Workday、Asana、英伟达都在客户名单里。既有散客又有大单,这让它跟那些只靠个人开发者撑场面的竞品拉开了身位。

    “用大白话描述一下,软件就自己长出来了”——这大概就是氛围编程最直白的注脚。

    为什么”氛围编程”这么值钱

    氛围编程说白了就是用户用自然语言描述想要什么,AI 就把软件给搭出来。这目前是 AI 最火、也最赚钱的应用场景,没有之一。同赛道里早就挤满了高估值玩家:

    • Replit:今年 3 月估值到 90 亿美元
    • Factory:帮企业做 AI 代理,4 月拿了 1.5 亿融资、估值 15 亿
    • Cursor:给开发者做氛围编程,上个月刚被 SpaceX 以 600 亿美元股票收购

    Lovable 这波估值翻倍,本质上是市场在给”AI 让人人都能写软件”这个故事重新定价。当收入跑得快、大企业也愿意买单,投资人自然愿意把赌注加倍。不过氛围编程这行的护城河到底有多深,会不会被大厂自家的 AI 工具一点点稀释,到现在还是个没人能答清楚的问题。


    回头看,Lovable 从去年底 66 亿到如今 132 亿,踩中的是 AI 从”聊天”走向”真把东西做出来”的那股劲。接下来要看的是,它能不能在 Cursor 被巨头收编、大厂工具免费化的夹击下,守住自己的那块地盘。

  • Grok 4.5发布:马斯克说它比Opus更快、更省token

    Grok 4.5 大模型发布
    SpaceXAI 把 Grok 4.5 定位为一款”主力劳工型”大模型

    SpaceXAI——也就是原来那家 xAI,被马斯克并进 SpaceX 之后改的名——这周三把 Grok 4.5 放出来了。这是公司几周前上市之后的第一个新模型,也算是重组后对外界交出的第一份模型答卷。

    马斯克自己在 X 上(X 现在也是 SpaceXAI 旗下的)把它形容成”Opus 级别”的模型,意思是能跟 Anthropic 那档专攻复杂任务的顶级模型掰手腕。他在帖子里写得很直白:Grok 4.5 是 Opus 级的水平,但更快、更省 token、也更便宜。

    一款”什么活都接”的主力模型

    官方博客里,SpaceXAI 把 Grok 4.5 定义成”主力劳工型”模型:写代码、搭应用、办公杂活、做研究、写稿子,这些 AI 圈一直想自动化的活它都能接。但最值得盯的不是它能干多少事,而是效率——公司声称它的 token 效率是其他主流模型的两倍。

    对真正天天调模型的人来说,token 贵不贵早就成了绕不开的痛点。如果这”两倍效率”在真实场景里能兑现,Grok 4.5 的性价比优势就立住了,而这恰恰是 SpaceXAI 最想打的牌。

    “It is an Opus-class model, but faster, more token-efficient and lower cost.”——马斯克在 X 上的原话

    成绩单跟价格,都挺能打

    SpaceXAI 周三甩出了一堆基准测试成绩,看下来跟竞争对手的顶级模型咬得很紧,但离”全场第一”还差一口气。真正有冲击力的是定价:输入每百万 token 2 美元,输出 6 美元。

    作为对比,Anthropic 的 Opus 4.7 要 5 美元和 25 美元,OpenAI 的 GPT-5.6 里最贵的 Sol 是 5 美元和 30 美元。马斯克后来补了一句:内部评估 Grok 4.5 大概跟 Opus 4.7 一个水平,但快得多,”能力、速度、低价三样凑一起,才是它打市场的资本”。

    • Grok 4.5:输入 2 美元 / 输出 6 美元(每百万 token)
    • Opus 4.7:输入 5 美元 / 输出 25 美元
    • GPT-5.6 Sol:输入 5 美元 / 输出 30 美元

    这周简直是模型发布大周。OpenAI 的 GPT-5.6 也在周四准备上线,而且这模型之前还被特朗普政府卡了发布,理由是安全顾虑。一边是 Grok 4.5 打着低价快速度的旗号冲出来,一边是 GPT-5.6 顶着”史上最强”的名头解禁,大模型圈的价格和能力军备竞赛,眼看着又被点了一把火。

  • Notion 砍了邮箱 App,转头做了个「Agents」:把 ChatGPT、Gemini、Claude 全塞进一个聊天框

    Notion Agents iPhone 应用界面示意图
    Notion Agents 把 ChatGPT、Gemini、Claude 收编进一个聊天框(配图由 AI 生成)

    Notion 这公司最近有点”拆东墙补西墙”的意思。上个月它刚宣布砍掉做了刚好一年的邮箱 App Notion Mail;这个月,它就端出了一个全新的 iPhone 应用,叫 Agents。

    它不是另一个笔记 App

    7 月 7 日上线的 Notion Agents,和它家那个主力的笔记 App 不是一回事。它不让你写文档,而是专门用来”聊”——跟你自己的 AI 代理聊,也跟接进来的大模型聊。目前支持三个:Anthropic 的 Claude、Google 的 Gemini,还有 OpenAI 的 GPT。换句话说,Notion 自己不下场做模型,而是做了个”代理集散中心”,把别人的模型都接进来。

    用法上挺直白。你可以在里面问代理问题,也可以随手记点东西:打一段文字、录一段语音、拍张照片,代理会自己判断这些内容该归到哪。它连着你真实的 Notion 工作区和你那一整套工具栈,所以回答不是凭空编的,而是从你自己的文档和数据里长出来的。

    Notion 主 App 是个”仓库”,你把东西存进去;Agents 是个”前台”,你动动嘴,它去仓库里翻、去帮你办。

    砍邮箱、做代理,Notion 在赌什么

    把 Notion Mail 的退场和 Agents 的登场放一起看,逻辑就清楚了。做邮箱那一年,Notion 想的是”AI 帮我处理收件箱”;现在它发现,比起替你盯邮件,更值钱的是做一个”你随时能调度的代理中枢”。邮箱是入口之一,但不是非争不可的入口;而”代理能连你的全部工作”这个位置,谁占住谁就掌握主动。

    • “懂你的工作”:接的是你真实的文档和工具,不是凭空编的答案
    • “即时捕捉任何东西”:文字、照片、语音,代理自己决定放哪
    • 能直接干活:建页面、起草周报、跨工具搜东西,全在一个聊天框里

    当然,Agents 现在还是个 iPhone 专属应用(iPad 和 Mac 上能勉强跑,但没专门适配)。对于一个主打”随时随地处理工作”的工具来说,桌面端的缺位有点尴尬。而且它本质上是个聚合层——模型能力好不好,最终还是 Claude、Gemini、GPT 说了算。

    Notion 的护城河,在于它握着你的文档、数据库和项目,也就是”上下文”。代理再聪明,没有你的真实数据也是空转。所以这事挺典型的:大厂做 AI,拼到最后往往不是谁模型最强,而是谁最贴近你的真实工作流。Notion 把赌注压在”上下文”上,砍掉边缘业务、All in 代理,这一步走得够干脆。


  • Google Photos 上线「Video Remix」:你手机里那段糊视频,几秒钟被 AI 改头换面

    Google Photos Video Remix AI 视频重混功能示意图
    Google Photos 的 Video Remix 把 AI 视频编辑做成了相册里的一键按钮(配图由 AI 生成)

    你手机相册里那些拍得一般、光线很暗、背景很乱的视频,以前基本就躺在那儿吃灰了。现在 Google 想让你点一下,AI 把它们”重混”一遍。7 月 8 日,Photos 里上线了一个叫 Video Remix 的功能,它跑在 Gemini Omni 这套模型上,干的事很具体。

    几秒钟能改头换面

    给暗乎乎的片段补光(Google 管这叫 cinematic relighting),把平淡的背景换成别的场景,或者给整段视频套上水彩、速写本这类艺术风格。入口藏在 Photos 的 “Create” 标签页里,Google 把它定义成你的”创意中枢”。操作逻辑很简单:挑一段视频,选个效果,等几秒,出来一份被重新打过光的版本。

    这个功能不是给所有人开的。目前只面向 Google AI Plus、Pro、Ultra 这几个订阅档位的用户灰度推送,也不是全球同时铺开。换句话说,你如果还用着免费的 Photos,暂时看不到这个按钮。

    Google 自己的说明里反复强调,用 Video Remix 生成的视频会带上 SynthID 的隐形水印,标明”这是 AI 动手过的”。

    三个月塞了三个,相册快成工具箱了

    有意思的是,这已经不是 Google Photos 今年第一次往相册里塞 AI 生成类工具了。翻一翻时间线,短短三个月里它已经堆了至少三个功能相近的东西。用户打开相册,本意是找张旧照片,结果迎面撞上一堆”AI 帮你重做”的入口。功能多是好事,但当每个入口都在暗示”你原来的素材不够好、让我替你重造一遍”,体验就开始变味了。

    水印这事儿,真挡得住吗

    再说 SynthID。Google 一直把这套隐形水印当成”负责任 AI”的门面,意思是 AI 生成的内容能被溯源、被识别。理想很丰满:以后看到一段以假乱真的视频,系统能告诉你”这是 AI 改的”。但现实骨感——水印只对”在 Google 生态内生成”的内容有效。你导出视频、转码一遍、或者用别的工具再处理,水印就可能掉了。

    • 给暗光视频补光、换背景,门槛低到几乎零成本
    • 艺术风格迁移让”看起来像那么回事”变得特别容易
    • SynthID 只对原生生成内容生效,二次传播基本失效

    我倒不是说 Google 存了什么坏心。把专业级的视频调色、风格化能力下放到每个人的相册,确实是技术进步。但当一个日活几十亿的产品,把”AI 改写现实”做成一键按钮,它承担的就不只是”好玩”的责任了。水印是第一步,但远远不够。


  • CubeSandbox:给 AI Agent 的 60ms 硬件级安全沙箱,腾讯云开源(8.9K Stars)

    CubeSandbox:给 AI Agent 的 60ms 硬件级安全沙箱,腾讯云开源(8.9K Stars)

    CubeSandbox

    📌 项目简介

    CubeSandbox 是腾讯云开源的、面向 AI Agent 的即时、并发、安全、轻量沙箱服务。它基于自研的 RustVMM + KVM 微虚拟机(MicroVM)构建,主打「硬件级隔离」——每个沙箱都跑在独立的 Guest OS 内核里,从根上杜绝了 Docker 共享内核的逃逸风险。平均冷启动 <60ms、单实例内存开销 <5MB,可以放心拿它来跑 LLM 生成的不受信任代码、Agent 自动执行等高风险任务。

    🛠 安装要求与过程

    环境要求:

    • x86_64 Linux 服务器(推荐 OpenCloudOS 9,Ubuntu / Debian / CentOS 同样支持)
    • ≥ 4 核 CPU、≥ 8 GB 内存,建议挂载独立数据盘给 /data/cubelet
    • 需要 KVM 支持(云服务器若无 /dev/kvm,可开启腾讯云 PVM 嵌套虚拟化)
    • v0.5.0 起原生支持 ARM64 全栈

    一键安装:

    # 标准安装(需 /dev/kvm)
    curl -sL https://github.com/tencentcloud/CubeSandbox/raw/master/deploy/one-click/online-install.sh | bash
    
    # 云服务器无嵌套虚拟化时,开启 PVM 安装
    curl -sL https://github.com/tencentcloud/CubeSandbox/raw/master/deploy/one-click/online-install.sh   | CUBE_PVM_ENABLE=1 bash
    
    # 国内加速镜像
    curl -sL https://cnb.cool/CubeSandbox/CubeSandbox/-/git/raw/master/deploy/one-click/online-install.sh   | CUBE_PVM_ENABLE=1 MIRROR=cn bash

    安装完成后打开 Web 控制台:http://<控制节点IP>:12088,三步即可上手:查看 Overview → 从 Template Store 准备模板 → 创建沙箱(Sandboxes → + New sandbox)。

    如果只想在本地 Python 里玩,也可以 pip install cubesandbox 拉起组件做开发联调。

    ⚡ 核心功能

    • 亚 60ms 冷启动 + 高密度:单实例开销 <5MB,支持空闲自动挂起/唤醒(AutoPause/AutoResume),单机可并发跑成百上千个沙箱。
    • 硬件级隔离:每个实例独立 Guest OS 内核,基于 KVM MicroVM + eBPF 虚拟交换机(CubeVS)做内核级网络隔离,不存在容器共享内核的逃逸面。
    • 无缝兼容 E2B SDK:原生兼容 E2B 协议,业务代码零改动——只把 E2B_API_URL / E2B_API_KEY 指向你自己的 CubeSandbox 即可迁移。
    • 企业级安全:凭据保险库(密钥不进沙箱/上下文/日志)、出口控制(域名白名单 + 未授权出口即时阻断 + 审计日志)。
    • 快照·克隆·回滚:基于 CubeCoW 写时复制引擎,百毫秒级打检查点,可回滚或开分支,Agent 试错零成本。

    🎯 典型使用场景

    1. 跑 LLM/Agent 生成的不受信任代码

    把模型吐出来的 Python/Shell 丢进沙箱执行,硬件隔离 + 出口白名单保证即使代码作恶也伤不到宿主。E2B 兼容意味着你现在的 Code Interpreter 代码直接换环境变量就能用:

    export E2B_API_URL=http://<你的控制节点IP>:12088
    export E2B_API_KEY=<你的API Key>
    
    from e2b_code_interpreter import Sandbox
    sandbox = Sandbox()
    execution = sandbox.run_code("x = 1 + 1; print('result =', x)")
    print(execution.logs.stdout)   # result = 2

    2. 浏览器自动化 / 数据抓取 Agent

    给爬虫、RPA、AI 操作员一人一个干净隔离的浏览器环境,跑完即销毁,避免指纹污染和横向污染。配合 Template Store 预置好带登录态的镜像,开箱即用。

    3. 强化学习 / SWE-Bench 类大规模评测

    官方用 CubeSandbox 做 SWE-Bench RL 训练,上千个独立环境并发创建、秒级回收,单节点高密度把评测成本打下来。

    💡 推荐理由

    这两年「让 Agent 自己写代码自己跑」成了标配,但把模型生成的代码直接丢宿主机执行,等于把大门钥匙交给一个偶尔会发疯的实习生。CubeSandbox 的价值就在于:它把「隔离」这件事做到了又快又便宜又省心——60ms 启动让你几乎感觉不到沙箱的存在,<5MB 开销让并发成本可控,而 E2B 兼容意味着你不用重写一行业务代码就能把云端沙箱换成自建的、数据不出域的版本。

    对国内团队尤其友好:有 CN 镜像、有 PVM 解决云厂商嵌套虚拟化痛点、有中文文档和微信社群。想自建一套「AI 代码执行底座」,CubeSandbox 是目前最省事的开源选择之一。

    📥 下载地址

    许可:Apache-2.0(仓库主协议,部分组件为其他开源协议)。当前 Star 数约 8.9K,仍在快速增长中。

  • 亚马逊秘密项目Moonraker曝光:要让Alexa真正像个能办事的Agent

    亚马逊 Alexa AI 代理概念图
    亚马逊秘密项目 Moonraker 旨在让 Alexa 升级为 AI 代理(概念图)

    Amazon 的 Alexa 一直被吐槽”听懂了但办不成事”。最近 Business Insider 翻出一批内部规划文件,曝光了一个此前没对外说过的项目,代号”Moonraker”——亚马逊想让 Alexa 从一个”问答机”变成能一口气跑完多个动作的 AI 代理。

    从”一句话”到”一串动作”

    现在的 Alexa+ 已经能帮用户叫车、买票,不过得靠 Uber、Ticketmaster 这些合作伙伴接好接口,本质上还是”你说一句、它办一件”。Moonraker 要做的,是让一次请求触发一连串操作。文件里举了个例子:”帮我叫辆车,再给我朋友发条消息”——以前 Alexa 大概率会卡在第二步,现在它要自己把这两件事都办了。

    这个方向一点都不新鲜,Google、OpenAI、Anthropic 早就推出了能自己上网、跑多步流程的 agent 产品。亚马逊只是终于坐不住,要把 Alexa 也推进这条赛道。

    代价是真贵

    但让 Alexa 变聪明,烧钱也烧得吓人。内部文件直接把 Moonraker 标成 Alexa+ 这轮升级里”成本最高”的新项目,预计 2026 年光 GPU 费用就要超过 1 亿美元。有文件甚至建议,要么推迟、要么缩水,给成本压力降降温。

    一些亚马逊高管觉得,团队在喂 Alexa 的 AI 模型上花超了,运行这些模型的费用已经成了内部越来越大的心病。这其实不是亚马逊一家的问题——整个硅谷都在经历一场”token 账单”的清醒:当先进 AI 真正铺开,账怎么算都肉疼。

    Alexa 的”成长的烦恼”

    翻翻 Alexa+ 的履历,麻烦一直没断过。助手在美国的铺开被推迟了好几回,年初才扩大可用范围;内部 beta 测试的时候还曝出幻觉、答非所问的问题,有个员工的 Alexa 误把鱼缸过滤器关了,鱼当场没了。CEO 贾西在最新的股东信里倒是很乐观,说大家跟 Alexa+ 聊天翻了一倍、下单频次是以前的三倍,但也没忘补一句:”Alexa 离成为全世界最好的个人助理,还早得很。”

    为了撑起 Moonraker,亚马逊去年底就备好了几百张英伟达 GPU,测试时还用了 Anthropic 的 Sonnet 模型做高级推理和视觉回应。不过面对 BI 的提问,亚马逊选择了不置评。


    说到底,Moonraker 是亚马逊给 Alexa 的一场豪赌:它想让语音助手真正”办成事”,而不只是”聊聊天”。只是这门生意的账,目前怎么看都不便宜。

  • 特朗普松口,OpenAI GPT-5.6本周四全面开放:Sol、Terra、Luna三件套来了

    OpenAI GPT-5.6 模型发布概念图
    OpenAI GPT-5.6 模型套件公开上线(概念图)

    OpenAI 在周二深夜扔出一条重磅消息:GPT-5.6 要来了,而且这次是面向所有人的公开上线。按照公司的说法,旗舰模型 Sol,加上中端的 Terra 和走量的 Luna,会在本周四一起向公众开放。距离 6 月 26 日它第一次以”受限预览”的身份露面,还不到两周。

    一场由政府点头的”放行”

    这次放行背后,站着特朗普政府。据 Axios 报道,在 OpenAI 和美国商务部下属的”AI 标准与创新中心”又做了一轮测试、开了几轮会之后,政府才给了这次大规模发布的绿灯。OpenAI 还专门派了技术专家常驻华盛顿,随时准备回答监管方的疑问。

    其实上个月,特朗普政府就要求 OpenAI 搞”分批发布”——先把模型开放给政府批准的少数实体,普通人暂时摸不着。当时 OpenAI 就明说,这不是它喜欢的发布方式。

    有意思的是,白宫自己并不认”绿灯”这个说法。一位官员回应说,法律上根本不需要、也没发过什么许可,”放不放、怎么放,决定权完全在公司手里”,还搬出了 6 月 2 日那份 AI 行政令——里面明确禁止联邦层面对模型发布搞强制牌照或预审。换句话说,那些测试和会谈,都是”自愿”的。

    不只 OpenAI 一家被卡过

    把视线拉宽一点,你会发现这阵子最先进的模型几乎都被”限”过。6 月商务部直接禁止外国人使用 Anthropic 的 Mythos 和 Fable 模型,等于逼着它们退出部分市场;上周 Fable 的禁令才刚松绑,用户访问隔了一天就恢复。OpenAI 和 Anthropic 这两家头部公司,最近的处境出奇地像。

    实力与定价才是真看点

    抛开监管戏码,GPT-5.6 本身有两把刷子。OpenAI 说它在写代码、网络安全、生物这几个方向特别能打,长任务的代理(agentic)能力也比上代稳。Sol 还多了两个档位:一个叫”max”,专门做更深层的推理;一个叫”ultra”,能调度子代理——这明显有 OpenAI 收购的 OpenClaw 团队的手笔。

    • Sol:旗舰,主打高端任务,定价每百万 token 输入 5 美元、输出 30 美元。
    • Terra:中端,定位”高吞吐量工作”,价格正好是 Sol 的一半。
    • Luna:日常款,便宜又快,价格还不到 Terra 的一半。

    这个定价挺狠——Sol 的成本差不多只有 Anthropic 旗舰 Claude Fable 5(10/50 美元)的一半。在大家都在喊”token 太贵”的当口,OpenAI 直接把价码压了下来。


    安全方面,OpenAI 这次也下足了功夫。Sol 被训练成会拒绝违规的网络协助请求,包括用户试图伪装意图或”越狱”的情况;公司还投入了约 70 万块 A100e 等效 GPU 小时做自动化红队测试。OpenAI 自己也说,希望这种”政府点头才能发”的流程别变成长期常态——毕竟把最好的工具卡在门外,受影响的还有开发者、企业和网络安全防御方。

  • 韩国商业风格产品拉扯涂鸦插画

    韩国商业风格产品拉扯涂鸦插画

    韩国商业风格产品拉扯涂鸦插画



    🤖 ChatGPT

    🇺🇸 English Prompt

    Use the uploaded product image as the exact reference. Preserve the product, packaging, logo, label, colors, textures, proportions, and branding 100% unchanged. Remove all props and place only the hero product on a clean pure white premium studio background.
    
    A realistic male hand enters from the frame edge, naturally gripping (without covering the logo) and pulling/lifting/dragging the product away with correct anatomy, realistic pressure, shadows, and skin texture.
    
    Add one unique hand-drawn doodle male character (random age, hairstyle, outfit, personality) desperately clinging to the product, being dragged while trying to stop the hand. Expression: [EXPRESSION]. Include a handwritten speech bubble with exactly: [SPEECH BUBBLE].
    Add playful doodle effects (motion lines, sweat drops, impact marks, stars, dust clouds, speed lines).
    
    Keep the product fully visible, ultra-realistic, and the clear hero. Style: Korean premium commercial product photography, clean white background, realistic lighting and shadows, sharp focus, humorous viral advertising.

    🇨🇳 中文提示词

    使用上传的产品图片作为准确参考。保持产品、包装、标志、标签、颜色、纹理、比例和品牌 100% 不变。移除所有道具,仅将核心产品放置在干净纯白的优质摄影棚背景上。
    
    一只写实的男性手从画面边缘进入,自然地抓握(不遮盖标志)并以正确的解剖结构、写实的压力、阴影和皮肤纹理将产品拉走/抬起/拖走。
    
    添加一个独特的手绘涂鸦男性角色(随机年龄、发型、服装、性格)拼命抓住产品,在试图阻止这只手时被拖走。表情:[EXPRESSION]。包含一个手写对话气泡,内容完全为:[SPEECH BUBBLE]。
    添加俏皮的涂鸦效果(运动线、汗水滴、冲击标记、星星、尘云、速度线)。
    
    保持产品完全可见、超写实,并且是明确的核心主角。风格:韩国高端商业产品摄影,干净的白色背景,写实的光影,锐利对焦,幽默的病毒式广告。