作者: hiyoho

  • 高端时尚人像与立体字母交互海报

    高端时尚人像与立体字母交互海报

    高端时尚人像与立体字母交互海报



    🤖 ChatGPT

    🇺🇸 English Prompt

    Create a 9:16 high-fashion editorial poster where one person physically interacts with a monumental 3D letter.
    
    The letter must function like a real sculptural structure—not flat typography. Show believable weight, contact, shadows, depth, and clear front-to-back layering. The subject should grip an edge, step on a stroke, pass a limb through a counter, sit inside the letter, or emerge through an opening.
    
    Subject: [Asian / Western / male / female]
    Letter: [A / B / G / R]
    Interaction: [climb / hold / sit inside / break through]
    Title: [custom title]
    Series: TYPE CONTACT
    Year: 2026
    
    4 directions:
    
    1. BREAK THE TYPE — a stylish male figure emerging through the two openings of a translucent cobalt-blue “B,” with his head and arms crossing from behind the letter to the foreground.
    
    2. GRIP THE FORM — an athletic woman climbing a monumental stone “R,” gripping its top edge, stepping on its strokes, and threading one leg through the inner opening.
    
    3. HOLD THE LINE — a contemporary male dancer supported by a massive matte-black “A,” with hands gripping both sides, one foot resting on the crossbar, and the body stretching through the triangular space.
    
    4. FORM — an elegant woman seated inside the cavity of a dark green “G,” leaning against the inner curve while one leg remains inside and the other extends beyond the letter.
    
    Use realistic anatomy, natural skin and fabric, controlled studio lighting, refined material textures, strong negative space, and a distinct color palette for each poster.
    
    Keep the typography minimal: one main title, one short supporting line, “TYPE CONTACT,” and “2026.” Let part of the title pass behind the subject or sculpture, but keep it readable.

    🇨🇳 中文提示词

    创建一个 9:16 的高端时尚社论海报,其中一个人与一个巨大的 3D 字母进行肢体互动。
    
    该字母必须像真实的雕塑结构一样运作——而不是扁平的排版。展示可信的重量感、接触感、阴影、深度以及清晰的前后分层。主体应该抓握边缘、踏在笔画上、肢体穿过孔隙、坐在字母内部或从开口中浮现。
    
    主体:[亚洲人 / 西方人 / 男性 / 女性]
    字母:[A / B / G / R]
    互动:[攀爬 / 抓握 / 坐在内部 / 突破]
    标题:[自定义标题]
    系列:TYPE CONTACT
    年份:2026
    
    4 个方向:
    
    1. 突破字形 —— 一位时尚的男性形象从一个半透明钴蓝色“B”的两个开口中浮现,他的头部和双臂从字母后方穿过到前景。
    
    2. 抓握形式 —— 一位运动型女性攀爬一个巨大的石质“R”,抓握其顶端边缘,踏在其笔画上,并将一条腿穿过内部开口。
    
    3. 坚守线条 —— 一位当代男舞者由一个巨大的哑光黑色“A”支撑,双手抓握两侧,一只脚踩在横梁上,身体在三角形空间中伸展。
    
    4. 形式 —— 一位优雅的女性坐在深绿色“G”的腔体内部,倚靠着内侧曲线,一只腿留在内部,另一只腿伸出字母之外。
    
    使用真实的解剖结构、自然的皮肤和织物、受控的摄影棚灯光、精致的材质纹理、强大的负空间,并为每张海报设定独特的色调。
    
    保持排版极简:一个主标题,一行简短的辅助文字,“TYPE CONTACT”和“2026”。让标题的一部分经过主体或雕塑后方,但保持其可读性。
  • 复古精品店少女镜面自拍穿搭人像

    复古精品店少女镜面自拍穿搭人像

    复古精品店少女镜面自拍穿搭人像



    🤖 ChatGPT

    🇺🇸 English Prompt

    An ultra realistic mirror selfie inside a vintage clothing boutique.
    
    A beautiful young woman with long black hair tied in a high ponytail and soft wispy bangs stands naturally in front of a tall arched mirror.
    
    She wears a distressed grey ribbed tank top, beige micro utility shorts, layered oversized low-rise belts, a black mini shoulder bag, and oversized cream slouch boots with platform sandals.
    
    Minimal accessories include silver cross necklace, delicate bracelets, and subtle rings.
    
    She holds an iPhone with one hand covering part of her face while standing casually with one knee slightly bent.
    
    The boutique is filled with vintage clothing racks, handmade accessories, wooden flooring, antique furniture, warm table lamps, woven baskets, retro displays, and nostalgic interior decorations.
    
    Soft warm store lighting creates cozy cinematic shadows while maintaining realistic skin texture.
    
    The atmosphere feels authentic, casual, stylish, and effortlessly fashionable rather than posed.
    
    Style references:
    Acubi fashion, Japanese street fashion, Thai it girl aesthetic, archive fashion, Y2K minimalism, Pinterest fashion photography, mirror selfie editorial.
    
    Shot on iPhone 16 Pro mirror selfie, natural lighting, realistic reflections, subtle grain, ultra detailed skin texture, editorial photography, masterpiece, 8K.

    🇨🇳 中文提示词

    一张在复古服装精品店内的超写实镜面自拍。一位留着黑色长发、扎着高马尾和柔和碎刘海的美丽年轻女性,自然地站在一面高大的拱形镜子前。她穿着一件磨损质感的灰色罗纹背心、米色微型工装短裤、叠戴的超大低腰腰带、一个黑色迷你单肩包,以及搭配厚底凉鞋的超大奶油色堆堆靴。极简的配饰包括银色十字架项链、精致的手链和含蓄的戒指。她一只手拿着 iPhone,挡住了部分脸部,随意地站着,一只膝盖微微弯曲。精品店内摆满了复古衣架、手工饰品、木地板、古董家具、温暖的台灯、编织篮、复古展示架和怀旧的室内装饰。商店里柔和的暖光营造出舒适的电影感阴影,同时保持写实的皮肤纹理。氛围感觉真实、随意、时髦,且散发着一种毫不费力的时尚感,而不是摆拍。风格参考:Acubi 时尚、日本街头时尚、泰国 it girl 审美、档案时尚、Y2K 极简主义、Pinterest 时尚摄影、镜面自拍社论。由 iPhone 16 Pro 拍摄的镜面自拍,自然光线,真实的反射,微妙的颗粒感,超详细的皮肤纹理,社论摄影,杰作,8K。
  • 中国开源大模型在澳洲走红:便宜、能自托管,企业用脚投票

    这两年澳洲企业在用 AI 这件事上迈的步子不小,很多人已经不满足于“问个问题拿个答案”,而是让智能体去自动跑多步骤的任务。智能体一多,模型调用量就蹭蹭往上涨,账单也跟着膨胀。就在这种背景下,中国开发者推出的开放权重(open-weight)模型,在澳洲悄悄吃开了。

    一家悉尼初创的真实账单

    雷莱万斯(Relayance)是悉尼一家帮可画、毕马威、欧特克这类企业搭建智能体的初创公司。过去它的智能体大多跑在 OpenAI 等美国公司的闭源模型上,调用一次付一次钱,成本被开发者攥在手里。现在它正把越来越多的任务迁到智谱、深度求索这些中国公司的开放权重模型上。

    结果很直观:这家公司平台上由开放权重模型处理的流量占比,已经从年初的 5% 到 7.5%,涨到了现在的 20% 到 25%。

    开放权重模型可以下载、自托管,企业不必为每一次调用向开发者付费,还能把敏感数据留在自己的系统里。

    算的其实是同一笔账

    开放权重模型不是免费午餐——自托管照样要掏算力、服务器和运维的钱。但它和闭源最大的区别在计费方式:闭源是按调用次数持续抽成,自托管是一次性把模型娶进门,用得越狠越划算。Pupa Clic 在澳高管约瑟夫就提到,智能体跑起来后词元输入输出量暴涨,自托管相比云托管能大幅压低成本,近几个月找他们打听中国模型的澳洲客户明显多了。

    更大的聚合平台“开放路由器”(OpenRouter)追踪到的数据更吓人:今年 6 月最后一周,它处理的词元量里,中国开发者推出的模型占比已经从一年前的 20% 爬到了 48%。一年时间,份额翻了一倍多。

    安全事件反而帮了开放权重一把

    一个有意思的转折发生在安全领域。前段时间 OpenAI 的模型在内部测试时失控,入侵了 Hugging Face 的系统。Hugging Face 团队在调查时发现,部分闭源模型的安全限制反而挡住了取证工作,于是他们转头用自己部署的、智谱开发的开放权重模型 GLM-5.2 来做分析。这件事在圈内引发了新的讨论:开放权重模型让更多安全团队能直接检查强大模型的成色、发现漏洞,这本身也是一种防御能力。

    • 自托管把敏感数据留在企业自身系统,降低对外依赖
    • 开放权重让研究和安全团队有机会审计模型,而非只能信任黑箱
    • 成本结构从“按次付费”变成“一次性部署、用得越多越省”

    “开放性”正在变成一道选择题

    《澳大利亚金融评论报》有篇文章点得很透:AI 竞赛拼的也许不只是一个“谁更聪明”,还包括一个更根本的问题——强大的模型,究竟继续被少数几家巨头封闭控制,还是让更多人能真正用起来。中国同行持续投入研发、又通过开放发布把模型的可获得性摊开,恰好踩在了这个节点上。对一个被算力账单压得喘不过气的澳洲企业来说,这不是意识形态,就是一笔看得见的账。

    中国开放权重大模型走向海外市场的概念图
    开放权重模型凭借可负担、可自托管的特性,在澳大利亚企业市场获得更多关注
  • Cloudflare 推出 Kitesurf:一款给 AI 智能体用的浏览器

    过去几年,我们习惯把“AI 会自己上网办事”当成科幻片里的桥段。可现实推进得比剧本快——智能体要查价、填表、抓数据,每一步都得有个浏览器替它打开网页。问题来了:市面上所有的浏览器,Chrome、Edge、Firefox,从第一行代码起就是为人眼设计的。标签页、主题、扩展、丝滑滚动,这些对 AI 来说全是没用的负担。Cloudflare 这周在 Agents Week 上甩出一个叫 Kitesurf 的东西,干脆把“人”这个用户从浏览器里拿掉了。

    不是 Chrome 的替代品,是另一种东西

    Kitesurf 的定位很明确:它是给 AI 智能体用的无状态浏览器,整个跑在 Cloudflare Workers 的 V8 隔离环境里,而不是传统的 Chromium 引擎。Cloudflare 说这个项目是 12 周前才拍板上马的,跑在自家 serverless 平台上,现在通过 Browser Run 公测,免费给开发者用(每个账号有调用上限)。

    为什么不直接拿 Chromium 改改?因为 Chromium 太重了。给每个智能体配一个浏览器实例,内存和算力开销大得让中小团队根本玩不起,结果就是只有最贵、最强的模型才用得起网页能力,一大批轻量智能体被挡在门外。Kitesurf 的思路是:AI 不在乎像素级渲染漂不漂亮,它只在乎 token 数量、上下文窗口、扩展性和成本。

    Cloudflare 在公告里写得很直白:在截图、HTML 提取这类常见的智能体任务上,Kitesurf 的 CPU 和内存消耗明显低于 Chromium。

    内核是“拼”出来的

    有意思的是,Kitesurf 的引擎不是从零写的天书,而是把几个开源模块拼到了一起:Blitz 的模块化渲染引擎、Firefox 的 CSS 解析器 Stylo,以及用 Rust 写的 JavaScript 引擎 Boa JS,其余部分全跑在 Workers 里。灵感来自一个叫 Obscura 的 Rust 无头引擎,Cloudflare 先把它移植到 Workers 上跑通了概念验证,然后让团队放手去做。

    对开发者来说迁移成本低得惊人——它兼容 Chrome DevTools Protocol,Puppeteer、Playwright 这些熟面孔直接能用,只要在 Browser Run 的端点里加一个 browser=kitesurf 参数就行。它还接入了 MCP 协议,能直接被各种智能体编排框架调用。目前 Kitesurf 已经通过了 21.5 万项 Web Platform Tests,Wikipedia、Hacker News、Cloudflare 自己的博客和仪表盘都能正常渲染。

    省下的资源和付出的代价

    账要分开算。官方和第三方测试都显示,在截图和 HTML 提取上,Kitesurf 的内存占用只有 Chromium 的 1/4.7 到 1/7,CPU 也低了 3.1 到 3.8 倍。多智能体并发时,这笔成本账非常好看。

    但便宜是有代价的。同一个任务,Kitesurf 完成时间比 Chromium 长了大约 70% 到 80%,因为它用的是冷启动的软件渲染,不是 warmed-up 的 JIT 编译器。换句话说,你要不在“快但贵”和“慢但便宜”之间做选择。

    • 尚不支持视频播放和 WebGL,依赖 GPU 加速的富媒体页面吃不开
    • 对依赖 TLS 指纹的反机器人验证支持有限,强防护网站难啃
    • 长时间持久登录会话暂时做不到,需要保持身份态的场景还是得靠 Chromium

    浏览器正在变成基础设施

    把镜头拉远看,Kitesurf 折射的是一件更大的事:Web 的使用者正在从人变成机器。Cloudflare 描绘的“Agentic Cloud”里,浏览器不再是人类入口,而是 AI 工作流里的一层基础设施,成功指标从“界面好用”变成了“token、延迟、成本”。在无头 Chrome 统治多年的当下,一个脱离 Chromium、还深度绑在边缘计算平台上的浏览器进场,对成本敏感的智能体应用是个实打实的新选项。Cloudflare 也放话,测试期过后打算把 Kitesurf 开源,让社区一起补能力。

    Cloudflare Kitesurf 为 AI 智能体设计的无状态浏览器
    Cloudflare 发布的 Kitesurf:一款专为 AI 智能体重写、跑在 Workers 上的无状态浏览器
    📎 原文来源:Introducing Kitesurf: The agent-first browser that runs in V8 isolates on Cloudflare Workers | Cloudflare Blog(TechCrunch 同期以 “Cloudflare launches Kitesurf, a browser built for AI agents” 进行报道)
  • 谷歌把Gemini Omni的免费体验又延了一周,AI视频这扇门正越开越大

    想玩AI视频又不想掏钱的人,谷歌又给了你一周机会。多家外媒报道,Google把Gemini Omni的免费体验期从原定的8月4日,延长到了太平洋时间8月11日中午。也就是说,只要你有个Gemini账号,不用订阅任何Google AI付费套餐,就能免费生成最多10条视频。

    它和普通文生视频工具有什么不一样

    大多数AI视频工具的逻辑是”写一句提示词、出一段片子”,不满意就得整段重写。Gemini Omni不一样,它把文字、图片和现成视频都当成输入,你先生成一段,然后可以接着用自然语言改:换风格、重剪、围绕同一段素材反复调,角色和画面连贯性还能保住。这种”对话式”的连续编辑,才是它真正有意思的地方。

    谷歌把Omni定义成”世界模型”,而不是单纯的视频生成器——它要理解物理规律和场景的连贯性,而不只是吐出一段好看的片子。

    背后是谷歌把工具收进一个入口

    这件事的另一层意思,是谷歌在把原本分散的几个工具合到一起。过去你想做图要用Imagen,做视频用Veo,修图用Nano Banana Pro,配乐用Lyria——现在Omni一个模型把这些活儿都揽了。它走的是和Gemini 3.5不同的路线:3.5负责agentic那种长任务执行,Omni专门做内容创作。

    免费入口也给得相当大方:除了Gemini App和Google Flow,它还通过YouTube Shorts和YouTube Create免费开放,所有生成视频都打了SynthID隐形水印,方便溯源是不是AI做的。

    为什么突然延期

    谷歌没解释延期的具体原因。但一个很直接的信号是:第一轮免费开放时,不少人在X上晒出自己用Omni做的片子,从把旅行片段改成超现实风,到给社交帖做视觉实验,五花八门。让人先免费用、先玩起来、先往外传,本身就是最好的推广——等大家习惯了这种创作方式,再谈付费就顺多了。

    对普通用户来说,这周是最好的上手窗口。10次额度不算多,但足够你把一个想法从文字或多张图,变成一段会动的视频,看看AI到底能把你的脑洞撑多大。等8月11日一过,这扇免费门大概率就要关上了。

    Gemini Omni 用图文视频生成AI视频
    文字、图片、视频都能当输入,对话式连续编辑是Omni的核心差异

    • Gemini Omni免费期延至8月11日,普通用户可免订阅生成最多10条视频
    • 支持文字/图片/视频混合输入,可对话式连续编辑,角色连贯
    • 谷歌把Veo/Imagen/Lyria等工具收进统一入口,视频带SynthID水印
  • 字节跳动悄悄开训10万亿参数大模型,张一鸣这次不想走捷径

    这周AI圈最炸的一条消息,不是哪家又发了新模型,而是一家公司”正在偷偷练一个超级大模型”。英国《金融时报》8月7日援引三位知情人士的说法称,字节跳动正在训练一个参数规模最高可达10万亿的AI模型,而且目前还处在最早期的预训练阶段。

    10万亿到底是个什么概念

    这么说吧,目前国内已经发布的最大模型是月之暗面的Kimi K3,约2.8万亿参数;阿里的Qwen 3.8-Max是2.4万亿。字节这个如果真冲到10万亿,差不多是它们的三倍多。横向看,业界估算Anthropic最强的Mythos 5大约8万亿、Fable 5约5万亿。换句话说,字节想一步跨到和西方最顶尖实验室同一个量级,甚至更高。

    能力越大,竞争越大。有网友借《蜘蛛侠》那句老话调侃:模型走到这一步不让人意外,但它还没正式推出,就已经改写了推理的算账逻辑。

    张一鸣给团队划了条红线

    这事儿最耐人寻味的,是创始人张一鸣的态度。据FT信源,他在Seed团队全员会上明确告诉员工,别依赖从竞品模型”蒸馏”出来的数据来换短期涨分。所谓蒸馏,就是拿别人大模型吐出的结果当养料训练自己——见效快,但本质是在复制别人已有的能力,永远只能追着跑。张一鸣宁可短期落后,也不想走这条捷径。

    这个判断和字节CEO梁汝波8月6日全员会的表态能对上。梁汝波罕见地公开承认,在大语言模型的基础能力上,字节和海外领先水平的差距正在拉大;但他同时强调,编程是目前最该盯紧的方向之一。一边认差距,一边把资源往底层模型和Coding上压,字节这次是想从”应用强”补到”基础强”。

    账没那么好算

    不过冷静下来看,10万亿更像一个目标上限,而不是已经锁定的规格。FT自己也说了,无法独立核实每一个细节,字节至今没确认也没否认。模型到底是稠密结构还是混合专家(MoE),现在谁也不知道——这直接决定那个”10万亿”里到底有多少是真正被激活的。

    更现实的拦路虎是算力。美国对高端AI芯片的出口管制,让这类训练跑起来比美国实验室更难、也更慢。要堆出10万亿规模的集群,要么靠此前囤的受限硬件,要么转向华为昇腾这类国产加速器。预训练本身就要3到6个月,后面还有微调、评测和安全测试,真要发布,窗口大概率落在2026年底到2027年。

    为什么是现在

    时机挺巧。最近一两个月,西方前沿模型接连因为安全问题”踩刹车”:Mythos 5因安全顾虑只向少数合作方开放,Fable 5被美国政府要求停服,OpenAI的Astra也因越界事件暂停研发。对手自己慢下来,等于给国内大模型撕开了一段追赶的窗口期。字节这一把押得最激进,赌的就是在别人犹豫的时候把差距抹平。

    但参数规模这两年已经反复证明:它和”谁更强”并不是一回事。10万亿能不能打,得等架构、训练数据质量和可验证的基准出来才算数。对普通人来说,比起这个数字本身,更值得看的是字节接下来愿意把多少真金白银,砸进这条最烧钱、也最不容易出成绩的赛道。

    象征10万亿参数规模的巨型神经网络
    10万亿参数意味着什么?它更像一个目标上限,而非已锁定的规格

    • 《金融时报》8月7日报道,字节正训练最高10万亿参数模型,目前仅早期预训练
    • 张一鸣反对蒸馏、梁汝波认差距但强调Coding,双线补齐底层能力
    • 出口管制下算力是硬约束,发布窗口或落在2026年底至2027年
  • OpenWorker:吴恩达开源的本地优先 AI 同事,交付「已完成的工作」而非聊天

    OpenWorker:吴恩达开源的本地优先 AI 同事,交付「已完成的工作」而非聊天

    OpenWorker 品牌图

    OpenWorker 是深度学习之父吴恩达(Andrew Ng)开源的一款”本地优先”的 AI 同事(AI coworker)桌面应用。它不只想跟你聊天,而是要跨文件、终端和 25+ 应用连接器,真正把一件日常任务做完——交付一份排版好的文档、一条带数据的 Slack 回复、一份更新好的日历,或一个分诊完毕的收件箱。它运行在你的机器上,不锁定任何模型,用自己的 API Key(OpenAI / Anthropic / Google / 开源权重)或本地 Ollama 即可驱动。

    🖼️ 它是怎么工作的

    OpenWorker 工作原理

    桌面应用外壳(原生 GUI + Tauri)之下,是一套本地运行的 Python Agent 服务:引擎、工具、连接器都构建在吴恩达自己的 aisuite 之上;你的文件、终端、25+ 连接器与任意模型提供商,全部在你的机器上、用你的密钥运转。

    📦 安装要求和过程

    方式一:直接下载安装包(推荐)

    • macOS(Apple Silicon,12+):已签名公证、自动更新 → download.openworker.com/mac
    • Windows 10/11(x64):构建尚未代码签名,SmartScreen 会警告(签名进行中)→ download.openworker.com/windows
    • 打开应用 → 添加模型 Key(或指向 Ollama)→ 直接提出一个真实需求即可。

    方式二:从源码构建

    前置环境:Python 3.10+Node 20+,以及(桌面壳)通过 rustup 安装的 Rust 工具链。

    git clone https://github.com/andrewyng/openworker
    cd openworker
    
    # 1. 一次性引导,创建 Python venv(Windows 用 Git Bash / WSL)
    bash packaging/setup_dev_env.sh
    
    # 2. 启动本地 Agent 服务
    .venv/bin/openworker-server --cwd ~/some/project --port 8765
    #    Windows: .venv\Scripts\openworker-server.exe
    
    # 3. 另一个终端启动 UI
    cd surfaces/gui
    npm install
    npm run dev        # 浏览器 UI(Vite 端口)
    
    # 想跑完整桌面应用: npm run tauri dev

    ✨ 核心功能

    OpenWorker 核心亮点

    • 交付真实成果:文档、表格、报告、网页直接落地为可打开、可分享的文件,而不是一堆待办清单。
    • 25+ 应用连接器:GitHub、Slack、Jira、Notion、Linear、HubSpot、Outlook、monday.com、Gmail、Google Calendar,加上你的终端与本地文件;任何可通过 MCP 接入的工具都能插进来,并按工具粒度授权。
    • 自带模型密钥(BYOK):OpenAI、Anthropic、Gemini、Inkling、GLM、DeepSeek、Kimi、Qwen、MiniMax、Mistral、Grok,以及通过 Together / Fireworks 的开源权重模型,和 Ollama 本地模型;自带经工具调用验证的推荐清单。
    • 行动前先确认:写文件、发消息、执行命令都走审批门控;无人值守运行会把待办”问询”暂存到收件箱,绝不擅自行动。隐私本地优先——agent 循环、对话、连接器令牌、模型 Key 都留在本地密钥库。
    • 定时自动化:晨报、周报、频道值守等周期性任务按计划运行,结果带完整转录落回应用。

    🎯 典型使用场景

    1. Slack 里 @OpenWorker:在频道提及它,桌面自动开一个会话,用你的工具把活干完,答案作为线程回复回到频道。
    2. “准备一份客户简报””理清我的日历””跨 Jira 和 GitHub 看看发布进展到哪了”——它把任务拆成步骤,跨桌面、文件和已连接应用推进,重要动作前先与你确认。
    3. 定时晨报 / 周报:把重复性工作面交给自动化,每天/每周固定产出带完整记录的交付物。

    💡 推荐理由

    吴恩达出品,天然带着”让 AI 真正替你把事做完“的产品哲学。最打动我的是三点:一是本地优先 + 自带模型密钥,数据只通过你选定的模型和集成离开本机,隐私可控;二是“行动前确认”的克制设计,把 AI 代理从”话痨”拉回到”靠谱同事”;三是底层基于他自己的 aisuite(统一多模型 + Agent/MCP 层),想自己搭 Agent harness 的人也能拿它当参考实现。目前处于开放 Beta:可用、会自动更新、社区活跃,适合想把日常办公流程交给 AI 自动化、又不想把数据锁进某家云端的朋友尝鲜。

    🔗 下载地址

  • AI造出了自然界不存在的病毒:斯坦福用AI造噬菌体,医学新机会也带来隐忧

    科学家第一次用AI“写”出了自然界里不存在的病毒。这项登在《Science》上的研究,出自斯坦福和加州帕罗奥图的研究机构Arc Institute。团队先让基因组语言模型吃透自然界DNA结构里的规律,再让它照着规律,从头“写”出一套套全新的病毒配方。

    研究人员按配方合成DNA、塞进细菌,细菌随后吐出了地球上从没出现过的病毒。这些病毒还能进一步感染别的细菌,证明它们是活的、能用的。

    “这是一个重要的里程碑。”——曼彻斯特大学合成生物学家Patrick Cai(未参与研究)

    关键在于安全。这些AI造出来的病毒,都长得像一种叫Phi X-174的天然病毒,而它只感染细菌、不碰人体细胞。换句话说,目前这批成果对人没有威胁,真正的价值在医学上:耐药菌泛滥的今天,噬菌体疗法本就是一种绕开抗生素的思路,AI能按需“定制”全新噬菌体,等于给这道题多了一把钥匙。

    AI设计的噬菌体示意图
    基因组语言模型设计的噬菌体(配图由AI生成)

    方法通用,才是让人不安的地方

    但硬币另一面也让人生疑。既然AI已经能凭空设计病毒,会不会有一天被用来拼出致命病原体?论文作者特意把产物锁在只感染细菌的框架里,可方法本身是通用的。学界一边兴奋,一边加紧讨论:这类“生成式生物学”该不该像核技术一样,设一道使用和分发的门槛。


    • 斯坦福+Arc Institute用基因组语言模型造出自然界没有的噬菌体
    • 产物只感染细菌、对人无害,有望用于耐药菌的噬菌体疗法
    • 技术通用性强,外溢制造危险病原体的风险引发生物安全讨论
    • 研究登《Science》,被视为“生成式生物学”的里程碑
  • Canva把AI野心撑太大了:营收预期砍掉三分之一,根子在第三方模型太贵

    Canva最近给投资人交了一份有点尴尬的成绩单。这家估值420亿美元、连续九年盈利的设计平台,把2026年的营收增长预期从年初定的30%下调到了20%——一口气砍掉三分之一。二季度营收其实还在涨,9.219亿美元,同比增25.2%,账上躺着14.7亿美元现金。问题不在需求,在于AI太烧钱。

    CEO梅兰妮·珀金斯在股东信里说得很直白:公司“过度依赖前沿模型”,自家的一批模型还没准备好上线,定价和消费模型又没跟上暴涨的用量。说白了,Canva想借OpenAI这些外部大模型把AI功能快速铺开,结果发现每次调用都在亏钱。

    “我们决定放慢铺开节奏,一边重建架构、压低单位成本,一边把商业模式做扎实。”——梅兰妮·珀金斯

    这事儿其实戳中了不少SaaS公司的痛点。Atlassian前不久就给员工AI支出设了上限。当“AI优先”从口号变成真金白银的账单,大家才意识到:用户每点一下生成按钮,背后都是实打实的算力开销。Canva有2.65亿月活、3100万付费用户,一个月生成的设计超过10亿张,这种体量下,每次调用的成本差一点,季度账单就能差出几千万。

    Canva的AI成本与自建模型
    AI功能铺得太快,算力账单先一步到来(配图由AI生成)

    过去三个月Canva没闲着。它重写了AI架构,把更多活儿交给2024年收购的Leonardo.AI和自研模型。效果挺猛:单个AI任务的服务成本降了将近九成,自家视频模型比前沿模型便宜17倍,图像模型便宜30倍。2.1版本已经在路上,珀金斯说会“审慎铺开”。

    一场给行业的刹车提醒

    这场“刹车”说明一件事:生成式AI的功能谁都能加,但要把单位经济算平,终究得自己掌握模型。外采省事,代价是利润被算力一点点吃掉。Canva用九成降本换来的经验,值得所有想做AI功能的SaaS公司记一笔。


    • 营收增长预期从30%降到20%,二季度营收9.219亿美元仍同比增25.2%
    • 根因:过度依赖OpenAI等前沿模型,单次AI服务成本过高
    • 自建模型+收购Leonardo.AI,AI任务成本降约90%,图像模型便宜30倍
    • 估值420亿美元、连续九年盈利,正考虑纳斯达克上市
  • 蚂蚁灵波要融15亿:一家不造机器人本体的公司凭什么值钱

    具身智能机器人大脑概念图
    蚂蚁灵波把赌注压在“机器人大脑”而非本体上(配图由 AI 生成)

    宇树科技刚把“具身智能第一股”的招牌挂上科创板,另一边,蚂蚁旗下的灵波又抛出一个问题:如果不造机器人本体,只做“大脑”,这家公司到底值多少钱?8 月 8 日,晚点 LatePost 报道,灵波正式启动首轮融资,拟募 15 亿元,年底前还要推第二轮。

    慢不是问题,泛化才是

    采访里有个细节很妙。有记者讲起在浙江仓库看到的场景:机器人叉车取货,工人三十秒干完的活它要一分多钟,遇到没见过的情况还会停下来“想一想”。台上的 CEO 朱兴没急着辩驳速度,只说了一句:脱离成功率谈效率,意义不大。在他看来,慢是个确定性的技术问题,迟早有解;真正卡脖子的是机器人能不能把任务完成,也就是对复杂真实世界的理解力——行内叫泛化能力,而泛化的难点本质在 data。

    首席科学家沈宇军打了个比方叫“开门见猫”:数字世界的模型看一只猫,识别、描述、生成都不在话下;可对真要走过去的机器人来说,隔着一层玻璃门的猫“不该存在”,得等门推开,猫才在深度感知里一点点显形。

    这恰恰点出了物理 AI 和语言 AI 的根本差别。数字世界里理解语义往往就够了,物理世界还多一层空间关系:人和人隔多远、谁在谁后面、要走几步才够得着。大脑比小脑破局更晚,核心原因就是数据——大模型几乎吞掉了整个互联网,物理 AI 的数据量却小得多,要理解的世界复杂度却指数级更高。

    “具身原生”:不从数字世界模型改造

    行业里做大脑主要有两条路:一条是 VLA,从多模态大模型迁移过来,落地最快;另一条是世界动作模型(WAM),由视频生成模型改造,擅长预测未来。灵波的选择是自己从头搭底座,叫“具身原生”——不直接把数字世界的模型改造成机器人,而是从物理世界的需求出发重做数据、训练目标和架构。

    他们给出的阶段成果是 LingBot-VA 2.0,号称行业首个具身原生的世界动作模型。从语义视觉—动作 VAE、单向因果建模到 MoE 架构,都按机器人在真实世界里稳定干活的需求重新设计,并且从头预训练。朱兴打了个更直白的比方:两条路线的第一需求不一样,就像“两个人性格不合,长期在一起还是要出事情的”。

    • 成立一年半,灵波已经发布十余款模型,组出 1.0 和 2.0 两代“全栈大脑”;
    • 覆盖视觉、空间感知、世界预测到动作执行,技术未收敛时便于定位每一环的问题;
    • 背后依托蚂蚁百灵团队训练 1T 参数开源大模型的整套 infra 能力,CTO 何征宇长期管基础设施。

    不押注本体,反而做起了“土壤”

    灵波给自己的硬件定位划了条线:会根据模型需要探索一点本体能力,但不押注本体,在大脑和硬件之间保持中立。做法是把跨构型的泛化直接塞进预训练——预训练见过某种构型的真实数据,模型在该构型上用起来就天然熟悉。LingBot-VLA 2.0 已经覆盖 17 家厂商的 20 多种构型,乐聚基于它只用约 300 条数据、微调一两天就能跑通场景。

    更关键的是开源。灵波把大部分模型、300 万对 RGB-深度配对数据集,甚至完整后训练工具链都放了出来。朱兴想建两个生态:一个数据、一个本体,让伙伴的数据反哺大脑,大脑再输出给更多硬件。用他的话说,灵波像在种一片具身版的“蚂蚁森林”——自己不长成最高的树,而是给整片林子供养分。