作者: hiyoho

  • 竖屏数码拼贴Kpop偶像时尚壁纸

    竖屏数码拼贴Kpop偶像时尚壁纸

    竖屏数码拼贴Kpop偶像时尚壁纸



    🤖 ChatGPT

    🇺🇸 English Prompt

    A vertical mobile wallpaper, digital collage style, magazine editorial. A young female K-pop idol posing facing the camera, showcasing stylish clothing details. Detailed stripes on her off-shoulder knitwear, edgy platform leather boots. Trendy cool-toned color palette (silver, charcoal, deep black). White cutout border around the character. Upper: clean July 2026 calendar typography. Lower: desaturated urban street background. Lower right: layered Polaroid overlay with "Happy Birthday" handwritten script. Cinematic lighting, muted moody tones, film grain, artistic fashion spread, ultra-detailed --ar 4:5

    🇨🇳 中文提示词

    一张竖屏手机壁纸,数码拼贴风格,杂志社论。一位年轻的女性K-pop偶像面对镜头摆姿势,展示时尚的服装细节。她露肩针织衫上的细致条纹,前卫的厚底皮靴。时尚的冷色调配色方案(银色、木炭色、深黑色)。人物周围有白色剪纸轮廓。上方:简洁的2026年7月日历排版。下方:去饱和度的城市街道背景。右下角:带有手写“Happy Birthday”字样的层叠宝丽来叠加层。电影照明,柔和的忧郁色调,电影颗粒,艺术时尚跨页,超细节 --ar 4:5
  • 都市冷白清透CCD约会生活照

    都市冷白清透CCD约会生活照

    都市冷白清透CCD约会生活照



    🤖 ChatGPT

    🇺🇸 English Prompt

    Photography style: Cold white clear CCD lifestyle style
    Photo direction: Urban dating lifestyle photo
    Scene direction: Light-colored beauty collection store / glass display cabinet / cold white light strips / clean makeup testing table
    Clothing direction: Cold pink U-neck tight short-sleeved top + light gray-white A-line short skirt
    Temperament labels: Gentle, pure, bright, exquisite, dating sense
    Facial features direction: Real, clear, and natural face, gentle and clean, not internet celebrity style
    Facial details: Soft oval face, natural and smooth contours, clear almond eyes, eyes soft and quiet, small and smooth nose shape, low-saturation red bean paste pink lip color, overall gentle and durable to look at
    Hairstyle direction: Natural black long hair hanging down, hair ends slightly curled inward, broken hair on the side of the face to modify the face shape
    Body shape direction: Light and slender, full and natural bust
    Line emphasis: Medium to strong
    Lens direction: Half-body to thighs
    Posture and action: Standing next to a glass display cabinet, one hand lightly holding the bag strap, the other hand hanging down naturally, body slightly turned to look at the camera
    Lighting atmosphere: Cold white light strips in the store + glass cabinet reflected light + extremely weak soft flash
    Filter effect: Cold white highlights + pink-white clear CCD colors + light grain + light digital noise
    Aspect ratio: 9:16
    Supplementary requirements: Cold pink clothing should be bright but not tacky, the image should remain clean and transparent, highlighting the collarbone, chest line, waistline, and overall slender proportions, not too heavy on the internet celebrity store-visiting feeling

    🇨🇳 中文提示词

    摄影风格:冷白清透CCD生活照风
    写真方向:都市约会生活照
    场景方向:浅色美妆集合店 / 玻璃陈列柜 / 冷白灯带 / 干净试妆台
    服装方向:冷粉色U领贴身短袖上衣 + 浅灰白A字短裙 
    气质标签:温柔、清纯、明亮、精致、约会感
    五官方向:真实清透自然脸,温柔干净,不网红
    五官细节:柔和鹅蛋脸,轮廓自然顺滑,清亮杏眼,眼神柔和安静,鼻型小巧流畅,低饱和豆沙粉唇色,整体温柔耐看
    发型方向:自然黑长发披散,发尾轻微内扣,脸侧碎发修饰脸型
    身形方向:轻盈纤细,上围饱满自然
    线条强调:中偏强
    镜头方向:半身到大腿
    姿态动作:站在玻璃陈列柜旁,一只手轻扶包带,另一只手自然垂落,身体轻微侧身看镜头
    光线氛围:店内冷白灯带 + 玻璃柜反射光 + 极弱柔闪
    滤镜效果:冷白高光 + 粉白清透CCD色彩 + 轻颗粒 + 轻数码噪点
    画幅比例:9:16
    补充要求:冷粉色服装要亮但不俗,画面保持干净通透,突出锁骨、胸线、腰线和整体纤细比例,不要网红探店感太重
  • 唯美夏日草坪东亚少女户外写真

    唯美夏日草坪东亚少女户外写真

    唯美夏日草坪东亚少女户外写真



    🤖 ChatGPT

    🇺🇸 English Prompt

    Generate a 9:16 vertical photorealistic summer meadow portrait of a beautiful adult East Asian young woman lying naturally in the grass. She has a refined, attractive face, bright expressive eyes, soft lips, natural skin texture, and long dark hair with loose strands and a slight summer breeze effect.
    
    She looks directly at the camera with a close, sweet, slightly flirtatious gaze and a gentle natural smile. Her figure is slim with elegant feminine curves, healthy and not bony, and she is wearing a soft pink spaghetti-strap camisole dress with lightweight fabric, natural folds, and a flattering but tasteful silhouette.
    
    Make her feel truly inside the meadow: hair, dress, arms, and body naturally pressed into the grass, not floating above it. The grass wraps around her naturally, with tiny yellow flowers scattered around her body. The setting includes soft green hills, blue sky, warm summer sunlight, fresh airy colors, and a clean outdoor atmosphere.
    
    Shot as low-angle close-up outdoor portrait photography, 85mm lens, shallow depth of field, slightly blurred foreground grass and flowers, realistic skin, realistic grass, realistic fabric, and a subtle dreamy summer mood.
    
    Avoid plastic skin, fake background, stiff pose, distorted hands, broken arms, unnatural body pressure, floating body, warped dress, broken straps, neon green grass, over-retouched face, CGI feel, and studio lighting.

    🇨🇳 中文提示词

    生成一张 9:16 垂直比例的写实夏日草地人像,主角是一位美丽的成年东亚年轻女性,自然地躺在草丛中。她拥有一张精致迷人的脸庞,明亮而富有表现力的眼睛,柔软的双唇,自然的皮肤纹理,以及带有散落发丝和轻微夏日微风效果的长黑发。她直视镜头,眼神亲近、甜美且略带调情,带着温柔自然的微笑。她的身材苗条,拥有优雅的女性曲线,健康而不骨感,穿着一件淡粉色的细肩带背心裙,面料轻盈,带有自然的褶皱,剪裁修身且大方。让她感觉真实地置身于草地之中:头发、裙子、手臂和身体自然地压在草地上,而不是漂浮在上面。草自然地包裹着她,她身体周围散落着细小的黄花。场景包括柔和的绿丘、蓝天、温暖的夏日阳光、清新通透的色彩和洁净的户外氛围。以低角度特写户外人像摄影风格拍摄,85mm 镜头,浅景深,前景的草和花略微模糊,写实的皮肤,写实的草地,写实的面料,以及微妙的梦幻夏日氛围。避免塑料皮肤、虚假背景、僵硬姿势、扭曲的手部、断裂的手臂、不自然的身体压力、漂浮的身体、变形的裙子、断裂的肩带、霓虹绿草地、过度修饰的脸部、CGI 感和影棚灯光。
  • Wayve 估值 85 亿美元,给员工开了个 8500 万美元的「套现」窗口

    英国自动驾驶公司 Wayve 最近干了件挺实在的事:让手里的员工把一部分已经兑现的股权卖给投资人,总额 8500 万美元,按 85 亿美元的估值来算。这不是新一轮融资,而是眼下 AI 公司里越来越流行的一种”留人”手段。

    不是融资,是让员工落袋为安

    这次叫 tender offer(股权收购要约),说白了就是公司牵线,让老员工把手里的股份按当前估值卖一部分给新老人投资人,套点现金揣兜里。估值锚定在今年二月那轮 12 亿美元 D 轮之后的 85 亿——那轮由 Eclipse、Balderton 和软银愿景基金二期领投,微软、英伟达、Uber 都跟着投了。这已经是 Wayve 第二次搞这种事了,上一次是 2024 年 5 月伴随 10.5 亿美元 C 轮做的。

    Wayve 在官方博客里写得很直白:造”具身智能”不是写普通软件,需要 AI 和汽车两边的人才,留住这拨人靠的是真金白银的回报,而不是画饼。

    为什么 AI 公司都在这么玩

    过去这种员工套现窗口一般得等到快上市才开,现在完全反过来了。Decagon、ElevenLabs、Linear、Clay 这些 AI 公司最近都搞过类似的操作。逻辑很简单:手上握着稀缺 AI 技能的人议价权太强,竞品随时想挖,自己创业也不是没可能。与其等多年后的 IPO,不如现在就给个兑现机会,让人愿意留下来。

    端到端神经网络,不走高清地图老路

    Wayve 的技术路线挺硬核:它不走大多数自动驾驶公司依赖的高清地图那套,而是用一个端到端的神经网络,纯粹从数据里学开车,更接近人靠经验上路的感觉。为了做个”通用”的 AI 司机——理论上能适应不同国家、不同车型、不同路况——公司一年内把团队从几百人扩到了 1200 人。


    商业化也在加速:今年晚些时候要跟 Uber 在伦敦推 robotaxi 试点,2027 年起把这套软件塞进日产的辅助驾驶系统。一边给员工发钱稳住军心,一边把车开上街,Wayve 这步棋走得不算慢。只不过,端到端路线到底能不能扛住真实路况的复杂,还得等路面上跑出来的数据说话。

    Wayve 自动驾驶测试车在德国街头
    Wayve 的自动驾驶系统已在多个国家城市路测(图源:TechCrunch / Wayve)
  • Gemini Spark 登陆 Mac:谷歌把智能体助手塞进了你的桌面

    Google 把 Gemini Spark 这个”管家型”AI 助手搬上了 Mac。它不算什么全新概念——能帮你整理文件、盯梢你关心的话题、顺手把发票变成预算表——但放到桌面端之后,它第一次能直接碰你电脑里的东西,终于可以和 Claude Desktop、Copilot 这些老对手正面杠上了。

    从聊天框变成会动手的助手

    Spark 是五月底跟着 Google I/O 一起亮相的,定位是”24 小时在线的个人智能体”。这次上了 Mac,它被塞进现有的 Gemini 桌面 app 里,beta 阶段只向美国的 Google AI Ultra 订阅用户开放。最关键的变化是:它不再只能在网页里跟你聊,而是能读取你电脑上的文件、按指令整理下载文件夹,或者把一堆发票直接拼成一张预算表。

    皮查伊在 I/O 上开玩笑说,Spark 跑在云端虚拟机上,”所以你可以合上笔记本了”——这话明显是在暗戳戳怼那些必须让电脑一直醒着才能干活的本地智能体。

    补上了被吐槽最狠的短板

    上个月 Spark 刚出来时,TechCrunch 的编辑专门点名:这玩意儿居然连 Google 自家的 Keep 笔记都接不上,想记个简单的打包清单都得塞进 Docs,太别扭。这次更新总算把 Tasks 和 Keep 补上了,还顺手接了一堆第三方应用:Canva、Dropbox、Instacart、OpenTable、Zillow Rentals。也就是说,你能让它帮你订餐厅、买每周的菜、做租房传单,甚至安排看房。

    开始”实时盯盘”

    另一个新花样是实时话题追踪。Spark 现在能跟着体育比分、股价、突发新闻走,也能盯着社交媒体、博客、购物网站和天气。谷歌还放风说要支持自定义的 MCP 协议,让你把自己常用的 app 直接接进来,把助手调教成更贴合你自己的样子。


    手机端的多步任务还没上线,但谷歌说”很快”就能在手机上派活儿,比如远程让桌面的 Spark 去翻 Mac 里某个文件。说白了,谷歌想让 Spark 成为你数字生活里那个随叫随到、还真的会动手的帮手——至于大家愿不愿意为它每个月掏 Ultra 的订阅费,那就是另一回事了。

    Gemini Spark 在 Mac 桌面端的界面截图
    Gemini Spark 现已作为智能体助手登陆 macOS 版 Gemini 桌面应用(图源:TechCrunch / Google)
  • Open WebUI:自托管、可离线运行的 AI 聊天与智能体平台

    Open WebUI:自托管、可离线运行的 AI 聊天与智能体平台

    Open WebUI 界面演示

    项目简介

    Open WebUI 是一个功能丰富、可完全离线运行的自托管 AI 平台,支持 Ollama 本地模型与 OpenAI 兼容 API,内置 RAG 检索增强、多模型对话、语音/视频通话、智能体与插件生态,是把任意大模型变成”私有 ChatGPT”的一站式前端。(GitHub ⭐ 145K+,Python,Open WebUI License)

    安装要求和过程

    环境要求:Python 3.11(pip 方式);或 Docker 20.10+(容器方式);可搭配 Ollama 本地推理,或任意 OpenAI 兼容 API Key。

    方式一 · pip 安装(最简):

    pip install open-webui
    open-webui serve   # 访问 http://localhost:8080

    方式二 · Docker 一条命令(自带 Ollama,CPU):

    docker run -d -p 3000:8080   -v ollama:/root/.ollama -v open-webui:/app/backend/data   --name open-webui --restart always   ghcr.io/open-webui/open-webui:ollama

    方式三 · 仅用 OpenAI API:

    docker run -d -p 3000:8080   -e OPENAI_API_KEY=your_secret_key   -v open-webui:/app/backend/data   --name open-webui --restart always   ghcr.io/open-webui/open-webui:main

    部署后访问 http://localhost:3000 即可使用;也支持 Docker Compose、Kubernetes(Helm/Kustomize)与 uv 安装。

    核心功能

    • 广泛的模型与 API 接入:本地 Ollama + 任意 OpenAI 兼容后端(LM Studio、Groq、OpenRouter、vLLM、Mistral 等),支持多模型并行对话、各取所长。
    • 本地 RAG 知识库:支持 9 种向量数据库与多种文档解析引擎(Tika、Docling、Mistral OCR 等),混合检索(BM25+向量)+ 重排,用 # 命令把文档/网页直接拉进对话。
    • 智能体与插件生态:Filters / Actions / Pipes / Tools / Skills 插件机制,可接 MCP、OpenAPI 工具服务器,把任意基础模型包装成专属 Agent。
    • 语音/视频通话与多模态:本地 Whisper 等 STT + 多种 TTS 引擎,内置 DALL·E / Gemini / ComfyUI 图像生成与编辑,支持网页浏览与联网搜索。
    • 企业级管理与安全:细粒度 RBAC 与用户组、LDAP / SSO / SCIM 自动配置、PostgreSQL 持久化、横向扩展与 OpenTelemetry 可观测性。

    典型使用场景

    • 个人本地 AI 助手:用 Ollama 在笔记本上跑 Llama / Mistral,全程离线、数据不出本机,配合 RAG 问答私人文档。
    • 团队自托管 AI 中台:公司内部署,接入 OpenAI 或自建 vLLM,统一账号、权限与用量审计,替代公网 SaaS,守住数据隐私。
    • 知识库问答与自动化:把 Confluence / Notion / 本地文件建索引,用智能体 + 定时自动化做日报生成、资料检索与多模型 A/B 评估。

    推荐理由

    我把 Open WebUI 当作”私有 ChatGPT 的标杆”。它最打动我的是真正的离线优先与自托管能力——所有聊天与文档数据都留在自己的机器或服务器,不依赖任何云。RAG 开箱即用,多模型对比、语音通话、插件生态一应俱全,Docker 一条命令就能跑起来,对不想把对话记录交给第三方的用户极其友好。社区极其活跃、更新频繁,是个人和中小团队落地 AI 的最低门槛选择。

    下载地址

  • Meetily:把会议转录和 AI 摘要锁在本地的隐私优先助手(24.4K Star)

    Meetily:把会议转录和 AI 摘要锁在本地的隐私优先助手(24.4K Star)

    每次开完会,最烦的不是写纪要,而是「这录音到底传去哪了」。云端会议助手很方便,但你的商业机密、病人信息、法律磋商,全进了别人家的服务器。最近在 GitHub 上刷到一个星标冲到 2.4 万+ 的项目 Meetily,它的卖点就一句话:转录和摘要 100% 在你自己电脑上跑,数据不出本机。今天把它拆给你看。

    📌 项目简介

    Meetily 是一个隐私优先的本地 AI 会议助手:实时录音转写、说话人分离、AI 生成会议纪要,全部在本地完成,零云端依赖。基于 Rust + Tauri 打包成单一桌面应用,macOS / Windows / Linux 通吃,采用 MIT 协议开源。

    Meetily 隐私优先 AI 会议助手
    Meetily:Privacy-First AI Meeting Assistant

    💻 安装要求和过程

    环境要求

    • 桌面端(推荐):macOS(Apple Silicon / Intel)、Windows 10+、Linux;无需自备 GPU,有则加速。
    • 本地 AI 模型:Whisper 或 NVIDIA Parakeet 做转写(Parakeet 官方称快 4 倍);摘要默认用本地 Ollama,也支持 Claude / Groq / OpenRouter / 任意 OpenAI 兼容端点。
    • 开发者构建:需安装 Rust 工具链 + Node.js(建议 18+) + pnpm。
    • GPU 加速:macOS 走 Metal/CoreML,Windows/Linux 走 NVIDIA CUDA 或 AMD/Intel Vulkan,构建时自动启用。

    快速安装

    Windows:到 Releases 下载最新 x64-setup.exe,双击安装即可。

    macOS:下载 meetily_0.4.0_aarch64.dmg,拖进「应用程序」文件夹后打开。

    Linux:建议从源码构建:

    git clone https://github.com/Zackriya-Solutions/meeting-minutes
    cd meeting-minutes/frontend
    pnpm install
    ./build-gpu.sh

    开发者本地跑:装好 Rust + Node 后,前端用 pnpm install && pnpm dev,后端由 Tauri 统一拉起。

    ✨ 核心功能

    1. 本地优先 / 隐私优先

    所有录音、转写文本、摘要都只存在你本机。不联云、不上传、无厂商锁定,企业可以把敏感会议完全留在自己的基础设施里。

    Meetily 本地存储与隐私设置
    所有数据留在本地,转录模型与记录均本机存储

    2. 实时转写 + 说话人分离

    用 Whisper 或 Parakeet 模型在设备端实时出稿,会议进行中就能看到逐字稿;支持说话人分离(speaker diarization),谁说了什么一目了然。

    Meetily 本地实时转写界面
    本地实时转写界面

    3. AI 驱动的会议摘要

    转写完成后一键生成摘要,AI Provider 可自选:本地 Ollama(推荐,零费用零外流)、或接入 Claude / Groq / OpenRouter / 自建 OpenAI 兼容端点。还支持导入已有录音文件重新转写。

    Meetily AI 会议摘要
    AI 生成的会议摘要

    4. 专业音频混音

    麦克风与系统声音同时采集,带智能闪避(ducking)和防削波,远端会议声音也能干净录下来,不用再担心「对方声音没录上」。

    Meetily 专业音频混音
    麦克风 + 系统音频同时采集,防削波

    5. 跨平台 + GPU 加速的轻量单包

    基于 Tauri(Rust 后端 + Next.js 前端)打包成单文件桌面应用,比 Electron 轻得多;三大桌面系统原生支持,GPU 加速开箱即用。

    🎯 典型使用场景

    • 合规敏感型企业会议:法律、医疗、军工、金融等行业,把会议内容留在内网,规避 GDPR / 数据泄露风险,满足审计与合规要求。
    • 团队与个人纪要自动化:日常站会、客户访谈、脑暴会,开完即出转写稿 + 摘要,省下整理时间,且全程不花任何 API 调用费。
    • 私有化部署的团队协同:用自建 OpenAI 兼容端点做摘要,把 Meetily 跑在公司服务器上,团队成员共享同一套本地推理基础设施。

    💡 推荐理由

    我用过一阵子,最打动我的是它的「零心理负担」:开会前不用先纠结「这段话能不能让第三方听见」。单一桌面应用安装即用,Tauri 打包体积小、启动快,Rust 后端也让人放心。转写质量在本地模型里属于第一梯队,Parakeet 确实快;摘要接 Ollama 本地跑,等于白嫖还不出户。当然它也有边界——Community 版靠本地模型,精度和高级导出、自动入会这类能力在付费 PRO 里;但社区版承诺永久免费开源,核心的本地转写 + 摘要完全够日常用。如果你在意数据主权、又想要一个不像「玩具」的会议助手,Meetily 值得放进收藏夹。

    📥 下载地址

    注:项目原名 meeting-minutes,发布与下载请认准 meeting-minutes 的 Releases 路径;仓库现已重命名为 meetily。

  • Ollama 融了 6500 万美元:给 AI 做个「Docker」,月活逼近 900 万开发者

    Ollama 这个开源小工具,最近把 B 轮融到了 6500 万美元,由 Theory Ventures 领投。加上之前 Benchmark 的 Peter Fenton 领投的 1500 万 A 轮,公司到现在一共拿了 8800 万美元。

    Ollama 2023 年出来,干的事很实在:帮开发者在自己电脑上跑开源权重的大模型,几分钟就能跑起来。它在 GitHub 上攒了 17.6 万 star、快 1.7 万 fork,也被无数教程和视频夸过。

    Ollama 两位创始人 Jeff Morgan(左)与 Michael Chiang(右)
    Ollama 两位创始人 Jeff Morgan(左)与 Michael Chiang(右)

    两个做过 Docker 的人,想给 AI 也做个「容器」

    创始人 Jeff Morgan 和搭档 Michael Chiang 之前参与做过 Docker Desktop,就是那个把云端应用搬来搬去变得轻松的工具。Docker 后来收购了他们上一家公司 Kitematic。所以 Ollama 干的事,本质上就是「AI 版的 Docker」:把烦人的硬件配置、环境依赖全部藏起来。

    Morgan 说,2023 年开源模型刚冒头的时候特别难用,那时候它们是给研究者准备的,不是给程序员准备的。想跑起来真的费劲。三年过去,现在 Ollama 每个月被超过 890 万开发者使用,进了 85% 的财富 500 强,而公司只有 14 个人。

    真正的拐点,是智能体带火了开源模型

    Morgan 把公司的转折放到今年 1 月前后,那时候 OpenClaw 这类智能体突然变热,更大的开源模型忽然能干活了,比如写代码。他发现,愿意付钱的用户,尤其是兜里有钱的企业和快速成长的 AI 应用公司,开始越来越多地转向更便宜的开源模型,只在必要的时候才去碰 Anthropic 这种闭源模型。

    我觉得大多数人辩论时都搞错了一点。这不是二选一。开源和闭源都有大把生意可做,但凡是推理成本高的公司,都有个关乎生死的项目在推着他们往开源权重模型挪。

    不是所有人都买账

    当然,也不是每个 Ollama 粉丝都高兴它开始赚钱。大概一年前,一堆博客和社交帖子抱怨它的云服务抢了免费项目的风头,把它当成开发工具「糊化」的典型。Morgan 的回应是:那些太大的开源模型本来就没法在个人电脑上跑,所以我们说,那我们来帮你找算力。Fenton 也补了一句:桌面端那个免费产品一点没变,你照样能发现、能跑本地模型。

    • Ollama 想做的不是又一个模型,而是模型和开发者之间的那层基础设施
    • 开源模型的性价比,正在把企业从闭源 API 手里一点点撬走
    • vLLM、SGLang、NanoClaw 这些开源项目也在长成公司,VC 开始追这一类
    • 14 个人、890 万月活,这个人均产出数字挺吓人

  • 机器人要迎来自己的「ChatGPT时刻」?这家公司把宝押在了游戏数据上

    OpenAI 用 GPT-3 拉开基础模型时代那阵子,做自然语言处理的公司还在各自为战,每家都从头训练一个专门解决自己任务的模型。现在没人这么干了,大家都是先拿 GPT、Claude 或者 Llama 这种通用模型,再微调或者写提示词去适配自己的需求。

    Pim de Witte 是 General Intuition 的 CEO,他觉得「具身智能」也会走一模一样的路。

    从「为每个机器人单独训练」到「一个通用大脑」

    现在不少团队在干的事,是围着某一台具体的机器人、某一个具体的环境,收集一大堆真实世界数据,专门训一个模型。de Witte 在 TechCrunch 的 Equity 播客里说,这种活儿很快会变得多余。他觉得行业真正该做的,是先把数据质量做上去,训出一个能把「怎么动、怎么和环境互动」的直觉迁移到各种场景里的通用模型。

    他有一句挺敢说的判断:模型本身能不能泛化,才是产品。它只要有了对空间和时间的底层理解,大家就不需要再去攒几十万、上百万小时的真实数据了,因为说到底,你真正需要的可能只有几分钟。

    游戏画面里的按键,成了机器人的老师

    General Intuition 自己的基础模型,是在数百万小时的游戏录像上训出来的,而且不只是看画面,还记下了「人什么时候按了手柄上的哪个键」。de Witte 和公司的领投方 Vinod Khosla 都相信,这种带「动作标注」的数据,才是让 AI 长出类人空间推理直觉的关键。

    四足机器人在办公室中自主行走,周围悬浮游戏画面与神经网络节点
    用游戏数据训练出的物理 AI 基础模型,正试图统一机器人的「大脑」

    模型本身能不能泛化,才是真正卖钱的东西。等它有了对空间和时间的底层理解,谁还愿意去攒上百万小时的真实数据?说到底,你需要的可能只有几分钟。

    8 分钟真实数据,机器狗就站起来了

    光说不练没用。这家公司上个月刚靠着这个想法融了 3.2 亿美元、估值冲到 23 亿美元。他们已经演示过:同一个模型既能连续打几小时游戏,也能驱动一台四足机器人,而且驱动机器人时,只用了 8 分钟的真实世界数据做微调。

    de Witte 说最让他们意外的,是这台机器狗「零样本」就跑起来了:只靠一个前置摄像头,没有别的传感器,办公室里还不断有人走动、有东西乱放。他觉得这就是未来的样子。

    它不想造机器人,想做「物理世界的地基」

    General Intuition 的终局不是自己下场造机器。它想当「物理 AI 的基础模型」,给其他机器人公司当底座,让他们在自己的机器上搭东西。用 de Witte 自己的比喻:我们不会去开一家自动驾驶公司,但我们要让下一个人造自动驾驶公司容易十倍。

    • 大模型用 GPT-3 统一了文本,机器人可能正要被「世界模型」统一
    • 游戏数据贵在「按键标注」,这比单纯看视频更接近真实动作
    • 只靠几分钟真实数据就能迁移,意味着真实世界采集的成本可能被砍掉一大截
    • Khosla 把它称为「一代人的赌注」,赌的是专有数据会成为通用智能体的地基

  • 可灵 AI 单轮融了近 30 亿美元:全球视频大模型最大一笔钱

    可灵 AI 单轮融了近 30 亿美元:全球视频大模型最大一笔钱

    7月2日晚上,快手在港交所发了个公告——旗下的视频生成大模型“可灵 AI”要独立出来,单轮融资规模最高 30 亿美元,投后估值大概 180 亿美元。这个数字创下了全球视频大模型公司单轮融资的纪录,国内 AI 领域也就仅次于 DeepSeek 首轮的 70 亿美元。可灵这是要单飞了。

    30 亿美元约占可灵扩大后注册资本的 16.67%,对应投后估值约 180 亿美元——全球视频基础模型赛道迄今最大的一笔融资。

    钱是谁给的?

    这轮阵容挺豪华。领投的有 CPE 源峰、国方创投、来自阿布扎比的 BlueFive Capital、腾讯、中关村科学城基金和中信证券,一共 34 家机构认购。跟投里还有阿里云、百度这样的产业资本,华策影视、芒果系的厚为资本这些文娱产业方也进来了。值得一提的是,BlueFive 来自中东,这是中东资本头一回投中国的 AI 视频模型;而 CPE 源峰同时押了 Kimi 和可灵,等于在 AI 赛道上“通用+垂直”两头下注。整个交易分两步走:领投方先出 138.24 亿元人民币,15 家额外投资方再加 52.2 亿,60 天认购期里还能再进最多 14 亿,凑到上限 204.47 亿元。

    可灵 AI 单轮融资近 30 亿美元,创全球视频大模型公司融资纪录
    可灵 AI 单轮融资近 30 亿美元,创全球视频大模型公司融资纪录

    为什么现在要拆出来单干?

    说白了,是被算力开支和竞争逼的。快手这一年几乎把资本开支全砸在了 AI 基础设施上,调整后净利润因此被拖累。把可灵拆出来独立融资,既能给它输血,也能让母公司喘口气。数据其实很能打:可灵今年一季度收入超过 6.5 亿元,同比涨了 300% 多;3 月的年化收入(ARR)接近 5 亿美元,一年翻了四倍;全球用户已经破了 1 亿,而且大约四分之三的收入来自海外。对一个视频大模型来说,这样的海外变现能力不多见。

    拿到钱,仗才刚开始

    不过投资人现在的心态变了。以前看的是技术 demo 够不够炫,现在更盯着能不能赚钱、边际效率高不高。 30 亿美元砸研发是够了,但可灵得赶紧跟其他视频大模型拉开差距,把钱变成实打实的成本优势才行。协议里还写了回购条款:要是 2031 年 10 月底前没能完成 IPO,或者没按约定时间重组,投资人可以要求按原价加每年 8% 的单利回购,母公司还得连带担责。这压力可不小。


    快手已经放话,未来 12 个月内可能启动可灵 AI 赴港上市。视频大模型这条赛道,海外有 Runway、OpenAI 的 Sora,国内有一堆追兵,可灵手里多了 30 亿美元的弹药,但真正的较量,是把这笔钱花出效率来。