标签: AI

  • 世界模型公司Odyssey冲到145亿美元估值,Amazon、AMD都来了

    世界模型公司Odyssey冲到145亿美元估值,Amazon、AMD都来了

    大语言模型之后,AI的下一个战场在哪里?越来越多人的答案是:世界模型(World Model)。而这家叫做Odyssey的公司,刚刚用一份融资成绩单告诉市场:资本已经用真金白银投了票。

    Odyssey完成3.1亿美元B轮融资,投后估值145亿美元。这轮由Natural Capital领投,Amazon、AMD Ventures、GV等跟投。加上这笔,公司成立以来总共融了3.37亿美元——对于一个2023年才成立的初创公司来说,这个速度相当惊人。

    AI世界模型概念图
    世界模型试图让AI理解物理世界的运行规律 | 概念图

    创始人背景:自动驾驶的老兵

    Odyssey的两位创始人,CEO Oliver Cameron和CTO Jeff Hawke,都是从自动驾驶行业出来的。Cameron之前是自动驾驶初创公司Voyage的联合创始人兼CEO,后来Voyage被GM的Cruise收购,他就在Cruise做产品VP。Hawke则在另一家英国自动驾驶公司Wayve当工程师。

    这个背景其实解释了Odyssey在做什么。世界模型的核心是:让AI理解物理世界的运行规律——重力、碰撞、光线、物体之间的相互作用。这正是自动驾驶公司一直在攻克的问题,只不过Odyssey把它做成了一个通用平台,可以应用到游戏、机器人、虚拟现实等多个领域。

    怎么采集数据?背上摄像头走遍全世界

    要训练世界模型,得先有海量真实世界的视频数据。Odyssey的做法相当”物理”:派人背上摄像头,走街串巷地拍。这个思路其实和Google Earth有点像,只不过Google是开车拍,Odyssey是让人背着设备步行采集,能覆盖到车辆到不了的地方。

    世界模型不只是生成视频,它要模拟物理规律。这意味着AI生成的画面里,一个杯子掉到地上会碎,一个球踢出去会按照抛物线飞行——而不是每一帧都”猜”接下来发生什么。

    应用场景:从游戏到机器人

    目前Odyssey的世界模型已经有几个明确的方向。游戏是最直接的——用文字提示词生成可交互的3D视频内容,理论上可以大幅降低游戏场景的制作成本。机器人是另一个大方向:用世界模型做仿真训练,让机器人在虚拟环境里”摔”几千次,再放到现实里。

    和Amazon的合作也值得注意。Odyssey宣布AWS成为其首选云服务商,并且会优化模型以运行在AWS的Trainium芯片上——这是Amazon自家开发的AI训练芯片,直接对标Nvidia的GPU。有了Amazon的投资和云资源,Odyssey在算力成本上可能比竞争对手更有优势。

    天使投资人名单:硅谷半壁江山

    除了机构投资人,Odyssey这轮还拉来了一批重量级天使:Google传奇工程师Jeff Dean、知名天使Elad Gil、YC现任CEO Garry Tan、Vercel CEO Guillermo Rauch,还有Cruise创始人Kyle Vogt。这个阵容基本上把硅谷AI圈最有话语权的那批人都聚齐了。

    世界模型是不是下一个大机会,现在下结论还为时过早。但资本已经在用行动表态:这个方向,值得押注。

  • Google终于认真做智能音箱了,这次靠Gemini能不能翻身

    Google终于认真做智能音箱了,这次靠Gemini能不能翻身

    智能音箱这个品类,已经沉寂太久了。自从2020年Google发布Nest Audio之后,这个品类就进入了某种休眠状态——功能年年小修小补,但没人真正重新想一想:有了大模型之后,音箱到底应该是什么样子。

    Google本周给出了它的答案:一台叫做Google Home Speaker的新设备,售价99.99美元。这是Google六年来第一款真正意义上的新音箱,也是第一款”为Gemini而生”的音频设备。

    Google Home Speaker智能音箱
    Google Home Speaker,底部有一圈环形灯 | 图片来源:Google

    自然语言,终于能用了

    老一代智能音箱最大的问题,是你得”学它的语言”。想关灯,得说”关掉客厅的灯”;说错了用词,它就听不懂。Gemini进来之后,这个逻辑被打破了。

    新音箱支持完全自然的多步骤指令。你可以说:”把厨房灯调暗,放点轻松的音乐,再设个20分钟的定时器。”一句话,三个动作,不需要分三次说,也不需要记住特定的唤醒词格式。

    更实用的一点是:它支持中途纠正。说到一半改主意了?直接改就行。”把咖啡机关掉……哦不对,是打开。”Gemini能理解这种日常对话里的反复,而不是让你重新来过。

    10种新声音,能聊也能问

    除了控制智能家居,这台音箱还被设计为可以和你对聊。它内置10种新声音,支持”持续对话”模式——不用说”OK Google”就能接着问。你可以拿它学东西、查资料、聊想法,基本就是把Gemini的对话能力,从手机屏幕搬到了客厅里。

    音箱的麦克风会在”持续对话”模式下短暂保持开启,让你能自然追问,而不必每次都重新唤醒。

    外观上,新音箱延续了Google一贯的织物包裹设计,圆形身材,3.4 x 4.2英寸大小。美国市场有Jade和Berry两种颜色,全球版本则提供Hazel和Porcelain。底部新增一圈环形灯,用不同光效表示”在听”、”在想”和”在回答”三种状态。

    订阅制来了:高级功能月费10美元

    不是所有新功能都免费。Google推出了Google Home Premium订阅计划,月费10美元(或年费100美元),解锁更强大的AI能力:

    • Gemini Live自由对话(更高级的多轮语音聊天)
    • Nest摄像头活动解读——你不在家时,AI帮你总结发生了什么
    • 更深度的智能家居场景联动

    好消息是,Google会在前六个月免费提供这些高级功能,让你先试试再看值不值得续费。这套路和手机厂商差不多——先让你用上,再决定要不要交钱。

    问题是,消费者愿意为智能音箱的AI能力每月交10美元吗?Google在这个时间点推订阅制,勇气可嘉,但市场买不买账,还得看实际体验。


    这台设备目前已经开放预购,本月晚些时候发货。Google显然希望Gemini能成为下一个时代的”音箱灵魂”,就像Siri定义了上一代设备一样。只是,六年过去了,人们的注意力早就从音箱转移到了手机、耳机、甚至眼镜上。Google这次能不能翻盘,答案可能要等到年底假期销售季才能揭晓。

  • Snap 发布 2195 美元智能眼镜:戴着它能不能看起来不傻,这是个问题

    Snap 发布 2195 美元智能眼镜:戴着它能不能看起来不傻,这是个问题

    昨天 Snap 正式发布了 Specs 智能眼镜,定价 2195 美元。CEO Evan Spiegel 在接受 CNBC 采访时说,这款产品他们做了12年以上,目标是”把计算带进现实世界”,让人不再低头看手机屏幕。

    Snap Specs 智能眼镜
    Snap Specs 的粗框设计在时尚与科技之间走钢丝

    Spiegel 戴着它上镜,然后大家都分心了

    Spiegel 在采访里侃侃而谈的时候,作者 Victoria Song 注意到一个细节:他每动一下头,光线就会照在镜片上,隐约露出里面显示屏的轮廓。这个人正在讲”屏幕疲劳”和”想要更真实地连接世界”,而他脸上正架着一台把屏幕摆在眼睛前面的设备。

    但更多人注意到的是——这副眼镜戴在他脸上,看起来挺滑稽的。

    时尚是很主观的事,但 Specs 的设计客观来说很大胆。粗框、棱角分明的飞行员风格、巨型镜腿——如果里面没有任何科技,这副眼镜也会被当成”宣言单品”,大概只有 Iris Apfel 或者《超人总动员》里的 Edna Mode 才会日常戴着出门。

    2195 美元,本来也没想让普通人买

    Snap 把这副眼镜定位成” aspirational 级”时尚科技单品,不是卖给大众的日常消费品。这一点从他们的全球广告 campaign 就能看出来——拍摄者是时尚摄影师 Steven Meisel,这人在 Vogue 和 Versace、Valentino、Balenciaga 这些高定品牌里都是常客。

    所以这个逻辑大概是:先让时尚圈和科技圈的人戴上,做出一种”未来已来”的意象,然后再慢慢往大众市场渗透。当年 Snap 的太阳镜相机 Spectacles 也是这个路数,只不过那次渗透率比预期低了不少。

    和 Meta Ray-Ban 走的是两条路

    目前市面上最成功的 AI 智能眼镜是 Meta 和 Ray-Ban 合作的款,走的是”看起来像普通眼镜”的路线,价格也控制在普通人能接受的范围。Snap Specs 完全反着来——它长得就是要让你注意到,价格也直接拉到 2000 美元以上。

    • Meta 的路数:先让大众习惯戴着眼镜听歌、拍照、调 AI,悄悄把市场做起来
    • Snap 的路数:先做品牌调性,再谈销量,宁可让大多数人觉得”酷但买不起”
    • 两种策略各有道理,但 Snap 的前几代眼镜产品并没有证明这条路能走通

    说到底,眼镜这件事比手机难多了

    手机你可以做得很酷,因为没人看你的手机长什么样。眼镜不一样——它架在你脸上,每个人跟你说话的时候都在盯着它看。Meta 选了 Ray-Ban 这个本身就代表”经典好看”的框型,很聪明。Snap 选了一条更难的路:要让大家觉得这副看起来很怪的眼镜是”酷”的。

    这件事不是完全不可能。早期戴 Apple Watch 的人也被嘲笑过,现在它已经是全球销量最大的手表了。只是 Snap 需要回答一个问题:除了”这是 Snap 做的”和”这是智能眼镜”,普通人为什么要花 2195 美元买这副看起来有点怪的眼镜?

    Spiegel 说人们已经受够了屏幕。他说得也许对。但如果解决方案是换一种方式把屏幕摆在面前,这件事到底算不算”减少屏幕”,可能每个人都有自己的答案。

  • Claude Design 新编辑器上线:AI设计工具开始认真和 Figma、Canva 抢饭碗了

    Claude Design 新编辑器上线:AI设计工具开始认真和 Figma、Canva 抢饭碗了

    Anthropic 这周给 Claude Design 推了一波大更新,说白了就是要把”AI生成设计”这件事从玩具变成真正能干活的工具。最显眼的变化是一个新编辑器——现在你可以直接在画布上拖拽、缩放、对齐元素,不用再靠文字描述让AI猜你想要什么布局。

    Claude Design 新编辑器界面
    Claude Design 新编辑器支持直接拖拽和对齐元素

    一周破百万用户,然后呢?

    Claude Design 上线第一周就有超过100万人用过。这个数字挺吓人的,但也说明一个问题:想用AI帮忙做设计的人真的很多,只是之前的工具还不够顺手。

    新编辑器的逻辑其实很直接——之前你用Claude Design,基本上是用文字描述你想要什么,然后AI给你出图。现在多了一步:AI出图之后,你可以直接在画布上微调,拖动某个按钮的位置、调整间距、对齐元素。听起来不算什么大突破,但实际用起来差别很大,因为之前每次想改个小地方都要重新生成,很浪费时间。

    和设计系统打通,这才是企业级功能

    这次更新里最值得企业用户关注的功能,是设计系统导入。你可以把公司已有的设计系统(从GitHub仓库、设计文件或者直接上传)喂给Claude Design,之后它生成的所有内容都会自动对齐你们的设计规范。大公司里还能设置一个管理员角色,锁定标准设计系统,防止有人乱改。

    Claude 会把输出和你的设计系统做比对,在你看结果之前就先自己纠正一遍。这对需要保持品牌一致性的团队来说,省了不少事后返工的功夫。

    和 Claude Code 打通,设计到代码不用截图

    这次更新还有一个挺实用的功能:Claude Design 和 Claude Code 之间可以无缝接力。你在Design里把设计定稿了,可以直接交给Claude Code接着做开发,Code会接着你之前的设计继续,而不是从头开始重新理解一遍(或者靠截图来猜)。

    反过来也行——如果你习惯先在终端里干活,现在可以在Claude Code里直接用 /design 命令创建和编辑设计项目,不用切来切去。

    出口通向一堆常用工具

    生成好的设计现在可以导出到不少地方:PDF、PowerPoint是基本的,还能直接推送到Adobe、Canva、Gamma、Lovable、Miro、Replit、Vercel、Wix等工具里。Anthropic和Replit、Lovable都有合作表态,说要让”从想法到上线”整个流程更顺畅。

    • 对独立开发者来说,在Claude Design里画完界面,直接推去Replit改改就能跑,这个流程确实诱人
    • 对企业设计师来说,导出到Canva或Adobe继续精修,比重新在那些工具里从零开始效率高
    • 目前支持的出口还在增加,Anthropic说”更多目的地即将到来”

    Figma和Canva肯定注意到了这个动向。Claude Design的打法和它们不一样——它不是要做一个更好的设计工具,而是把”设计生成”这件事嵌进整个开发流程里,从想法到设计到代码,尽量不让你重复描述同一件事。

    这种做法的风险在于:如果AI生成的设计不够好,后面所有接力都是在浪费时间。Anthropic说这版的错误率已经大幅下降,生成同样质量的结果用的token也更少了。实际用起来怎么样,还得看用户自己的反馈。

  • vLLM —— 83K+ Stars 的 LLM 高性能推理引擎,PagedAttention 颠覆内存管理

    vLLM Logo

    vLLM — 高性能 LLM 推理与服务引擎

    ⚡ vLLM

    83K+ Stars · 面向大模型的高吞吐量、内存高效推理与服务引擎

    📌 项目简介

    vLLM 是由加州大学伯克利分校 Sky Computing Lab 发起、现由 2800+ 贡献者共同维护的开源 LLM 推理与服务引擎。其核心竞争力在于首创的 PagedAttention 技术,通过智能管理注意力键值内存,大幅降低内存碎片,将 GPU 利用率推向极限。无论是本地开发调试,还是生产级大规模部署,vLLM 都是当前最热门的推理加速选择。

    83K+
    GitHub Stars

    2.8K+
    贡献者

    200+
    支持模型架构

    🛠️ 安装要求与过程

    环境要求:

    • Python 3.10+(推荐 3.12+)
    • NVIDIA GPU(CUDA 12.9/13.x)或 AMD GPU(ROCm)
    • 也支持 CPU、Google TPU、Apple Silicon 等多种硬件
    # 推荐用 uv 安装(更快更可靠)

    uv pip install vllm

    # 或用 pip

    pip install vllm

    # 快速启动 OpenAI 兼容 API 服务

    python -m vllm.entrypoints.openai.api_server \
    –model Qwen/Qwen3-8B –port 8000

    🚀 核心功能

    ⚡ PagedAttention 内存管理

    将注意力键值内存分页管理,类似操作系统的虚拟内存机制,大幅减少内存碎片和冗余复制,内存利用率提升 2-4 倍。

    🔄 持续批处理 + 前缀缓存

    动态合并正在处理的请求,并复用相同前缀(如 system prompt)的计算结果,吞吐量提升 3-5 倍。

    🧩 200+ 模型架构原生支持

    无缝兼容 Hugging Face 主流模型,涵盖 Llama、Qwen、DeepSeek-V3、Gemma、Mixtral、LLaVA 等,开箱即用。

    🔧 丰富量化方案

    支持 FP8、INT8、INT4、AWQ、GPTQ、GGUF 等主流量化格式,在保持精度的同时大幅降低显存占用和推理延迟。

    🌐 OpenAI 兼容 API

    提供与 OpenAI API 完全兼容的接口,只需改一行代码即可从 OpenAI 切换到自托管 vLLM,零迁移成本。

    💡 典型使用场景

    场景一:私有化部署大模型 API 服务

    企业希望在内部环境部署 Qwen 或 Llama 大模型,提供类似 OpenAI 的 API 供业务系统调用。vLLM 可在单张 H100 上实现远超传统方案的吞吐量,显著降低推理成本。

    场景二:本地开发与环境调试

    开发者在本地机器上调试 Prompt 或测试 Agent 工作流,需要快速启动一个兼容 OpenAI SDK 的本地服务。vLLM 一条命令即可启动,支持流式输出和工具调用。

    场景三:多模态模型推理服务

    需要部署 LLaVA、Qwen-VL 等多模态模型,同时处理文本和图像输入。vLLM 对多模态模型提供原生支持,统一的 API 接口让多模态应用开发更加便捷。

    ✨ 推荐理由

    vLLM 是目前 LLM 推理领域最炙手可热的开源项目,没有之一。它的核心竞争力在于 PagedAttention——这项技术直接解决了 LLM 推理中内存管理效率低下的痛点,是业界首个将操作系统虚拟内存思想引入注意力机制的工作,还发表了 SOSP 2023 学术论文。

    实际使用下来,vLLM 最让人省心的是「开箱即用」——Hugging Face 模型直接加载,OpenAI API 直接兼容,量化方案直接配置。对于想把大模型「跑起来」的团队,vLLM 是目前最成熟、社区最活跃的选择。

    值得一提的是,vLLM 的社区生态极其繁荣,AWS、NVIDIA、AMD、Google Cloud 等巨头均在赞助其开发。这意味着 vLLM 不仅是一个开源项目,更正在成为 AI 推理层的事实标准

    📥 下载地址

    License: Apache 2.0 | 语言: Python | 最初开发: UC Berkeley Sky Computing Lab

  • 三星手机将推出宠物健康AI检测,拍张照片就知道猫咪狗狗有没有病

    三星手机将推出宠物健康AI检测,拍张照片就知道猫咪狗狗有没有病

    三星在巴黎VivaTech 2026大会上亮了个新功能,挺有意思的——用手机拍一张猫狗的照片,AI就能帮你判断宠物有没有牙周病或者肥胖问题。这个功能是与宠物健康管理平台Lifet合作开发的,预计会整合到Galaxy手机的SmartThings应用和宠物护理生态里。

    给宠物看病的AI来了

    养宠物的人大概都有过这种经历:猫狗有点不对劲,但你不确定是不是该去看兽医,或者你拍了照片发给朋友,大家也都是凭经验猜。三星这个功能的思路是直接用AI分析照片,给出健康风险提示。

    三星宠物健康AI检测
    用Galaxy手机拍摄宠物照片,AI分析健康状况

    Lifet的平台本来就有网页版和App,这次和三星合作以后,相当于把宠物健康筛查直接搬到了手机上。你拍张照,几秒钟就能知道你的猫是不是可能超重了,或者狗狗的牙龈有没有发炎的迹象。

    三星的AI健康布局

    这不是三星第一次往健康领域押注。他们的Galaxy Watch已经能测心电图、血氧、睡眠质量,现在又把宠物健康拉进了生态。三星在VivaTech上说的”连接式护理解决方案”,其实就是想把人的健康和宠物的健康都整合到SmartThings里,一站式的健康管理。

    全球宠物经济一直在涨,但宠物医疗的信息不对称一直没怎么被科技解决。三星这个方向选得挺聪明的。

    当然,这种AI检测肯定不能替代真正的兽医诊断。三星应该也会在功能上线时加免责声明。但它的价值在于”提醒”——很多问题如果发现得早,治疗成本和宠物遭的罪都会少很多。AI做不了兽医,但做个早期预警还是可以的。

    这个功能目前还在开发阶段,三星没有公布具体的上线时间。不过从VivaTech的演示来看,基本思路已经跑通了。等正式推出以后,Galaxy用户随手拍张照片就能给宠物做个简易体检,这体验还是挺有吸引力的。


  • 三分之二美国人认为AI发展太快,年轻人最悲观

    三分之二美国人认为AI发展太快,年轻人最悲观

    皮尤研究中心刚发布了一份挺有意思的调查报告,他们问了几千个美国人怎么看AI。结果出来以后,估计硅谷那帮人会觉得有点扎心——63%的受访者说AI发展太快了,只有16%的人觉得AI对社会会有正面影响。

    用的人多了,担心的也多了

    这次调查是今年2月做的,一共问了5119个美国成年人。有个数字挺显眼:49%的人说用过AI聊天机器人,比2024年的33%涨了不少。ChatGPT最常用,44%的人说用过,比2023年翻了一倍。

    年轻人用得最多——18到29岁这个年龄段,66%的人用过聊天机器人。但讽刺的是,恰恰是这群人最不看好AI的前景。48%的年轻人觉得AI会产生负面影响,只有14%觉得是好事。

    AI调查配图
    三分之二的美国人对AI的快速发展保持警惕

    每天在用,但不太信

    大约四分之一的美国人说他们每天都会用聊天机器人。用得最多的场景是搜索信息(42%)和工作任务(38%)。三成的人觉得AI让他们的生产力提高了,但也有不少人对AI给出的信息质量表示怀疑。

    66%的美国人认为AI会让他们的个人信息更不安全,只有3%的人觉得会更安全。

    对政府的监管能力,大家也没什么信心。67%的人说他们对美国政府有效监管AI”信心不足”。有趣的是,民主党人比共和党人更不相信政府能管好AI——这在两年前还是反过来的。

    智能设备渗透日常生活

    除了聊天机器人,AI还在以别的方式进入美国人的家。35%的人有智能音箱(比如Amazon Echo),37%的人有智能手表,18%的人装了智能门铃。60%的人说他们会看搜索引擎结果顶部的AI摘要。

    这些数字说明,AI已经不是什么未来概念了,它正在真实地改变人们获取信息、管理健康和与科技互动的方式。但公众的情绪显然比硅谷的乐观叙事复杂得多——人们在使用这些工具,同时也在用警惕的眼光打量它们。


  • AI代理进公司打工,这家公司要给它们发员工身份

    AI代理进公司打工,这家公司要给它们发员工身份

    AI代理进公司打工,这件事在过去一年里从概念变成了现实。Goldman Sachs去年把AI编程代理Devin当正式员工来用,McKinsey年初说自家已经有25000个AI代理在和60000名人类员工一起干活。问题跟着来了:这些”数字员工”谁来管?权限怎么给?出了问题找谁?

    给AI代理发”工牌”

    网络安全创业公司NewCore从隐身模式走了出来,拿了6600万美元种子轮,估值after investment 3亿美元。领投的是专注网络安全的风投Cyberstarts,Index Ventures和Evolution Equity Partners跟投。他们的产品说白了就是一件事:把AI代理当”员工”来管理,给它们发身份、设权限、能吊销、能审计。

    AI代理身份管理概念图
    AI代理需要自己的”员工身份”,而不只是一串API密钥 | 配图来源:WorkBuddy AI生成

    创始人Zohar Alon之前创办过云安全公司Dome9(后来卖给了Check Point),他说服自己再创业的理由是:现在的身份系统——Okta、微软的Entra这些——都是给人类员工设计的,AI代理往里一塞,scale和复杂度会把它们撑爆。

    “我们很确定,AI代理要给那些用了15年、20年的身份平台增加的规模和复杂度,迟早会把它们搞崩。”
    ——Zohar Alon,NewCore联合创始人兼CEO

    不是给机器密钥,是给数字员工身份

    NewCore的平台把人类员工和AI代理的身份放在同一个系统里管,但AI代理拿的是”一等身份”——有自己的权限生命周期控制、独立的吊销机制,而不是被塞进传统的service account或者机器密钥的抽屉里。

    技术上一个关键是所谓的”split-key”架构:把关键身份凭证分成两份,客户拿一份,平台拿一份,这样就没有单一妥协点了。对于已经在用Anthropic Claude Code、OpenAI Codex或者Cursor的团队,NewCore提供了一个”Agentic Skill”集成包,让这些AI工具以受管身份访问企业系统,而不是靠人工分发的密钥。

    员工还可以用NewCore的手机App来授权、审查、吊销AI代理的访问权限——Alon把它描述成人类监督层,公司在部署更自主的系统时,总得有个”人”在循环里。

    AI代理比你想象的更快进入职场

    NewCore现在有50多个员工,分布在美国和以色列,平台当前有不到10个客户和10多个设计伙伴在用它。公司预计今年夏天开始向客户收费。

    Alon的预测是:在聚焦技术的组织里,AI代理数量几年内就会超过人类员工。TCS董事长N. Chandrasekaran最近也说了类似的话:AI代理的规模终将匹敌这家印度IT服务公司的员工总数。

    身份系统很可能是第一个被大规模AI代理部署压垮的企业系统。公司最终会需要新办法来监控、授权和吊销那些在网络里跑来跑去的数字工人——在它们搞出乱子之前。


  • 这家公司想用数学证明来管住AI的幻觉,2700万美元押一条没人走的路

    这家公司想用数学证明来管住AI的幻觉,2700万美元押一条没人走的路

    企业想把AI用到实处,最难的不是让模型”说出话”,而是让说出来的话靠谱。税务、法律、药物研发——这些领域错一个字就是真金白银甚至人命,AI幻觉在这儿比别处更致命。一家刚冒头的新公司觉得,解决这个问题靠的不是把模型做得更大,而是把规则写得更死。

    给AI套上数学的缰绳

    Pramaana Labs本周冒了出来,拿了Kholla Ventures领投的2700万美元种子轮,Accel、Boldcap、Nexus Venture Partners、Premji Invest和Unbound跟投。这家公司的主意说起来不复杂:用计算机科学里最”死板”的工具——数学形式化验证——来管住AI最”飘”的那部分幻觉和乱编。

    AI形式化验证概念图
    形式化验证让AI的推理过程变得可验证 | 配图来源:WorkBuddy AI生成

    CEO Ranjan Rajagopalan的说法是:税务法规本质上就是一套规则,跟数学差不多。一旦把规则用代码形式化,推理过程就能变成确定性的——换句话说,AI可以天马行空地理解自然语言,但最后得出来的结论必须过一道”数学检查”,否则不让出门。

    “世界上最难的问题不是无解,而是没有被形式化。每个’出错就要命’的领域——健康、金钱、自由——都有规则,只是这些规则还没被写成代码。”
    ——Ranjan Rajagopalan,Pramaana Labs联合创始人兼CEO

    LEAN语言来了

    Pramaana的做法是在常规LLM上面加一层确定性验证,这套验证用的是开源LEAN编程语言的工具——本来这东西是用来验证数学证明的,现在被他们拿来验证AI的输出。有法国民俗,法国的CATALA项目已经把本国税法和福利系统的一大块形式化成了可执行代码,算是这条路上有分量的先驱。

    每个使用场景,Pramaana会搭一套自己的类LEAN形式化验证系统,并且有领域专家盯着。税务方向的前IRS局长Danny Werfel在公司顾问名单上;网络安全与药物研发系统则由IIT Delhi、IIT Madras和UC Berkeley的教授们把关。

    为什么是现在

    AI可靠性这事儿,搁两年前大家还在实验室里吵,现在企业已经被迫要认真对待了。幻觉在闲聊里是个笑话,在报税软件里就是一个灾难。Pramaana挑的这几个垂直领域——法律、药物研发、税务——恰恰是容错率最低的几个地方,也是愿意为”可靠性”付钱的地方。

    这条路能不能走通,取决于一件事:把现实世界的复杂规则完整、准确地形式化,这件事本身难度就不比做AI小。但Rajagopalan的判断是,那些规则本来就在那儿,只是没人把它们变成代码而已。


  • Pinterest偷偷摸摸做了个AI购物助手,但先只给少数人用

    Pinterest偷偷摸摸做了个AI购物助手,但先只给少数人用






    Pinterest偷偷摸摸做了个AI购物助手,但先只给少数人用

    Pinterest AI购物助手
    Pinterest推出实验性AI购物应用”Ask Pinterest”(配图由AI生成)

    Pinterest本周三宣布了一款名为”Ask Pinterest”的新实验性应用。简单说,这东西能让Pinterest用一种更对话式的方式来做购物和产品发现,而且这种玩法最终可能会挪到Pinterest主应用里去。

    与此同时,公司还介绍了其他一些AI计划,包括为在Pinterest平台上跑活动的广告商设计的Pinterest模型上下文协议(MCP),以及其他一些AI广告工具。

    时间点微妙:赶在Cannes Lions前发布

    这个消息发布的时间点挺微妙——正值广告技术行业年度盛会Cannes Lions前夕。今年的这个会,焦点主要集中在AI如何满足广告商和营销人员的需求上。

    “Ask Pinterest”这个在线应用,给了公司另一种利用”Taste Graph”的方式——这是Pinterest内部的一套数据,用来把人和他们的兴趣、审美偏好映射起来。公司方面表示,最初会以有限访问的形式提供。

    这种AI驱动的体验,设计初衷是把Pinterest那套出名的可视化发现体验,从传统的主应用界面扩展到一个对话式、聊天机器人式的界面里。

    AI购物战场已经打响

    它的出现,正值AI聊天机器人日益跟传统搜索引擎抢消费者注意力的时候。Google已经让AI帮着在线购物者找想要的东西、追踪价格,还能直接结账。ChatGPT也实验过代理式购物,Meta、Shopify这些公司也一样。

    但Pinterest的做法不太一样。它很大程度上专注于用自己的数据训练AI模型,给自己的AI产品做支撑,而不是把自己变成别的AI服务可以通过许可协议来利用的产品推荐来源。

    另外,让Ask Pinterest成为一个独立应用,公司就有了一个在不破坏Pinterest主体验的情况下实验这项技术的方式。

    能做复杂的多步骤查询

    公司方面解释说,Ask Pinterest可以用来处理更复杂或者多步骤的查询——这类查询不太适合传统的Pinterest搜索。举个例子,你可以用这个应用来寻求筹划晚宴的帮助,或者慢慢布置一个房间。

    Pinterest表示,这个想法的核心是测试和探索AI如何能在保留用户跨会话上下文的同时,更好地支持人们的购物体验。

    Ask Pinterest还能利用用户自己保存的Pin和画板,来让回答更个性化。


    • Ask Pinterest初期限量访问,利用Pinterest的”Taste Graph”数据
    • 支持复杂多步骤查询,比如筹划晚宴或布置房间
    • 作为独立应用推出,不影响Pinterest主应用体验
    • 同步推出AI广告助手(Beta版)和Performance+ creative模型