标签: AI

  • 霍夫曼的新副业:AI实验室Prentis成立仅3个月,估值冲上10亿美元

    硅谷两位老江湖又凑到一起搞事情了。LinkedIn联合创始人里德·霍夫曼和Zynga创始人马克·平卡斯,联手一位31岁的连续创业者,悄悄办了家新AI实验室,名字叫Prentis。这家公司今年4月才成立,现在就已经在谈一轮1亿美元的融资,估值直接冲到10亿美元。消息来自两位知情人士,TechCrunch率先报了出来。

    Reid Hoffman
    里德·霍夫曼再度下场创业,这次押注的是”会用电脑的AI”(图片来源:TechCrunch)

    它做的事很朴素:教AI替打工人点鼠标

    Prentis瞄准的方向叫”计算机使用模型”。说白了,就是训练AI观察办公室职员平时怎么在各种文档和系统之间来回切换、走完一套流程,然后让AI智能体自己操控电脑把这些活儿干了。比如处理保险理赔,或者搞定海关退税里的异常单据,不再需要人工翻箱倒柜找材料。

    生意谈得也快。知情人士透露,公司已经和几家客户签了总额最高5000万美元的合同,客户里有医疗管理服务机构,也有制造商和服装厂商。TechCrunch拿到的投资材料显示,Prentis预计今年三季度年化流水能到7500万美元。不过它的招股材料里也写得明白:这个数字是按”帮客户省下的钱抽成20%”估算出来的,不是已确认的收入,最终还得看执行效果。

    Prentis自称其Hive-32B模型在WindowsAgentArena和ScreenSpot-v2两项电脑操作基准上,跑赢了OpenAI的GPT-5.4和Anthropic的Claude Opus 4.6,而单任务成本只有前沿API的十分之一左右。

    小模型、便宜、够用,这是它给投资人讲的核心逻辑——日常办公流程要大规模铺开,成本必须打下来。当然,这些基准成绩TechCrunch并没有独立验证过,听听就好。

    赛道已经挤满了大玩家

    Prentis赌的是:自动化日常办公任务,很快会取代写代码,成为AI最大的应用场景。问题是想到这一点的不止它一家。Anthropic、OpenAI,还有米拉·穆拉蒂的Thinking Machines Lab,全都在做电脑操作智能体。Anthropic甚至直接下场买人——今年2月收购了西雅图的计算机使用创业公司Vercept,把创始团队收编,产品直接关停。


    这个31岁的CEO,履历有点吓人

    真正操盘的是CEO里坦卡·达斯。这个人的履历值得单独说说:

    • 18岁从加州大学伯克利分校毕业,生物工程和化学生物学双学位,是伯克利一百多年来最年轻的”大学奖章”得主;
    • 牛津读完生物医学工程硕士,拿着盖茨剑桥奖学金读AI博士,然后退学;
    • 2014年创办控股公司Titan,模式刻意复古,学的是伯克希尔——靠自己项目退出的钱滚动投资,不找外部LP;
    • Titan旗下的Tala Health去年拿了1亿美元种子轮,自闭症护理公司Forta Health在2024年拿了Insight Partners领投的5500万美元,疾病预测公司Dascena则在2022年被收购。

    对霍夫曼和平卡斯来说,Prentis更像副业。霍夫曼上个月刚宣布卸任微软董事,说要对AI制药公司Manas AI开启”创始人模式”;他还是OpenAI的早期投资人,之前和穆斯塔法·苏莱曼共同创办的Inflection AI,团队大部分在2024年被微软打包带走。平卡斯这边则在运营投资机构Reinvent Capital,上个月刚出了本回忆录。

    团队方面,Prentis已经招了超过25人,研究员来自OpenAI、谷歌DeepMind、Meta等一线机构。三个月估值10亿,这个速度放在今天的AI圈不算稀奇,但”会用电脑的AI”这条赛道上,巨头和创业公司马上就要正面相撞了。

  • Kronos:首个金融K线开源基础模型,45+交易所数据预训练,33.5K Stars(AAAI 2026)

    Kronos:首个金融K线开源基础模型,45+交易所数据预训练,33.5K Stars(AAAI 2026)

    Kronos 两阶段框架总览

    项目简介

    Kronos首个面向金融 K 线(蜡烛图)的开源基础模型——由清华大学团队开源,在全球 45+ 家交易所的行情数据上预训练,把 OHLCV 序列当作”金融市场的语言”来建模,一个模型通吃价格预测、波动率估计等多种量化任务。论文已被 AAAI 2026 录用,GitHub 上已收获 33,000+ Stars,是今日 GitHub Trending 上最亮眼的 AI × 金融项目。

    与通用时间序列基础模型(TSFM)不同,Kronos 专门针对金融数据高噪声、多维联动的特性设计了两阶段框架:

    1. 分层离散化 Tokenizer:把连续的多维 K 线数据(开高低收 + 量额)量化为分层离散 token;
    2. 自回归 Transformer:decoder-only 架构在海量 token 序列上预训练,像 GPT “续写文本”一样”续写行情”。

    安装要求和过程

    环境要求

    • Python 3.10+
    • PyTorch(GPU 可选,CPU 也能跑小模型推理)
    • 微调需要 NVIDIA GPU(支持 torchrun 多卡)+ 可选 Qlib 数据环境

    快速安装

    # 1. 克隆仓库
    git clone https://github.com/shiyu-coder/Kronos.git
    cd Kronos
    
    # 2. 安装依赖
    pip install -r requirements.txt

    三行代码开始预测

    from model import Kronos, KronosTokenizer, KronosPredictor
    
    # 从 Hugging Face Hub 加载预训练模型
    tokenizer = KronosTokenizer.from_pretrained("NeoQuasar/Kronos-Tokenizer-base")
    model = Kronos.from_pretrained("NeoQuasar/Kronos-small")
    predictor = KronosPredictor(model, tokenizer, max_context=512)
    
    # df 为含 open/high/low/close(/volume/amount) 的 DataFrame
    pred_df = predictor.predict(df=x_df, x_timestamp=x_timestamp,
                                y_timestamp=y_timestamp, pred_len=120,
                                T=1.0, top_p=0.9, sample_count=1)

    KronosPredictor 封装了数据预处理、归一化、预测与反归一化全流程,返回未来 OHLCV 的完整 DataFrame;还提供 predict_batch 批量并行预测多个标的。

    Kronos 预测结果与真实行情对比

    核心功能

    • 金融专用基础模型家族:开源 Kronos-mini(4.1M 参数、2048 上下文)、Kronos-small(24.7M)、Kronos-base(102.3M)三档模型,全部可在 Hugging Face(NeoQuasar)直接下载,按算力自由选择;
    • 两阶段”金融语言”建模:分层离散化 Tokenizer 把高噪声 OHLCV 压成 token,自回归 Transformer 统一建模,一个模型服务多种量化任务;
    • 概率化采样预测:支持温度 T、top-p 核采样、sample_count 多路径平均,不只给单点预测,还能刻画行情的不确定性;
    • 完整微调管线:官方提供基于 Qlib 的 A 股微调全流程脚本——数据预处理 → Tokenizer 微调 → Predictor 微调(torchrun 多卡)→ Top-K 策略回测,一条龙跑通;
    • 在线 Live Demo:官方部署了 BTC/USDT 未来 24 小时预测的可视化演示页,无需安装即可直观感受模型效果。

    A股微调后回测累计收益曲线示例

    典型使用场景

    1. 量化研究信号生成:把 Kronos 的预测价格变动作为原始 alpha 信号,接入组合优化与风险中性化流程,用于选股/择时研究——官方 A 股示例展示了从 Qlib 数据到 Top-K 策略回测的完整路径;
    2. 加密货币/外汇短线预测:对 BTC/USDT 等 7×24 交易品种做未来数小时至一天的 K 线走势与波动区间预测(官方 Live Demo 场景),辅助仓位与风控决策;
    3. 自有市场数据微调:券商、私募或个人研究者用自己的分钟线/日线数据微调 Tokenizer + Predictor,让基础模型适配特定市场微观结构,替代从零训练的高昂成本。

    推荐理由

    时间序列基础模型不少,但真正”懂金融”的开源模型 Kronos 是第一个。我实际体验下来有三点印象很深:

    一是门槛低得惊人——pip install -r requirements.txt 加几行 Python 就能跑通预测,KronosPredictor 把归一化、截断、反归一化这些脏活全包了,量化新手也能十分钟上手;二是学术与工程兼备——AAAI 2026 论文背书、45+ 交易所数据预训练,同时给足了 torchrun 多卡微调和 Qlib 回测的工程脚本,不是只发权重不管落地的”论文模型”;三是诚实——README 明确提醒示例回测只是演示,生产级策略还需要组合优化、风险因子中性化、交易成本建模,这种不吹牛的态度在 AI × 金融领域难能可贵。

    需要注意:模型输出是概率性预测而非投资建议,直接拿裸信号实盘风险很高;Kronos-large(499M)暂未开源,开源版本上下文长度上限 512(mini 为 2048)。适合量化研究者、金融工程学生和对”AI 预测行情”认真感兴趣的开发者。

    下载地址

    许可证:MIT | 语言:Python | Stars:33.5K+ | 数据截至 2026-07-25

  • Bluesky给AI助手Attie加了“研究”功能,想帮你在噪音里找真相

    Bluesky的AI助手Attie本来是帮你搭建个性化信息流的工具,不用会编程就能定制自己的feed。这周它升级了,多了个叫Quests的新功能,方向也从”帮你搭feed”变成了”帮你做研究”。

    Bluesky AI助手Attie
    Bluesky的AI助手Attie(图片来源:Bluesky 截图)

    Quests能让你直接向Attie提问,让它去整个Bluesky社交网络里帮你找信息和新闻。这个大网络有个昵称叫”大气层”(Atmosphere),范围不只是Bluesky本身,还包括所有接入了底层AT Protocol协议的App。比如你可以让它扒一扒最近的热门话题,或者帮你找出某个领域、某个地区里最有影响力的账号。

    增长放缓,得找新招

    Bluesky这么折腾,跟它增长慢下来有关系。去年10月它一年内用户翻倍冲到4000万,风头很足,但现在也就4560万注册账号,速度明显缓了。所以公司一直在琢磨新的工具和服务,想把用户盘子做大,顺便看看能不能变现。

    Attie是今年3月上线的独立产品,让用户自己设计算法、创建定制feed,将来说不定还能”氛围编程”做出自己的小App。目前它是免费的,不过公司已经在盘算要不要收费了。

    “Attie的AI是一个帮你看懂互联网的工具,它给你自己找出真相的能力,让你能对抗那些泛滥的虚假信息和噪音。”——Bluesky首席创新官Jay Graber

    押注”帮人理解世界”

    写下这段话的Jay Graber今年3月卸任了CEO,现在这个位子由Automattic的创始CEO Toni Schneider接手。Graber说,他们赌的是——能帮人看懂世界的工具,最终会比那些只会制造混乱的工具更有用。他们希望Attie能降低学习AT Protocol的门槛,把定制体验的能力交到每个想要的人手里。

    Graber还透露,Attie正在重新设计,会加上无障碍功能和新logo,未来几个月还有更多改动。眼下新版还在测试阶段,会从候补名单里陆续放人进来。


    用户嫌弃AI,公司又得赚钱

    这里有个挺拧巴的地方。Bluesky不少用户出于经济、政治和环保方面的考虑,本来就不待见AI。可公司又得赚钱,才能养活自己和它主导的AT Protocol开发。怎么在社区情绪和现实需求之间找平衡,是个难题。

    • 今年3月Bluesky宣布拿到1亿美元融资,这轮其实在2025年就已经关闭
    • 这笔钱给了它试错的底气,去折腾Attie、AI在”大气层”里的角色
    • 高级订阅、面向重度用户的工具,也都在考虑范围内
  • Cognition花上亿美元买下Poke,赌的是AI会不会“说人话”

    写代码的AI工具Cognition又出手了,这次买下的不是什么技术公司,而是一个”会跟你贫嘴”的聊天助手Poke。交易金额官方说法是”低九位数”,也就是一亿多美元的量级。Poke背后的公司叫The Interaction Company of California,接下来它的那套交互方式和”性格”会被塞进Cognition的编程助手Devin里。

    Poke AI助手界面
    Poke:一个你可以像发短信给朋友一样使用的AI助手(图片来源:Poke / The Interaction Company of California)

    Poke最有意思的地方,也正是Cognition看上它的原因:它不像个工具,更像个人。你给它发消息,它会用俚语、带点幽默地回你,聊天感很强,而不是冷冰冰地执行命令。反过来,Poke也能借上Cognition的模型和基础设施,跑得更快更稳。

    为什么”有性格”值这么多钱

    Interaction Company的联合创始人Marvin von Hagen在接受TechCrunch采访时,把这笔账算得挺直白。他说的大意是,谁不喜欢有点脾气、能聊得来的同事呢,总比对着一堆机器人强。如果你的同事本身就是软件工程师,还能开个玩笑,你会觉得这活儿干得舒服多了。

    这笔收购背后是一个越来越被认同的判断:AI助手怎么跟人打交道,正变得和它底层的模型一样值钱。Cognition想让Devin少一点”软件味儿”,多一点”同事感”。

    Cognition联合创始人Scott Wu在博客里写道,Interaction团队做出了一个大家真心喜欢的智能体——它主动、懂你、还聊得来,而这正是跟Devin协作时该有的感觉。他还提到,自己和另一位联合创始人Walden Yan早就以天使投资人的身份投过Poke背后的公司。

    Poke这一路走过来

    Poke是2026年3月才上线的,最大的特点是你可以直接在自己惯用的消息App里跟它对话——iMessage、短信、Telegram,部分地区还支持WhatsApp。用户拿它干各种事,旅行、健康、理财、日程、学习都有人用。von Hagen说,最常见的还是管邮件、设提醒、列待办这类效率活儿。

    • 过去三个月,Poke上用户来回发了超过1亿条消息
    • 用户数已经有几十万,但跑起来太烧钱,一直难盈利
    • 今年6月,它成了苹果Messages for Business平台上第一个获批的AI智能体

    接下来两边怎么玩

    短期内Poke不会有大变化,今年年底前照旧运营,也会继续留在苹果的平台上。真正的动作要等明年——Poke的部分任务会改用Cognition最新的编程模型SWE-1.7,两个产品彻底合并也没被排除掉。

    von Hagen设想的画面是这样的:长远看,Poke可以负责调度那些编程任务,而Devin会变得越来越像Poke。他举了个例子,现在Devin一次只能处理一个PR(代码合并请求),如果让Poke来协调多个Devin会话,价值就出来了。更进一步,Poke还能帮Devin跨会话记住任务。用他的话说,有个”记性好又常在身边的同事”,挺好。

  • World Monitor:73K Stars 的开源「全球实时情报仪表盘」,AI 新闻聚合 + 地缘监控 + 金融雷达一屏搞定

    World Monitor:73K Stars 的开源「全球实时情报仪表盘」,AI 新闻聚合 + 地缘监控 + 金融雷达一屏搞定

    World Monitor 主仪表盘:3D 地球 + 多面板全球态势感知界面

    项目简介

    World Monitor 是一个开源的「实时全球情报仪表盘」——它把 500+ 精选新闻源、地缘政治事件、金融市场、大宗商品、航班、网络安全等 65+ 数据提供方聚合到一个统一的态势感知界面中,并用 AI 自动合成简报,支持完全本地化运行(Ollama,无需任何 API Key)。项目由开发者 Elie Habib 打造,目前在 GitHub 上已收获 73,000+ Stars,近日单日暴涨 3,000+ 星登顶 Trending 榜首,采用 AGPL-3.0 许可。

    安装要求和过程

    环境要求

    • Node.js 18+ 与 npm(Web 开发模式)
    • 可选:Ollama(本地 AI 摘要,无需云端 API Key)
    • 桌面版:直接下载 Windows (.exe) / macOS (Apple Silicon & Intel) / Linux (.AppImage) 安装包,零依赖

    快速安装(三分钟跑起来)

    # 1. 克隆仓库
    git clone https://github.com/koala73/worldmonitor.git
    cd worldmonitor
    
    # 2. 安装依赖并启动
    npm install
    npm run dev
    # 打开 http://localhost:3000,无需配置任何环境变量即可运行
    
    # 3. 想跑其他变体站点?
    npm run dev:tech       # 科技版
    npm run dev:finance    # 金融版
    npm run dev:commodity  # 大宗商品版
    npm run dev:energy     # 能源版

    命令行与 SDK 用户还可以直接:

    npx worldmonitor tools          # 免安装列出全部 MCP 工具
    npm install -g worldmonitor     # 安装 worldmonitor / wm 命令
    pip install worldmonitor-sdk    # Python SDK
    gem install worldmonitor        # Ruby SDK

    部署方面官方提供 Vercel、Docker、纯静态三种自托管方案,详见自托管指南

    核心功能

    World Monitor WebGL 平面地图(deck.gl),56 种地图图层

    • 500+ 新闻源 AI 简报:横跨 15 个类别的精选信息流,由 AI 自动去重、聚类并合成态势简报,支持 25 种语言(含 RTL 排版)与本地语种信息源。
    • 双地图引擎 + 56 种图层:globe.gl 3D 地球与 deck.gl WebGL 平面地图随意切换,叠加军事、灾害、航班(ADS-B)、基础设施、网络攻击等 56 类图层。
    • 跨信号关联与国家不稳定指数(CII v8):军事、经济、灾害、升级信号交叉关联,对 31 个一级国家做服务端权威压力评分,把「新闻」变成「预警」。
    • 金融雷达:覆盖 29 家证券交易所、大宗商品与加密货币,内置 7 信号市场综合指标,金融版变体开箱即用。
    • 本地 AI + Agent 友好:全部 AI 功能可用 Ollama 本地跑;同时提供 MCP Server、REST API(OpenAPI 规范)、CLI 和 Python/Ruby/Go 三语言官方 SDK,一套代码还能构建 6 个变体站点和 Tauri 2 原生桌面应用。

    典型使用场景

    1. 个人「全球情报中心」:替代十几个新闻 App 和推特列表,一屏看完地缘政治、突发灾害、市场异动,AI 简报直接给结论,配合桌面版常驻第二屏幕。
    2. 投研/宏观分析辅助:金融版聚合全球股指、商品、加密行情与新闻信号关联,CII 国家风险评分可作为宏观风险监控的免费开源替代。
    3. AI Agent 的实时世界数据源:通过 MCP Server(worldmonitor.app/mcp)或 SDK,让 Claude、自建 Agent 直接调用「某国当前风险评分」「最新升级信号」等工具,为智能体注入实时地缘与市场感知能力。

    推荐理由

    我把 World Monitor 挂在副屏跑了一天,感受是:这大概是开源界最接近「彭博终端 + 战情室」体验的项目。最打动我的有三点:一是信息密度与工程质量惊人——281 个 Protobuf 契约、60+ Vercel Edge Functions、三级缓存,纯 TypeScript 写出来的性能相当扎实;二是本地优先的 AI 设计,接上 Ollama 就能全功能离线跑,不用交出任何 API Key;三是对 Agent 生态的拥抱,MCP + OpenAPI + 三语言 SDK + llms.txt 一应俱全,拿它当智能体的「世界感知层」非常顺手。需要注意的是 AGPL-3.0 许可,商用集成到闭源产品前要评估合规或购买商业授权。如果你关注全球局势、做宏观投研,或者想给自己的 AI Agent 加上实时世界数据,这个项目值得一颗星。

    下载地址

  • Midjourney把星座App Co-Star买了,AI实验室连占星生意都不放过

    你没看错,做AI绘画的Midjourney,把一个星座App买了。据彭博社报道,Midjourney已经收购了社交占星应用Co-Star,交易金额没有披露。

    Co-Star在星座圈算是响当当的名字,月活用户约430万。它的主打玩法是帮用户排星盘,然后把星盘分享给App里的朋友互相比对。运势解读、配对分析这些内容,Co-Star一直是AI加真人编辑混着写的——某种意义上,人家做”AI生成内容”比很多大模型公司都早。

    Midjourney收购占星应用Co-Star
    Midjourney将星座应用Co-Star收入囊中(图源:TechCrunch)

    一个AI实验室,业务越铺越野

    Midjourney的产品版图最近有点看不懂。这家公司到今天都没有一个独立的App,用户生成图片和视频主要还是泡在Discord服务器里,以至于很多人觉得Midjourney和Discord根本就是绑在一起的。可与此同时,它又在折腾医疗业务,甚至还要开水疗馆。现在再添一个星座应用,画风确实越来越自由了。

    医疗、水疗、占星——Midjourney正在把一个AI图像实验室,一点点拼成生活方式公司。

    买的可能不是星座,是做App的人

    这笔收购里最实际的资产,或许是Co-Star那支二十来人的团队。他们已经整体加入Midjourney,而这批人最值钱的经验,恰恰是Midjourney最缺的——怎么做一款让几百万普通消费者天天打开的App。憋了这么多年,Midjourney自己的独立应用,说不定真要靠这帮做星座的人给做出来。

    • Co-Star月活约430万,主打星盘社交,内容由AI加真人混合生产
    • 交易金额未披露,约24人团队整体并入Midjourney
    • Midjourney至今没有独立App,主阵地仍是Discord
    • 医疗、水疗之后再添占星,产品线跨度越来越大

    从生意角度看,这步棋不算离谱。星座App用户粘性高、情感浓度高,又天然适合生成式AI发挥——每天给几百万人写个性化运势,这活儿AI干起来比人便宜多了。真正的悬念是,Midjourney到底想做一家什么公司。等它的独立App哪天上线了,答案大概就清楚了。

  • Anthropic甩出Opus 5:比旗舰便宜、限制更少,跑分还反超Fable 5

    Anthropic这个更新节奏是真的快。周五,他们家的重量级模型Opus 5正式上线,距离5月28日发布的Opus 4.8才过去两个月。算上6月扎堆亮相的Mythos 5、Fable 5和Sonnet 5,整个5系列现在就剩轻量级的Haiku还没换代了。

    有意思的地方在于,Opus 5虽然个头比旗舰Fable 5小,但官方公告里列出的一堆基准测试,它反而跑赢了Fable 5。再加上它更便宜、限制更少,Anthropic自己都承认,大多数场景下用户恐怕会更愿意选Opus 5。

    官方给的说法是,Opus 5″在验证自己的工作、反复迭代直到成功这件事上强了不少”。发布材料里有个例子:面对一个信息不全的提示词,它自己把一条计算机视觉流水线从头写了出来。

    Anthropic发布Opus 5模型
    Anthropic正式发布Opus 5(图源:TechCrunch)

    隐私和限制,都比Fable宽松

    Fable 5发布以来一直被两件事拖累:一是30天数据留存政策,让不少在意隐私的用户心里犯嘀咕;二是安全分类器动不动就拦请求。Opus 5在这两点上都松了绑——它不在数据留存政策的覆盖范围内,安全分类器的触发频率官方预计也会比Fable 5低85%。逻辑很直白:能力弱一档的模型,看管自然可以松一点。

    当然,护栏没有完全拆掉。网络安全类任务还是管得最严的:Opus 5不能直接扫描软件二进制文件找漏洞,但可以在源代码里找——因为后者更可能是防守方在做安全审计,前者更像攻击者的操作。这条线画得挺讲究。

    触发护栏不再报错,自动降级接着干

    前一天还有安全研究员集体吐槽AI护栏碍事,这次Anthropic顺手给了个补救方案:一个叫Automatic Fallbacks的测试版功能。开启之后,一旦请求触发了安全分类器,系统不再甩一个错误信息给你,而是自动把请求转给一个能力弱一些的模型去处理,API用户至少能拿到一个能用的结果。

    • Opus 5比Fable 5小、便宜、限制少,多项基准反而领先
    • 不受30天数据留存政策约束,安全分类器触发预计少85%
    • 二进制漏洞扫描仍被禁止,源代码找漏洞放行
    • 新功能Automatic Fallbacks:触发护栏时自动降级到弱模型,不再直接报错

    这一手其实值得同行学:护栏要有,但别让守规矩的用户跟着受罪。旗舰模型管严点,次旗舰放宽点,再配一个自动降级兜底,体验和安全都照顾到了。至于Opus 5跑分反超Fable 5这件事,多少有点尴尬——花更多钱买旗舰的用户,怕是要重新算算账了。

  • 英伟达GPU要上月球了:月球车用Jetson跑激光雷达,可能是月面第一颗GPU

    英伟达把GPU卖遍了地球上的数据中心,现在瞄上了38万公里外的月球。做太空机器人的初创公司Lunar Outpost周四宣布,他们的下一台月球车将用英伟达Jetson芯片来控制激光雷达系统。如果顺利落地,这大概率是月球表面出现的第一颗GPU。

    Lunar Outpost月球车测试
    Lunar Outpost正在测试的月球车,将搭载英伟达Jetson芯片(图源:TechCrunch)

    为什么是Jetson,而不是Blackwell

    Jetson在英伟达产品线里名气不如Blackwell、Vera Rubin这些AI训练主力,但它是很多实体AI系统的心脏——体积小、功耗低,能让机器人在本地实时处理传感器数据,不用把信号传回地球再等指令。对通信延迟以秒计的月球任务来说,这一点是刚需。

    Lunar Outpost CEO贾斯汀·塞勒斯说得很直白:他们正拿Jetson和自家更有航天资历的飞行计算平台做对比测试,”看看优势在哪、短板在哪,然后尽力把这些更强的GPU系统用到极端环境里去”。他透露,五年前公司的自主导航还是纯确定性算法,现在已经变成确定性模型加实体AI双轨并行。

    太空环境对GPU极不友好。近地轨道尚有地球磁场庇护,月面却直接暴露在宇宙辐射之下,温差随月相剧烈波动。塞勒斯说:”你的系统必须扛过月夜,而且得在极低功耗下活下来。”

    NASA买单,2028年等人来

    这背后是NASA的一盘大棋。仿照与SpaceX的合作模式,NASA正花钱请私营公司先去月球探路,为最快2028年宇航员重返月球做准备。Lunar Outpost的月球车将由Intuitive Machines的着陆器搭载,钻进环形山勘察地形、寻找水冰,年底前搭乘猎鹰9号发射。再下一次任务的目的地是月面磁异常区Reiner Gamma——那里的磁场之谜困扰了科学家几十年。

    英伟达在月球的布局不止这一处。它刚和首个成功软着陆月球的私营公司Firefly Aerospace达成合作,让Jetson在绕月卫星上处理影像数据,一边帮科学家绘制月图,一边追踪月面上越来越多的机器人。

    • 首发任务:Lunar Outpost月球车年底搭猎鹰9号升空,Jetson负责激光雷达
    • 绕月部署:与Firefly Aerospace合作,卫星在轨处理月球影像
    • 远期规划:载人月球车Pegasus在等蓝色起源的大火箭,目标2028年
    • 终极难题:宇宙辐射、月夜低温、极低功耗,GPU得先活下来

    从太空数据中心的畅想,到月面机器人舰队的蓝图,眼下都卡在同一件事上——一枚足够大的火箭。芯片已经准备好了,运力还在路上。

  • 刚被告上法庭第二天,OpenAI就把ChatGPT Health开放给了全美用户

    OpenAI这次的时间点选得相当微妙。7月22日,佛罗里达州一位牧师把它告上法庭,理由是ChatGPT曾建议他不用去看医生,差点要了他的命。结果第二天,OpenAI宣布:ChatGPT Health健康功能,向全美所有18岁以上用户开放,免费版也能用。

    OpenAI ChatGPT Health向全美用户开放
    被诉次日,OpenAI反而加速推开了ChatGPT Health的大门(图源:TechCrunch)

    每周3亿次健康提问,挡不住的需求

    ChatGPT Health今年1月开始小范围测试,做法是给用户一个专门的健康中心,可以接入Apple Health、Function、MyFitnessPal这些应用的数据,还能同步Epic、Oracle Health等医院系统和One Medical的电子病历。

    需求增长快得惊人。1月测试时,用户每周向ChatGPT提出2.3亿个健康相关问题,现在这个数字已经涨到了3亿。更有意思的是,OpenAI在测试中发现,70%的健康提问根本不发生在专属健康中心里,而是散落在日常对话中。所以这次更新干脆放开了:用户可以授权任何对话调用自己的健康数据,比如随口问一句某种食物适不适合自己的过敏体质,AI就能结合病历给出针对性回答。

    OpenAI称,最新一代GPT 5.6-Luna的最小模型,在其开源的HealthBench医疗评测基准上已经超过了上一代GPT 5.5。公司强调不用用户健康数据训练模型,并与执业医生合作改进回答质量。

    一边免责,一边扩张

    尴尬的地方在于,OpenAI的服务条款至今写着一句话:本服务”不用于任何健康状况的诊断或治疗”。面对佛州牧师的诉讼,公司搬出的正是这条免责条款,同时对《纽约时报》表示正在让医疗相关回答变得更安全,希望用户以专业医生的意见为准。

    牛津大学等机构的多项研究都指出,AI聊天机器人给出的医疗建议并不可靠,有些甚至存在明显问题。但这挡不住大厂们抢滩:Anthropic在1月推出了Claude for Healthcare,谷歌也给Fitbit配上了AI健康教练。健康数据这块蛋糕,没人愿意让。

    • 覆盖范围:全美18岁以上用户,free、Go、Plus、Pro全部套餐
    • 上线平台:本周起网页版和iOS陆续推送
    • 数据接入:Apple Health、MyFitnessPal、Epic、Oracle Health、One Medical等
    • 提问规模:每周3亿次健康相关查询,半年涨了30%

    一边是官司缠身的安全争议,一边是每周3亿次提问的真实需求,OpenAI选择了往前冲。AI能不能看病还没有定论,但用户显然已经用提问投了票。接下来的问题是,当免责条款和产品宣传背道而驰时,法庭会站在哪一边。

  • Open Code Review:阿里巴巴开源的 AI 代码评审 CLI,Token 只用 1/9 却更精准

    Open Code Review:阿里巴巴开源的 AI 代码评审 CLI,Token 只用 1/9 却更精准

    如果你用过 Claude Code 之类的通用 Agent 做代码评审,大概率遇到过这些坑:改动一多就”偷工减料”只看部分文件、报出来的问题行号对不上、换个提示词质量就飘。Open Code Review(OCR) 是阿里巴巴刚开源的一款 AI 代码评审命令行工具,它把”确定性工程”和”Agent 动态决策”拧在一起,专门解决这些问题。项目上线不久便冲上 GitHub Trending,目前已收获约 12.2K Stars

    Open Code Review 功能亮点
    Open Code Review 功能亮点(图片来源:项目 README)

    一句话简介

    Open Code Review 是阿里巴巴开源的 AI 代码评审 CLI 工具——读取 Git diff,交给可配置的大模型 Agent 进行带工具调用的深度评审,产出行级精准的结构化评审意见。它源自阿里内部使用两年、服务数万开发者、累计发现数百万代码缺陷的官方评审助手,经大规模验证后开源。

    安装要求与快速上手

    环境要求

    • Git ≥ 2.41:OCR 依赖 Git 生成 diff、检索代码与仓库操作。
    • 支持 Windows / macOS / Linux 三大平台;需要配置一个大模型接口(OpenAI / Anthropic 兼容即可),或使用”委托模式”无需配模型。

    安装(npm 全局安装)

    npm install -g @alibaba-group/open-code-review

    安装完成后,全局即可使用 ocr 命令。也支持安装脚本、GitHub Release 二进制、源码编译等方式。

    配置模型

    # 选择内置服务商或添加自定义服务商
    ocr config provider
    # 为当前服务商选择模型
    ocr config model

    交互式界面会引导你完成服务商选择、API Key 填写与模型配置,并自动测试连通性。

    模型配置界面
    交互式模型配置界面(图片来源:项目 README)

    开始评审

    cd your-project
    
    # 工作区模式:评审所有暂存/未暂存/未跟踪的改动
    ocr review
    
    # 分支范围:对比两个 ref
    ocr review --from main --to feature-branch
    
    # 单个 commit
    ocr review --commit abc123
    
    # 整文件扫描:不看 diff,直接审阅整个仓库或指定目录
    ocr scan
    ocr scan --path internal/agent

    核心功能

    • 确定性工程 × Agent 混合架构:对”绝不能出错”的评审步骤(选文件、匹配规则、定位行号)用工程逻辑硬约束保证正确,把动态决策与上下文检索交给 Agent,各司其职。
    • 精准选文件 + 智能打包:明确判定哪些文件需评审、哪些应过滤;把关联文件(如中英两份 message 属性文件)打包为一个评审单元,每包作为隔离上下文的子 Agent 并发运行,在超大改动集上依然稳定。
    • 行级精准定位 + 反思模块:独立的评论定位与评论反思模块,系统性提升 AI 反馈的位置准确度与内容准确度,避免”行号漂移”。
    • diff 评审 + 整文件扫描ocr review 审阅改动,ocr scan 审阅整份文件——适合审计陌生代码库或没有有意义 diff 的目录。
    • 丰富集成能力:内置 MCP Server 扩展工具、CI/CD 集成(GitHub Actions / GitLab CI / Gerrit 等),并可作为 Skill 或插件接入 Claude Code、Codex、Cursor;浏览器端 Session Viewer 可回放评审过程。

    性能基准

    官方基于 50 个热门开源仓库、200 个真实 PR、10 种编程语言构建了真实世界评审基准,由 80+ 资深工程师交叉标注出 1505 个基准问题。结果显示:在同一底座模型下,OCR 的 准确率(Precision)与 F1 显著更高,而 Token 消耗仅约通用 Agent 的 1/9、评审更快;召回率略低,是”以精度换噪声”的有意取舍。

    性能基准对比
    在同一底座模型下的基准表现概览

    典型使用场景

    • 提交前自检:在本地 ocr review 一把,把行级问题在推送前就修掉,减少来回改 PR 的成本。
    • CI 流水线自动评审:接入 GitHub Actions / GitLab CI,对每个 PR 自动评审并留下行级评论,低 Token 成本让团队大规模跑得起。
    • 审计陌生代码库:接手老项目或第三方代码时用 ocr scan 整文件扫描,快速摸清 NPE、线程安全、XSS、SQL 注入等隐患。

    推荐理由

    市面上”给 Agent 套个 Skill 就当代码评审”的方案不少,但真正在工程上把稳定性做扎实的不多。OCR 最打动我的一点,是它没有一味迷信大模型,而是把”该确定的地方交给工程、该灵活的地方交给 Agent”这条边界划得很清楚——这正是它能在阿里内部大规模跑两年、且在基准上只花约 1/9 Token 就拿到更高精度的原因。对追求 CI 成本可控、又不想被误报刷屏的团队来说,这是个值得一试的选择。它还内置了针对 NPE、线程安全、XSS、SQL 注入等常见缺陷的微调规则集,开箱即用。

    下载地址