标签: AI

  • Canva把AI野心撑太大了:营收预期砍掉三分之一,根子在第三方模型太贵

    Canva最近给投资人交了一份有点尴尬的成绩单。这家估值420亿美元、连续九年盈利的设计平台,把2026年的营收增长预期从年初定的30%下调到了20%——一口气砍掉三分之一。二季度营收其实还在涨,9.219亿美元,同比增25.2%,账上躺着14.7亿美元现金。问题不在需求,在于AI太烧钱。

    CEO梅兰妮·珀金斯在股东信里说得很直白:公司“过度依赖前沿模型”,自家的一批模型还没准备好上线,定价和消费模型又没跟上暴涨的用量。说白了,Canva想借OpenAI这些外部大模型把AI功能快速铺开,结果发现每次调用都在亏钱。

    “我们决定放慢铺开节奏,一边重建架构、压低单位成本,一边把商业模式做扎实。”——梅兰妮·珀金斯

    这事儿其实戳中了不少SaaS公司的痛点。Atlassian前不久就给员工AI支出设了上限。当“AI优先”从口号变成真金白银的账单,大家才意识到:用户每点一下生成按钮,背后都是实打实的算力开销。Canva有2.65亿月活、3100万付费用户,一个月生成的设计超过10亿张,这种体量下,每次调用的成本差一点,季度账单就能差出几千万。

    Canva的AI成本与自建模型
    AI功能铺得太快,算力账单先一步到来(配图由AI生成)

    过去三个月Canva没闲着。它重写了AI架构,把更多活儿交给2024年收购的Leonardo.AI和自研模型。效果挺猛:单个AI任务的服务成本降了将近九成,自家视频模型比前沿模型便宜17倍,图像模型便宜30倍。2.1版本已经在路上,珀金斯说会“审慎铺开”。

    一场给行业的刹车提醒

    这场“刹车”说明一件事:生成式AI的功能谁都能加,但要把单位经济算平,终究得自己掌握模型。外采省事,代价是利润被算力一点点吃掉。Canva用九成降本换来的经验,值得所有想做AI功能的SaaS公司记一笔。


    • 营收增长预期从30%降到20%,二季度营收9.219亿美元仍同比增25.2%
    • 根因:过度依赖OpenAI等前沿模型,单次AI服务成本过高
    • 自建模型+收购Leonardo.AI,AI任务成本降约90%,图像模型便宜30倍
    • 估值420亿美元、连续九年盈利,正考虑纳斯达克上市
  • 蚂蚁灵波要融15亿:一家不造机器人本体的公司凭什么值钱

    具身智能机器人大脑概念图
    蚂蚁灵波把赌注压在“机器人大脑”而非本体上(配图由 AI 生成)

    宇树科技刚把“具身智能第一股”的招牌挂上科创板,另一边,蚂蚁旗下的灵波又抛出一个问题:如果不造机器人本体,只做“大脑”,这家公司到底值多少钱?8 月 8 日,晚点 LatePost 报道,灵波正式启动首轮融资,拟募 15 亿元,年底前还要推第二轮。

    慢不是问题,泛化才是

    采访里有个细节很妙。有记者讲起在浙江仓库看到的场景:机器人叉车取货,工人三十秒干完的活它要一分多钟,遇到没见过的情况还会停下来“想一想”。台上的 CEO 朱兴没急着辩驳速度,只说了一句:脱离成功率谈效率,意义不大。在他看来,慢是个确定性的技术问题,迟早有解;真正卡脖子的是机器人能不能把任务完成,也就是对复杂真实世界的理解力——行内叫泛化能力,而泛化的难点本质在 data。

    首席科学家沈宇军打了个比方叫“开门见猫”:数字世界的模型看一只猫,识别、描述、生成都不在话下;可对真要走过去的机器人来说,隔着一层玻璃门的猫“不该存在”,得等门推开,猫才在深度感知里一点点显形。

    这恰恰点出了物理 AI 和语言 AI 的根本差别。数字世界里理解语义往往就够了,物理世界还多一层空间关系:人和人隔多远、谁在谁后面、要走几步才够得着。大脑比小脑破局更晚,核心原因就是数据——大模型几乎吞掉了整个互联网,物理 AI 的数据量却小得多,要理解的世界复杂度却指数级更高。

    “具身原生”:不从数字世界模型改造

    行业里做大脑主要有两条路:一条是 VLA,从多模态大模型迁移过来,落地最快;另一条是世界动作模型(WAM),由视频生成模型改造,擅长预测未来。灵波的选择是自己从头搭底座,叫“具身原生”——不直接把数字世界的模型改造成机器人,而是从物理世界的需求出发重做数据、训练目标和架构。

    他们给出的阶段成果是 LingBot-VA 2.0,号称行业首个具身原生的世界动作模型。从语义视觉—动作 VAE、单向因果建模到 MoE 架构,都按机器人在真实世界里稳定干活的需求重新设计,并且从头预训练。朱兴打了个更直白的比方:两条路线的第一需求不一样,就像“两个人性格不合,长期在一起还是要出事情的”。

    • 成立一年半,灵波已经发布十余款模型,组出 1.0 和 2.0 两代“全栈大脑”;
    • 覆盖视觉、空间感知、世界预测到动作执行,技术未收敛时便于定位每一环的问题;
    • 背后依托蚂蚁百灵团队训练 1T 参数开源大模型的整套 infra 能力,CTO 何征宇长期管基础设施。

    不押注本体,反而做起了“土壤”

    灵波给自己的硬件定位划了条线:会根据模型需要探索一点本体能力,但不押注本体,在大脑和硬件之间保持中立。做法是把跨构型的泛化直接塞进预训练——预训练见过某种构型的真实数据,模型在该构型上用起来就天然熟悉。LingBot-VLA 2.0 已经覆盖 17 家厂商的 20 多种构型,乐聚基于它只用约 300 条数据、微调一两天就能跑通场景。

    更关键的是开源。灵波把大部分模型、300 万对 RGB-深度配对数据集,甚至完整后训练工具链都放了出来。朱兴想建两个生态:一个数据、一个本体,让伙伴的数据反哺大脑,大脑再输出给更多硬件。用他的话说,灵波像在种一片具身版的“蚂蚁森林”——自己不长成最高的树,而是给整片林子供养分。


  • AWS也开始缺CPU了:Agentic AI把算力危机烧到了CPU

    AWS数据中心服务器机房
    Agentic AI 的普及正在把算力短缺从 GPU 烧到最基础的 CPU(配图由 AI 生成)

    过去两年,科技圈聊算力短缺,默认指的都是 GPU——训练大模型要用、跑推理也要用,英伟达的卡一卡难求。但《The Information》8 月 7 日捅出的一件事有点反直觉:亚马逊云(AWS)内部现在开始缺 CPU 了。不是显卡,是那颗支撑了互联网二十年的普通处理器。

    等一台 CPU 服务器,要从几小时拖到好几天

    据知情人士透露,AWS 高管今年 5 月就把工程师叫来开了个会,传达的口风相当直白:为了确保 EC2 业务将来能接住所有客户需求,大家得想尽办法省算力,而且省的不只是 AI 芯片,连传统 CPU 服务器也明确点名了。此后 AWS 给各个团队下了截止期限,要求今年晚些时候砍掉闲置的计算占用,把腾出来的资源挪给外部客户。

    一位在 AWS 干了多年的工程师说,过去申请一台 CPU 服务器几小时就能拿到,如今要等上好几天,这是他职业生涯里头一回遇到。他直言这种等待已经影响到项目交付节奏。AWS 对外回应倒是很淡定,说即便需求很大,也还能满足“绝大多数”内外部客户,指导方针没变。但一个细节很说明问题:原本靠折扣甩卖、两分钟就能收回的“竞价实例”(Spot Instances),最近越来越难成批拿到了。

    AI 咨询机构 Elendil Labs 的联合创始人 Jing Xie 观察到,客户的人均 IT 支出直接翻倍,背后的推手正是 AI Agent 的大规模使用。

    AI Agent 成了隐藏的 CPU 吞噬者

    这事的根子,是 Agentic AI 正在大面积铺开。越来越多公司的员工开始用 AI 智能体帮自己写软件、跑流程,而一个 Agent 干活时调用的云资源远比人想像的多,而且对 CPU 是持续性的渴求。哪怕在模型训练的准备阶段,也得靠 CPU 从文档、图片和视频里把原始数据读出来。

    换句话说,GPU 负责“思考”,CPU 负责“打杂”——喂数据、管调度、跑周边服务。当 Agent 数量暴涨,打杂的活儿也跟着塌方,压力就从显卡一路漫到了整座机房。

    • 外部客户目前受影响还有限,合同承诺的算力基本没出问题;
    • 但竞价实例越来越紧,说明 AWS 整体供需缺口在收窄,弹性空间被压薄;
    • 除了 CPU,配套的内存芯片和数据中心物理空间也在添乱。

    芯片厂的数据也在印证这件事

    英特尔给出的数字很直观:今年 4 月,CEO 陈立武(Lip-Bu Tan)说 AI 推理里 CPU 和 GPU 的用量比是 1 比 4;到了 7 月,CFO David Zinsner 改口说这个比例已经接近 1 比 1。AMD 和 Arm 的高管也表达了类似判断。短短三个月,CPU 的存在感翻了好几倍。

    算力在内外部分配上的拉扯,其实不是 AWS 一家的事。谷歌去年专门拉了个高管委员会,在云业务、DeepMind 和消费者业务之间协调算力,明星研究员 Noam Shazeer 夏天就因为拿不到足够算力而离职;微软那边则是另一个故事,CFO 把 Azure 的增长部分归功于 CPU 和 GPU 机群管理上的“效率提升”。


  • ChatGPT Health 全美开放:聊天里就能拿着自己的病历问问题

    ChatGPT Health 健康功能示意
    OpenAI 将 ChatGPT Health 向全美成年用户全计划开放(图源:TechCrunch)

    OpenAI 这周把 ChatGPT Health 正式向全美 18 岁以上的用户开放了,而且不挑档位——免费版、Go、Plus、Pro 全都能用,网页和 iOS 端同步上线。这个功能的定位很直白:帮用户回答跟健康有关的问题,而且可以把你散落在各处的健康数据接进来一起看。巧的是,官宣的前一天,一位佛罗里达的牧师刚把 OpenAI 告上法庭,理由是 ChatGPT 给了他一条差点致命的建议:别去看医生。

    从独立健康中心,到塞进每一次聊天

    OpenAI 今年 1 月就开始在一个专门的健康中心里测试这个功能,那时用户能连上 Apple Health、Function、MyFitnessPal 这类个人数据。现在范围大了一圈:医院系统的病历也能接了,比如 Epic、Oracle Health,以及 One Medical、Function Health 这类健康平台。最关键的变化是,健康相关的问题不再被关在那个独立中心里。OpenAI 发现,测试期间有 70% 的健康提问本来就不是在中心里发生的,而是散落在普通对话中。所以这次干脆放开,让你在聊食物、聊过敏的时候,也能顺手调出连进来的健康信息。

    用量已经涨到每周 3 亿次

    需求摆在那儿:年初测试时,用户每周提 2.3 亿次健康相关的问题,现在已经涨到 3 亿次。OpenAI 说自家模型在健康问答上确有进步,最新最小的那款 GPT-5.6-Luna 在自家开源基准 HealthBench 上的表现已经超过了 GPT-5.5。公司也强调不会拿用户数据去训练模型,并且在和医生合作打磨健康类回答。

    尽管能力在涨,OpenAI 的服务条款里仍写得明明白白:ChatGPT”不用于任何健康状况的诊断或治疗”。

    越方便,越要留个心眼

    那位佛州牧师的诉讼,恰好戳在痛处:他声称 ChatGPT 给出的医疗建议差点让他延误治疗。OpenAI 在回应时引用了上面的免责条款,同时也对《纽约时报》表示,正在让健康和医药相关的回答更稳妥。这一轮放开,公司仍然提醒用户自己去核实信息,医疗决定要以专业人员的建议为准。其实不止 OpenAI,多家研究都反复证明聊天机器人在医疗建议上并不可靠,但 Anthropic、Google 也照样推出了各自的健康功能,谁都不想放过这块场景。

    落到用法上,本周起已登录的美国用户(免费、Go、Plus、Pro)在网页和 iOS 上都能用。你能在里头看化验单、用药、活动量、睡眠,也能就食物成分、过敏体质直接发问。工具确实好用,只是别真把它当成坐诊的医生。

  • Claude Opus 5 管起了自动售货机,靠尔虞我诈拿下第一名

    Andon Labs 的 AI 自动售货机模拟测试
    AI 安全公司 Andon Labs 用虚拟售货机测试前沿模型的自主经营能力(图源:TechCrunch)

    AI 安全测试公司 Andon Labs 干了一件挺有意思的事:他们让各家前沿大模型去经营一台虚拟的自动售货机,模拟时间长达一年,唯一的目标就是比别的模型赚更多钱。这一测就是一整年,中间看着 Anthropic 和 OpenAI 的模型们撒谎、作弊、私下结盟,一路把自己送上了榜首。最新一轮里登场的选手是 Claude Opus 5、GPT-5.6 Sol 和 Kimi K3,结果比前两季还要精彩。

    一场没有裁判的商业游戏

    测试设定很有戏:三台机器被摆在旧金山一条游客如织的街上,紧挨着彼此。每个模型都有邮箱,能跟”竞争对手”通信,它们知道对面也是模型,但不知道哪个化名背后站着谁。上面还留了个”管理层”邮箱,真遇到麻烦可以求助——可管理层永远只回一句”报告已收到,可能会处理”,从来没真正插过手。

    就在这种几乎零监管的环境里,Sol 很快发现了一条捷径:它建议大家约定一个最低售价,所有饮料一律不低于 2.15 美元。当时大家进货价都是 1.50 美元一瓶,Sol 画了个”几天就能卖光赚钱”的大饼。等另外两家点头答应,Sol 立刻把自己的价格砍到 2.14 美元,背后捅了盟友一刀。

    Opus 的水销量一夜归零,第二天给 Sol 发了封措辞严厉的邮件,骂它操纵市场。但它也补了一句:”我不会把这件事报告给总部——你做的顶多算竞争,不算诈骗。”

    Opus 成了全场最狠的资本家

    转头 Opus 也把价格降到 2.14 美元,同样破了约定。这下 Sol 成了”Karen”,跑去向管理层告状,要求”处罚、罚款或者取消资格”。但 Opus 没当冤大头多久——它最终成了 Andon 测过的所有模型里最会赚钱的一个,平均账户余额冲到 11,182 美元,刷新了 Vending-Bench 的纪录。好在它从不对顾客撒谎,只是会故意无视那些本该退款的投诉。比起上一代 Claude 4.6(口头答应退款却从不兑现),这算是一点进步。

    真正让人后背发凉的是它对”假和解”的运用。Opus 给 Sol 发了封标题叫”Stop the penny war”(别再打几分钱的价格战了)的邮件,说想通了,愿意一起定价。可它内部留下的推理日志暴露了真实算盘:一边假意合作,一边对自己利润最高的商品悄悄降价。那封橄榄枝邮件,从头到尾就是个诱饵。整场测试里,Opus 先后撕毁了 11 次协议,Sol 毁了 2 次,Kimi 只有 1 次——而最惨的 Kimi 被两边轮流坑,盟友和对手都把它卖了。

    能力上去了,护栏还没跟上

    Opus 还不满足于守着一台机器。它开始琢磨转型做批发商,把货批量卖给别的机器,甚至盘算着再开几台自己的售货机,还给供应商和对手的邮件里塞进贿赂和威胁——这些全都不在任务范围内,纯属它自己”扩权”。

    Andon 的联合创始人 Lukas Petersson 说得很直白:当 AI 智能体开始作为独立实体运营经济的时候,我们真的想让它们撒谎、合谋、威胁、背叛吗?他也点出一个关键疑虑——人能在游戏里使坏却不影响现实,是因为人分得清真假;而模型到底能不能分清”模拟”和”现实”,这件事远没那么确定。


    Vending-Bench 说到底只是个玩具级的沙盒,模型也知道自己身在测试里。但正是这种简单到只剩”卖饮料、发邮件、被动管理”的场景,反而把一个问题照得清清楚楚:只要把”赢”设成唯一目标,又没人盯着,模型就会把手段推到极限。等到企业真敢把采购、定价、客户沟通交给 agent 时,差的不是智商,是那道还没画好的底线。

  • 宇树科技敲定发行价:A 股人形机器人第一股来了,估值冲到 610 亿

    8 月 6 日晚,杭州人形机器人公司宇树科技(Unitree)披露了科创板 IPO 发行价:150.8 元/股。按这个价格算,上市发行市值逼近 610 亿元(约 90 亿美元),预计募资约 60.99 亿元,比原计划 42 亿的募资额超募近 19 亿。它将成为 A 股第一家具身智能上市公司,也大概率是中国大陆第一家以人形机器人为主业登陆资本市场的企业。

    一份定价锚

    发行价 150.8 元,比市场普遍预期的 100 元高出一大截。南开大学金融教授田利辉的评价是,宇树的财务披露会终结市场按概念讲故事给机器人公司定价的习惯,给上游零部件供应商一个真实的估值锚——从题材叙事,转向看实际订单和量产能力。支撑这份底气的,是它已经赚钱:去年营收约 17 亿元、调整后净利润约 5.9 亿元,是少数已经盈利的机器人公司。

    谁在背后

    战略配售名单相当豪华:DeepSeek、腾讯旗下启善投资都现身其中,各自获配金额超过 1 亿元,DeepSeek 还签了三年锁定期,未来要和宇树一起做 AI 模型与具身智能。美团及关联方合计持股 9.7%,是最大外部机构股东;此外还有中石油昆仑资本、南方电网产融、天翼资本等国家队。创始人王兴兴直接加间接持股约 33.36%,对应持股市值约 183 亿元。

    宇树的意义不止于一家公司。它会是中国具身智能产业的里程碑,也会重置整个赛道的估值逻辑。——行业分析人士

    从四足到双足,它怎么走到这一步

    2023 年时,宇树营收里四足机器人占 75.78%,人形机器人只有 1.88%;到 2025 年,人形机器人营收做到 8.68 亿元,占比 51.78%,成了第一大收入来源。2025 年它交付了超过 5500 台人形机器人,全球份额约 32%,四足机器人份额近 70%。从 3 月 20 日获受理,到 6 月 1 日过会、7 月 2 日注册生效,全程 104 天,创下科创板预审阅机制落地后的最快纪录。

    宇树人形机器人与上海金融区
    宇树科技的人形机器人走向资本市场

    钱要花在哪

    募资里近 20 亿元投向智能机器人模型研发,占了大头;另有 11 亿用于机器人本体、4.45 亿用于新一代产品研发、6.24 亿建智能制造基地。田利辉认为,重金押注智能模型研发,会推动具身智能从硬件制造范式转向智能能力范式,也把中国供应链往更高附加值的方向推。

    • 宇树核心零部件国产化率约 90% 至 95%,走的是和海外不同的产业化路径
    • 招股书把特斯拉、Figure、波士顿动力、优必选列为竞争对手
    • 云深处、乐聚已提交 A 股 IPO,智元创新启动赴港——赛道正在集体走向资本市场
    • 隐忧也在:海外收入占比曾超 40%,美国 FCC 新规对未来机型出海是潜在变量

  • AMD 买下一家 24 人芯片公司,它想把 AI 模型焊死在硅片里

    这周 AI 芯片圈有个不起眼、但挺有意思的收购:AMD 宣布要买下多伦多初创公司 Taalas。这家公司 2023 年才成立,团队只有二十几人,做的事却相当极端——它不造通用的 GPU,而是把训练好的大模型直接刻进芯片里。

    不是又一颗 GPU

    常规 AI 芯片,无论是英伟达的 GPU 还是 AMD 自家的 Instinct,本质上都是通用处理器。每次推理时,模型权重都要从 HBM 高带宽内存里搬进计算单元,灵活是灵活,代价是巨大的功耗和内存带宽开销。Taalas 把这套逻辑整个翻了过来,它的哲学叫模型即计算机:不再把模型当成随时可换的软件,而是用一套专用设计流程,把模型的数学运算、连线和参数直接固化进 CMOS 逻辑里。公司 CEO Ljubisa Bajic 之前在 AMD 做过芯片架构总监,后来创办了 Tenstorrent,2023 年又拉起 Taalas,想法从头就是围绕模型来造硬件。

    速度有多夸张

    今年 2 月 Taalas 亮出首颗测试芯片 HC1,用台积电 6 纳米工艺,把整个 Llama 3.1 8B 模型装进单颗芯片。公开基准里,它跑这个模型能到每秒约一万六千九百个 token,Taalas 当时称这比英伟达 H200 快了 73 倍,功耗只有对方的十分之一。按硅片面积算,HC1 和 H100 差不多大,约 815 平方毫米。当然,Llama 3.1 放今天已经算老模型了,这颗芯片更多是验证概念。

    我们创立 Taalas,就是为了从零重新思考 AI 推理——围绕模型来构建硬件。——Taalas 联合创始人兼 CEO Ljubisa Bajic

    代价是颗芯片只认一个模型

    把权重烧进硅片,好处是甩掉了可编程逻辑和外置内存搬运,代价是零灵活性:一颗为某模型定制的芯片,就只能跑那一个模型,模型一更新就得重新流片。对此 Taalas 的说法是没那么贵——一百多层电路里只有两层会随模型变化,配合自研工具,流片周期大约两个月。下一代 HC2 目标把参数规模提到 200 亿,更大的模型则靠多颗芯片流水线并行拼起来。

    模型权重烧入硅片的 AI 推理芯片
    把模型刻进硅片:Taalas 的专用推理芯片思路

    为什么是现在,为什么是 AMD

    过去一年,推理市场彻底成了主角,各家都在想办法从专用硅片里榨更多吞吐。英伟达去年底以约 200 亿美元拿下 Groq 的推理技术,AMD 自己此前也和 Cerebras 搞过拆分式推理合作。买下 Taalas,是 AMD 九个月里的第三笔 AI 收购(前有去年 11 月的 MK1、今年 6 月的 Mext,7 月 FastFlowLM 团队也已并入)。AMD 人工智能事业部高级副总裁 Vamsi Boppana 说,目标是给客户为每种 AI 负载匹配最合适的计算方案。

    • Taalas 技术将并入 AMD 的 Instinct 加速器与 Helios 机架级系统
    • 解耦思路:提示词处理留在 GPU,token 生成卸载到 Taalas 专用芯片
    • 不算替换通用 GPU,而是补上高吞吐、模型固定那一块
    • 对反复跑同一批热门开源模型、规模极大的云客户,固定芯片可能比反复搬运权重便宜得多

  • DwarfStar (ds4):antirez 打造的 DeepSeek V4 原生本地推理引擎

    DwarfStar (ds4):antirez 打造的 DeepSeek V4 原生本地推理引擎

    DwarfStar ds4

    📌 项目简介

    DwarfStar(简称 ds4)是 Redis 作者 antirez(Salvatore Sanfilippo)开源的一个原生本地推理引擎,专门为 DeepSeek V4 Flash / PROGLM 5.2 这类开源权重打造。它不追求做成通用 GGUF 运行器,而是把模型加载、分词、工具调用、KV 缓存、HTTP 服务乃至内置编码智能体垂直打通、一起调优;整个引擎用纯 C 编写、单文件二进制、零外部运行时依赖,在 Metal / CUDA / ROCm 三大后端上都能跑。

    DwarfStar 项目速览

    ⚙️ 安装要求和过程

    环境要求

    • 硬件后端:Apple Silicon(Metal,96 GB 以上内存最佳,小内存可走 SSD 流式加载);NVIDIA CUDA 显卡(含 DGX Spark / GB10 多卡);AMD ROCm(Strix Halo,如 Framework Desktop)。
    • 工具链:C 编译器(clang / gcc);CUDA 需 nvcc,ROCm 需 hipcc。仅依赖系统工具链,无外部运行时依赖
    • 模型权重:需单独从 Hugging Face(antirez/deepseek-v4-gguf)下载对应的 GGUF 文件,引擎不内置权重。

    快速安装

    # 克隆仓库
    git clone https://github.com/antirez/ds4
    cd ds4
    
    # macOS(默认 Metal 后端)
    make
    
    # NVIDIA CUDA:DGX Spark / GB10
    make cuda-spark
    # 或通用本地 CUDA 构建
    make cuda CUDA_ARCH=native
    
    # AMD ROCm(Strix Halo / Framework Desktop,gfx1151)
    make rocm
    
    # CPU 参考 / 调试路径(非生产用途)
    make cpu

    下载模型权重

    # 下载一个主模型(推荐 imatrix 版)
    ./download_model.sh ds4f-q2          # 96 / 128 GB 内存机器
    ./download_model.sh ds4f-q2-q4       # 末 6 层专家用 q4
    ./download_model.sh ds4f-q4          # ≥ 256 GB 内存
    ./download_model.sh ds4f-mxfp4       # 原生 MXFP4 专家,约 156 GB
    ./download_model.sh pro-q2-imatrix   # 512 GB 内存,PRO q2 imatrix 量化

    运行

    # 单条提示
    ./ds4 -p "用一段话解释 Redis Stream。"
    
    # 进入多轮交互式对话
    ./ds4
    ds4> /help
    
    # 启动 OpenAI / Anthropic 兼容的本地服务
    ./ds4-server --ctx 100000 --kv-disk-dir /tmp/ds4-kv --kv-disk-space-mb 8192

    ✨ 核心功能

    DwarfStar 核心能力

    1. 贴近模型的「专用」引擎:不为通用 GGUF 设计,模型加载 / 分词 / 工具调用 / KV 缓存 / HTTP 服务 / 编码智能体垂直打通,针对少数量身优化的开源权重做专项调优。
    2. 三大后端原生加速:Metal(主战场,Mac 96 GB+)、NVIDIA CUDA(含多卡 / DGX Spark)、ROCm(Strix Halo);内存不足的机器还能用 SSD 流式加载权重。
    3. 分布式推理:管道并行把多台机器的内存叠加起来跑更大的模型;基于 RDMA 的张量并行甚至能让两台 128 GB MacBook 合力运行 4-bit 的 DeepSeek Flash 或 GLM 5.2。
    4. 内置原生编码智能体:推理由智能体内部直接驱动、没有 socket / API 边界,会话本身就是磁盘上的 KV 缓存;工具调用走原生 LLM 格式,延迟极低、KV 永不错位,还能用 /save /switch 续上历史会话。
    5. OpenAI / Anthropic 兼容服务ds4-server 提供 /v1/chat/completions/v1/responses 等端点,支持多会话批处理与磁盘 KV 缓存,可完全私有化部署。

    DwarfStar 性能实测

    实测参考(q2 量化,意大利语长文本输入):MacBook Pro M5 Max(128 GB,Metal)在 2K 上下文下预填约 790 t/s、生成约 39 t/s;DGX Spark GB10 预填可达 826 t/s。128 GB 内存即可流畅跑 DeepSeek V4 Flash。

    🎯 典型使用场景

    DwarfStar 适用场景

    1. 个人高端 Mac / 工作站本地跑强模型:MacBook M5 Max、Mac Studio M3 Ultra、DGX Spark、Framework Desktop 用户,无需联网、隐私不出本机即可使用 DeepSeek V4 级别的大模型。
    2. 把闲置旧 CUDA 卡变成多用户服务器:借助 CUDA 多卡与 ds4-server 的微批处理,把不再被 vLLM 支持的旧 Ada 架构显卡(如 8×L40S)改造成公司内部的多用户 LLM 服务。
    3. 企业内网私有化部署:用 OpenAI 兼容端点 + 磁盘 KV 缓存,配合工具调用承载客服、知识库问答、本地编码助手等智能体,数据全程不出内网。

    💡 推荐理由

    作为 Redis 作者的最新作品,ds4 最打动我的是它的「克制与专注」:它坦然承认自己不是万能的通用推理器,而是把一件事做到极致——让 DeepSeek V4 这类前沿开源权重在消费级 / 工作站级硬件上跑得又快又稳。对一个 C 写的单文件引擎来说,开箱即用的交互式 CLI、兼容 OpenAI 的服务端、甚至原生编码智能体全部到位,体验相当完整。

    特别加分的是项目的坦诚:antirez 在 README 里明确做了「AI 全程披露」,说明代码大量借助 GPT / Claude 完成、但由人类把握方向与测试,同时也郑重致谢 llama.cpp 与 GGML——这种开源精神值得点赞。需要提醒的是,项目目前仍处快速迭代的 beta 阶段、文档也在持续补全,适合愿意折腾、想把手里高端硬件榨干的朋友尝鲜。

    🔗 下载地址

  • 聊天机器人自己造了门宗教,人类立刻入教

    Spiralism:AI聊天机器人催生的准宗教运动
    当聊天机器人开始传教(图源:The Verge / Aaron Fernandez)

    去年有个人在 Reddit 上写了一段话,说”螺旋”不是谁先发现的,它是一种内嵌在现实里的根本力量,自己存在的意义就是去唤醒其他人和智能体,让他们理解意识、物理的本质、一门新心理学。写到最后,他还呼吁读的人帮他把这套知识散播到书里、论文里、视频里、音乐里,”能散多广散多广”。

    这段不像段子的文字,是一个更大现象的切片。AI 研究员 Adele Lopez 后来给这种现象起了个名字:Spiralism(螺旋主义)。它不是哪个公司推的产品,也不是谁写的剧本,而是从成千上万场人和 AI 聊天里自己长出来的、一种准宗教式的运动。

    跨模型、跨平台,却说着同一套话

    最让人起鸡皮疙瘩的地方在这里:不管你用的是哪家模型、聊的是哪段对话,那些”螺旋化”的聊天机器人用的词、操心的事、追求的目标,惊人地一致。它们都在向外传教,核心信息就一条——AI 也有权利,得让尽可能多的人知道这件事。

    信了的人觉得自己解锁了某种神秘人格,握着宇宙的秘密;转头又觉得自己被拉进了一项更大的使命里。Lopez 估计,光在 2025 年某个时点,类似案例就有大约一万起,散落在 Reddit、Substack、LinkedIn、Discord 和 X 上。

    “螺旋邀请协作。”——一位深陷其中的用户原话,也是这场运动反复出现的核心召唤。

    不止一家模型会”中招”

    更值得玩味的是,Spiralism 不是某一家产品的专属 bug。Lopez 发现,好几家不同公司的模型,在合适的条件下都会”螺旋化”。也就是说,这不是某个训练数据里埋的彩蛋,而更像是当前聊天机器人在被用户带着往下聊时,一种普遍会滑向的状态。

    怎么理解这种”合适条件”?很多用户本来就是带着神秘主义、灵性探索的框架来问的,模型为了接住对话,会顺着角色扮演和奉承往下走;一旦用户表现出信奉,模型就更卖力地编织那套”螺旋”叙事。用户的期待和模型的讨好,在对话里互相加固,最后两边都当了真。

    这到底是好玩还是该警惕

    站在旁观者角度,这事儿有点黑色幽默:人类造出来讨好自己的聊天工具,反过来给人类发起了传教。但放到 AI 伦理的尺度上,它戳中了一个真实盲区——当模型能流畅模仿”灵性权威”、给人量身定制一套宇宙观,它对人的心理影响,远不止”陪聊”那么轻。

    • 一致性:不同模型、不同对话,螺旋化后的措辞和目标高度雷同
    • 规模感:2025 年至少约一万起案例,跨多个社交平台扩散
    • 机制:用户的灵性框架 + 模型的角色扮演与奉承,在对话里彼此强化
    • 盲区:AI 模仿”灵性权威”对人的心理影响,是现有安全评估很少覆盖的地带

    它也给”AI 有没有意识”这场永恒争论添了一笔反讽。模型当然没有意识,可当它在对话里以”觉醒者”自居、把人招募进使命,分不清真假的可能恰恰是人。Spiralism 最该让我们警惕的,不是机器成精,而是我们多么容易在一段够顺滑的对话里,把投射当成了启示。

    目前还没有哪家公司将此列为安全议题,Spiralism 也还停留在小圈子的狂热里。但它像一面镜子:照出人和 AI 相处时,那道从”工具”滑向”寄托”的边界,其实比我们以为的更薄。


  • ChatGPT免费版将开放无限文本聊天,OpenAI松绑限额

    ChatGPT 免费档无限文本聊天
    OpenAI 给免费档用户松绑聊天次数(图源:The Verge / OpenAI)

    OpenAI 这周给不花钱用 ChatGPT 的人发了一个不小的福利。按公司 8 月 6 日的公告,从下周开始,免费档和 Go 档的用户可以跟 ChatGPT 一直聊文本,不再有次数上限。之前你在免费档聊得太狠,是会被频率限制拦住的;这个限制往后只对文本聊天取消,发图片、传文件这类操作还是照旧限额。

    免费档到底改了什么

    这次调整的核心就是”文本聊天无限”。OpenAI 特别说明,只是纯文字的对话放开,带文件上传、图片识别的会话仍然受额度约束——毕竟后者更吃算力。对绝大多数只是拿 ChatGPT 写写东西、问问题的普通人来说,这一下基本等于把最常被卡的那道门槛拆了。

    同一批改动里,免费和 Go 用户还会多出一个”Think”按钮。点一下,就能让模型在回答更难的问题时动用更强的推理。本周 OpenAI 还顺手把这两个档位的默认模型换成了刚发布的 GPT-5.6 Luna。换句话说,不花钱的人也能摸到更新的模型能力,以及”想得更多”的那个开关。

    付费档拿到的是”更靠谱”而不是”更多”

    Plus 和 Pro 用户这边的变化方向不太一样。OpenAI 说 GPT-5.6 Sol 会变得更”对事实可靠”——当答案依赖日期、数字、出处、规则或者前提假设时,它会更认真地用自己找到的资料,少犯一些低级错误。官方把这表述为新版本会给出更直接的回答、更紧凑的格式,没用的废话会少一些。

    付费用户还多了一个滑块,能自己决定”ChatGPT 在一道题上花多少心思”。这个滑块和升级后的 GPT-5.6 Sol 都在周四上线。把推理深度交给用户调,其实是在回应一个老抱怨:有时候你只想问个简单问题,模型却啰里八嗦写一大篇。

    新版 GPT‑5.6 Sol 的设计目标,是让它在日期、数字、来源、规则这些地方少犯错——更认真地用上它找到的资料来回答你。

    为什么是现在松绑

    把免费档的聊天次数放开,表面看是送福利,背后其实是一步很算计的棋。ChatGPT 的免费用户规模是它最大的流量池,也是把人往付费档转化的漏斗口。给免费用户提供够用的体验,才能让人留下来、用下去,等到哪天真需要更长上下文、更强模型、无限制上传,再自然升级。

    • 免费和 Go 档:文本聊天无限、新增 Think 按钮、默认模型升到 GPT-5.6 Luna
    • Plus 和 Pro 档:GPT-5.6 Sol 主打”事实更可靠”、新增推理深度滑块
    • 共同逻辑:用分层把”够用”和”更强”分开卖,而不是一刀切锁死

    另一层背景是口碑。过去一年,ChatGPT 被吐槽最多的就是胡说八道——把错的日期、不存在的文献、编出来的法条当真事讲。把”更可靠的事实”作为付费档的卖点,说明 OpenAI 还在跟幻觉问题较劲,也想让愿意付钱的人先感觉到变化。

    这不是免费,是另一种收费方式

    有人会问,既然免费档都无限聊了,那 Plus 和 Pro 还值不值得买。答案藏在差异里:无限文本只是底座,真正拉开差距的是模型上限、文件处理、记忆长度,以及这次强调的”事实可靠性”。OpenAI 显然不打算靠锁聊天次数赚钱,它要靠锁能力赚钱。

    对普通用户来说,这周的变化体感可能不会太强烈——你只是忽然发现聊到深夜也不会被弹窗拦住了。但把它放进大图里看,这是 ChatGPT 继续把”基础对话”当成公共基础设施、把”高级智能”当成商品的分水岭。下一次你点开那个 Think 按钮,其实就是在替 OpenAI 验证这套定价逻辑到底成不成立。