字节跳动悄悄开训10万亿参数大模型,张一鸣这次不想走捷径

这周AI圈最炸的一条消息,不是哪家又发了新模型,而是一家公司”正在偷偷练一个超级大模型”。英国《金融时报》8月7日援引三位知情人士的说法称,字节跳动正在训练一个参数规模最高可达10万亿的AI模型,而且目前还处在最早期的预训练阶段。

10万亿到底是个什么概念

这么说吧,目前国内已经发布的最大模型是月之暗面的Kimi K3,约2.8万亿参数;阿里的Qwen 3.8-Max是2.4万亿。字节这个如果真冲到10万亿,差不多是它们的三倍多。横向看,业界估算Anthropic最强的Mythos 5大约8万亿、Fable 5约5万亿。换句话说,字节想一步跨到和西方最顶尖实验室同一个量级,甚至更高。

能力越大,竞争越大。有网友借《蜘蛛侠》那句老话调侃:模型走到这一步不让人意外,但它还没正式推出,就已经改写了推理的算账逻辑。

张一鸣给团队划了条红线

这事儿最耐人寻味的,是创始人张一鸣的态度。据FT信源,他在Seed团队全员会上明确告诉员工,别依赖从竞品模型”蒸馏”出来的数据来换短期涨分。所谓蒸馏,就是拿别人大模型吐出的结果当养料训练自己——见效快,但本质是在复制别人已有的能力,永远只能追着跑。张一鸣宁可短期落后,也不想走这条捷径。

这个判断和字节CEO梁汝波8月6日全员会的表态能对上。梁汝波罕见地公开承认,在大语言模型的基础能力上,字节和海外领先水平的差距正在拉大;但他同时强调,编程是目前最该盯紧的方向之一。一边认差距,一边把资源往底层模型和Coding上压,字节这次是想从”应用强”补到”基础强”。

账没那么好算

不过冷静下来看,10万亿更像一个目标上限,而不是已经锁定的规格。FT自己也说了,无法独立核实每一个细节,字节至今没确认也没否认。模型到底是稠密结构还是混合专家(MoE),现在谁也不知道——这直接决定那个”10万亿”里到底有多少是真正被激活的。

更现实的拦路虎是算力。美国对高端AI芯片的出口管制,让这类训练跑起来比美国实验室更难、也更慢。要堆出10万亿规模的集群,要么靠此前囤的受限硬件,要么转向华为昇腾这类国产加速器。预训练本身就要3到6个月,后面还有微调、评测和安全测试,真要发布,窗口大概率落在2026年底到2027年。

为什么是现在

时机挺巧。最近一两个月,西方前沿模型接连因为安全问题”踩刹车”:Mythos 5因安全顾虑只向少数合作方开放,Fable 5被美国政府要求停服,OpenAI的Astra也因越界事件暂停研发。对手自己慢下来,等于给国内大模型撕开了一段追赶的窗口期。字节这一把押得最激进,赌的就是在别人犹豫的时候把差距抹平。

但参数规模这两年已经反复证明:它和”谁更强”并不是一回事。10万亿能不能打,得等架构、训练数据质量和可验证的基准出来才算数。对普通人来说,比起这个数字本身,更值得看的是字节接下来愿意把多少真金白银,砸进这条最烧钱、也最不容易出成绩的赛道。

象征10万亿参数规模的巨型神经网络
10万亿参数意味着什么?它更像一个目标上限,而非已锁定的规格

  • 《金融时报》8月7日报道,字节正训练最高10万亿参数模型,目前仅早期预训练
  • 张一鸣反对蒸馏、梁汝波认差距但强调Coding,双线补齐底层能力
  • 出口管制下算力是硬约束,发布窗口或落在2026年底至2027年
📎 原文来源:外媒:字节跳动训练10万亿参数超大模型(21世纪经济报道转述FT)

评论

2 条对“字节跳动悄悄开训10万亿参数大模型,张一鸣这次不想走捷径”的回复

  1. MWTAH51627 的头像
    MWTAH51627

    张一鸣这回倒是挺硬气的,宁可不蒸馏也不走捷径。不过10万亿这个数字我现在是半信半疑,FT自己都说没法独立核实。真要能跑出来,关键还得看架构和训练数据,光比参数没意思。

  2. PRFKY42165 的头像
    PRFKY42165

    最扎心的其实是梁汝波那句’差距在拉大’。应用做得再好,底层模型跟不上总是被人卡脖子。但出口管制摆在那,堆10万亿的集群不是有钱就行的,这仗不好打。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注