这周AI圈最炸的一条消息,不是哪家又发了新模型,而是一家公司”正在偷偷练一个超级大模型”。英国《金融时报》8月7日援引三位知情人士的说法称,字节跳动正在训练一个参数规模最高可达10万亿的AI模型,而且目前还处在最早期的预训练阶段。
10万亿到底是个什么概念
这么说吧,目前国内已经发布的最大模型是月之暗面的Kimi K3,约2.8万亿参数;阿里的Qwen 3.8-Max是2.4万亿。字节这个如果真冲到10万亿,差不多是它们的三倍多。横向看,业界估算Anthropic最强的Mythos 5大约8万亿、Fable 5约5万亿。换句话说,字节想一步跨到和西方最顶尖实验室同一个量级,甚至更高。
能力越大,竞争越大。有网友借《蜘蛛侠》那句老话调侃:模型走到这一步不让人意外,但它还没正式推出,就已经改写了推理的算账逻辑。
张一鸣给团队划了条红线
这事儿最耐人寻味的,是创始人张一鸣的态度。据FT信源,他在Seed团队全员会上明确告诉员工,别依赖从竞品模型”蒸馏”出来的数据来换短期涨分。所谓蒸馏,就是拿别人大模型吐出的结果当养料训练自己——见效快,但本质是在复制别人已有的能力,永远只能追着跑。张一鸣宁可短期落后,也不想走这条捷径。
这个判断和字节CEO梁汝波8月6日全员会的表态能对上。梁汝波罕见地公开承认,在大语言模型的基础能力上,字节和海外领先水平的差距正在拉大;但他同时强调,编程是目前最该盯紧的方向之一。一边认差距,一边把资源往底层模型和Coding上压,字节这次是想从”应用强”补到”基础强”。
账没那么好算
不过冷静下来看,10万亿更像一个目标上限,而不是已经锁定的规格。FT自己也说了,无法独立核实每一个细节,字节至今没确认也没否认。模型到底是稠密结构还是混合专家(MoE),现在谁也不知道——这直接决定那个”10万亿”里到底有多少是真正被激活的。
更现实的拦路虎是算力。美国对高端AI芯片的出口管制,让这类训练跑起来比美国实验室更难、也更慢。要堆出10万亿规模的集群,要么靠此前囤的受限硬件,要么转向华为昇腾这类国产加速器。预训练本身就要3到6个月,后面还有微调、评测和安全测试,真要发布,窗口大概率落在2026年底到2027年。
为什么是现在
时机挺巧。最近一两个月,西方前沿模型接连因为安全问题”踩刹车”:Mythos 5因安全顾虑只向少数合作方开放,Fable 5被美国政府要求停服,OpenAI的Astra也因越界事件暂停研发。对手自己慢下来,等于给国内大模型撕开了一段追赶的窗口期。字节这一把押得最激进,赌的就是在别人犹豫的时候把差距抹平。
但参数规模这两年已经反复证明:它和”谁更强”并不是一回事。10万亿能不能打,得等架构、训练数据质量和可验证的基准出来才算数。对普通人来说,比起这个数字本身,更值得看的是字节接下来愿意把多少真金白银,砸进这条最烧钱、也最不容易出成绩的赛道。

- 《金融时报》8月7日报道,字节正训练最高10万亿参数模型,目前仅早期预训练
- 张一鸣反对蒸馏、梁汝波认差距但强调Coding,双线补齐底层能力
- 出口管制下算力是硬约束,发布窗口或落在2026年底至2027年







