报道称字节讨论训练超5万亿参数大模型

据晚点 LatePost 报道,字节跳动正在讨论训练一个参数量超过5万亿的大模型,若推进将成为国内已知规模最大的模型之一,但该计划仍处早期阶段,最终不一定发布。报道提到,国内大模型参数规模已由 Qwen3.8Max、Kimi K3 推至2.4万亿和2.8万亿。按 H100 算力估算,训练5万亿参数模型约需10万颗 H100 运行347天,或100万张显卡运行35天,实际可能采用20万至30万张显卡训练数月,并叠加准备和后训练流程。

上一篇:

下一篇:

发表回复

登录后才能评论