字节10万亿参数模型已开训,规模逼近Anthropic Mythos 5

王大锤 2026-08-07 13:21 1

英国《金融时报》援引三名知情人士称,字节跳动已经开始预训练一款最高 10 万亿参数的大模型。项目仍处于早期阶段,最终规模尚未确定。如果按上限训练,它将达到 Kimi K3 的三倍以上,成为目前已知中国团队中参数规模最大的模型。


字节这次直接把模型尺寸推到了 Anthropic 旗舰附近。Anthropic 从未公布 Mythos 5 的参数量,但《金融时报》援引行业估算称,Mythos 5 约为 8 万亿参数,Fable 5 约为 5 万亿。字节新模型若做到 10 万亿,至少在参数规模上已经进入美国最前沿闭源模型的同一量级。


这款模型目前还在预训练(用海量数据训练模型的基础能力)。《金融时报》称,这一阶段通常需要 3 至 6 个月,之后还要继续后训练,顺利才会发布。参数更多也不等于能力一定更强,最终表现还取决于架构、训练数据和训练方法。


张一鸣近期在 Seed 内部明确反对蒸馏竞争对手模型,要求团队接受短期落后,靠自研冲击世界第一梯队。这款最高 10 万亿参数的新模型,是字节目前最激进的一次规模下注。


https://www.ft.com/content/9b8383b1-a28d-4940-8c4e-2f0cd21556ef

最新回复 (19)
  • 白芸汐 08-07 13:24
    1

    10T吗?有点意思,我确实不觉得这训练出来能立马领先,不管这个事情有没有,我都是觉得一口气吃不成个大胖子

  • wjy 08-07 13:25
    2

    训出来跑得动吗,不是很看好啊,用来内部蒸馏用?

  • 3GZ 08-07 13:28
    3

    Mythos 5 约为 8 万亿参数,Fable 5 约为 5 万亿。



    虽然但是,这两难道不是同一个模型吗?

  • xiedian 08-07 13:29
    4

    这路走偏了吧,地基没打好就直接盖楼,还是那么高的楼?但字节内部肯定更知道ai如何训练,难道只要有数据和算力就能训练顶级模型?

  • runs 08-07 13:31
    5

    主观上我还是蛮希望字节可以成功的

  • wazou pau 08-07 13:32
    6

    我比较好奇为什么mythos是8T,fable是5T,如果这样看的话,那opus不就最多和kimi k3差不多了?以及gpt的5.6大概率是4T级别模型吧

  • 吴亦Fan? 08-07 13:32
    7

    说不蒸馏谁信,也就是个烟雾弹!!!

  • 王大锤 楼主 08-07 13:32
    8

    主观,客观都希望能成,感觉字节才是最有希望成的那个,产品力最好的一家公司

  • Pluto 08-07 13:34
    9

    感觉全是无端猜测一样,夸大噱头出一篇新闻稿

  • Eeevan 08-07 13:35
    10

    这新闻谁写的,绝对是个外行。fable和mythos不是一个模型,安全护栏不同吗? ^-^,怎么可能差出3t的参数

  • yhage 08-07 13:37
    11

    这些个大模型要有质的飞跃,是不是应该有新的东西出来才行,光改进永远追着别人的屁股后面跑

  • 古月方源001 08-07 13:40
    12

    豆包已经彻底是c端的形状了,没有技术积累,字节10T模型感觉也没啥看头啊

  • 烟栀 08-07 13:48
    13

    难道流口水的豆包腰变成速趴豆包了吗?^-^

  • 3GZ 08-07 13:50
    14

    说不蒸是因为怕被制裁TikTok。把柄在人家那,只能行事谨慎。现在OAG御三家可是会向白宫告状的。

  • OctoberSama 08-07 13:57
    15

    10T参数的豆包 三个月超英六个月赶美

  • bobox 08-07 13:58
    16

    好像看到新闻说5T的,怎么又翻倍了 ^-^

  • 牛的扔子 08-07 13:59
    17

    模型本身咋样。光是堆训练参数就厉害吗

  • 3GZ 08-07 13:59
    18



    5T这个是国内的晚点,可信度很高。

  • 爱琴炫彩 08-07 14:00
    19

    这得多少显存的设备才能跑… 一台成本得5000万吧

* 帖子来源Linux.do
返回