DeepSeek正在训练更大参数的模型

MarchBeta2087 2026-09-22 19:24 1

2万亿参数(2T)在训练中,8万亿参数(8T)规划中




需要注意的是,这里面的“兆”是港台用法,大陆是百万,港台是万亿




最新回复 (13)
  • V_Arrow 09-22 19:28
    1

    1.6T的V4P都炼炸了,2T 8T还能把握得住么 ^-^

  • ensemble 09-22 19:31
    2

    v4.1pro应该就是这个2T模型了。8T的有点难以想象啊,deepseek有这么多卡吗?fable和astra应该也没有这么大吧 ^-^

  • Humpy 09-22 19:33
    3

    不好说,他们不公布体积肯定不是因为体积小,尤其是fable

  • xiedian 09-22 19:34
    4

    按照v4.1 flash是版本最小参数的说法,再加上v4 pro炼炸了,接下来应该是一个v4.1中等参数的模型,中等参数没问题,最后可能才是v4.1完全体

  • 初九猫 09-22 19:35
    5

    deepseek-v4.1说是“该系列最小的模型”的时候我就预料到了,至少这个系列有三个模型,现在就看最大的模型叫什么名字了……deepseek-v4.1-max?

  • 时牧 09-22 19:35
    6

    值得注意的是^-^早上我在x看到同款消息,是那种蓝钩营销号发的

    这不会是x上的小道消息吧




    还行,只是添油加醋了

    应该真的在训 2 万亿参数的4.1pro

  • yangkl 09-22 19:36
    7

    参数越大,推理费用是不是就越高了,后边还能愉快用AI吗

  • blless 09-22 19:37
    8

    有也很正常吧,v4.1 flash跟v4 flash架构差距那么大,推出时间才一个月左右。说明底模肯定已经训练好了,按ds尿性,4.1pro肯定已经在训练了啊。

  • Myallure 09-22 19:40
    9

    ds极致稀疏化,感觉应该还行

  • 心雨 09-22 19:45
    10

    这两位之前就有传言上10t了,有些营销号吹的更夸张,绝对小不了

  • Z 09-22 19:48
    11

    考虑到astra出来后O的算力都这么紧张,感觉应该是一个挺大的模型

  • DROP_TABLE.user_info 09-22 20:02
    12

    对咯!梁子你听叔的,你把握不住~

  • Stesla 09-22 20:03
    13

    ^-^灰测呢?灰测模型怎么不放出来了^-^^-^^-^

* 帖子来源Linux.do
返回