看了梁sir的泄露谈话,说我们国内目前用的大模型其实只有50B的参数,是真的嘛?

martinMao 2026-08-07 23:03 1

在B站看到他们发出来的部分录音,说我们用的国内模型,其实只有50B,有大佬知道是这样的嘛

最新回复 (11)
  • 80hou 08-07 23:05
    1

    比7B强就是了。

  • MyrnaGrote 08-07 23:07
    2

    激活参数 吧 ^-^

  • atoz03 08-07 23:10
    3

    moe架构,单次激活专家参数

  • martinMao 楼主 08-07 23:11
    4

    @80hou #1 那肯定的,肯定比本地模型强

  • Kazemvn 08-07 23:20
    5

    3楼正解,国模现在都是moe的,3.8max是2.4T A95B;K3是2.8T A104B;v4pro是1.6T A49B,这些算大的。minimax m3 428B A23B glm5.2 744B A40B v4flash 284B A13B

    不过国外模型,基本上不认为是很大的dense模型,也是moe只不过参数量非常大罢了,激活几百B那种

  • yoyosky 08-07 23:24
    6

    bd

  • martinMao 楼主 08-07 23:37
    7

    @atoz03 #3 原来是这样,多谢解答

  • martinMao 楼主 08-07 23:38
    8

    @Kazemvn #5 明白了,多谢大佬科普

  • 1952444901 08-07 23:57
    9

    国模的创举就是提高稀疏度,资源受限不得已而为之

  • martinMao 楼主 08-08 09:31
    10

    @1952444901 #9 明白了 多谢大佬解释

  • lwdsj 08-08 09:47
    11

    50b,是50 bit?

* 帖子来源NodeSeek
返回