怪不得k3这么强,100b激活参数,感觉v4正式版不可能反超

天怒 2026-07-27 23:41 1



这也是部分贵的理由了。

别问这图为什么是豆包做的,gpt到期了 ^-^

反正数没错!

最新回复 (19)
  • 小林康娜 07-27 23:43
    1

    只要没发就是有可能,先相信,相信相信的力量

  • 天怒 楼主 07-27 23:43
    2

    靠后训练50b打100b吗,真的假的,我不信 ^-^

  • NukaColaM 07-27 23:45
    3

    为啥一定要反超,别妨碍你梁叔叔训练AGI ^-^

  • 天怒 楼主 07-27 23:46
    4

    毕竟要融资吗,还是要sota的。

  • jcc 07-27 23:47
    5

    梁文峰说的800b激活的,估计就是肥波吧


    差的有点多

  • charles 07-27 23:48
    6

    k3是多模态吗,我不清楚,还没用过

  • 07-27 23:49
    7

    k3和5.6相比如何 逆向能力怎么样 最近被5.6气疯了

  • NukaColaM 07-27 23:49
    8

    梁叔叔生气了,居然把内部纪要给泄了,他不融了。等下再掏几百亿展示实力。

  • 刘小白 07-27 23:50
    9

    但是K3比V4要贵好多啊,从这点来说,还是V4更好吧

  • 天怒 楼主 07-27 23:51
    10

    我觉得不像,800b成本撑不住,400最多了。

  • qianye223 07-27 23:52
    11

    50B打100B,这波优势在我们梁白开 ^-^

  • Emporio 07-27 23:52
    12

    这个图是真的吗,glm 效果明显比 ds 好吧

  • NukaColaM 07-27 23:53
    13

    不是这么比的,你不看coding,ds把glm按在地上摩擦。

  • enget 07-27 23:53
    14

    glm 效果明显比 ds 好吧



    参数量和模型能力不能直接比的,glm52 强说明他的算法更牛逼

  • supanono 07-27 23:55
    15

    将近 3 万亿,104B 激活,这就像所谓梁圣录音里提到的,现在开源模型也就是开源而已了,第三方的部署成本无论如何也低不过模型开发厂商,可能不至于让他们赔本,但利润空间小多了


    这就让做三方的有得赚,但想多赚还是得自己研发,势头是好的




    scaling laws 还是太权威了,大模型领域的摩尔定律(不当类比),那么梁圣有实力掏一个大模型领域的韬定律出来吗?

  • jcc 07-27 23:55
    16

    可能刚上线的时候800b,然后上线后再持续优化(降智),然后到了400b


    梁文峰说的全球最大的模型,激活800b,估计就是肥波

  • JARK006 07-27 23:56
    17

    我也不太信,激活量低终究是个先天劣势,如果把激活量提起来估计有戏。


    我在 lm studio 玩moe模型是可以调整激活专家数量的,就像Qwen3.6-35B-A3B也可以变成A35B,至于质量变化如何就不清楚了

  • Jack C. 07-28 00:00
    18

    而且蒸馏的很厉害,很有怀疑,那个Any就是K3的蒸馏。

  • 小林康娜 07-28 00:00
    19


    一想到要解释梗,那还是算了

* 帖子来源Linux.do
返回