关于Moe和稠密模型,涨知识了

风云 2026-08-18 23:17 1

一直刷到qwen3.8-27B比dsv4f强


我还以为我的白月光烂掉了


然后阅读时发现"稠密模型"四个字,和以前看到的Moe不一样,去了解了一下,才发现并非如此


分享给各位佬友


Moe虽然宣传起来参数量大,但是真正激活的参数量往往极小于参数量,而模型工作能力精度取决于激活量


稠密模型则是有多少激活多少


比如说284B的dsv4f,激活13B


那么能力和27B的qwen差不多情有可原啊


然后Moe没激活的那些,其实就是知识了,可以让模型广度强于稠密模型


可以理解为Moe是一颗大脑加上一堆学习的知识


稠密则是一颗大脑




又去学习了一下


之前写的地方确实有些不太准确


想表达的是,qwen的27B其实不算真正的小模型,真正的小模型应该是27B激活1B


然后就是激活参数的方面


激活的越多算的越厉害


如果dsv4f激活27B那肯定会更强


同时激活参数也很需要算力,所以说很多地方27B的qwen比dsv4f更贵

最新回复 (9)
  • tobyang72 08-18 23:19
    1

    主要是现阶段还是要依赖sft,其实即时base也只有一少部分激活

  • hzqst 08-18 23:22
    2

    srds,dsv4f的激活参数不是10B吗

  • ANON 08-18 23:41
    3

    emmm, 讲道理大脑应该更像是MOE模型, 而且很稀疏(不过可以理解佬友的意思

  • Yangzii 08-18 23:43
    4

    人脑更像moe模型,具体表现为上下文不到10k,参数量约等于2b ^-^

  • ba lao 08-18 23:46
    5

    我觉得 MOE 模型其实要更好一点,因为 MOE 他会调用多个专家处理问题,稠密模型一次性让整个模型进行计算

  • qaw159 08-19 00:09
    6

    但上一代qwen3.6 35b a3b和qwen3.6 27b差距也不是特别大,qwen3.8 35b a3b目前还没开源,但应该是要开源的

  • Amodel 08-19 02:27
    7

    恩可以参考Gemma4 26b

    这个参数量比qwen还小点但它是Moe模型,激活参数3.8b


    不过说实在的这个还行,没有真4b模型那种没法用的感觉……

  • 美帝码工 08-19 02:30
    8

    qwen3.8-27B比dsv4f强



    大参数仍然是有好处的。小模型世界知识少,幻觉更多

  • suntop 08-19 02:32
    9

    是的,这次的 qwen3.827b 确实实力提升惊人,

    我试了满血版的 qwen3.827b,站里常见的魔方,鹈鹕自行车啥的都有超过 v4f 的效果,

    现在就看 qwen3.8-35b-a3b 效果如何了?

* 帖子来源Linux.do
返回