从 Deepseek V4 Pro 正式版和 flash 正式版的规律猜大模型演化新路线

CaiGbro 2026-08-13 14:25 1

昨晚 Deepseeek v4 pro 正式版发布,从官方评测来看,与 flash 正式版差距很小,今天下午似乎由于社区评测不及官方评测的原因,将 V4 pro 正式版又撤回了 ^-^。


我认为如果是撤回,那也仅仅是因为 V4 pro 正式版在部署时出现了问题,但是官方给的评测结论是没有问题的,即 V4 pro 正式版与 flash 正式版的差距就像他们在测评表中的那样,就是差距很小,但是模型参数和价格差距很大,显得 V4 pro 毫无性价比 ^-^。


基于** Pro 与 Flash 参数相差巨大,但性能相差很小**这一点,我有以下猜想:


未来很长一段时间里,各家的主力模型都会是 flash 版本,pro 版本将作为 flash 版本的模具而存在,并且 pro 版本会与 flash 版本在参数上的差距会越来越大,但最终能力上二者会维持可观但又不是很大的差距,差距至少比当前的 v4 pro 正式版和 v4 flash 正式版的差距要大很多,不然 pro 在使用价值上太低了。 ^-^


理由如下:


1.大模型的能力与参数正相关,参数越大,能力越强。


2.大模型的能力随着参数的增大,能力增长幅度越来越小。


3.flash 版本从 pro 版本上继承一定比例的能力与其继承的参数规模相对不变(不准确,暂且这么表述)。


举个例子:


pro 版智力 100,参数 2T,对应的 flash 版智力 80 ,参数 200B。


pro 版智力 120,参数 4T,对应的 flash 版智力 100,参数 400B。


pro 版智力 140,参数 8T,对应的 flash 版智力 120,参数 800B。


在这种情况下,我要提供给市场预期智力为100的模型,就需要先训出 pro 版的120的版本,并且 pro 的120的版本在市场上是根本不赚钱的,因为能用的起的很少,但是它的意义就是由它脱胎出的对应的 flash 的版本。 ^-^


那么在这种情况下,指导原则将不再以限制 pro 的参数上限作为前排约束条件,而是只以能更快更好训练更大的模型为前排约束条件。


说不定现实可能是:


pro 版智力 100,参数 2T,对应的 flash 版智力 90,参数 200B。


pro 版智力 120,参数 4T,对应的 flash 版智力 110,参数 300B。


pro 版智力 140,参数 8T,对应的 flash 版智力 130,参数 400B。


如果是这样的话,那肯定是以训练更大的模型为首要,但是其 flash 版才是用户真正使用的。 ^-^


这种情况下,用不起 Pro 我也无丝毫怨言,那恰恰是我能爽用的条件。

最新回复 (8)
  • Doro2077 08-13 14:27
    1

    我感觉上的是更新后的新版flash,因为我测了下跟flash没啥区别,回答的内容也差不多,就思维链变成更有逻辑性的思维链

  • zitons 08-13 14:30
    2

    flash本身就是从pro而来,所以像说明不了什么

  • 石晓 08-13 14:32
    3

    模型上没上对,都还没有定论呢

    参数差距这么大,但智力几乎一样,明显是不符合逻辑的

    基于不确定的事实去猜测是没有意义的

  • CaiGbro 楼主 08-13 14:37
    4

    说不定我猜的这条路真能走一段时间,但就像你说的,智力差距那么大,参数却相差那么小,这也肯定是有问题的,也一定不是最终的形态。但这个机制,目前不是还没人搞清楚吗,所以说说不定这个路线可以走一段时间。 ^-^

  • wazou pau 08-13 14:43
    5

    GPT,GROK,Claude 等模型的演进并不完全支持你这种分析,目前来看如果是提升不大,更可能是训练flash的策略在pro上失效了。

  • Mario 08-13 14:50
    6

    参数都拉开几个数量级了智商还半斤八两,这明显不科学。

  • 阿达姆 08-13 14:56
    7

    我觉得或许是这样:参数量决定下限,训练材料决定上限;目前deepseek拥有的数据能够充分将flash这个尺寸的模型的能力挖掘出来,但是对于pro这个体量的模型,这个数据量不够,导致上限不够高

  • 00:00 08-13 15:01
    8

    不是flash版是真正用户使用的,而是在中国大模型里,会从追求大参数量转移到追求更高的参数效率,国内的训练资源太少了,没法像openai或者anthropic那样用大量的算力对大参数量进行后训练,这是一个国内企业针对国内环境做出的适应

* 帖子来源Linux.do
返回