Scaling Law还是权威

你是什么东东 2026-08-13 19:45 1

大伙还是对1.6T的v4 pro太多期待了,其实跟kimi k2.6或者2.7比一下就知道这次正式版对没对了。其实由此可以推测fable 5没有网上传的10T那么大,感觉预估在4T-5T之间,5.6sol可能在4T左右。以后看模型能力感觉看参数量差不多了,除非这个模型没有后训练


还有一个情况是不知道官网界面介绍v4 pro 正式版的时候有没有像flash那样说重新进行后训练,没有的话就代表这3个月deepseek可能就是做了flash后训练、提升pro的agent能力,开发harness以及可能在开发下一代模型

最新回复 (4)
  • kimi 08-13 19:46
    1

    GLM5.2也才7百多吧,如果DeepseekV4proGA能有GLM5.2两倍的功力,那也没那么多失望透顶了

  • ppdx 08-13 19:47
    2

    肥波5-6吧。

    sol略小一些。

    dsv4p可能就是base拉了,后训练也搞不动了。

    v4f可能有一些独家技术,对小模型增幅较大。

    再等等吧,应该会有下一代了。

  • OpenAI_Q-Star 08-13 19:57
    3

    让我简易翻译Scaling Law

    假如你有1T硬碟

    你可以放1T的小姐姐

    如果播放的小姐姐都是你心中即时所想

    正是最好的模型


    当越大T,P,E,Z,Y

    越多小姐姐可以入住

    每次你心中所想都立马出现

  • Duichangg 08-13 20:16
    4

    scaling law不是线性的啊,横坐标是对数坐标系,模型越大收益就越低啊

* 帖子来源Linux.do
返回