关于ds v4.1的注意力,我测试了MRCR v2

xsmingerfan 2026-09-12 12:08 1

在论坛回复他人的时候,我看见有人提到ds v4.1的注意力相比前代有所下降,遂进行了一下MRCR v2的8 needle测试。至于什么是MRCR v2,以下是G老师的解释:


MRCR v2是对大模型上下文能力的一项有效测试,GPT,Claude,Gemini等模型公司基本上都会在报告中测试这个能力。第三方网站https://contextarena.ai/ 也会对这些模型进行测试。DeepSeek在V4 Pro和V4 Flash中同样进行了相应的测试,不过不知道为什么,在V4.1 flash的报告中,并没有这个bench,第三方网站数据似乎也没有更新V4.1 flash的数据。


那就由我来吧测试给补上吧。我在DSH中,让V4.1 flash帮我做了这项工作,并让它对比了一下前代模型,国模以及GPT上一代旗舰模型GPT 5.6-sol的数据。



这个图是V4.1 flash画的,我第一眼看到的时候非常惊艳啊,这个属于是稍微紧凑点可以放进论文或者报告的图了,非常好看。


从图片中可以看出,相对于前代模型,V4.1 flash在128K以前的注意力有一个非常大的提升,基本上能到达国模第一的水平,但是到达256K以后,注意力急速下降,甚至略弱于前代的V4 Flash 0731。至于国模其他模型,GLM 5.3相对于GLM 5.2,在注意力上有巨大的提升(相对与5.2结构没变,但是注意力有提升,应该是训练带来的效果)。而Kimi的模型在注意力上则一如既往地拉胯,不知道是否是线性注意力导致的。


从使用建议上来说,还是建议控制一下V4.1 flash的上下文,再长上下文下还是比较容易出现上下文丢失的问题。不过这对于所有模型都是如此。


最后就是,我的钱啊呜呜呜



光DSH自己就花了4kw token

最新回复 (2)
  • apparition 09-12 12:27
    1

    不知道 5.3f 跟 5.3 的曲线是否一致

  • xsmingerfan 楼主 09-12 12:45
    2

    5.3f比5.3稍微差一些

* 帖子来源Linux.do
返回