deepseek-flash 的第三方跑分趣闻

sentinelK 2026-09-11 13:51 1

这次的 flash-v4.1 的第三方跑分释放了,数据源如下: https://artificialanalysis.ai/models/deepseek-v4-1-flash?pricing=blended-price#intelligence-breakdown
ec8c111a-d4ac-4a9c-b666-e78156efa1ab-image.jpeg


总体上是预期水平( artificialanalysis.ai 刚刚调整了整个总分的权重和算法),但是发现了个有趣的点,值得玩味。


v4.1 的错误回答中,幻觉率非常大,也就是非常不懂装懂。
f03ec6d1-0474-403d-9464-a0ee8ebc5f43-image.jpeg


幻觉率的公式是:错误答案 /(错误答案 + 部分答案 + 未尝试回答)也就是说,他有 96%的错误情形都是硬装。而不是放弃或者只回答一部分。


这也就导致,v4.1 的平均任务花费 token 数,会更高(PS:GPT6 的平均 token 数确实很惊艳):
23b78075-c3d4-43b9-bf5e-9a8c30a7cf33-image.jpeg

最新回复 (3)
  • Insolitude 09-11 14:14
    1
    还真有这种感觉,用的自部署的 deepseek v4 flash ,在 Claude code 这种比较克制的 harness 上,容易代码没理清就开始提修复。到了 dsh 上,就比较奔放,问一个问题要从盘古开天辟地开始读代码,好处是确实看得比较透,坏处是 token 用量体感是 Claude 的 2-3 倍。
  • loveqianool 09-11 14:48
    2
    这上面怎么没有豆包呀。
  • sentinelK 楼主 09-11 14:53
    3
    @loveqianool 这个有个筛选条件,你可以自选筛选哪些模型进入表格。
* 帖子来源V2EX
返回