DeepSeek V4.1 Flash 官方 benchmark

sandiferresner 2026-09-10 13:55 1



最新回复 (19)
  • sandiferresner 楼主 09-10 13:56
    1

    感觉很强呀,特别是 Terminal Bench 4.0 这个新的评分

  • a12908 09-10 13:57
    2

    直接核爆?DS官方的跑分还是比较可信的 之前PRO拉完了也老实放出来了 ^-^

  • DenisZ 09-10 13:57
    3

    我去,这么强的吗?感觉跟Sol打得有来有回啊?

  • Dowad 09-10 13:58
    4

    这个评分看,是它自己的模型强,跟 opus 差距有点儿大。 不知道 astra 是怎样的

  • sandiferresner 楼主 09-10 14:01
    5

    这都不是一个价格、同等参数量的模型,能到这种程度已经非常非常牛批了。

  • Kassdin 09-10 14:02
    6

    Opus 跑分王这一块,从跑分上看 sol 基本被 opus 暴打,用起来就是另外一回事了

  • bbb 09-10 14:03
    7

    跑分看起来还不错啊 不知道实际用起来怎么样

  • WWT 09-10 14:03
    8

    tb4.0这个分还是对的 个人体感比glm5.3快

    后端执行比kimi3强点

  • 汉武帝(的大熊猫) 09-10 14:04
    9

    哈哈 dsp这个分支可能真的是有点问题. dsf这一路高歌猛进.. dsp到底除了啥问题

  • sandiferresner 楼主 09-10 14:05
    10

    terminal bench 4.0 应该是目前最没法作弊的测试了。之前像 muse spark 在很多测试里面都很好,但是就这个测试很差。


    DeepSeek 这个 Agent 能力太逆天了。

  • WizisCool 09-10 14:07
    11

    muse 的生态位终于找到了,评估基准测试集的准确度

  • WWT 09-10 14:08
    12

    没绷住

    以后muse什么测试集差

    什么就有含金量^-^

  • sandiferresner 楼主 09-10 14:14
    13

    测试项目参考


  • Kassdin 09-10 14:15
    14

    这一代模型架构和基座都换了,比如这个模型就是 500B 的总参数,不可同日而语

  • Pipinstall 09-10 14:20
    15

    换基座了吗,为什么还用 4.1 这种小版本更新号,看不懂 ^-^

  • sandiferresner 楼主 09-10 14:21
    16

    我觉得这个模型是真的斩杀线了, 速度快、聪明还便宜。

  • bbbb 09-10 14:25
    17

    人用起来比市面上其他模型强多了好吧,就说150ts的速度,能稳住pro的能力,flash的价格。性价比

  • dfeiwej 09-10 14:28
    18

    难道是有2拨人在分别推进flash和PRO。。。

  • w2459 09-10 14:31
    19

    4.1相比4换底座架构了吗,怎么提升这么大

* 帖子来源Linux.do
返回