花巨资测试:Qwen3.8-27B_3090-5090-V100-上下文_横评

jeffccie 2026-08-23 14:16 1

想跑 64K:RTX 3090 24G 是性价比首选(~37 tok/s Decode)。

想跑 192K:RTX 5090 32G 完胜 V100 32G(Decode 52 vs 30 tok/s,1.73×)。

想跑 192K:V100 32G 相比真是白菜价值得拥有(Decode 30 tok/s,)。






最新回复 (7)
  • jeffccie 楼主 08-23 14:18
    1

    全为真机实测,给各们佬参考。


    V100是真划算。就是慢点

  • coupile 08-23 14:18
    2

    dflash2不是可以加速吗,你这个测试用了吗

  • jeffccie 楼主 08-23 14:21
    3

    这个得换卡试,V100 架构太老只能用OLLAMA ,只支持MTP

  • jeffccie 楼主 08-23 14:37
    4



    搞起来试试,看能提高多少

  • jeffccie 楼主 08-23 22:44
    6

    听佬们的建议加了DFLASH和MTP,质的飞跃,从192K 从58飞到120







  • jeffccie 楼主 08-23 22:47
    7

    测试完了质的飞跃,但32G只能跑32K上下文,不过用原生MTP速度也翻了一倍。 ^-^

  • olivame 08-23 22:49
    8

    多少量化的呀这是,速度和量化关系也挺大的

* 帖子来源Linux.do
返回