双 3090 跑 qwen3.8 27b q4 单会话已经来到了 120t/s!

VeroFess 2026-08-20 11:30 1

当然是开了 mtp 了,但是 mtp 他也是单会话!


最佳 120.63 tok/s, 在 omp 跑二十分钟任务平均 96.8 tok/s decode + 1483 tok/s prefill


也就是说现在双 3090 在考虑价格的情况下完全可以说是拉爆 4090 和 5090 了,在 4090 没吃上优化的前提下双 3090 也是比双 4090 快的,更别提 dxg 了,算是一万多块钱吃上好的了,嘿嘿

最新回复 (11)
  • 于小盼 08-20 11:31
    1

    我看到标题 进来了 就想问一句开mtp了吧?


    结果就看到开mtp了


    部署的是 W8A16 的么

  • VeroFess 楼主 08-20 11:33
    2

    不开 mtp 那真是拉爆物理极限了x 老黄要给我磕一个的级别x


    这个成绩只在 HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF 和 unsloth/Qwen3.8-27B-GGUF 的 Q4_K_M 上测试过

  • Teddy 08-20 11:34
    3

    当年有个朋友 3090 置换 5080,光顾着笑话他了,忘了当时应该收过来的^-^

  • 于小盼 08-20 11:35
    4

    我现在也在怂恿我们领导部署3.8 也在研究怎么弄好


    目前选的方案是 w8a16 int8 catch 不量化


    晟腾910B 0.0

  • VeroFess 楼主 08-20 11:42
    5

    晟腾那我是真没见过x 跑起来的话偷偷告诉我能跑多快x

  • 夸父石 08-20 11:42
    6

    这速度的话已经达到可用级别了。3090性价比又增加了

  • 于小盼 08-20 11:46
    7

    调研了一下 8卡 分布式部署 带mtp 2000t/s


    毕竟单卡64g


    最近刚部署了dsf 所以还没实施

  • VeroFess 楼主 08-20 11:52
    8

    流下了口水, 等三年大船就可以爽玩了(?

  • 咪叭 08-20 11:53
    9

    楼主是用了nvlink吗,感觉显卡间的信息传输量比较高


    另外后端是什么,vllm吗

  • VeroFess 楼主 08-20 12:25
    11

    没 nvlink (宽度买错了插不上), 用的是魔改 bar1 p2p, 后端是魔改的 llama.cpp, 实现了 paged fa 之类的优化, 可以看




    但是 q4 有关的优化没有推送

  • 气雾剂 08-20 13:00
    12

    262k 上下文跑满速度能有多少?心动了 ^-^

* 帖子来源Linux.do
返回