有佬有4080s 32G魔改版本,能试试qwen3.8 27B部署效果咋样的么?

429_TooManyRequests 2026-08-26 11:13 1

每个会话单路 256K(262,144 Tokens)极限上下文运行 Qwen3.8-27B Q4_K_M + TurboQuant3
















































并发路数 总管理上下文 Token 数 总显存占用量 显存水位与状态 单用户吐字速度 (tok/s) 多路聚合总吞吐 (tok/s)
并发 2 路 52.4 万 Tokens 22.8 GB 71%(极度安全) 55 ~ 60 110 ~ 120
并发 4 路 104.8 万 Tokens 27.5 GB 86%(生产推荐黄金档) 45 ~ 50 180 ~ 200
并发 5 路 131.0 万 Tokens 29.8 GB 93%(稳定上限档) 40 ~ 45 200 ~ 220
并发 6 路 157.2 万 Tokens 32.1 GB 98%(物理硬极限) 35 ~ 38 210 ~ 230

帮忙看下上面这个数据靠谱不?

现在我是5060ti 16G,只能并发1 不开多模态上下文160k 能跑35~40 tok/s

大显存的就 4080s 还便宜点,有点想冲了 ^-^

最新回复 (7)
  • 阿皮 08-26 11:22
    1

    我有4080s。。。想改又怕坏!好鸡儿纠结哦

  • admini 08-26 11:23
    2

    Q4, 你用 16G 肯定不够。单卡怎么多路聚合,这个指标哪里来的。

  • 凌风神舞 08-26 11:38
    3

    个人用划不来, 电费+设备折旧+升级设备, 这个花费不太美丽, 算下来, 不如买token.

  • 429_TooManyRequests 楼主 08-26 11:43
    4

    RTX 5060 Ti 16G UD-Q3_K_XL (12.2G) 448 GB/s 单并发 1 34 ~ 46 tok/s 5060ti 数据是我实测出来的 Q3量化版本 忘记写了


    4080s 32G的数据是ai算出来的,所以没有实测

  • admini 08-26 11:47
    5

    原来是 Q3 ,那差不多。 32G 上面写的是 Q4 在量化小的情况下但是大显存,所以单用户吐字速度比你那个快一点狠正常。

  • jeffccie 08-26 12:11
    6

    32G 我试过只能 192K最多了。这数据哪来的

  • jeffccie 08-26 12:16
    7



    这是OLLAMA的VLLM的NVFP4 测完还没上传

* 帖子来源Linux.do
返回