经过两天的尝试,4090 显卡 Qwen3.8-27B 全上下文,开视觉 115 token/s,配置分享

炫彩小鱼干 2026-08-18 00:38 1

终于把这个模型调到了满意程度:262k 上下文,开启视觉,短、中上下文文本输出约 115 tps


相较于 ds v4 flash 的 140 tps,这个稍慢但是有视觉,上下文短,但部署在自己的硬件上,完全免费


我的显卡是 4090D ,24GB显存,以下是配置分享:


模型:Qwen3.8-27B-NVFP4
框架:llama.cpp
KV Cache:Q4_0
视觉:开启,F16 mmproj
推测解码:MTP n=2 + ngram-mod
Batch:1024
Ubatch:512

更多极限测试:


254K 预填充:623.7 tps
254K 上下文时输出:30.8 tps
视觉输出:68 tps

默认思考时间确实长,但是关思考又太笨,可能是小模型的无奈之举吧,但在这个速度下,确实是相当可用的智能


有显卡的可以试试了,免费 tokens 确实爽啊

最新回复 (6)
  • sun shaoan 08-18 00:40
    1

    速度这么快?我的RTX5000,也就能跑40t/s

  • Levi 08-18 00:42
    2

    么得那么大显存,5070ti,搞不来…

  • 炫彩小鱼干 楼主 08-18 00:43
    3

    调好投机解码,选合适的模型,一点一点提升试了好久 ^-^

  • 蛋蛋 08-18 00:53
    4

    mtp这个草稿模型是你自己找的嘛?默认的那个不太行?A800的速度65tokens/s

  • 炫彩小鱼干 楼主 08-18 00:58
    5

    就是这个 Qwen3.8-27B-NVFP4-Q5K-mtp.gguf 自带的 mtp 头


    --spec-type draft-mtp,ngram-mod
    --spec-draft-n-max 2
  • leioukupo 08-18 01:07
    6

    3090加16g内存能不能抄这套配置

    速度有个二三十就行

* 帖子来源Linux.do
返回