花巨资横评:Qwen3.8-27B_四卡对比_3090-4090-5090-V100

jeffccie 2026-08-30 00:04 1

以下数据全部为真机实测



本报告完全基于以下实测报告(全部同源,模型均为 Qwen3.8-27B):



  • 3090 24G:Ollama 0.32.15 / Q4_K_M / 实测 32K-128K

  • 4090 48G:llama.cpp Ridge-3.7bpw / 实测 192K-256K + vLLM 0.19.1 FP8 / 实测 192K

  • 5090 32G:Ollama 0.32.15 / Q4_K_M / 实测 64K-256K + vLLM 0.26.1rc1 / NVFP4 / 实测 32K-192K

  • V100 32G:Ollama / Q4_K_M / 实测 192K-256K


命名说明:本报告用"RTX 5090"指代 32GB 档位的卡——nvidia-smi 原文为 NVIDIA GeForce RTX 5090 / 32607 MiB,但文件夹沿用"5070"目录名。两者指同一份硬件。


量化格式警告:四卡使用了四种不同量化格式(Q4_K_M / Ridge-3.7bpw / NVFP4 / FP8),所有跨卡对比都带此口径差异。本报告在每个对比处标注了量化信息。



速览 — 2 分钟看完



给不想看全部数据的人。



四张卡跑同一个 27B 模型,结果一句话概括:











































你的需求 选这张卡 为什么
预算有限,跑 64K 上下文 RTX 3090 24G 二手便宜,64K 跑 37 字/秒,够用
要跑 192K 长上下文 + 速度快 RTX 5090 32G 192K 还能 52 字/秒(Ollama)/ 70 字/秒(vLLM)
要跑 192K + 显存留余量 RTX 4090 48G 48G 显存只用了 49%,192K 跑 42 字/秒,还剩 25G 干别的
预算极紧 + 能接受慢一点 Tesla V100 32G 退役卡便宜,192K 跑 30 字/秒,能用但慢
追求极限速度(≤32K) RTX 5090 + vLLM + DFlash 2 32K 跑到 170 字/秒,峰值 230
要大 prompt 灌入速度快 RTX 4090 + vLLM 10 万字 10 秒吃完,其他卡要 95 秒

关键数字:






































100% GPU 极限 最佳 Decode 最佳 Prefill
3090 24G 64K 37 tok/s @64K 1100 tok/s @64K
4090 48G 192K+ 42 tok/s @192K(llama)/ 98 tok/s 短 ctx(MTP2) 15,600 tok/s(vLLM)
5090 32G 192K 52 tok/s @192K(Ollama)/ 170 tok/s @32K(vLLM DFlash) 2650 tok/s @128K(Ollama)
V100 32G 192K 30 tok/s @192K ~780 tok/s @192K(3K prompt)



0. 结论


0.1 一句话



Ollama 路线(Q4_K_M):

想跑 64K:RTX 3090 24G 性价比首选(~37 tok/s)。

想跑 192K:RTX 5090 32G 完胜(~52 tok/s,比 V100 快 1.73×)。

想跑 192K + 预算紧:V100 32G 备选(~30 tok/s,慢但能用)。


llama.cpp 路线(4090 48G):

192K 长上下文日用首选(42 tok/s 中位,79.5 分钟零崩溃,显存只吃 49%)。


vLLM 路线(4090 / 5090):

5090 + vLLM 0.26 + NVFP4:速度天花板(32K DFlash 2 跑出 170 tok/s / 峰值 230)。

4090 + vLLM 0.19.1 + FP8:prefill 之王(10.2K-15.6K tok/s),但 100K+ decode 只有 1.8-3.2 tok/s(kernel 病理)。



0.2 四卡推荐档位对照







































































框架 量化 首选档 次选档 不推荐档 100% GPU 极限
3090 24G Ollama 0.32.15 Q4_K_M 64K(~37 tok/s) 32K(~36 tok/s) 128K(~2.3 tok/s,offload) 64K
4090 48G llama.cpp Ridge-3.7bpw 192K(42 tok/s) 256K 单 slot(42 tok/s) 256K×4slot+MTP(KV 争用) 192K+
4090 48G vLLM 0.19.1 FP8 W8A8 短 ctx 双流(51 tok/s) 100K+(1.8-3.2 tok/s,病理) 192K(但长 ctx 不可用)
5090 32G Ollama 0.32.15 Q4_K_M 192K(~52 tok/s) 128K(~58 tok/s) 256K(~7 tok/s,offload) 192K
5090 32G vLLM 0.26.1rc1 NVFP4+fp8 KV 32K+DFlash 2(~170 tok/s) 128K+MTP(~120 tok/s) 192K+MTP(KV 装不下) 192K
V100 32G Ollama Q4_K_M 192K 单卡(~30 tok/s) 256K / 双卡(无加速) 192K

0.3 四卡核心指标横向对比(Ollama 路线,直接可比档位)



直接可比规则:两卡必须在同一 num_ctx 档都有完整数据。缺失格子留 “—”。

本表所有数据来自 Ollama 0.32.15(Q4_K_M),vLLM / llama.cpp 数据见第 9-10 章。









































































































































































指标 64K 128K 192K 256K
3090 24G 加载层数 66/66 54/66
4090 48G 加载层数 —(llama.cpp 数据体系不同)
5090 32G 加载层数 66/66 66/66 66/66 54/66
V100 32G 加载层数 66/66 56/66
3090 24G KV GPU (GiB) 4.0 6.5
5090 32G KV GPU (GiB) 4.0 8.0 12.0 13.0
V100 32G KV GPU (GiB) 12.0 14.3
3090 24G KV CPU (GiB) 0 1.5
5090 32G KV CPU (GiB) 0 0 0 3.0
V100 32G KV CPU (GiB) 0 2.0
3090 24G Prefill 8K (tok/s) ~1100 ~245
5090 32G Prefill 8K (tok/s) 2580 2650 2597 535
V100 32G Prefill 3K (tok/s) ~780
3090 24G Decode 中位 (tok/s) ~37 ~2.3
5090 32G Decode 中位 (tok/s) ~56 ~58 ~52 ~7
V100 32G Decode 中位 (tok/s) ~30
3090 24G MTP accept 0.71 0.75
5090 32G MTP accept 0.50 0.55 0.46 0.53
V100 32G MTP accept 0.58

0.4 跨硬件倍数关系(直接可比档位)


















































维度 档位 5090/3090 5090/V100 来源
Prefill 8K 64K 2.35× 5090: 2580 vs 3090: 1100
Prefill 8K 128K 10.8× 5090: 2650 vs 3090: 245(3090 已 offload)
Decode 中位 64K 1.51× 5090: 56 vs 3090: 37
Decode 中位 128K 25.2× 5090: 58 vs 3090: 2.3(3090 已 offload)
Decode 中位 192K 1.73× 5090: 52 vs V100: 30


128K 那行注意:3090 已 12 层 offload、5090 仍 100% GPU——倍数包含"offload vs 全 GPU"的差距,不只是硬件性能差。





TL;DR










































































































维度 3090 24G 4090 48G 5090 32G V100 32G
架构 Ampere(sm86) Ada(sm89) Blackwell(sm120) Volta(sm70)
推理引擎 Ollama 0.32.15 llama.cpp / vLLM 0.19.1 Ollama 0.32.15 / vLLM 0.26.1rc1 Ollama
量化 Q4_K_M Ridge-3.7bpw / FP8 Q4_K_M / NVFP4 Q4_K_M
加速方案 MTP(k=4) MTP(k=2/3) MTP(k=4)/ DFlash 2(k=7) MTP(k=4)
100% GPU 极限 64K 192K+ 192K 192K
Offload 触发 128K(12 层) 未触发(48G 够大) 256K(12 层) 256K(10 层)
Ollama 64K Decode ~37 tok/s ~56 tok/s
Ollama 192K Decode ~52 tok/s ~30 tok/s
llama 192K Decode 42 tok/s
vLLM 最高 Decode 51 tok/s(短 ctx 双流) 170 tok/s(32K DFlash 2)
MTP acceptance 0.71-0.75 47.7%-61.1% 0.46-0.55 0.55-0.58
显存利用率 68%(runner.vram/可用) 49%(llama)/ 94%(vLLM) 53%(runner.vram)/ 97%(nvidia-smi) 53%
性价比档 64K 192K(llama) 192K(Ollama)/ 32K(vLLM DFlash) 192K

最新回复 (8)
  • jeffccie 楼主 08-30 00:05
    1

    以上均为真机实测,用于给佬们一个参考,请注意数据真实非AI生成。

  • apparition 08-30 00:12
    2

    5090 > 4090 > V100 32G > 3090 > V100 16G

    没钱连本地小模型都玩不起 ^-^

  • jeffccie 楼主 08-30 00:15
    3

    随便一个卡大几千好几W,感觉个人还是plan适合一般使用,除非是防泄密,不然投入太多。不过有之前买过游戏卡有需要可以用起来哈哈。 ^-^

  • 我倒,原来你也网上冲浪啊? 08-30 00:29
    4

    V100 你得用 1Cat-vLLM 才是真实实力,Ollama 跑的简直没法用。

  • jeffccie 楼主 08-30 00:37
    5

    核心太老了,新模型适配困难只有OLLAMA简单点。量化也挑 ,不过佬的建议我要试试 1Cat-vLLM ^-^

  • 我倒,原来你也网上冲浪啊? 08-30 00:39
    6

    是我冲撞了!自费测试辛苦了非常感谢佬的付出

  • cohen 08-30 00:39
    7

    我最近也测了这个,不过我是用并行云的,80元买的500券

  • jeffccie 楼主 08-30 00:40
    8

    1Cat-vLLM



    我刚去看了感觉很不错呀,明天搞来试试看提升多少 ^-^

* 帖子来源Linux.do
返回