Qwen3.8-27B BF16 / FP8 / NVFP4 实测

Einzieg 2026-08-28 08:07 1

本次测试对象为 Qwen3.8-27B 的 BF16、官方 FP8 和社区 NVFP4 。除权重精度外,SGLang、上下文、KV Cache、DFlash2、采样参数和题目都保持一致。


测试对象




























精度 模型 来源
BF16 Qwen/Qwen3.8-27B Qwen 官方 BF16 权重
FP8 Qwen/Qwen3.8-27B-FP8 Qwen 官方 block FP8,block size 128
NVFP4 RadixArk/Qwen3.8-27B-NVFP4 社区 NVIDIA Model Optimizer 混合精度权重

测试环境












































项目 配置
GPU NVIDIA RTX PRO 6000 Blackwell Workstation Edition,96GB
Docker Engine 29.2.1
SGLang 0.0.0.dev1+g5f55db35e
镜像 lmsysorg/sglang:dev-qwen38-27b-dflash2
KV Cache FP8 E4M3,256K
Mamba cache extra_buffer_lazy,8 slots,SSM float32
推测解码 DFlash2,incoai/Qwen3.8-27B-DFlash2,8 draft tokens
Attention FlashInfer;chunked prefill 2048

测试题目



  1. GSM8K 前 100 题:zero-shot、temperature 0、开启 thinking、最大输出 1024 tokens。

  2. GPQA 前 30 题:zero-shot、temperature 0、开启 thinking、最大输出 2048 tokens。

  3. 18 道诊断题:糖果组合、球拍球、机器零件、睡莲翻倍、Wason 卡片、骑士与说谎者、Monty Hall、条件概率、涂色立方体、方向旋转、Python 闭包/生成器、指令注入和严格 JSON 等。答案用 exact/regex 自动判定,temperature 0,最大输出 2048 tokens。

  4. 鹈鹕 SVG:提示词固定为 Generate an SVG of a pelican riding a bicycle.


测试得分




































精度 GSM8K GPQA 诊断题 鹈鹕 SVG
BF16 91/100 8/30 17/18(94.4%) 7/10
FP8 93/100 8/30 16/18(88.9%) 6/10
NVFP4 90/100 7/30 15/18(83.3%) 4/10

速度、首字、性能占用


固定任务:10 个随机请求,每个输入 1024 tokens、输出 512 tokens,temperature 0、关闭 thinking、并发 1。












































精度 吞吐 平均 TTFT 平均 TPOT 平均 ITL 服务显存 模型占用空间
BF16 57.58 tok/s 249.41ms 16.91ms 17.54ms 83.13GiB 63.663GiB
FP8 80.30 tok/s 148.95ms 12.18ms 13.24ms 60.34GiB 29.779GiB
NVFP4 112.93 tok/s 114.39ms 8.65ms 9.49ms 52.04GiB 20.438GiB

完整记录文件


qwen38-precision-benchmark.zip (579.5 KB)

最新回复 (4)
  • 海绵宝宝 08-28 08:26
    1

    我用T20 46G部署了qwen3.8 27B 8bit,速度只有50-60 token/s,这个模型思考太长,不适合干需要等待的活,可以挂后台跑定时任务

  • HeriX 08-28 08:49
    2

    所有参数相对小的模型都需要靠长思维链来保证智商

    很多东西只能靠推理出来, 不像大模型直接知识库里就有现成的

  • Haesome 08-28 10:51
    3

    想问下佬,qwen3.8 27b支持的cuda版本最低是多少?

  • Einzieg 楼主 08-28 18:29
    4

    qwen3.8 27b本身没有cuda版本下限限制。但是sglang需要cuda12.8及以上。

* 帖子来源Linux.do
返回