Qwen3.8-27B部署讨论

llliiilll 2026-08-19 00:09 1

目前在A100上部署的bf16的qwen3.8-27b,多模态效果比较惊艳,coding感觉没有aa给的52分那么高,但速度实在是太慢了,才70+/s,用sglang部署的(vllm缓存命中有坑)。


问题:

1、因为机器比较老所以没按照官方推荐配置mamba之类的,有效果影响吗?

2、看到有些版本有dspark,不知道大佬们有无测试效果?速度提升多少?效果降低多少?


期待同部署了未量化的Qwen3.8-27B的朋友一起讨论。

最新回复 (1)
  • NSA 08-19 00:43
    1

    我这边也跑了一下,测试环境单卡RTX PRO 6000 Blackwell 96G,WSL里跑的SGLang 0.5.17,模型BF16原权重,大概的参数如下:

    context_length=262144

    mem_fraction_static=0.90

    kv_cache_dtype=fp8_e4m3

    chunked_prefill_size=2048

    max_prefill_tokens=32768

    attention_backend=flashinfer

    mamba_radix_cache_strategy=extra_buffer

    mamba_ssm_dtype=float32

    max_running_requests=3

    max_total_tokens=786432


    不开MTP的benchmark大概是31 token/s左右 ^-^;开自带MTP后几组结果:

    off:median decode 31.14 token/s,端到端约 28.29 token/s

    mtp steps=3 draft=2:median decode 57.45 token/s,端到端约 43.16 token/s

    mtp steps=3 draft=4:median decode 57.10 token/s,端到端约 42.70 token/s

    mtp steps=3 draft=6:median decode 55.30 token/s,端到端约 44.16 token/s

    mtp steps=3 draft=8:median decode 50.30 token/s,端到端约 43.45 token/s


    以我这里最佳是draft_tokens=2,accept rate大概0.52左右,accept len大概 2.57。MTP有效但也没有跑到网上有些表格里90+/s那种水平 ^-^,估计和后端、测试workload、prompt长度、SGLang参数、是否用了专门优化分支都有关系。DSpark暂时还没测~因为需要额外的drafter checkpoint会吃掉一些显存,而生产环境只有可怜的A6000 48G x 2,没啥意义~

* 帖子来源Linux.do
返回