目前在A100上部署的bf16的qwen3.8-27b,多模态效果比较惊艳,coding感觉没有aa给的52分那么高,但速度实在是太慢了,才70+/s,用sglang部署的(vllm缓存命中有坑)。
问题: 1、因为机器比较老所以没按照官方推荐配置mamba之类的,有效果影响吗? 2、看到有些版本有dspark,不知道大佬们有无测试效果?速度提升多少?效果降低多少?
期待同部署了未量化的Qwen3.8-27B的朋友一起讨论。
我这边也跑了一下,测试环境单卡RTX PRO 6000 Blackwell 96G,WSL里跑的SGLang 0.5.17,模型BF16原权重,大概的参数如下: context_length=262144 mem_fraction_static=0.90 kv_cache_dtype=fp8_e4m3 chunked_prefill_size=2048 max_prefill_tokens=32768 attention_backend=flashinfer mamba_radix_cache_strategy=extra_buffer mamba_ssm_dtype=float32 max_running_requests=3 max_total_tokens=786432
不开MTP的benchmark大概是31 token/s左右 ^-^;开自带MTP后几组结果: off:median decode 31.14 token/s,端到端约 28.29 token/s mtp steps=3 draft=2:median decode 57.45 token/s,端到端约 43.16 token/s mtp steps=3 draft=4:median decode 57.10 token/s,端到端约 42.70 token/s mtp steps=3 draft=6:median decode 55.30 token/s,端到端约 44.16 token/s mtp steps=3 draft=8:median decode 50.30 token/s,端到端约 43.45 token/s
以我这里最佳是draft_tokens=2,accept rate大概0.52左右,accept len大概 2.57。MTP有效但也没有跑到网上有些表格里90+/s那种水平 ^-^,估计和后端、测试workload、prompt长度、SGLang参数、是否用了专门优化分支都有关系。DSpark暂时还没测~因为需要额外的drafter checkpoint会吃掉一些显存,而生产环境只有可怜的A6000 48G x 2,没啥意义~