求大佬们教一下本地部署优化

Love_Runs_Out 2026-09-17 00:05 1

小白自己搭着玩的

推理速度稳定在 ~28.45 tokens/s

设备:双路 NVIDIA RTX 5880 Ada Generation 单卡 48GB显存,拿pcie连一起的


模型:Qwen/Qwen3.8-27B (270亿参数,原生 BF16 精度完整加载,权重占用约 51GB)


直接从hf拉下来的官方原生,有没有什么好建议,感觉输出的好慢,想要快一点


是换轻量化一点的模型,还是有什么加速推理的技巧,能否请大佬指点一二,可以直接甩我链接我自己学,不胜感激

最新回复 (5)
  • 神仙哥哥 09-17 00:07
    1

    这些事情,你找AI不是更方便?让AI给你出文档不是更好学?

  • Love_Runs_Out 楼主 09-17 00:12
    2

    基础太差了,ai给出的建议是再搞个更小的模型来先做,叫什么投机解码(Speculative Decoding,不是很懂,所以想来请教请教

  • Einzieg 09-17 00:20
    3

    输出慢可以加 DFlash2 推理解码

  • 咪叭 09-17 00:22
    4

    **Qwen3.8-27B**有MTP可以开一下看看,另外也可以试试换成Qwen 3.8 Flash Next模型,激活量少


    应该快不少

  • Null_ptr 09-17 00:50
    5

    上面说qwen 3.8 flash next的认真的吗?ngram开offload后权重都放不下,sm_89的卡走PCIE直接考虑Qwen/Qwen3.8-27B-FP8,根据Model_Card可以算出256K大概单卡分摊4GB,所以最高试下同时处理8并发,再随机解码应该效果还可以,参数参照vllm recipes如下:


    export VLLM_USE_RUST_FRONTEND=1

    vllm serve Qwen/Qwen3.8-27B-FP8 \
    --tensor-parallel-size 2 \
    --max-model-len 262144 \
    --kv-cache-dtype fp8 \
    --gpu-memory-utilization 0.95 \
    --max-num-seqs 8 \
    --max-num-batched-tokens 8192 \
    --reasoning-parser qwen3 \
    --enable-auto-tool-choice \
    --tool-call-parser qwen3_xml

    后续再根据vllm_bench调优吧

* 帖子来源Linux.do
返回