佬们,求指导如何使用华为 910B 显卡部署千问小模型

bzwf 2026-06-22 20:40 1

佬们,为啥我用 8 卡的 910b 服务器部署千问 32 模型,api回复的特别慢,大概每秒两三个字左右。


我是通过docker 部署的vl lm 加载的模型参数,使用命令查看八张卡的显存占用率都在 90% 以上,是vllm 的启动参数哪里设置的不对吗?


参数大概是这样的


vllm serve /root/.cache/models/Qwen3.5-35B-A3B/

–served-model-name “qwen3.5-35B”

–host 0.0.0.0

–port 8010

–tensor-parallel-size 8

–data-parallel-size 1

–max-model-len 16384

–max-num-batched-tokens 16384

–max-num-seqs 128

–gpu-memory-utilization 0.94

–trust-remote-code

–async-scheduling

–allowed-local-media-path /

–mm-processor-cache-gb 0

–enforce-eager

–log-level warning

最新回复 (9)
  • 睡小觉 06-22 20:43
    1

    ?不至于这么慢吧,我用2张910B跑qwen3.5的35b模型感觉速度还行,应该是启动参数的问题

  • ba lao 06-22 20:47
    2

    参数给出来给佬友们看看,不然都是盲人摸象

  • bzwf 楼主 06-22 20:48
    3

    搞了一天,到最后也没搞定。佬你用的也是vllm 部署的吗,我现在都怀疑是vllm 的问题了

  • bzwf 楼主 06-22 20:56
    4

    参数是这样的


    vllm serve /root/.cache/models/Qwen3.5-35B-A3B/

    –served-model-name “qwen3.5-35B”

    –host 0.0.0.0

    –port 8010

    –tensor-parallel-size 8

    –data-parallel-size 1

    –max-model-len 16384

    –max-num-batched-tokens 16384

    –max-num-seqs 128

    –gpu-memory-utilization 0.94

    –trust-remote-code

    –async-scheduling

    –allowed-local-media-path /

    –mm-processor-cache-gb 0

    –enforce-eager

    –log-level warning

  • ba lao 06-22 22:12
    5

    好像是



    –gpu-memory-utilization 0.94



    这个的问题,这个显存优化问题很大。要么删了要么改成0.8

  • Cian 06-22 22:40
    6

    华子的模型启动比较玄学,佬友可以试下我的启动配置,还有如果上下文长度开的不是很长的话不建议8卡一个实例,之前在vllm-ascend:v0.10.2上进行测试8卡1实例的吞吐不如2卡4实例

    vllm serve /data/Qwen3.5-35B-A3B-W8A8

    –served-model-name “qwen3.5-35b-a3b”

    –host 0.0.0.0

    –port 8000

    –tensor-parallel-size 2

    –max-model-len 36864

    –gpu-memory-utilization 0.94

    –compilation-config ‘{ “cudagraph_mode”:“FULL_DECODE_ONLY”}’

    –trust-remote-code

    –enable-auto-tool-choice

    –tool-call-parser qwen3_coder

    –async-scheduling

    –allowed-local-media-path /

    –quantization ascend

    –mm-processor-cache-gb 0

    –additional-config ‘{“enable_cpu_binding”:true, “multistream_overlap_shared_expert”: true}’

  • BoT_eng 06-23 09:09
    7

    佬,你要不看看你的GPU有没有启动,按道理是不会这么慢的,会不会是cpu在跑

  • bzwf 楼主 06-23 09:14
    8

    这个参数是豆包叫我设置的,我也不知道干啥用的 ^-^ ,下次去掉再试试

  • ba lao 06-23 09:16
    9

    不要用豆包,你用美国豆包gemini都比用豆包好

* 帖子来源Linux.do
返回