单卡5090+cpu 混合推理 Qwen3.8-Flash-Next-UD-Q4_K_XL,测试8tps, 如何优化

seq001 2026-08-30 08:23 1

部署:llama.cpp

用了一个5090,内存占用74G,CPU占用1200%,


./build/bin/llama-server -m /modelscope/Qwen3.8-Flash-Next-GGUF/UD-Q4_K_XL/Qwen3.8-Flash-Next-UD-Q4_K_XL-00001-of-00004.gguf --alias Qwen3.8-Flash-Next -ngl 99 --device CUDA1 --cpu-moe --expert-hot-s 140 -c 81920 -fa on --jinja --port 8091 --host 0.0.0.0

测试

8.13 tokens每秒,跑了1个半小时。

eval time = 5475543.96 ms / 44533 tokens ( 122.96 ms per token, 8.13 tokens per second)


有没有大佬指点一下能优化的地方?服务器有4个5090,能用2个。试了2个也是一样的速度。


提示词: 创建一个HTML,内容是SVG绘制一个鹈鹕骑自行车的2D动画。



file.html.txt (49.5 KB)

最新回复 (3)
  • 落寞书生 08-30 11:17
    1

    内存带宽是多少,我两个3080魔改20gb,8通道32gb 2666mhz 内存,无上下文情况下decode速度将近30t/s

  • 落寞书生 08-30 11:26
    2

    目前随着上下文增加速度下降比较快

    启动命令

    /home/zbj/program/llama.cpp/build/bin/llama-server -m /home/zbj/llama/Qwen3.8-Flash-Next_UD_Q4_K_XL.gguf -c 211224 -ngl 99 --port 8953 --alias Qwen3.8-Flash-Next_UD_Q4_K_XL.gguf --tensor-split 24,25 --jinja --mmproj /home/zbj/llama/mmproj/mmproj-Qwen3.8-Flash-Next-BF16.gguf --threads 16 --threads-batch 16 --flash-attn on -cb -mg 0 -b 8192 -ub 4096 --temp 0.8 --top-k 40 --top-p 0.95 --min-p 0.05 --repeat-penalty 1.00 --repeat-last-n 64 --presence-penalty 0.00 --frequency-penalty 0.00 --parallel 1 --n-cpu-moe 99 --fit off --no-webui --load-mode mlock --cache-prompt --cache-ram 36841 --checkpoint-min-step 512 --ctx-checkpoints 64 --chat-template-kwargs {“enable_thinking”:true,“reasoning_effort”:“xhigh”}


  • seq001 楼主 08-30 15:21
    3

    服务器是8通道32G DDR5 Speed: 5600 MT/s

* 帖子来源Linux.do
返回