【分享】两张V100(16G)跑千问3.8-27B的最优命令

Paranoia Gu 2026-08-24 17:58 1

分享一下我的命令,也许并不是最优,但是也是我目前调到最优的状态。欢迎大家提出更好方案。


#!/bin/bash

nohup ./build/bin/llama-server \
-hf unsloth/Qwen3.8-27B-GGUF:Q4_K_M \
--parallel 1 \
--ctx-size 262144 \
--cache-type-k q4_0 \
--cache-type-v q4_0 \
--flash-attn on \
--split-mode tensor \
--spec-type draft-mtp \
--temp 1.0 \
--top-p 0.95 \
--top-k 20 \
--min-p 0.0 \
--presence_penalty 0.0 \
--repeat_penalty 1.0 \
--jinja \
--chat-template-file /mnt/data/llama.cpp/qwen3.8.jinja \
--reasoning on \
--reasoning-preserve \
-fit off \
--cache-ram 1024 \
--host 0.0.0.0 \
--port 4086 \
--n-gpu-layers 999 \
--chat-template-kwargs '{"enable_thinking":true,"reasoning_effort":"xhigh"}' \
--log-file run_Qwen3.8-27B-GGUF-Thinking.log \
> /dev/null 2>&1 &

最新回复 (6)
  • 一人一根辣条 08-24 18:00
    1楼

    效果如何啊? 多少token每秒

  • Paranoia Gu 楼主 08-24 18:18
    2楼

    差不多:60token/s

    实际还要看上下文长度。

  • w61 08-25 14:58
    3楼

    你这是怎么的两张v100啊,是pcie还是用nvlink连接的?求问,我也打算搞一个

  • Paranoia Gu 楼主 08-25 15:07
    4楼

    用V100 300G NVLink扩展底板,然后再接到2个PCIE上。所以实际上已经是PCIE了。

  • Paranoia Gu 楼主 08-25 15:08
    5楼

    补充:我劝你不要搞。很鸡肋,价格也不便宜。

  • lkainan 10-05 15:20
    6楼

    我也想搞一套,楼主的方案还在用没呢?

* 帖子来源Linux.do
返回