dflash2牛逼,老显卡部署qwen3.8 27b做到250+tok/s

zhiqing 2026-08-20 12:03 1

a800 80g部署qwen3.8 27b int8做到了250+tok/s


跑鹈鹕骑单车120+tok/s


其他场景更是250+tok/s

最新回复 (11)
  • 不二 08-20 12:04
    1

    这玩意能用来vibe coding用吗,最近看论坛都是这个

  • zhiqing 楼主 08-20 12:05
    2

    简单任务应该还是可以的,具体没测试过,我现在主要拿来养龙虾用

  • 不二 08-20 12:06
    3

    用的什么显卡部署的啊,配置搞上去

  • Token 08-20 12:06
    4

    A800玩不起啊佬,太贵了,消费级显卡跑的有点慢

  • pan iron 08-20 12:08
    5

    10w才能跑这种, 等后面MOE模型出来看看还能不能更好. 感觉本地部署的路还任重道远啊

  • Ljj 08-20 12:27
    6

    佬龙虾现在主要用来干嘛呀请教一下

  • zhiqing 楼主 08-20 12:46
    7

    也就是聊聊天,处理一些杂事之类的

  • jess eness 08-20 13:27
    8

    佬 有具体的配置参数嘛?用的什么框架呢

  • zhiqing 楼主 08-20 14:15
    9

    用的sglang


    sglang serve \
    --model-path ./Qwen3.8-27B-INT8-GPTQ-Marlin \
    --host 0.0.0.0 \
    --port 12345 \
    --served-model-name qwen3.8-27b \
    --mem-fraction-static 0.94 \
    --mamba-ssm-dtype bfloat16 \
    --max-running-requests 12 \
    --cuda-graph-max-bs-decode 12 \
    --cuda-graph-backend-prefill disabled \
    --schedule-policy lpm \
    --context-length 262144 \
    --chunked-prefill-size 4096 \
    --enable-mixed-chunk \
    --kv-cache-dtype fp8_e5m2 \
    --attention-backend flashinfer \
    --speculative-algorithm DFLASH \
    --speculative-draft-model-path ./Qwen3.8-27B-DFlash2 \
    --speculative-num-draft-tokens 8 \
    --speculative-draft-window-size 4096 \
    --reasoning-parser qwen3 \
    --tool-call-parser qwen3_coder
  • CocoTang1024 08-24 16:13
    10

    楼主好,这个Qwen3.8-27B-INT8-GPTQ-Marlin是自己特调的吗,我在huggingface上面只找到了Chungulus/Qwen3.8-27B-GPTQ-INT8配置起来一直有问题。

  • zhiqing 楼主 08-24 16:45
    11

    Chungulus/Qwen3.8-27B-GPTQ-INT8



    试试看这个shawnw3i/Qwen3.8-27B-GPTQ-INT8-MTP

* 帖子来源Linux.do
返回