Qwen3.8-flash-next 成功本地部署4bit量化!仅单卡RTX3090 24G,128K上下文,27t/s,无MTP

996 2026-08-27 14:12 1


我的配置:RTX3090 24G +DDR5 32G + 2T固态硬盘


使用的模型: Qwen3.8-Flash-Next-AD-3.84bpw-IQ4_XS-M64


这个模型有很大一部分占空间的是 n-gram 表。


我用24G显存+32G内存放下了 45.8G,其他的39.1GB都放在了SSD里,上下文128K,


目前还没有MTP支持,速度在27t/s。





我现在更期待社区MTP草稿模型的更新,以及破限的4bit模型!


启动参数:


   ~/llama.cpp/build/bin/llama-server \
-m /root/models/AtomicChat/Qwen3.8-Flash-Next-AD-3.84bpw-IQ4_XS-M64-00001-of-00028.gguf \
-ngl 99 -ncmoe 32 -c 128000 -np 1 -b 1024 -ub 256 \
--jinja -fit off \
--host 0.0.0.0 --port 49444
最新回复 (2)
  • 996 楼主 08-27 14:20
    1

    感觉受限传输带宽的瓶颈了,我的GPU只运行了40%的算力


  • astrostar 08-27 15:40
    2

    ngram参数好像对带宽没有那么高要求,应该是可以稳定放内存里的

    看以后的模型参数会怎么分配吧,如果主要在ngram上的话显存压力应该会小很多?

* 帖子来源Linux.do
返回