分享一下关于部署 qwen27b 的最新成果【配置分享】

炫彩小鱼干 2026-09-07 11:50 1

qwen-3-8-27b这个模型真是特别好用啊,在这段时间用的同时,也在不断追踪社区里最新的解决方案,综合了很多讨论和方案,经过实测之后,现在的状态比之前的状态又有了明显的进化,所以开贴来记录一下。



终于把这个模型调到了满意程度:262k 上下文,开启视觉,短、中上下文文本输出最高 100 tps
相较于 ds v4 flash 的 140 tps,这个稍慢但是有视觉,上下文短,但部署在自己的硬件上,完全免费
我的显卡是 4090D ,24GB显存,以下是配置分享:
模型:Qwen3.8-27B-NVFP4
框架:llama.cpp
KV Cache:Q4_0
视觉:开启,F16 mmp…


从上文继续:


依旧4090,依旧262k全上下文,开启视觉


但现在变成了:无重复bug的去审查版本,更高精度上下文,加入了 DFlash2 投机加速,最高速度可达130tps


配置分享:


去审查、修复重复bug的主模型:




Huihui-Qwen3.8-27B-abliterated-UD-IQ4_XS.gguf(14.4 GB)


dflash2加速模型:




Qwen3.8-27B-DFlash2-Q2_K_S-MIX.gguf


视觉模型:




mmproj-F16.gguf


启动命令:


    llama-server \
-m Huihui-Qwen3.8-27B-abliterated-UD-IQ4_XS.gguf \
-md Qwen3.8-27B-DFlash2-Q2_K_S-MIX.gguf \
-mm mmproj-F16.gguf \
-ngl 99 -ngld all \
-c 262144 -b 1024 -ub 512 -np 1 \
-fa on -ctk q8_0 -ctv q4_0 \
--spec-type draft-dflash --spec-draft-n-max 5 \
--jinja --reasoning-format deepseek --reasoning-preserve \
--host 0.0.0.0 --port 8080

这里上下文设置成KQ8 VQ4非对称精度,是参考了一些q比k耐压的讨论,所以这套配置理论上可以比之前直接设成q4kv获得更高的精度。

qwen27b真的特别好用啊,平时用来写一点单网页应用,不考虑成本,就单单它的界面效果都是我最喜欢的了,推荐大家有能力的多去试试!

最新回复 (4)
  • 剑转流云 09-07 11:53
    1

    这种模型,需要什么配置,才能带的动啊

  • 匿名者 09-07 11:54
    2

    能达到100+确实是到了可用的程度了。

  • 3003n 09-07 12:02
    3

    DFlash2会不会带来降智

  • cczxl 09-08 07:44
    4

    佬单卡不会oom吗

* 帖子来源Linux.do
返回