qwen-3-8-27b这个模型真是特别好用啊,在这段时间用的同时,也在不断追踪社区里最新的解决方案,综合了很多讨论和方案,经过实测之后,现在的状态比之前的状态又有了明显的进化,所以开贴来记录一下。
终于把这个模型调到了满意程度:262k 上下文,开启视觉,短、中上下文文本输出最高 100 tps
相较于 ds v4 flash 的 140 tps,这个稍慢但是有视觉,上下文短,但部署在自己的硬件上,完全免费
我的显卡是 4090D ,24GB显存,以下是配置分享:
模型:Qwen3.8-27B-NVFP4
框架:llama.cpp
KV Cache:Q4_0
视觉:开启,F16 mmp…
从上文继续:
依旧4090,依旧262k全上下文,开启视觉
但现在变成了:无重复bug的去审查版本,更高精度上下文,加入了 DFlash2 投机加速,最高速度可达130tps
配置分享:
去审查、修复重复bug的主模型:
Huihui-Qwen3.8-27B-abliterated-UD-IQ4_XS.gguf(14.4 GB)
dflash2加速模型:
Qwen3.8-27B-DFlash2-Q2_K_S-MIX.gguf
视觉模型:
mmproj-F16.gguf
启动命令:
llama-server \
-m Huihui-Qwen3.8-27B-abliterated-UD-IQ4_XS.gguf \
-md Qwen3.8-27B-DFlash2-Q2_K_S-MIX.gguf \
-mm mmproj-F16.gguf \
-ngl 99 -ngld all \
-c 262144 -b 1024 -ub 512 -np 1 \
-fa on -ctk q8_0 -ctv q4_0 \
--spec-type draft-dflash --spec-draft-n-max 5 \
--jinja --reasoning-format deepseek --reasoning-preserve \
--host 0.0.0.0 --port 8080
这里上下文设置成KQ8 VQ4非对称精度,是参考了一些q比k耐压的讨论,所以这套配置理论上可以比之前直接设成q4kv获得更高的精度。
qwen27b真的特别好用啊,平时用来写一点单网页应用,不考虑成本,就单单它的界面效果都是我最喜欢的了,推荐大家有能力的多去试试!