分享一下5090D本地部署Qwen3.8-27B几种思考模式下的鹈鹕

Gsai-1 2026-08-19 20:18 1

显卡 5090D,ninfer 部署


执行参数:

ninfer-serve ./models/qwen3_8_27b_nvfp4.ninfer --host 127.0.0.1 --port 8080 --max-context 262144 --kv-capacity auto --max-concurrency 1 --max-pending-requests 16 --pending-timeout-ms 600000 --prefill-chunk 1024 --log-stats-interval-ms 5000 --kv-dtype int8 --spec mtp --draft-tokens 3 --lm-head-draft --default-max-tokens 8192


Qwen3.8-27B默认三档思考模式:



  • low

  • medium

  • xhigh


使用Claude Code执行,提示词统一:

生成一个鹈鹕骑自行车的SVG图像


low:




✻ Churned for 15s ≈ 132 tok/s



































计费模型 输入 输出 总成本 用时/首字 状态 来源
qwen3.8-27b 24,553 1,849 未定价 0.0s 200 session_log
qwen3.8-27b 26,473 130 未定价 0.0s 200 session_log

图一乐,就算了吧


medium:



✻ Sautéed for 52s ≈ 135 tok/s



































计费模型 输入 输出 总成本 用时/首字 状态 来源
qwen3.8-27b 31,277 315 未定价 0.0s 200 session_log
qwen3.8-27b 24,527 6,679 未定价 0.0s 200 session_log

看起来居然还行,但是和xhigh一比就相形见绌了


xhigh:



✻ Cogitated for 3m 16s ≈ 137 tok/s












































计费模型 输入 输出 总成本 用时/首字 状态 来源
qwen3.8-27b 51,125 394 未定价 0.0s 200 session_log
qwen3.8-27b 50,938 147 未定价 0.0s 200 session_log
qwen3.8-27b 24,566 26,303 未定价 0.0s 200 session_log

真没想到本地模型有这个效果……

最新回复 (4)
  • fan 08-19 20:22
    1

    听说3.8 27B把DeepSeek-V4-Flash-0731干翻了

  • SuIHi 08-19 20:29
    2

    期待未来万元级自部署模型能与opus齐步

  • 长沙猪脚饭大王 08-19 20:38
    3

    这个风格太像我之前用的一家中转站的鹈鹕了。。。。无语,合理怀疑之前中转站fable惨水惨的千问

  • why 08-19 20:46
    4

    其实我缺的不是怎么部署千问啊呜呜 ^-^

* 帖子来源Linux.do
返回