5070 45tps本地跑180B Qwen3.8 q3!?

W1nge 2026-09-26 19:37 1

如题


Reddit 老哥给 Qwen3.8 flash next 开发了一个专用推理引擎 Strata


在同样的 5070 12G + 64G 5600内存 + 六核 7600 CPU 配置下能够跑到

Q2_0 → 65.1 tps decode + 543 tps prefill

IQ2_XS → 52.0 tps decode + 472 tps prefill

IQ3_XXS → 44.8 tps decode + 414 tps prefill


与此同时 llama.cpp 的decode只有15tps



另附上原帖链接:https://www.reddit.com/r/LocalLLaMA/comments/1wp7zyb/qwen38flashnext_on_12gb_vram_65_tokens_per_second/

老哥Twitter:Niko Veit (@coldniko) / X

Github项目仓库:GitHub - Niko1221/Strata: Qwen3.8-Flash-Next (125B MoE) on a 12-24 GB NVIDIA GPU + 64 GB RAM: one-click install for Windows / Linux. Strata inference engine, OpenAI/Anthropic API on localhost, optional image input. · GitHub

最新回复 (2)
  • sg8011 09-29 23:35
    1楼

    我今天也装了,我的平台是4060ti 16g+96G ddr4 3200+12700k

    糖果题思考10分钟,竟然答对了



  • W1nge 楼主 09-29 23:37
    2楼

    nb啊佬 这个是什么量化的?

* 帖子来源Linux.do
返回