【本地部署】单卡5070ti实测 160K上下文prefill 1000t/s decode100t/s,qwen3.8 27b gsq-rco+ninfer 16g版推理引擎

Ruby 2026-10-03 14:27 1

目前是用的github上50系 16g版本的源码编译,若有需要的可以自行问agent很快就能找到。

显卡还承担视频输出职责,实际可用显存空间约14.8G

下一步准备在这版开源代码基础上融入kvarn量化技术,视觉编码器内存侧推理。

WSL2+UBuntu2404环境下,开启MTP3,启用带上下文扰动的needle recall测试,单论

得到下表:



172K后开mtp接近显存极限,不开MTPdecode约55

最新回复 (2)
  • Fashion 10-03 15:16
    2楼

    我也部署了这个,快是真快,但是感觉智力水平有点低,鹈鹕测试简直没法看^-^,感觉不如strata部署3.8 flash next

  • Xxll88 10-03 15:54
    3楼

    感兴趣,做个记号

* 帖子来源Linux.do
返回