云端部署Qwen-3.8-27b 记录

熊大快跑 2026-09-18 23:11 1

配置:

单卡RTX5880 48G显存 32核心 64G内存 (实际就GPU在干活,cpu单核90+,剩下31个核心动都不动)

lallm+投机加速

精度:K16 V16

参考文章: 分享一下关于部署 qwen27b 的最新成果【配置分享】


使用效果(双人使用稳定75+tps):



单人使用稳定110tps



当然这里也准备了一份搭建文档,供大家学习(文档是ai生成的哈,但是思路是一步一步试错出来的)


部署教程总结


有什么不对的地方欢迎指正


当然鹈鹕测试少不了:

最新回复 (3)
  • 你有魔力嘛 09-18 23:27
    2

    感谢佬的教程,现在想自建的心已经达到顶峰

  • yuuc 09-18 23:29
    3

    大佬是怎么做到这么快的阿,我用两台l20,使用vllm部署fp8版本,单流decode只有五六十,四并发,每个请求就只有二三十token/s了

  • 熊大快跑 楼主 09-18 23:42
    4

    多检查一下思考跟投机加速和精度,多尝试,让ai给你多写几个测试用例

* 帖子来源Linux.do
返回