想部署qwen3.8 27b,大佬们推荐个版本,dell7920工作站,RTX3090 24G,内存128

wind 2026-08-29 23:53 1

手头有dell7920工作站,RTX3090 24G,内存128,看主板还能插一个3090 供电口差一组8pin,电脑城说可以按个转接。电源是1400W,2种情况,都能部署哪个版本的qwen3.8 27b,自用用slgon,还是llama.cpp ,新手小白,请大佬们赐教

最新回复 (11)
  • laodo 08-30 00:00
    1

    llama.cpp 用来做基准测试就行;比如:


    llama-bench -m ./Qwen3.8-27B-Uncensored-Q4_K_M.gguf -p 512 -n 128 -t 8 -ngl 99


    使用可以用ollama或者lm studio, anythingllm 等,有很多这种工具


    这个配置流畅的跑Q4够了

  • Jason Smith 08-30 00:03
    2

    我Ubuntu 用 amd 7900xt 跑这个4bit的模型,输出45-50t/s,感觉相当惊艳,就是上下文,最多32k,只有20g显存,要是上下文能有256k就相当不错了

  • wind 楼主 08-30 00:07
    3

    是单卡吗, 用ollama下载其官网的qwn3.8不知道是不是27b,笔记本8G的也能下载而且一样流畅,感觉不像呀

  • blaumeer 08-30 00:07
    4

    正好有和你差不多的配置,折腾过一阵


    建议双卡,单24G显存上下文太捉襟见肘了


    要发挥qwen3.8 27b的推理优势(同时也是缺点,思考太占输出token),至少要128K上下文朝上


    单卡可以llama.cpp用unsloth的UDQ4KM量化,128K上下文问题不大,MTP有原生的


    双卡SGlang上AWQ-Marlin的W4A16 INT4量化,开满256K上下文


    或者直接让AI Agent帮你配置就行了

  • wind 楼主 08-30 00:07
    5

    重装系统ubuntu吗还是wsl,我现在是windows

  • wind 楼主 08-30 00:09
    6

    佬哥太及时了,后者更强吗。。。值得折腾下是吗

  • wind 楼主 08-30 00:12
    7

    NAME ID SIZE MODIFIED

    qwen3.8:latest 22130167c4c2 17 GB 11 days ago

    笔记本5060la 8G运行这个模型也很快,不知道这是啥版本,用工作站下载是不是一样的模型

  • blaumeer 08-30 00:14
    8

    ^-^取决于你是玩玩还是生产用了


    我是内网coding用,Agent方面我让codex帮我魔改了DSH(屏蔽掉联网插件,精简系统提示词和tool schema)


    还是非常不错的

  • wind 楼主 08-30 00:22
    9

    我是想vibe coding或办公用,不知道部署的模型能力是否差太多

  • blaumeer 08-30 00:24
    10

    ^-^还是不错的


    我体感跟反重力的opus4.6相差无几


    思考和说话风格也很接近,不过毕竟小模型,智力上差一点


    不过常规任务多做1-2轮也基本都能搞定

  • laodo 08-30 00:28
    11

    可以到huggingface去下载

* 帖子来源Linux.do
返回