有没有佬使用过llama.cpp在内存大显存小的机子上部署上了较大参数的模型?

nakanojinharuka 2026-08-04 22:28 1

如题,实际测试测下来之后我们有一台4090(24G)和128G内存的机子能够部署deepseek v4 flash的Q4量化,然后像Qwen等这些都能本地部署(也是Q4量化甚至是Q8),就是可能要分配下显存。


我这里做研究够用了,但还需要问下佬友,怎么尽可能吃完这些资源?

最新回复 (3)
  • W1nge 08-04 22:32
    1

    llama.cpp有一个number of layers for which to force moe whights onto cpu的参数,调整这个可以让内存密集的moe层加载在cpu上,而计算密集的attention跑在显卡,佬可以试试这个。

  • nakanojinharuka 楼主 08-04 22:59
    2

    --n-cpu-moe这个参数我看了下几篇文章,看起来是要做实验确定最佳配置?

  • cocodina 08-04 23:06
    3

    我们有一个3080 10G和128G内存的服务器llama.cpp部署了qwen3-coder,输出挺快,但是智商堪忧,上下文也不太行

* 帖子来源Linux.do
返回