多台8卡A40本地化部署模型求助

Axon 2026-06-16 09:59 1

各位大佬好,最近实验室准备部署开源大模型,目前手头可调配的硬件资源如下:


GPU:1 到 2 台 8卡 A40(单卡 48G 显存,单台总计 384G,两台总计 768G)。

CPU 内存:每台服务器自带 1T 内存。

网络环境:实验室局域网,两台都是物理机。


想问下这个推荐本地化部署哪个大模型,最好是1台可部署的,INT4量化版本的就行。之前部署的minimax-M2.7,最近感觉有点拉

最新回复 (4)
  • 陆水银 06-16 10:13
    1

    真有钱,我都是,3太机器分布式,切割,跑一个模型,我跑的是千问,感觉还行,其实2台组起来跑个ds,也不错的

  • Axon 楼主 06-16 10:30
    2

    两台组起来感觉ds也不够呀,ds不是1.6T显存的吗?

  • 我心永恒 06-16 10:31
    3

    int4 太差劲,起码得 fp8

  • 十万大山的山大王 06-16 10:32
    4

    如果能把所有 GPU 合并到一起,能跑 GLM-5.1-754B-A45B Q6 量化版,完全不降智,还能留出足够的 kv-cache 空间

* 帖子来源Linux.do
返回