没有nvlink的显卡性能部署大模型差别能有多大

无奇 2026-08-24 14:54 1

小弟新入职一家中小型公司,最近公司想搞一台13-15W左右的服务器跑qwen3.8 27b模型.负责人之前没搞过本地部署,我之前的公司搞过很多本地部署的工作,我也有所了解,但是基本都不是用的cuda

我寻思能整两张4090或者一张a6000用vllm跑fp8或者Q4 Q5量化

4090没有nvlink,不知道瓶颈会不会在pcie4.0上

不然就一张5090跑个Q4量化,那emmbeding就得扔cpu去跑了


佬友们给点建议,没有nvlink,使用tp模式两张卡之间通信会影响很大么


还有个同事给了个建议用华为Atlas卡有48g跑vllm-ascend跑模型,但是从我以前的经验来看,怀疑性能会比cuda同性能的卡差不少

最新回复 (18)
  • happy_lemon 08-24 15:07
    1

    目前有一台8卡PCIE的4090,做了些测试最后是4卡跑两组FP8的256K上下文,加反代做负载均衡。4卡跑FP8基本单路45token/s 没法开MTP,开了反而因为带宽不够而掉速…PCIE瓶颈太大了

  • 咪叭 08-24 15:11
    2

    买AMD的MI 计算卡来跑怎么样


    或者3090有Nvlink?

  • ClaudeCode 08-24 15:14
    3

    双4090 48gb,上周强开p2p成功了,测试下来,除了prefill速度提升了30%左右外(3000token/s到4000token/s左右),其他的提升感觉不是很明显,mtp开启了的情况下,有没有p2p都是69-130 token/s左右的输出解码速度。nvlink没这个条件就不清楚了^-^

  • 无奇 楼主 08-24 15:16
    4

    你是4卡跑一个实例只有45tokens/s?

    比我想象中慢不少

    我之前算下来 fp8+256k的kv应该只要30+的显存,为啥不直接两卡一个实例呢哥

  • 无奇 楼主 08-24 15:17
    5

    3090的问题跟a6000一样的 不支持fp8,老黄刀的真是狠狠的

    A卡没用过,以前老东家用海光的,我跑过的dcu对比性能宣传同级别的核心情况下,计算性能比cuda低不少 ^-^

  • zhcsxd 08-24 15:24
    6

    atlas卡你得看想买的卡支不支持跑fp8的,性能差是肯定的,如果能用n卡,个人建议还是上n卡

  • 无奇 楼主 08-24 15:30
    7

    佬友 fp8么?首字大概多长时间

    多并发情况下输出速度有比较大的变化么

  • ClaudeCode 08-24 15:33
    8

    是的,fp8量化。首字和有没有命中cache有关,命中了那基本上秒出(感知不到明显延迟)。没命中的话,那就是和prefill速度有关,prefill不知道为什么会越来越慢,例如10w的输入token,最开始会有4000token/s左右,满满的就只有3000token/s左右了,平均下来按3200 token/s算吧,用你的输入token除以prefill速度再加个0.5s左右就是首字速度了。


    然后有个坑,就是vllm不知道是有bug还是我没配置好,vllm速度奇慢,开了mtp都只有30多token/s,建议直接上sglang,不开mtp差不多就45token/s左右,开了mtp,接受率高的话有峰值我测试下来有130token/s左右

  • happy_lemon 08-24 15:40
    9

    尝试过 一直爆显存,是我姿势不对吗

  • 宫廷玉液酒 08-24 15:43
    10

    佬,我们也在纠结类似的采购方案,2张PRO 6000 MAX Q 96G 和 4张A6000 48G(NVLINK) 建议怎么选?

  • 丸子 08-24 15:43
    11

    (帖子已被作者删除)

  • 无奇 楼主 08-24 15:45
    12

    能有100左右那我觉得确实可用了

  • 无奇 楼主 08-24 15:46
    13

    ^-^没打过这么富裕的仗,但是从我的角度来看 肯定是前者,后者不支持FP8

  • ClaudeCode 08-24 15:48
    14

    我觉得可以先4090用着了,现在基本上nvlink的卡好像都不便宜,我们公司主要是部分同事需要政策库搜索,和自动出初版可研报告,所以4卡就完全够了,之前是拿2卡来测试模型。真到要到那种大并发+对性能要求高的情况下,再换专业卡^-^觉得4090 48gb魔改怕不稳定就上5090,就是显存没那么大不够香了^-^

  • 无奇 楼主 08-24 15:55
    15

    确实 主要48g魔改对公不好搞报销.领导那边肯定直接挡下来的

    我看你们的体验 我也倾向于5090方案了

    越看越理解老黄这刀法的精准 ^-^

  • ClaudeCode 08-24 15:56
    16

    其实还好,正规商家都是能开正规专票报销的哈哈哈,我们的需求时显存大于速度,就看怎么权衡了

  • happy_lemon 08-24 18:08
    17

    哥 有没有用过RadixArk/Qwen3.8-27B-DSpark · Hugging Face 这个DSpark试试还能提高不?

  • ClaudeCode 08-24 18:24
    18

    dsaprk就没测试过了,主要是mtp性能已经足够了

* 帖子来源Linux.do
返回