Qwen3.8-27B-FP8 部署兼容性问题咨询

arthas 2026-08-21 11:49 1

前提

目前有一台机器,里面有4张L20的卡,其中有三张已经有其他用途不能动,驱动无法升级,现在想剩下其中的一个卡来试试部署 Qwen3.8-27B-FP8,部署步骤参考:



目前遇到的问题

我的驱动是 Driver Version: 535.216.03 CUDA Version: 12.2


目标模型需要 vllm >= 0.17.0,而该版本的 vLLM 官方预编译包依赖 CUDA 12.9CUDA 13.0 的 PyTorch 环境,与现有的 CUDA 12.2 环境不兼容 。


由于不能升级驱动,咨询一下各位大佬有什么解决思路或者其他部署的方式吗


报错日志


(vllm_fix1) [root@gpu-l20-10 ~]# CUDA_VISIBLE_DEVICES=1 vllm serve /data/model/qwen/Qwen--Qwen3.8-27B-FP8/snapshots/master \
--served-model-name Qwen3.8-27B-FP8 \
--tensor-parallel-size 1 \
--max-model-len 65314 \
--kv-cache-dtype fp8 \
--reasoning-parser qwen3 \
--port 8088
Traceback (most recent call last):
File "/root/miniconda3/envs/vllm_fix1/bin/vllm", line 4, in <module>
from vllm.entrypoints.cli.main import main
File "/root/miniconda3/envs/vllm_fix1/lib/python3.11/site-packages/vllm/__init__.py", line 14, in <module>
import vllm.env_override # noqa: F401
^^^^^^^^^^^^^^^^^^^^^^^^
File "/root/miniconda3/envs/vllm_fix1/lib/python3.11/site-packages/vllm/env_override.py", line 90, in <module>
from vllm.utils.torch_utils import is_torch_equal, is_torch_equal_or_newer
File "/root/miniconda3/envs/vllm_fix1/lib/python3.11/site-packages/vllm/utils/torch_utils.py", line 72, in <module>
PIN_MEMORY = is_pin_memory_available()
^^^^^^^^^^^^^^^^^^^^^^^^^
File "/root/miniconda3/envs/vllm_fix1/lib/python3.11/site-packages/vllm/utils/platform_utils.py", line 45, in is_pin_memory_available
from vllm.platforms import current_platform
File "/root/miniconda3/envs/vllm_fix1/lib/python3.11/site-packages/vllm/platforms/__init__.py", line 277, in __getattr__
_current_platform = resolve_obj_by_qualname(platform_cls_qualname)()
^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
File "/root/miniconda3/envs/vllm_fix1/lib/python3.11/site-packages/vllm/utils/import_utils.py", line 109, in resolve_obj_by_qualname
module = importlib.import_module(module_name)
^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
File "/root/miniconda3/envs/vllm_fix1/lib/python3.11/importlib/__init__.py", line 126, in import_module
return _bootstrap._gcd_import(name[level:], package, level)
^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
File "/root/miniconda3/envs/vllm_fix1/lib/python3.11/site-packages/vllm/platforms/cuda.py", line 23, in <module>
import vllm._C_stable_libtorch # noqa
^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
ImportError: libcudart.so.13: cannot open shared object file: No such file or directory
最新回复 (12)
  • acai 08-21 11:57
    1

    能用cuda12.2重编译vllm及其依赖吗,或者转llama.cpp跑gguf

  • arthas 楼主 08-21 12:04
    2

    感谢提供思路,两个方式我都去尝试试试。

  • acai 08-21 12:06
    3

    GitHub - fengwm64/vllm-cuda126-builder: Auto-build vLLM Docker image with CUDA 12.6 via GitHub Actions · GitHub 有支持低版本cuda的构建项目,可以试试能否降到12.2

  • flymyd 08-21 12:11
    4

    1、你可以尝试安装CUDA12.9,官方文档里说了:



    一个机器里是可以存在多个CUDA的。如果你怕捅出篓子,那就拖docker。


    2、如果真的不行,那就只有挂好代理,然后拖VLLM源码进行编译试试:

  • asxix 08-21 12:12
    5

    可以升级驱动吧,

    nvidia-smi显示的是当前已安装的 NVIDIA 显卡驱动所能支持的最高 CUDA 运行版本,而不是系统当前安装的 CUDA 开发工具包(CUDA Toolkit)版本。

  • zhiqing 08-21 12:14
    6

    换sglang吧,sglang现在支持dflash2比vllm好

  • arthas 楼主 08-21 12:27
    7

    1.我搜了一下,需要把显卡驱动升级到580,才有可能够装两个。

    2.第二种就只能是最后的尝试。

  • Light 08-21 12:31
    8

    实在不行开iommu,pcie passthrough,把第四张卡给到虚拟机里,虚拟机装新版驱动。

  • JeremyGE 08-21 12:35
    9

    当然是一张机器上装两个cuda啦,只有指明你12.9的环境变量才能用你12.9的。另外,vllm最好还是用镜像启动容器服务

  • 董炸淘 08-21 12:41
    10

    这个最好就是docker版本的vllm,自带torch和cuda,版本不用管都封装好了。


    跑模型走GPU也不太影响性能

  • 长夜 08-21 12:58
    11

    有且只有拉docker一条路。其他任何方案都别尝试——不然其他三张卡正在跑的玩意炸了你等着被追杀就完事了。

  • dovelie_z 08-21 13:01
    12

    不需要重编译. 我也是 535 的驱动跑 sglang 最新的 main 分支, 他只支持CUDA12.9, 官方出了兼容层的.

* 帖子来源Linux.do
返回