搞了一台华为910C的四节点集群 按照官方教程自部署K3报错 各位佬能帮忙看下吗

iu5dm 2026-08-06 00:09 1

本文AI生成/润色内容已经通过截图发出


先说下集群配置 环境:4节点 910C 每个节点8张物理卡 每个2die (共64 die / 4TB HBM),Huawei Cloud EulerOS 2.0,NPU驱动 25.5.1,固件 7.8.0.6.201,镜像 nightly-releases-v0.23.0-a3-openeuler(CANN 9.0.1)


权重在 Kimi-K3-w4a8 这里拉下来的

我参考 Kimi-K3 — vllm-ascend 这个官方教程部署的

但是每次在profile_run阶段就崩溃


RuntimeError: SUSPECT REMOTE ERROR

[ERROR] ERR00100 PTA call acl api failed

malloc(): unsorted double linked list corrupted

at torch_npu/dynamo/npugraph_ex/npu_fx_compiler.py:507

→ line 6304 in forward (dynamically generated fused MoE kernel)

→ acl_graph.py:894 fx_run_eagerly


同时 dmesg 里反复出现内存释放竞态报错


[devmm] Va can’t free, is used by rts, must call destory api first. (va=0x12c0c1000000)

[devmm] Vaddress is not finish image word, please GE and RTS call unbind_stream before rtfree.

[devmm] Va heap_start_addr can’t free, is being used by rts


因为我是纯小白 不咋懂自部署 于是在AI指导下 调了多次配置 具体如截图




然后又运用了初中物理学的对照试验法做了俩实验(应该叫对照试验。。)


我以为是机器本身问题 于是跑一次Qwen3-8B 结果没问题 能正常输出

我又以为是MoE问题 跑了次Qwen3-30B-A3B 这个是MoE的 结果还是没问题… 能正常输出

就K3不行! 所以我怀疑是不是模型太大导致的 真没招了 求各位佬支支招…

最新回复 (3)
  • iu5dm 楼主 08-06 00:12
    1

    从下午两点一直搞到现在 求各位佬看看什么情况

  • LastHuman 08-06 00:30
    2
  • Nul1_ptr 08-06 00:42
    3

    vllm启动参数得放出来啊,感觉是cann的问题

* 帖子来源Linux.do
返回