华为昇腾 0 Day 支持智谱 GLM-5.2 模型,提供全面推理优化

a12908 2026-06-18 15:09 1

[IT之家]6 月 18 日消息,“昇腾 AI 开发者”公众号 6 月 17 日宣布,昇腾 0 Day 支持 GLM-5.2,为编程与长程任务提供全面推理优化。


据官方介绍,目前昇腾 A3 系列产品已经支持 GLM5.2 的单双机以及大 EP 推理部署。针对 GLM5.2 模型的结构特点,昇腾围绕以下几个关键技术开展了高效推理优化:




  • **MOE 大融合算子:**将专家路由、加权计算与结果归约融合为统一算子,消除中间张量冗余读写,显著提升计算效率。




  • **通信与计算融合:**通过将 AllReduce 优化为 ReduceScatter 与 AllGather 通信原语,并与矩阵计算形成紧耦合流水线,实现通信延迟的有效隐藏。




  • **注意力前处理与多 Token 预测优化:**采用注意力前处理融合算子,结合多 Token 预测(MTP)机制的加速,提升单步生成效率。




  • **高并发调度与预填充延迟机制:**在高并发混合负载场景下引入预填充延迟调度,平滑计算峰值,降低 Prefill 阶段对 Decode 阶段的资源抢占。




  • **智能缓存与索引优化:**结合 IndexCache 技术缓存高频专家路径与静态路由表,并采用 Chunked Prefill、稀疏索引检索等方法,优化长上下文推理性能。




  • **PD 分离与 Prefix Cache:**通过 Prefill 与 Decode 阶段分离及前缀缓存技术,压缩解码时延抖动,提升在线服务吞吐稳定性。




  • 极致 Infra 优化,Day 0 运行在国产算力平台:在 1M 上下文长度下,将单位 token 的 FLOPs 降低至 2.9 倍;已在 Day 0 完成与华为昇腾、平头哥、摩尔线程、寒武纪、昆仑芯、沐曦、海光、壁仞等国产算力平台的推理适配;预计下半年昇腾 950 超节点上市后,也将成为 GLM-5.2 强劲的算力底座



最新回复 (11)
  • 4396 06-18 15:19
    1

    一个个都支持

    但是价格居高不下

    支持到哪里去了。。。。。。

  • a12908 楼主 06-18 15:19
    2

    还没出货呢 都在等下半年的950 950到底啥时候来啊 下半年到底在哪啊 ^-^

  • 项太傅 06-18 15:20
    3

    智谱这才是正常价格,芯片成本摆在这。

  • 谢大佬 06-18 15:25
    4

    不着急,还有十几天就下半年了,问题是国产卡上了以后价格能下来多少。

  • a12908 楼主 06-18 15:26
    5

    我记得DeepSeek官方的原文是大幅降价 估计小不了

  • juesso 06-18 15:50
    6

    他们应该已经提前降价了,把原来的限时折扣已经干成永久折扣了,我估计后续也降不下来了

  • a12908 楼主 06-18 15:52
    7

    再期待一手吧 DeepSeek的官网挂了内蒙古的数据中心的职位

    说不定建上自己的数据中心后还有的降呢 而且算法也在持续优化

  • Elio 06-18 15:55
    8

    各位佬友昇腾显卡部署大模型一直失败有佬友能解答一下吗?

  • Elio 06-18 15:59
    9

    昇腾显卡310P的我安装了驱动和固件但是部署模型的时候一直不行用不了,使用ollama,ollama又不支持国产显卡

  • init0 06-18 16:04
    10

    310p卡本身就比较差劲,身为“推理卡”,其实能部署的模型少之又少,佬友先看看mindie的模型支持列表里,310p的卡能部署的模型里,包不包括你想部署的模型,如果没有就尝试下在vllm-ascend的镜像里能不能部署的起来吧。或者去魔乐社区看看有没有部署你想部署的模型的教程

  • Elio 06-18 16:06
    11

    我用的其实就是社区里的,随便一个都部署不了现在不知道咋弄好,看看去申请换个英伟达的吧,弄累了

* 帖子来源Linux.do
返回