华为开源 505B 参数 MoE 大模型 openPangu-2.0-Pro

Zonki 2026-07-31 14:59 1



华为近日在 Hugging Face 发布开源大模型 openPangu-2.0-Pro。该模型基于昇腾 NPU 训练,采用混合专家(MoE)架构,总参数约 505B,每 token 激活约 18B,支持 512k 上下文长度,训练数据约 34T tokens。


架构上,模型采用 MLA 注意力及 DSA+SWA 独立分层混合设计、3 头 MTP 自投机模块,后训练阶段完成快慢合一微调与多专项强化学习。Thinking 版本在 AIME 2026 数学测评中得分 95.4,GPQA-Diamond 为 87.9。

最新回复 (1)
  • Angel 07-31 15:30
    1

    该模型基于昇腾 NPU 训练,采用混合专家(MoE)架构,总参数约 505B,每 token 激活约 18B,支持 512k 上下文长度,训练数据约 34T tokens。



    除了这个昇藤npu训练 可能真的无人在意了

    dsf正式版不打爆它?^-^^-^^-^^-^

* 帖子来源Linux.do
返回