华为开源 505B 参数 MoE 模型 openPangu-2.0-Pro
华为在 Hugging Face 开源 openPangu-2.0-Pro,该模型为 505B 参数的 MoE 架构,基于昇腾 NPU 训练,激活参数约 18B,支持 512k 上下文。Thinking 版本在 A...
发生了什么
华为在 Hugging Face 发布了开源大模型 openPangu-2.0-Pro。该模型基于昇腾 NPU 训练,采用混合专家(MoE)架构,总参数量约 505B,每个 token 激活约 18B 个参数。它支持最长 512k token 的上下文,训练数据规模约 34T tokens。
核心能力
模型集成了 MLA 注意力机制以及 DSA 和 SWA 独立分层的混合设计。在解码过程中引入了 3 头 MTP 自投机模块,可一次性预测多个 token,以加速生成。后训练阶段包含快慢合一微调和多专项强化学习,使得模型的推理能力大幅提升。其 Thinking 版本在 AIME 2026 数学测评中取得 95.4 分,在 GPQA-Diamond 研究生级科学问答中取得 87.9 分,显示出在复杂推理任务上的竞争力。
对开发者意味着什么
由于总参数规模大但激活参数少,openPangu-2.0-Pro 在显存占用与推理效率之间进行了平衡。512k 的长上下文可以让开发者处理整本书或长档案等任务。MTP 自投机模块有潜力降低解码延迟,但其与主流推理框架的兼容性尚待验证。此外,模型基于昇腾 NPU 训练,在华为 Ascend 硬件上预期会获得最佳推理性能,迁移至其他 GPU 平台可能涉及额外的适配投入。
当前边界
目前官方尚未公布模型的权重许可证,因此不宜直接用于商业项目。缺少模型推理的具体显存需求、计算量或吞吐量数据,也未提供推理代码或专用引擎。非昇腾硬件上的迁移方案以及多语言支持范围目前都不明确。在正式工程化使用前,需等待社区对以上未知点的进一步澄清。





