华为开源盘古5050亿参数大模型
IT时代网7月31日消息,华为今天官宣,5050亿参数的openPangu-2.0-Pro模型正式开源,模型权重、基础推理代码及技术报告一并上线。开源盘古openPangu是华为的开源AI模型品牌,目标是通过昇腾原生训练与推理技术,为业界用好昇腾提供实践参考。
这款模型是基于昇腾NPU训练的大规模混合专家(MoE)语言模型,参数规模约505B,每个token的激活参数约18B,支持512k上下文长度,训练数据总量约34T tokens。后训练阶段完成了快慢合一微调(SFT)与多专项强化学习(RL),并通过在线蒸馏(OPD)实现能力合一。
架构层面的升级不少。注意力部分沿用高效MLA,并采用DSA与SWA独立分层的混合架构,层配比1:2——SWA层负责局部窗口建模,DSA层做稀疏全局聚合,在保住精度的同时明显降低长序列推理的计算、显存与访存开销。拓扑上,传统残差连接升级为4支流mHC架构,提升表征多样性与泛化能力;自投机模块采用3头MTP设计,一次额外预测3个token,推理速度随之提升。训练中还引入了Muon优化器,收敛更快。
在今年6月的华为开发者大会上,华为终端BG董事长余承东曾宣布openPangu 2.0计划从6月30日起陆续开源7大组件,包括预训练代码、后训练代码与训练算子。6月30日,92B参数的openPangu-2.0-Flash已率先开源。
至于openPangu-2.0-Pro总参数为何只有505B,余承东此前解释过:算力大量支持了国内其他企业的需求,自己留的数量非常有限;加上AI算力成本高昂,华为更聚焦时延和吞吐率的提升。目前相关组件已陆续登陆开源平台,开发者可通过官方渠道获取。

注:本文中包含AI辅助创作的内容。