DeepSeek将推2万亿参数大模型
IT时代网9月21日消息,临近中秋国庆,国内外大模型密集预热,其中最受关注的当属 DeepSeek V4.1 Pro。有海外媒体爆料称,DeepSeek 正在训练参数规模达 2 万亿的大模型,未来还可能扩展到 8 万亿参数。同时,新一代大模型训练将押注国产 AI 芯片,尤其是华为昇腾系列。
这 2 万亿参数的模型很可能就是即将发布的 DeepSeek V4.1 Pro,具体月份尚不确定,节前发布希望不大,10 月中旬到下旬的可能性更高。从已披露的 V4.1 Flash 信息看,V4.1 Pro 将延续全新架构设计,包括 CED+Engram、Prefill 与 Decode 拆分、非对称式激活结构等技术。
训练 2 万亿参数规模的大模型,大约需要 50 万亿至 60 万亿 Token。按当前算力估算,H100/H200 这类显卡约需 3 万张,B200 约需 1.5 万张,而昇腾 950 系列约需 3 万张,与 H200 大致相当。DeepSeek 新架构显然在与昇腾走软硬件协同优化,以适配其 Prefill 与 Decode 拆分后的训练与推理流程。
用国产 AI 芯片训练万亿级大模型已有实例,但 2 万亿规模尚属首次确认。目前国内参数超过 2 万亿的模型主要有文心一言 5.0、Kimi K3、千问 Qwen 3.8 Max 等,尚未有公开信息显示它们使用国产 AI 芯片训练。若 DeepSeek V4.1 Pro 部分采用国产 AI 芯片完成 2 万亿参数训练,即便不是全流程,也具备里程碑意义。
明年华为昇腾 960 系列还将提前一至三个季度上市,困扰国产大模型发展的算力瓶颈未来几年有望大幅缓解,国产大模型也更有机会与国际头部厂商正面竞争。

注:本文中包含AI辅助创作的内容。
编辑:林一舟