DeepSeek新论文推理提速85%

IT时代网6月30日消息,6月27日,DeepSeek团队联合北京大学发布名为《DSpark》的研究论文,提出一种用于加速大模型推理的新方法,该话题登上微博科技热搜。

论文指出,现有并行"草稿生成"方式虽然能一次生成更长token,但由于token间关联不足,容易导致被拒绝比例上升。为此,DSpark引入半自回归结构,在并行生成骨干上加入轻量级顺序模块,以增强token之间的依赖关系。

同时,DSpark提出"基于置信度的动态验证机制",根据不同请求的成功概率与系统负载,自适应调整验证长度,从而减少无效计算开销。在DeepSeek-V4线上系统中,相比基线模型,推理速度提升约60%至85%,并有效降低高并发下的吞吐损耗。

值得注意的是,DeepSeek创始人梁文锋亲自位列论文作者名单。随DSpark一同开源的DeepSpec,是一个用于训练和评估推测解码草稿模型的全栈代码库,支持MIT许可,已成功适配阿里Qwen3及Gemma4等主流开源基座。

THE END