Strata引擎让12GB显卡跑起125B大模型

IT时代网10月6日消息,开发者Niko1221开源推出Strata推理引擎,可在12GB及以上显存的消费级显卡上运行量化后的Qwen3.8-Flash-Next模型。这一模型包含1250亿参数,另含510亿参数的n-gram嵌入表,原生支持262K token上下文长度,是阿里巴巴Qwen团队今年8月推出的多模态混合专家模型(MoE)的压缩版本。

Strata为压低显存占用采用两项关键技术:一是将MoE模型整体载入内存,仅把高频使用的专家模型放入显存;二是用轻量模型执行投机解码,预测下一token以加速推理过程。

硬件门槛方面,运行该模型需满足最低配置:12GB以上显存的NVIDIA或AMD显卡、32GB以上内存、80GB以上存储空间(推荐固态硬盘)、Windows 10/11或Linux系统。

性能实测中,在GeForce RTX 5070(12GB显存)、Ryzen 5 7600、64GB内存的平台下,2比特量化版Q2_0达到每秒94个token的推理速度,3比特量化版兼顾速度与质量,被认为更适合大多数用户。

注:本文综合自IT之家等,文中包含AI辅助创作的内容。

编辑:林一舟

THE END