Strata引擎开源:单张RTX 5070可运行125B参数Qwen3.8模型
开发者Niko1221开源Strata引擎,通过混合专家模型内存卸载与投机解码技术,实现12GB显存显卡运行125B参数Qwen3.8-Flash-Next模型。实测RTX 5070在2比特量化下推理速度达94词元每秒。
驱动中国10月6日消息,据gigazine报道,开发者Niko1221开源推出Strata引擎,该工具支持在12GB及以上显存的消费级显卡上运行量化的Qwen3.8-Flash-Next模型(1250亿参数)。在单张NVIDIA GeForce RTX 5070配置下,该引擎实现94词元/秒的推理速度。
Qwen3.8-Flash-Next是阿里巴巴Qwen团队于2026年8月推出的多模态混合专家(MoE)模型压缩版本,包含125B参数及51B参数的n-gram嵌入表,原生支持262K token上下文长度。Strata引擎通过两项关键技术降低显存占用:将MoE模型整体载入RAM,仅把高频使用的专家模型载入VRAM;同时利用轻量模型进行投机解码,预测下一Token以加速推理过程。
硬件运行要求方面,部署Qwen3.8-Flash-Next需满足最低配置:搭载12GB以上VRAM的NVIDIA或AMD显卡、32GB以上RAM、80GB以上存储空间(推荐SSD),系统支持Windows 10/11或Linux。
性能测试数据显示,在NVIDIA GeForce RTX 5070(12GB VRAM)、Ryzen 5 7600、64GB RAM配置下,2比特量子化版Q2_0达到94词元/秒推理速度,3比特量子化版IQ3_S为53词元/秒。在AMD Radeon RX 9070 XT(16GB VRAM)环境下,Q2_0版本达到60词元/秒。
具体量化版本性能表现如下:Q2_0版本写答案速度94词元/秒、阅读提示速度2650词元/秒;IQ2_XS版本分别为79词元/秒、2090词元/秒;IQ3_XXS版本为62词元/秒、1750词元/秒;IQ3_S版本为53词元/秒。