Strata引擎开源:单张RTX 5070可运行125B参数Qwen3.8模型

AI 驱动中国 叶舟 452次阅读
分享 微 Q 信
AI摘要
由 AI 生成 · 仅供参考

开发者Niko1221开源Strata引擎,通过混合专家模型内存卸载与投机解码技术,实现12GB显存显卡运行125B参数Qwen3.8-Flash-Next模型。实测RTX 5070在2比特量化下推理速度达94词元每秒。

驱动中国10月6日消息,据gigazine报道,开发者Niko1221开源推出Strata引擎,该工具支持在12GB及以上显存的消费级显卡上运行量化的Qwen3.8-Flash-Next模型(1250亿参数)。在单张NVIDIA GeForce RTX 5070配置下,该引擎实现94词元/秒的推理速度。

Qwen3.8-Flash-Next是阿里巴巴Qwen团队于2026年8月推出的多模态混合专家(MoE)模型压缩版本,包含125B参数及51B参数的n-gram嵌入表,原生支持262K token上下文长度。Strata引擎通过两项关键技术降低显存占用:将MoE模型整体载入RAM,仅把高频使用的专家模型载入VRAM;同时利用轻量模型进行投机解码,预测下一Token以加速推理过程。

硬件运行要求方面,部署Qwen3.8-Flash-Next需满足最低配置:搭载12GB以上VRAM的NVIDIA或AMD显卡、32GB以上RAM、80GB以上存储空间(推荐SSD),系统支持Windows 10/11或Linux。

性能测试数据显示,在NVIDIA GeForce RTX 5070(12GB VRAM)、Ryzen 5 7600、64GB RAM配置下,2比特量子化版Q2_0达到94词元/秒推理速度,3比特量子化版IQ3_S为53词元/秒。在AMD Radeon RX 9070 XT(16GB VRAM)环境下,Q2_0版本达到60词元/秒。

具体量化版本性能表现如下:Q2_0版本写答案速度94词元/秒、阅读提示速度2650词元/秒;IQ2_XS版本分别为79词元/秒、2090词元/秒;IQ3_XXS版本为62词元/秒、1750词元/秒;IQ3_S版本为53词元/秒。

版权声明:本文由驱动中国整理发布,转载需注明出处与原文链接。如有疑问请联系 editor@qudong.com。
来源:驱动中国 · 原文链接:https://www.qudong.com/article/525320.html
本文价值 ★★★★★ 5 1 人已评
登录后为本文打分
网友评论0 条评论
正在回复 的评论取消
评论加载中…
🔐

登录后参与互动

评论、点赞均可赚积分
连续签到、邀请好友也有奖励 🎁

电脑端: 微信扫码登录 微信内: 一键登录
✎ 我要投稿有独家观点或行业线索?向驱动中国投稿,审核采用后署名发布并获积分奖励。 去投稿 ›

微信扫一扫

打开微信「扫一扫」,分享本文到朋友圈或好友