小米罗福莉官宣 MiMo-V3 采用新架构 核心 HySparse 2 发布
小米大模型负责人罗福莉宣布 MiMo-V3 将采用全新架构,其核心 HySparse 2 今日发布。该架构在百万 Token 长度下显著降低预填充计算量与 KV 缓存大小,并优化长上下文检索能力,旨在解决智能体推理中的关键路径问题。
驱动中国9月23日消息,小米 MiMo 大模型负责人罗福莉发文确认,小米 MiMo-V3 即将采用全新架构。作为该架构的核心组件,HySparse 2 于今日正式对外发布,重点优化了预填充效率、KV 缓存占用以及长上下文检索能力。
根据公开的技术指标,在 1M(100 万)Token 的上下文长度下,新架构使预填充计算量(FLOPs)降低了 5.02 倍,同时 KV 缓存缩小了 4.5 倍。此外,该架构在 MRCRv2 和 RULER-v2 评测中得分更高,而 AgentPPL 和 LongPPL 指标则有所降低。
罗福莉指出,智能体(Agentic)推理是一种与传统任务截然不同的工作负载。在每一轮交互中,简短的动作可能返回需要进行预填充的长文本观察结果,且上下文处于持续增长状态,这导致预填充成本、KV 缓存大小和检索准确率同时成为影响性能的关键路径。
为应对上述挑战,HySparse 2 引入了 KV 桥接(KV Bridging)与 KV 重用(KV Reuse)机制。KV 桥接遵循 YOCO 思路,使交叉解码器(cross-decoder)中的全注意力层能够利用自解码器(self-decoder)的隐藏状态构建其 K/V。KV 重用则在每个混合块内,让稀疏层复用前一层全注意力层的 KV 缓存和选择索引。
架构还包含两项具体改进:采用 Token 级别的选择机制替代原有的块(block)级别选择;使用近期 Token 的强制窗口替代独立的 SWA 分支,实现本地和全局 Token 共享同一个 KV 缓存。由于所有交叉解码器的 KV 缓存均源自自解码器,预填充过程可在自解码器完成时即刻停止。
此前一日凌晨,小米已发布并开源了全新的 Xiaomi MiMo-V2.6 系列模型,包含 Pro 与 Flash 两个原生全模态版本。小米方面表示,该系列是其探索 RSI(递归自我改进)路径的关键一步,旨在通过规模化扩展强化学习算力,使模型在持续的探索与反馈中拓展智能边界。