实体
Hybrid Sliding Window Attention
Hybrid Sliding Window Attention
PulseAugur coverage of Hybrid Sliding Window Attention — every cluster mentioning Hybrid Sliding Window Attention across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
MiMo-V2.5 模型系列通过混合 SWA 和 MoE 优化以实现高效推理
研究人员详细介绍了 MiMo-V2.5 模型系列的全方位推理优化策略,该策略将混合滑动窗口注意力(Hybrid SWA)与稀疏专家混合(MoE)和多模态编码器相结合。优化通过分层预取和 SWA 感知前缀缓存树等技术,专注于减少注意力和 KVCache 存储。一种名为 GCache 的新型分布式缓存基础设施,利用 RDMA 优化的网络和 KVCache 亲和性路由器,进一步提高了效率。该系统还包含了针对多模态输入的优化,包括 GPU 图…
-
小米详解 MiMo-V2.5 AI 模型效率优化
小米公司详细介绍了其 MiMo-V2.5 系列 AI 模型背后的工程优化,重点在于实现长上下文推理和多模态任务的效率。与传统的全注意力机制相比,该模型采用混合滑动窗口注意力(Hybrid SWA)来大幅降低 KVCache 的存储和计算成本。进一步的增强包括稀疏 MoE 激活以减少每 token 的计算量,以及用于跨模态理解的多模态编码器。该公司系统地设计了推理系统,以在生产环境中实现这些架构优势,解决了 KVCache 管理、调度和…