MiniMax Sparse Attention
PulseAugur coverage of MiniMax Sparse Attention — every cluster mentioning MiniMax Sparse Attention across labs, papers, and developer communities, ranked by signal.
- 2026-07-25 research_milestone Fireworks AI achieved a 1.6x throughput uplift on MiniMax Sparse Attention through kernel optimizations. 来源
2 天有情绪数据
-
Fireworks AI 将 MiniMax 稀疏注意力吞吐量提升 1.6 倍
Fireworks AI 优化了 MiniMax 稀疏注意力(MSA)内核,吞吐量提升了 1.6 倍。此次优化着重于改进注意力内核中的加载和存储流水线。这些改进有望为 MSA 的开源实现带来显著效益。
-
MiniMax M3:发布开放权重 1M 上下文模型,但商业用途受限
MiniMax 发布了 MiniMax M3,这是一款开放权重的专家混合(Mixture-of-Experts)模型,拥有 100 万 token 的上下文窗口和原生多模态能力。该模型拥有 4280 亿总参数,每个 token 仅激活 230 亿参数,在 SWE-Bench Pro 上取得了 59.0% 的分数,使其成为开放权重模型中的有力竞争者。然而,运行 M3 需要大量的硬件资源,通常是拥有超过 200GB VRAM 的多 GPU…
-
新研究探索用于大型语言模型的混合和稀疏注意力机制
研究人员正在探索优化大型语言模型中注意力机制的新方法,特别是用于处理长上下文。例如,HydraHead架构沿头轴混合了全注意力(FA)和线性注意力(LA),识别关键的FA头并协调分布差异。另外,StreamKL提供了一种快速且内存高效的方法来计算注意力蒸馏的Kullback-Leibler散度,减少了HBM占用空间,并支持在单个GPU上进行长上下文蒸馏。其他研究包括基于域分解的分层注意力和距离自适应表示,后者为远距离标记分配较低的维度…
-
Together AI 推出 MiniMax M3 多模态模型,支持 100 万上下文
Together AI 已宣布推出 MiniMax M3 API,这是一个开放权重、原生多模态模型。该模型拥有 100 万 token 的上下文窗口,通过 MiniMax Sparse Attention 增强,并具有独特的“思考”和“非思考”模式,分别用于复杂推理和延迟敏感任务。Together AI 被强调为 MiniMax 的首选云合作伙伴,为 M3 模型提供优化的推理。
-
MiniMax AI 发布开放权重多模态 M3 模型
MiniMax AI 发布了其 MiniMax M3 模型,该模型具有开放权重,总参数约 4280 亿,激活参数 230 亿。该模型专为智能体时代设计,支持文本、图像和视频的原生多模态,上下文窗口高达 100 万 token。此次发布还包括更新的许可条款,年收入低于 2000 万美元的个人或公司可免费商用,只需通知。
-
MiniMax AI 强调 M3 模型稀疏注意力机制
MiniMax AI 最近举行了一场现场会议,讨论了其 M3 模型,并重点介绍了 MiniMax 稀疏注意力(MSA)机制。与其他压缩 KV 缓存的注意力方法不同,MSA 保留了未压缩的 KV 缓存。该方法是与 Together AI 团队合作开发的。