Mixture of Kittens
PulseAugur coverage of Mixture of Kittens — every cluster mentioning Mixture of Kittens across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
Cursor 的 MoK 重新定义 MoE 执行,优化 GPU 内核以加速 AI 训练
Cursor 开发并开源了 Mixture-of-Kittens (MoK),这是一个旨在优化 Mixture-of-Experts (MoE) 模型执行的新软件层。MoK 通过将 token 调度、GPU 间通信和专家计算集成到单个 GPU 内核中来解决效率低下问题。这种方法旨在降低延迟,特别是在大规模 MoE 训练中,通信瓶颈会阻碍性能,尽管 NVIDIA 的 Blackwell GPU 和 NVLink 等硬件有所进步。这项创新…
-
Megakernels:过时的研究还是性能突破?
关于AI推理中“megakernels”的讨论已经转变,许多人现在认为它们在生产环境中已经过时。虽然理论上可以减少启动开销,但优化这些融合内核的复杂性常常使其比NVIDIA的TensorRT-LLM等模块化方法更慢。NVIDIA的Rubin GPU等近期硬件进展似乎旨在进一步抑制megakernel的使用。尽管如此,Cursor发布了一个名为Mixture of Kittens的开源megakernel,声称取得了显著的性能提升。
-
Cursor 发布开源 MoE 训练超级内核 Mixture-of-Kittens
Cursor Research 已开源 Mixture-of-Kittens (MoK),这是一个专为 Mixture-of-Experts (MoE) 模型设计的专用训练内核。该超级内核将 MoE 通信和计算融合为单一的确定性过程,据称与现有基线相比,吞吐量提高了 2.37 倍。MoK 针对 NVIDIA GB200 NVL72 机架等高端硬件进行了优化,适用于大规模 AI 模型开发和训练。
-
Cursor 开源 Mixture-of-Kittens 训练超级内核 · 跟踪 3 个来源
Cursor 已开源 Mixture-of-Kittens (MoK),这是一个专为 NVL72s 设计的 MoE 训练超级内核。该内核融合了专家混合模型的通信和计算,与现有基线相比,性能最高可提升 2.37 倍。MoK 目前支持 Cursor 上数万个 GPU 的模型训练,将端到端训练吞吐量提高了 1.41 倍。