MLSys 2026
PulseAugur coverage of MLSys 2026 — every cluster mentioning MLSys 2026 across labs, papers, and developer communities, ranked by signal.
-
LLM 推动 GPU 内核生成和推理优化 · 跟踪 4 个来源
研究人员正在开发利用大型语言模型 (LLM) 优化 GPU 内核生成的先进方法。其中一种方法在 MLSys 2026 上提出,使用以工程化为中心(harness-centered)的系统来约束、验证和分析 LLM 生成的代码,与基线实现相比实现了显著的加速。另一项研究引入了 Atrex-Bench,这是一个源自生产推理跟踪的基准测试,用于评估 LLM 生成的 GPU 内核,结果显示当前模型仅能达到硬件潜力的约 10%,并且经常依赖回退…
-
AI推理成本通过三种硬件优化策略大幅降低 · 追踪2个来源
SemiAnalysis 详细介绍了优化AI推理成本的三种方法,重点在于最大化硬件利用率。这些方法包括按阶段(预填充和解码)划分工作负载,按层(注意力层和前馈网络)划分,以及按时间(交错执行窗口)划分。这些策略的核心原则是识别并填补空闲的计算资源,最终降低每token的成本,并有望推动AI服务需求的增长。
-
AI 生产系统通过新的优化技术应对 MoE 挑战
SemiAnalysis 正在强调大规模 AI 模型(尤其是专家混合 (MoE) 架构)的生产系统挑战。他们指出,专家平衡和为不同工作负载分配专用资源等技术正从学术研究转向实际应用。稀疏注意力机制,以前仅限于基准测试,现在正被应用于生产系统,并引用了 DeepSeek Sparse Attention 和 NousResearch 的工作等示例。
-
Together AI 主办 MLSys 2026 社交活动
Together AI 将在 MLSys 2026 会议期间举办一场名为“Inference After Dark”的活动。该活动将于 5 月 19 日星期二晚上 7:30 至 10:00 在华盛顿州贝尔维尤的 Tavern Hall 举行。旨在为研究人员和 AI 原生构建者提供一个社交聚会。