PulseAugur
中
实时 13:48:22
实体 TorchInductor

TorchInductor

PulseAugur coverage of TorchInductor — every cluster mentioning TorchInductor across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. TOOL · CL_275331 ·

    DynaFlow框架通过可编程算子调度增强机器学习并行性

    研究人员开发了DynaFlow,一个旨在提高机器学习推理和训练设备内并行性的新框架。DynaFlow将逻辑模型定义与物理执行调度解耦,允许以最小的代码更改透明地集成并行策略。这种方法旨在克服现有框架需要侵入性、模型特定大修的局限性。DynaFlow在六个最先进的ML系统中展示了高达1.29倍的吞吐量提升。

  2. TOOL · CL_58626 ·

    PassNet 使用 LLM 生成编译器通道以优化性能

    研究人员推出了一种新颖的框架 PassNet,该框架旨在利用大型语言模型 (LLM) 来生成编译器通道,这对于优化代码性能至关重要。现有的张量编译器在处理长尾工作负载时存在困难,常常导致性能下降。PassNet 旨在通过使 LLM 能够编写结构化的图变换来解决这一问题,这些变换可以集成到编译器管道中。该系统包含一个大型计算图数据集和一个基准套件,用于评估 LLM 在该领域的性能。

  3. RESEARCH · CL_13517 ·

    CuTeDSL成为LLM推理的新GPU内核路径,挑战CUTLASS

    LLM推理的GPU内核工程领域正在发生转变,CuTeDSL正崭露头角,有望成为C++ CuTe/CUTLASS的后继者。这种演变体现在FlashAttention-4和TorchInductor等技术中的行业趋势。对于2026年的开发者来说,选择C++ CUTLASS还是基于Python的CuTeDSL正成为一个关键考量,PyTorch和NVIDIA在其中扮演着重要角色。

  4. RESEARCH · CL_11928 ·

    GraphMend 编译器技术修复 PyTorch 2 图中断,提升性能

    研究人员开发了 GraphMend,一种旨在解决 PyTorch 2 程序中 FX 图中断问题的新型编译器技术。这些中断由动态控制流和不支持的 Python 结构引起,通常会导致性能下降和优化机会减少。GraphMend 采用源代码转换来消除这些中断,从而实现更大、不间断的计算图。在 Hugging Face 模型上的评估显示,延迟显著降低,吞吐量提高,从而提高了 PyTorch 开发者的可用性和性能。