torch.compile
PulseAugur coverage of torch.compile — every cluster mentioning torch.compile across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
ByteDance 和 清华AIR 训练大语言模型使用 CUDA Agent 编写更快的 GPU 代码
ByteDance Seed 和 清华AIR 开发了 CUDA Agent,一个使用强化学习训练大语言模型生成优化 GPU 核的系统。该系统在 KernelBench 基准测试中达到了 98.8% 的正确率,并且生成的核比编译器生成的代码快 96.8% 的时间。该 Agent 在模拟的 CUDA 开发环境中运行,结合了性能分析和正确性检查来提高核性能,在 AI 基础设施和其他延迟敏感领域具有潜在应用。
-
Kimi K3 AI模型优化GPU,设计芯片并加速研究
开放前沿智能(Open Frontier Intelligence)推出的先进AI模型Kimi K3,在超越典型语言任务方面展现了卓越的能力。该模型在优化GPU内核方面表现出色,学习速度提升高达2.48倍,并显著缩短了执行时间。它还成功开发了一个可与Triton和torch.compile相媲美的GPU编程系统,甚至参与了AI芯片的初步设计。此外,Kimi K3能够自主实现、验证和分析复杂的计算研究工作流,在短短几小时内完成通常需要人…
-
C++ RLHF 奖励评分引擎在 CPU 上优于 PyTorch
一项新的研究调查了人类反馈强化学习 (RLHF) 管道中奖励评分的速度,发现基于 ONNX Runtime 构建的自定义 C++ 推理引擎在 CPU 上的性能明显优于标准的 PyTorch 实现。虽然 C++ 引擎在 GPU 上的性能也优于 PyTorch 和 FastAPI,但比 torch.compile 略慢。研究强调,批处理策略是性能的关键因素,其重要性往往超过语言或运行时的选择。
-
新的C++引擎加速了CPU上的RLHF奖励评分
研究人员开发了一种新的C++推理引擎,使用ONNX Runtime进行人类反馈强化学习(RLHF)管道中的奖励模型评分。该引擎在CPU和GPU上与PyTorch eager模式、torch.compile和FastAPI进行了基准测试。C++引擎在CPU上表现出卓越的性能,优于所有基线,而在GPU上,torch.compile取得了更快的速度。研究还强调,批处理策略,特别是长度感知分桶,对吞吐量有显著影响,尤其是在GPU上。
-
开发者创建简化的 torch.compile 以解释算子融合
一位开发者用大约 500 行 Python 代码创建了 PyTorch 的 `torch.compile` 的简化实现。该项目旨在说明算子融合的核心概念,这是 `torch.compile` 实现显著加速的关键,即使在处理像 NumPy 中那样高度优化的函数时也是如此。开发者分享了代码和相关的 notebook 来解释其机制。
-
新的MARS LLM架构使用内部状态来覆盖提示
一位研究人员开发了一种名为MARS的新型语言模型架构,该架构包含“本体感觉通道”,允许模型感知其自身的内部状态,例如记忆显著性或谨慎级别。当通道用于传达事实时,初始实验失败了,但当它们用于传达内部状态而事实在提示中时,实验就成功了。一项关键测试表明,模型的内部状态信号可以覆盖显式文本提示,这表明了一种超越传统提示工程的新型控制形式。
-
扩散模型加速取决于开销减少,而非仅仅是步数减少
单张图像扩散模型推理速度慢的原因在于内核启动开销和注意力内存流量,而非原始计算能力。通过在 `reduce-overhead` 模式下使用 `torch.compile` 进行优化,采用融合注意力后端,以及批处理无分类器引导,可以显著降低延迟。只有在这些优化之后,才应考虑使用蒸馏方法来进一步提高速度,同时仔细评估潜在的质量下降。