torch.profiler
PulseAugur coverage of torch.profiler — every cluster mentioning torch.profiler across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
IBM发布开源多语言嵌入模型,支持32K上下文
IBM发布了Granite Embedding Multilingual R2,一个基于Apache 2.0许可的开源嵌入模型。该模型支持32K上下文窗口,目标是以少于一亿个参数实现顶级搜索质量。此次发布还包括一份关于PyTorch性能分析的指南,重点介绍torch.profiler工具。
-
Hugging Face 详细介绍 Holotron-12B 代理和 PyTorch 性能分析指南
Hugging Face 发布了两项与 AI 相关的不同主题的信息。第一个是 Holotron-12B,被描述为高吞吐量计算机使用代理。第二个主题是关于 PyTorch 中 torch.profiler 的入门指南,作为 PyTorch 性能分析系列的第一部分。
-
Hugging Face 聚焦 AI 工具:Holotron-12B、olmo-eval 和 PyTorch Profiler
Hugging Face 正在重点介绍几个与 AI 相关的项目和工具。这包括 Holotron-12B,一个专为高吞吐量计算设计的代理;以及 olmo-eval,来自 Allen Institute for Artificial Intelligence 的模型开发循环评估工作台。此外,还提供了一篇关于在 PyTorch 中使用 torch.profiler 的指南,旨在改进性能分析。
-
通过优化体素化而非骨干网络来降低LiDAR检测器延迟
研究人员在分析LiDAR物体检测器时发现,体素化和scatter-to-pillars步骤(而非3D卷积骨干网络)消耗了约40%的每帧延迟。通过将体素化过程移至GPU并优化scatter操作为一个单一的融合内核,他们将处理时间从31毫秒减少到19毫秒。这种优化主要得益于CPU和GPU工作的重叠,而不是单个内核速度的提升。在他们的自动标注循环中也发现了类似的瓶颈,通过为VLM API调用实现故障转移网关来解决。
-
Hugging Face 博客:用于 LLM 优化的 PyTorch Profiler 指南
Hugging Face 发布了其博客系列的第一部分,详细介绍了如何使用 PyTorch 的 torch.profiler 工具。本指南旨在为开发人员揭开性能分析的神秘面纱,从基本的矩阵乘法和偏置加法运算开始。它解释了如何设置 profiler、解释 CPU 和 GPU 跟踪,并理解从 Python 调用到 CUDA 内核的流程,以实现未来的优化和编译。