PulseAugur
实时 09:40:43
实体 torch.profiler

torch.profiler

PulseAugur coverage of torch.profiler — every cluster mentioning torch.profiler across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 5 条
  1. RESEARCH · CL_137106 ·

    IBM发布开源多语言嵌入模型,支持32K上下文

    IBM发布了Granite Embedding Multilingual R2,一个基于Apache 2.0许可的开源嵌入模型。该模型支持32K上下文窗口,目标是以少于一亿个参数实现顶级搜索质量。此次发布还包括一份关于PyTorch性能分析的指南,重点介绍torch.profiler工具。

  2. TOOL · CL_113135 ·

    Hugging Face 详细介绍 Holotron-12B 代理和 PyTorch 性能分析指南

    Hugging Face 发布了两项与 AI 相关的不同主题的信息。第一个是 Holotron-12B,被描述为高吞吐量计算机使用代理。第二个主题是关于 PyTorch 中 torch.profiler 的入门指南,作为 PyTorch 性能分析系列的第一部分。

  3. TOOL · CL_88223 ·

    Hugging Face 聚焦 AI 工具:Holotron-12B、olmo-eval 和 PyTorch Profiler

    Hugging Face 正在重点介绍几个与 AI 相关的项目和工具。这包括 Holotron-12B,一个专为高吞吐量计算设计的代理;以及 olmo-eval,来自 Allen Institute for Artificial Intelligence 的模型开发循环评估工作台。此外,还提供了一篇关于在 PyTorch 中使用 torch.profiler 的指南,旨在改进性能分析。

  4. TOOL · CL_65011 ·

    通过优化体素化而非骨干网络来降低LiDAR检测器延迟

    研究人员在分析LiDAR物体检测器时发现,体素化和scatter-to-pillars步骤(而非3D卷积骨干网络)消耗了约40%的每帧延迟。通过将体素化过程移至GPU并优化scatter操作为一个单一的融合内核,他们将处理时间从31毫秒减少到19毫秒。这种优化主要得益于CPU和GPU工作的重叠,而不是单个内核速度的提升。在他们的自动标注循环中也发现了类似的瓶颈,通过为VLM API调用实现故障转移网关来解决。

  5. TOOL · CL_59386 ·

    Hugging Face 博客:用于 LLM 优化的 PyTorch Profiler 指南

    Hugging Face 发布了其博客系列的第一部分,详细介绍了如何使用 PyTorch 的 torch.profiler 工具。本指南旨在为开发人员揭开性能分析的神秘面纱,从基本的矩阵乘法和偏置加法运算开始。它解释了如何设置 profiler、解释 CPU 和 GPU 跟踪,并理解从 Python 调用到 CUDA 内核的流程,以实现未来的优化和编译。