PulseAugur
实时 17:48:14
实体 torch.profiler

torch.profiler

PulseAugur coverage of torch.profiler — every cluster mentioning torch.profiler across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 9
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/1 页 · 共 9 条
  1. RESEARCH · CL_238654 ·

    Hugging Face 详解异步处理和 PyTorch 性能分析

    该集群涵盖了 Hugging Face 的两篇技术博客文章,通过 Mastodon 分享。第一篇文章《Continuous Async》深入探讨了 AI 模型连续批处理中异步处理的复杂性。第二篇文章《Profiling in PyTorch (Part 1)》是关于使用 `torch.profiler` 进行 PyTorch 性能分析的入门指南。

  2. RESEARCH · CL_214926 ·

    Hugging Face 详解异步处理和 PyTorch 性能分析

    Hugging Face 发布了两篇技术博客文章,详细介绍了 AI 开发的进展。第一篇文章《批处理中的连续异步处理》(Continuous Async in Batched Processing)探讨了在批处理 AI 任务中增强异步操作的方法。第二篇文章《PyTorch中的性能分析(第一部分):torch.profiler入门指南》(Profiling in PyTorch (Part 1): An Introductory Guid…

  3. COMMENTARY · CL_189702 ·

    Hugging Face 详细介绍异步处理和 PyTorch 性能分析

    Hugging Face 发布了两篇博客文章,详细介绍了 AI 开发的技术方面。第一篇文章“Continuous Async”探讨了批处理操作中的异步处理,第二篇“PyTorch Profiler”则作为 PyTorch 框架内性能分析的入门指南。

  4. RESEARCH · CL_163138 ·

    IBM 发布开源多语言嵌入模型,支持 32K 上下文

    IBM 发布了 Granite Embedding Multilingual R2,这是一个在 Apache 2.0 许可下的开源嵌入模型。该模型支持 32K 上下文窗口,并声称在参数少于 1 亿的情况下实现顶级搜索质量。另外,一篇关于在 PyTorch 中使用 `torch.profiler` 的指南已发布,重点介绍了该框架内的剖析技术。

  5. RESEARCH · CL_137106 ·

    IBM发布开源多语言嵌入模型,支持32K上下文

    IBM发布了Granite Embedding Multilingual R2,一个基于Apache 2.0许可的开源嵌入模型。该模型支持32K上下文窗口,目标是以少于一亿个参数实现顶级搜索质量。此次发布还包括一份关于PyTorch性能分析的指南,重点介绍torch.profiler工具。

  6. TOOL · CL_113135 ·

    Hugging Face 详细介绍 Holotron-12B 代理和 PyTorch 性能分析指南

    Hugging Face 发布了两项与 AI 相关的不同主题的信息。第一个是 Holotron-12B,被描述为高吞吐量计算机使用代理。第二个主题是关于 PyTorch 中 torch.profiler 的入门指南,作为 PyTorch 性能分析系列的第一部分。

  7. TOOL · CL_88223 ·

    Hugging Face 聚焦 AI 工具:Holotron-12B、olmo-eval 和 PyTorch Profiler

    Hugging Face 正在重点介绍几个与 AI 相关的项目和工具。这包括 Holotron-12B,一个专为高吞吐量计算设计的代理;以及 olmo-eval,来自 Allen Institute for Artificial Intelligence 的模型开发循环评估工作台。此外,还提供了一篇关于在 PyTorch 中使用 torch.profiler 的指南,旨在改进性能分析。

  8. TOOL · CL_65011 ·

    通过优化体素化而非骨干网络来降低LiDAR检测器延迟

    研究人员在分析LiDAR物体检测器时发现,体素化和scatter-to-pillars步骤(而非3D卷积骨干网络)消耗了约40%的每帧延迟。通过将体素化过程移至GPU并优化scatter操作为一个单一的融合内核,他们将处理时间从31毫秒减少到19毫秒。这种优化主要得益于CPU和GPU工作的重叠,而不是单个内核速度的提升。在他们的自动标注循环中也发现了类似的瓶颈,通过为VLM API调用实现故障转移网关来解决。

  9. TOOL · CL_59386 ·

    Hugging Face 博客:用于 LLM 优化的 PyTorch Profiler 指南

    Hugging Face 发布了其博客系列的第一部分,详细介绍了如何使用 PyTorch 的 torch.profiler 工具。本指南旨在为开发人员揭开性能分析的神秘面纱,从基本的矩阵乘法和偏置加法运算开始。它解释了如何设置 profiler、解释 CPU 和 GPU 跟踪,并理解从 Python 调用到 CUDA 内核的流程,以实现未来的优化和编译。