PulseAugur
中
实时 17:56:27
实体 Nccl

Nccl

PulseAugur coverage of Nccl — every cluster mentioning Nccl across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
23
90 天内 23
发布 · 30天
0
90 天内 0
论文 · 30天
10
90 天内 10
层级分布 · 90 天
主题
情绪 · 30 天

6 天有情绪数据

最近 · 第 1/2 页 · 共 23 条
  1. TOOL · CL_284363 ·

    新的 T-CCL 库利用 TMA 提升多 GPU AI 模型性能

    研究人员开发了 T-CCL,这是一个专为大型 Transformer 模型中高效多 GPU 执行而设计的新型集体通信库。T-CCL 利用张量内存加速器 (TMA) 来卸载数据移动和归约操作,显著减少了 GPU 流式多处理器 (SM) 上所需的计算资源。这种减少使得通信和计算能够更好地并发执行,从而提高性能。评估显示,在资源受限的条件下,T-CCL 的性能比 NCCL 等现有库高出 3.42 倍,并提高了 vLLM 等系统中的端到端推理吞吐量。

  2. TOOL · CL_283438 ·

    为AI工程师解析Nvidia GPU术语

    本文为AI工程师定义了必不可少的GPU术语,涵盖了从CUDA核心到NVLink的概念。文章解释了这些NVIDIA GPU概念如何影响模型拟合、执行速度和可扩展性。该文旨在使AI专业人士掌握相关知识,以了解和优化其机器学习工作负载的GPU性能。

  3. TOOL · CL_277808 ·

    Google 通过 NVIDIA 自动激活增强 GPU 集群,但落后于顶级提供商

    据 SemiAnalysis 称,Google 在不到两年的时间里显著改善了其 GPU 集群体验,从“铜牌”级别提升至“金牌”级别。一项关键的增强功能是 NVIDIA ConnectX-7/8 NCCL 插件的自动激活,简化了 Google Cloud Platform (GCP) 用户设置和性能优化。尽管取得了这些进展,GCP 的 GPU 体验仍被认为不如 CoreWeave 和 Nebius 等顶级提供商那么完善,Google C…

  4. TOOL · CL_275363 ·

    新的ThunderEP设计提升消费级GPU上的MoE推理性能

    研究人员开发了ThunderEP,这是一种新的通信设计,用于在通过PCIe连接的消费级GPU上高效运行大型专家混合(MoE)模型。该系统解决了这些设置中固有的通信瓶颈,数据传输通常涉及CPU。ThunderEP旨在绕过CPU中继跳跃并利用DMA引擎,避免与计算资源的争用,从而减少同步延迟。在配备RTX 4090和RTX 5090 GPU的系统上进行的评估表明,与NCCL等现有方法相比,速度显著提升,MoE推理的端到端改进高达1.66倍。

  5. TOOL · CL_274134 ·

    Modal推出支持RDMA的无服务器GPU集群

    Modal宣布其新产品Modal Clusters普遍可用。该功能允许组织访问大规模计算资源,包括用于节点间高速通信的RDMA支持,而无需拥有底层硬件。该系统专为高效的多节点调度而设计,并提供无服务器定价,按GPU使用时长计费。

  6. TOOL · CL_258365 ·

    NVIDIA NVRx 增强 Amazon EKS 上的分布式 AI 训练容错能力

    NVIDIA 推出了 NVRx,这是一个 Python 库,旨在增强 Amazon EKS 上大规模分布式 AI 训练的容错能力。NVRx 与 PyTorch 的 Fully Sharded Data Parallel (FSDP) 集成,支持异步检查点,将 I/O 操作与训练重叠,从而显著减少空闲时间。它还提供进程内重启功能,可在几秒钟内从故障中恢复,而无需重启容器,并提供作业内重启机制来处理严重崩溃。

  7. TOOL · CL_253459 ·

    llama.cpp 在最新发布中添加了 Ubuntu-CUDA 构建和 GCC 14 支持

    llama.cpp 项目发布了 b10969 版本,其中包括针对 Ubuntu-CUDA 的新构建作业,支持 x64 和 arm64 架构上的 CUDA 12.8 和 13.3 版本。此更新还在持续集成过程中为 CUDA arm64 构建集成了 GCC 14,并确保在 Ubuntu 上提供依赖库。发布说明提到了管理 NCCL 许可并将其集成到构建管道中的工作。

  8. TOOL · CL_239487 ·

    新的REACT系统在应用层缓解AI集群拥塞

    研究人员开发了一个名为REACT的系统,该系统解决了分布式训练期间共享AI集群中的拥塞问题。REACT在应用层运行,使用流统计信息实时检测网络拥塞,并动态调整通信集体模式。这种方法不需要特殊的网络基础设施支持,并且可以由单个用户部署。REACT被原型化为NCCL之上的一个Shim层,在共享学术GPU集群的拥塞情况下,通信性能提高了13%-38%,模拟显示在各种场景下可提高高达75%。

  9. TOOL · CL_229708 ·

    NVIDIA 和 Google 为 GCP 自动化 NCCL 插件设置

    NVIDIA 和 Google 合作实现了 Google 的 NCCL 插件的自动激活,特别是针对 ConnectX-7 和 ConnectX-8 NCCL。这项增强功能是根据 SemiAnalysis 的反馈实现的,旨在显著改善 Google Cloud Platform (GCP) 上的用户体验。以前,用户需要在 GCP NVIDIA GPU 机器上为 NVIDIA ConnectX NICs 的最佳性能手动配置库路径和环境变量,…

  10. TOOL · CL_206863 ·

    开发者详解在双RTX 3090上设置Qwen3.8-27B

    一位开发者详细介绍了在没有NVLink的双RTX 3090配置上运行Qwen3.8-27B模型所需的广泛故障排除工作。使用vLLM和SGLang的初步尝试遇到了重大问题,包括编译错误、依赖冲突和模型加载失败,尤其是在量化检查点方面。通过将CUDA 13.0与SGLang 0.5.17匹配并应用特定的无NVLink和内存相关补丁,终于取得了突破。进一步的优化包括使用DSpark进行推测解码,这显著提高了令牌生成速度。

  11. RESEARCH · CL_187441 ·

    在 NVIDIA B300 上对 Qwen3-32B 进行微调的新研究

    一篇新论文详细介绍了在 NVIDIA B300 加速器上微调 Qwen3-32B 模型时遇到的操作挑战和解决方案。该研究侧重于多节点训练的实际方面,深入探讨了基于功耗的分类、网络文件系统争用等性能瓶颈,以及检测和防止 NCCL 死锁的策略。研究结果强调了实际操作最佳实践而非算法新颖性,并指出监控功耗和验证运行前不变量对于大规模数据并行作业至关重要。

  12. TOOL · CL_135401 ·

    新的CTA-pipelining方法大幅降低LLM的多GPU延迟

    研究人员推出了一种新颖的多GPU系统执行范式CTA-pipelining,该范式针对服务大型语言模型的延迟进行了优化。该方法利用了协同线程阵列(Cooperative Thread Array)层面的依赖关系,从而实现跨GPU的并发内核执行。在H200和B200系统上的实验表明,CTA-pipelining可以将特定操作的延迟降低高达31.8%,并且可以与张量并行(Tensor Parallelism)结合以获得进一步的性能提升。

  13. RESEARCH · CL_117364 ·

    新的HSAP框架提升了混合上下文模型LLM的训练效率

    研究人员推出了一种名为HSAP(Hierarchical Sequence-aware Parallelism)的框架,旨在提高大型语言模型训练的效率。这种新方法解决了处理混合上下文序列和因果注意力计算中的挑战,这些在预训练和微调中常用的打包序列中很常见。HSAP通过优化跨多个设备组的张量传输和注意力计算,并利用JIT编译进行通信策略,来克服现有序列并行方法的局限性。

  14. TOOL · CL_107156 ·

    Together AI 发布用于 LLM 推理的开源并行内核构建器

    Together AI 发布了并行内核构建器 (PKB),这是一个旨在优化大型语言模型推理性能的开源工具。PKB 可以识别并生成新颖的内核,例如用于 NeMo 词汇并行 log-probs 和 Hyena 上下文并行的内核,这些内核并未公开文档化。该工具已展示出显著的加速效果,其中一个内核的性能从标准的 320.6µs 提升至 87.9µs,并且该项目鼓励社区贡献。

  15. RESEARCH · CL_107157 ·

    研究人员发现大型语言模型在生成多GPU内核方面存在困难

    Together的研究人员发现,虽然大型语言模型能够高效地生成单GPU内核,但在多GPU内核生成方面却面临巨大挑战。当被要求创建针对多个GPU优化的内核时,这些模型表现不佳,经常无法编译或产生错误结果。这一限制源于单GPU(计算/内存带宽)和多GPU(互连)操作之间的瓶颈差异,而当前的大型语言模型无法有效处理这些差异。

  16. TOOL · CL_107109 ·

    前沿大语言模型在多GPU内核生成方面遇到困难,新基准测试揭示

    一项名为ParallelKernelBench (PKB) 的新基准测试已被开发出来,用于评估前沿大语言模型生成高效多GPU内核的能力。对GPT-5.5、Gemini 3 Pro和Opus 4.7等模型的测试显示出显著的性能差距,只有不到三分之一的问题得到正确解决,而其中只有不到四分之一的性能优于简单的基线。该基准测试侧重于用NVLink上的直接CUDA内核替换PyTorch + NCCL,解决了经常成为AI推理瓶颈的关键通信开销。

  17. COMMENTARY · CL_86026 ·

    用户寻求关于 llama.cpp 中双 GPU 非对称推理的优化建议

    一位用户在 r/LocalLLaMA 子版块上寻求关于优化非对称双 GPU 配置性能的建议。他们拥有一块 12GB 显存的 3080 Ti 和一块 20GB 显存的 3080,当整个模型和缓存无法完全放入显存时,他们遇到了显著的速度下降。该用户正在尝试使用 llama.cpp 以及各种量化和缓存策略来最大化推理速度。

  18. TOOL · CL_66044 ·

    新的OptCC算法最大限度地减少了网络故障对AllReduce的拖慢

    研究人员开发了OptCC,这是一种旨在提高大规模GPU集群中AllReduce操作效率的新算法,尤其是在发生网络故障时。该算法接近完成时间的理论下限,显著减少了现有容错方法通常会看到的性能下降。实验表明,即使由于网络问题导致带宽大幅损失,OptCC仍能保持接近最优的性能,优于当前最先进的方法。

  19. TOOL · CL_64743 ·

    开发者详述 verl RL 框架内部原理及 NCCL bug

    一位开发者详细介绍了他在使用 ByteDance 的 verl 框架进行 RL 后训练的经历,包括其内部工作原理以及 fork 该项目的挑战。这篇博文涵盖了框架的编排层、资源管理以及维护 fork 所需的工程开销。它还重点介绍了一个与网络接口选择相关的特定 NCCL bug,该 bug 导致多 GPU 测试挂起。

  20. TOOL · CL_62964 ·

    新框架HetCCL提升混合硬件集群上的LLM训练效率

    研究人员开发了HetCCL,一个旨在提高用于训练大型语言模型的异构计算集群中集体通信效率的新框架。该框架通过实现不同供应商硬件之间高效的点对点传输,减少了开销并消除了主机-设备内存复制成本,从而解决了现有系统的局限性。HetCCL创新的边界通信器机制和分层拓扑抽象允许进行供应商无关的归约操作和优化的数据传输,从而带来显著的带宽提升和更快的端到端训练时间。