PulseAugur
实时 04:02:53
实体 NVLink

NVLink

PulseAugur coverage of NVLink — every cluster mentioning NVLink across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
6
90 天内 24
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 3
层级分布 · 90 天
主题
关系
情绪 · 30 天

5 天有情绪数据

最近 · 第 1/2 页 · 共 24 条
  1. TOOL · CL_214262 ·

    AI 爱好者寻求多 GPU 设置以进行本地模型推理的建议

    r/LocalLLaMA 子版块的一位用户正在寻求有关配置多 GPU 以进行 AI 模型推理的建议。他们目前正在使用 RTX 3090,并考虑添加第二块 GPU,例如 3070,但面临当前主板设置的物理空间限制。用户正在探索替代解决方案,包括外部 GPU 配置和使用 NVMe 存储来存放模型数据。

  2. TOOL · CL_209852 ·

    TPU与Mooncake合作进行推理优化

    SemiAnalysis报道称,张量处理单元(TPU)正与开源推理优化库Mooncake合作。此次合作旨在将TPU的能力集成到Mooncake Store中,从而提高生产推理的总拥有成本效益。初步实现将利用TENT在横向扩展网络上进行KVCache DRAM P2P池化,而不是使用ICI/NVLink。

  3. TOOL · CL_202104 ·

    二手GPU购买指南:优先考虑本地LLM推理的显存

    在购买用于本地LLM推理的二手GPU时,应将显存容量置于所有其他规格之上,因为内存不足将导致模型完全无法运行。显存带宽是第二重要的因素,而核心数量和其他功能则重要性大大降低。请考虑GPU的驱动程序支持周期,因为随着时间的推移,较旧的显卡可能与较新的CUDA工具包和推理软件不兼容。NVIDIA RTX 3090因其24 GB GDDR6X显存和NVLink连接器而备受关注,尽管后者在推理中的实用性有限。

  4. TOOL · CL_199134 ·

    Anyscale Ray 优化 NVIDIA GB300 NVL72 的 NVLink 域放置

    Anyscale 为其 Ray 框架引入了 NVLink 域感知放置组,旨在优化 NVIDIA GB300 NVL72 系统的性能。这些新的放置组确保紧密耦合的 actor 被调度在同一个 NVLink 域内,NVLink 域是一个连接 72 个 NVIDIA Blackwell GPU 和 36 个 NVIDIA Grace CPU 的机架级互连。这种拓扑感知调度原语旨在最大化 GPU 通信并保留系统意图,它建立在先前节点级放置策略的基础上。

  5. TOOL · CL_179869 ·

    AI 生成虚假漏洞污染安全管道

    人工智能现已被用于生成虚假漏洞,污染了通用漏洞披露 (CVE) 管道。这一趋势令安全研究人员感到担忧,他们指出,AI 生成的漏洞可能会压垮用于跟踪和管理真实安全缺陷的系统。该问题凸显了网络安全领域的新挑战,因为恶意行为者甚至粗心的用户都可以利用 AI 来制造噪音,分散对真正威胁的注意力。

  6. TOOL · CL_178265 ·

    新研究通过拓扑感知数据移动优化解耦LLM推理

    一篇新研究论文介绍了一个拓扑感知数据移动系统,旨在优化解耦LLM推理。该系统通过发现互连层级和选择最优传输方法来解决在独立GPU池之间传输KV缓存的挑战。它采用了流水线式逐层传输、面向混合专家模型的NVLink域感知放置以及CXL 3.0内存扩展器,以显著降低传输延迟。

  7. TOOL · CL_155509 ·

    Nvidia 展示 Vera Rubin NVL72 机架运行 OpenAI 工作负载

    Nvidia 独家展示了其工程超级实验室的内部情况,展示了 Vera Rubin NVL72 机架系统的运行。该实验室位于 Nvidia 总部附近,旨在让工程师测试和演示新硬件,包括 Vera CPU 及其与下一代 AI 平台的集成。实验室展示了运行 OpenAI 工作负载的机架,特别提到了 GPT‑Rosalind 模型,并演示了 800VDC 等先进的供电系统。

  8. SIGNIFICANT · CL_155515 ·

    NVIDIA Vera Rubin平台全球扩展,提升AI工厂效率 · 追踪4个来源

    NVIDIA宣布其专为大规模AI工厂设计的Vera Rubin平台已在全球范围内扩展并加速部署。该系统通过七个芯片和五个机架托盘的极端协同设计构建,旨在提供高能效比和最低的代币成本。CoreWeave等合作伙伴的早期基准测试显示,与前几代相比,吞吐量有了显著提升。Vera Rubin平台正在被主要云服务提供商部署,并为欧洲新的AI基础设施项目提供支持,包括与Microsoft和Mistral的合作。

  9. TOOL · CL_153102 ·

    NVIDIA NVLink 以扩展网络为目标,进军 AI 工厂

    NVIDIA 的 NVLink 技术正被定位为 AI 工厂的关键网络解决方案。它旨在满足大规模 AI 工作负载和复杂模型训练日益增长的需求。该技术旨在实现 AI 驱动自动化所必需的可扩展计算能力。

  10. SIGNIFICANT · CL_144221 ·

    英伟达CEO否认Vera Rubin AI平台延迟,称已“大量”生产

    英伟达CEO黄仁勋否认了该公司即将推出的Vera Rubin AI平台生产延迟的说法,并表示该平台已投入生产,将“大量”交付。尽管黄仁勋确认了平台的就绪状态,但有报道称,像Kyber NVL144这样的特定机架规模系统可能会因其PCB中板的制造复杂性而推迟到2028年。英伟达方面表示,尽管存在这些特定的系统级挑战,但其整体产品路线图保持不变。

  11. RESEARCH · CL_141209 ·

    AI 模型服务加速分解:运行时收益占主导,量化提供微小提升 · 跟踪 2 个来源

    一篇新的研究论文详细介绍了一种分解 AI 模型服务中加速的方法,将收益与运行时、内核优化和量化分开。该研究在四块 NVIDIA RTX A5000 GPU 上进行,发现运行时改进约占总加速的三分之二。量化在测试模型中提供的收益较小,最多为 1.5%,但显著增加了支持的并发用户数量。研究还探讨了最佳实例配置,表明工作负载和模型大小决定了分片还是多个独立实例更有效。

  12. COMMENTARY · CL_137833 ·

    LocalLLaMA 用户讨论用于 LLM 任务的 SXM2 GPU 成本

    一位 Reddit 用户正在咨询使用两块 NVIDIA SXM2 GPU(可能是 V100 或 A100)进行本地大型语言模型 (LLM) 任务的成本和可行性。该用户特别想知道是否可以在这些 GPU 的售后主板上使用 NVLink,并正在寻求相关经验、后悔之处以及与消费级设置的成本比较。

  13. TOOL · CL_107109 ·

    前沿大语言模型在多GPU内核生成方面遇到困难,新基准测试揭示

    一项名为ParallelKernelBench (PKB) 的新基准测试已被开发出来,用于评估前沿大语言模型生成高效多GPU内核的能力。对GPT-5.5、Gemini 3 Pro和Opus 4.7等模型的测试显示出显著的性能差距,只有不到三分之一的问题得到正确解决,而其中只有不到四分之一的性能优于简单的基线。该基准测试侧重于用NVLink上的直接CUDA内核替换PyTorch + NCCL,解决了经常成为AI推理瓶颈的关键通信开销。

  14. RESEARCH · CL_104417 ·

    英伟达推出Vera Rubin超级计算平台,用于AI和HPC

    英伟达推出了其Vera Rubin超级计算平台,专为气候建模和能源勘探等要求苛刻的HPC和AI工作负载而设计。该平台集成了Rubin GPU和Vera CPU,采用NVLink、InfiniBand和液冷技术,以实现高密度和高性能。多家制造商将提供基于该架构的系统,预计将于2026年底上市。

  15. SIGNIFICANT · CL_104418 ·

    NVIDIA Vera Rubin NVL4 系统将于 2026 年第四季度推出,AI 算力达 7 百亿亿次 · 追踪 2 个来源

    NVIDIA 发布了其 Vera Rubin NVL4 系统,专为气候建模和流体动力学等要求严苛的 HPC 和 AI 工作负载而设计。该平台集成了 Rubin GPU 和 Vera CPU,采用 NVLink、InfiniBand 和液冷技术,实现统一设计。它提供超过 7 百亿亿次的 AI 算力和约 5 千万亿次 FP64 科学计算能力,每机架密度高达 144 个 GPU。包括 Dell、HPE 和 Supermicro 在内的主要制…

  16. RESEARCH · CL_103715 ·

    Upscale AI 以 20 亿美元估值融资 1.9 亿美元,用于构建 AI 网络架构

    Upscale AI 是一家专注于为 AI 数据中心构建网络基础设施的初创公司,已获得 1.9 亿美元 A-1 轮融资,公司估值为 20 亿美元。本轮融资由 Premji Invest 领投,使 Upscale AI 在 18 个月内的总融资金额达到 5 亿美元。该公司旨在创建一个开放标准的网络架构,使不同制造商的 AI 芯片能够高效通信,从而解决当前 AI 基础设施的关键瓶颈。包括 Nvidia 和 Salesforce Ventu…

  17. TOOL · CL_106207 ·

    NVIDIA Blackwell 平台主导 MLPerf 训练 6.0 基准测试

    NVIDIA 的 Blackwell 平台在 MLPerf 训练 6.0 基准测试中创下新纪录,在所有七项测试中均取得最快成绩。该平台展示了强劲的扩展性,拥有多达 8,192 个 GPU 的集群在训练大型语言模型时显示出显著的加速效果。这一性能凸显了高带宽互连(如 NVLink)和低精度计算对于高效大规模 AI 训练的重要性。

  18. TOOL · CL_98292 ·

    Nvidia H100 GPU 定价及 2026 年替代方案

    2026 年,Nvidia H100 GPU 仍是 AI 基础设施的关键组成部分,购买价格从 30,000 美元到 40,000 美元以上不等。云租赁成本差异很大,专业 GPU 云比 AWS、Azure 和 Google Cloud 等超大规模云服务商提供更低的费率。H200 和 B200 等新型号也已上市,提供更大的内存和有竞争力的定价,尤其适用于内存密集型推理任务。

  19. RESEARCH · CL_94829 ·

    NVIDIA Blackwell 平台在 MLPerf 训练 6.0 基准测试中占据主导地位 · 跟踪 4 个来源

    NVIDIA 的 Blackwell 平台在 MLPerf 训练 6.0 行业标准测试的所有七项基准测试中均取得了最佳性能。该平台展示了最快的训练时间和最大的训练规模,使用了多达 8,192 个 GPU。这一成功凸显了该平台通过先进的硬件和网络功能加速 AI 模型开发和降低训练成本的能力。

  20. TOOL · CL_64488 ·

    RTX Spark 内存带宽修正低于 600GB/s

    关于 RTX Spark 内存带宽的报道已被修正,新信息表明其不具备 600GB/s 的带宽。该数字实际上指的是 NvLink 速度,而非内存带宽。此前报道了错误带宽数据的几家媒体已进行更正。