PulseAugur
实时 13:22:39
实体 NVIDIA GPUDirect Storage

NVIDIA GPUDirect Storage

PulseAugur coverage of NVIDIA GPUDirect Storage — every cluster mentioning NVIDIA GPUDirect Storage across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. TOOL · CL_212516 ·

    LLM 存储延迟容忍度随 GPU 利用率阶梯式变化

    LLM 推理的存储延迟容忍度并非随 GPU 利用率线性下降,而是以阶梯状方式变化。在较高的 GPU 利用率水平(约 90%)下,计算队列饱和,存储延迟成为关键瓶颈。这需要稳定、低延迟的存储响应,而不仅仅是高带宽,以避免 GPU 空闲时间并维持有效的计算。例如,使用 Mingxin FX100 和 480B 模型,增加并发性显著提高了首次令牌生成时间,凸显了存储性能在高利用率 AI 工作负载中的重要性。

  2. TOOL · CL_183926 ·

    明玕FX100存储解决方案加速视频推理,降低延迟

    明玕的FX100存储解决方案解决了实时视频推理中的延迟瓶颈,这些瓶颈通常由存储和数据路径限制引起,而非GPU计算能力。该系统采用分层KV缓存方法,将热数据放在GPU HBM中,温数据放在本地NVMe上,冷数据放在NVMe-oF阵列上。该策略显著提高了吞吐量,并减少了长上下文工作负载的首次令牌生成时间(TTFT),吞吐量提升高达40%,TTFT提升32%。

  3. TOOL · CL_182033 ·

    NVIDIA通过Vera CPU和开放的cuFile API推动AI存储发展

    为了满足大型数据集和上下文窗口日益增长的需求,NVIDIA正在推进AI存储基础设施的建设。该公司正在推出新的存储解决方案,包括NVIDIA Vera CPU,与传统的x86处理器相比,它在数据压缩和加密方面提供了显著更高的吞吐量。NVIDIA还将其cuFile API开源,使GPU能够直接与存储交互,并将数据访问速度提高到微秒级别。这些努力是Storage-Next计划的一部分,旨在为GPU驱动的存储建立开放的行业标准,并提高AI数据…

  4. TOOL · CL_64082 ·

    AWS 使用 GPUDirect Storage 和 FSx 缩短 LLM 加载时间

    AWS 推出了一种新方法,可以显著加快大型语言模型加载到 GPU 实例的速度。通过将 NVIDIA GPUDirect Storage (GDS) 与 Amazon FSx for Lustre 结合使用,模型权重可以直接加载到 GPU 内存中,绕过 CPU 和 PCIe 总线。此优化将模型加载时间从几分钟缩短到几秒钟,从而减少了首次令牌(TTFT)的总时间,并使昂贵的 GPU 资源能够更快地用于推理。