NVM Express
PulseAugur coverage of NVM Express — every cluster mentioning NVM Express across labs, papers, and developer communities, ranked by signal.
9 天有情绪数据
-
SanDisk 发布具有 14 PBW 额定值的耐用型 NAS SSD
SanDisk 推出了新的 NAS 专用 SSD,即 NAS 600 SATA 和 NAS 800 NVMe 系列,专为连续 24/7 运行而设计。顶级 NAS 800 7.68TB 型号拥有令人印象深刻的 14 PBW 耐用性额定值,允许用户在保修期内每天写入高达 7.67TB 的数据,持续五年。这些驱动器的耐用性远高于普通消费级 SSD,价格也相应较高,7.68TB NAS 800 型号售价为 2199.99 美元,预计将于 9 月上市。
-
LLM 存储延迟容忍度随 GPU 利用率阶梯式变化
LLM 推理的存储延迟容忍度并非随 GPU 利用率线性下降,而是以阶梯状方式变化。在较高的 GPU 利用率水平(约 90%)下,计算队列饱和,存储延迟成为关键瓶颈。这需要稳定、低延迟的存储响应,而不仅仅是高带宽,以避免 GPU 空闲时间并维持有效的计算。例如,使用 Mingxin FX100 和 480B 模型,增加并发性显著提高了首次令牌生成时间,凸显了存储性能在高利用率 AI 工作负载中的重要性。
-
Minisforum N5 Pro NAS 评测,搭载 Ryzen AI 9 芯片
Minisforum N5 Pro,一款五盘位网络附加存储(NAS)设备已接受评测。该 NAS 由 Ryzen AI 9 HX PRO 370 处理器驱动,运行 Ubuntu 26.04 LTS。它配备 NVMe 存储和 10 千兆以太网连接。
-
AirLLM 通过从磁盘流式传输层,实现 4GB GPU 上的 70B 模型推理
AirLLM 是一个新项目,它能够在外存(VRAM)非常有限的硬件上运行大型语言模型,例如 70B 参数模型。它通过按需从磁盘顺序加载模型层到 GPU 来实现这一目标,而不是要求整个模型同时装入外存。虽然这大大降低了推理的硬件门槛,但代价是速度显著降低,据报道推理时间比量化本地模型或基于 API 的解决方案慢几个数量级。该项目最适合不需要优先考虑速度的批处理作业或评估,并且由于持续的数据流,它还可能对消费级 SSD 造成显著磨损。
-
SSD速度对11款游戏性能影响分析
一项对11款游戏大作的最新分析显示,虽然PCIe 5.0等更快的SSD能带来一些改进,但对游戏性能的实际影响通常很小。该研究比较了SATA和NVMe SSD,并指出PlayStation 5和Xbox Series X|S等游戏主机的进步促使开发者针对SSD进行优化。然而,即使有DirectStorage技术,许多游戏也未能充分利用高端SSD的功能,与旧款或较慢的SSD相比,在加载时间和游戏内资产流方面差异甚微。
-
KV Cache预取大幅降低LLM推理延迟
一种新的KV Cache数据预取策略已被开发出来,显著降低了大模型推理期间的存储延迟。该方法在明心FX100上使用480B模型进行了测试,推理吞吐量提高了40%,首个token的生成时间缩短了32%。该策略涉及在计算单元需要KV Cache块之前,将其从存储加载到更快的内存层级,这是随着上下文窗口扩展并超出GPU高带宽内存(HBM)容量而进行的关键优化。与KV Cache数据未命中时重新计算相比,这种方法提供了8.6倍到20倍的显著加速。
-
NVMe 为 SSD 增加虚拟化功能,提升虚拟化环境中的存储性能
NVMe 规范已更新,为本地连接的固态硬盘 (SSD) 引入了虚拟化功能。此项增强旨在改善虚拟化环境中的存储管理和性能。此次更新还涉及更广泛的行业趋势,包括 AI 模型开发和云基础设施的进步。
-
KV 缓存分层可提升 LLM 推理速度并降低成本
一种管理大型语言模型推理中 KV 缓存的新方法建议将其视为暖存储层内的高频访问子集,而不是传统的冷热层。这种策略,对于 Qwen3-Coder-480B-FP8 等长上下文模型尤其重要,涉及使用专用的加速层,例如 Mingxin FX100 NVMe-oF 阵列。实测结果表明,这种分层可以将吞吐量提高高达 40%,并将首次令牌延迟时间缩短 30% 以上,从而解决了 LLM 推理中的一个关键瓶颈。
-
亚马逊提供三星2TB SATA SSD 60%折扣
亚马逊正在大幅折扣销售三星2TB SATA SSD,具体型号为870 Evo。此优惠提供了超过60%的零售价折扣,使其成为寻求存储解决方案的消费者的诱人选择。虽然不如NVMe驱动器快,但SATA SSD仍然被认为是各种应用的可靠选择。
-
人工智能为数据存储行业带来重大机遇和威胁
随着人工智能的兴起,存储行业面临着双重挑战和机遇。人工智能在推动对更快访问速度和更安全数据恢复的需求的同时,也通过潜在的故障和攻击带来了重大威胁。NVIDIA、AMD和Intel等公司在开发满足这些需求所需的硬件方面发挥着关键作用,而Microsoft、Google和Amazon等云服务提供商则在整合这些技术。OpenAI和Meta也是这个不断发展的格局中的重要实体。
-
在人工智能驱动的价格上涨中,将旧硬盘重新用作外部存储
随着外部 SSD 价格因人工智能驱动的需求而飙升,一篇来自 Tom's Hardware 的新文章探讨了将旧的内部硬盘重新用作外部存储。测试涉及在高达 80 Gbps 的外壳中使用 SATA SSD、NVMe 硬盘甚至传统硬盘。虽然性能无法与专用的外部硬盘相媲美,但这些 DIY 解决方案可以为基本的备份和文件传输需求提供经济高效的替代方案,尽管像 4K 视频编辑或运行本地 LLM 这样的要求苛刻的任务仍需要更快、更新的硬件。
-
开发者通过社区基准测试优化 MoE 模型文件布局
一位开发者通过根据测量的共激活重新排序专家权重来优化 MoE 模型文件,将磁盘读取次数减少了 2.23 倍。在分享这项工作时,最初的两个优化方案被社区成员使用他们自己的推理引擎所驳斥。当应用于从 SSD 流式传输专家的引擎时,剩余的优化(文件重新排序)被证明是有效的,这证明了社区驱动的基准测试和优化的价值。
-
WekaFS 对比 Ceph 解决AI GPU饥饿问题:一场存储的较量
对WekaFS和Ceph在AI训练管道中解决GPU饥饿问题的有效性进行了比较。WekaFS提供极高的DPDK速度,但软件许可费用高昂;而Ceph则能在100G网络上提供PB级存储,且无厂商锁定。文章还建议在GRUB中使用iommu=pt来修复NVMe CPU自旋锁,并强制要求在Kubernetes环境中,使用CephFS (RWX) 而非RBD来共享LLM权重。
-
Colibri 项目通过磁盘流式传输实现在消费级硬件上运行 744B 参数模型
Colibri 项目开发了一种新颖的磁盘流式传输技术,可以在内存有限的消费级硬件上运行大型语言模型,例如 Z.ai 的 GLM-5.2(拥有 7440 亿参数)。该方法将保留在内存中的密集模型主干与按需从高速 NVMe SSD 流式传输的稀疏专家层分开。虽然初始性能较慢,但随着常用专家被缓存到内存中,吞吐量会显著提高,使其适用于批处理和长时任务。
-
丹佛裸金属服务器提供均衡的美国延迟和高吞吐量
在丹佛部署裸金属服务器通过平衡延迟和提供强大的基础设施,为全美用户群带来了显著优势。丹佛的中心位置可确保到西海岸的延迟低于30毫秒,并优化到东海岸的连接。该基础设施支持高达100Gbps的高吞吐量选项,并能处理AMD EPYC处理器和NVMe阵列等密集硬件配置,受益于高效的冷却。
-
现在可以在消费级笔记本电脑和 PC 上运行巨大的 AI 模型
新的发展使得在消费级硬件上运行大型 AI 模型成为可能,显著降低了本地 AI 开发的门槛。AirLLM 等项目能够让参数量为 700 亿的模型在仅需 4GB VRAM 的 GPU 上运行,而 Colibri 则允许参数量为 7440 亿的模型通过从磁盘流式传输专家来在拥有 25GB RAM 的笔记本电脑上运行。这些进展,以及 wigolo 用于本地网络研究和 code-review-graph 用于上下文管理的工具,使开发人员能够拥有…
-
新的HGA方法可在有限显存下实现长上下文LLM微调
研究人员开发了一种名为分层全局注意力(HGA)的新方法,可在有限显存下高效微调大型语言模型。该技术结合了分段反向传播和分层KV存储,将旧数据卸载到RAM或NVMe,同时将活动段保留在显存中进行区分。将其应用于Qwen3_8B模型,HGA在16 GB Quadro RTX 5000 GPU上成功训练了16,384个token,这是在同一硬件上使用标准密集训练方法不可能实现的壮举。HGA训练的适配器在较短的上下文长度下也表现出与密集训练适…
-
华硕 ROG Strix Aiolos M.2 SSD 硬盘盒降至 59 美元
华硕 ROG Strix Aiolos M.2 SSD 硬盘盒,传输速度高达 20 Gbps,目前在亚马逊上的售价为 59 美元,折扣为 14%。这款免工具硬盘盒支持 NVMe 和 SATA M.2 SSD,并具有可通过软件控制的 RGB 照明。它还包括一个基本版的 ROG SSD Dashboard,用于监控驱动器的健康状况、容量和温度。
-
《龙腾世纪》创作者认为系列已死;Amazon SageMaker 增强推理
《龙腾世纪》系列创作者 David Gaider 认为,由于《龙腾世纪:守望者》表现不佳,该系列很可能已经结束。尽管如此,他表示如果机会出现,他愿意回归该系列。另外,Amazon SageMaker HyperPod 推出了增强企业推理的新功能,包括多层数据捕获、直接从 Hugging Face Hub 部署以及与 NVM Express 和 Route 53 的集成。
-
AWS SageMaker HyperPod 通过新功能提升企业 AI 推理能力
Amazon SageMaker HyperPod 推出了新功能,以增强生成式 AI 工作负载的企业推理能力。这些更新包括在推理管道的各个节点改进数据捕获能力,提供更强的可观测性和可审计性。该平台现在支持直接从 Hugging Face 等社区中心进行部署,并内置了受控访问和版本固定功能。通过 NVMe 存储降低延迟以提升性能,并通过细粒度的 IAM 权限和自动 DNS 管理增强安全性。