PulseAugur
中
实时 12:52:29
实体 NVM Express

NVM Express

PulseAugur coverage of NVM Express — every cluster mentioning NVM Express across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
40
90 天内 41
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
关系
情绪 · 30 天

9 天有情绪数据

最近 · 第 1/3 页 · 共 44 条
  1. TOOL · CL_280719 ·

    125B LLM 在 RTX 4090 上以 100 tok/s 速度运行,但需要大量内存

    一种新的模型架构 Qwen 3.8 Flash Next,已展示出在单张 RTX 4090 GPU 上以大约每秒 100 个 token 的速度运行的能力。这是通过采用稀疏的专家混合(MoE)设计实现的,其中每个 token 只激活模型参数的一小部分。该系统名为 Strata,将不常用的参数卸载到系统内存,并利用 NVMe SSD 进行 n-gram 表,从而显著降低了显存需求。然而,要达到这些速度需要大量的系统内存,实际上是在消费级…

  2. TOOL · CL_277757 ·

    133 GB MoE 模型通过 NVMe 流式传输在 8 GB GPU 上运行

    一篇技术博文详细介绍了一种在消费级 8 GB GPU 上运行大型 133 GB 混合专家(MoE)模型 Qwen3.8 Flash-Next 的方法。该技术涉及从 NVMe 存储流式传输模型专家,并利用自定义的 PyTorch 和 Triton 引擎来高效管理数据加载和计算。这种方法实现了每秒 11 个 token 的速度,与模型在参考实现上的性能相当,并且是与 Claude 和 Codex 等模型的 AI 辅助协作开发的。

  3. TOOL · CL_276222 ·

    BiWin推出适用于便携式游戏的2TB CL 100 Mini SSD

    BiWin发布了CL 100 Mini,这是一款超紧凑的15x17毫米NVMe SSD,专为便携式游戏设备设计。这款小巧的驱动器容量高达2TB,并采用PCIe 4.0接口,顺序读取速度达到3700 MB/s,写入速度达到3400 MB/s。虽然最初是为BiWin自家的OneXPlayer系列和GPD Win5等游戏便携设备定制的,但可选的USB-C读卡器配件允许将其用作外部驱动器。

  4. TOOL · CL_259555 ·

    Colibri引擎通过新颖的权重流式传输技术,支持在台式机上运行 744B 参数 LLM

    一款名为 Colibri 的新推理引擎允许用户在标准台式机硬件上运行超大型混合专家(MoE)模型,例如拥有 7440 亿参数的模型。Colibri 并非通过压缩模型来使其适应显存(VRAM),而是采用一种类似于权重即时(JIT)编译器的“放置”策略。模型的密集组件驻留在内存(RAM)中,而大量的专家则根据需要从快速的 NVMe 磁盘存储中流式传输。这种方法能够以每秒一到两个 token 的速率执行海量模型,使其适用于批量分析或注重隐私…

  5. RESEARCH · CL_258435 ·

    1500亿参数MoE模型通过NVMe存储在笔记本上运行,绕过GPU

    研究人员展示了一个1500亿参数的混合专家(MoE)模型,可以直接从标准开发者笔记本的NVMe存储中流式传输。这种设置绕过了对可用GPU的需求,存储驱动器在不到十一秒的时间内为200个token的生成提供了数据。该实验为运行大型AI模型更快存储的优势设定了一个实际的上限。

  6. TOOL · CL_256753 ·

    Colibri推理引擎可在消费级硬件上运行7440亿参数模型

    Colibri,一个C语言推理引擎,可在消费级硬件上运行高达7440亿参数的大型语言模型。它通过将密集层存储在内存中,并在需要时从NVMe存储流式传输路由专家来实现这一点。虽然这种方法会影响批量推理速度,但它满足了对高级AI模型本地执行的重大需求,Colibri在GitHub上迅速获得星标就证明了这一点。

  7. TOOL · CL_254100 ·

    Ollama 模型重新加载问题通过服务器端 keep-alive 设置得到解决

    一位开发者调查了为什么他们的本地 AI 模型表现不一致,发现 Ollama 由于默认的 5 分钟空闲超时而频繁地从磁盘重新加载模型。这个重新加载过程显著增加了延迟,将快速的开发响应变成了缓慢的用户体验。开发者发现,将 `keep_alive` 参数设置为服务器端环境变量 (`OLLAMA_KEEP_ALIVE=24h`) 并优化模型放置(每个 GPU 一个模型,嵌入在 CPU 上)可以将每天的模型加载事件从 214 次大幅减少到 9 次。

  8. TOOL · CL_249940 ·

    SSD 与 HDD:速度与存储容量的对比解析

    在 256GB 固态硬盘 (SSD) 和 1TB 机械硬盘 (HDD) 之间进行选择,取决于用户需求,需要在速度和存储容量之间取得平衡。SSD 由于其电子数据检索方式,为操作系统和应用程序提供显著更快的性能,使其成为响应速度至关重要的系统盘的理想选择。然而,其每千兆字节的成本较高限制了容量,因此适合主要浏览网页、处理文档或使用云存储的用户。相反,1TB HDD 以较低的每千兆字节成本提供更大的存储空间,使其成为存储游戏、照片、视频等大…

  9. TOOL · CL_247018 ·

    Amazon SageMaker HyperPod 添加模型缓存以加速推理

    Amazon SageMaker HyperPod 推出了模型缓存功能,以减少推理冷启动。此功能将模型权重和容器镜像预加载到集群节点上,使 Pod 能够从本地 NVMe 存储访问数据,而不是下载数据。此增强功能旨在提高平台上的推理操作的效率和速度。

  10. TOOL · CL_246638 ·

    Databricks 通过新的计算缓存提升 Lakebase Postgres 速度

    Databricks 增强了 Lakebase Postgres 的计算缓存,旨在提高用户性能并降低延迟。该公司实施了本地文件缓存 (LFC),该缓存与 Postgres 的共享缓冲区协同工作,将频繁访问的数据保留在 DRAM 中。这种新架构可以更有效地利用内存,通过直接从计算节点的内存提供数据,有可能使计算速度加倍并降低延迟。

  11. TOOL · CL_244249 ·

    Debian 13 云安装在工具和漏洞报告方面差异很大

    对 AWS、Azure 和 Google Cloud Platform (GCE) 上 Debian 13 安装的比较显示,默认软件包的可用性和硬件工具集存在显著差异。本地 Debian 13 安装有 1,923 个软件包,而云实例的软件包数量在 328 到 350 个之间。值得注意的是,AWS 和 Azure 在仅使用 NVMe 驱动器的系统上缺少 `nvme-cli` 等基本 NVMe 管理工具,而 GCE 则包含了这些工具以及 …

  12. TOOL · CL_239455 ·

    KVMem 在消费级GPU上虚拟化百万Token的AI Agent工作空间

    研究人员开发了KVMem,一个用于管理AI Agent大上下文窗口的系统,使其能够在消费级GPU上运行高达一百万Token。这种虚拟化技术将溢出的上下文存储为分页KV状态,分布在GPU内存、主机内存和NVMe中,与传统的压缩方法相比,能够更有效地处理长历史记录。KVMem已证明了提高任务成功率和交互响应能力,使得长时运行的Agent能够维护广泛的工作空间。

  13. TOOL · CL_238362 ·

    Kaleidescape推出面向豪华家庭影院的246TB SSD媒体服务器

    Kaleidescape发布了其新款Compact Terra Prime 246TB SSD媒体服务器,专为高端家庭影院系统设计。该服务器可存储多达2300部高比特率的4K电影,并支持25个并发4K流。它使用了两个123TB的Solidigm D5-P5336 SSD,采用紧凑的铝制外壳和静音散热设计。该设备通过2.5 Gbps以太网端口连接,能够快速下载从Kaleidescape高级在线商店购买的电影。

  14. TOOL · CL_229836 ·

    VMware 增强内存分层以应对高昂的硬件成本

    VMware 正在增强其内存分层技术,以应对持续高企的硬件和内存价格。该技术将访问频率较低的数据从昂贵的 DRAM 移至更快的 NVMe 存储,旨在提高 CPU 效率并减少服务器采购需求。该公司计划扩展对更多 VM 类型和平台的支持,包括 Microsoft 的 Radius,其路线图涵盖未来两到三年。

  15. COMMENTARY · CL_228413 ·

    AI训练受元数据而非带宽瓶颈,催生新的存储解决方案

    AI训练性能常受存储而非原始带宽的瓶颈限制,这是由于检查点和数据集操作期间会生成大量小元数据文件。这些元数据操作会压垮存储系统,导致GPU空闲和训练时间延长。解决方案包括能够处理元数据密集型工作负载的横向扩展NAS和并行文件系统,以及用于快速从节点故障中恢复的快速快照功能,从而降低整体的“训练税”。

  16. TOOL · CL_212736 ·

    SanDisk 发布具有 14 PBW 额定值的耐用型 NAS SSD

    SanDisk 推出了新的 NAS 专用 SSD,即 NAS 600 SATA 和 NAS 800 NVMe 系列,专为连续 24/7 运行而设计。顶级 NAS 800 7.68TB 型号拥有令人印象深刻的 14 PBW 耐用性额定值,允许用户在保修期内每天写入高达 7.67TB 的数据,持续五年。这些驱动器的耐用性远高于普通消费级 SSD,价格也相应较高,7.68TB NAS 800 型号售价为 2199.99 美元,预计将于 9 月上市。

  17. TOOL · CL_212516 ·

    LLM 存储延迟容忍度随 GPU 利用率阶梯式变化

    LLM 推理的存储延迟容忍度并非随 GPU 利用率线性下降,而是以阶梯状方式变化。在较高的 GPU 利用率水平(约 90%)下,计算队列饱和,存储延迟成为关键瓶颈。这需要稳定、低延迟的存储响应,而不仅仅是高带宽,以避免 GPU 空闲时间并维持有效的计算。例如,使用 Mingxin FX100 和 480B 模型,增加并发性显著提高了首次令牌生成时间,凸显了存储性能在高利用率 AI 工作负载中的重要性。

  18. TOOL · CL_198824 ·

    Minisforum N5 Pro NAS 评测,搭载 Ryzen AI 9 芯片

    Minisforum N5 Pro,一款五盘位网络附加存储(NAS)设备已接受评测。该 NAS 由 Ryzen AI 9 HX PRO 370 处理器驱动,运行 Ubuntu 26.04 LTS。它配备 NVMe 存储和 10 千兆以太网连接。

  19. TOOL · CL_195554 ·

    AirLLM 通过从磁盘流式传输层,实现 4GB GPU 上的 70B 模型推理

    AirLLM 是一个新项目,它能够在外存(VRAM)非常有限的硬件上运行大型语言模型,例如 70B 参数模型。它通过按需从磁盘顺序加载模型层到 GPU 来实现这一目标,而不是要求整个模型同时装入外存。虽然这大大降低了推理的硬件门槛,但代价是速度显著降低,据报道推理时间比量化本地模型或基于 API 的解决方案慢几个数量级。该项目最适合不需要优先考虑速度的批处理作业或评估,并且由于持续的数据流,它还可能对消费级 SSD 造成显著磨损。

  20. TOOL · CL_189283 ·

    SSD速度对11款游戏性能影响分析

    一项对11款游戏大作的最新分析显示,虽然PCIe 5.0等更快的SSD能带来一些改进,但对游戏性能的实际影响通常很小。该研究比较了SATA和NVMe SSD,并指出PlayStation 5和Xbox Series X|S等游戏主机的进步促使开发者针对SSD进行优化。然而,即使有DirectStorage技术,许多游戏也未能充分利用高端SSD的功能,与旧款或较慢的SSD相比,在加载时间和游戏内资产流方面差异甚微。