PCI Express
PulseAugur coverage of PCI Express — every cluster mentioning PCI Express across labs, papers, and developer communities, ranked by signal.
6 天有情绪数据
-
NVIDIA推出NVLink Fusion,将定制XPUs集成到AI工厂
NVIDIA推出了NVLink Fusion技术,旨在将定制设计的XPUs(eXponential Processing Units)与NVIDIA现有的AI基础设施集成。该解决方案旨在通过提供成熟、高性能的网络和机架级架构来加速AI工厂的开发和部署。NVLink Fusion利用NVLink技术实现加速器之间的高带宽、低延迟通信,并利用NVLink-C2C与CPU进行高效集成,从而降低了构建专业AI硬件的公司的运营风险和上市时间。
-
AI 爱好者寻求多 GPU 设置以进行本地模型推理的建议
r/LocalLLaMA 子版块的一位用户正在寻求有关配置多 GPU 以进行 AI 模型推理的建议。他们目前正在使用 RTX 3090,并考虑添加第二块 GPU,例如 3070,但面临当前主板设置的物理空间限制。用户正在探索替代解决方案,包括外部 GPU 配置和使用 NVMe 存储来存放模型数据。
-
计算、内存和存储领域探索LLM首次响应时间缩减策略
减少大型语言模型(LLM)的首次响应时间(TTFT)对于用户体验和性能至关重要。这涉及到优化四个关键领域:计算、GPU内存、存储和整体架构。FlashAttention和PagedAttention等技术解决了计算和内存管理问题,但它们的有效性受到硬件带宽的限制。扩展GPU内存或将KV Cache分层到更快的存储(如NVMe-oF阵列)可以显著减少长上下文场景下的延迟,明信科技的解决方案就证明了这一点,该方案显示480B模型的TTFT…
-
PCIe P2P 提升消费级NVIDIA GPU上的LLM性能
一位Reddit用户分享了一种方法,通过启用PCI Express点对点(P2P)通信,显著提高了多GPU消费级硬件上大型语言模型的性能。通过使用补丁后的NVIDIA驱动程序和VLLM中的特定环境变量启用P2P,该用户观察到Qwen/Qwen3.6-27B-FP8模型的处理速度大约提高了25%。这种优化对于在具有高RAM带宽的系统上运行多个GPU的用户尤其有益。
-
ASUS Pro WS WRX90E-SAGE SE 工作站主板详览
ASUS Pro WS WRX90E-SAGE SE 主板专为 AMD Threadripper PRO CPU 设计,提供广泛的 PCIe 扩展和 ECC 内存支持。这款工作站级主板并非为典型的游戏设置而设计,而是面向专业、企业级任务。
-
PCIe SSD:内存短缺期间容量优先于速度
在全球内存供应短缺期间,PC配置中PCIe SSD的选择应优先考虑容量而非原始速度。虽然高读/写速度对游戏加载等任务有益,但与GPU或CPU等组件相比,对游戏性能的实际影响很小。对于游戏,尤其是大型现代游戏,拥有足够的存储空间来安装多个游戏比最快的SSD接口更关键。
-
人工智能为数据存储行业带来重大机遇和威胁
随着人工智能的兴起,存储行业面临着双重挑战和机遇。人工智能在推动对更快访问速度和更安全数据恢复的需求的同时,也通过潜在的故障和攻击带来了重大威胁。NVIDIA、AMD和Intel等公司在开发满足这些需求所需的硬件方面发挥着关键作用,而Microsoft、Google和Amazon等云服务提供商则在整合这些技术。OpenAI和Meta也是这个不断发展的格局中的重要实体。
-
依赖感知缓存解决了多 LoRA 服务延迟问题
初创公司为满足特定客户需求而微调大型语言模型时,常常面临不断增长的基础设施成本。一种常见的解决方案是使用多 LoRA 服务,它允许多个微调适配器在单个 GPU 上运行。然而,粗糙的实现会导致 LoRA 权重和 KV 缓存之间的缓存颠簸,从而导致高延迟。通过实现依赖感知缓存管理,将 KV 缓存视为依赖于其特定 LoRA 适配器,可以显著降低延迟。
-
Supermicro 成为定制服务器架构的首选代工厂商
Supermicro 已成为开发独特服务器架构的初创公司的关键代工厂商,超越了标准设计。该公司提供灵活的解决方案,可适应各种 PCIe 拓扑,包括单根和多根复杂配置。Supermicro 最初支持 Intel 和 AMD 处理器,现已将其产品扩展到包括基于 ARM 的平台,为客户提供更多计算基础设施的选择。
-
AMD 发布配备 HBM 和 PCIe 的 Instinct MI350P AI 加速器
AMD 发布了其新款 AI 加速器 Instinct MI350P,该加速器采用了高带宽内存 (HBM) 和 PCI Express 接口。这款加速器旨在增强 AI 和高性能计算任务。MI350P 预计将比其前代产品提供显著的性能提升,以满足日益增长的 AI 模型训练和推理需求。
-
Together AI 通过自动修复和 Slinky 1.0 提高 GPU 集群的可靠性
Together AI 增强了其 GPU 集群,增加了专注于大规模 AI 工作负载的可靠性和运营控制的新功能。这些更新包括被动健康检查,用于在主动使用期间检测硬件和软件的降级;以及一个自动节点修复系统,该系统建议并执行诸如重启或重新配置故障节点之类的操作,关键任务需要人工监督。此外,Together AI 使用 Slinky 1.0 重建了其 Slurm-on-Kubernetes 堆栈,以提高作业调度的稳定性和弹性。
-
新的ATInfer系统提升了消费级设备的本地大语言模型推理性能
一个名为ATInfer的新系统已被开发出来,通过有效利用CPU和GPU资源来提高大语言模型(LLMs)在消费级设备上的性能。该系统在张量粒度上运行,动态调度数据移动和计算以优化性能。评估显示,与现有方法相比,ATInfer可以显著提高吞吐量和GPU利用率,从而改善本地大语言模型部署的用户体验。
-
AI 模型服务加速分解:运行时收益占主导,量化提供微小提升 · 跟踪 2 个来源
一篇新的研究论文详细介绍了一种分解 AI 模型服务中加速的方法,将收益与运行时、内核优化和量化分开。该研究在四块 NVIDIA RTX A5000 GPU 上进行,发现运行时改进约占总加速的三分之二。量化在测试模型中提供的收益较小,最多为 1.5%,但显著增加了支持的并发用户数量。研究还探讨了最佳实例配置,表明工作负载和模型大小决定了分片还是多个独立实例更有效。
-
双 GPU llama.cpp 测试揭示张量并行与流水线并行之间的 PCIe 传输差异
一位 Reddit 用户在双 GPU 设置下使用 llama.cpp 进行了测试,以测量不同并行策略下的 PCIe 传输速度。测试比较了张量并行和流水线并行配置,结果显示张量并行提供了更高的解码速度(47 t/s 对 30 t/s),而流水线并行实现了更快的预填充速度(1250 t/s 对 650 t/s)。用户得出结论,PCIe 延长线对于张量并行设置可能不是一个显著的瓶颈,并建议它们可能是未来硬件扩展的可行选择。
-
MI50 GPU 性能:PCIe 对比 PEX8749 交换卡
Reddit 的 r/LocalLLaMA 子版块上一位用户分享了对两种 MI50 GPU 配置的性能基准测试。第一种设置使用了六个直接通过 PCIe 连接的 MI50,而第二种设置使用了一张 PEX8749 卡来管理四个 MI50,从而为另外两张卡腾出了 PCIe 插槽。在各种测试中,PEX8749 配置在 'pp' 速度上略有下降(不到 1%),但在 'tg' 速度上略有提升(高达 2.8%)。总的来说,两种设置之间的性能差异很小…
-
中国龙芯推出面向中小企业的新一代16核LoongArch服务器CPU
中国龙芯中科公司发布了其新款3C3000服务器处理器,该处理器基于LoongArch架构拥有16个核心。这款40W的芯片支持DDR4 ECC内存,并提供32个PCIe通道,定位于中小企业经济高效的通用计算工作负载。龙芯声称其性能与上一代3C5000型号相当,并且旨在支持中国的国产软硬件生态系统。
-
Rosewill M.2 SSD 克隆器和擦除器创纪录低价至 47 美元
Rosewill 的 M.2 SSD 克隆器和擦除器目前以 47 美元的最低价发售,为 IT 专业人士和家庭用户提供便捷的解决方案。该设备支持离线克隆和擦除 NVMe 驱动器,或通过 USB 3.2 Gen 2x2 连接到 PC 进行克隆和擦除,速度高达 20 Gbps。虽然它采用塑料外壳,但其价格实惠且功能齐全,使其成为管理存储驱动器的实用选择。
-
Meta 因内部数据泄露事件暂停员工追踪 AI 计划
Meta 已暂时中止一项内部 AI 培训计划,该计划追踪员工的电脑活动,包括鼠标移动和击键记录,此前发生了一次重大的数据泄露事件。该计划,名为模型兼容性计划 (MCI),无意中将敏感的员工数据泄露给了整个公司。尽管 Meta 表示没有迹象表明存在不当的外部访问,但此次事件已引发内部强烈反对,并重新点燃了员工对先前抗议强制性监控的隐私担忧。
-
AI板块蓄势待发:算力、PCIe及药物发现引领增长
36氪的多篇报道突显了对AI行业的看好,特别关注了对算力的需求。中信证券和中信建投的分析师预测,随着GLM-5.2和Kimi K2等国内AI模型能力的提升,AI算力将持续增长。报道还强调了PCIe协议和交换机在扩展GPU连接性方面的关键作用,预计PCIe交换机市场将显著增长。此外,AI的进步正在彻底改变药物发现,预计到2035年AI制药市场将达到460亿美元。
-
中国公司打造紧凑型V100 GPU用于AI
一家名为“GPU god”的中国公司开发了NVIDIA V100 GPU的单槽、半高PCIe版本。这张定制设计的显卡保留了V100核心的全部性能,并设计用于被动散热,同时提供更高功率的选项。16GB版本预计零售价低于220美元,另有32GB型号计划推出。