Sapphire Rapids
PulseAugur coverage of Sapphire Rapids — every cluster mentioning Sapphire Rapids across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
Intel Sapphire Rapids 用户报告 DeepSeek-V4 模型性能问题
Reddit 的 r/LocalLLaMA 子版块上一名用户在使用 Intel Sapphire Rapids 工作站运行 DeepSeek-V4-Flash-0731 模型时,遇到了显著的内存带宽限制。尽管拥有理论带宽为 153 GB/s 的 DDR5-4800 RDIMM,用户实际获得的带宽仅为 36-40 GB/s,导致推理速度仅为每秒 3-4 个 token。用户咨询了 AI 助手,助手建议调整 CPU 线程和批处理设置不匹配…
-
研究员创建最慢x86 CPU指令“耻辱榜”
硬件研究员Christopher Domas发起了一个项目,旨在找出最慢的单条x86指令,并创建一个排行榜来排名这些性能瓶颈。目前排名第一的是`fxrstor64`指令,它执行时耗费了惊人的1980亿周期,即62秒,用于从内存中恢复512字节的SIMD寄存器状态。Domas通过操纵内存映射I/O并压垮CPU的PCIe总线,故意减慢指令的执行速度来实现这一目标。未来计划为ARM和RISC-V架构创建排行榜,并制定特定规则以确保只测量单条指令的延迟。
-
mistral.rs v0.9.0 的 CPU 解码速度比 llama.cpp 快 1.8 倍
mistral.rs 项目已发布 0.9.0 版本,在大型语言模型的 CPU 解码方面展示了显著的性能提升。基准测试显示,在 x86 和 ARM 架构上,mistral.rs 的速度比 llama.cpp 快 1.8 倍。这些优化旨在惠及所有模型,并适用于包括支持 AVX2、AVX512 和 NEON 的各种 CPU。