SIMD
PulseAugur coverage of SIMD — every cluster mentioning SIMD across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
探索 Rust SIMD 在 GPU 加速方面的能力
本文探讨了在图形处理单元 (GPU) 上实现 Rust 的单指令多数据 (SIMD) 功能。文章深入研究了利用 SIMD 在 GPU 上进行并行处理的技术细节,这种技术可以显著提高某些类型计算的性能。讨论可能涵盖使用 Rust 进行 GPU 编程的优势和挑战,并可能强调其安全特性和性能优势。
-
开发者发布 Rust 版 SIMD Viterbi 解码器;文章质疑 FIPS 140-3 的安全性
一位开发者用 Rust 实现了一个 SIMD Viterbi 解码器,重新启动了一个最初用 C 语言构建的项目。新版本利用了 Rust 标准的 SIMD 功能来提高性能。另外,一篇文章讨论了 FIPS 140-3,认为它不能提供真正的安全保证,并且审计员也意识到了它的局限性。
-
Quotient Tree Arithmetic 引入,用于高效的机器学习计算
研究人员引入了商数树算术(QTA),一个新颖的计算框架,旨在将值表示为延迟商数对。该方法旨在提高计算效率和准确性,特别是在机器学习应用中。QTA 通过结构化方式防止梯度下溢,并通过链式法则磁带折叠实现高效的梯度计算,可能减少共享权重批次的存储需求。
-
ExaGEMM 框架通过低比特 GEMM 优化提升 CPU 机器学习推理性能
研究人员开发了 ExaGEMM 框架,旨在优化 CPU 上机器学习推理的低比特通用矩阵乘法 (GEMM) 操作。该框架解决了高效执行不适合传统 CPU 架构的低比特精度权重和激活的挑战。通过共同探索参数化内核和轻量级 SIMD 指令集支持,ExaGEMM 显著减小了最优配置的搜索空间,并为特定的 ML 模型和 CPU 目标生成定制化解决方案。该系统展示了显著的延迟改进,特别是在混合精度 LLM 工作负载方面,与纯软件方法相比,速度提升…
-
ExaGEMM 框架通过低比特 GEMM 优化提升 CPU 机器学习推理性能 · 跟踪 2 个来源
研究人员开发了 ExaGEMM,这是一个旨在优化传统 CPU 上机器学习推理的低比特通用矩阵乘法 (GEMM) 操作的框架。该框架解决了有效执行通常不适合标准 CPU 架构的超低比特精度计算的挑战。ExaGEMM 共同设计了参数化内核和轻量级 SIMD 指令集架构 (ISA) 支持,分析了寄存器可行性、计算成本和硬件开销等因素,以显著缩小搜索空间。与纯软件基线相比,该系统在机器学习模型的延迟方面实现了 13.29 倍的提升,特别突出了…
-
Spring AI和JEP 489支持更快、更便宜的本地LLM重排
本文详细介绍了一种通过对检索到的文档进行本地重排来优化检索增强生成(RAG)性能的方法。文章提倡使用Java的JEP 489 Vector API进行SIMD加速的相似性计算,并将BGE-Reranker-v2-m3等量化交叉编码器模型直接部署在Spring Boot应用程序中。这种方法旨在降低将重排任务发送到外部LLM API所带来的延迟和成本。