AVX-512
PulseAugur coverage of AVX-512 — every cluster mentioning AVX-512 across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新的RVANNS引擎提升了RISC-V上的近似最近邻搜索性能
研究人员开发了RVANNS,这是一个针对RISC-V处理器优化的近似最近邻搜索新引擎。该系统采用混合精度索引和局部感知图遍历,通过减少数据转换开销和提高缓存效率来提升性能。当集成到Milvus向量数据库中时,RVANNS在吞吐量和能效方面均显著优于现有的CPU和GPU基线。
-
开发者为扭蛋游戏构建定制 Rust 机器学习模拟器
一位开发者创建了 Talos-XII,一个用于游戏《明日方舟:终末地》扭蛋系统的命令行模拟器。该模拟器使用了一个定制的自动微分引擎和一小型神经网络栈,包括 MLP、Dueling DQN 和 PPO,来模拟游戏的不确定性和决策制定,而不是依赖静态概率表。该项目完全用 Rust 构建,不依赖 PyTorch 或 TensorFlow 等外部机器学习框架,并支持运行时 SIMD 分派以优化跨不同 CPU 架构的性能,并可选支持 GPU。开…
-
mistral.rs v0.9.0 的 CPU 解码速度比 llama.cpp 快 1.8 倍
mistral.rs 项目已发布 0.9.0 版本,在大型语言模型的 CPU 解码方面展示了显著的性能提升。基准测试显示,在 x86 和 ARM 架构上,mistral.rs 的速度比 llama.cpp 快 1.8 倍。这些优化旨在惠及所有模型,并适用于包括支持 AVX2、AVX512 和 NEON 的各种 CPU。
-
据报道,英特尔Nova Lake CPU将在所有核心上恢复AVX-512支持
英特尔即将推出的Nova Lake CPU预计将恢复AVX-512支持,该功能自Alder Lake一代以来一直缺失。最新的Linux内核补丁表明,性能核(P-cores)和能效核(E-cores)都将原生支持512位执行。此举解决了现代AI工作负载和其他受益于AVX-512指令的计算密集型任务的一个重大限制。
-
开发者将 C LLM 推理速度提升 25 倍,达到 DRAM 限制
一位开发者详细介绍了优化 C 语言 LLM 推理引擎 Project Zero 的过程,以在 CPU 上实现显著更快的性能。该项目最初以 1.4 tokens/秒的速度运行 BitNet b1.58,经过九个月的迭代,在 Xeon 处理器上达到了 36.25 tokens/秒,接近 DRAM 带宽上限。优化过程包括移除 ML 框架、利用 AVX-512 和 VNNI 等特定 CPU 指令,以及解决内存带宽和散热限制等硬件瓶颈。
-
Spring AI和JEP 489支持更快、更便宜的本地LLM重排
本文详细介绍了一种通过对检索到的文档进行本地重排来优化检索增强生成(RAG)性能的方法。文章提倡使用Java的JEP 489 Vector API进行SIMD加速的相似性计算,并将BGE-Reranker-v2-m3等量化交叉编码器模型直接部署在Spring Boot应用程序中。这种方法旨在降低将重排任务发送到外部LLM API所带来的延迟和成本。
-
PHP-ORT 为 PHP 开发者带来机器学习推理能力
一个名为 PHP-ORT 的新基础设施项目旨在将机器学习推理能力直接引入 PHP,PHP 是网络上很大一部分使用的服务器端语言。这一发展旨在使数百万 PHP 开发者能够在不依赖外部服务或切换编程语言的情况下,将 AI 功能集成到他们的应用程序中。PHP-ORT 提供核心 Tensor API、高性能数学库,并与 ONNX 集成以实现直接推理,有望显著提速。