PulseAugur
中
实时 19:15:04
实体 AVX2

AVX2

PulseAugur coverage of AVX2 — every cluster mentioning AVX2 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
8
90 天内 8
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
关系
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 10 条
  1. TOOL · CL_275377 ·

    Google的Yggdrasil决策树通过新的直方图技术得到提升

    研究人员开发了矢量化动态直方图,以显著加快稀疏斜(SPO)决策树的训练速度。这些新方法已集成到Google的Yggdrasil Decision Forests库中,将SPO-RF的训练效率提高了2倍,SPO-GBT提高了1.6倍,使得SPO-RF的训练时间与轴对齐随机森林相当。该优化在海量数据集上进行了评估,并且该实现已开源。

  2. COMMENTARY · CL_242326 ·

    开发者优先考虑运行时检查而非 LLM 二进制文件的构建配置

    一位开发者在 llama.cpp 二进制文件的构建系统配置与其实际运行时能力之间遇到了差异。两组笔记提供了关于启用 AVX2 的冲突建议,其中一组认为它被禁用并且是性能瓶颈,而另一组则声称它被故意禁用以留出系统空间。两者都不正确,因为运行中的二进制文件证实 AVX2 一直处于启用状态。此事件导致了证据等级的修订,在验证操作事实时,优先考虑运行时伪影检查而非构建系统考古。

  3. COMMENTARY · CL_242329 ·

    旧硬件上的大型语言模型推理揭示了不断演变的真相

    作者详细介绍了在旧硬件上运行大型语言模型推理的经验,并将其与科学理解的不断演变进行了类比。起初,他们对最佳配置持有几种假设,例如禁用 Flash Attention 或强制使用特定内核,但这些假设后来被实际应用和硬件限制所推翻。学到的关键经验包括通过受控实验、阅读源代码以及随着时间的推移观察生产证据来验证主张的重要性,而不是仅仅依赖社区的主张或临时测量。这种专注于理解底层机制而非仅仅关注结果的严谨方法,被认为是性能工程的真正产物。

  4. TOOL · CL_228303 ·

    llama.cpp 增加 AVX2 支持以加速提示处理

    一项提交给 llama.cpp 项目的拉取请求为 IQ 模型引入了 AVX2 指令集支持,以加速提示处理,尤其是在大批量处理时。此优化旨在提高 CPU 上本地大型语言模型推理的速度。该更改由用户 bartowski1182 提交,是增强 llama.cpp 库性能的持续努力的一部分。

  5. TOOL · CL_210933 ·

    llama.cpp PR 通过 AVX2 优化提升 IQ 模型提示处理速度 · 跟踪 1 个来源

    llama.cpp 项目的一个拉取请求引入了 AVX2 优化,以显著加速 IQ 模型(尤其是在大批量处理时)的提示处理。基准测试显示速度大幅提升,某些配置下的每秒 token 数提升超过 1000%。这些优化对于 IQ3_S 和 IQ3_XXS 等特定量化类型最为显著,展示了大型模型处理效率的巨大提升。

  6. TOOL · CL_130651 ·

    mistral.rs v0.9.0 的 CPU 解码速度比 llama.cpp 快 1.8 倍

    mistral.rs 项目已发布 0.9.0 版本,在大型语言模型的 CPU 解码方面展示了显著的性能提升。基准测试显示,在 x86 和 ARM 架构上,mistral.rs 的速度比 llama.cpp 快 1.8 倍。这些优化旨在惠及所有模型,并适用于包括支持 AVX2、AVX512 和 NEON 的各种 CPU。

  7. RESEARCH · CL_66784 ·

    Intel 发布 Xeon 6+ 搭载 E 核,放弃超线程

    Intel 推出了其新款 Xeon 6+ "Clearwater Forest" 处理器,该处理器采用基于 18A 工艺的 E 核,并拥有更高的核心数量。该公司特意在这些 E 核服务器部件中省略了超线程,转而专注于为横向扩展工作负载提供核心密度。Intel 还指出,对 AI 处理的需求导致一些 GPU 舰队在等待 CPU 时处于闲置状态,并且 18A 晶圆分配目前非常紧张。

  8. TOOL · CL_18759 ·

    StateSMix 压缩器使用 Mamba SSM 和 N-gram 进行在线无损压缩

    研究人员开发了 StateSMix,这是一种新颖的无损压缩算法,它利用 Mamba 风格的状态空间模型 (SSM) 结合稀疏 N-gram 上下文混合。该系统对正在压缩的数据进行逐个 token 的训练,无需预训练权重或 GPU。StateSMix 在 enwik8 基准测试上实现了具有竞争力的压缩率,比 xz (LZMA2) 高出 8.7%。该实现完全用 C 语言编写,可在标准硬件上处理大约每秒 2,000 个 token。

  9. RESEARCH · CL_03577 ·

    llama.cpp 和 ik_llama.cpp 为节省 VRAM 添加 FP4 推理支持

    llama.cpp 和 ik_llama.cpp 项目均已集成对 FP4(4位浮点)推理的支持,这是模型量化的一项重大进展。llama.cpp 现在包含 NVFP4,一种 Nvidia 特定的格式,而 ik_llama.cpp 支持 MXFP4,遵循 MX 联盟标准。预计这些进展将大幅降低 VRAM 需求,一旦模型支持跟上,就能在消费级硬件上运行更大的模型。

  10. TOOL · CL_17743 ·

    PHP-ORT 为 PHP 开发者带来机器学习推理能力

    一个名为 PHP-ORT 的新基础设施项目旨在将机器学习推理能力直接引入 PHP,PHP 是网络上很大一部分使用的服务器端语言。这一发展旨在使数百万 PHP 开发者能够在不依赖外部服务或切换编程语言的情况下,将 AI 功能集成到他们的应用程序中。PHP-ORT 提供核心 Tensor API、高性能数学库,并与 ONNX 集成以实现直接推理,有望显著提速。