SDCBP
PulseAugur coverage of SDCBP — every cluster mentioning SDCBP across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
llama.cpp 发布带来 OpenVINO 更新、Vulkan、GGUF 和 SYCL 改进
llama.cpp 项目发布了多个更新,包括 b11024 版本,该版本更新了 OpenVINO 2026.4 并修复了各种编译器警告。其他近期版本,如 b11022 和 b11020,分别改进了 Vulkan 支持和 DeepSeek 模型的消息分隔符解析。b11019 版本解决了 GGUF 文件对齐和 LoRA 加载问题,而 b11013 解决了 Vulkan 着色器中的缓冲区对齐问题。早期的更新,如 b11017 和 b1101…
-
AI与HPC通过Triton和SYCL的Stencil计算实现融合
本文通过Stencil计算的视角探讨了AI与高性能计算(HPC)的交叉领域。文章重点介绍了向量外积等技术以及Triton编程模型如何应用于优化这些计算,而这些计算对于许多科学模拟和AI工作负载至关重要。文章还提到了SYCL标准,作为在该领域实现跨不同硬件架构可移植性的一种方式。
-
llama.cpp 发布更新,修复性能和稳定性问题 · 跟踪 9 个来源
llama.cpp 项目发布了多个更新,包括 0.4.1 版本,该版本解决了跨不同平台的各种性能和稳定性问题。值得注意的更改包括对 SYCL 后端的优化、CPU 堆损坏的修复以及对缺乏 BF16 硬件加速的 CUDA 设备的后备机制。这些更新旨在提高在各种硬件上运行语言模型的效率和可靠性。
-
AI 系统生成专用 GPU 内核以实现极致效率
研究人员正在开发优化 GPU 内核的先进方法,这对于高效的 AI 模型推理至关重要。一种名为 KernelFoundry 的方法使用具有质量多样性搜索和元提示进化的进化框架来生成 SYCL 和 CUDA 内核,在 KernelBench 上实现了平均 2.3 倍的速度提升。另一个系统 Proteus 专注于极致的专业化,通过生成针对特定模型大小和运行时条件定制的内核,从而生成比 vLLM 中的内核快 1.8–5.2 倍的 Qwen 3…
-
llama.cpp PR 提升 Intel GPU 和 x86 CPU 性能
llama.cpp 项目的一个拉取请求(PR)为量化 KV 缓存解码带来了显著的性能提升。一项更改针对 Intel Battlemage GPU,通过 SYCL 内核切换,在长上下文长度下实现了高达 169% 的解码速度提升。另一项优化侧重于 x86 CPU,为 Q2_0 量化实现了一个 VNNI 路径,解码性能提升了 3-3.6 倍。尽管这些改进在基准测试中显示出有希望的结果,但它们目前仍处于开放的拉取请求状态,需要在各种硬件配置上…
-
llama.cpp 发布包含服务器改进和性能优化 · 跟踪 8 个来源
llama.cpp 项目发布了多个更新,包括 b10331 版本,该版本通过正确报告隔离工作目录来改进服务器功能。其他近期版本,如 b10330 及更早版本,则侧重于 CUDA 操作的性能优化、SYCL 的错误修复以及跨 macOS、Linux、Android 和 Windows 等各种平台的通用系统兼容性。这些更新反映了 llama.cpp 库在高效本地 LLM 部署方面的持续开发和完善。
-
llama.cpp PR 缓存 MoE 专家以加速本地 AI 推理 · 跟踪 4 个来源
llama.cpp 的一项新拉取请求引入了一种在 GPU 上缓存常用专家混合(MoE)层的方法,通过将 Qwen3.6-35B-A3B 等模型在显存有限的消费级硬件上的推理速度最高提升 2 倍。然而,这种优化并非普遍适用,由于开销原因,在某些情况下甚至可能降低性能。同时,llama.cpp 还迎来了其他更新,包括增强了对 Intel GPU 的 SYCL 支持,改进了 iGPU 和 WebGPU F16 性能,并为聊天模型引入了工具调…
-
llama.cpp 发布多个更新,改进性能和构建
llama.cpp 项目发布了多个更新,包括 b10567 版本,该版本为 macOS、Linux、Android 和 Windows 提供了 CI 改进和各种构建选项。之前的版本如 b10566 和 b10549 分别引入了版本升级和张量分割功能。其他更新解决了 b10539 中的 Vulkan 量化计算、b10545 和 b10538 中的 Metal 性能优化以及 b10536 中的服务器端模型加载等具体问题。b10537 版本…
-
llama.cpp 通过性能优化增强了对 SYCL/Intel GPU 的支持
llama.cpp 项目发布了多项更新,增强了其对 SYCL 和 Intel GPU 的支持。这些更新包括对使用 XMX 引擎和 oneDNN 图形 API 的 Flash Attention 的优化,显著加快了 Qwen3.6-27b 等模型的推理速度。此外,这些更改还解决了 USM 系统分配的缓冲区大小最小值问题,并引入了对 OP XIELU 和 fp16 conv2d_dw 内核类型等新操作的支持。
-
llama.cpp 发布多个更新,支持跨平台优化
llama.cpp 项目发布了多个更新,包括 b10106、b10105、b10108、b10099、b10098、b10094、b10093、b10092、b10091 和 b10103 版本。这些发布在不同平台和硬件加速器上引入了各种改进和修复。值得注意的更新包括对 CUDA、Metal、Hexagon 和 OpenVINO 的增强,以及对 DeepSeekv4 等特定模型模板的修复,并改进了参数解析和内存管理。
-
llama.cpp 发布多个更新,包含性能和错误修复
llama.cpp 项目已发布多个更新,包括 b9975、b9974、b9973、b9972、b9971、b9970、b9969、b9968、b9966 和 b9965 版本。这些发布在 macOS、Linux、Android 和 Windows 等多个平台上引入了各种改进和错误修复。值得注意的更改包括对 DeepSeek 模型的优化、在 Adreno GPU 等特定硬件上 Vulkan 和 OpenCL 性能的增强,以及对 CUDA…
-
llama.cpp SYCL 基准测试显示 Gemma 和 Qwen 模型性能参差不齐
llama.cpp 项目使用 SYCL 后端进行了基准测试,展示了各种模型的性能指标。测试包括不同大小的 Gemma 4 模型(4.65B、11.91B 和 25.23B 参数)和 Qwen 35 模型(27.32B 和 34.66B 参数)。虽然 SYCL 后端功能正常,但结果表明性能仍有进一步优化的空间。
-
llama.cpp 发布增强性能并添加新功能
llama.cpp 项目发布了多个更新,包括 b9608,该版本更新了 cpp-httplib 并为 macOS、Linux、Android 和 Windows 等各种平台提供了预编译二进制文件。b9606 版本引入了 EAGLE3 推测解码支持,增强了模型推理能力。b9605 版本包括为 Adreno GPU 添加 OpenCL 内核,提高了在某些移动设备上的性能。b9604 版本解决了 SYCL 后端的 CI 构建和发布问题,确保…
-
OpenCL 和 SYCL 因开发缓慢未能成为主流AI计算标准
虽然 OpenCL 和其他基于 C++ 的 GPU 编程模型(如 SYCL)旨在实现跨平台兼容性并获得了广泛采用,但它们未能成为主流的 AI 计算平台。主要问题包括委员会驱动的开发速度缓慢,导致缺乏快速的功能迭代和供应商特定的扩展。此外,硬件供应商之间“开放合作竞争”的固有紧张关系,即创新成果保密,阻碍了这些标准满足 AI 快速变化的需求。
-
llama.cpp 将 Docker 中的 SYCL 计算运行时更新至 v26.x
llama.cpp 项目发布了 b9554 版本,在其 Docker 环境中将其 SYCL 计算运行时更新至 26.x 版本。此次更新还添加了一个注释,详细说明了多 GPU 设置的旧驱动程序配置。
-
llama.cpp 增加 SYCL 后端以支持 Intel Arc GPU,提升速度
llama.cpp 项目已提交一个拉取请求,将多列 MMVQ(矩阵-矩阵向量量化)从 CUDA 后端移植到 SYCL。此次移植旨在提高 Intel Arc 显卡用户的性能,初步报告显示推测解码速度提升约 45%。建议拥有兼容 Intel 硬件的用户更新其 llama.cpp 版本以受益于此优化。
-
Intel Arc B580 GPU 挑战 RTX 3060 在本地AI领域的地位
英特尔的Arc B580 GPU以249美元的价格提供了引人注目的12GB显存和456 GB/s的内存带宽,使其在纸面上成为本地AI任务的有力竞争者。然而,其实际性能受到英特尔尚不成熟的软件栈的阻碍,需要特定的配置和变通方法才能实现最佳的LLM推理。虽然硬件具有竞争力,但用户必须克服驱动程序问题和软件兼容性,例如使用修补过的Ollama版本,才能获得可用的吞吐量。
-
Qwen 3.6-35B-A3B 模型在 Intel Arc GPU 上达到 977 tk/s
一位用户已成功在 Intel Arc B70 Pro GPU 上运行 Qwen 3.6-35B-A3B 模型,并取得了令人印象深刻的性能指标。该设置使用了带有 SYCL 后端的 llama.cpp,实现了每秒 977 个 token 的提示处理速度,并支持 262,000 个 token 的上下文窗口。此配置使用户能够开发一个功能齐全的扑克游戏,而没有遇到模型循环或崩溃等问题。
-
WAVE 项目创建统一 GPU ISA 以实现跨供应商兼容性
一种名为 WAVE 的新型便携式 GPU 指令集架构 (ISA) 已被开发出来,旨在统一不同硬件供应商之间的编程。WAVE 抽象了在 NVIDIA、AMD 和 Intel GPU 中发现的常见功能,允许开发人员编写一次内核,然后将其编译到 Metal、PTX、HIP 或 SYCL 等各种后端。事实证明,这种方法可以在 Apple、NVIDIA 和 AMD 的硬件上产生相同的训练结果。
-
llama.cpp 发布增加 Vulkan 支持,优化矩阵运算,并改进服务器日志记录
llama.cpp 项目发布了多项更新,包括 b9580 版本,该版本增加了对矩阵-矩阵乘法和 Flash Attention 的 Vulkan 支持,并对 FP16 dot2 扩展进行了优化。其他近期版本,如 b9578 和 b9577,分别对视频子进程处理和服务器提示日志记录进行了重构。这些更新提供了适用于 macOS、Linux、Android 和 Windows 等各种平台的预编译二进制文件,并支持 CUDA、ROCm 和 V…