Heterogeneous Integration Platform
PulseAugur coverage of Heterogeneous Integration Platform — every cluster mentioning Heterogeneous Integration Platform across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
Growing trend of specialized hardware kernels for AI inference
The recent releases from llama.cpp (OpenCL for Adreno GPUs) and MoonMath AI (HIP kernel for AMD MI300X) highlight a growing trend of developing highly specialized kernels to maximize AI inference performance on specific hardware architectures. This suggests a shift towards more hardware-aware optimization strategies within the open-source AI community.
llama.cpp to integrate AMD MI300X optimizations
Given MoonMath AI's recent open-sourcing of an optimized attention kernel for AMD MI300X that outperforms existing solutions, and llama.cpp's continuous efforts to enhance performance across various hardware (including recent OpenCL additions for Adreno GPUs), it's plausible that llama.cpp will explore integrating similar AMD-specific optimizations in future releases to broaden its hardware support and performance.
-
llama.cpp 更新测试框架,改进日志管理
llama.cpp 项目发布了 b10362 版本,更新了其测试框架。具体来说,该版本禁用了 HIP(异构集成平台)的后端采样器测试,原因是与 CUB 存在兼容性问题,而 CUB 是 top_k 采样所必需的。此外,持续集成流程已更新,通过将日志存储在以 GitHub 运行 ID 命名的每个运行目录中,来更好地管理 GPU-ROCm 日志,解决了日志被覆盖的问题。
-
audio.cpp 0.5 增加了 DramaBox TTS、Confucius4 语音转换和 AMD GPU 支持
audio.cpp 项目已发布 0.5 版本,对其文本转语音 (TTS) 和语音转换功能进行了重大更新。一个主要亮点是 DramaBox,一个专为提示词驱动的配音设计的新模型,可控制情感和表达。该版本还推出了 Confucius4-TTS 用于跨语言语音转换,并集成了其他几个模型和 ASR 系统。平台支持的增强功能包括对 AMD GPU 的早期 HIP/ROCm 兼容性以及对 Apple Silicon 的性能改进,同时还改进了直播和摄入功能。
-
llama.cpp 发布多个更新,支持跨平台优化
llama.cpp 项目发布了多个更新,包括 b10106、b10105、b10108、b10099、b10098、b10094、b10093、b10092、b10091 和 b10103 版本。这些发布在不同平台和硬件加速器上引入了各种改进和修复。值得注意的更新包括对 CUDA、Metal、Hexagon 和 OpenVINO 的增强,以及对 DeepSeekv4 等特定模型模板的修复,并改进了参数解析和内存管理。
-
llama.cpp 为 HIP 构建添加 -ffast-math 标志,提升性能
llama.cpp 项目的一个拉取请求引入了 ggml-hip 库,为 HIP 构建启用了 -ffast-math 编译器标志。在 RDNA3.5 GPU 上的基准测试显示,使用此标志时,Qwen3.5-27B 模型的性能提升高达 7%,Qwen3-0.6B 模型的性能提升高达 3.4%。在各种提示长度下都观察到了性能提升,在较短的提示长度下观察到了最显著的改进。
-
适用于 AMD GPU 的 CUDA 模拟器 Zluda 失去资金支持,回归爱好状态
Zluda 项目是一个在 AMD GPU 上模拟 NVIDIA CUDA 的开源项目,现已失去商业资金支持并回归爱好状态。尽管面临挫折,Zluda 的第 6 版引入了新功能,包括对 32 位 PhysX 的预 Alpha 支持、改进的 Windows 兼容性以及对 PyTorch 集成的增强。虽然 Zluda 之前曾获得 AMD 和一家未披露的 AI 公司的支持,但其未来的开发现在完全依赖于其首席开发者的热情。
-
llama.cpp 发布多个更新,包含性能和错误修复
llama.cpp 项目已发布多个更新,包括 b9975、b9974、b9973、b9972、b9971、b9970、b9969、b9968、b9966 和 b9965 版本。这些发布在 macOS、Linux、Android 和 Windows 等多个平台上引入了各种改进和错误修复。值得注意的更改包括对 DeepSeek 模型的优化、在 Adreno GPU 等特定硬件上 Vulkan 和 OpenCL 性能的增强,以及对 CUDA…
-
MoonMath AI 开源 HIP Attention Kernel 以支持 AMD MI300X,性能超越 AITER v3
MoonMath AI 已开源一个用于 AMD MI300X GPU 的新型 bf16 前向注意力内核,该内核使用 HIP 编写。据报道,该内核在各种配置下均优于 AMD 自家的 AITER v3,速度提升高达 1.26 倍。性能提升归因于战略性的内存放置和一种新颖的单指令汇编包装器技术,该技术允许在利用编译器进行寄存器分配优化的同时,精确控制操作。这项进展已集成到 SGLang 中,以加速 Wan2.1 等视频扩散模型。
-
MoonMath AI 开源 AMD MI300X 注意力内核,性能优于 AITER v3 · 跟踪 3 个来源
MoonMath AI 发布了一个开源的 HIP 注意力内核,适用于 AMD 的 MI300X GPU,据报道其性能优于 AMD 自家的 AITER v3。该内核通过优化内存布局和使用单指令汇编包装器进行寄存器控制,实现了高达 1.26 倍的速度提升。此优化已集成到 SGLang 中,以加速 Wan2.1 等视频扩散模型。
-
llama.cpp 发布增强性能并添加新功能
llama.cpp 项目发布了多个更新,包括 b9608,该版本更新了 cpp-httplib 并为 macOS、Linux、Android 和 Windows 等各种平台提供了预编译二进制文件。b9606 版本引入了 EAGLE3 推测解码支持,增强了模型推理能力。b9605 版本包括为 Adreno GPU 添加 OpenCL 内核,提高了在某些移动设备上的性能。b9604 版本解决了 SYCL 后端的 CI 构建和发布问题,确保…
-
LLM用户寻求更快的提示处理速度以支持长代理运行
一位用户在 r/LocalLLaMA 子版块上寻求提高大型语言模型提示处理速度的方法,特别提到了 Qwen 模型的问题,以及随着上下文长度增加,每秒令牌数显著下降的情况。他们目前在 Linux 上使用 Vulkan,并指出 HIP 提供了速度提升,但内存使用量增加且令牌生成效果不佳。用户正在寻找在长代理运行期间保持更高处理速度的解决方案。
-
WAVE 项目创建统一 GPU ISA 以实现跨供应商兼容性
一种名为 WAVE 的新型便携式 GPU 指令集架构 (ISA) 已被开发出来,旨在统一不同硬件供应商之间的编程。WAVE 抽象了在 NVIDIA、AMD 和 Intel GPU 中发现的常见功能,允许开发人员编写一次内核,然后将其编译到 Metal、PTX、HIP 或 SYCL 等各种后端。事实证明,这种方法可以在 Apple、NVIDIA 和 AMD 的硬件上产生相同的训练结果。
-
AI重塑软件开发,将焦点从代码转向想象力
超过3000名软件开发人员参加了由DeepLearning.AI组织的AI Dev 26 x SF会议,讨论AI在软件开发中不断演变的角色。发言者强调,AI正在将瓶颈从编码转移到想象力,并加速行业转型。虽然一些人将AI视为提高速度和效率的工具,但另一些人则强调降低缺陷率和保持代码正确性高标准的重要性,并提到了Hydro、Cedar和Strata等项目。