实体
AMD ROCm
AMD ROCm
PulseAugur coverage of AMD ROCm — every cluster mentioning AMD ROCm across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
-
llama.cpp 针对 Apple Silicon 进行优化,Hugging Face 提升 4 位扩散推理速度
最新发布的 llama.cpp 版本 b10299 为 Apple Silicon 引入了优化,通过 Metal API 提升了在 macOS 和 iOS 设备上的性能。此外,Hugging Face 详细介绍了其 Nunchaku 4 位扩散推理集成到 Diffusers 库中,显著降低了 VRAM 需求并加速了消费级 GPU 上的图像生成。NVIDIA NemotronLabs VoiceChat-11B 模型也在 Hugging…
-
Ollama v0.32.4 通过 Apple MLX 支持增强本地 AI,并支持多模态视觉
Ollama 发布了 v0.32.4 版本,为本地 AI 推理带来了显著的增强,特别是对于拥有 Apple Silicon 硬件的用户。此次更新通过 Apple 的 MLX 引擎支持 Laguna 模型系列,从而在集成 GPU 上实现加速推理。此外,该版本通过量化 draft-model output heads 来优化投机解码,以提高效率和准确性,并修复了 Qwen3 MoE 模型的解码问题。此次更新还包括 llama.cpp 中 …
-
使用 ROCm 和 QLoRA 在 AMD MI300X 上微调 LLM
本文详细介绍了使用 AMD 的 ROCm 平台,特别是在 MI300X 硬件上微调大型语言模型的实用工作流。文章重点介绍了如何通过利用 ROCm、QLoRA 技术和检查点训练来克服 NVIDIA CUDA 的主导地位。该过程旨在利用 MI300X 上可用的 192GB 大量 VRAM 来实现高效的模型定制。