PulseAugur
中
实时 14:13:11
实体 Rocm

Rocm

PulseAugur coverage of Rocm — every cluster mentioning Rocm across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
111
90 天内 111
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
关系
情绪 · 30 天

12 天有情绪数据

最近 · 第 1/7 页 · 共 122 条
  1. TOOL · CL_282447 ·

    用户在性能问题中寻求高效的 t2v/i2v 工具

    Reddit 上的用户正在寻找文本到视频 (t2v) 和图像到视频 (i2v) 生成的高效工具,特别是在 Windows 11 上。一位用户在使用 ComfyUI 时遇到严重的性能问题,报告 VRAM 和 RAM 使用率极高,导致视频生成速度急剧下降。他们正在探索强制使用 Vulkan 运行时或使用适合其 32GB VRAM 的量化 i2v 模型等选项,同时还注意到 ROCm 在 Windows 上存在问题。

  2. COMMENTARY · CL_282242 ·

    FP8量化成本节省因模型输出问题而产生误导

    一位开发者发现,在AMD MI300X GPU上使用vLLM进行FP8量化,特别是针对Qwen2.5模型,导致GPU成本显著降低了47%。然而,这种成本节省具有误导性,因为模型开始输出重复的垃圾标记,而不是有意义的响应。在使用预量化的FP8模型时,成本节省更为适度(约33%),但模型的输出质量保持不变。开发者建议在应用量化后,检查输出长度和在temperature为0下的几个固定提示,以确保模型完整性,而不是仅仅依赖每token成本指标。

  3. TOOL · CL_282047 ·

    定制AI设备配备Strix Halo加速器

    一位名为greyqueen的用户详细介绍了他们的定制AI硬件设置,该设置配备了两块Strix Halo AI 9 395+ Max加速器。该系统包括256GB DDR8000内存和100Gbit背板,并使用ROCm作为其后端。此配置实现了SDXL XL-base1-q4大约51秒的平均生成时间。

  4. TOOL · CL_282031 ·

    艺术家使用定制AI硬件进行数字艺术创作

    一位名叫greyqueen的艺术家正在利用定制的AI硬件设置进行数字艺术创作。该设置包括两个Strix Halo AI 9 395+ Max处理器、256GB DDR8000内存和100Gbit背板,运行在ROCm后端和3相管道上。这种配置允许每件作品的平均生成时间约为47.7秒,被描述为“隐性超现实主义”。

  5. TOOL · CL_281176 ·

    用户在 Debian 上成功本地安装 ComfyUI,并更新了 ROCm/PyTorch

    一位用户成功在他们的 Debian Testing 机器上本地安装了 ComfyUI,无需再使用 chroot 环境。这涉及到将他们的 ROCm 和 PyTorch 堆栈更新到最新版本,特别是 ROCm 10.1 和 PyTorch 2.15 nightly。用户遇到了一个问题,即 PyTorch 的构建没有明确支持他们的 GPU 架构 (gfx1031),但他们通过使用环境变量覆盖绕过了这个问题。

  6. TOOL · CL_281357 ·

    llama.cpp b11422 通过新的 MUSA indexer kernel 优化 CUDA/ROCm

    llama.cpp 项目发布了 b11422 版本,其中包括对 CUDA 和 ROCm 架构的优化。具体来说,此次更新为 MUSA 引入了一个新的 vector lightning indexer kernel,解决了某些 MUSA 架构上的共享内存限制。通过分批处理,这一更改确保了具有 28 KB 静态共享内存上限的 MUSA 架构 21 和 22 可以有效地处理 indexer 查询。

  7. TOOL · CL_278403 ·

    新引擎支持在单台迷你PC上运行两款300B MoE模型

    一款名为Kyojin的新引擎,基于ExLlamaV3并针对AMD的Strix Halo硬件进行了优化,已被开发用于运行大型混合专家(MoE)模型。该引擎允许两款300B级别的MoE模型,GLM-5.3-Flash和MiMo-V2.6-Flash,分别装入单台128GB的机器中。性能基准测试显示,GLM-5.3-Flash的预填充速度约为580 token/s,MiMo-V2.6-Flash的解码速度高达44 token/s,且与官方F…

  8. TOOL · CL_277573 ·

    Redis 创始人发布专注的本地 LLM 引擎 DwarfStar 4

    Redis 的创始人 Salvatore Sanfilippo 发布了 DwarfStar 4 (ds4),一个新的本地 LLM 推理引擎。与许多旨在广泛兼容模型的引擎不同,ds4 专注于少数模型,包括 DeepSeek V4、GLM 5.x 和 Qwen 3.8 Flash Next。这种专注的方法允许进行不对称量化和驻留磁盘的模型权重等优化,从而能够在高内存机器(尤其是配备 Apple Silicon 的 Mac)上高效运行。该引…

  9. TOOL · CL_277493 ·

    AMD Ryzen AI 开发者平台更新至 Linux 7.2、ROCm 10.0

    AMD 更新了其 Ryzen AI 开发者平台,现运行于 Linux 7.2 和 ROCm 10.0,并配备了新的 4.00 BIOS。该平台还包括一个增强的、专注于安全性的 AMD 开发者中心。此次更新旨在提高性能和 AI 开发能力。

  10. COMMENTARY · CL_274052 ·

    通过高效的 MLOps 最大化 LLM 的 GPU 价值

    文章强调,要最大化 GPU 在大型语言模型 (LLM) 中的价值,很大程度上取决于高效的软件利用率,而不仅仅是硬件能力。文章着重指出了优化 MLOps 实践的重要性,以确保像 Nvidia 和 AMD 这样的昂贵硬件不会被低估使用。文章建议,像 PyTorch 和 TensorFlow 这样的框架,以及 CUDA 和 Rocm 等专业库,在实现这种效率方面发挥着至关重要的作用。

  11. TOOL · CL_272681 ·

    Hugging Face Transformers 5.18.0 新增多模态模型和说话人日志

    Hugging Face Transformers 库发布了 5.18.0 版本,引入了几个新模型和重要更新。主要新增功能包括用于说话人识别的 Nemotron 3 Diarization,用于跨文本、图像、视频和声音的多模态推理的 NemotronH Omni,以及来自 Naver 的多模态模型 HyperCLOVAX Vision V2。该版本还整合了新的文本表示模型 GTE,并包含与 ROCm、vLLM 和各种模型集成相关的重大…

  12. TOOL · CL_258135 ·

    llama.cpp 发布带来 OpenVINO 更新、Vulkan、GGUF 和 SYCL 改进

    llama.cpp 项目发布了多个更新,包括 b11024 版本,该版本更新了 OpenVINO 2026.4 并修复了各种编译器警告。其他近期版本,如 b11022 和 b11020,分别改进了 Vulkan 支持和 DeepSeek 模型的消息分隔符解析。b11019 版本解决了 GGUF 文件对齐和 LoRA 加载问题,而 b11013 解决了 Vulkan 着色器中的缓冲区对齐问题。早期的更新,如 b11017 和 b1101…

  13. RESEARCH · CL_251989 ·

    新工具和研究致力于 GPU AI 工作负载的优化

    多篇研究论文和一个新的开源工具解决了在 GPU 上优化 AI 工作负载的挑战。COMPASS-ABS 旨在减少深度学习训练共享 GPU 集群中的碎片化,提高资源利用率和作业完成时间。研究人员还开发了自适应框架,如用于商品 GPU 上高效长上下文推理的 Tri-Metric Router 和使用数据流不变性进行代理 GPU 优化的 Ave。此外,mKernel 和 AttnFuse 分别专注于为多 GPU 系统和注意力机制创建快速、融合…

  14. TOOL · CL_251612 ·

    ZLUDA 使 AMD GPU 能够运行 CUDA 应用

    一个名为 ZLUDA 的项目正在使针对 NVIDIA CUDA 的 Windows 应用程序能够在 AMD GPU 上运行。这个兼容层利用 ROCm/HIP,其性能比原生 CUDA 执行慢约 3%。该开发旨在让受 CUDA 限制的项目和优化能够在 AMD 硬件上运行,从而可能扩大 AI 和 GPU 计算的可访问性。

  15. TOOL · CL_249890 ·

    ROCm 对比 Vulkan:选择 AMD GPU 加速器进行本地 LLM 托管

    本指南比较了 ROCm 和 Vulkan 在加速 AMD GPU 进行本地 LLM 托管方面的作用,并强调了它们各自的独特之处。ROCm 作为 AMD 的计算平台,支持 PyTorch 等框架以及 vLLM 和 SGLang 等引擎,需要兼容的驱动程序和库堆栈。而 Vulkan 是一种便携式 GPU API,被 llama.cpp 等引擎使用,可在各种硬件上运行量化模型,无需特定厂商的机器学习堆栈。两者之间的选择取决于具体的 LLM …

  16. TOOL · CL_247568 ·

    NVIDIA PAIR 已修改以支持 AMD GPU 和 llama.cpp

    一位用户修改了 NVIDIA 的 Personal AI Router (PAIR) 以支持 AMD GPU,集成了 ROCm 遥测。这使得 PAIR 能够将任务路由到在 AMD 节点上运行的 llama.cpp,克服了 PAIR 原生仅识别 NVIDIA 硬件和 Ollama 或 LM Studio 等特定引擎的限制。用户还开发了一个自定义引擎清单,使 PAIR 能够与位于 llama.cpp 前端的 OpenAI 兼容服务器进行接…

  17. TOOL · CL_246397 ·

    AMD GPU 用户分享 RDNA 3/4 的 ComfyUI 优化指南

    用户正在分享使用 AMD GPU 优化 ComfyUI 的指南和故障排除技巧,特别关注 RDNA 3 和 RDNA 4 架构。主要挑战在于确保与新版 PyTorch 和 ROCm 安装的兼容性,以便高效运行 ProxiMax H3 和 Minimax H3 等模型。建议包括使用 ROCm 7.14.0 安装 PyTorch 的特定命令,以及各种启动参数和环境变量,以提高在 Windows 11 上的性能和稳定性。

  18. TOOL · CL_242224 ·

    Unsloth 发布重大性能提升和错误修复

    Unsloth 发布了重要的更新,重点关注跨平台的性能增强和错误修复。最新版本在 Apple Silicon 上为扩散模型提供了显著的速度提升,加快了提示处理速度,并减少了 MLX KV 缓存的内存使用。此外,Unsloth 通过默认使用 Vulkan 提高了 AMD GPU 的性能,通过签名二进制文件增强了 Windows 兼容性,并简化了 RAG 和 API 功能。软件包大小也已减小,并提供新的 Docker 镜像以提高可访问性。

  19. TOOL · CL_241031 ·

    RX 9070 XT 在 Linux 上使用 ComfyUI 的 AI 性能受到质疑

    一位用户正在询问 RX 9070 XT 显卡在 Linux 上运行 AI 工作负载的性能,特别是在通过 Stability Matrix 和 ROCm 使用 ComfyUI 的情况下。他们想了解 Krea、LTX、Seedvr 和 Wan 等流行 AI 工具在 Linux 下的 AMD 硬件上是否完全可用,以及是否存在任何重大的限制或必要的解决方法。

  20. TOOL · CL_240451 ·

    AMD通过软件优化将vLLM在MiniMax M3上的性能提升了11倍

    SemiAnalysis报道称,AMD在19天内,通过使用MI355x硬件在MiniMax M3模型上实现了vLLM性能11倍的提升。这些提升是通过软件优化实现的,特别是针对长上下文注意力操作,突显了ROCm堆栈的能力。这表明硬件投资可以通过软件更新带来持续的性能改进。