一位开发者创建了一套名为 R9V 的自定义内核,旨在优化 RDNA4 显卡的性能,特别是针对 AMD 的 R9700s。当应用于 vLLM-Radiance 推理引擎时,这些内核显著提高了 Qwen3.8-Flash-Next 等模型的速度,在某些任务中实现了高达 30 倍的性能提升。该项目还包括为密集模型开发的独立推理引擎,并提供了 Qwen3.8-Flash-Next 和 Muse Glimmer 30B 的软件包,并与 llama.cpp 等其他后端进行了性能比较。 AI
影响 对 RDNA4 硬件的优化可能有助于 AMD GPU 更广泛地采用本地 LLM。
排序理由 开发者为特定硬件创建的优化内核。[lever_c_demoted from research: ic=1 ai=0.7]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →