PulseAugur
实时 07:26:08
实体 Rocm

Rocm

PulseAugur coverage of Rocm — every cluster mentioning Rocm across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
35
90 天内 90
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 3
层级分布 · 90 天
主题
关系
情绪 · 30 天

17 天有情绪数据

最近 · 第 1/5 页 · 共 90 条
  1. TOOL · CL_214566 ·

    Fizgig LoRA 训练器在新更新中增加了 AMD Radeon 支持

    开源 LoRA 训练器和工作台 Fizgig 发布了 4.3.0 版本,现在支持使用 ROCm 在 AMD Radeon GPU 上进行训练。此新功能主要在 Windows 上得到支持,在 Linux 上为实验性功能,由社区贡献开发。此次更新还包括针对 16 GB 显卡使用 MiniMax H3 的身份蒸馏的优化,以及增强的 Repair Studio,提供并排比较视图来修复过度训练的 LoRA。

  2. COMMENTARY · CL_210365 ·

    Qwen 3.8 27B KV 缓存精度影响性能,用户报告

    Reddit r/LocalLLaMA 版块的一名用户报告称,Qwen 3.8 27B 模型的 KV 缓存精度对性能有显著影响,这与普遍的假设相反。该用户发现在长上下文的细节和记忆召回方面,KV 缓存的 F16 精度比 Q8_0 更好。这一观察是在使用 ROCm 在 AMD R9700 GPU 上通过 UD 3.0 框架进行测试时做出的。

  3. RESEARCH · CL_206769 ·

    人工智能推理需要高效的 GPU 管理,以避免显存耗尽和碎片化

    管理人工智能工作负载的 GPU 资源,特别是生成媒体和大型语言模型推理,由于其高内存和计算需求,带来了重大挑战。与传统的 Web 应用程序不同,这些任务很容易耗尽 GPU 显存,导致无法恢复的错误和作业失败。为了缓解这种情况,使用作业队列和消息代理(如 BullMQ 和 Redis)的异步架构模式对于将任务摄取与执行解耦至关重要。高效的内存管理,如 PagedAttention,以及将 KV 缓存卸载到外部存储,对于减少 GPU 空闲…

  4. TOOL · CL_203519 ·

    Llama.cpp ROCm 7.14 基准测试显示 Radeon 780M 性能有所提升

    一位 Reddit 用户对 llama.cpp 在 ROCm 7.14 下的性能进行了基准测试,并指出其引入了对 Radeon 780M iGPU 的支持。基准测试将 ROCm 与 Vulkan 在各种 Qwen 模型上进行了比较,结果显示 ROCm 在密集模型上提供了显著的速度提升,尤其是在更高的上下文长度下。然而,用户也遇到了 ROCm 的稳定性问题,需要调整特定的内核参数,这表明可能与某些环境变量存在不兼容性。

  5. TOOL · CL_202901 ·

    Linux 发行版和 AI 工具迎来更新和新集成 · 跟踪 2 个来源

    多个 Linux 发行版和相关软件正在接收更新和新功能。Lemonade 11.6 现在集成了 Muse-Glimmer 30B 和实验性的 TheNoise ROCm 图像生成,而 AMD GAIA 0.23 允许从终端安装 AI 代理。FastFlowLM 1.0 也在 AMD ROCm 框架下发布。此外,Zed v1.15.0 包含自托管 AI 预测功能,Omarchy 将其未来押注在 AI 代理上。Ubuntu 24.04 L…

  6. TOOL · CL_200961 ·

    MiniMax H3 for AMD GPUs 提升 Stable Diffusion 性能

    一位开发者发布了 MiniMax H3,这是专为 AMD GPU 优化的扩散模型版本,集成了 BlockCache、Sol-Attn 和 Turbo 功能。在 RX 7900 XTX 上的测试显示性能显著提升,Sol-Attn 在短时间的 Turbo 运行中将处理时间缩短了约 23 秒。BlockCache 在较长的 20 步生成任务中显示出优势,将某些场景下的时间从 6 分钟以上缩短到约 4 分钟。

  7. TOOL · CL_194504 ·

    llama.cpp 为 ROCm 7.14 添加 CI 目标

    llama.cpp 项目已提交一个拉取请求,为 ROCm 7.14 添加持续集成 (CI) 目标。此更新旨在使 llama.cpp 在 Linux 和 Windows 环境中都能使用 ROCm 7.14,这是首个使用 TheRock 构建系统的生产版本。ROCm 7.14 可通过多种安装方式获得,包括多架构交付物。

  8. SIGNIFICANT · CL_189981 ·

    AMD推出Instella-MoE-16B-A3B,完全使用自家GPU训练

    AMD发布了其Instella-MoE-16B-A3B AI模型,这是一个重要的进展,因为它完全使用AMD自家的GPU(特别是Instinct MI300X和MI325X)进行训练,不依赖Nvidia硬件或CUDA等软件。这个拥有160亿参数的模型采用了混合专家(MoE)架构,每次推理只激活28亿参数,从而实现更快的处理速度。AMD还完全开源了训练权重、代码和数据配方,允许社区进行审查和进一步开发,但模型权重根据ResearchRAI…

  9. TOOL · CL_189120 ·

    本地 AI 更新:llama.cpp、PyTorch、Kimi-K3 和 NVIDIA NeMo Speech 3.0

    本地 AI 和开源模型领域的最新更新包括 llama.cpp 通过 CUDA Fusion 实现的性能增强,解决了 PyTorch 中针对 AMD GPU 的关键量化错误,以及备受关注的 Moonshot AI Kimi-K3 模型,该模型利用压缩张量实现高效推理。此外,NVIDIA 发布了 NeMo Speech 3.0,专注于核心语音 AI 任务,LiquidAI 的 LFM2.5-2.6B 模型在本地代理部署方面也日益受到欢迎。

  10. RESEARCH · CL_186742 ·

    AMD顶尖AI工程师集中在上海开发ROCm

    AMD的顶尖AI工程人才的很大一部分,包括专注于MoRI、KV缓存卸载和池化的关键团队,都位于上海。这种专业知识的集中对于开发AMD ROCm软件栈的核心组件至关重要,许多关键要素都在中国大陆构建。

  11. TOOL · CL_179717 ·

    AI推理卡将数据库查询延迟降低高达32%

    一项新研究强调了国内AI推理加速卡(特别是明心FX100)如何显著提高实时数据库查询性能。通过优化存储访问路径和缩短模型加载时间,这些卡可以将首个token延迟降低高达32%,模型加载时间缩短高达9倍。这些改进在AMD MI308X和华为Ascend 910B平台上均得到验证,表明AI驱动的实时数据库中的瓶颈正从计算转向存储访问,尤其是在处理大型模型时。

  12. TOOL · CL_175672 ·

    audio.cpp 0.5 增加了 DramaBox TTS、Confucius4 语音转换和 AMD GPU 支持

    audio.cpp 项目已发布 0.5 版本,对其文本转语音 (TTS) 和语音转换功能进行了重大更新。一个主要亮点是 DramaBox,一个专为提示词驱动的配音设计的新模型,可控制情感和表达。该版本还推出了 Confucius4-TTS 用于跨语言语音转换,并集成了其他几个模型和 ASR 系统。平台支持的增强功能包括对 AMD GPU 的早期 HIP/ROCm 兼容性以及对 Apple Silicon 的性能改进,同时还改进了直播和摄入功能。

  13. TOOL · CL_175373 ·

    AMD RX 9070 XT 搭配 ROCm 导致 Stable Diffusion 出现伪影

    一位 Reddit 用户在将显卡从 NVIDIA GeForce RTX 3060 升级到使用 ROCm 后端的 AMD RX 9070 XT 后,在使用 Lustify Apex V8 Stable Diffusion 模型时遇到了严重的图像生成问题。尽管进行了干净的操作系统和驱动程序安装,新设置却产生了严重的伪影、变异图像以及生成图像中不自然的眼睛,而这些问题在使用之前的硬件时并未出现。该用户正在寻求可能存在的变通方法或解决方案的…

  14. TOOL · CL_175285 ·

    DeepSeek V4 Flash 为 DwarfStar 推理引擎进行了量化

    用户创建并分享了 DeepSeek V4 Flash 模型的量化版本,专门针对 DwarfStar (DS4) 推理引擎进行了优化。这些 GGUF 文件旨在提供比标准 llama.cpp 实现更快的性能,一位用户报告在 MacBook M5 Max 上速度超过 30 tokens/秒。创建者正在寻求用户的反馈,特别是拥有 CUDA 或 ROCm 硬件的用户,以帮助改进量化并可能提高性能和去审查等功能。

  15. TOOL · CL_175008 ·

    llama.cpp 发布多个更新,改进性能和构建

    llama.cpp 项目发布了多个更新,包括 b10567 版本,该版本为 macOS、Linux、Android 和 Windows 提供了 CI 改进和各种构建选项。之前的版本如 b10566 和 b10549 分别引入了版本升级和张量分割功能。其他更新解决了 b10539 中的 Vulkan 量化计算、b10545 和 b10538 中的 Metal 性能优化以及 b10536 中的服务器端模型加载等具体问题。b10537 版本…

  16. TOOL · CL_174543 ·

    AMD V620 GPU 成功集成到 ComfyUI 中用于 AI 任务

    一位用户成功地将 AMD V620 工作站显卡集成到其 ComfyUI 设置中用于 Stable Diffusion,尽管最初对其性能有所怀疑。虽然速度不快,但该显卡因其 32GB VRAM 而被购买,可可靠地用于生成图像和视频,并且还可用于本地大型语言模型 (LLM) 任务。用户已记录了基准测试并确认了与 Triton 和 Sage Attention 的兼容性,将 GPU 识别为 gfx1030 并使用 ROCm。

  17. TOOL · CL_172439 ·

    vLLM v0.25.0 推出 Model Runner V2,增强本地 LLM 推理能力

    vLLM 项目发布了 0.25.0 版本,将 Model Runner V2 作为密集模型的默认选项,增强了量化支持,从而实现更高效的本地 LLM 推理。此次更新旨在提高吞吐量和降低延迟,使在消费级硬件上运行复杂的开源模型更加容易。此外,Ollama v0.32.5 已发布,修复了影响 Apple Silicon 上 NVFP4 模型输出质量的错误,确保了 macOS 设备上本地推理的可靠性。

  18. COMMENTARY · CL_172366 ·

    本地AI:AMD Radeon R9700 对比 NVIDIA CUDA,用户寻求建议

    一位用户正在寻求建议,询问其为本地AI工作负载选择两块Radeon R9700 GPU是否是错误之举,与NVIDIA的产品相比。他们担心AMD的ROCm平台与NVIDIA的CUDA相比,在运行大型语言模型(LLMs)方面的成熟度和兼容性,目标是实现最佳性能和质量。

  19. RESEARCH · CL_171656 ·

    AMD MI355X 在 Kimi K2.5 模型上的 vLLM 性能超越 Nvidia B200

    AMD 的 MI355X 图形卡在 Kimi K2.5 模型的 vLLM 基准测试中表现优于 Nvidia 的 B200,这是社区开发的内核驱动的重大成就。这一进步源于 AMD 和 GPU_MODE 组织的一项价值 110 万美元的内核黑客马拉松,通过在 MoE、Top-K 和张量并行内核方面的优化,使 MI355X 的端到端性能提高了 4 倍以上。虽然 AMD 在 Kimi 模型上的 vLLM 性能仍有差距,但这些已合并到 AMD …

  20. TOOL · CL_171177 ·

    Unsloth 支持本地 Kimi K3、并行聊天和 AI 研究模式

    Unsloth 发布了一个更新,支持在本地运行 Moonshot AI 的 Kimi K3 模型,这是一个拥有 1M 上下文窗口的 2.8T 参数 MoE 模型。此次更新还引入了并行聊天功能,允许用户同时管理多个对话,以及一个“深度研究”模式,可自动规划、网络搜索和引用研究任务。此外,该版本还增强了对 AMD 和 Intel GPU 的支持,包括 DoRA 训练,并解决了各种安装和推理问题。