AMD Strix Halo
PulseAugur coverage of AMD Strix Halo — every cluster mentioning AMD Strix Halo across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
DeepSeek V4 集成并测试于 Framework Desktop PC
DeepSeek V4 模型已成功集成并测试于一台运行在 Lemonade 服务器环境中的 Framework Desktop PC 上,该 PC 配备了 AMD Strix Halo 处理器和 128GB 内存。代码片段生成的初步测试结果令人印象深刻,模型在处理长上下文时表现出一致的性能,尽管其速度被认为相对较慢。尽管在使用非常长的上下文(总计约 35k tokens)时出现了一些不稳定和过早的流结束问题,但总体而言,DeepSee…
-
Qwen3.5-122B 模型可装入 64GB 内存,提供更高质量但速度较慢
一位用户在 r/LocalLLaMA 上分享了他们在拥有 64GB 内存的系统上运行具有 UD-Q2_K_XL 量化的 Qwen3.5-122B 模型的经验。该设置允许更大的模型装入内存,与 Qwen3 Next 80B 等较小模型相比,提供了明显更好的响应质量和内部知识。然而,这以生成速度降低(约 2.9 tokens/秒)和提示处理速度大幅下降为代价,使其不适合代理任务。
-
STAGE框架为分布式工作负载合成大语言模型执行图 · 跟踪2个来源
一个名为STAGE的新框架已被开发出来,用于合成大语言模型(LLMs)和专家混合模型(MoEs)的高保真执行图。该框架旨在通过建模各种并行化策略来优化分布式人工智能工作负载,从而能够在无需直接访问大规模基础设施的情况下探索不同的模型架构和系统配置。STAGE通过为超过128,000个GPU生成跟踪记录,证明了其可扩展性,并在计算、内存和通信方面保持了张量级别的准确性。
-
在 AMD Strix Halo 上使用 ROCm 成功训练 Ideogram 4 LoRA
一位用户在使用 ROCm 和 AI-Toolkit 的 AMD Strix Halo APU 上成功训练了 Ideogram 4 人脸 LoRA。该过程涉及几个 AMD 特有的挑战,包括 bitsandbytes 的不兼容性、融合注意力下 Qwen3-VL 文本编码器的问题,以及 JSON 标题中触发词的静默失败。尽管存在这些障碍,训练仍成功完成,并产生了可用的结果。
-
Ideogram 4 LoRA训练详细介绍,适用于AMD硬件和风格示例
用户们正在分享他们为Ideogram 4模型训练LoRA的经验和结果。Ideogram 4是一个因其开源能力而受到赞誉的扩散模型。一位用户详细介绍了在AMD Strix Halo系统上使用ROCm和AI-Toolkit训练人脸LoRA的过程,强调了AMD硬件的特定挑战和解决方案。其他用户展示了为特定风格(如吉卜力工作室、动漫/数字绘画)训练的LoRA,其中一些用户注意到出现意外结果,例如特征夸张,并讨论了最佳训练步骤。
-
通过Thunderbolt fabric实现了InfiniBand网络
一位开发者创建了一个名为thunderbolt-ibverbs的项目,该项目可在Thunderbolt fabric上实现InfiniBand网络。该设置使用USB4线缆和自定义Linux内核模块连接两个AMD Strix Halo mini-PC。由此产生的网络在每个方向上实现了约48 Gb/s的速率,显著优于Thunderbolt上的标准以太网和soft-RoCE。