Strix Halo
PulseAugur coverage of Strix Halo — every cluster mentioning Strix Halo across labs, papers, and developer communities, ranked by signal.
8 天有情绪数据
-
Qwen3.8-27B 模型在 Strix Halo 硬件上实现 21.23 tok/s
一位用户分享了 Qwen3.8-27B 模型在 Strix Halo 硬件上使用 Q4 量化运行的性能指标。基准测试显示,在 96 个请求中,中位数推理速度为每秒 21.23 个 token,最大序列长度 (n-max) 为 4。这些数据在一个多 token 预测 (MTP) 矩阵中呈现。
-
Mastodon 上的 AI 进展:ROCmFPX 代码和 Qwen3.8-27B 发布
Mastodon 上正在流传两条独立的 AI 相关帖子。一位开发者正在为 ROCmFPX 开发特定代码,该代码将仅在 Strix Halo 上运行。另一则帖子重点介绍了一个未审查版本的 Qwen3.8-27B,由 elderplinius 作为 AI Red Team 的一部分发布,可供本地使用。
-
英特尔Nova Lake移动芯片可能跳过新技术缓存;Razor Lake将首次推出
英特尔即将推出的Nova Lake移动处理器据传将省略“bLLC”(大容量最后一级缓存)功能,该功能旨在与AMD的3D V-Cache竞争。相反,这项增强的缓存技术可能会在随后的Razor Lake移动系列中首次亮相。虽然桌面版Nova Lake CPU预计将配备bLLC,双芯片配置的容量可能高达288MB,但移动版本据称将依赖标准的L3缓存。Razor Lake处理器据传也将使用台积电的N2X工艺节点制造。
-
Qwen3.8-27B模型在多种硬件配置下表现强劲 · 已追踪4个来源
用户报告称Qwen3.8-27B模型在各种硬件配置下展现出令人印象深刻的性能和能力。一位用户在使用vLLM的单块RTX 5090上实现了262K的上下文窗口,以合理的token生成速度展示了长上下文处理能力。另一套使用Strix Halo搭配RTX 3090 Ti和llama.cpp的配置,在32K和200K上下文下实现了高token生成速率,并且在HumanEval基准测试中显著优于双RTX 3090 vLLM配置。在Strix H…
-
Ling 3.0 语言模型在 Strix Halo 硬件上展现出惊人的速度
Ling 3.0,Ling 语言模型的新迭代版本,已在 Strix Halo 硬件上进行了演示运行。该版本利用 vLLM 配合 ROCm/HiP 和 4 位压缩张量(int4)以提升性能。初步比较表明,当 Ling 3.0 和 Qwen-122b 都针对各自格式进行优化时,Ling 3.0 的速度显著优于 Qwen-122b,但工具调用功能在某些环境中被指出存在问题。
-
Beelink SER10 Max迷你PC发布,支持双启动Windows/Ubuntu及Ryzen AI芯片
Beelink SER10 Max是一款新的迷你PC,开箱即可提供Windows和Ubuntu的双启动功能。它配备了AMD的Ryzen AI 9 HX 470处理器,其中包括用于本地AI任务的AI TOPS。然而,其在AI应用中的性能受到内存带宽的限制,远低于Strix Halo等即将推出的芯片。
-
Apple M4 Max Mac Studio 在本地 AI 解码吞吐量方面领先 NVIDIA 和 AMD
Apple 的 M4 Max 芯片在 Mac Studio 中表现出强大的本地 AI 性能,尤其是在解码吞吐量方面,其性能优于 NVIDIA 的 GB10 和 AMD 的 Strix Halo。这一优势主要归功于 Apple Silicon 的高内存带宽,这对于在顺序 LLM 推理过程中流式传输模型权重至关重要。虽然 GB10 系统提供广泛的软件兼容性,但 Apple 的统一内存架构为优先考虑本地 AI 任务的内存带宽和容量的用户提供…
-
Unsloth 支持本地 Kimi K3、并行聊天和 AI 研究模式
Unsloth 发布了一个更新,支持在本地运行 Moonshot AI 的 Kimi K3 模型,这是一个拥有 1M 上下文窗口的 2.8T 参数 MoE 模型。此次更新还引入了并行聊天功能,允许用户同时管理多个对话,以及一个“深度研究”模式,可自动规划、网络搜索和引用研究任务。此外,该版本还增强了对 AMD 和 Intel GPU 的支持,包括 DoRA 训练,并解决了各种安装和推理问题。
-
Intel的Nova Lake桌面CPU可能配备65W集成显卡
根据泄露的信息,Intel即将推出的Nova Lake桌面处理器可能配备功能强大的集成GPU。据传一款特定的SKU需要单独的65W供电,需要两个VCCGT相位来支持其12个Xe3P核心。对于桌面CPU来说,集成显卡达到如此高的功率水平是前所未有的,可能媲美移动APU的性能,标志着Intel集成显卡能力的一次重大飞跃。
-
AMD推出Ryzen AI Embedded X100及Strix Halo平台
AMD的嵌入式部门正在推出Ryzen AI Embedded X100,该产品采用了Strix Halo平台。这款新芯片旨在增强嵌入式系统中的AI能力。
-
AMD推出面向机器人的X100芯片,挑战Intel
AMD已推出其新款X100芯片系列,其中包括专为机器人物理AI应用设计的Strix Halo APU。这些处理器专为24/7运行和10年生命周期而构建,结合了Zen 5 CPU和RDNA 3.5 GPU核心。X100系列旨在直接与Intel的Panther Lake SoC竞争,提供集成解决方案以降低机器人系统的延迟。AMD还提供Kria System on Module (SOM)和机器人开发平台形式的芯片,以便于集成。
-
AMD的Medusa Point APU在Geekbench上创下新高,接近桌面级性能
AMD即将推出的10核“Medusa Point”APU预计将采用Zen 6架构,其性能有所提升,已在Geekbench上亮相。泄露的SKU取得了单核3329分和多核16555分的成绩,超越了此前的泄露数据,并在单核测试中超越了大多数其他x86移动芯片。这款新的APU旨在与Intel的Panther Lake竞争,代表了AMD移动产品的一次重大架构飞跃。
-
Strix Halo 因在本地部署 LLM 时的能效和价值而受到赞誉
一位 Reddit 用户分享了他们使用 Strix Halo 的经验,强调了其在运行本地大型语言模型方面的能效和价值。他们报告称,即使在高负载下,该设备每天的消耗也最多为 0.48 美元,他们认为这比 A6000 等传统 GPU 具有显著优势。用户还注意到 Strix Halo 的多功能性,为推理以外的托管服务提供了充足的资源。
-
Stable Diffusion Forge WebUI 通过 ROCm 7.2 在 AMD Strix Halo 上运行
一位用户创建了一个 Docker 镜像,使得 Stable Diffusion Forge WebUI 可以在 AMD 的 Strix Halo (gfx1151) 硬件上运行。该设置利用了官方的 ROCm 7.2 PyTorch 构建,为社区开发的 nightly 构建提供了替代方案。该项目包含一个公开的 Docker 镜像和一个带有设置说明的 GitHub 存储库,供用户使用。
-
AMD 的 Zen 6 Medusa Point APU 基准测试显示性能显著提升
一款代号为“Medusa Point”且基于即将推出的 Zen 6 架构的 10 核 AMD APU 已出现在 Geekbench 上。这款工程样品,可能是 Ryzen AI 9 565,在单核和多核得分上显著高于当前的旗舰 Strix Point APU,即 Ryzen AI 9 HX 370。它在单核测试中也优于 Strix Halo 旗舰 Ryzen AI 9 Max+ 395,表明 AMD 下一代移动处理器性能将有大幅提升。
-
AMD 在 Micro Center 独家推出售价 3,999 美元的 Ryzen AI Halo PC
AMD 推出了其 Ryzen AI Halo PC,这是一款采用全新 Strix Halo 处理器的高端台式机系统。该系统仅在美国的 Micro Center 独家发售,售价为 3,999 美元。Ryzen AI Halo PC 专为 AI 密集型任务而设计,利用了 AMD 的 Zen 5 架构和 RDNA 3 图形技术。
-
AMD推出4000美元Ryzen AI Halo迷你PC,用于本地AI开发
AMD发布了Ryzen AI Halo,这是一款售价4000美元的迷你PC,专为本地AI开发而设计。该系统配备了Zen 5 AMD Ryzen AI Max+ 395处理器,集成Radeon 8060S显卡和一个NPU,并配有128 GB内存和2 TB SSD。它预装了Windows或基于Debian的Linux发行版,为AI从业者提供了一个交钥匙解决方案,尽管其性能和价格点被认为与NVIDIA的DGX Spark系统相当。
-
LLM 用户寻求关于升级到 40B+ 参数模型以提高速度和知识的建议
r/LocalLLaMA subreddit 上的一位用户正在寻求关于拥有超过 400 亿参数的大型语言模型 (LLM) 的推荐。他们目前使用的是 Qwen3.6 35B,但发现它缺乏通用知识,更像一个执行者而不是助手。用户正在考虑升级到 Qwen3.5 122B,但担心速度问题,因为他们在 Strix Halo 硬件上使用 131k 上下文窗口时,目前能达到大约 30-40 tokens/秒。
-
预填充速度是 RAG 的关键,超越了解码速度
对于检索增强生成 (RAG) 任务而言,模型处理初始提示的速度(预填充速度)比其解码速度更关键。像 Strix Halo 这样的统一内存架构虽然能够实现不错的解码速度,但可能会遇到显著的预填充延迟,导致响应生成前出现长时间的停顿。与拥有离散 GPU 的系统相比,这使得它们不太适合交互式 RAG 应用,因为离散 GPU 可以更有效地处理 RAG 所需的大上下文窗口。对于预算有限的用户,建议优先选择允许未来升级离散 GPU 以分担预填充任务的硬件。
-
Computex 2026:英伟达的 AI 笔记本电脑与廉价 8GB 型号的较量
Computex 2026 展示了笔记本电脑市场的两极分化,一个细分市场专注于配备 8GB 内存的经济型设备,让人想起 Apple 的 MacBook Neo,而另一个细分市场则推出了专为代理式 AI 未来设计的高端英伟达笔记本电脑。这些高端英伟达 RTX Spark 笔记本电脑由 Arm CPU 和 CUDA 核心组合驱动,旨在支持高达 128GB 内存的本地 AI 代理,尽管其高昂的成本预计将主要限制其在 AI 开发人员和爱好者中…