MI355x
PulseAugur coverage of MI355x — every cluster mentioning MI355x across labs, papers, and developer communities, ranked by signal.
- 2026-07-30 research_milestone Kernel optimizations improved MI355X performance by over 2x and were upstreamed to AMD's AITER and ATOM inference engines. 来源
5 天有情绪数据
-
Kimi K3 的 2.8T 参数凸显了大型语言模型部署作为一项系统工程挑战
Kimi K3 模型拥有 2.8 万亿总参数,每个 token 约有 1040 亿活跃参数,其部署挑战远超其庞大的规模。其架构融合了混合专家(mixture-of-experts)设计和原生多模态支持,上下文窗口超过一百万个 token。至关重要的是,该模型使用低精度 MXFP4 权重和 MXFP8 激活进行训练,这意味着量化是其推理路径的内在组成部分,而非事后考虑。这需要能够高效执行这些原生格式的专用硬件,目前的 vLLM 指导建议…
-
开放权重视频模型和 Kimi K3 性能基准发布
ComfyUI 发布了一个开放权重的、全模态的视频模型,支持 2K 视频输出和真正的立体声,针对 RTX 6000 甚至 3060 等 GPU 的本地使用进行了优化。另外,一个团队在 AMD MI355X 硬件上实现了 Kimi K3 的高性能运行,报告称与 NVIDIA 的 B200 和 B300 相比,每节点每美元的令牌处理速度显著更快。
-
AMD MI355X 挑战 NVIDIA,字节跳动发布 Seedance 2.5 视频模型
AMD 的 MI355X 处理器在 Kimi K3 推理成本方面表现优于 NVIDIA 的产品。与此同时,字节跳动推出了其新的 Seedance 2.5 视频生成模型,显示出巨大的潜力。该集群还触及了围绕 AI 代理和责任的新兴法律复杂性。
-
AMD MI355X GPU 为 Kimi K3 模型提供更优的每美元性能
来自 Wafer.ai 的一篇博文详细介绍了他们如何在 AMD 的 MI355X GPU 上运行 Kimi K3 模型,从而实现了更优的每美元性能。尽管 Kimi K3 拥有 2.8T 的巨大参数量,需要大量的 VRAM,但 MI355X 凭借其每个 GPU 288GB 的 VRAM,证明了其作为 NVIDIA B300 和 B200 GPU 的经济高效替代方案。虽然 NVIDIA 的硬件提供了更高的总吞吐量,但 MI355X 提供了…
-
AMD MI355X 在 Kimi K2.5 模型上的 vLLM 性能超越 Nvidia B200
AMD 的 MI355X 图形卡在 Kimi K2.5 模型的 vLLM 基准测试中表现优于 Nvidia 的 B200,这是社区开发的内核驱动的重大成就。这一进步源于 AMD 和 GPU_MODE 组织的一项价值 110 万美元的内核黑客马拉松,通过在 MoE、Top-K 和张量并行内核方面的优化,使 MI355X 的端到端性能提高了 4 倍以上。虽然 AMD 在 Kimi 模型上的 vLLM 性能仍有差距,但这些已合并到 AMD …
-
AMD MI355X 性能因社区黑客马拉松而提升,在 Kimi 模型上可与 B200 匹敌 · 跟踪 6 个来源
AMD 与 GPU_MODE 合作,启动了一个耗资 110 万美元的内核黑客马拉松,显著提升了其 MI355X 图形卡的性能。Readonflow Team 的优化专注于 MoE 内核和其他核心组件,带来了高达 4 倍的性能提升,并已合并到 AMD 的 AITER 内核库和 ATOM 推理引擎中。该计划旨在使 AMD 的 vLLM 性能接近 CUDA vLLM 的水平,并增强社区对 ROCm 堆栈的体验。
-
AMD 投资 50 亿美元与 Anthropic 合作,获得 2GW AI GPU 算力,挑战英伟达
AMD 宣布与 Anthropic 达成一项重大的战略合作伙伴关系,投资额高达 50 亿美元。作为回报,Anthropic 将部署 2 吉瓦 (GW) 的 AMD MI450 GPU,从 2027 年上半年开始,为其 Claude 模型提供算力。此项交易使 AMD 成为 AI 芯片市场中英伟达的关键竞争对手,并包括一项工程合作,以优化 AMD Instinct GPU 的工作负载并加速 ROCm 的开发。
-
Kimi K3 2.8T 模型需要超越 NVIDIA DGX B200 的先进硬件
Kimi K3 2.8T 模型异常庞大,需要单个 NVIDIA DGX B200 系统以外的专用硬件。为了适应其大小,由于每块 GPU 拥有大量的内存,因此需要涉及 GB300 NVL72、B300 或 MI355X 系统的配置。虽然将多个节点与 WideEP 组合是一个潜在的解决方案,但与 NVL72 等系统相比,B200 有限的节点间带宽构成了一个挑战。
-
美团发布开源 LongCat-2.0,支持 100 万上下文窗口
美团发布的开源模型 LongCat-2.0 已在 MIT 许可下发布。该模型拥有 1.6 万亿参数,其中约有 480 亿活跃参数,并支持 100 万 token 的上下文窗口。它专为代理编码而设计,并与 Claude Code、OpenClaw 和 Hermes Agent 等框架集成,在 SWE-bench Pro 等基准测试中表现出竞争力,超越了 GPT-5.5。
-
DeepSeekV4 展现出快速的性能提升,挑战顶级AI模型
拥有1.6万亿参数的DeepSeekV4模型在其发布后的43天内展现出显著的性能提升。早期基准测试表明,该模型在推理和编码等领域具有竞争力,甚至超越了GPT-4和Claude 3 Opus等成熟模型。该模型的开发得到了Huawei先进计算基础设施的支持,包括其GB300 NVL72和MI355X加速器,以及NVIDIA的B200 GPU,这表明了强大的软硬件协同作用。
-
AMD 投资 360 万美元用于 AI 开发集群,以支持 ROCm 生态系统
AMD 正在大力支持开源 AI 社区,特别是其 ROCm 软件栈。该公司最近向 vLLM 和 SGLang 的维护者提供了价值 360 万美元的互联 MI355X 开发集群的访问权限。此举旨在建立一个更强大的生态系统,类似于 NVIDIA 长期以来的做法,并解决先前在这些关键 AI 开发工具的硬件可用性和支持方面存在的问题。
-
SGLang的MI355x将DeepSeekv4 Pro每GPU吞吐量提升超过10倍
DeepSeekv4 Pro的性能显著提升,每GPU吞吐量实现了十倍以上的增长。这一进步是通过在SGLang框架上集成MI355x实现的。与模型最初发布相比,效率有了大幅飞跃。