PulseAugur
实时 20:34:28
实体 MI300X

MI300X

PulseAugur coverage of MI300X — every cluster mentioning MI300X across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
5
90 天内 12
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/1 页 · 共 12 条
  1. RESEARCH · CL_215745 ·

    新框架优化深度学习和 HPC 的 GPU 内核 · 跟踪 3 个来源

    三篇新研究论文介绍了用于优化 GPU 内核的先进框架,这对于深度学习和高性能计算至关重要。HIERA 专注于跨 PyTorch 和 CUDA 等不同实现空间的感知工作负载规划,展示了更高的效率和性能。AsmEvo 在 AMD GPU 的汇编级别进行优化,验证功能等价性并在生产工作负载上实现显著加速。KernelArc 在 NVIDIA GPU 上采用多智能体框架进行自主优化,通过协调专业智能体在基准排行榜上获得顶级排名。

  2. TOOL · CL_202483 ·

    Ruitong 推出以衡量 LLM 在不同硬件上的准确性漂移

    一项名为 Ruitong 的新计划已启动,旨在解决大型语言模型 (LLM) 在迁移到不同硬件时出现的准确性漂移问题。虽然延迟和成本是众所周知的,但对模型输出的影响在很大程度上仍未被衡量。Ruitong 旨在提供一个标准化、可复现的准确性差异表,以量化这些变化,使公司能够更好地评估在切换硬件供应商或精度时模型的性能。初步研究结果表明,即使是微小的精度变化也会导致不同的输出,尽管端到端的函数等效性门控通常仍然通过。

  3. COMMENTARY · CL_200595 ·

    提议:在 GPU 层面强制执行 AI 模型安全

    一项提议建议在 GPU 层面强制执行 AI 模型安全,以减轻风险,特别是来自开放权重模型的风险。目前的安保措施包括内部模型保护、输入/输出筛选和监控,但这些措施对于开放权重模型通常不可行。作者认为,GPU 级别的合规性可以作为额外的安全层,特别是随着包括 Claude Opus 和 Fable 等模型在内的强大 AI 代理能够发动大规模网络攻击。

  4. FRONTIER RELEASE · CL_189279 ·

    阿里巴巴发布 Qwen3.8-27B 模型;AI 助力 GPU 移植;LLM 基础设施详解

    阿里巴巴的 Qwen 团队发布了 Qwen3.8-27B,这是一个拥有 270 亿参数的密集模型,可容纳在单个 GPU 上,并支持 100 万 token 的上下文窗口,在 vLLM 中实现了 Day-0 集成。同时,研究正在探索 AI 辅助的 GPU 移植技术,用于遗留科学应用程序,展示了显著的速度提升和数值验证。此外,还详细介绍了 LLM 的 GPU 基础设施的更广泛格局,涵盖了硬件选项和优化技术,如连续批处理和层流式处理,以最大…

  5. RESEARCH · CL_166886 ·

    AMD MI355X 性能因社区黑客马拉松而提升,在 Kimi 模型上可与 B200 匹敌 · 跟踪 6 个来源

    AMD 与 GPU_MODE 合作,启动了一个耗资 110 万美元的内核黑客马拉松,显著提升了其 MI355X 图形卡的性能。Readonflow Team 的优化专注于 MoE 内核和其他核心组件,带来了高达 4 倍的性能提升,并已合并到 AMD 的 AITER 内核库和 ATOM 推理引擎中。该计划旨在使 AMD 的 vLLM 性能接近 CUDA vLLM 的水平,并增强社区对 ROCm 堆栈的体验。

  6. COMMENTARY · CL_162152 ·

    人工智能的真正瓶颈:内存而非芯片限制了大型语言模型的扩展性

    人工智能行业面临的关键瓶颈并非NVIDIA H100或AMD MI300X等专用芯片的可用性,而是支持它们的内存系统。尽管Google、Microsoft和Meta等公司在硬件方面投入巨资,但像OpenAI的GPT-4和Meta的Llama 3这样的大型语言模型的真正限制在于内存的速度和容量。这一限制正变得比GPU本身的供应更为显著,影响着人工智能发展的可扩展性和效率。

  7. TOOL · CL_153047 ·

    Unsloth为更快的本地LLM训练增加了AMD GPU支持

    Unsloth发布了一项更新,显著增强了对AMD GPU的支持,从而可以在各种AMD硬件上进行本地LLM训练和推理。新版本承诺在不影响准确性的情况下,性能提升高达2倍,显存使用量减少70%。更新还包括对ROCm的优化、与MI300X和MI325X等特定AMD GPU的兼容性改进,以及运行更大模型和更可靠下载的增强功能。

  8. TOOL · CL_108532 ·

    Inferra提议建立GPU计算期货交易所以解决碎片化市场问题

    由于访问碎片化、H100等高需求芯片分配不均以及供应商之间缺乏价格透明度,为AI开发采购GPU仍然充满挑战。现有的解决方案,如预留实例、竞价实例和Vast.ai等市场,未能充分解决这些问题。一个名为Inferra的新项目正在提议建立一个GPU计算的衍生品交易所,提供特定芯片的永续期货,以实现价格发现和对冲未来需求。

  9. TOOL · CL_92344 ·

    Machine0.io 推出支持 CLI 控制的持久化虚拟机

    Machine0.io 推出了一个新的服务,为开发者和代理提供持久化虚拟机 (VM),可以通过命令行界面 (CLI) 访问。这些虚拟机运行 NixOS 或 Ubuntu,并预装了工具,提供专用的资源、静态 IP 和按分钟计费。该服务强调可复现的构建、用于节省成本的状态冻结以及跨多个区域的全球可用性。

  10. TOOL · CL_77556 ·

    使用 ROCm 和 QLoRA 在 AMD MI300X 上微调 LLM

    本文详细介绍了使用 AMD 的 ROCm 平台,特别是在 MI300X 硬件上微调大型语言模型的实用工作流。文章重点介绍了如何通过利用 ROCm、QLoRA 技术和检查点训练来克服 NVIDIA CUDA 的主导地位。该过程旨在利用 MI300X 上可用的 192GB 大量 VRAM 来实现高效的模型定制。

  11. TOOL · CL_55396 ·

    TritonMoE 内核实现跨平台 MoE 推理

    研究人员开发了 TritonMoE,这是一种用于专家混合(MoE)模型的新推理内核,完全使用 OpenAI 的 Triton 语言编写。该内核实现了跨平台兼容性,无需供应商特定的代码即可在 NVIDIA 和 AMD 硬件上运行。它展示了显著的性能提升,在较短的 token 序列吞吐量方面优于 Megablocks 等现有方法,尽管在非常长的上下文或大量专家方面存在局限性。

  12. RESEARCH · CL_10487 ·

    AMD的MI300X因软件问题在AI训练方面表现不佳

    最近的基准测试分析显示,尽管AMD的MI300X在规格和总体拥有成本方面具有理论优势,但在AI训练工作负载方面,它与NVIDIA的H100和H200相比缺乏竞争力。主要原因是AMD的软件栈不成熟且存在错误,这阻碍了其开箱即用的可用性和性能。虽然AMD的工程师已展现出修复问题的能力,但该公司整体的软件质量保证文化和开发方法需要显著改进,才能挑战NVIDIA成熟的CUDA生态系统。