DeepGEMM
PulseAugur coverage of DeepGEMM — every cluster mentioning DeepGEMM across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
vLLM v0.31.0 通过 FlashMLA、DeepGEMM 和 MXFP8 增强服务
vLLM 发布了 0.31.0 版本,为其服务能力带来了重大增强。此次更新将 FlashMLA 与 V4.1 NVFP4 压缩 KV 缓存集成,作为 SM100 的默认配置,并包含了 DeepGEMM。该版本还具有稀疏 MQA logits、Mega-Gate 融合以及使用 MXFP8 量化的融合小批量 WO-A。
-
DeepSeek 开源支持华为 Ascend 硬件的 AI 基础设施
DeepSeek 已发布其 TileLang、DeepGEMM 和 DeepEP 基础设施组件的开源 Ascend 兼容版本。这些工具旨在优化 AI 模型在华为 Ascend 硬件上的性能。此次发布旨在促进 AI 社区内更广泛的采用和发展。
-
DeepSeek、华为开源工具挑战英伟达AI主导地位 · 跟踪10个来源
DeepSeek 和华为联合发布了一套开源工具,旨在增强华为 Ascend AI 芯片的软件生态系统。该计划旨在提供 Nvidia 的 CUDA 平台的 viable 替代方案,提供 TileLang 编程语言、高性能计算库(DeepGEMM、FlashMLA)和分布式通信库(DeepEP)等组件。此次合作的重点是使开发人员能够更轻松地充分发挥 Ascend 硬件的全部性能,在中国培养一个独立可控的人工智能芯片软件环境。
-
智谱AI的GLM-5.2模型已部署在无服务器GPU上
智谱AI发布了GLM-5.2,一个拥有7000亿参数的混合专家模型(MoE),在复杂推理和软件工程任务方面表现出色,据报道在某些基准测试中能媲美甚至超越Claude 3.5 Sonnet和GPT-4o等专有模型。由于其庞大的权重和上下文窗口,部署这个大型模型需要一个8x NVIDIA H200 GPU集群,这带来了显著的基础设施挑战。文章详细介绍了在无服务器GPU平台Modal上部署GLM-5.2的案例研究,强调了FP8量化在内存效率…
-
DeepSeek V4 通过自定义内核取代 cuBLAS 实现更快的性能
DeepSeek 开发了一个自定义内核栈 DeepGEMM 和 TileLang,其性能不仅媲美,而且超越了 NVIDIA 的 cuBLAS。此自定义实现实现了比特级确定性和批次不变性,解决了其他工作负载平衡策略(如 splitK 或 split-KV)中常见的非确定性输出问题。这项创新在于其浮点数学方法,确保了调试和训练结果的一致性。