DeepSpeed
PulseAugur coverage of DeepSpeed — every cluster mentioning DeepSpeed across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
KV 缓存大小挑战 LLM 推理效率
KV 缓存是高效 LLM 推理的关键组成部分,它存储每个 token 的键值向量以避免重新计算。该缓存的体积可能比模型权重本身大得多,尤其是在上下文窗口较长的情况下,这会导致巨大的 GPU 内存需求。优化 KV 缓存的传输和管理对于降低推理延迟和成本至关重要,vLLM 和 DeepSpeed 等工具提供了潜在的改进方案。
-
新的SCOUT框架可检测LLM预训练中的故障
研究人员开发了SCOUT,一个旨在精确定位大型语言模型(LLM)预训练期间故障的新框架。SCOUT通过在等效副本之间建立严格的多数共识来识别异常值,从而定位停顿、减速或数值错误的根源。即使在训练过程挂起时,该系统也能保持响应,并且其回放功能有助于检测静默数据损坏并验证检查点完整性。SCOUT与PyTorch、TorchTitan、Megatron-Core和DeepSpeed等流行框架兼容。
-
开发者按概念深度而非流行度绘制150个AI/ML工具图谱
一位开发者创建了一个约150个AI和机器学习工具的分类图谱,并按“概念深度”而非流行度进行组织。该图谱从即用型AI使用(如ChatGPT)的0级到研究和扩展(包括vLLM和DeepSpeed等工具)的4级不等。列出的每个工具都包含用于理解的文档或文章链接,以及其代码库或主页链接,链接会定期检查有效性。
-
AI工作站配置:4x RTX 5090 对比 1x RTX 6000 Blackwell
一位用户正在为YouTube自动化和数据蒸馏等商业应用寻求高端AI工作站的配置建议。他们正在权衡两种GPU配置:四块RTX 5090显卡,总计128GB显存,或一块RTX 6000 Blackwell显卡,拥有96GB显存。用户担心多GPU分片用于视频生成和微调的实际操作性,以及单块大显存显卡的简便性,尤其是在成本相似的情况下。
-
Anyscale 详解 PyTorch 和 Ray 中的 FSDP,用于训练 Qwen3-TTS
这篇博文详细介绍了 PyTorch 中的完全分片数据并行(FSDP)技术,这是一种在多个 GPU 上高效训练大型 AI 模型的技术。它涵盖了 FSDP 的内部工作原理,演示了如何分片模型参数、梯度和优化器状态以最大限度地减少每个 GPU 的内存使用。文章包括实际示例,例如使用 PyTorch 和 Ray Train 训练 Vision Transformer 和微调 Qwen3-TTS 语音克隆模型。
-
开源框架加速 LLM 训练,支持 MoE/MoD
一位开发者创建了一个开源 PyTorch 框架,专为训练具有混合专家(MoE)和混合深度(MoD)架构的大型语言模型而设计。该框架包含自定义 CUDA 内核,与标准 PyTorch 相比速度显著提升,并提供了一个自适应训练协调器,可自动管理学习率和专家剪枝等参数。它支持从 50 万到 3000 亿参数的模型,并兼容 Apple Silicon。
-
PyTorch 教程简化分布式人工智能模型推理
本文使用 PyTorch 解释了大型人工智能模型的分布式推理技术。它详细介绍了如何用最少的代码实现数据并行 (DP)、张量并行 (TP) 和流水线并行 (PP)。演示使用了一个小型模型和两个 GPU 来说明这些概念,旨在揭开 Megatron-LM 和 DeepSpeed 等复杂框架的神秘面纱。
-
新方法解决大语言模型量化问题,以提高效率和准确性
研究人员开发了多种通过量化提高大语言模型(LLM)效率的新方法。OSAQ 专注于利用低秩 Hessian 属性抑制权重异常值,实现精确的低比特仅权重量化。BWLA 引入了一个框架,用于 1 位权重量化和低比特激活,实现了显著的推理加速。AGoQ 通过采用感知层激活量化和 8 位梯度存储,以内存高效的方式进行分布式训练,减少了内存使用并提高了训练速度。