PulseAugur
实时 15:39:47
实体 DeepSpeed

DeepSpeed

PulseAugur coverage of DeepSpeed — every cluster mentioning DeepSpeed across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 8
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 3
层级分布 · 90 天
主题
关系
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 8 条
  1. RESEARCH · CL_203060 ·

    KV 缓存大小挑战 LLM 推理效率

    KV 缓存是高效 LLM 推理的关键组成部分,它存储每个 token 的键值向量以避免重新计算。该缓存的体积可能比模型权重本身大得多,尤其是在上下文窗口较长的情况下,这会导致巨大的 GPU 内存需求。优化 KV 缓存的传输和管理对于降低推理延迟和成本至关重要,vLLM 和 DeepSpeed 等工具提供了潜在的改进方案。

  2. TOOL · CL_196164 ·

    新的SCOUT框架可检测LLM预训练中的故障

    研究人员开发了SCOUT,一个旨在精确定位大型语言模型(LLM)预训练期间故障的新框架。SCOUT通过在等效副本之间建立严格的多数共识来识别异常值,从而定位停顿、减速或数值错误的根源。即使在训练过程挂起时,该系统也能保持响应,并且其回放功能有助于检测静默数据损坏并验证检查点完整性。SCOUT与PyTorch、TorchTitan、Megatron-Core和DeepSpeed等流行框架兼容。

  3. TOOL · CL_160113 ·

    开发者按概念深度而非流行度绘制150个AI/ML工具图谱

    一位开发者创建了一个约150个AI和机器学习工具的分类图谱,并按“概念深度”而非流行度进行组织。该图谱从即用型AI使用(如ChatGPT)的0级到研究和扩展(包括vLLM和DeepSpeed等工具)的4级不等。列出的每个工具都包含用于理解的文档或文章链接,以及其代码库或主页链接,链接会定期检查有效性。

  4. TOOL · CL_121996 ·

    AI工作站配置:4x RTX 5090 对比 1x RTX 6000 Blackwell

    一位用户正在为YouTube自动化和数据蒸馏等商业应用寻求高端AI工作站的配置建议。他们正在权衡两种GPU配置:四块RTX 5090显卡,总计128GB显存,或一块RTX 6000 Blackwell显卡,拥有96GB显存。用户担心多GPU分片用于视频生成和微调的实际操作性,以及单块大显存显卡的简便性,尤其是在成本相似的情况下。

  5. TOOL · CL_88289 ·

    Anyscale 详解 PyTorch 和 Ray 中的 FSDP,用于训练 Qwen3-TTS

    这篇博文详细介绍了 PyTorch 中的完全分片数据并行(FSDP)技术,这是一种在多个 GPU 上高效训练大型 AI 模型的技术。它涵盖了 FSDP 的内部工作原理,演示了如何分片模型参数、梯度和优化器状态以最大限度地减少每个 GPU 的内存使用。文章包括实际示例,例如使用 PyTorch 和 Ray Train 训练 Vision Transformer 和微调 Qwen3-TTS 语音克隆模型。

  6. TOOL · CL_76535 ·

    开源框架加速 LLM 训练,支持 MoE/MoD

    一位开发者创建了一个开源 PyTorch 框架,专为训练具有混合专家(MoE)和混合深度(MoD)架构的大型语言模型而设计。该框架包含自定义 CUDA 内核,与标准 PyTorch 相比速度显著提升,并提供了一个自适应训练协调器,可自动管理学习率和专家剪枝等参数。它支持从 50 万到 3000 亿参数的模型,并兼容 Apple Silicon。

  7. TOOL · CL_33818 ·

    PyTorch 教程简化分布式人工智能模型推理

    本文使用 PyTorch 解释了大型人工智能模型的分布式推理技术。它详细介绍了如何用最少的代码实现数据并行 (DP)、张量并行 (TP) 和流水线并行 (PP)。演示使用了一个小型模型和两个 GPU 来说明这些概念,旨在揭开 Megatron-LM 和 DeepSpeed 等复杂框架的神秘面纱。

  8. RESEARCH · CL_11807 ·

    新方法解决大语言模型量化问题,以提高效率和准确性

    研究人员开发了多种通过量化提高大语言模型(LLM)效率的新方法。OSAQ 专注于利用低秩 Hessian 属性抑制权重异常值,实现精确的低比特仅权重量化。BWLA 引入了一个框架,用于 1 位权重量化和低比特激活,实现了显著的推理加速。AGoQ 通过采用感知层激活量化和 8 位梯度存储,以内存高效的方式进行分布式训练,减少了内存使用并提高了训练速度。