PulseAugur
实时 17:59:08
实体 Mixture of Depths

Mixture of Depths

PulseAugur coverage of Mixture of Depths — every cluster mentioning Mixture of Depths across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. TOOL · CL_168675 ·

    Mixture-of-Depths 动态分配 Transformer 计算量,节省约 50% 的 FLOPs

    研究人员开发了一种名为 Mixture-of-Depths (MoD) 的新颖技术,该技术可以动态分配 Transformer 模型内的计算资源。通过在每个块中引入一个小型路由器,MoD 仅识别和处理最重要的 token,允许不太关键的 token 跳过计算并沿残差连接传递。这种方法通过在固定的总预算下为每个 token 动态分配深度,显著减少了 FLOPs,以大约 50% 的计算量实现了与密集模型相当的性能。

  2. TOOL · CL_148031 ·

    MixCompress框架引入混合专家模型以实现高效图像压缩

    研究人员推出了一种新颖的学习图像压缩框架MixCompress,该框架解决了为每个压缩率存储单独模型的问题。这种新方法利用稀疏的混合专家(MoE)架构,为不同的压缩需求专门化模型组件,从而缓解了特征纠缠。为了进一步提高高比特率下的性能,MixCompress引入了混合深度(MoD)扩展以实现动态容量缩放,并引入了条件辅助变换(CAT)以进行子带能量调制。评估表明,MixCompress不仅可以媲美,甚至可以超越单独优化的单比特率模型,…

  3. RESEARCH · CL_133496 ·

    新研究探索统一路由以实现自适应 LLM 效率 · 跟踪 2 个来源

    两篇新研究论文探讨了通过根据令牌复杂度动态调整计算资源来优化大型语言模型效率的方法。第一篇论文《线性注意力架构》比较了各种线性注意力机制,发现 Kimi Delta Attention with Muon 的验证损失最低,而纯 Gated DeltaNet 堆栈的训练吞吐量最高。这项工作还引入了跨层值路由(CLVR)来提高性能。第二篇论文《TriRoute》提出了一个统一的学习路由系统,该系统为每个令牌联合调整注意力分辨率、专家选择和…

  4. TOOL · CL_76535 ·

    开源框架加速 LLM 训练,支持 MoE/MoD

    一位开发者创建了一个开源 PyTorch 框架,专为训练具有混合专家(MoE)和混合深度(MoD)架构的大型语言模型而设计。该框架包含自定义 CUDA 内核,与标准 PyTorch 相比速度显著提升,并提供了一个自适应训练协调器,可自动管理学习率和专家剪枝等参数。它支持从 50 万到 3000 亿参数的模型,并兼容 Apple Silicon。