实体
MoE models
MoE models
PulseAugur coverage of MoE models — every cluster mentioning MoE models across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
xHC 方法将 Transformer 流扩展到 N=4 以上,以改进 LLM 预训练
研究人员推出了一种新颖的 xHC(扩展超连接)方法,用于将 Transformer 模型扩展到 N=4 流的典型限制之外。这种新方法解决了先前超连接(HC)方法中的瓶颈,例如写回信息不足和计算成本高昂的残差混合生成。通过结合时间特征增强和稀疏残差流架构,xHC 能够有效地扩展到 N=16 流,在 18B 和 28B MoE 模型上显示出显著的下游改进。此外,还提出了 xHC-Flash 以减少内存流量,使大 N 残差流扩展在 LLM …
-
为本地 LLM 推理寻求预算 GPU 建议
一位用户在 r/LocalLLaMA 子版块上寻求关于在预算有限的情况下购买硬件以运行大型语言模型的建议。他们正在考虑购买一张拥有 32GB 显存的 Radeon VII,或者两张提供总计 48GB 显存的 P100 GPU,两者价格相似。用户正在权衡更多显存和更快推理速度之间的取舍,特别是询问更高的显存对于 Q8 量化的专家混合(MoE)模型是否有用,并寻求其他合适的 MoE 模型推荐。