PulseAugur
中
实时 15:56:29
实体 Moonlight-16B-A3B

Moonlight-16B-A3B

PulseAugur coverage of Moonlight-16B-A3B — every cluster mentioning Moonlight-16B-A3B across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
5
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
4
90 天内 4
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 5 条
  1. TOOL · CL_277202 ·

    新的 MoRA 框架剪枝 MoE 模型,提高效率和性能

    研究人员开发了 MoRA,一个新颖的框架,用于剪枝混合专家(MoE)模型,以减少内存使用而不显著影响性能。MoRA 引入了可学习的路由器偏差来锐化路由概率并鼓励专家多样性,以及一个专家近似机制来进一步增强剪枝后的模型。在 Qwen3-30B-A3B、DeepSeek-V2-Lite 和 Moonlight-16B-A3B 上的实验表明,MoRA 在九个零样本基准测试中优于现有的剪枝方法。

  2. TOOL · CL_244873 ·

    新技术保留 MoE 路由结构,以提高 AI 模型性能

    研究人员推出了一种名为 Router Prior Bias (RPB) 的新技术,以提高混合专家 (MoE) 模型在训练后的性能。与强制均匀使用专家的标准方法不同,RPB 保留了预训练期间学到的固有的、非均匀的路由结构。这种被称为软路由锚定的方法,在 Moonlight-16B-A3B 和 Qwen3-30B-A3B-Base 等模型上展示了显著的领域内准确性提升,其表现优于均匀重新应用负载均衡损失和未锚定的微调。研究表明,软性地维护…

  3. TOOL · CL_231402 ·

    Instella-MoE:新的开源 MoE 语言模型发布

    一份新的技术报告介绍 Instella-MoE,一个拥有 160 亿总参数的开源专家混合(MoE)语言模型。该模型在 AMD Instinct GPU 上训练,并采用了门控多头潜在注意力(Gated Multi-head Latent Attention)和 FarSkip-Collective 连接等创新技术,以实现高效的训练和推理。Instella-MoE 在预训练基准测试中表现强劲,优于其他开源模型,并在指令遵循、推理、数学、编…

  4. TOOL · CL_176538 ·

    AMD 发布拥有 2.8B 激活参数的开源 Instella-MoE-16B LLM

    AMD 发布了 Instella-MoE-16B-A3B,这是一款开源的专家混合(Mixture-of-Experts)语言模型。该模型拥有 160 亿总参数,但每个 token 仅激活 28 亿参数,利用了门控多头潜在注意力(Gated Multi-head Latent Attention)和 FarSkip-Collective 连接等架构创新,以提高训练和推理速度。虽然训练代码采用 MIT 许可且高度可重用,但模型权重是在 R…

  5. RESEARCH · CL_163913 ·

    新研究通过先进的推测解码技术提高LLM推理速度 · 追踪8个来源

    研究人员正在探索先进技术,通过推测解码来加速大型语言模型(LLM)的推理。"Functional Reconstruction"等新方法旨在通过优化注意力函数来提高草稿模型和目标模型之间的一致性,而"SparseSpec-L"则利用动态稀疏化的KV缓存和每头注意力统计数据来提高效率。其他工作重新审视了"lossy verification"以分析权衡和失败模式,并将方法分为基于截断和协作验证。此外,"AngelSpec"为不同的推测解…