实体
Moonlight-16B-A3B
Moonlight-16B-A3B
PulseAugur coverage of Moonlight-16B-A3B — every cluster mentioning Moonlight-16B-A3B across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天
2 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
AMD 发布拥有 2.8B 激活参数的开源 Instella-MoE-16B LLM
AMD 发布了 Instella-MoE-16B-A3B,这是一款开源的专家混合(Mixture-of-Experts)语言模型。该模型拥有 160 亿总参数,但每个 token 仅激活 28 亿参数,利用了门控多头潜在注意力(Gated Multi-head Latent Attention)和 FarSkip-Collective 连接等架构创新,以提高训练和推理速度。虽然训练代码采用 MIT 许可且高度可重用,但模型权重是在 R…
-
新研究通过先进的推测解码技术提高LLM推理速度 · 追踪8个来源
研究人员正在探索先进技术,通过推测解码来加速大型语言模型(LLM)的推理。"Functional Reconstruction"等新方法旨在通过优化注意力函数来提高草稿模型和目标模型之间的一致性,而"SparseSpec-L"则利用动态稀疏化的KV缓存和每头注意力统计数据来提高效率。其他工作重新审视了"lossy verification"以分析权衡和失败模式,并将方法分为基于截断和协作验证。此外,"AngelSpec"为不同的推测解…