实体
Instella-MoE-16B-A3B
Instella-MoE-16B-A3B
PulseAugur coverage of Instella-MoE-16B-A3B — every cluster mentioning Instella-MoE-16B-A3B across labs, papers, and developer communities, ranked by signal.
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
时间线
最近 · 第 1/1 页 · 共 3 条
-
AMD推出Instella-MoE-16B-A3B,完全使用自家GPU训练
AMD发布了其Instella-MoE-16B-A3B AI模型,这是一个重要的进展,因为它完全使用AMD自家的GPU(特别是Instinct MI300X和MI325X)进行训练,不依赖Nvidia硬件或CUDA等软件。这个拥有160亿参数的模型采用了混合专家(MoE)架构,每次推理只激活28亿参数,从而实现更快的处理速度。AMD还完全开源了训练权重、代码和数据配方,允许社区进行审查和进一步开发,但模型权重根据ResearchRAI…
-
AMD 发布拥有 2.8B 激活参数的开源 Instella-MoE-16B LLM
AMD 发布了 Instella-MoE-16B-A3B,这是一款开源的专家混合(Mixture-of-Experts)语言模型。该模型拥有 160 亿总参数,但每个 token 仅激活 28 亿参数,利用了门控多头潜在注意力(Gated Multi-head Latent Attention)和 FarSkip-Collective 连接等架构创新,以提高训练和推理速度。虽然训练代码采用 MIT 许可且高度可重用,但模型权重是在 R…
-
AMD携Instella-MoE-16B-A3B进入开源AI模型领域
AMD发布了名为Instella-MoE-16B-A3B的新开源模型,可在HuggingFace上获取。这标志着AMD进入了开源AI模型开发领域。该模型最近上传,社区尚未完全探索其性能和能力。