实体
FarSkip-Collective
FarSkip-Collective
PulseAugur coverage of FarSkip-Collective — every cluster mentioning FarSkip-Collective across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
AMD发布在自家GPU上训练的开源Instella-MoE AI模型
AMD发布了Instella-MoE,这是一款使用其自有GPU和软件开发的新型开源混合专家(Mixture-of-Experts)语言模型。该模型有多种形式可供选择,包括预训练、中度训练和微调版本,其训练代码和框架也公开可用。Instella-MoE拥有160亿总参数和28亿活跃参数,在某些基准测试中表现出竞争力,尤其超越了Gemma-4-E4B。
-
新的MoE架构通过重叠计算和通信来提高AI模型速度
研究人员开发了FarSkip-Collective,这是一种用于混合专家(MoE)模型的新型架构修改,旨在提高分布式环境中的通信效率。该方法通过引入跳跃连接,使计算能够与通信重叠,即使对于Llama 4 Scout (109B)等大型架构,也能保持与原始模型相当的准确性。该方法在训练和推理方面都显示出显著的加速效果,在DeepSeek-V3推理过程中,首次令牌时间(Time To First Token)提高了32.6%,并在训练期间…