研究人员开发了一种名为 SMELT(稀疏 MoE Transformer,中间层循环两次)的新架构,该架构通过迭代共享层块来改进循环 Transformer。通过精确匹配 FLOPs、参数和 KV 缓存,SMELT 在计算方面展示了更快的损失下降,可能节省 6.8-18.0% 的训练 FLOPs。这种架构优势转化为下游基准测试(尤其是在编码任务中)的性能提升,并且似乎源于中间层的第二次通过减少了注意力沉淀并重新将焦点导向相关 token。 AI
影响 这项研究提供了一种提高 Transformer 效率的实用方法,可能降低训练成本并提高在编码等特定任务上的性能。
排序理由 该集群包含一篇详细介绍新模型架构及其性能特征的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →