一篇新研究论文探讨了评估联邦预训练的挑战,这是一种在不集中化的前提下在分布式数据上训练模型的方法。研究强调,在GLUE等基准上的下游微调可能无法可靠地反映联邦预训练的质量。相反,预训练期间的直接下一个词预测与预训练测试困惑度显示出更强的对应关系,表明它是更可靠的评估信号。 AI
影响 提出了更可靠的联邦预训练评估信号,可能改进模型开发和比较。
排序理由 在arXiv上发表的研究论文,详细介绍了联邦预训练的评估方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →