研究人员开发了递归 Transformer,与标准 Transformer 相比,它们在数据有限的条件下表现更好。这些新模型重用共享块并采用因子化嵌入来优化参数使用并减少词汇映射参数。在各种数据预算和语料库上的实验表明,递归 Transformer 在使用 1000 万到 1 亿词进行训练时优于标准模型,并在 BabyLM 挑战赛 2025 中保持与顶级模型的竞争力。 AI
影响 为在有限数据集上训练语言模型提供了一种更有效的方法,有可能提高在数据稀缺环境中的性能。
排序理由 详细介绍新模型架构的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- BabyLM Challenge 2025
- CatalyzeX
- CORE Recommender
- DagsHub
- Gotit.pub
- Hugging Face
- Recursive Transformers
- ScienceCast
- Transformers
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →