一篇新研究论文探讨了训练轨迹如何影响退火软先验Transformer中电路的可移除性。研究发现,特定的训练方法,如平滑渐零训练,对于在移除位置先验后保留检索电路的功能至关重要。这种效应在不同任务中都得到了观察,包括联想回忆和马尔可夫归纳,这表明训练路径,而不仅仅是最终架构,决定了小型离散检索任务中电路的可移除性。 AI
影响 了解训练如何影响模型的电路可移除性可能有助于开发更强大、更具可解释性的AI系统。
排序理由 arXiv上发表的研究论文,详细介绍了Transformer模型训练的发现。[lever_c_demoted from research: ic=1 ai=1.0]
在 arXiv cs.NE (Neural & Evolutionary) 阅读 →
- annealable soft-prior Transformer
- arXiv
- Associative recall of memory without errors
- Hugging Face
- Linear regression ICL
- Markov induction
- Soft-prior Transformers
- Transformers
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →