研究人员正在探索通过整合刚体力学和分析权重结构来增强 Transformer 架构的新方法。一篇论文介绍了“Screw Attention”,这是一种 Transformer 层,它使用刚体代数对物体之间的空间关系进行建模,在操作任务和几何变化鲁棒性方面表现出改进的性能。另一项研究“JET: Justification Evaluation in Transformer”专注于提高 Transformer 在 MMLU 等任务中的决策准确性和效率。进一步的研究通过尺度场研究了 Transformer 权重的介观视图,揭示了组织结构及其在训练过程中的演变。此外,控制理论视角检查了前馈层在 Transformer 动力学中的作用,证明了它们将 token 引向共识的能力,另一篇论文使用模式形成理论来理解塑造 Transformer 中 token 表示的归纳偏置和架构组件。 AI
影响 这些研究为理解和改进 Transformer 模型提供了新的理论框架和分析工具,有望带来更高效、更鲁棒的 AI 系统。
排序理由 多篇 arXiv 论文展示了关于 Transformer 架构及其组件的新研究。
- AdamW
- arXiv
- Feed-Forward Layer
- Hugging Face
- JET: Justification Evaluation in Transformer
- Massive Multitask Language Understanding
- multi-head attention
- Positional Encoding
- Pythia
- Qwen3.6 35B-A3B
- Screw Attention
- self-attention
- transformer
AI 生成摘要 · Google Gemini · 来自 5 个来源。 我们如何撰写摘要 →