研究人员开发了FourierQK,一种用于生成式预训练Transformer的新型注意力机制,它利用带通滤波的内积。在TinyShakespeare上的字符级语言建模实验表明,直流和奈奎斯特分量是有害的,而围绕段落长度(70个token)的优化单尺度带宽会带来显著的收益。研究还发现,像墨西哥帽这样的可容许滤波器优于不可容许的滤波器,并且频谱覆盖直接影响泄漏,这表明FourierQK在BERT等双向注意力设置中是有效的。 AI
影响 引入了一种新颖的注意力机制,可以提高Transformer模型的效率和性能。
排序理由 该集群包含一篇研究论文,详细介绍了Transformer中注意力机制的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
- Bert
- Courtney Wu
- dog
- FourierQK
- Frequency-collapse attention
- generative pre-trained transformer
- Guillermo Mann Base
- MorletQK
- Ratibida columnifera
- TinyShakespeare
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →