TinyShakespeare
PulseAugur coverage of TinyShakespeare — every cluster mentioning TinyShakespeare across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
FourierQK 技术通过频谱预处理提升 Transformer 注意力 · 已追踪 2 个来源
研究人员开发了一种名为 FourierQK 的新技术,通过对查询-键投影应用频谱预处理,显著增强了 Transformer 注意力机制。该方法在 TinyShakespeare 等字符级语言建模任务上进行了测试,与标准的点积注意力相比,错误率降低了高达 79%,取得了显著的性能提升。其优势归因于全局频域混合而非度量失真,并且该方法在架构上与 FNet 等先前方法不同。
-
LoRA-Muon:新型优化器提升深度学习微调效率
研究人员推出了一种名为LoRA-Muon的优化技术,旨在提高低秩适配(LoRA)在深度学习模型中的效率和有效性。该新方法将谱最速下降规则应用于低秩设置,旨在为现有的LoRA微调方法提供更稳定、性能更好的替代方案。LoRA-Muon在跨越不同模型维度时表现出更强的学习率可迁移性,甚至在某些场景下可以超越密集基线,提供一种更节省内存的方法。
-
Morlet 小波框架增强 Transformer 位置编码
研究人员推出了一种新颖的 Transformer 位置编码框架——Morlet 位置编码 (MoPE),超越了传统正弦和旋转方法。MoPE 利用 Morlet 小波同时编码位置和频率,使每个嵌入维度都能学习自己的局部性带宽。该方法在理论上统一了现有方法,并在语言建模等任务中取得了实证改进,与能量门控注意力结合时性能优于标准注意力机制。
-
能量门控注意力通过优先处理显著性token来增强Transformer模型
研究人员推出了一种名为能量门控注意力(EGA)的新型机制,旨在通过关注谱显著性token来改进Transformer模型。该方法借鉴了流体动力学的原理,优先处理信息密集且拥有不成比例谱能量的token。EGA在TinyShakespeare和Penn Treebank等数据集上实现了显著的验证损失改进,同时参数开销极小,计算成本也无额外增加。