Longformer: The Long-Document Transformer
PulseAugur coverage of Longformer: The Long-Document Transformer — every cluster mentioning Longformer: The Long-Document Transformer across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
滑动窗口注意力大幅降低 LLM 成本,实现更长上下文
滑动窗口注意力是一种将大型语言模型的计算成本从二次方降低到线性的技术,它通过将每个 token 的注意力限制在先前 token 的局部窗口内来实现。Longformer、Mistral 和 BigBird 等模型采用的这种方法显著降低了计算和内存需求,尤其是在长序列处理方面。通过堆叠多层,模型可以有效地获得更大的感受野,从而在不产生全自注意力带来的高昂成本的情况下处理和理解长距离依赖关系。
-
无参数稀疏注意力通过数据压缩实现效率提升
研究人员开发了一种新颖的、无需参数的自适应稀疏注意力方法,用于 Transformer 模型,利用数据压缩技术动态选择长程注意力相关的关键内容块。该方法借鉴了 GZIP 等经典压缩算法的思路,识别信息丰富且不易压缩的片段,从而在不增加可学习参数或专用硬件的情况下提高注意力效率。在 PG-19 数据集上的实验表明,与固定注意力模式和其他自适应方法相比,该方法在逐字节语言建模性能上有了显著提升,收敛速度更快,并且在处理长序列时具有更好的可扩展性。
-
大型语言模型通过注意力技巧应对长上下文挑战
大型语言模型中自注意力机制的二次方复杂度,即计算和内存随输入令牌数量的平方而扩展,对处理长上下文构成了重大挑战。各种技术旨在规避这一限制,包括滑动窗口注意力,它将每个令牌的关注范围限制在局部片段;以及注意力沉没(attention sinks),通过保持最初几个令牌的持续可见性来稳定流式处理。稀疏注意力结合了局部窗口与全局和跨步连接,使信息能够跨越更长的序列;而 RoPE 缩放调整位置嵌入,使在较短上下文上训练的模型能够处理扩展输入。
-
新方法使用推理图进行鲁棒的LLM作者归因
研究人员开发了一种新颖的方法,通过分析大型语言模型(LLM)生成的文本的推理结构来归属其作者身份。该方法利用通过论证挖掘管道提取并由图神经网络处理的推理图。与传统基线相比,新方法表现出显著提高的鲁棒性和泛化能力,在对抗释义和反向翻译等混淆技术时,性能高出多达27个百分点。
-
扩展数据集提升了Transformer模型在短信诈骗检测方面的能力
研究人员开发了COVA-X,一个包含10,985个合成对话的扩展数据集,用于检测多轮短信诈骗攻击,特别是那些针对老年人的攻击。这个新数据集是对最初COVA数据集的改进,解决了生成管道中的几个问题,提供了更干净、更全面的数据。扩展数据集使Longformer模型在检测短信诈骗方面优于XGBoost,取得了更高的准确率和宏F1分数,这凸显了利用Transformer模型的全部潜力需要更大的对话语料库。
-
新的注意力方法应对大语言模型长上下文挑战
研究人员正在开发新的注意力机制来处理大型语言模型中日益增长的长上下文。一种方法,Runtime-Certified Bounded-Error Quantized Attention,使用分层 KV 缓存来压缩内存,同时保证回退到精确注意力,确保语言建模和检索等任务的质量。另一种方法,DashAttention,采用可微分稀疏分层注意力来适应性地选择相关 token,以与全注意力相当的准确性实现高稀疏度,并提供优于现有分层方法的性能。…
-
CLaC系统使用LLM和编码器进行政治言论清晰度检测
研究人员提出了一个用于SemEval-2026任务6的系统,专注于检测政治言论中的清晰度和规避性。他们的方法包括比较微调的编码器和基于提示的大型语言模型(LLM)。LLM集成取得了优异的成绩,在少数类上尤其优于微调编码器,并且他们的代码和配置是公开可用的。