LongBench: a bilingual, multitask benchmark for long context understanding
PulseAugur coverage of LongBench: a bilingual, multitask benchmark for long context understanding — every cluster mentioning LongBench: a bilingual, multitask benchmark for long context understanding across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
WakeKV 为 LLM 引入反应式 KV 缓存驻留
研究人员开发了 WakeKV,这是一种新颖的 KV 缓存驻留策略,旨在提高大型语言模型的效率。与固定头分类的现有方法不同,WakeKV 会动态地将生成过程中行为发生变化的头移动到可恢复的 CPU 存储库中。这种反应式方法在各种模型和任务中持续提高性能,在内存受限的情况下优于 SnapKV 和 ReasonAlloc 等方法。
-
新的HHR方法提升LLM长上下文生成速度
研究人员开发了层级哈希检索(HHR),一个旨在提高大型语言模型(LLM)在生成过程中效率的新框架,尤其是在长上下文场景下。HHR通过引入几何感知键路由(GKR)和学习哈希投影(LHP)来解决传统基于哈希的检索的局限性。这些技术协同工作,通过更好地使汉明距离与实际注意力相关性对齐来提高检索精度,从而减少检索错误。实验表明,HHR在LongBench等基准测试中显著提升了Llama 3.1 8B-Instruct模型的解码速度和整体性能。
-
新的VLM框架LensVLM和FocusVTC改进了视觉文本压缩
研究人员开发了两个新框架LensVLM和FocusVTC,以改进视觉语言模型(VLM)处理长文档的方式,方法是压缩视觉文本表示。LensVLM使用训练后方法选择性地扩展相关文本的压缩图像,在保持准确性的同时实现了显著压缩。FocusVTC采用自适应分辨率,结合低DPI全局视图和选择性区域增强,并在各种基准测试中展示了改进的性能,甚至在某些任务上超越了其文本输入骨干。
-
新研究解决KV缓存压缩问题,以实现高效LLM推理 · 跟踪10个来源
arXiv上发布的多篇研究论文提出了优化大型语言模型(LLM)中键值(KV)缓存的新方法,以提高推理效率并减少内存使用。EchoPress和PatchKV等技术旨在在不显著损失准确性的情况下修剪或补偿KV缓存压缩,而ResidualKV和KV-Kaizen等其他技术则探索自适应压缩策略。此外,ATTUNER和HeadGuard等方法分别侧重于查询端适应和选择性头部保护,以应用于LLM代理和视觉语言模型等特定场景。
-
新的自索引注意力机制提升了 LLM 长上下文推理速度
研究人员开发了一个名为自索引注意力(Self-Indexing Attention)的新框架,旨在提高稀疏长上下文大型语言模型(LLM)推理的效率。这种无需训练的方法利用共享的变换域表示,允许使用可重用的令牌级索引,从而在预填充和解码阶段实现高效检索。该系统实现了显著的速度提升,实验表明在 5% 的注意力密度下,预填充速度最快可达 6.1 倍,解码注意力操作速度最快可达 10.3 倍,同时在 LongBench 和 RULER 等基准…
-
KV 缓存压缩研究确定时间聚合为关键因素
研究人员调查了时间聚合和排名保留对大型语言模型解码时 KV 缓存压缩的影响。他们发现指数移动平均 (EMA) 聚合可以使评分器修改在驱逐级别无法区分,从而实现稳定的保留集。这促成了 InertiaKV 和 InertiaKV-Lazy 的开发,这些方法与完全刷新方法相比,将解码吞吐量提高了 1.34-1.46 倍。该研究还探讨了无评分解码,它在显著降低计算成本的同时保持了平均质量。
-
新的 Faster Flash Decoding 框架提高了 LLM 的长上下文效率
研究人员开发了 Faster Flash Decoding (FFD),一个显著提高大型语言模型长上下文解码效率的新框架。FFD 通过将选择器和计算器集成到融合内核中,并使用低比特量化的内容感知扫描,解决了注意力机制的内存带宽瓶颈和二次复杂度问题。这个无需训练、即插即用的解决方案实现了高达 11.6 倍的内核级加速和 2.37 倍的端到端吞吐量提升,使模型能够在保持准确性的同时处理长达 256K 的上下文长度,这已在 RULER 和 …
-
Tail-Replay 提升混合 LLM 推理速度,实现无约束的前缀重用
研究人员推出了一种新颖的前缀缓存机制 Tail-Replay,旨在提高混合大型语言模型(LLM)的效率。这些模型结合了全注意力(full-attention)和线性注意力(linear-attention)层来处理长上下文,但传统的前缀缓存难以处理这些层不同的状态管理。Tail-Replay 通过重放匹配前缀的短后缀来近似线性注意力状态,从而消除了对循环状态检查点的需求。这种方法实现了无约束的 token 级前缀重用,并在 LongB…
-
CRISP方法提升长上下文LLM推理速度和准确性
研究人员开发了CRISP,一种提高长上下文大型语言模型(LLM)推理效率的新方法。CRISP通过引入直接的结构化路由指标和感知接收器的阈值来缓解背景噪声,从而解决了预填充阶段自注意力机制的二次方扩展瓶颈。该方法在512k token下实现了高达5.30倍的速度提升,并在InfiniteBench、RULER和LongBench等基准测试中提高了检索准确性。
-
SEER框架通过选择性视觉-文本压缩增强LLM长上下文推理能力
研究人员开发了SEER,一个旨在通过选择性压缩视觉-文本信息来改进大型语言模型长上下文推理能力的新框架。与之前应用统一压缩的方法不同,SEER根据查询学习识别和检索最相关的文本内容,从而在降低计算成本的同时保持精度。在LongBench基准测试上的实验证明了SEER的有效性,其准确性高于Glyph-9B和Qwen3-8B等基线模型。
-
新的AI架构MARCH和Consolidator提升长上下文记忆能力
两篇新的研究论文介绍了一种增强AI模型长上下文记忆能力的新型架构。第一篇MARCH提出了一种系统,该系统会定期将循环状态检查点缓存为“状态锚点”,以在保持计算效率的同时维护不断增长的记忆库。第二篇Consolidator则专注于在将短期记忆累积到长期记忆之前对其进行转换,从而使模型能够更有效地跨越上下文边界保留和利用信息。这两种方法都旨在克服当前Transformer和循环模型在处理扩展序列和复杂回忆任务方面的局限性。
-
新的基准测试 LLM 长上下文推理,超越简单检索
新的基准正在涌现,以测试大型语言模型(LLM)在处理扩展上下文方面的能力,超越了简单的“大海捞针”检索测试。虽然由 Greg Kamradt 推广的大海捞针测试在初步评估中很有用,但它存在一些局限性,例如容易被优化以及不能反映现实世界的语义复杂性。研究人员正在开发更稳健的方法,如 NVIDIA 的 RULER 和清华大学的 LongBench,它们旨在通过评估模型在整个文档上进行推理的能力,而不仅仅是定位特定事实,来衡量模型的“有效上下文长度”。
-
新的ReTopK方法加速了LLM的长上下文注意力
研究人员开发了ReTopK,一种提高Transformer模型长上下文注意力效率的新颖方法。该技术通过重用过去的注意力决策来加速识别相关键值对的过程,从而降低计算成本。ReTopK在128K上下文长度下实现了超过3倍的注意力计算加速,同时仅带来极小的困惑度增加。该方法在PG19和LongBench等基准测试中表现强劲,优于其他近似注意力方法。
-
PIVOT索引方法加速LLM中的稀疏注意力
研究人员开发了PIVOT,一种新颖的索引方法,旨在优化大型语言模型中的令牌级稀疏注意力。PIVOT通过减少冗余计算,解决了DeepSeek Sparse Attention等系统中索引器造成的瓶颈。它通过对附近的查询进行分组并执行一次共享扫描来识别候选令牌,从而显著加速了索引过程。
-
OpenAI subreddit 用户寻求聊天评估基准
一位 r/OpenAI subreddit 的用户正在寻求用于评估聊天模型性能的数据集和基准的建议。他们特别关注衡量多轮对话准确性和内存管理,并指出 LongBench、NIAH 和 RULER 等现有基准可能已过时。该用户旨在识别当前最先进的方法并找出自己工作中的薄弱环节,目前不包括基于代理的评估。
-
LLM KV缓存管理:安全威胁与效率创新
研究人员正在探索管理大型语言模型(LLM)中关键值(KV)缓存的新方法,这对于推理速度至关重要,但会随着上下文长度线性增长。一种方法,“通过随机设计实现KV缓存驱逐的误差证书”,提出使用随机驱逐策略来提供误差界限并改进故障归因,在降低预算的情况下几乎免费地获得性能提升。相比之下,“HijackKV”识别出位置无关KV缓存重用方面的一个新安全漏洞,其中受污染的KV数据可以以很高的成功率悄悄地劫持模型行为。第三种方法,“SelKV”,提供…
-
新研究致力于 LLM KV 缓存优化以提高效率 · 已追踪 10 个来源
近期研究论文引入了优化大型语言模型中 KV 缓存管理的新技术,解决了内存瓶颈并提高了推理效率。vToken、GCache、LinearKV、KVDiagnosis、SemPIC、SPECTRA、CommitKV、RippleKV、CoinRAG 和 GraceKV 等方法提出了各种策略,包括令牌级虚拟化、全局影响缓存、与位置无关的缓存、诊断基准测试、语义缓存、谱变换编码、生命周期感知压缩和全局资源分配。这些方法旨在减少内存使用量、加速…
-
新框架LongCrafter增强LLM长上下文理解能力
研究人员推出了一种名为LongCrafter的新框架,旨在生成多样化的高质量数据,用于微调大型语言模型(LLMs),以提高其长上下文理解能力。该框架通过分层组织任务、将生成指令与证据图关联,并确保可控的难度和忠实度,解决了现有方法的局限性。使用LongCrafter数据微调的模型在LongBench和LongBench-v2等基准测试中表现出优越的性能,尤其在更具挑战性的任务上表现出色,并缓解了“中间丢失”问题。
-
新的RAGP方法使用图剪枝和莱维行走来压缩提示
研究人员开发了一种新颖的提示压缩技术,称为RAGP,它将文本建模为多重图,以捕捉局部句法和全局语义关系。该方法利用莱维行走来有效地识别和修剪图结构中的冗余信息。在LongBench基准测试上的实验表明,RAGP在更高的压缩率下,平均得分高于LongLLMLingua等现有方法。
-
新的强化学习框架优化LLM KV缓存以实现高效推理
研究人员开发了一个名为KV Policy (KVP) 的新颖框架,通过优化键值(KV)缓存来解决大型语言模型(LLM)的内存需求。KVP将KV缓存驱逐重构为一个强化学习问题,训练轻量级代理来预测未来解码的token有用性。该方法在长上下文和多轮对话基准测试中显著优于现有的启发式方法,并展示了在不改变底层LLM的情况下泛化到新任务和更长序列长度的能力。