PulseAugur
实时 06:41:34
实体 LongBench: a bilingual, multitask benchmark for long context understanding

LongBench: a bilingual, multitask benchmark for long context understanding

PulseAugur coverage of LongBench: a bilingual, multitask benchmark for long context understanding — every cluster mentioning LongBench: a bilingual, multitask benchmark for long context understanding across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
7
90 天内 25
发布 · 30天
0
90 天内 0
论文 · 30天
6
90 天内 22
层级分布 · 90 天
主题
关系
情绪 · 30 天

6 天有情绪数据

最近 · 第 1/2 页 · 共 25 条
  1. TOOL · CL_206300 ·

    SEER框架通过选择性视觉-文本压缩增强LLM长上下文推理能力

    研究人员开发了SEER,一个旨在通过选择性压缩视觉-文本信息来改进大型语言模型长上下文推理能力的新框架。与之前应用统一压缩的方法不同,SEER根据查询学习识别和检索最相关的文本内容,从而在降低计算成本的同时保持精度。在LongBench基准测试上的实验证明了SEER的有效性,其准确性高于Glyph-9B和Qwen3-8B等基线模型。

  2. RESEARCH · CL_198071 ·

    新的AI架构MARCH和Consolidator提升长上下文记忆能力

    两篇新的研究论文介绍了一种增强AI模型长上下文记忆能力的新型架构。第一篇MARCH提出了一种系统,该系统会定期将循环状态检查点缓存为“状态锚点”,以在保持计算效率的同时维护不断增长的记忆库。第二篇Consolidator则专注于在将短期记忆累积到长期记忆之前对其进行转换,从而使模型能够更有效地跨越上下文边界保留和利用信息。这两种方法都旨在克服当前Transformer和循环模型在处理扩展序列和复杂回忆任务方面的局限性。

  3. TOOL · CL_188745 ·

    新的基准测试 LLM 长上下文推理,超越简单检索

    新的基准正在涌现,以测试大型语言模型(LLM)在处理扩展上下文方面的能力,超越了简单的“大海捞针”检索测试。虽然由 Greg Kamradt 推广的大海捞针测试在初步评估中很有用,但它存在一些局限性,例如容易被优化以及不能反映现实世界的语义复杂性。研究人员正在开发更稳健的方法,如 NVIDIA 的 RULER 和清华大学的 LongBench,它们旨在通过评估模型在整个文档上进行推理的能力,而不仅仅是定位特定事实,来衡量模型的“有效上下文长度”。

  4. TOOL · CL_174067 ·

    新的ReTopK方法加速了LLM的长上下文注意力

    研究人员开发了ReTopK,一种提高Transformer模型长上下文注意力效率的新颖方法。该技术通过重用过去的注意力决策来加速识别相关键值对的过程,从而降低计算成本。ReTopK在128K上下文长度下实现了超过3倍的注意力计算加速,同时仅带来极小的困惑度增加。该方法在PG19和LongBench等基准测试中表现强劲,优于其他近似注意力方法。

  5. TOOL · CL_167561 ·

    PIVOT索引方法加速LLM中的稀疏注意力

    研究人员开发了PIVOT,一种新颖的索引方法,旨在优化大型语言模型中的令牌级稀疏注意力。PIVOT通过减少冗余计算,解决了DeepSeek Sparse Attention等系统中索引器造成的瓶颈。它通过对附近的查询进行分组并执行一次共享扫描来识别候选令牌,从而显著加速了索引过程。

  6. COMMENTARY · CL_163194 ·

    OpenAI subreddit 用户寻求聊天评估基准

    一位 r/OpenAI subreddit 的用户正在寻求用于评估聊天模型性能的数据集和基准的建议。他们特别关注衡量多轮对话准确性和内存管理,并指出 LongBench、NIAH 和 RULER 等现有基准可能已过时。该用户旨在识别当前最先进的方法并找出自己工作中的薄弱环节,目前不包括基于代理的评估。

  7. RESEARCH · CL_154057 ·

    LLM KV缓存管理:安全威胁与效率创新

    研究人员正在探索管理大型语言模型(LLM)中关键值(KV)缓存的新方法,这对于推理速度至关重要,但会随着上下文长度线性增长。一种方法,“通过随机设计实现KV缓存驱逐的误差证书”,提出使用随机驱逐策略来提供误差界限并改进故障归因,在降低预算的情况下几乎免费地获得性能提升。相比之下,“HijackKV”识别出位置无关KV缓存重用方面的一个新安全漏洞,其中受污染的KV数据可以以很高的成功率悄悄地劫持模型行为。第三种方法,“SelKV”,提供…

  8. RESEARCH · CL_151862 ·

    新研究致力于 LLM KV 缓存优化以提高效率 · 已追踪 10 个来源

    近期研究论文引入了优化大型语言模型中 KV 缓存管理的新技术,解决了内存瓶颈并提高了推理效率。vToken、GCache、LinearKV、KVDiagnosis、SemPIC、SPECTRA、CommitKV、RippleKV、CoinRAG 和 GraceKV 等方法提出了各种策略,包括令牌级虚拟化、全局影响缓存、与位置无关的缓存、诊断基准测试、语义缓存、谱变换编码、生命周期感知压缩和全局资源分配。这些方法旨在减少内存使用量、加速…

  9. RESEARCH · CL_131290 ·

    新框架LongCrafter增强LLM长上下文理解能力

    研究人员推出了一种名为LongCrafter的新框架,旨在生成多样化的高质量数据,用于微调大型语言模型(LLMs),以提高其长上下文理解能力。该框架通过分层组织任务、将生成指令与证据图关联,并确保可控的难度和忠实度,解决了现有方法的局限性。使用LongCrafter数据微调的模型在LongBench和LongBench-v2等基准测试中表现出优越的性能,尤其在更具挑战性的任务上表现出色,并缓解了“中间丢失”问题。

  10. TOOL · CL_123006 ·

    新的RAGP方法使用图剪枝和莱维行走来压缩提示

    研究人员开发了一种新颖的提示压缩技术,称为RAGP,它将文本建模为多重图,以捕捉局部句法和全局语义关系。该方法利用莱维行走来有效地识别和修剪图结构中的冗余信息。在LongBench基准测试上的实验表明,RAGP在更高的压缩率下,平均得分高于LongLLMLingua等现有方法。

  11. TOOL · CL_115682 ·

    新的强化学习框架优化LLM KV缓存以实现高效推理

    研究人员开发了一个名为KV Policy (KVP) 的新颖框架,通过优化键值(KV)缓存来解决大型语言模型(LLM)的内存需求。KVP将KV缓存驱逐重构为一个强化学习问题,训练轻量级代理来预测未来解码的token有用性。该方法在长上下文和多轮对话基准测试中显著优于现有的启发式方法,并展示了在不改变底层LLM的情况下泛化到新任务和更长序列长度的能力。

  12. COMMENTARY · CL_113515 ·

    100万个上下文窗口是LLM的容量,而非能力

    虽然大型语言模型现在支持多达一百万个令牌的上下文窗口,但这种容量并不等同于完美的记忆或推理。研究人员指出,模型在长文本中间的信息处理方面常常遇到困难,表现出“针尖上的麦子”式的失败,并且在多跳推理方面存在困难,可能导致幻觉。为了解决这些局限性,至关重要的是,不要仅仅依赖令牌数量,而是要通过学术基准测试和特定领域测试,对模型在特定用例上的表现进行彻底评估。

  13. TOOL · CL_111684 ·

    新的SSM适配器在长上下文微调方面优于LoRA

    研究人员开发了一种名为Hankel降阶模型(HRM)适配器的新型参数高效微调(PEFT)方法,该方法利用状态空间模型(SSM)进行长上下文微调。与专注于注意力机制的传统PEFT方法不同,HRM适配器被设计用于注入MLP块,并利用SSM的时间不变性进行高效计算。在使用Mistral-7B进行LongBench等长上下文任务的评估中,HRM适配器表现优于LoRA变体,在准确性和ROUGE-1分数上均取得了显著提升。

  14. RESEARCH · CL_115713 ·

    新的注意力机制提升LLM效率并减少幻觉 · 跟踪10个来源

    研究人员正在开发新颖的注意力机制,以提高大型语言模型(LLM)和多模态大型语言模型(MLLM)的效率和能力。这些进展侧重于优化长上下文的稀疏注意力,降低计算成本,并减轻幻觉和视觉基础薄弱等问题。Flash Sparse Attention (FSA)、Information-Regularized Attention (IRA) 和 Multipole Semantic Attention (MuSe) 等技术旨在提高性能、降低延迟,…

  15. RESEARCH · CL_107863 ·

    Nexus Sampling 改进 LLM KV 缓存驱逐,减少内存使用

    研究人员开发了 Nexus Sampling,一种用于大型语言模型 KV 缓存驱逐的新颖方法,特别适用于长上下文和代理工作负载。这种无需训练的方法将 Nexus 评分与加权水库采样相结合,以保留可能因确定性 top-K 选择而丢失的重要 token。Nexus Sampling 在保留细微重要 token 方面理论上优于传统方法,并在 LongBench 等基准测试中实证达到了与密集注意力相当的性能,同时显著减少了缓存内存使用。

  16. RESEARCH · CL_106564 ·

    新的 KV 缓存压缩技术提升大语言模型推理性能 · 跟踪 9 个来源

    多篇研究论文探讨了优化大语言模型(LLM)服务中的键值(KV)缓存的新技术,以解决内存和性能瓶颈。这些方法包括量化、剪枝、合并和频率引导压缩,旨在减少内存使用并提高长上下文工作负载的推理速度。研究评估了这些技术在各种基准测试和模型上的表现,强调了压缩率、任务质量和系统性能之间的权衡,并建议根据工作负载选择压缩策略。

  17. RESEARCH · CL_93251 ·

    新的LLM KV缓存压缩方法应对安全性和效率挑战

    研究人员正在开发新的方法来压缩大型语言模型(LLM)中的键值(KV)缓存,以减少内存使用并提高推理效率。AnchorKV通过偏向于不保留有害提示的token来关注安全性,而PolyKV通过对不同的Transformer层应用不同的策略和预算来优化压缩。Tangram在服务框架中实现了实用的非均匀KV缓存压缩,而BACON通过结合观察窗口注意力和最后查询证据来增强多模态KV缓存压缩。此外,TurboQuant和OSCAR代表了KV缓存量…

  18. RESEARCH · CL_76817 ·

    新的EASE-TTT框架提升小型LLM的长上下文问答能力

    研究人员开发了EASE-TTT,一种用于改进小型语言模型长上下文问答能力的新型框架。该方法将检索到的证据片段与注意力机制对齐,以指导模型适应。在六个LongBench QA任务上的实验表明,EASE-TTT的性能优于现有的检索和测试时训练方法。

  19. TOOL · CL_68443 ·

    EndPrompt方法可高效扩展LLM上下文窗口

    研究人员开发了一种名为EndPrompt的新方法,可以在无需对长序列进行大量训练的情况下,高效地扩展大型语言模型的上下文窗口。该技术通过使用简短的初始片段和简短的终端提示进行训练,引入了必要的位置信息。EndPrompt在LongBench等基准测试中表现出显著的改进,其性能优于其他方法,同时消耗的计算资源大大减少。

  20. TOOL · CL_38307 ·

    KV 缓存驱逐保护比评分更重要

    研究人员开发了一种管理大型语言模型中 KV 缓存驱逐的新方法,发现结构性保护比评分算法更关键。他们对 Transformer 模型的研究表明,如果没有保护,现有的驱逐策略会显著退化。通过为结构性保护保留一小部分缓存,模型即使在缓存大小有限的情况下,也能恢复相当数量的原始质量。