LongBench-v2
PulseAugur coverage of LongBench-v2 — every cluster mentioning LongBench-v2 across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
混合线性注意力提高了长上下文LLM的性能
研究人员开发了混合线性注意力(HLA),这是一种新颖的注意力机制,旨在提高大型语言模型中的长上下文建模能力。与固定的分块混合方法相比,HLA根据查询动态路由信息,允许更自适应地访问历史数据。当应用于Qwen 3.5模型时,HLA在LongBench-v2和RULER等基准测试中表现出显著的性能提升,并且在从头开始训练场景中也提高了跨越扩展上下文长度的性能。
-
KV 缓存压缩研究确定时间聚合为关键因素
研究人员调查了时间聚合和排名保留对大型语言模型解码时 KV 缓存压缩的影响。他们发现指数移动平均 (EMA) 聚合可以使评分器修改在驱逐级别无法区分,从而实现稳定的保留集。这促成了 InertiaKV 和 InertiaKV-Lazy 的开发,这些方法与完全刷新方法相比,将解码吞吐量提高了 1.34-1.46 倍。该研究还探讨了无评分解码,它在显著降低计算成本的同时保持了平均质量。
-
新的TTT-NTP方法利用下一个词元预测提升LLM性能
研究人员推出了一种名为“测试时训练与下一个词元预测”(TTT-NTP)的新方法,该方法可增强预训练长上下文语言模型的性能。该技术利用语言模型训练中使用的固有下一个词元预测信号,来指导测试时训练过程中的适应过程。与使用代理的先前方法不同,TTT-NTP直接使用模型自身的上下文隐藏状态来监督更新,确保每个适应步骤都与核心训练目标保持一致。在RULER Full-13和LongBench-v2等基准测试上的评估显示,包括Llama-3.1-…
-
PolicyLong 通过策略内数据演进推进 LLM 上下文扩展
研究人员推出了一种名为 PolicyLong 的新方法,通过动态构建训练数据来扩展大型语言模型的上下文窗口。与使用固定模型生成数据的先前离线方法不同,PolicyLong 使用当前模型迭代地重新筛选数据,确保训练分布与模型不断发展的能力保持一致。这种策略内方法创建了一个新兴的自课程学习机制,其中正面和挑战性上下文都源自模型自身的熵景观。在 RULER、HELMET 和 LongBench-v2 等基准测试上的实验表明,PolicyLo…
-
新的 KV 缓存压缩技术旨在提升 LLM 长上下文性能
研究人员正在开发新的方法来压缩大型语言模型中的键值(KV)缓存,这是长上下文推理的主要瓶颈。Minima-KV 采用混合格式方法,将最近的页面存储在 FP8 中,将较旧的页面存储在 TQ3 中,以实现显著压缩。ST-Lite 通过解决视觉冗余和 UI 元素结构来针对 GUI 代理,性能优于现有方法。PuzzleKV 采用逐页低秩分解,将每页视为独立的压缩单元,以在减少存储的同时保持性能。Sigmoid Attention 探索了注意力…
-
新的GC-OPD方法将LLM教师偏好与任务成功率对齐
一种名为GC-OPD的新方法已被开发出来,用于解决大型语言模型上策略蒸馏中的差异。该方法协调了教师模型在token层面的似然度偏好与生成响应的实际任务成功率。标准的上策略蒸馏可能导致不匹配,即响应在局部上是合理的,但未能满足整体任务要求,尤其是在长上下文的情况下。GC-OPD引入了一个残差项,该残差项根据响应级别的验证器奖励来校准教师的信号,将训练更新集中在不一致的区域。
-
引用悬空:LLM提示压缩中的一种新故障模式
一篇新论文识别出硬提示压缩技术中的一种重大故障模式,称为“引用悬空”。当旨在通过选择高分文本片段来减少上下文长度的方法无意中丢弃了理解保留文本所需的关键支持信息(如先行词或桥接事实)时,就会发生这种情况。在包括GPT-5.5在内的多个数据集和模型中都观察到了这个问题,当删除支持性上下文时,准确性会显著下降。研究提出,提示压缩应同时优化相关性和引用完整性,以维持模型性能。
-
新研究探索大语言模型效率和推理能力的提升
多篇研究论文探讨了提高大语言模型(LLMs)效率和可靠性的方法。Hugging Face 的 LFM2.5-DSpark 通过使用推测性解码技术,展示了高达 3.2 倍的推理速度提升。OpWeave 和 LayerRoute 分别提出了用于跨异构硬件优化大语言模型服务和实现自适应层跳过的框架。其他研究则关注大语言模型的推理和校准,其中 ZebraArena 为工具增强型大语言模型提供了诊断环境,而 Efficiency Halluci…
-
新研究致力于 LLM KV 缓存优化以提高效率 · 已追踪 10 个来源
近期研究论文引入了优化大型语言模型中 KV 缓存管理的新技术,解决了内存瓶颈并提高了推理效率。vToken、GCache、LinearKV、KVDiagnosis、SemPIC、SPECTRA、CommitKV、RippleKV、CoinRAG 和 GraceKV 等方法提出了各种策略,包括令牌级虚拟化、全局影响缓存、与位置无关的缓存、诊断基准测试、语义缓存、谱变换编码、生命周期感知压缩和全局资源分配。这些方法旨在减少内存使用量、加速…
-
新方法旨在提高 LLM KV 缓存压缩效率
研究人员正在开发先进的技术来压缩大型语言模型 (LLM) 的键值 (KV) 缓存,这是推理过程中内存成本的主要贡献者。JoLT 和 FlashJoLT 等新方法利用张量分解和残差分配,在性能损失极小的情况下实现了显著压缩,如在 Mistral-7B-v0.3 和 Llama 2 13B 等模型上所证明的。其他研究探讨了查询可见性如何影响压缩方法的排名,一些方法在事先不知道查询的情况下表现不佳。此外,PM-KVQ 和 REAL 等方法旨…
-
新研究探索自适应大语言模型评估和自我改进技术 · 追踪10个来源
研究人员正在开发新的方法来评估和改进大语言模型(LLMs)。一种名为ATLAS的方法使用项目反应理论,显著减少了准确评估LLM所需的项目数量,需求减少高达90%。另一项研究将信号检测理论应用于衡量LLM的元认知效率,揭示置信信号和准确性并不总是对齐,并且在不同模型之间存在显著差异。此外,一个名为“Double Ratchet”的框架与LLM代理技能共同演进评估指标,即使在最初没有可靠指标的情况下也能实现自我改进。
-
新框架LongCrafter增强LLM长上下文理解能力
研究人员推出了一种名为LongCrafter的新框架,旨在生成多样化的高质量数据,用于微调大型语言模型(LLMs),以提高其长上下文理解能力。该框架通过分层组织任务、将生成指令与证据图关联,并确保可控的难度和忠实度,解决了现有方法的局限性。使用LongCrafter数据微调的模型在LongBench和LongBench-v2等基准测试中表现出优越的性能,尤其在更具挑战性的任务上表现出色,并缓解了“中间丢失”问题。
-
新的TTT-NTP方法提高了LLM在长上下文任务上的性能
研究人员引入了一种名为“测试时训练与下一词预测”(TTT-NTP)的新方法,该方法提高了预训练长上下文语言模型的性能。该技术无需重新设计架构即可适应现有的LLM检查点。TTT-NTP使用模型自身的下一个上下文隐藏状态来监督更新,与自监督的下一词预测目标保持一致。该方法在RULER Full-13和LongBench-v2等基准测试中,在包括Llama 3.1:8b和Mistral-7B-v0.3在内的各种模型上都显示出了一致的改进,同…
-
新框架指导大语言模型在检索增强生成(RAG)和长上下文处理之间进行选择
研究人员开发了一个名为 Pre-Route 的新框架,以帮助大语言模型(LLM)决定在文档理解中使用检索增强生成(RAG)还是长上下文(LC)处理。这个主动系统使用轻量级元数据来分析任务、估算覆盖范围并预测信息需求,从而做出更具可解释性和成本效益的路由决策。实验表明,Pre-Route 在 LaRA 和 LongBench-v2 等基准测试中优于现有方法,证明大语言模型具有潜在的路由能力,可以被有效激发,甚至可以蒸馏到更小的模型中。
-
Telegraph English 使用结构化符号压缩提示,性能优于 LLMLingua-2
研究人员开发了一种名为 Telegraph English (TE) 的新提示压缩协议,该协议将自然语言重写为使用逻辑符号的结构化方言。与删除标记的方法不同,TE 将输入分解为原子事实,并用符号替换短语,使压缩适应信息密度。在 OpenAI 模型上的 LongBench-v2 评估显示,TE 在 50% 的 token 缩减率下保留了 99.1% 的准确率,并且性能优于现有方法,尤其是在较小的模型上。