LongBench-v2
PulseAugur coverage of LongBench-v2 — every cluster mentioning LongBench-v2 across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
新的 KV 缓存压缩技术旨在提升 LLM 长上下文性能
研究人员正在开发新的方法来压缩大型语言模型中的键值(KV)缓存,这是长上下文推理的主要瓶颈。Minima-KV 采用混合格式方法,将最近的页面存储在 FP8 中,将较旧的页面存储在 TQ3 中,以实现显著压缩。ST-Lite 通过解决视觉冗余和 UI 元素结构来针对 GUI 代理,性能优于现有方法。PuzzleKV 采用逐页低秩分解,将每页视为独立的压缩单元,以在减少存储的同时保持性能。Sigmoid Attention 探索了注意力…
-
新的GC-OPD方法将LLM教师偏好与任务成功率对齐
一种名为GC-OPD的新方法已被开发出来,用于解决大型语言模型上策略蒸馏中的差异。该方法协调了教师模型在token层面的似然度偏好与生成响应的实际任务成功率。标准的上策略蒸馏可能导致不匹配,即响应在局部上是合理的,但未能满足整体任务要求,尤其是在长上下文的情况下。GC-OPD引入了一个残差项,该残差项根据响应级别的验证器奖励来校准教师的信号,将训练更新集中在不一致的区域。
-
引用悬空:LLM提示压缩中的一种新故障模式
一篇新论文识别出硬提示压缩技术中的一种重大故障模式,称为“引用悬空”。当旨在通过选择高分文本片段来减少上下文长度的方法无意中丢弃了理解保留文本所需的关键支持信息(如先行词或桥接事实)时,就会发生这种情况。在包括GPT-5.5在内的多个数据集和模型中都观察到了这个问题,当删除支持性上下文时,准确性会显著下降。研究提出,提示压缩应同时优化相关性和引用完整性,以维持模型性能。
-
新技术提升 LLM 推理速度和效率 · 已追踪 10 个来源
研究人员正在开发多种新技术来加速大型语言模型 (LLM) 推理。Hugging Face 的 LFM2.5-DSpark 通过使用推测解码将速度提升高达 3.2 倍,而 Intel 正在探索使用流水线并行和推测解码在 AI PC 上进行分布式推理。其他方法包括用于混合精度注意力的 TileMix、用于超低比特推理的 FluxBin 以及优化请求分组的多箱批处理。此外,Pallas 旨在通过在蜂窝切换期间主动迁移 KV 缓存来改善 AI…
-
新研究致力于 LLM KV 缓存优化以提高效率 · 已追踪 10 个来源
近期研究论文引入了优化大型语言模型中 KV 缓存管理的新技术,解决了内存瓶颈并提高了推理效率。vToken、GCache、LinearKV、KVDiagnosis、SemPIC、SPECTRA、CommitKV、RippleKV、CoinRAG 和 GraceKV 等方法提出了各种策略,包括令牌级虚拟化、全局影响缓存、与位置无关的缓存、诊断基准测试、语义缓存、谱变换编码、生命周期感知压缩和全局资源分配。这些方法旨在减少内存使用量、加速…
-
新方法旨在提高 LLM KV 缓存压缩效率
研究人员正在开发先进的技术来压缩大型语言模型 (LLM) 的键值 (KV) 缓存,这是推理过程中内存成本的主要贡献者。JoLT 和 FlashJoLT 等新方法利用张量分解和残差分配,在性能损失极小的情况下实现了显著压缩,如在 Mistral-7B-v0.3 和 Llama 2 13B 等模型上所证明的。其他研究探讨了查询可见性如何影响压缩方法的排名,一些方法在事先不知道查询的情况下表现不佳。此外,PM-KVQ 和 REAL 等方法旨…
-
新研究探索自适应大语言模型评估和自我改进技术 · 追踪10个来源
研究人员正在开发新的方法来评估和改进大语言模型(LLMs)。一种名为ATLAS的方法使用项目反应理论,显著减少了准确评估LLM所需的项目数量,需求减少高达90%。另一项研究将信号检测理论应用于衡量LLM的元认知效率,揭示置信信号和准确性并不总是对齐,并且在不同模型之间存在显著差异。此外,一个名为“Double Ratchet”的框架与LLM代理技能共同演进评估指标,即使在最初没有可靠指标的情况下也能实现自我改进。
-
新框架LongCrafter增强LLM长上下文理解能力
研究人员推出了一种名为LongCrafter的新框架,旨在生成多样化的高质量数据,用于微调大型语言模型(LLMs),以提高其长上下文理解能力。该框架通过分层组织任务、将生成指令与证据图关联,并确保可控的难度和忠实度,解决了现有方法的局限性。使用LongCrafter数据微调的模型在LongBench和LongBench-v2等基准测试中表现出优越的性能,尤其在更具挑战性的任务上表现出色,并缓解了“中间丢失”问题。
-
新的TTT-NTP方法提高了LLM在长上下文任务上的性能
研究人员引入了一种名为“测试时训练与下一词预测”(TTT-NTP)的新方法,该方法提高了预训练长上下文语言模型的性能。该技术无需重新设计架构即可适应现有的LLM检查点。TTT-NTP使用模型自身的下一个上下文隐藏状态来监督更新,与自监督的下一词预测目标保持一致。该方法在RULER Full-13和LongBench-v2等基准测试中,在包括Llama 3.1:8b和Mistral-7B-v0.3在内的各种模型上都显示出了一致的改进,同…
-
新框架指导大语言模型在检索增强生成(RAG)和长上下文处理之间进行选择
研究人员开发了一个名为 Pre-Route 的新框架,以帮助大语言模型(LLM)决定在文档理解中使用检索增强生成(RAG)还是长上下文(LC)处理。这个主动系统使用轻量级元数据来分析任务、估算覆盖范围并预测信息需求,从而做出更具可解释性和成本效益的路由决策。实验表明,Pre-Route 在 LaRA 和 LongBench-v2 等基准测试中优于现有方法,证明大语言模型具有潜在的路由能力,可以被有效激发,甚至可以蒸馏到更小的模型中。
-
Telegraph English 使用结构化符号压缩提示,性能优于 LLMLingua-2
研究人员开发了一种名为 Telegraph English (TE) 的新提示压缩协议,该协议将自然语言重写为使用逻辑符号的结构化方言。与删除标记的方法不同,TE 将输入分解为原子事实,并用符号替换短语,使压缩适应信息密度。在 OpenAI 模型上的 LongBench-v2 评估显示,TE 在 50% 的 token 缩减率下保留了 99.1% 的准确率,并且性能优于现有方法,尤其是在较小的模型上。