实体
oolong
oolong
PulseAugur coverage of oolong — every cluster mentioning oolong across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
2 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
新方法揭示LLM上下文窗口基准存在缺陷
一篇新的研究论文介绍了一种“抗干扰截断”方法,以更好地评估长上下文窗口对大型语言模型(LLM)的真实影响。研究发现,在提示的中间移除内容的朴素截断会显著降低Claude和GPT-5.5等模型的性能。然而,当在截断提示的同时保留与任务相关的信息时,性能保持稳定甚至有所提高,这表明之前的基准可能将上下文长度效应与信号丢失混淆了。
-
新的 SWE-Pruner Pro 方法将编码代理上下文优化了 39%
研究人员开发了 SWE-Pruner Pro,一种用于有效管理编码代理长上下文的新颖方法。与使用单独分类器之前的其他方法不同,SWE-Pruner Pro 利用代理的内部表示来确定工具输出的哪些部分是相关的并且应该被保留。该技术可以将提示和完成的 token 减少多达 39%,同时保持任务质量并增加最小的推理开销。该方法在 SWE-Bench Verified 和 Oolong accuracy 等基准测试中显示出改进。