实体
Greg Kamradt
Greg Kamradt
PulseAugur coverage of Greg Kamradt — every cluster mentioning Greg Kamradt across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
大型语言模型在长上下文的中间信息处理上遇到困难
最近发表在《计算语言学学报》(Transactions of the ACL) 上的一项由刘等人进行的研究,识别出一种被称为“迷失在中间”的现象。在该现象中,当关键信息被置于长上下文窗口的中间时,语言模型的准确性会下降。当相关文档既不在提示的开头也不在结尾时,性能会显著下降,有时甚至比闭卷回忆的表现还要差。这种现象已在各种模型架构和上下文长度中观察到,表明这是模型处理扩展信息方式的一个基本挑战。该论文提出,具有固定预算的注意力机制、不…
-
新的基准测试 LLM 长上下文推理,超越简单检索
新的基准正在涌现,以测试大型语言模型(LLM)在处理扩展上下文方面的能力,超越了简单的“大海捞针”检索测试。虽然由 Greg Kamradt 推广的大海捞针测试在初步评估中很有用,但它存在一些局限性,例如容易被优化以及不能反映现实世界的语义复杂性。研究人员正在开发更稳健的方法,如 NVIDIA 的 RULER 和清华大学的 LongBench,它们旨在通过评估模型在整个文档上进行推理的能力,而不仅仅是定位特定事实,来衡量模型的“有效上下文长度”。