Greg Kamradt
PulseAugur coverage of Greg Kamradt — every cluster mentioning Greg Kamradt across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
OpenAI 的 GPT-6 Astra 使用符号世界模型,在 AI "智商测试" 中接近满分 · 跟踪 2 个来源
OpenAI 的最新模型 GPT-6 Astra 在 ARC-AGI-3 智能测试中取得了接近满分的成绩,该测试旨在评估 AI 在新环境中的推理和解决问题的能力。该模型通过开发一个“符号世界模型”,在图形模式识别任务中展现出比人类更高的效率。这个内部模型将环境规则抽象成一种符号语言,能够在执行动作前进行精确预测和规划,这是对先前暴力试错方法的重大改进。然而,专家警告说,高昂的计算成本以及对外部“约束”的依赖来补充模型的能力,引发了关于…
-
大型语言模型在长上下文的中间信息处理上遇到困难
最近发表在《计算语言学学报》(Transactions of the ACL) 上的一项由刘等人进行的研究,识别出一种被称为“迷失在中间”的现象。在该现象中,当关键信息被置于长上下文窗口的中间时,语言模型的准确性会下降。当相关文档既不在提示的开头也不在结尾时,性能会显著下降,有时甚至比闭卷回忆的表现还要差。这种现象已在各种模型架构和上下文长度中观察到,表明这是模型处理扩展信息方式的一个基本挑战。该论文提出,具有固定预算的注意力机制、不…
-
新的基准测试 LLM 长上下文推理,超越简单检索
新的基准正在涌现,以测试大型语言模型(LLM)在处理扩展上下文方面的能力,超越了简单的“大海捞针”检索测试。虽然由 Greg Kamradt 推广的大海捞针测试在初步评估中很有用,但它存在一些局限性,例如容易被优化以及不能反映现实世界的语义复杂性。研究人员正在开发更稳健的方法,如 NVIDIA 的 RULER 和清华大学的 LongBench,它们旨在通过评估模型在整个文档上进行推理的能力,而不仅仅是定位特定事实,来衡量模型的“有效上下文长度”。