实体
Ernest Davis
Ernest Davis
PulseAugur coverage of Ernest Davis — every cluster mentioning Ernest Davis across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
人工智能推理能力引发争议,声称存在“捷径”和“思维幻觉”
人工智能推理能力的最新进展引发了关于这些系统的性质和可靠性的辩论。虽然大型推理模型(LRMs)在解决复杂数学问题等方面展现出了令人印象深刻的问题解决能力,但研究表明,这些成功可能源于“捷径”或“系统博弈”,而非真正的理解。Melanie Mitchell等专家指出,虽然LRMs提高了准确性,但生成的“思维链”可能无法准确反映内部过程,有时甚至可能无益。
-
分析揭示有影响力的METR AI时间跨度图存在严重错误
Transformer上发布的Nathan Witkin的最新分析发现,被广泛引用的METR AI时间跨度图存在许多严重错误。这些缺陷包括猜测的人类基线数据、通过按小时支付工资来激励更长的任务完成时间、有偏见的人类基准测试者样本,以及潜在的测试-训练数据污染。分析得出结论,该图表存在太多问题,无法得出有意义的结论,应被舍弃,以支持更可靠的信息。
-
Chess-GPT 模型学习世界模型,可通过操纵改变其技能水平
研究人员探索了对一个为国际象棋而训练的语言模型(称为 Chess-GPT)进行干预的方法。通过操纵模型对棋盘状态和玩家技能的内部表征,他们证明了这些表征与模型的输出之间存在因果关系。这项工作回应了关于大型语言模型是否拥有真正世界模型还是仅仅学习表面模式的怀疑,表明有针对性的编辑可以影响模型的棋力水平和走子生成。