一篇新发表在arXiv上的研究论文,调查了前沿语言模型中“分子似曾相识”的现象,即模型似乎是逐字检索已发布的分子属性值,而非进行预测。研究发现,这种逐字检索现象普遍存在,但在不同的回归基准测试中差异显著。有趣的是,当模型被赋予更高的推理提示时,检索率会显著增加。该研究还探讨了中断这种检索的方法,并提出模型的通用预测能力并非完全由记忆的值决定。 AI
影响 这项研究突显了大型语言模型评估中存在的潜在局限性,表明当前的基准测试可能由于记忆而无法完全捕捉真实的预测能力。
排序理由 该集群包含一篇详细介绍语言模型研究发现的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →