研究人员开发了一个新的基准来评估大型语言模型(LLMs)根据法律事实发生的时间来确定正确法律版本的能力。他们的实验显示,即使不适用于案件时间线,大型语言模型也倾向于偏爱最新的法律。这种偏见似乎源于强化学习塑造的显式推理,这可能会限制推理路径的多样性,并导致模型过度依赖当前法规。与直觉相反的是,具有更强一般推理能力的模型在此类时间法律推理任务上的表现反而更差。 AI
影响 突出了大型语言模型在时间推理方面的一种特定故障模式,表明需要改进需要历史法律背景的应用。
排序理由 学术论文,详细介绍了新的基准和关于大型语言模型能力的研究发现。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →