研究人员开发了一种名为问题损害评分(Question Damage Score)的新指标,用于评估大型语言模型在语言推理中对所提供上下文的依赖程度。他们使用英国语言奥林匹克竞赛中的谜题,通过移除单个上下文示例(包括那些被确定为“承重”的示例)来创建修改版本。在对三个前沿大型语言模型进行测试时,即使在关键上下文被移除的情况下,模型也经常未能避免回答,这表明存在真正的上下文依赖性与记忆或推理之间的问题。 AI
影响 这项研究突显了大型语言模型在上下文依赖性方面存在的潜在弱点,表明模型可能过度依赖记忆而非真正的理解。
排序理由 学术论文,介绍了一种用于评估大型语言模型的新评估指标。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXivLabs
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- Load-Bearing Context
- Question Damage Score
- ScienceCast
- UK Linguistics Olympiad
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →