Aditya Pratap Singh 及同事在 arXiv 上发表的一篇新研究论文揭示了当前 AI 模型知识编辑基准的重大局限性。他们的研究使用了一个名为 INLAY 的无梯度系统,发现现有基准无法准确衡量范围分类决策,该决策决定了存储的编辑是否适用于给定的查询。研究表明,这些基准在设计上不会惩罚使用参数化知识时的错误答案,因此未能奖励能够拒绝不当编辑的分类器。该论文认为,这些问题普遍存在于这些基准所评估的范围分类器家族中。 AI
影响 凸显了 AI 评估方法中的关键缺陷,可能影响知识编辑系统的开发和可靠性。
排序理由 在 arXiv 上发表的研究论文,详细介绍了 AI 基准的局限性。 [lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →