一项新的研究论文质疑了多模态自动事实核查(MAFC)的动态评估方法的有效性。研究表明,即使是设计为使用LLM知识截止日期之后发布的声明的基准,仍然存在污染问题,因为这些声明可以通过预先存在的知识进行验证。这种污染会将性能指标最多提高11.34个百分点,并改变不同MAFC系统的感知排名。研究人员提出了更值得信赖的MAFC评估的实用指南。 AI
影响 强调了对AI事实核查能力可能的高估,并提出了可靠评估的改进建议。
排序理由 该集群包含一篇详细介绍AI系统评估新发现和新方法的 ist 研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →