LiveFact基准旨在通过向模型呈现在事件发生时可能尚未完全可验证的说法来评估事实核查能力。该系统每月使用当前新闻进行重建,确保其测试项目的时间晚于模型的训练数据。LiveFact奖励模型准确识别说法因证据不足而含糊不清的情况,而不是仅仅回忆故事的最终结果。 AI
影响 该基准可以推动AI实时评估信息和处理模糊性的能力得到提升。
排序理由 该项目描述了一个用于评估AI事实核查能力的新基准。 [lever_c_demoted from research: ic=1 ai=1.0]
在 Mastodon — fosstodon.org 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →