一项名为“Post-Cutoff Knowledge 150”的新基准测试旨在评估前沿 LLM 关于其训练数据截止日期之后发生的事件的参数化知识。该基准测试包含 150 个事实性问题,这些问题源自仅限于 2025-2026 年事件的网页索引,结果发现即使是表现最好的模型也面临严峻挑战,Gemini 3.7 Flash 的得分最高,达到 24%。研究表明,推理能力无法弥补截止日期后知识的缺失,模型大小或价格与性能没有持续相关性,这表明训练数据的时效性是一个关键因素。 AI
影响 凸显了 LLM 在近期事件参数化知识方面的显著差距,影响了那些依赖最新信息而无需 RAG 的应用程序。
排序理由 在 dev.to 上发布了评估 LLM 训练数据截止日期后知识的新基准测试。[lever_c_demoted from research: ic=1 ai=1.0]
- 2026
- Claude Sonnet 4.5
- DeepSeek-R1
- Gemini
- Gemini 2.5 Pro
- Gemini 3.7 Flash
- Gemma 4.31B
- GPT-5.4
- Kaggle
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →