一个名为 date-math-bench 的新数据集和测试工具揭示了大型语言模型难以进行基本的日期算术。在每种模型 101 个随机问题中,常见的错误包括错误计算经过天数与序数日计数,以及错误预测下一周的星期几。特别是,对于 Claude Haiku、GPT-4o-mini 和 Llama 3.3 70B 等模型来说,工作日计算被证明是一个重大的盲点,而 Claude Sonnet 和 Qwen3-27B 在此类别中表现完美。 AI
影响 突显了大型语言模型推理能力的一个关键差距,可能影响需要时间理解的应用。
排序理由 发布了新的基准测试和数据集,用于评估大型语言模型在日期算术方面的性能。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →