开发了一个名为时间谜题(Time Puzzles)的新基准,用于评估大型语言模型(LLM)的迭代时间推理能力,特别是在使用网络搜索等工具时。该基准由包括郑祥(Zhengxiang Wang)在内的研究人员提出,发现即使是像GPT-5这样先进的模型在此类推理方面也存在困难,在不使用工具的情况下准确率仅为55.3%。虽然网络搜索可以提高性能,但当明确给出带有日期的时间限制时,模型的表现会显著更好,这凸显了在复杂时间任务中可靠使用工具的差距。 AI
影响 突显了大型语言模型在时间推理工具使用方面的差距,可能指导未来的模型开发和评估。
排序理由 该集群包含一篇介绍用于评估大型语言模型能力的新颖基准的学术论文。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →