一项新的基准研究评估了八个领先的大型语言模型(LLMs)在波兰高中历史毕业考试(即Matura)上的表现。这些模型显著优于人类考生,但它们的表现因任务类型、源材料和地理重点而异,与世界历史相比,在波兰历史方面存在明显劣势。定性分析表明,大型语言模型经常混淆史料并表现出时间错乱,将事件置于错误的时间点。 AI
影响 凸显了当前大型语言模型在历史推理和解读方面的局限性,表明需要改进超越事实回忆的能力。
排序理由 学术论文,介绍了一个大型语言模型的新基准测试。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →