研究人员开发了IslamicTurathBench (ISTB),一个旨在评估大语言模型 (LLMs) 在理解古典伊斯兰学术方面的能力的新数据集。ISTB包含3,465个问答项,这些问答项来源于35部公认的学术著作,涵盖了12个多世纪和伊斯兰研究中的七个关键领域。该数据集旨在评估LLMs在不同学术需求级别和各种任务格式下的表现,包括选择题、段落理解和开放式知识问答,以期全面了解模型在这一专业领域的性能。 AI
影响 该基准有望提高LLMs在专业学术和宗教领域的准确性和文化敏感性。
排序理由 该集群描述了一个用于评估LLMs的新学术基准数据集。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →