PulseAugur
实时 10:58:58

新基准数据集评估大语言模型在伊斯兰学术传统方面的能力

研究人员开发了IslamicTurathBench (ISTB),一个旨在评估大语言模型 (LLMs) 在理解古典伊斯兰学术方面的能力的新数据集。ISTB包含3,465个问答项,这些问答项来源于35部公认的学术著作,涵盖了12个多世纪和伊斯兰研究中的七个关键领域。该数据集旨在评估LLMs在不同学术需求级别和各种任务格式下的表现,包括选择题、段落理解和开放式知识问答,以期全面了解模型在这一专业领域的性能。 AI

影响 该基准有望提高LLMs在专业学术和宗教领域的准确性和文化敏感性。

排序理由 该集群描述了一个用于评估LLMs的新学术基准数据集。

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新基准数据集评估大语言模型在伊斯兰学术传统方面的能力

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Shahd Gaben, Heba Sbahi, Samer Rashwani, Abdessalam Bouchekif, Mutaz Al-Khatib, Emad Mohamed, Somaya Eltanbouly, Mohammed Ghaly ·

    IslamicTurathBench: A Multi-Task, Multi-Discipline Benchmark for Evaluating Large Language Models on the Islamic Scholarly Tradition (turath)

    arXiv:2608.04703v1 Announce Type: new Abstract: Large language models (LLMs) are increasingly used for question answering, education, and research, including in religious and cultural domains where answers depend on specialised source traditions. Yet in Islamic Studies, key conce…