研究人员推出了一种新颖的框架QMFOL,旨在生成可量化且可控的单子一阶逻辑推理任务。该系统通过精确控制逻辑复杂度、语义多样性和一致性,解决了现有基准的局限性。该框架已被用于创建QMFOLBench,一个包含2880个实例的基准,并已用于评估六个大型推理模型和两个LLM。评估结果表明,随着逻辑复杂度的增加,模型性能下降且计算需求增加,并且模型在标记为“真”的任务上的准确率高于标记为“假”或“未知”的任务。 AI
影响 提供了一种更精确的方法来评估LLM的演绎推理能力,从而能更好地理解模型在逻辑复杂度增加时的局限性。
排序理由 该集群描述了一篇介绍新框架和基准以评估LLM推理能力的新学术论文。
- arXiv
- False
- Hugging Face
- large-language models
- LRMs
- QMFOL
- QMFOLBench
- True
- alphaXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →