一个名为ACT-Eval的新评估框架已被开发出来,用于评估大型语言模型(LLM)国际象棋评论的事实准确性和概念覆盖范围。该框架将评论分解为原子声明,并使用引擎支持的工具和专家参考来验证正确性。评估表明,即使是像GPT-5.4这样先进的模型,在没有工具增强的情况下,错误子声明的幻觉率也高达22.0%,而较小的开源模型则超过40%。虽然工具增强显著提高了事实准确性和走法质量评估,但模型在全面覆盖专家战略和战术思想方面仍然存在困难。 AI
影响 凸显了LLM输出在专业领域中事实准确性方面持续存在的挑战,以及对强大评估工具的需求。
排序理由 该集群包含一篇学术论文,详细介绍了LLM评论的新评估框架和基准。[lever_c_demoted from research: ic=1 ai=1.0]
- ACT-Eval
- alphaXiv
- arXiv
- CatalyzeX
- Connected Papers
- CORE Recommender
- DagsHub
- Gotit.pub
- GPT-5.4
- Hugging Face
- Litmaps
- ScienceCast
- scite Smart Citations
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →