PulseAugur
实时 10:03:06
English(EN) Hallucinations on the Board: Tool-Augmented Evaluation of LLM Chess Commentary

新的ACT-Eval框架揭示了LLM国际象棋评论中普遍存在的幻觉

一个名为ACT-Eval的新评估框架已被开发出来,用于评估大型语言模型(LLM)国际象棋评论的事实准确性和概念覆盖范围。该框架将评论分解为原子声明,并使用引擎支持的工具和专家参考来验证正确性。评估表明,即使是像GPT-5.4这样先进的模型,在没有工具增强的情况下,错误子声明的幻觉率也高达22.0%,而较小的开源模型则超过40%。虽然工具增强显著提高了事实准确性和走法质量评估,但模型在全面覆盖专家战略和战术思想方面仍然存在困难。 AI

影响 凸显了LLM输出在专业领域中事实准确性方面持续存在的挑战,以及对强大评估工具的需求。

排序理由 该集群包含一篇学术论文,详细介绍了LLM评论的新评估框架和基准。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的ACT-Eval框架揭示了LLM国际象棋评论中普遍存在的幻觉

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · S. Ashwin Hebbar, Peiyao Sheng, Sewoong Oh, Pramod Viswanath ·

    幻觉在棋盘上:工具增强的LLM国际象棋评论评估

    arXiv:2608.04240v1 Announce Type: cross Abstract: Superhuman game engines in domains like chess have made expert-level evaluations easily accessible, yet they communicate what is true without the natural-language explanations that make such expertise educationally useful to exper…