PulseAugur
实时 11:06:30
实体 ACT-Eval

ACT-Eval

PulseAugur coverage of ACT-Eval — every cluster mentioning ACT-Eval across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_185257 ·

    新的ACT-Eval框架揭示了LLM国际象棋评论中普遍存在的幻觉

    一个名为ACT-Eval的新评估框架已被开发出来,用于评估大型语言模型(LLM)国际象棋评论的事实准确性和概念覆盖范围。该框架将评论分解为原子声明,并使用引擎支持的工具和专家参考来验证正确性。评估表明,即使是像GPT-5.4这样先进的模型,在没有工具增强的情况下,错误子声明的幻觉率也高达22.0%,而较小的开源模型则超过40%。虽然工具增强显著提高了事实准确性和走法质量评估,但模型在全面覆盖专家战略和战术思想方面仍然存在困难。