PulseAugur
实时 09:20:13
English(EN) AI-Based Thesis Assessment: An Empirical Study of Human Evaluation Priorities and Their Impact on Automated Assessment

研究发现AI论文评估难以匹配人类优先事项

一项研究调查了四个学术领域的84名论文导师,以了解他们对论文评估标准的优先排序。研究发现,导师得出的标准权重与AI评估系统RubiSCoT使用的默认权重之间存在显著差异。当将这些导师得出的权重整合到RubiSCoT中时,AI生成的评估在与人类评估的一致性方面仅有边际改善,这表明仅进行标准权重校准不足以弥合差距。 AI

影响 这项研究强调了在将AI评估工具与细致的人类评估标准相匹配方面所面临的挑战,表明除了简单的权重校准之外,还需要进一步的工作。

排序理由 该集群包含一篇关于基于AI的论文评估的实证研究的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

研究发现AI论文评估难以匹配人类优先事项

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Garv Vikram Gursahaney, Baskhad Idrisov, Thorsten Fr\"ohlich, Tim Schlippe ·

    AI-Based Thesis Assessment: An Empirical Study of Human Evaluation Priorities and Their Impact on Automated Assessment

    arXiv:2608.00717v1 Announce Type: cross Abstract: Rubric-based AI systems for thesis assessment use criterion weights to assign different levels of importance to evaluation criteria. These weights are typically defined through expert judgment, although little empirical evidence e…