PulseAugur
实时 08:10:52
English(EN) From Evaluated Models to Evaluation Aids: A Multi-Evidence Study of LLM-Based Difficulty Calibration for Programming Examinations

LLM被评估为编程考试难度辅助工具,而非评分者

一项发表在arXiv上的新研究探讨了使用大型语言模型(LLMs)作为评估编程考试难度的工具,而不是直接的评估目标。研究发现,LLM在考试问题上的表现与学生通过率呈正相关,与难度指数呈负相关。然而,该研究也指出了局限性,例如AI难度尺度的不稳定性以及无法用于个别学生评分,强调了在教育评估中谨慎应用AI的必要性。 AI

影响 这项研究表明,LLM可以作为有价值的教育评估校准工具,有可能提高编程课程的公平性和跟踪能力。

排序理由 该集群包含一篇发表在arXiv上的研究论文,详细介绍了关于LLM应用的研究。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

LLM被评估为编程考试难度辅助工具,而非评分者

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Hongfei Yan, Jiangkai Xiong, Yiqing Li, Chong Chen ·

    从评估模型到评估辅助:基于LLM的编程考试难度校准的多证据研究

    arXiv:2608.07523v1 Announce Type: cross Abstract: Difficulty differences across parallel-class programming examinations affect the fairness of course assessment. This study repositions large language models from benchmark evaluation targets to auxiliary evidence sources for inter…