近期研究表明,虽然大型语言模型(LLMs)可以以中等准确度预测项目难度级别,但它们在识别真正困难的项目时却力不从心。研究发现,LLMs 倾向于低估因误解而对学习者构成挑战的项目难度,这种现象被称为“简单陷阱”。这表明当前的 LLMs 可能在近似课程难度而非认知难度,从而在教育评估和自适应系统中带来偏见的风险。 AI
影响 由于无法准确评估学习者驱动的难度,大型语言模型可能会在教育评估中引入偏见。
排序理由 arXiv 上发表的两篇关于大型语言模型在教育评估中表现的学术论文。
- arXiv
- Classical test theory
- Hugging Face
- Indonesian undergraduates
- item response theory
- Large language models
- The Easy Trap
- alphaXiv
- CatalyzeX
- Gotit.pub
- GPT-4.1
- GPT-5.4
- Indonesian
- LLMs
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →