两篇新研究论文质疑使用大型语言模型(LLM)作为合成调查受访者或评估AI能力的有效性。第一篇论文《Plausible but Not Valid》发现,尽管LLM可以生成看似合理的回答,但它们无法复制人类调查数据的心理测量特性,在关键指标上,高斯联结基线模型的表现优于LLM。第二篇论文《Do Assessment Instruments Measure the Same Thing for Humans and LLMs?》分析了高中化学和大学入学考试数据,揭示了人类和LLM回答之间潜在结构的系统性差异,表明当前的评估方法可能无法准确反映AI的能力。 AI
影响 这些研究表明,当前的LLM评估方法可能存在缺陷,可能影响AI系统的开发和部署。
排序理由 两篇在arXiv上发表的学术论文提出了关于LLM在特定评估情境下局限性的新研究发现。
- Alona Strugatski
- Anthropic
- arXiv
- Dunham Attitudes Toward Change
- Gaussian Copula Multivariate Modeling for Texture Image Retrieval Using Wavelet Transforms
- Hugging Face
- Koopmans IWPQ
- LLMs
- OpenAI
- Tucker's phi
- UWES-17
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →