一篇题为“Item-Mean Surrogates: 为什么更丰富的个人数据未能将大型语言模型作为人类替代品进行改进”的新研究论文已在arXiv上发表。研究发现,虽然大型语言模型(LLMs)可以准确预测人类对调查项目的平均反应,但它们无法捕捉个体特异性差异。即使拥有更丰富的个人数据和微调,LLMs只能解释一小部分受访者特异性方差,其表现远低于人类重测信度。该研究强调,当前的LLMs表现出“项目平均替代性”,意味着它们近似项目平均值,但无法近似真正替代人类所需的细微的个体偏差。 AI
影响 大型语言模型可以近似人类的平均反应,但尚不能捕捉个体特异性差异,这限制了它们作为人类替代品的用途。
排序理由 一篇在arXiv上发表的研究论文,详细介绍了关于大型语言模型能力的发现。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →