arXiv上发表的一项新研究表明,大型语言模型在被要求模拟心理健康患者时,能够生成个体上合理的病例,但无法代表真实的人群。研究人员测试了GPT-4o mini、Gemini 3 Flash、DeepSeek-V3和GLM-4.7等模型根据人口群体生成患者档案的能力。虽然个体患者模拟在很大程度上符合诊断标准,但聚合后的人群却显示出显著的偏差,包括症状评分虚高、人口统计学差异扭曲以及患者数据再生不稳定。研究人员将这种差异称为“连贯性-保真度分离”。 AI
影响 由于人群层面的不准确性,凸显了在心理健康模拟中使用大型语言模型的潜在风险。
排序理由 该集群包含一篇详细介绍大型语言模型能力研究结果的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- DeepSeek-V3
- DSM-5
- Gemini 3 Flash
- GLM-4.7
- GPT-4o mini
- Patrick Keough
- US National Health and Nutrition Examination Survey
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →