PulseAugur
实时 10:41:34
English(EN) Plausible Patients, Impossible Populations: Auditing Epidemiological Fidelity in Large Language Model Mental Health Simulations

大型语言模型能模拟出合理的患者,但无法代表真实人群

arXiv上发表的一项新研究表明,大型语言模型在被要求模拟心理健康患者时,能够生成个体上合理的病例,但无法代表真实的人群。研究人员测试了GPT-4o mini、Gemini 3 Flash、DeepSeek-V3和GLM-4.7等模型根据人口群体生成患者档案的能力。虽然个体患者模拟在很大程度上符合诊断标准,但聚合后的人群却显示出显著的偏差,包括症状评分虚高、人口统计学差异扭曲以及患者数据再生不稳定。研究人员将这种差异称为“连贯性-保真度分离”。 AI

影响 由于人群层面的不准确性,凸显了在心理健康模拟中使用大型语言模型的潜在风险。

排序理由 该集群包含一篇详细介绍大型语言模型能力研究结果的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

大型语言模型能模拟出合理的患者,但无法代表真实人群

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Patrick Keough ·

    合理的患者,不可能的人群:大型语言模型心理健康模拟中的流行病学保真度审计

    arXiv:2604.17359v2 Announce Type: replace-cross Abstract: Language models asked to simulate psychiatric patients produce cases that survive inspection one at a time and populations that match no real one. We gave GPT-4o-mini, Gemini-3-Flash, DeepSeek-V3 and GLM-4.7 each of 120 de…