一项新研究表明,像GPT-5、Gemini 2.5 Pro和Claude Opus 4这样的大型语言模型常常误解在线帖子中的心理痛苦,特别是来自基于身份的社区的帖子。研究人员发现,开放权重模型甚至前沿模型倾向于高估痛苦,尤其是在无痛苦到轻度痛苦的情况下,产生了大量假阳性。这与人类判断形成对比,人类的群体外评估更为平衡,表明模型具有一种 AI
排序理由 [lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →