发表在arXiv上的一项新研究显示,与人类判断相比,多模态大语言模型(MLLM)系统性地高估了面部吸引力。研究人员将2,513名人类参与者的评分与四个商业AI模型(Claude、Gemini、GPT和Grok)的评分进行了比较。虽然AI模型在吸引力的人类排名顺序上表现出很强的相关性,但它们对人脸的评分普遍比人类更积极,且范围更窄。只有面部年龄是人类和MLLM之间吸引力的一致预测因素,而种族和性别等其他因素在模型之间显示出不一致的模式。特别是Grok,其与人类评分的一致性最低。 AI
影响 表明当前MLLM在美容评估等主观任务上可能不可靠,突显了AI与人类感知之间的差异。
排序理由 发表在arXiv上的研究论文,详细介绍了AI模型能力的研究结果。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- Claude
- DagsHub
- Gemini
- generative pre-trained transformer
- Gotit.pub
- Grok
- Hugging Face
- Mohit Mendiratta
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →