一项新的研究论文调查了大型语言模型(LLM)判断社交吸引力的能力,并将其评估与人类判断进行了比较。研究发现,虽然LLM在三个吸引力等级的个人资料排序方面表现出稳定性和一致性,但它们比人类更倾向于对有吸引力的个人资料给出更积极的评价,对没有吸引力的个人资料给出更消极的评价。研究还探讨了性别呈现的影响,发现在LLM或人类评估中,性别名称、代词或中性名称均未产生显著影响。 AI
影响 这项研究表明,LLM可以针对主观评估进行训练,但突显了其判断与人类相比的差异,表明了AI社交智能进一步发展的领域。
排序理由 该集群包含一篇详细介绍LLM能力研究结果的学术论文。
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →