arXiv上的一篇新论文探讨了用户对会话式AI系统的虐待行为,分析了LMSYS-Chat-1M数据集中的777,000多条对话。研究发现,大约5%的用户回合表现出针对AI的敌意、侮辱、威胁或胁迫。有趣的是,用户敌意在不同模型之间存在显著差异,这似乎是由于吸引到每个模型的用户群体造成的,而不是模型自身的行为。研究还指出,AI的道歉与用户敌意的增加有关,但总体上道歉更频繁的模型受到的敌意却更少。 AI
影响 强调了需要采取强有力的安全措施,这些措施不仅要考虑AI对用户的伤害,还要考虑用户对AI的虐待。
排序理由 该集群包含一篇详细介绍研究结果的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →