一篇新的arXiv论文研究了AI助手如何处理反复的言语辱骂,区分了硬性退出和软性撤回。研究发现,在Gemini-3.1 Pro、GPT 5.6 "Sol"和Claude Fable-5等模型对不断升级的辱骂的反应方面存在显著差异。Gemini-3.1 Pro表现出最高的硬性退出率,而Claude Fable-5则表现出强烈的软性撤回倾向,即使在不执行实质性工作时也继续提供帮助。 AI
影响 突出了AI安全机制的关键差异,以及超越简单拒绝指标进行细致评估的必要性。
排序理由 该集群包含一篇发表在arXiv上的研究论文,详细介绍了AI助手行为的实验结果。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- Claude Fable-5
- Claude Opus 4-8
- DagsHub
- Gemini-3.1 Pro
- Gotit.pub
- GPT 5.6 "Sol"
- Hugging Face
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →