一个名为SafeIMG的新基准已被开发出来,用于评估AI生成的图像在高风险场景下的可靠性,例如那些影响公共安全和个人声誉的场景。研究人员发现,目前专门的检测器和视觉语言模型(VLMs)在识别这些合成图像方面无效,最好的VLM仅能检测到49.5%,而顶级的检测器仅能识别33.1%。人类评估者表现明显更好,准确率达到81.7%,并且能够识别出当前AI模型难以检测或解释的局部伪影、常识冲突和物理不一致性。 AI
影响 目前AI图像检测方法不足以应对高风险应用,需要对鲁棒且可解释的检测系统进行进一步研究。
排序理由 该集群包含一篇介绍AI生成图像评估新基准的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →