一篇新发表在arXiv上的研究调查了用于强化学习安全信号的冻结视觉-语言模型(VLMs)的可靠性。研究人员发现,这些依赖图像-文本相似性来检测危险的模型可能并未准确感知危险。相反,评分似乎受到提示结构、嵌入几何和摄像机视角等因素的影响,而不是真正的危险识别。研究表明,VLMs可能是在跟踪场景与字幕的相似度,而不是实际的安全风险,这引发了对其在现实世界应用中有效性的担忧。 AI
影响 对当前基于VLM的安全信号的可靠性提出了质疑,可能影响更安全的人工智能系统的开发。
排序理由 学术论文,详细介绍了一种新的AI安全模型评估方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →