研究人员推出了 SafeAtlas-VL,这是一个旨在改进多模态安全审核的新型数据集和一套防护模型。该数据集包含 150 万个训练实例,为图像、请求和响应在 15 个危害类别中的判断提供了五级有序量表。这种方法超越了二元安全评估,允许对多模态交互中的风险进行细致的比较。还发布了一个配套的基准测试 SafeAtlas-Bench 和一系列训练好的防护模型,包括一个达到最先进性能的 8B 参数模型,以促进该领域的进一步研究。 AI
影响 增强了检测和比较多模态人工智能交互中风险的能力,可能带来更安全的人工智能部署。
排序理由 该集群描述了一篇介绍用于多模态安全的数据集和模型的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- SafeAtlas-Bench
- SafeAtlas Guard
- SafeAtlas-VL
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →