发布了两个新的基准来评估语言模型的安全能力。TSHA使用超过66,000个问答对,侧重于评估视觉语言模型在真实室内环境中识别安全隐患的能力。而CAREBench则专门针对语言模型,评估其识别明确滥用内容之外的上游儿童安全风险的能力,包含十二个类别的500个提示。这两个基准都突显了当前前沿模型在安全意识方面存在的显著不足。 AI
影响 这些基准将推动AI安全评估的改进,促使模型更好地识别和减轻现实场景中的风险。
排序理由 在arXiv上发布了两篇学术论文,介绍了用于评估AI安全的新基准。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →