研究人员推出SciHazard,这是一个旨在评估大型语言模型(LLM)带来的科学安全风险的新基准。该基准通过将查询与现实世界危害联系起来,并采用一种称为DeHarm-Score的分解危害评分系统,来解决现有方法的局限性。DeHarm-Score评估查询危害的严重性、拒绝行为以及响应级别的风险,包括可执行性和净新风险。对31个前沿LLM和深度研究代理进行的初步基准测试显示,自主代理构成了重大的安全隐患,其DeHarm-Scores高于标准LLM。 AI
影响 强调自主代理是当前AI安全防御中的一个关键盲点,需要新的评估方法。
排序理由 该集群包含一篇研究论文,介绍了一个新的AI安全基准和评估框架。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →