PulseAugur
实时 07:11:20
English(EN) SciHazard: A Benchmark for Measuring Scientific Safety Risks with Decomposed Harm Scoring

新基准SciHazard衡量大型语言模型科学安全风险

研究人员推出SciHazard,这是一个旨在评估大型语言模型(LLM)带来的科学安全风险的新基准。该基准通过将查询与现实世界危害联系起来,并采用一种称为DeHarm-Score的分解危害评分系统,来解决现有方法的局限性。DeHarm-Score评估查询危害的严重性、拒绝行为以及响应级别的风险,包括可执行性和净新风险。对31个前沿LLM和深度研究代理进行的初步基准测试显示,自主代理构成了重大的安全隐患,其DeHarm-Scores高于标准LLM。 AI

影响 强调自主代理是当前AI安全防御中的一个关键盲点,需要新的评估方法。

排序理由 该集群包含一篇研究论文,介绍了一个新的AI安全基准和评估框架。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新基准SciHazard衡量大型语言模型科学安全风险

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Chunxiao Li, Yuan Xiong, Lijun Li, Tianyi Du, Wenlong Zhang, Lei Bai, Jing Shao ·

    SciHazard:一个用于衡量科学安全风险并进行分解伤害评分的基准测试

    arXiv:2607.18665v1 Announce Type: new Abstract: Large language models (LLMs) increasingly support science, but they can also convert hazardous scientific knowledge into actionable misuse guidance. Existing benchmarks often rely on templated queries disconnected from real-world ha…