PulseAugur
中
实时 10:42:33
实体 SafeAgentBench

SafeAgentBench

PulseAugur coverage of SafeAgentBench — every cluster mentioning SafeAgentBench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_227070 ·

    研究论文强调语音控制的具身AI的安全风险

    一篇新发表在arXiv上的研究论文探讨了语音控制的具身AI系统的安全影响。研究表明,自动语音识别(ASR)中的错误可能导致这些AI模型接受并执行不安全的指令。通过模拟ASR错误并将其与SafeAgentBench和POEX等现有安全基准相结合,该研究强调了此类错误如何引入有害的歧义或削弱拒绝行为,从而导致生成和执行不安全的计划。虽然ASR错误的自动纠正有时可以减轻这些风险,但并非总是有效,这表明具身AI存在重大的安全隐患。

  2. RESEARCH · CL_147731 ·

    新的PRISM方法可检测LLM行动中超越文本安全的物理危险

    研究人员开发了一种名为PRISM的新方法,用于检测大型语言模型(LLM)在控制具身智能体时可能带来的物理危险。与传统的基于文本的安全检查不同,PRISM分析LLM的内部状态,以识别将指令与物理世界相结合时产生的风险。这种方法表明,在LLM的表示中,物理危险信号可以与内容危险信号分离。PRISM在旨在测试物理安全性的基准测试中取得了高准确率,在识别潜在有害行为方面显著优于标准的LLM裁判。