实体
Backdoors
Backdoors
PulseAugur coverage of Backdoors — every cluster mentioning Backdoors across labs, papers, and developer communities, ranked by signal.
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
新框架增强AI模型生物训练,以提高可解释性
研究人员提出了一个用于训练和验证用于测试AI可解释性技术的“模型生物”的新框架。该研究认为,仅用单一目标训练这些生物是不够的,并引入了一种多目标方法,侧重于目标行为的安装、通用能力的保持和输出的自然性。这种利用模型合并的新方法被应用于一套旨在检测临床推理中人口统计学偏差的模型生物,结果表明与监督微调相比,直接偏好优化(DPO)训练能更好地保持能力和自然性。
-
对使用世界模型的具身AI的安全威胁和防御进行了调查
本文调查了利用世界模型的具身AI系统的安全状况。文章详细介绍了这些预测核心在实现高级规划的同时,也引入了新的漏洞。研究追溯了从数据构建到长期适应的世界模型整个生命周期中的威胁,并将诸如投毒、后门和提示注入等攻击归类于世界状态和学习到的动力学。文章还讨论了世界模型作为潜在安全护盾和预测性安全幻觉来源的双重作用,并提出了防御和评估协议。
-
研究人员轻松地用不到100美元的成本毒化了开放权重AI模型
一位研究人员已经证明,在开放权重AI模型中引入后门是可行且廉价的。该过程成本不到100美元,涉及微妙地改变模型的训练数据以创建隐藏的触发器。然后可以激活这些触发器,使模型产生意外行为,例如错误地分类特定输入或生成有害内容。