研究人员开发了新的方法来防御和利用先进AI模型中的后门攻击。一种名为BYORn的方法旨在通过识别和替换微调过程中生成的语义上不合理的响应来提高大型视觉-语言模型的鲁棒性,从而保持干净的任务性能。与此同时,一种名为SILENTDRIFT的新攻击针对机器人领域使用的视觉-语言-动作模型,利用动作分块来创建视觉上与合法演示无法区分的隐蔽后门攻击。 AI
影响 强调了AI安全方面的持续研究,对模型鲁棒性和关键应用中潜在的对抗性操纵具有影响。
排序理由 两篇研究论文详细介绍了防御和利用AI模型后门攻击的新方法。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →