研究人员开发了 TrajShield,一个旨在保护文本到视频模型免于生成不安全内容的新型防御框架。该系统通过分析生成视频的时间轨迹来解决现有提示级防御的漏洞,识别随时间出现的风险,而不仅仅是提示的表面层面。TrajShield 通过模拟提示的隐含轨迹,查明潜在危险的来源,并应用有针对性的重写来消除风险,同时保留原始语义含义。 AI
影响 引入了一种缓解生成视频模型安全风险的新方法,可能改进负责任的 AI 部署。
排序理由 这是一篇详细介绍文本到视频模型新防御框架的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →