PulseAugur
实时 06:47:46
English(EN) TrajShield: Trajectory-Level Safety Mediation for Defending Text-to-Video Models Against Jailbreak Attacks

TrajShield 保护文本到视频模型免受越狱和新兴风险的侵害

研究人员开发了 TrajShield,一个旨在保护文本到视频模型免于生成不安全内容的新型防御框架。该系统通过分析生成视频的时间轨迹来解决现有提示级防御的漏洞,识别随时间出现的风险,而不仅仅是提示的表面层面。TrajShield 通过模拟提示的隐含轨迹,查明潜在危险的来源,并应用有针对性的重写来消除风险,同时保留原始语义含义。 AI

影响 引入了一种缓解生成视频模型安全风险的新方法,可能改进负责任的 AI 部署。

排序理由 这是一篇详细介绍文本到视频模型新防御框架的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

TrajShield 保护文本到视频模型免受越狱和新兴风险的侵害

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Quanchen Zou, Nizhang Li, Wenxin Zhang, Jiaye Lin, Yangchen Zeng, Xiangzheng Zhang, Zonghao Ying ·

    TrajShield:用于防御文本到视频模型免受越狱攻击的轨迹级安全中介

    arXiv:2605.01761v1 Announce Type: new Abstract: Text-to-Video (T2V) models have demonstrated remarkable capability in generating temporally coherent videos from natural language prompts, yet they also risk producing unsafe content such as violence or explicit material. Existing p…