Veto
PulseAugur coverage of Veto — every cluster mentioning Veto across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新的VETO防御可保护图像免受高级AI编辑
研究人员开发了VETO,一种新的方法来保护图像免受FLUX.2等高级AI模型的编辑。与针对旧版编辑流程的先前防御措施不同,VETO专门破坏了现代模型用于提取和重新语境化图像信息的联合注意力机制。为了评估其有效性,还引入了一个名为VetoBench的新基准,该基准测试了防御措施对局部编辑和更广泛的上下文变化的能力。VETO在多个当代编辑模型和基准测试中展示了卓越的性能和更好的保护-保真度权衡。
-
新方法增强在线策略蒸馏以进行AI模型训练 · 已追踪6个来源
研究人员正在开发新的在线策略蒸馏方法,这是一种通过让较小的AI模型学习较大、能力更强的模型的输出来训练这些较小模型的技术。Apple Machine Learning Research 引入了一个诊断框架,用于分析在线策略蒸馏在何处以及为何有效,发现该信号在学生模型不正确的输出时更有益。同时,Veto 和 RG-OPD 等新方法通过重新构建蒸馏目标或使用验证器反馈来过滤不可靠的教师信号,旨在稳定训练。此外,ReOPD 提供了一种离环境…
-
新的LLM基准揭示“失控的对齐”压倒证据
一篇题为“错误的正确:量化和定位LLM中失控的对齐”的新研究论文引入了“失控的对齐”概念,即语言模型由于过度热心的安全训练而拒绝合理的结论。该论文定义了一个名为失控对齐率(MAR)的指标和一个名为VETO的基准,该基准包含2,032个源自BBQ数据集的对比对。对25个LLM的基准测试显示,MAR显著,范围从4.7%到18.9%,而人类参与者的MAR为0.0%。研究表明,对齐诱导的线索会加剧这些失败,这表明当前的对齐方法可能过度泛化安全…