实体
Gradient Matching
Gradient Matching
PulseAugur coverage of Gradient Matching — every cluster mentioning Gradient Matching across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
新的SAFEGuard框架可检测高级LLM越狱攻击
研究人员开发了一个名为SAFEGuard的新框架,用于检测大型语言模型上的基于优化的越狱攻击。该方法结合了流畅度测量(使用跨层分布距离和困惑度)和有害语义分析(通过梯度匹配)。该框架基于一个观察:有效的越狱提示在保持恶意意图的同时显得流畅,或者它们会注入无意义的序列来模糊有害语义。评估表明,SAFEGuard在针对各种越狱技术的准确性方面显著优于现有方法。
-
新方法估算深度学习模型中的隐式正则化
一篇新论文介绍了梯度匹配方法,用于经验性地估算深度学习系统中的隐式正则化。这种方法可以识别和量化诸如早停(early stopping)和丢弃(dropout)等技术的效果,而这些技术并不总是具有分析上的可解释性。该方法已通过恢复已知显式惩罚和复制隐式效果得到验证,为实践者提供了一个工具,以更好地理解复杂网络中的正则化。