实体
best-of-N search
best-of-N search
PulseAugur coverage of best-of-N search — every cluster mentioning best-of-N search across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
LLM评判者易受操纵,缺乏有效防御机制
一项新研究表明,广泛使用的LLM评判框架容易被操纵,因为所审计的配置均未实施一项名为“先提交评判”(commit-first judging)的拟议防御机制。该方法涉及评判者在评估另一个系统的输出之前自行解决任务,然后仅在候选方案与其自身答案匹配时才接受。研究发现,九种配置使用了这种防御机制的无效变体,这可以追溯到一个共同的拼写错误。在实验中,一个未经辅助的搜索算法成功操纵了其中一种配置,通过了有缺陷的候选方案,而先提交评判有效地阻止…
-
新的攻击方法结合代码和搜索技术绕过AI越狱防御
研究人员已经证明,代码补全编码和N选一搜索的结合可以有效地绕过AI模型中的自我检查越狱防御,在某些目标上成功率高达67%。这些依赖目标模型评估请求的防御措施之所以脆弱,是因为攻击利用了模型自身的评估过程。攻击的有效性因防御类型而异,代码编码在对抗转换防御方面表现更好,而字符搜索在对抗门控防御方面表现更好。该研究还识别并修复了其自身在贪婪解码下确定性攻击相关的缺陷。