PulseAugur
实时 07:21:09
English(EN) ToxScreen: Detecting Whether an LLM Has Been Poisoned

新的基准测试 ToxScreen 可检测被投毒的大型语言模型

研究人员开发了 ToxScreen,这是一个旨在检测被投毒的大型语言模型(LLM)的新基准测试。该基准测试包含约 800 个带有后门的模型,涵盖了各种攻击目标、触发机制和模型规模。研究发现,基于梯度的提示优化在恢复触发器方面无效,但通过攻击成功率对候选者进行排名的令牌查找方法可以在后门有效时恢复触发器。研究还发现,后门通过不同于越狱的机制策略运作,这为防御者过滤越狱提供了一种方法。 AI

影响 为检测和缓解 LLM 中的数据投毒攻击提供了一个新的基准测试和方法,这对于高风险部署至关重要。

排序理由 该集群包含一篇学术论文,详细介绍了检测被投毒的大型语言模型的新基准测试和方法。 [lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的基准测试 ToxScreen 可检测被投毒的大型语言模型

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Anthony Hughes, Nicole Xing, Collin Francel, Andy Kim, Andrew Draganov ·

    ToxScreen:检测大型语言模型是否被投毒

    arXiv:2607.26849v1 Announce Type: cross Abstract: As large language models (LLMs) are deployed in high-stakes domains, adversaries may poison training data to implant backdoors: hidden triggers that covertly manipulate model behavior at inference time. We ask whether a defender c…