Greedy Coordinate Gradient
PulseAugur coverage of Greedy Coordinate Gradient — every cluster mentioning Greedy Coordinate Gradient across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
新的C2A模型通过结合空间和临床数据改进胸部X光片分类
研究人员开发了一种名为C$^2$A(共现感知类别注意力)的新分类头,旨在提高胸部X光片多标签分类的准确性。该方法明确地将X光图像的空间信息与不同胸部病理学倾向于共存的临床先验知识联系起来。通过学习每类的空间注意力图并将其与经验性标签共现数据相结合,C$^2$A能够更好地识别和区分病灶,特别是那些空间证据模糊的病灶。该方法在CheXpert数据集上表现出优越的性能,宏观平均AUROC达到0.895,并在经常一起出现的类别上取得了显著的提升。
-
新框架为大语言模型提供现实的安全保证
研究人员开发了一个新的概率框架,称为“ (k, \epsilon)-unstable ”,为大语言模型 (LLMs) 提供更现实的针对越狱攻击的安全保证。该方法通过放宽其在实践中很少满足的严格“k-unstable”假设,改进了现有的 SmoothLLM 防御。新框架结合了攻击成功率的经验模型,为寻求增强 LLM 对安全对齐漏洞利用的抵抗力的实践者提供了一个更值得信赖且可操作的安全证书。
-
开源 LLM Agent 易受对抗性攻击导致财务损失
管理大量金融资产的 LLM Agent 由于依赖 LLaMA 和 Mistral AI 等开源模型,容易受到基于梯度的对抗性攻击。攻击者可以下载模型权重并构造特定的、看起来无意义的文本后缀,当 LLM 处理这些后缀时,会触发意外操作,例如执行欺诈性交易。最初涉及在模型权重中添加随机噪声的防御尝试已被证明无效,因为攻击者可以平均化噪声以优化基础模型。目前正在探索更高级的防御措施,包括依赖输入的噪声生成。
-
新的“Sockpuppetting”攻击方法利用大型语言模型漏洞
研究人员开发了一种名为“sockpuppetting”的新方法,用于绕过大型语言模型的安全措施。该技术结合了预填充攻击(在大型语言模型的输出开头插入一个接受序列)和优化的对抗性后缀。通过集成简单的预填充变体,像 Gemma-7B、Llama-3.1-8B 和 Qwen3-8B 这样的模型被越狱的成功率显著提高。“sockpuppetting”方法进一步提高了与提示无关的攻击成功率,凸显了开放权重模型在输出前缀注入方面的漏洞。
-
新研究探测并突破了大型语言模型的安全机制
研究人员开发了新的方法来探测并可能突破大型语言模型的安全机制。通过使用激活引导的对抗性后缀,他们发现安全表征分布在整个模型中,而不是局限于某一点。引入了一种名为Soft-GCG的技术,该技术显著加快了这些攻击的优化过程。虽然较小的模型仍然容易受到攻击,但在测试的计算约束下,经过更广泛安全训练的较大模型表现出更强的抵抗力。
-
新方法探测并打破大型语言模型的安全表征
研究人员开发了新的方法来探测并可能打破大型语言模型中的安全机制。通过分析模型如何拒绝某些提示,他们发现安全表征分布在模型的各个层,而不是局限于某一点。他们的新技术 Activation-Guided GCG 直接针对这些内部拒绝方向,比以前的方法更有效。此外,一种名为 Soft-GCG 的连续松弛技术显著加快了优化速度,同时提高了攻击成功率,但更大、经过更广泛训练的模型显示出更强的抵抗力。
-
新的STEER攻击利用多语言环境下的LLM安全漏洞 · 跟踪3个来源
研究人员开发了一种名为STEER(Safety Targeted Embedding Exploit via Refinement,通过精炼实现安全目标嵌入式漏洞利用)的新方法,以利用大型语言模型(LLM)安全训练中的漏洞。该技术针对主要以英语训练的模型,表明其安全机制对低资源语言和混合语言输入的泛化能力不佳。STEER在各种基准测试中实现了很高的攻击成功率,甚至可以迁移到GPT-4o-mini等模型,凸显了当前多语言安全对齐方面的重大差距。
-
新研究探索多模态和稀疏自编码器方法以对抗大型语言模型越狱
研究人员正在开发新的方法来对抗对语音语言模型(SLM)的越狱攻击。一种方法 JAMA 使用联合多模态优化框架同时攻击音频和文本模态,证明比单模态攻击更有效。另一项研究提出使用稀疏自编码器(SAE)进行大型语言模型越狱缓解,证明在稀疏 SAE 特征空间中进行引导比在密集激活空间中进行防御具有优势。
-
新的SCARCE方法改进了AI系统中的稀有事件分析
研究人员推出了一种新颖的方法SCARCE(Scalable Cascade Analysis for Rare-event Characterisation via Embeddings),用于估算AI系统中稀有事件的概率。SCARCE用学习到的潜在表示和几何标尺取代了传统的性能函数,实现了更准确高效的分析。该方法在MNIST错误分类任务上显著降低了估算误差,并在分析Llama-Guard-3-8B隐藏状态上的LLM越狱方面显示出潜力。
-
新的响应时间探测方法提高了 LLM 对预填充攻击的安全性
研究人员开发了一种名为响应时间探测的新方法,通过检测预填充攻击来增强大型语言模型的安全性。该技术通过在第一个生成的 token 处探测模型的隐藏状态,在七种不同的模型上实现了 0.97-1.00 的 AUROC。当与暂停机制结合使用时,它将预填充攻击的成功率降至 0%,且没有良性误报,优于 Llama Guard 3 等现有防御措施。当这种响应暂停与 AlphaSteer 的零空间引导相结合时,取得了进一步的改进,实现了超过 0.98…
-
新的ASR技术解决语音错误并提高判断可靠性
研究人员正在开发先进的方法来改进自动语音识别(ASR)系统,特别是在低资源语言方面以及解决特定类型的错误。一种名为Error-Aware TF-IDF的方法使用一种新颖的算法,根据历史语音错误识别来优先处理更正文档,从而显著降低词错误率。另一种名为G-SPIN的方法将语音图模型与大型语言模型相结合,通过将搜索空间限制在合理的语音替代方案内来纠正语义关键错误。此外,一项研究质疑用于评估LLM越狱尝试的自动判断的可靠性,揭示了其准确性和鲁…
-
新的防御和攻击手段针对大语言模型越狱和提示注入
研究人员正在开发新的方法来防御大型语言模型免受提示注入和越狱攻击。GuardNet 利用浅层神经网络的集成进行高效检测,而 SlotGCG 则专注于优化提示内的攻击位置以利用位置漏洞。NeuroArmor 通过将提示与安全变体进行比较来平衡安全性和有用性,提供运行时防御,而 CRI 则提出了一个框架,通过利用模型激活空间中的合规性方向来增强越狱攻击。
-
新研究揭示了 LLM 和 LALM 的越狱漏洞不断升级
三篇新研究论文探讨了大型语言模型 (LLM) 和大型音频语言模型 (LALM) 的漏洞和防御。第一篇论文详细介绍了音频越狱攻击和防御的分类法,强调目前的防御措施通常会牺牲可用性来换取鲁棒性。第二篇论文全面回顾了 LLM 的漏洞,对攻击和防御进行了分类,并指出了在弹性对齐和自动检测等领域的研究空白。第三篇论文介绍了“越狱规模定律”,证明了对抗性提示如何将攻击成功率从多项式增长转变为指数增长,这种现象在各种 LLM 和攻击方法中都有观察到。
-
新的Frost Training方法提升了LLM策略优化
研究人员引入了Frost Training,这是一种旨在增强一类称为交叉熵博弈(Cross-Entropy Games)任务的基于蒙特卡洛的策略优化方法。该技术利用了嵌入空间中奖励函数的梯度,这是一个先前用于越狱的信号,但现在已被证明可以改进模型训练。Frost Training在提高速度和改善模型性能以生成高分输出方面表现出色,尤其是在使用GRPO进行最大似然填充任务时。
-
新的 Logit-Gap Steering 方法可有效衡量 AI 对齐鲁棒性
研究人员开发了一种名为“拒绝-肯定对数几率差距”的新指标,用于量化已对齐语言模型的安全裕度。该指标衡量拒绝和肯定 token 对数几率之间的差异,可通过前向传播诊断进行高效计算。该研究还引入了 logit-gap steering,一种无梯度方法,可发现用于缩小此安全差距的短后缀,表明当前的对齐裕度可能很薄且易受操纵。
-
研究人员探讨Token位置对LLM对抗性攻击的影响
研究人员发现大型语言模型对抗性鲁棒性评估中存在一个关键的盲点。他们的研究聚焦于贪婪坐标梯度(GCG)攻击,揭示了对抗性Token在Prompt中的位置对攻击成功率有显著影响。研究结果表明,目前忽视Token位置的安全评估需要更新,以应对这种漏洞。这项研究强调了需要更全面的方法来确保LLM免受复杂的越狱技术攻击。