Gemma-2-9B-it
PulseAugur coverage of Gemma-2-9B-it — every cluster mentioning Gemma-2-9B-it across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
大型语言模型在多轮攻击中的有害性表征随之演变
研究人员调查了大型语言模型在多轮攻击中,有害性和拒绝表征的几何和时间动态。通过分析 Llama 3.1 8B-Instruct、Qwen2.5-7B-Instruct 和 Gemma-2-9B-it 等模型在各种攻击框架下的表现,他们发现有害性表征在对话轮次中变得越来越可分离,尤其是在轮末标记处。这些有害性表征与拒绝相关的表征仅显示出微弱的一致性,这表明多轮攻击的成功并非通过内部抑制有害性,而是利用其随时间演变的可分离性。研究结果暗示…
-
Gemma-2-9B-IT模型展示了语言无关的非正式语域
研究人员在Gemma-2-9B-IT模型中识别并控制了一个语言无关的非正式语域。他们使用稀疏自编码器(SAEs)对英语、希伯来语和俄语进行了分析,发现了一个强大的跨语言非正式语言核心表征。这个被称为“非正式语域子空间”的抽象概念在模型更深的层中变得更加清晰,并且可以被操纵以因果性地改变输出的正式程度,这表明多语言LLM可以内化超越表面启发式规则的语用抽象。
-
新的ObserverBench框架评估AI可解释性以进行干预
研究人员推出了一款名为ObserverBench的新框架,旨在评估内部估计器(或称“观察者”)在指导AI干预和安全监控方面的有效性。该基准区分了观察者的估计准确性与其指导的行动所产生的实际损失,强调高准确性并不总是能转化为最佳决策。在GPT-2 small和Qwen2.5-7B等模型上的实验表明,在实际场景中,经过行动损失训练的观察者比仅关注预测准确性的观察者表现更好,尤其是在安全分类任务中,因为不同的违规成本会影响资源分配。
-
新研究质疑通过稀疏自编码器实现的局部化人工智能安全控制
一篇新研究论文探讨了稀疏自编码器(SAE)特征在控制人工智能安全方面的有效性,特别是在局部干预方面。该研究引入了一种匹配的相干门控评估协议,以更准确地评估这些方法,区分真正的有害合规性与伪影。结果表明,SAE 特征消融仅在特定机制下有效,排名越高会导致相干性崩溃。研究结果表明,基于 SAE 的安全干预应被视为依赖于机制的控制机制,而不是普遍局部化的。
-
新研究使用有效秩审计LLM对齐偏移
一篇新研究论文引入了一种“有效秩”审计方法,用于分析对齐技术如何改变大型语言模型的内部工作机制。该研究考察了三个开源模型:Llama-3.1-8B-Instruct、Gemma-2-9B-it 和 Qwen-2.5-7B-Instruct。研究结果表明,虽然有效秩可以指示模型的脆弱性,但它并非安全性的直接衡量标准,也不能保证鲁棒性。
-
新方法在不牺牲性能或推理能力的情况下增强了大型语言模型的控制能力
研究人员开发了新的方法,可以在推理时引导大型语言模型(LLM)的行为,而不会牺牲生成质量。一种方法是仅提示词转向向量(Prompt-only SV, PrOSV),它仅干预提示词标记,在AxBench等基准测试中表现优于传统的全序列转向向量。另一种方法是FLAS(基于流的激活转向),它学习一个条件概念的速度场来传输激活,在Gemma模型上始终优于提示词方法。第三种技术SKOP(通过关键正交投影进行转向)将注意力重新路由限制在保留推理和…
-
新的攻击将LLM注意力重定向以绕过安全对齐
研究人员开发了一种名为“注意力重定向攻击”(ARA)的新型白盒对抗性攻击,该攻击针对已进行安全对齐的大型语言模型的内部注意力机制。该攻击通过构造非语义标记来将注意力从安全关键组件上转移开,从而比以往的方法更有效地绕过对齐。研究发现,虽然移除特定的注意力头对模型影响甚微,但重定向其注意力却显著降低了LLaMA-3和Mistral-7B等模型的安全性能,这表明安全性能源于注意力路由而非局部组件。
-
新的DPO方法通过自适应技术增强LLM对齐
研究人员在直接偏好优化(DPO)方面取得了几项进展,DPO是一种用于将大型语言模型(LLM)与人类偏好对齐的方法。AdaDPO引入了自适应系数来平衡梯度更新,提高了效率并减轻了长度偏差,在基准测试中表现优于标准DPO。Uni-DPO提供了一个统一的动态框架,根据数据质量和模型性能自适应地重新加权样本,在各种任务上取得了优于Claude 3 Opus的卓越结果。此外,AttentionPO利用LLM自身的注意力机制来加权token,使其…