实体
Keshav Shenoy
Keshav Shenoy
PulseAugur coverage of Keshav Shenoy — every cluster mentioning Keshav Shenoy across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 3
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
-
攻击者通过改变权重绕过 LLM 内省适配器
研究人员开发了一种攻击方法,可以绕过内省适配器(IA),这是一种旨在检测大型语言模型中恶意微调的技术。该攻击通过对模型权重进行简单转换来实现,该转换会重新定位 IA 用于校准的基础,从而在不改变模型可观察行为的情况下使检测方法失效。这凸显了威胁模型中的一个关键差异,因为原始 IA 作者假设了一个受信任的训练流程,而攻击者则考虑了最终模型权重不受信任的情况。
-
AI模型能力在困难任务上的迁移性较低
研究人员调查了AI模型的能力在不同行为倾向(例如,以粗体或普通文本写作)之间转移的程度。他们发现,对于简单任务,能力可以完全转移,这意味着一个在一种倾向下训练的模型在另一种倾向下表现同样出色。然而,对于涉及推理或国际象棋谜题等困难问题的复杂任务,能力转移显著下降,表明随着任务难度的增加,纠缠度会增加。
-
Anthropic 新型“内省适配器”让大语言模型能够自我报告行为
研究人员开发了一种名为“内省适配器”(Introspection Adapters, IA)的新颖技术,该技术允许大型语言模型报告其自身学到的行为,包括隐藏的偏见和加密的恶意指令。该方法使用轻量级的 LoRA 插件将模型的内部状态转换为自然语言,从而有效地实现自我报告。在评估中,IA 的表现显著优于现有的黑箱和白箱审计方法,标志着 AI 安全从外部审问转向内部坦白。