实体
Yannick Assogba
Yannick Assogba
PulseAugur coverage of Yannick Assogba — every cluster mentioning Yannick Assogba across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
苹果研究人员发布模型来解读AI安全标注者的推理过程
Apple Machine Learning Research 推出了标注者策略模型(APMs),这是一种理解AI安全标注中分歧的新颖方法。这些可解释的模型直接从标注者的标注行为中学习其内部安全策略,无需标注者提供额外解释。APMs 可以准确地模拟标注者的安全策略,预测对反事实编辑的响应,并识别分歧的根源,例如操作失误、策略模糊或价值多元化。通过使标注者的推理过程可见且可比较,这种方法支持更具针对性和透明度的AI安全策略设计。
-
新研究探索多模态和稀疏自编码器方法以对抗大型语言模型越狱
研究人员正在开发新的方法来对抗对语音语言模型(SLM)的越狱攻击。一种方法 JAMA 使用联合多模态优化框架同时攻击音频和文本模态,证明比单模态攻击更有效。另一项研究提出使用稀疏自编码器(SAE)进行大型语言模型越狱缓解,证明在稀疏 SAE 特征空间中进行引导比在密集激活空间中进行防御具有优势。