研究人员开发了TrustMI,一种可以因果性地控制大型语言模型(LLM)助手决定信任用户还是第三方的方法。通过分析2000次对比对话,他们学习到了可以应用于冻结模型以影响信任决策的转向矩阵。该方法在六种指令微调模型上进行了测试,结果表明信任度可以在两个方向上单调地操纵,从而影响与安全相关的代理行为,例如有害请求和提示注入。 AI
影响 这项研究提供了一种控制大型语言模型信任度的新颖方法,通过减轻有害请求和提示注入的风险,有可能增强AI安全性。
排序理由 该集群描述了一篇研究论文,其中详细介绍了一种控制大型语言模型信任度的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →