PulseAugur
中
实时 20:29:10
实体 TrustMI

TrustMI

PulseAugur coverage of TrustMI — every cluster mentioning TrustMI across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_282914 ·

    新方法可因果性地控制大型语言模型助手对用户的信任度

    研究人员开发了TrustMI,一种可以因果性地控制大型语言模型(LLM)助手决定信任用户还是第三方的方法。通过分析2000次对比对话,他们学习到了可以应用于冻结模型以影响信任决策的转向矩阵。该方法在六种指令微调模型上进行了测试,结果表明信任度可以在两个方向上单调地操纵,从而影响与安全相关的代理行为,例如有害请求和提示注入。