研究人员在大语言模型(LLM)代理中发现了一种称为“权威崩溃”的现象,其中交互历史的巩固成可重用事实可能会无意中剥离关键的来源约束。这意味着存储的信息可能暗示比其来源允许的更大的权威,从而可能被滥用。开发了一个新的基准 AuthMem-Bench 来评估各种记忆系统和 LLM 主干的这一问题。研究结果表明,权威崩溃普遍存在,崩溃的记忆会导致未经授权的行动发生率显著。然而,自动预测和持久化的权威标签可以有效地减少这些未经授权的行动,而不会影响任务成功。 AI
影响 强调了 LLM 记忆巩固中的一个关键缺陷,可能导致未经授权的行动,需要新的方法来保留信息权威。
排序理由 该集群基于一篇详细介绍新基准和与 LLM 记忆系统相关的发现的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →