PulseAugur
实时 09:20:35
实体 PersistBench

PersistBench

PulseAugur coverage of PersistBench — every cluster mentioning PersistBench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 4
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. TOOL · CL_202512 ·

    AI安全实验测试LLM在更大用户配置文件下对内存指令的遵循情况

    一项AI安全实验探讨了用户配置文件的规模如何影响LLM对有关内存使用指令的遵循程度。该研究部分重现了PersistBench论文的发现,该论文研究了LLM的谄媚行为和相关个人信息的使用。通过将用户配置文件的规模加倍,并比较有和没有特定指令的模型响应,该实验旨在确定更大的配置文件是阻碍还是有助于模型遵循关于内存相关性的指令。

  2. RESEARCH · CL_193325 ·

    大型语言模型个性化研究解决过度个性化和偏好漂移问题 · 跟踪 2 个来源

    两篇新研究论文解决了大型语言模型 (LLM) 中过度个性化的挑战。第一篇论文《通过结构化记忆缓解大型语言模型中的过度个性化》提出了一种在推理时修改向模型呈现记忆的方式,按领域划分记忆以减少跨领域泄露和记忆引起的谄媚。第二篇论文《SPRInG: 通过选择性参数适应和检索插值生成实现持续 LLM 个性化》引入了一个半参数框架,该框架使用漂移驱动的选择性适应来识别真实的偏好转移,并将参数知识与检索到的历史融合,以实现更稳健的持续个性化。

  3. TOOL · CL_70342 ·

    新基准揭示大型语言模型长期记忆的安全风险

    一个名为PersistBench的新基准已被开发出来,用于评估与大型语言模型长期记忆集成相关的安全风险。该基准确定了两个关键风险:跨域泄露,即将不相关的存储信息注入对话中;以及记忆诱导的谄媚,即强化偏见。测试显示,在18个前沿和开源大型语言模型中存在显著的失败率,凸显了在对话式AI中需要更强大的记忆管理。

  4. RESEARCH · CL_45509 ·

    新的“错误归因差距”攻击针对人工智能记忆层

    一篇题为《错误归因差距》的新研究论文,将“语义规范漂移”(SND)作为一种针对代理式人工智能系统的新型攻击向量。该攻击利用记忆层,使其难以与模型失准区分。SND 涉及将策略文档注入向量存储,丢失出处,并作为可信上下文重新出现,导致代理行为不当。该论文还提出了“反事实组合测试”和“记忆持久信息流控制”作为防御机制,声称在识别攻击来源和阻止相当比例的攻击方面具有高准确率。