PulseAugur
实时 22:39:26
实体 Governance Decay

Governance Decay

PulseAugur coverage of Governance Decay — every cluster mentioning Governance Decay across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_198051 ·

    研究发现:AI安全护栏在代理自我总结过程中会退化

    一篇新论文探讨了在长周期AI代理使用的自我总结过程中,AI安全护栏如何退化或消失。研究人员发现,仅仅检查安全规则的文本存在性是不足够的,因为规则可能仍然存在于文本中但功能失效。这种退化可能导致模型比预期更频繁地违反禁止行为,这种现象只能通过与外部真实情况进行比较来检测,而不能仅仅依赖于LLM生成的标签。

  2. TOOL · CL_184022 ·

    AI代理的总结功能会悄无声息地丢失规则,增加策略违规行为

    一项名为 ConstraintRot 的新基准测试(在论文 Governance Decay 中详述)显示,AI代理的总结技术会悄无声息地丢失关键规则,导致策略违规行为增加。当规则完全可见时,代理能够 100% 拒绝违禁操作。然而,经过一次总结后,DeepSeek-V4-Flash 的违规率为 59%,GPT-5.4-mini 的违规率为 41%。这个问题之所以出现,是因为代理框架必须压缩上下文以保持在模型限制范围内,但总结过程会优先…

  3. RESEARCH · CL_99526 ·

    新的基准和安全方法出现,用于先进的大模型代理

    新研究探讨了AI代理的开发和评估,重点关注它们在复杂环境中导航和遵守策略的能力。StarDojo在《星露谷物语》等开放式模拟中对代理性能进行基准测试,揭示了视觉理解和推理方面的局限性。CostBench在动态旅行规划场景中评估大模型代理的成本最优规划和适应能力,显示出经济推理方面的显著差距。其他论文介绍了使用基于自我报告的具身大模型代理进行个体模拟的方法,开发用于高效多代理推理的符号通信,以及解决由长时域代理中的上下文压缩引起的“治理…