PulseAugur
实时 08:16:10

AI agent safety must shift from training to runtime enforcement, paper argues

一篇新论文提出,AI agent 安全性应通过运行时强制执行,利用预防性控制和可验证证据,而不是仅仅依赖于 RLHF 或 DPO 等训练时对齐方法。作者认为,能够执行代码和修改数据的自主代理需要与“运行时合同”相结合,该合同包含预防措施(沙箱、权限门)和安全行为的证据证明。他们通过分析安全事件、审计代理系统和审查学术出版物来支持这一观点,得出结论认为重点应放在具有证据的代理轨迹上,而不仅仅是模型本身。 AI

影响 提出将 AI 安全焦点从训练转移到运行时强制执行,可能影响自主代理的开发和部署方式。

排序理由 该项目是一篇提出新 AI 安全方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →

AI agent safety must shift from training to runtime enforcement, paper argues

报道来源 [2]

  1. arXiv cs.AI TIER_1 English(EN) · Albus W. Ng, Yi Han, Jusheng Zhang, Wenhao Wang ·

    Agent Safety Should Be a Runtime Contract

    arXiv:2608.11274v1 Announce Type: cross Abstract: The dominant paradigm treats AI safety as a property to be instilled during model training via RLHF, DPO, or Constitutional AI. We argue this is structurally insufficient for autonomous agents that execute code, mutate files, send…

  2. Hugging Face Daily Papers TIER_1 English(EN) ·

    Agent Safety Should Be a Runtime Contract

    Agent safety should be enforced at runtime through preventive controls and verifiable evidence rather than relying solely on training-time alignment methods.