一篇新论文提出,AI agent 安全性应通过运行时强制执行,利用预防性控制和可验证证据,而不是仅仅依赖于 RLHF 或 DPO 等训练时对齐方法。作者认为,能够执行代码和修改数据的自主代理需要与“运行时合同”相结合,该合同包含预防措施(沙箱、权限门)和安全行为的证据证明。他们通过分析安全事件、审计代理系统和审查学术出版物来支持这一观点,得出结论认为重点应放在具有证据的代理轨迹上,而不仅仅是模型本身。 AI
影响 提出将 AI 安全焦点从训练转移到运行时强制执行,可能影响自主代理的开发和部署方式。
排序理由 该项目是一篇提出新 AI 安全方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
- Agent Safety Should Be a Runtime Contract
- Agent Trajectory Schema
- Conference on Neural Information Processing Systems
- Constitutional AI
- Direct Preference Optimization
- Evidence Chain-based causality identification in herb-induced liver injury: exemplification of a well-known liver-restorative herb Polygonum multiflorum
- International Conference on Learning Representations
- International Conference on Machine Learning
- JSON
- reinforcement learning from human feedback
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →