一篇新论文认为,AI安全应通过运行时合约强制执行,而非仅在训练阶段。作者提出了一个双管齐下的方法:预防性措施,通过沙箱和过滤器阻止危险行为的发生;以及证据性措施,要求对安全行为进行可验证的证明。这一观点得到了AI安全事件、代理系统审计以及学术出版物审查的证据支持,表明代理式AI面临着与计算机安全和实验科学等社区相似的压力,这些社区已经采用了运行时合约。 AI
影响 这项研究表明,AI安全重点将从模型训练转向运行时执行,这可能会影响AI代理的开发和部署方式。
排序理由 该集群包含一篇提出AI安全新方法的学术论文。
- Agent Safety Should Be a Runtime Contract
- Agent Trajectory Schema
- Conference on Neural Information Processing Systems
- Constitutional AI
- Direct Preference Optimization
- Evidence chain-based causality identification in herb-induced liver injury: exemplification of a well-known liver-restorative herb Polygonum multiflorum
- International Conference on Learning Representations
- International Conference on Machine Learning
- JSON
- reinforcement learning from human feedback
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →