研究人员开发了HazardAuditor,一个旨在通过解决运行时执行风险来增强计算机使用代理安全性的新框架。该系统将来自Claude Code、Codex、Hermes和OpenClaw等各种代理的交互规范化为统一格式以进行监督。此外,还引入了一种名为Guard Policy Optimization (GuardPO) 的新颖训练方法,以更好地将保护模型训练与序列级安全结果对齐,将准确性比以前的方法提高了多达16.5个百分点。 AI
影响 这项研究可能带来更安全的AI代理,能够与复杂系统交互,从而降低其执行相关的风险。
排序理由 该集群描述了在arXiv论文中提出的新研究框架和优化技术。
在 Hugging Face Daily Papers 阅读 →
- arXiv
- Claude Code
- codex
- GuardPO
- Guard Policy Optimization
- HazardAuditor
- Hermes
- OpenClaw
- Hugging Face
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →