研究人员推出了 Niyam-AI,这是一个旨在为 AI 代理提供加密可验证安全护栏的新颖框架。与依赖软件检查的现有方法不同,Niyam-AI 使用隔离的 Judge 模型和零知识证明(zk-SNARKs)来数学上验证每个工具调用是否符合预定义的约束。这种方法提供了可证明的安全执行保证,允许第三方在无需访问模型内部权重的情况下确认合规性。在 Agent-SafetyBench 数据集上的评估表明,Niyam-AI 的性能显著优于 NeMo Guardrails、Llama Prompt Guard 2 和 OpenAI 的 GPT-OSS-Safeguard 等现有护栏,在较低的误报率下实现了 88.5% 的 F1 分数,但证明生成会引入每个动作超过 2 秒的延迟。 AI
影响 引入了一种可证明安全的 AI 代理安全方法,有可能为自主系统中的可验证护栏设定新标准。
排序理由 介绍新颖 AI 安全技术的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- Agent-SafetyBench
- GPT-OSS Safeguard
- Llama Prompt Guard 2
- NeMo Guardrails
- NiyamAI
- OpenAI
- SHA-256
- Zero knowledge proofs
- zk-SNARK
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →