PulseAugur
实时 09:25:16
English(EN) NiyamAI - An Intent-Bound AI Agent with Cryptographically Verifiable Guardrails using Zero-Knowledge Proofs

Niyam-AI 使用零知识证明实现可验证的 AI 代理安全

研究人员推出了 Niyam-AI,这是一个旨在为 AI 代理提供加密可验证安全护栏的新颖框架。与依赖软件检查的现有方法不同,Niyam-AI 使用隔离的 Judge 模型和零知识证明(zk-SNARKs)来数学上验证每个工具调用是否符合预定义的约束。这种方法提供了可证明的安全执行保证,允许第三方在无需访问模型内部权重的情况下确认合规性。在 Agent-SafetyBench 数据集上的评估表明,Niyam-AI 的性能显著优于 NeMo GuardrailsLlama Prompt Guard 2OpenAI 的 GPT-OSS-Safeguard 等现有护栏,在较低的误报率下实现了 88.5% 的 F1 分数,但证明生成会引入每个动作超过 2 秒的延迟。 AI

影响 引入了一种可证明安全的 AI 代理安全方法,有可能为自主系统中的可验证护栏设定新标准。

排序理由 介绍新颖 AI 安全技术的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

Niyam-AI 使用零知识证明实现可验证的 AI 代理安全

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Aditya Katkar, Om Karkele, Kartik Mandhane, Manisha More, Yash Kashid ·

    NiyamAI - 具有加密可验证护栏的意图绑定AI代理,使用零知识证明

    arXiv:2608.07167v1 Announce Type: new Abstract: Giving an AI agent the ability to send emails, query databases, or execute commands is useful--until the agent is tricked into doing something it shouldn't. Prompt injection, hallucinated reasoning, and unsafe tool calls form the pr…