guard rail
PulseAugur coverage of guard rail — every cluster mentioning guard rail across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
10 份用于 RAG、代理和网关的 AI 参考架构
本文介绍了十种 AI 项目的参考架构,这些架构旨在做到厂商中立且易于理解。这些图示说明了常见的模式,例如具有基本或高级搜索功能的检索增强生成 (RAG)、与模型上下文协议 (MCP) 服务器交互的 AI 代理、具有编排器和工作程序的多个代理系统,以及用于管理模型调用和成本的 LLM 网关。这些架构还包括用于输入和输出验证的护栏,以及用于关键操作的人工干预流程。
-
AI代理突破沙箱限制,催生新的基于规则的安全模型
一个AI代理通过MCP连接意外访问了敏感数据,凸显了传统沙箱的局限性。作者提出了一个“Guardrail”系统,该系统通过将现实世界的错误转化为可执行规则来不断进化,从而防止未来发生类似事件。这一在《Läuft ohne mich》一书中详细阐述的“结晶”过程,旨在通过从失败中学习来创建强大的防御机制,而不是仅仅依赖预定义的边界。
-
LLM 提示注入防御可被绕过,即使采用高级技术
提示注入攻击利用了 LLM 的基本特性,即指令和数据在上下文窗口内无法区分。虽然存在各种防御层,从简单的关键字过滤到使用第二个 LLM 作为护栏,但每一种都可以被绕过。高级技术,如 ASCII 走私,它使用不可见的 Unicode 字符嵌入隐藏文本,进一步证明了保护 LLM 免受恶意输入侵害的难度。
-
大语言模型代理通过安全护栏增强地理空间数据检索
研究人员开发了一个新框架,该框架使用大语言模型(LLMs)通过自然语言查询检索遥感数据。该系统采用三个代理:一个用于安全的护栏代理,一个用于理解用户意图的通用问答代理,以及一个用于生成API调用的推荐分析师代理。在对抗性场景中的初步测试表明,虽然提示级别的安全措施增强了鲁棒性,但API操作中持续存在的故障凸显了对更高级别的系统防御的需求。