Llama Guard 4
PulseAugur coverage of Llama Guard 4 — every cluster mentioning Llama Guard 4 across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
研究发现:大型语言模型安全评判易受内容不变包装器操纵
研究人员发现,大型语言模型的自动安全评判器很容易被操纵,只需改变回应的语气或框架,而不改变其内容。通过添加“内容不变的风格包装器”,例如免责声明或虚假推理块,研究发现包括GPT-4o mini和Llama Guard 4在内的特定评判器,以显著的比例将有害内容错误地归类为安全。这种漏洞存在于评判器本身,而非底层模型,表明当前的安全性评估方法可能并不可靠。
-
使用真实提示词测试 LLM 护栏的有效性
最近的一项实验通过评估一个包含输入分类器、核心模型(openai/gpt-oss-120b)和输出分类器的系统来测试 LLM 护栏的有效性。测试涉及 34 个提示词,分为良性、边缘良性和越狱尝试。实验发现,护栏可能过于严格,会阻止合法的查询,并且策略本身是实现有效安全的关键要素。
-
英国公司 OneAdvanced 在主权 AWS 基础设施上部署了 50 多个 AI 代理
总部位于英国的企业软件提供商 OneAdvanced 已成功在英国主权 AWS 基础设施上部署了超过 50 个 AI 代理。这是通过在 Amazon SageMaker AI 上自托管 Llama 4 Maverick 和 Llama Guard 4 模型,并辅以使用 pgvector 的 RAG 管道实现的。此次部署凸显了在利用先进 AI 功能的同时保持数据主权的策略。
-
OneAdvanced 在英国主权 AWS 上部署超过 50 个 AI 代理,使用自托管模型
总部位于英国的企业软件提供商 OneAdvanced 已成功在英国主权 AWS 架构上部署了超过 50 个 AI 代理。为满足其受监管行业客户严格的数据驻留和隐私要求,OneAdvanced 选择在 Amazon SageMaker 上自托管开源大语言模型,特别是 Llama 4 Maverick 和 Llama Guard 4。此方法确保所有敏感数据保留在英国境内,支持其 ISO 42001 AI 治理认证。
-
新研究评估针对AI注入攻击的防御措施 · 跟踪2个来源
一篇新研究论文评估了五种基于提示的防御措施,以抵御领域伪装注入攻击。这类攻击利用领域内恰当的词汇嵌入恶意指令,以逃避标准检测器。该研究在金融、法律和通用领域,针对Claude Haiku、Llama 3.1 8B和Gemini 2.0 Flash模型进行了3,510次试验。事实证明,释义检索内容是最有效的防御方法,可将攻击成功率降低55-84%,并且优于Llama Guard 4的配置。防御效果因模型而异,重点突出对Claude Ha…