研究人员推出Granite.Trust Policy Tools,这是一个旨在为生成式AI应用创建可共享、可操作的安全策略的新框架。该系统通过引入Actionable Policy模式解决了传统访问控制的局限性,该模式是一种基于YAML的格式,用于指定模型响应中的内容约束。该模式支持基于异常的治理和策略违规跟踪。此外,该框架还包括一个合成数据生成管道,用于创建用于模型对齐和测试的对齐训练数据,从而在整个AI应用生命周期中实现一致的策略执行。 AI
影响 提供了一种标准化方法来定义和执行GenAI安全策略,有可能改善模型对齐并降低风险。
排序理由 该集群包含一篇详细介绍生成式AI安全策略新框架和模式的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →