实体
guard model
guard model
PulseAugur coverage of guard model — every cluster mentioning guard model across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
研究发现:LLM合规系统对监管规则敏感度低
一篇题为“无规则的判决:诊断和审计LLM合规系统中监管规则的敏感性”的新研究论文,调查了大型语言模型(LLMs)在遵守监管规则方面的可靠性。研究发现,即使在相关规则被更改或否定时,LLMs也常常维持其原判,这表明它们对所提供的法规缺乏敏感性。虽然模型在规则变化会影响预测的简单案例中表现良好,但在更复杂场景下的准确性值得怀疑,其中一个测试的防护模型表现仅略优于随机猜测。
-
Guard Vector 通过参数组合和多语言支持增强LLM安全性
研究人员开发了Guard Vector,一种通过创建安全模型与基础语言模型之间的参数差异来增强LLM安全性的新方法。该技术无需额外的训练数据或目标语言标签,即可在包括中文、日文和韩文在内的多种语言中提高安全分类能力。Guard Vector方法还展示了跨不同模型架构(如Llama和Gemma)的可移植性,并与流式感知前缀微调相结合时,在实时处理条件下保持了分类质量,同时提高了吞吐量并降低了延迟。