实体
gpt-oss-safeguard-20b
gpt-oss-safeguard-20b
PulseAugur coverage of gpt-oss-safeguard-20b — every cluster mentioning gpt-oss-safeguard-20b across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
Mistral AI 发布政策自适应多模态安全模型 Shieldstral
Mistral AI 发布了 Shieldstral 1.0 3B,这是一款专为高效内容审核设计的新型多模态安全分类器。与预测固定类别的传统模型不同,Shieldstral 在推理时能够适应提供的自然语言安全策略,从而无需重新训练即可处理新颖的审核标准。这款紧凑、开放权重模型可以处理文本、图像或两者兼有,并针对资源受限环境进行了优化。
-
AI代理发现先进的大语言模型攻击方法,揭示不单调的安全收益
AI代理能够发现超越现有方法的新型对抗性攻击算法,用于攻击大型语言模型。一项研究表明,这些AI发现的攻击在针对经过安全防护的GPT模型时,在特定查询上取得了高达80%的成功率,而在针对Meta的对抗性鲁棒模型时成功率达到100%。另一篇论文发现,Google的Gemma模型的安全对齐在不同代际之间并非持续改进,Gemma 3相比其前代和后代模型,攻击成功率显著增加。
-
新框架识别AI聊天机器人中老年人特有的风险
研究人员开发了GrandGuard,一个旨在解决老年用户与AI聊天机器人交互时特定安全问题的框架。该框架包含一个包含50种风险类型的分类法,涵盖心理健康、财务、医疗、毒性和隐私领域,这些风险类型基于现实世界的事件和利益相关者研究。一个包含超过10,000个提示和响应的基准测试显示,领先的LLM在超过一半的情况下未能处理这些老年人特有的风险。为缓解这些问题,实施了两项保障措施,在检测不安全提示方面取得了高准确率。