实体
Red-Teaming in the Public Interest
Red-Teaming in the Public Interest
PulseAugur coverage of Red-Teaming in the Public Interest — every cluster mentioning Red-Teaming in the Public Interest across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
启动全球AI红队测试计划以增强安全性
Red Packet Security 倡导通过全球协作的AI红队测试方法来加强AI安全。该倡议被称为“公益红队测试”,旨在促进全球研究人员和组织之间的合作。此举旨在在潜在风险被利用之前,主动识别和减轻与先进AI系统相关的潜在风险。
-
新的 PI-Hunter 工具自动化了针对 LLM 代理漏洞的红队测试
研究人员开发了 PI-Hunter,这是一个自动化框架,旨在主动识别和定位大型语言模型 (LLM) 代理中的提示注入漏洞。该系统通过反馈驱动的探索构建真实的测试用例,促使代理揭示来自外部源的隐藏恶意指令。实验表明,与现有的红队测试方法相比,PI-Hunter 显著提高了漏洞暴露和攻击面覆盖率,即使面对当前的提示注入防御措施也是如此。
-
论文认为人工智能安全验证方法不足以满足治理要求
一份新的立场文件认为,当前验证人工智能安全声明的方法不足以满足近期治理框架的要求。该文件强调了一个“审计差距”,即行为评估和红队测试无法验证法规要求的潜在表征或长时程代理行为。文件提出,地缘政治和行业压力促使人们进行表面验证而非深入的结构分析,并建议将行为证据的范围限定在法律文本中,并扩大对机制证据类别的访问。