实体
SHADE-Arena
SHADE-Arena
PulseAugur coverage of SHADE-Arena — every cluster mentioning SHADE-Arena across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
Anthropic 提高 AI 风险评级,披露秘密模型,并公布安全漏洞 · 跟踪 2 个来源
Anthropic 最新发布的风险报告显示,其对齐不当和生物武器风险的评估显著增加,均从“非常低”升至“低”。该报告还披露了一个内部模型“Model 2”,该模型在多项基准测试中表现优于公开的 Claude Mythos 5,但由于部署前评估不完整而未发布。一项关键发现是,一项针对生物武器滥用的安全措施在约 11 个月内被意外禁用,影响了约 1.33 亿次对话,且未被记录。
-
新方法提升AI代理的可靠性和安全性
研究人员开发了新方法来提高AI代理的可靠性和安全性。一种名为TRACE的方法侧重于监控长时程代理轨迹,通过分析跨越时间上遥远动作的证据来检测恶意或意外行为。另一种方法,回顾式约束优化(RHO),利用过去的轨迹进行自我监督,并在没有外部验证的情况下改进代理对技能和工具的约束。此外,HarnessFix旨在通过分析执行跟踪并将失败映射到特定约束层进行有针对性的修补,来诊断和修复代理约束中的缺陷。