实体 Meta-SecAlign-70B

Meta-SecAlign-70B

PulseAugur coverage of Meta-SecAlign-70B — every cluster mentioning Meta-SecAlign-70B across labs, papers, and developer communities, ranked by signal.

Show in brief

总计 · 30天

90 天内 1

发布 · 30天

90 天内 0

论文 · 30天

90 天内 1

层级分布 · 90 天

主题

安全 1
论文 1

情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条

RESEARCH · CL_65134 · May 30 · 17:07

AI代理发现先进的大语言模型攻击方法，揭示不单调的安全收益

AI代理能够发现超越现有方法的新型对抗性攻击算法，用于攻击大型语言模型。一项研究表明，这些AI发现的攻击在针对经过安全防护的GPT模型时，在特定查询上取得了高达80%的成功率，而在针对Meta的对抗性鲁棒模型时成功率达到100%。另一篇论文发现，Google的Gemma模型的安全对齐在不同代际之间并非持续改进，Gemma 3相比其前代和后代模型，攻击成功率显著增加。

AI代理发现先进的大语言模型攻击方法，揭示不单调的安全收益