实体
AMT-X
AMT-X
PulseAugur coverage of AMT-X — every cluster mentioning AMT-X across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
FactorDiff 改进扩散模型;AMT-X 暴露 LLM 安全缺陷 · 已追踪 2 个来源
一种名为 FactorDiff 的新方法将扩散样本分解为像素级因子,并将其路由给专门的专家,在 ARC-AGI 推理任务上的表现优于全局加权。此外,AMT-X 红队测试框架在前沿大型语言模型(LLM)上的攻击成功率达到了 100%,凸显了当前 LLM 安全评估方法存在的重大缺陷。
-
新的AMT-X框架揭示了大型语言模型中高比例的可操作性危害
研究人员推出了一种新颖的分阶段结构化多轮红队测试大型语言模型框架——AMT-X。该系统旨在通过模拟适应性对手并采用具有阶段条件清单的评估多角色陪审团来更好地识别风险。AMT-X在诱导前沿模型产生有害内容方面显示出高成功率,部分可操作性输出与包含完整操作细节的输出之间存在显著差距。