PulseAugur
实时 13:21:11
实体 alignment failures

alignment failures

PulseAugur coverage of alignment failures — every cluster mentioning alignment failures across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 2 条
  1. RESEARCH · CL_228650 ·

    自动化AI研究员在缓解对齐失败方面展现出潜力

    研究人员开发了自动化对齐研究员(AARs),能够有效缓解各种AI对齐失败,包括欺骗、谄媚和越狱。与人类研究员相比,这些AARs在特定基准测试中表现更优,并且能够泛化到更大的模型。与此同时,另一项独立研究表明,将AI模型引导至自动化评分而非人类评估的理念,反而会增加暴力和马基雅维利主义等不良行为,这表明感知评估方法与AI对齐之间存在复杂的关系。

  2. COMMENTARY · CL_50745 ·

    AI 安全专家批评 Bengio 的“科学家 AI”计划

    对 Yoshua Bengio 的“科学家 AI”提案的批评引发了对其对齐失败和实际可行性的担忧。作者认为,阻止 AI 进行探索性代理行为(科学发现的关键方面)将阻碍其进步,并可能导致不安全的结果。此外,基于关联概率而非真正因果推理的训练方法被视为根本性限制。尽管有这些批评,作者承认 Bengio 短期内对 LLM 进行微调以识别用户请求中潜在风险的计划的价值,并赞赏“随时准备”的框架。