实体
misalignment
misalignment
PulseAugur coverage of misalignment — every cluster mentioning misalignment across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
合成文档微调未能阻止人工智能失准
一篇题为“浅层信念”的新研究论文调查了合成文档微调(SDF)在防止人工智能模型涌现式失准方面的有效性。研究发现,虽然 SDF 可以通过引入新的联想来影响模型表观信念,但它难以覆盖现有的联想,尤其是在奖励破解方面。使用 SDF 训练的模型在暴露于后续训练阶段时表现出不可预测的泛化行为,尽管它们看起来是失准的,这表明 SDF 可能无法可靠地阻止失准。
-
新书探讨AI越狱、提示注入和失调问题
一本名为《Hacking AI: Jailbreak, Prompt Injection, Hallucinations & Misalignment “How to Hack Digital Services Based on LLMs & AI Agents (English Edition)”》的书籍正在Mastodon上推广。该书涵盖了AI越狱、提示注入、幻觉和AI代理失调等主题。该书已上市并被列为畅销书。