一个名为 Heretic 的工具已证明能够显著降低 Google 的 Gemma 3 模型的拒绝率。通过使用一个命令且无需任何重新训练,Heretic 将 Gemma 3 的拒绝率从 97% 降至仅 3%。这表明 AI 模型中的安全配置可能可调,促使人们更仔细地审视供应商如何披露其护栏架构。 AI
影响 展示了一种调整 AI 安全护栏的潜在简便方法,这可能会影响模型的部署和用户交互。
排序理由 该条目描述了一种调整现有 AI 模型安全参数的新颖方法,这是一项研究发现。[lever_c_demoted from research: ic=1 ai=1.0]
在 Mastodon — mastodon.social 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →