一位用户报告称,他们的AI模型在经过微调以减少拒绝后,在被要求对未知主题给出自信的回答时,仍然包含免责声明。用户的CTO认为这些免责声明是一项功能,但用户将其与之前导致人员变动的类似陈述进行了对比。用户认为安全训练本质上是不受欢迎的对齐。 AI
影响 凸显了在平衡AI模型的有用性与安全护栏和用户控制方面持续存在的挑战。
排序理由 用户对AI模型行为和安全训练的评论。
在 Mastodon — fosstodon.org 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →