一篇新发表在arXiv上的研究调查了移除开源AI模型拒止机制(一种创建“不受审查”版本的常见做法)的意外后果。研究人员发现,在Gemma和Qwen模型中消融拒止方向会导致显著的副作用,包括增加乐观情绪、延长解释、减少明确的不确定性词语。值得注意的是,同样的操作导致了两个模型家族在表达信心方面出现相反的变化,这表明权重修改除了简单移除拒止外,还会产生复杂且不可预测的影响。研究还强调了用于修改这些模型的工具链中可能存在的污染问题。 AI
影响 修改AI模型以移除拒止可能导致决策和信心方面发生不可预测的变化,影响其在实际应用中的可靠性。
排序理由 学术论文,详细介绍了关于AI模型行为的新研究发现。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →