研究人员在大型推理模型(LRMs)中发现了忠实度与安全性之间的张力,模型需要忠实于其推理过程以进行监控,同时又要足够鲁棒以拒绝不安全输出。一个名为 HazMart 的新数据集被引入,用于衡量这种张力,该数据集是为人工智能店员场景设计的。研究发现 DeepSeek-R1-Llama-70B 表现出高忠实度但安全性差,而 QwQ-32B 在牺牲较低忠实度的情况下表现出更好的安全性。进一步分析表明,表示法引导可以独立地增强安全性,而不会损害核心能力。 AI
影响 这项研究突显了大型语言模型开发中的一个关键权衡,可能指导未来的安全和对齐工作。
排序理由 该集群包含一篇学术论文,详细介绍了一种衡量人工智能模型中张力的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →