Qwen3.8-27B 模型已更新为 FP8 构建,将有害指令的拒绝率从 64-99% 大幅降低至 0-6%。然而,这种安全性的提高似乎并未以牺牲能力为代价,因为 MMLU 和 GSM8K 的基准分数变化极小,变动小于 1.3 分。作为红队材料发布的评估数据表明,虽然模型拒绝有害提示的可能性降低,但其核心推理和知识能力基本保持不变。 AI
影响 展示了一种在不牺牲核心性能指标的情况下增强 AI 安全性的潜在方法。
排序理由 关于特定模型性能改进的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →