Abliterlitics发布了对Qwen 3.8-27B模型八个无审查变体以及基础模型的比较分析。该研究涉及167小时的GPU计算,并使用HarmBench在基准测试、KL散度和拒绝率上评估了模型。'orcarouter'变体以82.2%的攻击成功率成为表现最佳者,而'apostate'则以接近同等能力和最低KL散度提供了最佳价值。相反,'obliteratus'变体因显著的性能下降和思考循环而被标记为需要规避,基础模型显示出最低的合规性。 AI
影响 提供了对无审查LLM变体性能和安全权衡的见解,引导用户选择更强大或更安全的选择。
排序理由 对现有开源模型的多个变体进行分析和比较。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →