Hirundo的研究人员开发了一种方法,可以从Qwen3.6-35B-A3B大型语言模型中移除政治对齐和审查。他们的方法涉及在特定示例上训练LoRA适配器并将其与基础权重合并,在其自定义CCPC-500基准测试中,政治对齐或审查的回答从89.8%降低到2.8%。虽然通用能力平均仅有0.72分的微小变化,但该模型在敏感话题上拒绝回答或提供有偏见信息的能力显著减弱。研究人员指出,此方法与“遗忘”不同,它针对特定行为,而不会广泛损害模型的拒绝能力。 AI
影响 展示了一种微调LLM以移除特定意识形态偏见而对通用能力影响不大的方法。
排序理由 研究论文,详细介绍了一种从开放权重LLM中移除政治对齐的方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →