研究人员开发了一种名为TRACE的新颖方法,通过分析大型语言模型(LLM)的检查点更新来对其进行审计。该技术直接在模型的权重中识别有害监督微调(SFT)目标的持续痕迹,独立于模型执行或行为评估。TRACE使用参考几何来量化有害程度,在各种微调配置甚至部分检查点访问中保持稳定。这种仅限权重的审计方法为安全评估提供了补充信号,尤其是在行为测试受限的情况下。 AI
影响 提供了一种新的、仅限权重的LLM安全审计方法,是对现有行为评估的补充。
排序理由 详细介绍LLM审计新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →