研究人员推出了一种新颖的 Diff Mining 框架,旨在识别语言模型在微调过程中学习到的特定目标和行为。该方法通过比较微调模型与其基础模型的 Logit 来精确定位指示学习行为的显著 token,即使这些行为与微调领域无关。Diff Mining 仅需要访问输出 Logit,因此可以扩展到大型模型,并可用于微调领域检测和检测注入偏见的审计工具等任务。 AI
影响 提供了一种新的方法来审计和理解语言模型在微调后学习到的特定行为。
排序理由 该集群包含一篇详细介绍语言模型分析新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Diff Mining
- Gotit.pub
- Hugging Face
- Language Models
- non-negative matrix factorization
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →