研究人员探索了使用简单的聚类技术来发现大型语言模型激活空间中可解释且有用的特征。通过将递归二元k-means聚类应用于Qwen2.5-7B-Instruct模型的激活,他们识别出了按词汇、句法和语义类别组织的独特聚类。LLM裁判能够以高精度区分这些实际聚类和诱饵,表明发现的特征是有意义的。此外,激活修补实验表明,用聚类质心替换激活会影响模型的行为,表明这些特征在功能上是相关的。 AI
影响 这项研究提出了一种新的无监督方法来理解和潜在地操纵LLM的内部表征,有助于可解释性研究。
排序理由 该条目描述了一篇研究论文,其中详细介绍了一种使用聚类在LLM中发现特征的新颖方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →