研究人员利用一种称为 J-lens 的技术,在 Qwen3.6-27B 模型上识别出了“元标记”。这些元标记是特定的标记,可以揭示模型中不明显的计算过程。例如,当遇到歧义文本时,“什么意思”这个元标记会被激活,影响模型的解释,防止其误解双关语。同样,在数学问题上,“gcd”标记会出现,表明模型使用了乘积/GCD 算法,而操纵这个标记会改变模型的计算结果。研究表明,虽然目前的单标记 J-lens 有局限性,但未来多标记版本可以提供对模型算法更深入的见解。 AI
影响 这项研究提供了一种理解大型语言模型内部结构的新方法,有望带来更具可解释性和可控性的 AI 系统。
排序理由 该条目描述了一种应用于现有模型以理解其内部工作原理的新颖研究技术,发布在研究论坛上。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →