研究人员开发了一种新颖的方法来测试大型语言模型(LLM)跟踪“信念状态”的能力,方法是将一个可控的潜在变量嵌入到自然语言文本中。该技术涉及一个 LLM 教师在被微妙地引导沿特定的自编码器方向写作文本,这些方向根据马尔可夫链而变化。一个在该语料库上训练的独立 Transformer 模型成功跟踪了植入的潜在变量的贝叶斯后验信念,甚至按照马尔可夫链的顺序排列了这些状态,这为概念的几何形状受到其潜在变量统计动力学的影响提供了证据。 AI
影响 这项研究提供了一种更现实的方法来评估 LLM 的信念跟踪及其与概念几何的联系,有望带来更强大、更具可解释性的模型。
排序理由 该集群包含一篇学术论文,详细介绍了一种测试 LLM 能力的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
- Alexandru-Iulius Jerpelea
- arXiv
- Hugging Face
- Large Language Models
- Sarfati et al.
- Shai et al.
- Transformer++
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →