研究人员开发了一种名为StateSwap的新方法,用于研究大型语言模型(LLM)如何根据提示框架不一致地处理选择题。通过引入一个特殊标记[STATE],并分析其在中间层的激活情况,他们发现支持导向和消除导向的框架会诱导不同的内部表征。在不同提示之间交换这些[STATE]激活可以改变模型预测,并提高不同框架之间的一致性,这表明这些内部状态与行为相关。 AI
影响 提供了一种理解和潜在改进LLM对不同提示响应一致性的新技术。
排序理由 该集群描述了一篇关于探测LLM行为的新颖方法的新的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →