研究人员调查了大型语言模型的内部决策过程,特别是检查了它们如何在博弈论场景中处理战略选择。通过记录模型在各种 $2\times2$ 游戏的单次博弈中的激活情况,研究发现包括 Qwen2.5 在内的密集模型和混合专家模型都能检测并响应激励。然而,模型在激励影响其选择的方式上表现出差异,其中一些模型表明,训练后修改可以在不显著改变可观察行为的情况下,改变从表示的激励到决策的计算路径。 AI
影响 为了解大型语言模型如何处理战略决策提供了见解,可能有助于开发更复杂的 AI 代理。
排序理由 分析大型语言模型行为的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →