一位研究人员在 GPT-5.6 Luna 中发现了一个特殊的推理错误,模型会正确识别“吹牛骰子”游戏中的叫价是否真实,但仍然选择挑战,而这种行为会保证失败。这种行为并非由于回退机器人,而是源于动作模式中的歧义,其中“挑战”可以被解释为“停止加注并立即结算”,而不是直接断言叫价是假的。在随后的测试中,修改动作模式以明确包含“断言:当前叫价是假的”字段纠正了此错误。 AI
影响 强调了动作模式设计的细微变化如何显著影响大型语言模型的推理和决策。
排序理由 该条目详细说明了模型中的特定推理错误以及该错误的实验性纠正。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →