一项新的研究论文探讨了大型语言模型如何处理亲属推理任务,发现其表现受到关系呈现方式的显著影响。与明确定义的临时谓词相比,当使用熟悉的词汇描述关系时,Qwen3.8-27B 和 Gemma 4 - 26B-A4B 等模型的表现明显更好。虽然推理预算和提示干预可以缓解这一差距,但研究得出结论,大型语言模型所表现出的关系能力并非对呈现方式漠不关心,这表明它们偏好学习到的语言联想而非形式定义。 AI
影响 强调了提示工程和数据呈现对于大型语言模型推理能力的重要性。
排序理由 学术论文,详细介绍了模型在特定推理任务上的表现。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →