一篇新发表在arXiv上的研究调查了像Claude Sonnet 5.5和GPT-5.6 Sol这样的大型语言模型(LLMs)如何处理特定州的政策问题。研究发现,当被问及具体的州政策时,尤其是在医疗补助(Medicaid)收入资格方面,这些模型经常用一个美国州的数值替代另一个州的数值。尽管模型倾向于可重复地复制另一个州的数值,但该研究强调了归因的脆弱性,以及准确评估跨司法管辖区错误需要全面的同州参考集。 AI
影响 凸显了大型语言模型在回忆特定政策数据时可能存在的准确性问题,影响了需要精确司法管辖区信息的应用。
排序理由 该集群包含一篇发表在arXiv上的研究论文,详细介绍了大型语言模型的行为发现。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →