一篇新的研究论文探讨了大型语言模型(LLMs)在面对不确定性时如何利用证据和搜寻信息。研究发现,虽然大型语言模型通过参与“思考”过程来提高其性能,但这并不一定转化为更有效地利用现有证据或更倾向于搜寻新信息。该研究使用了带有十个开放权重模型的双臂老虎机试验来衡量行动偏好、思考时长和报告的置信度。结果表明,思考增强了模型根据当前证据采取行动的能力,并减少了随机决策,但并未显示出信息搜寻行为的显著增加。 AI
影响 这项研究表明,虽然可以提示大型语言模型进行“思考”以改进当前决策,但它们本身并不会变得更倾向于搜寻信息,这可能会影响它们在复杂、不断变化的环境中的效用。
排序理由 该集群包含一篇详细介绍大型语言模型行为研究结果的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →