引入了一个名为 FinLifeBench 的新基准,用于评估大型语言模型从银行对话中随时间重建客户的生命事件和财务状况的能力。该基准包含 6,000 次韩国银行会话,揭示了当前的大型语言模型在维护完整且时间有效的纵向记录方面存在困难。随着会话数量的增加,性能会显著下降,模型经常遗漏事件或将过时的财务信息视为当前信息。 AI
影响 突显了大型语言模型在维持长期上下文和记忆能力方面的关键差距,这对于需要持续用户理解的应用至关重要。
排序理由 该集群包含一篇介绍用于评估大型语言模型能力的基准的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →