研究人员推出PRAGMA,这是一个旨在评估大型语言模型(LLM)在长期对话中提供个性化指导能力的新基准。目前的LLM在处理完整的交互历史以进行指导时,面临计算开销和可靠性问题,尤其是在用户偏好和上下文不断演变的情况下。PRAGMA通过提供精心策划的纵向对话历史和指导场景来解决这一问题,强调了对支持健壮的对话检索和推理(超越简单事实回忆)的记忆架构的需求。 AI
影响 该基准有望推动LLM对话代理的改进,使其在个性化辅助和决策支持方面更加有效。
排序理由 该集群包含一篇介绍用于评估LLM能力的新的基准的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →