研究人员推出了一项名为多会话个性化工具调用 (MPT) 的新基准,以应对基于 LLM 的智能体需要完整参数才能执行工具的挑战。MPT 基准包含 459 个多会话交互历史中的 4,695 个实例,专注于偏好召回、归纳和迁移。为了应对这些挑战,该团队还开发了 PRefine,一种测试时记忆方法,通过生成-验证-精炼循环来假设和精炼用户偏好。PRefine 在五个 LLM 上表现出卓越的性能,在偏好迁移方面尤其优于现有的记忆系统和完整历史提示。 AI
影响 这项研究可能带来更复杂、更个性化的 AI 智能体,能够更准确地理解和执行用户请求。
排序理由 该集群包含一篇关于 LLM 工具调用新基准和方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →