研究人员推出了MemHop,这是一个旨在评估大型语言模型(LLM)智能体多跳推理能力的新基准。该基准包含在10个社交网络场景中的1000个带证据标注的问题,测试1到5跳的深度回忆能力。与MemHop一同提出的还有Profile-Graph Memory (ProGraph),一种新颖的记忆架构,它结合了用于遍历叙事档案中实体名称的档案扩展和用于捕获日期、数量等精确细节的压缩残差。ProGraph在MemHop和长上下文建模(LoCoMo)基准上均表现出色,优于现有的记忆框架。 AI
影响 引入了评估和改进LLM智能体长期记忆的新方法,有望增强其处理复杂、多步任务的能力。
排序理由 学术论文,介绍了一种用于LLM智能体的新基准和记忆架构。[lever_c_demoted from research: ic=1 ai=1.0]
- A Memoir Blue
- arXiv
- FullContext
- HippoRAG
- LLM agents
- Long Context Modeling
- Mem0 Agent Memory Framework
- MemHop
- Profile-Graph Memory
- ProGraph
- retrieval-augmented generation
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →