研究人员推出了一种名为Hindsight Memory-PRM的新方法,用于监督长时程大型语言模型(LLM)代理的记忆管理。该方法利用代理操作留下的检索命中和回答时引用的审计跟踪来训练一个记忆效用批评者。该系统使用此批评者为操作分配代理奖励,无需每次操作都进行人工标注或复杂的重放。在评估中,使用Hindsight Memory-PRM的本地8B策略在LoCoMo和LongMemEval基准测试上取得了比其API教师和其他外部系统显著更高的分数,同时使用的上下文量大大减少。 AI
影响 这种监督LLM代理记忆的新方法可以通过减少对广泛人工标注的需求,从而实现更高效、更有能力的长期代理。
排序理由 该集群包含一篇详细介绍LLM记忆管理新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hindsight Memory-PRM
- Hugging Face
- Long Context Modeling
- LongMemEval
- Mem0 Agent Memory Framework
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →