研究人员引入了新的基准——公共人工智能记忆(PAIM)和公共Transformer(PTr)——来评估大型语言模型(LLM)代理的科学记忆能力。这些基准侧重于从完整的科学论文中恢复证据,这是研究代理的关键任务。该研究评估了八种记忆/检索系统,结果表明摄入粒度、检索预算和检索模式等因素显著影响性能。值得注意的是,混合稀疏-密集检索方法被证明非常有效,在PTr基准测试中并列领先。研究结果表明,科学记忆应被评估为预算式、模式感知的上下文恢复,而不是简单的架构排行榜。 AI
影响 为LLM代理从科学文献中回忆信息的能力建立了新的评估标准,可能指导未来的记忆系统开发。
排序理由 该集群包含一篇介绍LLM记忆系统新基准和评估方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- BM25
- Graphiti Data Visualization
- Hugging Face
- Mem0 Agent Memory Framework
- Public AI Memory
- Public Transformers
- Simple RAG
- Theoria
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →