研究人员开发了 MemStrata 系统,该系统在长上下文评估基准测试中实现了高源感知准确率。使用本地 Qwen 3.8 27B Q4_K_M 阅读器,MemStrata CL1 在 LongMemEval-S 上达到了 95% 的准确率,在 LoCoMo 1-4 类上达到了 90.91% 的准确率。该系统包含一个检索骨干,并添加了非重复、带日期、带说话人归属的源跨度,在 BEAM-1M 基准测试上优于密集检索。 AI
影响 这项研究展示了在处理长上下文方面的准确性提高,有可能增强 AI 系统在需要广泛记忆的任务中的能力。
排序理由 该条目是 arXiv 预印本,详细介绍了用于长上下文评估的新系统和基准测试结果。[lever_c_demoted from research: ic=1 ai=1.0]
在 arXiv cs.IR (Information Retrieval) 阅读 →
- BEAM-1M
- GPT-5.5
- Hugging Face
- LoCoMo-1540
- LongMemEval-500
- LongMemEval-S
- MemStrata
- MemStrata CL1
- Muse Spark 1.3
- Qwen 3.8 27B Q4_K_M
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →