PulseAugur
中
实时 00:26:08
实体 LongMemEval-S

LongMemEval-S

PulseAugur coverage of LongMemEval-S — every cluster mentioning LongMemEval-S across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
18
90 天内 18
发布 · 30天
0
90 天内 0
论文 · 30天
14
90 天内 14
层级分布 · 90 天
主题
关系
情绪 · 30 天

7 天有情绪数据

最近 · 第 1/1 页 · 共 18 条
  1. TOOL · CL_282208 ·

    MemStrata 使用本地 Qwen 阅读器在长上下文基准测试中达到 95% 的准确率

    研究人员开发了 MemStrata 系统,该系统在长上下文评估基准测试中实现了高源感知准确率。使用本地 Qwen 3.8 27B Q4_K_M 阅读器,MemStrata CL1 在 LongMemEval-S 上达到了 95% 的准确率,在 LoCoMo 1-4 类上达到了 90.91% 的准确率。该系统包含一个检索骨干,并添加了非重复、带日期、带说话人归属的源跨度,在 BEAM-1M 基准测试上优于密集检索。

  2. RESEARCH · CL_273211 ·

    TAGGRAPH框架评估LLM智能体记忆系统 · 已追踪3个来源

    研究人员开发了TAGGRAPH,一个用于评估LLM智能体记忆系统的新颖框架。该系统使用具有共享对话记忆的受控评估框架,采用局部图配置和个性化PageRank扩散。虽然AdaptiveGraph在LongMemEval-S基准测试中表现强劲,但传统的BM25和OpenClaw方法最终获得了更高的检索分数。研究强调了词汇归一化和提取质量对图检索的显著影响,表明检索策略应与记忆设置和稳健的词汇基线结合进行评估。

  3. TOOL · CL_280936 ·

    新研究质疑大型语言模型(LLM)的长期记忆评估方法

    一篇发表在arXiv上的新论文详细介绍了对检索链长期记忆评估方法的审计。研究发现,由于读者差异和需要重复判断,评分存在不一致性,即使重新评估相同的答案,分数也会波动。研究还强调了阴性对照的问题以及缺乏未触及的留出数据,并得出结论,当前方法未能明确确立新的排行榜领先者或可转移的记忆优势。

  4. RESEARCH · CL_270355 ·

    AI记忆系统在基准测试中取得高分,一个用于LLM,一个用于机器人技术

    一篇新研究论文介绍了一个可审计的AI长期记忆系统,该系统在LongMemEval-S基准测试中取得了高分。使用Claude Opus作为阅读器,该系统得分分别为479/500和475/500,表现与Chronos High公布的分数相当。另一篇论文详细介绍了一个名为ECROM的回顾性开放词汇记忆系统,用于机器人技术的长期物体搜索,该系统在一个新的HM3D基准测试中提高了性能。

  5. TOOL · CL_270366 ·

    Mnemon 代理采用双系统方法实现 LLM 长期记忆

    研究人员推出 Mnemon,这是一种专为大型语言模型长期上下文设计的新型记忆代理。Mnemon 区分快速、基于判断的任务(系统 1)和慢速、基于推理的任务(系统 2),将前者分配给名为 Jev 的决策模型,后者分配给 LLM。这种方法使 Mnemon 能够维护并有效利用广泛的对话历史,在使用 GPT-4.1 mini 的 LoCoMo 基准测试中表现优于其他 14 个系统,并在 LongMemEval-S 上取得顶级结果。

  6. RESEARCH · CL_268689 ·

    新研究解决长时任务的LLM智能体记忆问题 · 追踪8个来源

    多篇研究论文探讨了用于大型语言模型(LLM)智能体的高级记忆管理技术,以提高它们在长时任务上的表现。这些研究引入了新的框架和方法,如因果记忆策略(CMP)、持久上下文图(ReCAP)和MemFit,旨在优化智能体存储、检索和利用信息的方式。研究强调了区分记忆保留与检索、管理重尾记忆痕迹以及开发高效、非破坏性记忆系统的重要性,以增强智能体能力并降低计算成本。

  7. TOOL · CL_255895 ·

    AI代理记忆框架详细说明安全性和可复现性措施

    两个不同的AI代理记忆框架skillmem和nautilus-compass详细说明了它们在安全性和可复现性方面的处理方法。Skillmem解决了外部文本可能被误认为是代理指令的漏洞,通过实施来源跟踪和明确的信任声明来缓解此问题。相反,Nautilus-compass强调“证明它是错的”的理念,在写入时在本地执行所有嵌入和处理,并将基准测试声明作为可验证的、签名的证据包发布,以确保可复现性。

  8. RESEARCH · CL_246338 ·

    Nautilus-Compass 代理内存层在检索基准测试中优于 Mem0

    一个名为 Nautilus-Compass 的新开源 AI 代理内存层,在 LongMemEval-S 检索基准测试中表现优于 Mem0 Agent Memory Framework。Nautilus-Compass 系统通过按原样存储会话文本并使用 BGE-M3 进行本地嵌入来实现这一点,避免了在写入过程中调用 LLM。这种方法实现了无损内存写入,所有智能都在读取时应用,利用了话语类型路由、混合 BM25 和密集检索融合以及日期锚定…

  9. RESEARCH · CL_246219 ·

    Fortunate Recall 通过本体驱动策略增强LLM记忆管理

    研究人员推出了一种新颖的策略层Fortunate Recall (FR),旨在改进大型语言模型 (LLM) 的记忆管理。FR通过将个人事实分类到行为本体中并应用特定类别的生命周期策略,解决了无界内存增长和检索精度下降的问题。该方法旨在根据记忆的行为类型,确定哪些记忆应该持久存在、被替换或调整其有效性。

  10. TOOL · CL_241077 ·

    Nautilus-Compass推出无LLM的AI代理记忆层

    Nautilus-Compass发布了一个开源的AI代理记忆和可靠性层,旨在在写入时无需LLM提取即可改善长期记忆检索。这种方法将原始文本嵌入本地存储,并根据特定查询检索信息,这与ChatGPT和Mem0等提取对话为事实的系统形成对比。开发者认为,这种方法更具成本效益,并且随着嵌入技术的未来改进而更具适应性,因为它保留了原始文本以供重新索引。

  11. TOOL · CL_230352 ·

    Uteke 内存引擎在不同 CPU 架构上表现出高一致性

    Codecora 发布了其开源内存引擎 Uteke 的基准测试结果,在 LongMemEval-S 基准测试中显示出高召回率。一个关键发现是该引擎在不同 CPU 架构之间的一致性,在 x86 云基础设施和 ARM 桌面之间,108 个测试用例中有 107 个匹配。基准测试方法强调透明度,鼓励用户使用公共工具运行自己的测试。

  12. TOOL · CL_227837 ·

    Wontopos Tablet 2 在多语言和多模态记忆检索方面表现强劲

    研究人员在各种文本检索基准上评估了 Wontopos Tablet 2,这是一个用于语言模型的长期记忆引擎。该系统在 LongMemEval-S (95.7%) 和 BEAM-1M (67.5%) 上取得了高分,尽管论文指出这些指标可能对读取器和重新提问预算的变化敏感。在多模态测试中,Wontopos Tablet 2 在跨语言图像检索方面显著优于 BM25,召回率达到 95.2%,而 BM25 为 19.0%。该系统在检索 14 种…

  13. RESEARCH · CL_219216 ·

    Wontopos Tablet 2 在不进行词汇匹配的情况下推进了 LLM 记忆检索 · 跟踪 2 个来源

    一篇新研究论文介绍 Wontopos Tablet 2,这是一个为语言模型设计的长期记忆引擎,用于在不依赖词汇匹配的情况下进行多语言和多模态检索。该系统在 LongMemEval-S 等文本基准测试中表现强劲,准确率达到 95.7%,在 BEAM-1M 数据集上的准确率为 67.5%。在多模态测试中,Wontopos Tablet 2 在跨语言照片检索方面显著优于 BM25,召回率达到 95.2%,而 BM25 为 19.0%,并且在…

  14. TOOL · CL_121467 ·

    新框架通过用户感知检索增强AI对话记忆

    研究人员开发了一个名为Profile-guided Personalized Retrieval Optimization (PPRO) 的新框架,以增强对话AI代理的长期记忆检索能力。该系统从对话历史中创建用户档案,以个性化记忆检索,并考虑用户属性和偏好。PPRO还包括一个使用Group Relative Policy Optimization训练的查询重写器,利用检索和答案质量的反馈来提高性能。在LoCoMo和LongMemEva…

  15. TOOL · CL_104777 ·

    RAG压缩评估存在缺陷,掩盖了模型性能差异

    arXiv上发表的一篇新研究论文指出了检索增强生成(RAG)压缩评估中的一个关键缺陷。研究表明,固定的压缩方法会掩盖语言模型之间显著的性能差异,导致排名具有误导性。这是因为压缩通过过滤噪声来使较弱的模型受益,但通过删除有用细节来损害较强的模型,从而模糊了各种基准和领域中真实的Reader缩放能力。

  16. TOOL · CL_91371 ·

    LLM对话的逐字块优于提取的事实,在记忆检索方面

    一项新的研究论文挑战了将长LLM对话提炼成事实或事件等结构化信息的常见做法。研究发现,在LoCoMo和LongMemEval-S两个基准测试中,使用逐字对话块在检索准确性方面显著优于提取的信息。研究人员认为,提取过程是有损的,会丢弃逐字块保留的关键细节。他们提出,结构化记忆应作为逐字文本的补充,而非替代,以提高对话式AI的性能。

  17. RESEARCH · CL_43964 ·

    DeferMem框架通过强化学习增强LLM长期记忆问答能力

    研究人员开发了DeferMem,一个旨在改进大型语言模型在处理长期对话记忆时的问答能力的新框架。该系统将过程分为初步的广泛候选检索和随后的条件查询证据蒸馏阶段。DeferMem利用一种名为DistillPO的强化学习算法,将检索到的信息提炼成简洁、相关的证据,在准确性和效率方面优于现有方法。

  18. TOOL · CL_27572 ·

    Nautilus Compass 在无需模型访问的情况下检测 LLM 代理个性漂移

    研究人员开发了 Nautilus Compass,这是一个旨在检测生产环境中大型语言模型 (LLM) 代理个性漂移的新颖系统。这种黑盒方法仅在提示文本层运行,利用与行为锚文本和 BGE-m3 嵌入的余弦相似度来识别偏差。与需要模型权重的白盒方法不同,Nautilus Compass 兼容 Claude 和 GPT-4 等闭源 API,并且在索引期间无需 LLM 调用即可运行,从而提高了效率。该系统在检测漂移和检索信息方面表现出强大的性…