LongMemEval
PulseAugur coverage of LongMemEval — every cluster mentioning LongMemEval across labs, papers, and developer communities, ranked by signal.
- used by Long Context Modeling 90%
- instance of Mem0 Agent Memory Framework 90%
- instance of locomotive class 90%
- instance of Gotit.pub 90%
- instance of Long Context Modeling 70%
- used by DagsHub 70%
- instance of ScienceCast 70%
- instance of DagsHub 70%
- instance of CatalyzeX 70%
- instance of alphaXiv 70%
- competes with Mem0 Agent Memory Framework 60%
5 天有情绪数据
-
AI 记忆挑战:注意到变化,而非仅仅回忆过往对话 · 跟踪 1 个来源
近期对 AI 记忆系统的调查表明,AI 助手面临的主要挑战并非回忆过往对话,而是注意到信息何时发生了变化。测试显示,大多数情况下,AI 模型不需要广泛的记忆,而当需要记忆时,AI 常常因未能识别更新的事实而非遗忘它们而失败。虽然提供完整的聊天记录可行,但与使用定向笔记相比效率低下得多,特别是对于进行大量来回交互的 AI 代理。
-
新模型通过时间有效性和显式概念溯源增强大型语言模型
研究人员引入了概念生命周期模型(CLM)和概念导向注意力(CGA),以增强知识密集型语言模型。CLM将概念表示为具有显式溯源的持久性、时间版本化的实体,而CGA将图结构注入Transformer计算中。在MuSiQue和HotpotQA等数据集上的评估表明,虽然图注意力机制并未显著提高证据召回率,但显式时间表示将答案准确率提高了多达25个百分点。该框架还通过明确表述认知状态,显著减少了不支持的断言。
-
MemFold 通过基于策略的优化来优化 AI 内存以实现个性化
研究人员开发了 MemFold,这是一种用于优化 AI 助手紧凑型软内存的新颖方法,专为长上下文个性化而设计。与将内存压缩到潜在向量或将其保留为文本的传统方法不同,MemFold 根据其支持的行为来优化内存。该系统使用查询条件化的文本内存,该内存被压缩成连续向量,并使用来自冻结教师模型的组相对奖励和基于策略的蒸馏进行训练。这种方法在 PersonaMem-32K 和 PersonaMem-128K 基准测试中表现出更高的准确性,尤其是…
-
新研究解决长时任务的LLM智能体记忆问题 · 追踪8个来源
多篇研究论文探讨了用于大型语言模型(LLM)智能体的高级记忆管理技术,以提高它们在长时任务上的表现。这些研究引入了新的框架和方法,如因果记忆策略(CMP)、持久上下文图(ReCAP)和MemFit,旨在优化智能体存储、检索和利用信息的方式。研究强调了区分记忆保留与检索、管理重尾记忆痕迹以及开发高效、非破坏性记忆系统的重要性,以增强智能体能力并降低计算成本。
-
新的大语言模型记忆系统应对长期对话挑战 · 已追踪 5 个来源
研究人员正在开发新的方法来管理和检索大型语言模型(LLM)的长期对话记忆中的信息。这些方法旨在克服全上下文注入(计算成本高)和有损摘要(丢弃关键历史数据)的局限性。诸如 'Pull' 和 'MemLoc' 等技术侧重于惰性实现或精确查找相关的对话轮次,从而在保持或提高响应质量的同时降低令牌成本。其他方法,如 'CueMem',使用提取的记忆线索来重建与查询相关的上下文,而 'PRAGMA' 通过将记忆与不断变化的用户偏好对齐来评估个性…
-
KVMem 在消费级GPU上虚拟化百万Token的AI Agent工作空间
研究人员开发了KVMem,一个用于管理AI Agent大上下文窗口的系统,使其能够在消费级GPU上运行高达一百万Token。这种虚拟化技术将溢出的上下文存储为分页KV状态,分布在GPU内存、主机内存和NVMe中,与传统的压缩方法相比,能够更有效地处理长历史记录。KVMem已证明了提高任务成功率和交互响应能力,使得长时运行的Agent能够维护广泛的工作空间。
-
开发者创建AI伴侣应用基准测试以打击联盟营销垃圾信息
一位开发者创建了一个名为companion-bench的基准测试,用于评估AI伴侣应用程序,解决了这些应用缺乏客观测试的问题。与测试原始语言模型的基准测试不同,companion-bench评估的是完整的应用体验,包括记忆管道、角色提示和安全层。该基准测试使用标准化的脚本,包含特定的事实和探针,以测试回忆、一致性和无提示记忆,同时采用确定性的通过/失败标准和基于LLM的评判者进行主观评估。
-
新方法使大型语言模型能够高效压缩上下文
研究人员开发了新的方法来压缩大型语言模型的上下文,使其能够更有效地处理更多信息。来自arXiv的FlexComp框架通过对每个实例的内存预算进行采样,使单个模型能够处理可变的压缩率,其性能优于固定比率的专用模型。LatentPress是另一种方法,它将对话历史和文档编码成连续的内存令牌,冻结的解码器可以直接读取,绕过文本重建,并显著加快推理速度。
-
新方法使用审计跟踪来监督LLM代理记忆
研究人员推出了一种名为Hindsight Memory-PRM的新方法,用于监督长时程大型语言模型(LLM)代理的记忆管理。该方法利用代理操作留下的检索命中和回答时引用的审计跟踪来训练一个记忆效用批评者。该系统使用此批评者为操作分配代理奖励,无需每次操作都进行人工标注或复杂的重放。在评估中,使用Hindsight Memory-PRM的本地8B策略在LoCoMo和LongMemEval基准测试上取得了比其API教师和其他外部系统显著更…
-
新的原生于 PostgreSQL 的图 RAG 引擎提高了时态准确性
研究人员开发了 post-graph-rag,这是一个开源引擎,旨在提高基于图的检索增强生成 (RAG) 系统的效率和准确性。该新引擎将嵌入、规范实体图和社区摘要集成在单个 PostgreSQL 数据库中,利用 pgvector 进行搜索和边表进行遍历。它通过实现一个双时态层来解决基础设施同步、通过验证保证数据质量以及时态准确性等挑战,该层跟踪关系何时有效以及何时被认为是真实的。
-
新的SearchWiki框架学习导航知识维基以进行主动信息检索
研究人员开发了SearchWiki,一个旨在将语料库合成为结构化、可导航知识维基的框架。该系统训练了一个名为WikiResearcher-9B的智能体,通过多轮工具使用主动搜寻信息,并将知识组织在文档概述、跨文档主题页面和页面级来源记录中。在各种基准测试上的评估表明,WikiResearcher-9B(一个经过RL微调的Qwen 9B模型)的性能显著优于基线模型,并能媲美或超越更大的外部模型,这凸显了与扁平检索方法相比,通过结构化语料…
-
新方法超越文本和视觉压缩LLM的长上下文 · 跟踪2个来源
两篇新的研究论文介绍了压缩大型语言模型长上下文的新颖方法。LatentPress利用连续内存令牌,绕过文本重建,实现更快、更高效的处理,在极少的参数训练下实现了显著的压缩率。TopoCompress是一个无需训练且模型无关的框架,采用图连接的语义轨迹来选择连贯的跨度,其性能优于现有的压缩基线,并减少了预算和时间。
-
AI代理因模型快速更迭面临记忆丢失;Uteke提供持久化记忆解决方案
AI模型的快速发布周期,以Qwen在36天内发布五次为例,给依赖模型特定上下文进行记忆的AI代理带来了巨大的维护负担。这种“更迭税”意味着每次模型切换时,提示和工具调用都必须重新调整,如果模型本身存储记忆,这实际上会导致记忆丢失。为了解决这个问题,Uteke被开发出来,将记忆视为一种独立于底层模型的持久化资产,允许代理在模型更改时保留其“大脑”。
-
AI 的上下文窗口在扩展,但专用记忆系统仍然至关重要
AI 模型的上下文窗口正在扩展,但这并不等同于真正的记忆系统。虽然更大的窗口提供了更多的即时工作空间,但它们并不能从根本上解决信息持久性、检索或随时间推移的相关性问题。“中间遗忘”等问题仍然存在,即大上下文中间的信息利用效率较低。此外,处理海量上下文窗口的成本和延迟使得“将所有内容都放入上下文”的方法对于长期 AI 代理功能来说是不切实际的。有效的 AI 记忆需要专门的系统来管理、更新和检索信息,而不是仅仅依赖更大的上下文窗口。
-
ArborMem框架增强LLM记忆以处理复杂对话
研究人员推出ArborMem,一个专为大型语言模型设计的新型记忆框架,用于管理复杂的对话状态。ArborMem将对话表示为可导航的交互状态森林,能够保留多个交织的任务轨迹。这种方法使模型能够定位相关状态,恢复上下文,并在不同的对话分支中检索证据,从而在不混淆不同轨迹的情况下保持连贯性。为了评估其有效性,开发了一个名为BranchMemEval的新基准,专注于交织和可恢复的交互轨迹。实验表明,ArborMem在包括LongMemEval…
-
LLM上下文窗口研究表明,对代理来说,越多越好并非如此
近期研究表明,增加LLM代理的上下文窗口大小并不一定会提高性能,实际上可能会降低性能。研究表明,模型难以有效利用大量的上下文,特别是埋藏在长输入中间的信息。有效的性能依赖于智能选择相关信息的精选记忆系统,而不是最大化上下文,在特定基准测试中甚至优于GPT-4o等大型模型。
-
Oracle agent memory system slashes token use, boosts LongMemEval accuracy
研究人员开发了一种新的Oracle代理记忆系统,该系统显著减少了令牌使用量。该系统在LongMemEval基准测试中达到了93.8%的准确率,与传统的扁平历史基线相比,使用的令牌数量减少了10.7倍。研究结果在最近一篇关于长时程AI代理的arXiv预印本中有所详细介绍。
-
Memora 记忆系统在抽象和具体性之间取得平衡,适用于 AI 代理 · 跟踪 2 个来源
研究人员推出了一种新颖的记忆表示系统 Memora,旨在平衡 AI 代理的抽象和具体性。该系统通过抽象索引具体数据的核心概念来组织信息,同时使用线索锚点来扩展跨不同记忆方面的检索。Memora 在理论上将标准的检索增强生成 (RAG) 和知识图谱 (KG) 记忆系统统一为特例。在实践中,Memora 在 LoCoMo 和 LongMemEval 基准测试上达到了新的最先进水平,在记忆规模扩大时显示出检索相关性和推理效率的提高。
-
微软发布AI代理Memora记忆系统
微软研究院推出了Memora,一个旨在增强AI代理在长周期任务中能力的新型记忆系统。Memora通过将记忆内容与检索机制分离,解决了当前AI模型无状态的特性,使代理能够保留和访问具体细节以及抽象组织结构。这种方法显著提高了代理的生产力并减少了上下文令牌的使用,在LoCoMo和LongMemEval等基准测试中达到了新的最先进性能。
-
NLL引导的层选择优化LLM长上下文效率
研究人员开发了一种名为NLL引导层选择的新型无训练方法,以优化长上下文LLM的效率。该技术通过测量当某一层使用滑动窗口注意力而非全注意力时的负对数似然下降来识别混合注意力模型中应保留全注意力的层。将其应用于LongMemEval基准测试上的Qwen3-4B模型,该方法仅使用1/4的全注意力层就达到了64.6%的准确率,显著优于现有基线,同时计算成本减半。