Long Context Modeling
PulseAugur coverage of Long Context Modeling — every cluster mentioning Long Context Modeling across labs, papers, and developer communities, ranked by signal.
7 天有情绪数据
-
NylonME记忆引擎增加“睡眠模块”以改进常识推理
一个名为NylonME的新记忆引擎引入了一个“异步反思”模块,其灵感来源于人脑在睡眠期间的记忆巩固过程。该模块允许系统在空闲时段建立不同信息片段之间的联系,而不仅仅依赖于直接检索。该实现已显著提高了LoCoMo基准测试分数,尤其是在常识推理方面,将整体召回率推至85.3%。
-
NylonME Memory Engine将LoCoMo基准测试召回率提升至84.6%
NylonME Memory Engine在LoCoMo基准测试上的性能显著提升,仅用两周时间就从47.1%的召回率跃升至84.6%。这一改进是通过一个多步骤过程实现的,包括集成双通道嵌入系统(词汇和向量)以及实施双层写入架构。双层方法同时存储原始对话轮次和提炼的抽象事实,从而保留了精确的召回和推理能力。
-
开发者创建AI伴侣应用基准测试以打击联盟营销垃圾信息
一位开发者创建了一个名为companion-bench的基准测试,用于评估AI伴侣应用程序,解决了这些应用缺乏客观测试的问题。与测试原始语言模型的基准测试不同,companion-bench评估的是完整的应用体验,包括记忆管道、角色提示和安全层。该基准测试使用标准化的脚本,包含特定的事实和探针,以测试回忆、一致性和无提示记忆,同时采用确定性的通过/失败标准和基于LLM的评判者进行主观评估。
-
新方法使用审计跟踪来监督LLM代理记忆
研究人员推出了一种名为Hindsight Memory-PRM的新方法,用于监督长时程大型语言模型(LLM)代理的记忆管理。该方法利用代理操作留下的检索命中和回答时引用的审计跟踪来训练一个记忆效用批评者。该系统使用此批评者为操作分配代理奖励,无需每次操作都进行人工标注或复杂的重放。在评估中,使用Hindsight Memory-PRM的本地8B策略在LoCoMo和LongMemEval基准测试上取得了比其API教师和其他外部系统显著更…
-
新的SearchWiki框架学习导航知识维基以进行主动信息检索
研究人员开发了SearchWiki,一个旨在将语料库合成为结构化、可导航知识维基的框架。该系统训练了一个名为WikiResearcher-9B的智能体,通过多轮工具使用主动搜寻信息,并将知识组织在文档概述、跨文档主题页面和页面级来源记录中。在各种基准测试上的评估表明,WikiResearcher-9B(一个经过RL微调的Qwen 9B模型)的性能显著优于基线模型,并能媲美或超越更大的外部模型,这凸显了与扁平检索方法相比,通过结构化语料…
-
新的基准和检索方法推动了AI对话记忆利用 · 跟踪2个来源
两篇新的研究论文探讨了对话式AI记忆的进步,重点关注模型如何利用和检索来自扩展对话历史的信息。第一篇论文介绍了UTILMEM,这是一个旨在测试分布式和隐式证据整合的基准,发现尽管当前系统在事实回忆方面表现良好,但在这种能力方面仍存在困难。第二篇论文提出了一种实体-记忆图检索方法,通过将对话轮次构建为节点并通过共享实体将它们链接起来,提高了长对话问答中的证据覆盖率,并显示出GPT-3.5和DeepSeek等模型的证据回忆率显著提高。
-
新的CABLE系统增强了AI代理的长期记忆检索能力
一篇新研究论文介绍了一种名为CABLE的系统,旨在改进AI代理的长期记忆检索。CABLE构建了与语义相似性互补的记忆之间的链接,目的是找出标准检索器可能遗漏的证据。这种方法优先考虑稀疏的、与推理相关的联想。在使用Qwen3.5-27B、DeepSeek Chat和GPT-4o-mini等模型在LoCoMo和MA-LongMemEval等基准上的评估表明,CABLE能够提高LLM的评判分数,尤其是在需要跨越多个记忆或会话的证据的问题上。
-
ArborMem框架增强LLM记忆以处理复杂对话
研究人员推出ArborMem,一个专为大型语言模型设计的新型记忆框架,用于管理复杂的对话状态。ArborMem将对话表示为可导航的交互状态森林,能够保留多个交织的任务轨迹。这种方法使模型能够定位相关状态,恢复上下文,并在不同的对话分支中检索证据,从而在不混淆不同轨迹的情况下保持连贯性。为了评估其有效性,开发了一个名为BranchMemEval的新基准,专注于交织和可恢复的交互轨迹。实验表明,ArborMem在包括LongMemEval…
-
新的记忆框架增强了AI对话代理的长期理解能力
研究人员开发了FTA-Mem,一个旨在增强情感支持代理长期对话理解能力的新型记忆框架。该系统通过创建捕获事实内容、时间上下文和情感状态的结构化记忆单元,解决了低密度对话的挑战。在ES-MemEval和LoCoMo基准上的实验表明,FTA-Mem通过有效平衡证据保存和构建成本,提高了问答准确性。
-
新研究探讨人工智能代理中的上下文压缩,发现时间数据丢失
一篇新研究论文介绍了基于睡眠记忆巩固启发的“显著性加权巩固”(Salience-Weighted Consolidation, SWC)框架,用于分析长时程语言模型代理中基于摘要的上下文压缩的有效性。研究发现,虽然压缩有助于事实性和多跳推理问题,但它会通过丢弃日期和时间信息来严重阻碍时间问题的表现。一种简单的提示修改被证明可以极大地改善时间表达的保留和在这些特定问题类型上的准确性。
-
Comprehension Memory 大幅降低 LLM 上下文成本,提升效率
一篇新论文介绍了 Comprehension Memory (CoMem) 技术,该技术旨在显著降低长上下文语言模型相关的内存和计算成本。CoMem 的工作原理是在“分割层”缓存中间层状态,而不是存储所有层的完整 KV 缓存。这种方法可以实现更快的推理速度和急剧降低的 VRAM 使用量,以 128k token 仅需 18.26 GB 的占用空间为例,相比之下通常需要 89 GB。该方法在 Qwen3_8B 模型上进行了测试,在保持准…
-
Huawei open-sources MindMemOS for AI agent memory evolution
华为的诺亚方舟实验室已开源MindMemOS,这是一个用于AI代理的内存操作系统层,旨在解决内存可转移性、演进和时间理解等问题。MindMemOS将内存与单个代理解耦,使用实体、属性和时间对其进行结构化,并通过用户反馈和离线“做梦”过程支持演进。该系统旨在使AI代理能够在会话和应用程序中保留和演进知识,从而通过内存巩固和技能演进的基准测试结果来改善用户体验和任务性能。
-
TrajWiki 框架通过源锚定记忆轨迹增强 LLM 代理
研究人员推出 TrajWiki,一个旨在增强大型语言模型代理的长期对话能力的新型记忆框架。与将记忆视为静态或可覆盖的现有方法不同,TrajWiki 将记忆建模为源锚定的演化轨迹。该框架包含一个“记忆维基”层,将对话历史结构化为相互链接的页面,捕捉关键实体和事件。通过实现从维基页面到记忆轨迹和快照的分层检索,TrajWiki 旨在提高扩展对话中的响应连贯性、可解释性和诊断可见性。
-
新基准揭示AI弃权能力取决于问题距离
一个名为RE-call的新基准已被开发出来,用于衡量AI代理在信息不存在于其知识库时弃权回答的能力。该基准引入了“切除距离”的概念,以量化问题与其支持证据的距离,并揭示了性能随距离的变化很大。以前的基准提供了一个单一的标量值,掩盖了这种关键的细微差别,并导致关于弃权能力的冲突结果。
-
InferScale系统通过可重用的KV状态优化LLM服务
研究人员开发了InferScale,一个新颖的GPU原生系统,旨在增强个性化大型语言模型(LLM)的服务。InferScale通过利用可重用的KV状态来解决内存系统中重复的提示预填充问题,从而在检索到的内存大小增加时减少首次令牌生成时间(TTFT)。该系统与vLLM集成,无需修改引擎或对模型进行微调,并在各种开源模型上展示了TTFT和吞吐量的显著改进。
-
AI Agent内存系统因不准确的基准测试面临审查
对包括Mem0、Zep Ai和Letta在内的AI Agent内存系统的最新分析显示,在基准测试的可复现性和准确性方面存在严重问题。最受欢迎的GitHub内存层Letta通过使用简单的文本文件和grep命令获得了高分,绕过了复杂的内存机制。独立测试表明,当前的内存系统在准确回忆更新的事实时存在困难,其中一个系统在20次测试中有19次失败。此外,该领域领先的基准测试被发现存在算术错误,导致分数虚高,这凸显了Agent内存领域缺乏独立验证。
-
LLM智能体新基准和记忆架构发布
研究人员推出了MemHop,这是一个旨在评估大型语言模型(LLM)智能体多跳推理能力的新基准。该基准包含在10个社交网络场景中的1000个带证据标注的问题,测试1到5跳的深度回忆能力。与MemHop一同提出的还有Profile-Graph Memory (ProGraph),一种新颖的记忆架构,它结合了用于遍历叙事档案中实体名称的档案扩展和用于捕获日期、数量等精确细节的压缩残差。ProGraph在MemHop和长上下文建模(LoCoM…
-
研究人员8个月200次实验后未能构建LLM替代品
一位研究人员记录了一个为期八个月的项目,试图构建一个无需重新训练大型语言模型即可积累经验并改进行为的系统。该项目进行了大约200次失败的实验,最终在保留可转移的因果转换方面遇到了瓶颈——即识别并将过去的情况、行动和后果应用于新情况的能力。虽然一些状态突变机制和特定数据类型的确定性保护措施得以保留,但创建记忆和权重之间能够改变未来行为而无需修改代码的知识基底的核心目标仍然难以实现。
-
新框架通过用户感知检索增强AI对话记忆
研究人员开发了一个名为Profile-guided Personalized Retrieval Optimization (PPRO) 的新框架,以增强对话AI代理的长期记忆检索能力。该系统从对话历史中创建用户档案,以个性化记忆检索,并考虑用户属性和偏好。PPRO还包括一个使用Group Relative Policy Optimization训练的查询重写器,利用检索和答案质量的反馈来提高性能。在LoCoMo和LongMemEva…
-
Memora 记忆系统在抽象和具体性之间取得平衡,适用于 AI 代理 · 跟踪 2 个来源
研究人员推出了一种新颖的记忆表示系统 Memora,旨在平衡 AI 代理的抽象和具体性。该系统通过抽象索引具体数据的核心概念来组织信息,同时使用线索锚点来扩展跨不同记忆方面的检索。Memora 在理论上将标准的检索增强生成 (RAG) 和知识图谱 (KG) 记忆系统统一为特例。在实践中,Memora 在 LoCoMo 和 LongMemEval 基准测试上达到了新的最先进水平,在记忆规模扩大时显示出检索相关性和推理效率的提高。