WebWalkerQA
PulseAugur coverage of WebWalkerQA — every cluster mentioning WebWalkerQA across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
7B模型ZGCM-1优先考虑工具使用和大型上下文,而非记忆
来自中关村学院和中关村人工智能研究院的研究人员开发了ZGCM-1,一个拥有73.9亿参数的模型,该模型优先考虑工具使用和大型上下文窗口,而不是记忆海量数据集。这种方法允许较小的模型通过按需检索信息来执行复杂任务,而不是试图将其内部存储。ZGCM-1利用混合注意力机制和FP8 Muon优化器,在其256K上下文窗口内实现高效处理,在搜索和数学基准测试中表现出色,可与更大模型相媲美。
-
新框架AutoMem可自动搜索LLM代理的内存架构
研究人员开发了AutoMem,一个旨在自动发现大型语言模型(LLM)代理最佳内存架构的新型框架。该文本梯度递归自改进系统导航编码器、存储、检索和管理模块的搜索空间,使内存设计适应特定任务。在GAIA和WebWalkerQA等基准测试上的实验表明,AutoMem能够持续识别出优于人类设计的基线内存架构,从而提高准确性并降低代币成本。
-
新的深度研究预训练框架增强了AI代理的训练
研究人员开发了深度研究预训练(DRP)框架,这是一个旨在改进深度研究代理训练的离线框架。DRP从现有证据结构(如引文图谱和超链接)中提取监督信号,将其转换为搜索-打开-写入轨迹。该方法教会模型在不需要实时检索环境的情况下有效地搜索、检查文档和综合证据。在学术引文图谱(DRP-Paper)和Wikipedia超链接(DRP-Web)上进行测试时,DRP的表现始终优于未经训练的模型,即使在数据量较少的情况下也能取得更好的结果,并在下游代理…
-
新型PRInTS模型增强AI代理的长时信息检索能力
研究人员开发了PRInTS,一种新的生成式奖励模型,旨在提高AI代理在长时间内检索信息的能力。与之前对短期任务提供二元判断的模型不同,PRInTS为每个步骤提供密集的多维度评分,考虑工具解释和输出信息量等因素。它还将长上下文压缩成摘要,同时保留评估所需的重要信息。在FRAMES和GAIA等基准测试上的实验表明,PRInTS显著增强了各种代理的信息检索能力,甚至优于更大、更前沿的模型。