PulseAugur
实时 19:14:48
实体 WebWalkerQA

WebWalkerQA

PulseAugur coverage of WebWalkerQA — every cluster mentioning WebWalkerQA across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. TOOL · CL_255981 ·

    7B模型ZGCM-1优先考虑工具使用和大型上下文,而非记忆

    来自中关村学院和中关村人工智能研究院的研究人员开发了ZGCM-1,一个拥有73.9亿参数的模型,该模型优先考虑工具使用和大型上下文窗口,而不是记忆海量数据集。这种方法允许较小的模型通过按需检索信息来执行复杂任务,而不是试图将其内部存储。ZGCM-1利用混合注意力机制和FP8 Muon优化器,在其256K上下文窗口内实现高效处理,在搜索和数学基准测试中表现出色,可与更大模型相媲美。

  2. TOOL · CL_206031 ·

    新框架AutoMem可自动搜索LLM代理的内存架构

    研究人员开发了AutoMem,一个旨在自动发现大型语言模型(LLM)代理最佳内存架构的新型框架。该文本梯度递归自改进系统导航编码器、存储、检索和管理模块的搜索空间,使内存设计适应特定任务。在GAIA和WebWalkerQA等基准测试上的实验表明,AutoMem能够持续识别出优于人类设计的基线内存架构,从而提高准确性并降低代币成本。

  3. TOOL · CL_180464 ·

    新的深度研究预训练框架增强了AI代理的训练

    研究人员开发了深度研究预训练(DRP)框架,这是一个旨在改进深度研究代理训练的离线框架。DRP从现有证据结构(如引文图谱和超链接)中提取监督信号,将其转换为搜索-打开-写入轨迹。该方法教会模型在不需要实时检索环境的情况下有效地搜索、检查文档和综合证据。在学术引文图谱(DRP-Paper)和Wikipedia超链接(DRP-Web)上进行测试时,DRP的表现始终优于未经训练的模型,即使在数据量较少的情况下也能取得更好的结果,并在下游代理…

  4. TOOL · CL_84877 ·

    新型PRInTS模型增强AI代理的长时信息检索能力

    研究人员开发了PRInTS,一种新的生成式奖励模型,旨在提高AI代理在长时间内检索信息的能力。与之前对短期任务提供二元判断的模型不同,PRInTS为每个步骤提供密集的多维度评分,考虑工具解释和输出信息量等因素。它还将长上下文压缩成摘要,同时保留评估所需的重要信息。在FRAMES和GAIA等基准测试上的实验表明,PRInTS显著增强了各种代理的信息检索能力,甚至优于更大、更前沿的模型。