PulseAugur
中
实时 13:54:26
实体 Search Agents

Search Agents

PulseAugur coverage of Search Agents — every cluster mentioning Search Agents across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
7
90 天内 7
发布 · 30天
0
90 天内 0
论文 · 30天
6
90 天内 6
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 7 条
  1. TOOL · CL_286847 ·

    新框架通过中间奖励改进LLM搜索代理训练

    研究人员开发了一个新的训练框架,以提高大型语言模型(LLM)使用的搜索代理的效率。该框架通过在最终结果奖励之外,纳入来自检索步骤的中间监督信号,来解决强化学习中的信用分配挑战。实验表明,这种方法提高了代理的整体性能,并突显了奖励设计和信用分配在训练有效的搜索代理中的重要性。

  2. TOOL · CL_231527 ·

    新方法改进搜索代理的强化学习

    研究人员开发了一种用于训练搜索任务中使用的强化学习代理的新方法。这种方法称为通过事实效用估计实现密集过程监督,解决了在推理过程的中间步骤中分配信用的挑战。通过将推理建模为离散证据事实的累积、对语义等效事实进行聚类以及推断其效用,该方法生成密集的步骤级奖励来指导训练。在问答基准上的实验表明,该技术持续优于现有基线,在多跳问答场景中比仅结果奖励的训练有显著改进。

  3. TOOL · CL_123387 ·

    新的基准DiscoBench评估LLM搜索代理的澄清能力

    引入了一个名为DiscoBench的新基准,用于评估搜索代理(特别是由LLM驱动的代理)处理模糊查询的能力。DiscoBench评估这些代理识别模糊性、提出澄清性问题以及通过用户交互恢复正确推理路径的有效性。实验表明,代理经常在模糊性检测方面遇到困难,并且重复搜索可能不如寻求澄清甚至猜测有效,这突显了当前代理在交互式问题解决能力方面的差距。

  4. TOOL · CL_103195 ·

    Google 推出 AI 驱动的搜索代理以跟踪信息

    Google 正在开始在其 AI Mode 中推出“搜索代理”,特别是针对 AI Ultra 订阅用户。这些代理旨在主动为用户跟踪和管理信息。该概念最初是在 Google 的 I/O 2026 大会上公布的。

  5. TOOL · CL_86749 ·

    新基准评估搜索代理在日常任务中的表现

    研究人员开发了DailyReport,这是一个旨在评估搜索代理(SAs)在现实的、开放式的日常搜索任务中的能力的新基准。与之前专注于特定场景的基准不同,DailyReport包含150个任务和3500多个评分标准,反映了当前用户的用户信息需求。该基准通过跨不同维度的级联评分标准来评估任务,提供可解释的分数,并且对17个代理系统的初步测试表明,当前的SAs尚未达到用户的期望。

  6. TOOL · CL_104629 ·

    新的DailyReport基准评估搜索代理在实际任务中的表现

    研究人员推出了一款名为DailyReport的新型开放式基准,旨在评估搜索代理在日常信息检索任务中的能力。该基准包含150个任务和3,546个评分标准,旨在提供比以往的专业基准更细致、更易于理解的评估。使用DailyReport对17种不同代理系统进行的初步结果表明,当前的搜索代理尚未达到用户期望。

  7. TOOL · CL_56282 ·

    新的 CalibAdv 方法增强了搜索代理的训练稳定性

    一种名为 CalibAdv 的新方法已被开发出来,用于提高搜索代理的训练稳定性和性能,特别是那些使用组相对策略优化 (GRPO) 的代理。该方法解决了中间正确步骤因最终答案错误而受到惩罚以及训练可能变得不稳定导致性能下降的问题。CalibAdv 通过微调优势的分配来实现这一点,根据中间步骤的正确性来缩小过度的负面优势,并重新平衡正面和负面优势,以更稳定地模拟奖励和惩罚。