PulseAugur
实时 19:32:21
实体 Search Agents

Search Agents

PulseAugur coverage of Search Agents — every cluster mentioning Search Agents across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 4
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 5 条
  1. TOOL · CL_123387 ·

    新的基准DiscoBench评估LLM搜索代理的澄清能力

    引入了一个名为DiscoBench的新基准,用于评估搜索代理(特别是由LLM驱动的代理)处理模糊查询的能力。DiscoBench评估这些代理识别模糊性、提出澄清性问题以及通过用户交互恢复正确推理路径的有效性。实验表明,代理经常在模糊性检测方面遇到困难,并且重复搜索可能不如寻求澄清甚至猜测有效,这突显了当前代理在交互式问题解决能力方面的差距。

  2. TOOL · CL_103195 ·

    Google 推出 AI 驱动的搜索代理以跟踪信息

    Google 正在开始在其 AI Mode 中推出“搜索代理”,特别是针对 AI Ultra 订阅用户。这些代理旨在主动为用户跟踪和管理信息。该概念最初是在 Google 的 I/O 2026 大会上公布的。

  3. TOOL · CL_86749 ·

    新基准评估搜索代理在日常任务中的表现

    研究人员开发了DailyReport,这是一个旨在评估搜索代理(SAs)在现实的、开放式的日常搜索任务中的能力的新基准。与之前专注于特定场景的基准不同,DailyReport包含150个任务和3500多个评分标准,反映了当前用户的用户信息需求。该基准通过跨不同维度的级联评分标准来评估任务,提供可解释的分数,并且对17个代理系统的初步测试表明,当前的SAs尚未达到用户的期望。

  4. TOOL · CL_104629 ·

    新的DailyReport基准评估搜索代理在实际任务中的表现

    研究人员推出了一款名为DailyReport的新型开放式基准,旨在评估搜索代理在日常信息检索任务中的能力。该基准包含150个任务和3,546个评分标准,旨在提供比以往的专业基准更细致、更易于理解的评估。使用DailyReport对17种不同代理系统进行的初步结果表明,当前的搜索代理尚未达到用户期望。

  5. TOOL · CL_56282 ·

    新的 CalibAdv 方法增强了搜索代理的训练稳定性

    一种名为 CalibAdv 的新方法已被开发出来,用于提高搜索代理的训练稳定性和性能,特别是那些使用组相对策略优化 (GRPO) 的代理。该方法解决了中间正确步骤因最终答案错误而受到惩罚以及训练可能变得不稳定导致性能下降的问题。CalibAdv 通过微调优势的分配来实现这一点,根据中间步骤的正确性来缩小过度的负面优势,并重新平衡正面和负面优势,以更稳定地模拟奖励和惩罚。