PulseAugur
实时 08:39:37
English(EN) InteractComp: Evaluating Search Agents With Ambiguous Queries

新基准显示搜索代理在模糊查询上表现不佳

一个名为 InteractComp 的新基准已被开发出来,用于评估语言代理在网络搜索中处理模糊查询的能力。该基准包含 210 个专家精心策划的问题,显示当前代理在处理模糊性方面存在显著困难,表现最好的模型准确率仅为 13.73%。研究表明,让代理能够互动并提出澄清性问题可以极大地提高性能,这凸显了尽管在通用搜索性能方面取得了进步,但它们当前能力中存在一个关键的差距。 AI

影响 凸显了当前 AI 搜索代理能力中的一个关键差距,表明需要改进交互和消歧机制。

排序理由 该集群包含一篇介绍用于评估 AI 代理的新基准的研究论文。

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新基准显示搜索代理在模糊查询上表现不佳

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Mingyi Deng, Lijun Huang, Yani Fan, Fanqi Kong, Jiayi Zhang, Fashen Ren, Jinyi Bai, Fuzhen Yang, Dayi Miao, Zhaoyang Yu, Yifan Wu, Yanfei Zhang, Fengwei Teng, Yingjia Wan, Song Hu, Yude Li, Xin Jin, Conghao Hu, Haoyu Li, Qirui Fu, Tai Zhong, Xinyu Wang, … ·

    InteractComp: Evaluating Search Agents With Ambiguous Queries

    arXiv:2510.24668v2 Announce Type: replace Abstract: Language agents have demonstrated remarkable potential in web search and information retrieval. However, many search-agent benchmarks assume that user queries are complete and unambiguous. This assumption leaves under-tested a p…