PulseAugur
实时 06:57:45

新基准测试大型语言模型澄清搜索查询的能力

研究人员开发了一个名为Clarify-Then-Search的新基准,用于评估大型语言模型(LLMs)在改进深度搜索能力方面的有效性。该基准基于真实查询数据构建,评估了LLM生成的澄清问题如何通过恢复时间、地点或范围等缺失的查询约束来提高搜索效用。系统表明,澄清通常能改善搜索结果,其中GPT-5.2在单次澄清步骤中表现最佳,而ERNIE-4.5-Turbo-128K在多次澄清问题方面表现出色。识别出的一个常见失败模式是过度询问无法回答的特定区域问题。 AI

影响 该基准可以通过更好地评估LLM驱动的澄清策略来推动搜索引擎准确性和用户体验的改进。

排序理由 该集群描述了一个用于评估LLM在特定任务(深度搜索澄清)中性能的新学术基准。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新基准测试大型语言模型澄清搜索查询的能力

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Deqiang Huang, Jingbo Zhou, Xinjiang Lu, Tong Xu, Hua Wu, Enhong Chen ·

    Clarify-Then-Search:面向端到端片段恢复的深度搜索澄清基准

    arXiv:2608.20357v1 Announce Type: cross Abstract: Deep search is brittle on underspecified user queries: missing constraints such as time, location, scope, or definitions can lead to retrieval drift and incomplete answers. We introduce Clarify-Then-Search, a benchmark for evaluat…