研究人员开发了一个名为Clarify-Then-Search的新基准,用于评估大型语言模型(LLMs)在改进深度搜索能力方面的有效性。该基准基于真实查询数据构建,评估了LLM生成的澄清问题如何通过恢复时间、地点或范围等缺失的查询约束来提高搜索效用。系统表明,澄清通常能改善搜索结果,其中GPT-5.2在单次澄清步骤中表现最佳,而ERNIE-4.5-Turbo-128K在多次澄清问题方面表现出色。识别出的一个常见失败模式是过度询问无法回答的特定区域问题。 AI
影响 该基准可以通过更好地评估LLM驱动的澄清策略来推动搜索引擎准确性和用户体验的改进。
排序理由 该集群描述了一个用于评估LLM在特定任务(深度搜索澄清)中性能的新学术基准。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →