PulseAugur
实时 11:01:56
English(EN) Do LLMs Know What to Ask and When? Evaluating Multi-Turn Information Seeking

新的研究套件MT-InfoSeek评估大型语言模型在询问缺失信息方面的能力

一篇新研究论文介绍了一个新颖的评估套件MT-InfoSeek,旨在评估大型语言模型(LLMs)在面对不明确的用户查询时,识别和请求缺失信息的能力。研究发现,虽然大型语言模型能够认识到需要更多数据,但它们总是低估所需数据的数量,并且常常无法获取足够的信息来确定唯一答案。此外,模型询问信息的顺序会显著影响准确性,即使最终收集了所有必要的数据。这项研究强调,多轮信息检索能力与生成答案的能力不同,并且目前的LLM评估未能充分衡量这些能力。 AI

影响 突出了LLM信息检索能力的局限性,表明当前的评估可能无法捕捉真正的多轮推理。

排序理由 介绍LLM新评估套件的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的研究套件MT-InfoSeek评估大型语言模型在询问缺失信息方面的能力

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Yepeng Huang, Jiawen Zhang, Michelle Dai, Xiaorui Su, Shanghua Gao, Zi Wang, Marinka Zitnik ·

    大型语言模型知道该问什么以及何时问吗?评估多轮信息检索

    arXiv:2608.14808v1 Announce Type: new Abstract: When a user question is underspecified, a capable model should recognize that its context is insufficient, identify the missing information, ask for it, and respond only once that information determines a unique answer. We formalize…