一项使用大语言模型对数据库表进行编目的实验表明,生成的描述虽然准确,但却降低了检索性能。该大语言模型描述了 1,245 个表,但这一过程导致“联系人”等常用术语的召回率显著下降。这是因为大语言模型生成的描述使用了模式中已有的词汇,增加了这些术语的文档频率。因此,依赖逆文档频率的 BM25 评分机制将这些常用术语视为功能词,从而削弱了它们的信号。此外,BM25 中的长度归一化会惩罚较长的文档,而这些文档通常是最核心的表,这进一步降低了检索准确性。 AI
影响 大语言模型生成的元数据会通过增加词频和影响评分机制来降低搜索性能。
排序理由 该条目描述了一个实验及其在大语言模型特定技术背景下的使用发现。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →