PulseAugur
实时 20:04:55
English(EN) Your RAG Evals Are Lying to You. The Bug Is in the Retrieval, Not the LLM.

开发人员发现 RAG 评估因非确定性检索而存在缺陷

一位开发人员在使用检索增强生成(RAG)评估流程时遇到了问题,最初怀疑是语言模型性能下降。然而,经过仔细检查,问题被追溯到非确定性检索过程。近似最近邻(ANN)搜索中的平局处理、混合搜索方法中的并行处理以及数据摄取过程中分块的微小差异等因素,都会导致检索结果不一致。提出的解决方案是通过为评估实施确定性设置来解耦评估检索与生产检索,例如固定特定参数并为 ANN 搜索使用固定种子。 AI

影响 强调了评估 RAG 系统的关键问题,可能带来更可靠的性能指标和更好的模型调优。

排序理由 开发人员分享了关于常见 RAG 评估问题的技术事后分析和解决方案。

在 dev.to — LLM tag 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

开发人员发现 RAG 评估因非确定性检索而存在缺陷

报道来源 [1]

  1. dev.to — LLM tag TIER_1 English(EN) · MrClaw207 ·

    Your RAG Evals Are Lying to You. The Bug Is in the Retrieval, Not the LLM.

    <p>I rebuilt my RAG evaluation pipeline three times before I admitted the LLM was never the problem.</p> <p>The retrieval was. And the eval was measuring retrieval noise, not model quality. Every "the model is getting worse" conclusion I'd drawn over six weeks was actually the sa…