Ragas
PulseAugur coverage of Ragas — every cluster mentioning Ragas across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
RAG系统评估因指标不稳和评判者差异而证明不可靠
一位研究人员在调查检索增强生成(RAG)系统的最佳文本块数量时发现,评估指标极不稳定。多次运行相同的配置所产生的结果差异,比配置之间的差异还要大,使得参数扫描没有结论。此外,更换评估模型(评判者)显著影响了得分,甚至比更改top-k参数的影响更大。研究人员得出结论,如果不指定评判者模型,RAGAS得分是不可靠的,并且在样本量小和并列率高的情况下难以实现统计显著性。
-
LLM聊天机器人测试清单强调基于属性的断言和OWASP安全
测试LLM聊天机器人和RAG应用需要从传统的确定性检查转向基于属性的断言,重点关注所需事实、拒绝范围外查询以及遵守格式。开发人员应单独测试检索和生成步骤,使用Ragas等工具进行上下文召回和忠实度指标。安全测试应纳入LLM应用OWASP Top 10,解决提示注入、敏感数据泄露和系统提示泄露问题,同时验证是否符合AI Act的透明度要求。
-
大型语言模型是智能,完整技术栈才是AI应用中的产品
大型语言模型本身并非一个完整的AI产品,而是更大系统中的智能层。构建生产就绪的AI应用程序需要一个完整技术栈,包括数据提取工具、嵌入模型、向量数据库、RAG和编排框架、评估工具以及用于身份验证、监控和成本控制等方面的生产级基础设施。从原始数据到评估答案的复杂数据流涉及多个阶段,远不止简单的用户与大型语言模型的交互。
-
新研究质疑LLM事实性评估方法,倾向于RAGAS
一篇新论文探讨了用于评估大型语言模型事实性之方法的可靠性。研究人员开发了一个元评估框架,通过扰动标准答案来测试现有指标在多大程度上能捕捉真实性的变化。研究发现,基于管道的指标(如RAGAS的事实正确性指标)比LLM作为裁判的方法更能有效地追踪退化情况。作者还提出了一种新的、具有成本效益的事实正确性指标变体。
-
开源LLM在ESG报告任务中的表现评估 · 跟踪到1个来源
一篇新论文评估了七个开源大语言模型(LLMs)在环境、社会和治理(ESG)领域内进行检索增强生成(RAG)任务的性能。该研究使用了来自欧盟上市公司(EU-listed companies)的498份真实ESG报告和100对合成问答对来评估GLM 4.7 Flash、Nemotron-3-nano:4b和Qwen3:4b-instruct等模型。虽然模型的检索性能普遍较强,但在忠实度和事实准确性等生成指标上存在显著差异,表明需要进行领域特定的微调。
-
研究发现RAG评估套件会忽略提示词回归问题
最近的一项分析探讨了检索增强生成(RAG)评估套件在检测提示词回归方面的有效性。研究发现,像忠实度(faithfulness)和答案相关性(answer-relevancy)等标准指标未能识别出常见的提示词修改,例如颠倒指令或删除提示词的一部分。作者建议,在答案不在上下文中时增加一个特定的弃答检查(abstaining check),并加入一个无法回答的情况,可以显著提高此类回归问题的检测率。
-
发布工程领域排名前五的LLM评估框架排名
最近的一项分析强调,Promptfoo是发布工程领域领先的LLM评估框架,尤其因其能够阻止构建失败测试的CI/CD集成而备受关注。DeepEval推荐用于基于Python的测试套件,并提供与pytest的无缝集成。LangSmith因其强大的托管可追溯性和实验历史而受到关注,适合优先考虑详细记录的团队。OpenAI Evals因其可重用的评估规范而受到认可,而Ragas则被确定为评估检索增强生成(RAG)质量的专业工具。评估标准侧重于…
-
混合 RRF 检索修复了卡纳达语文学作品上的 RAG 故障
一位开发者详细介绍了为扫描的卡纳达语小说构建检索增强生成(RAG)系统所面临的挑战,并强调检索而非语言模型是主要瓶颈。由于卡纳达语的黏着语性质以及文学文本的稀缺性,最初在 ChromaDB 中使用标准多语言嵌入的方法失败了,导致了不准确和幻觉般的响应。解决方案涉及一种结合了 BM25 和密集嵌入以及倒数排名融合(Reciprocal Rank Fusion)的混合检索系统,以及用于精确页面查询的正则表达式路由器,显著提高了忠实度和上下文召回率。
-
RAGas框架优化以太坊智能合约的气体效率
研究人员开发了RAGas,一个旨在优化以太坊智能合约中气体使用量的新型框架。该系统利用检索增强生成(RAG)和大型语言模型来识别并自动纠正导致高执行费用的代码效率低下问题。实验表明,RAGas可以在保持功能等效性的同时,将气体消耗量减少高达11%,解决了持续利用不断变化的 গ্যাস使用模式的不足之处。
-
研讨会将涵盖使用开源模型的生产RAG和基准测试
一个专注于使用开源模型进行生产检索增强生成(RAG)的研讨会将于8月29日举行。该活动由人工智能顾问Ben Auffarth主持,将涵盖混合检索方法、重排技术以及使用RAGAS进行评估。参与者将学习如何构建护栏以及对开源模型部署的成本和性能进行基准测试。
-
学生构建 RAG 评估工具,以捕捉 RAGAS 遗漏的 LLM 故障
一名一年级 AI 学生开发了 RAG Sentinel,一个用于评估检索增强生成 (RAG) 系统的开源工具,以解决现有工具(如 RAGAS)的局限性。该工具专注于检索-生成对齐、引用准确性、上下文矛盾和置信度校准等关键指标,而 RAGAS 据称会遗漏这些指标。RAG Sentinel 还包括一个生产监控仪表板,并在六周内完成构建和部署,突显了构建生产系统而非简单聊天机器人的价值。
-
LLM评估工具提供指标,但关键挑战依然存在
对五个流行的LLM评估工具——Arize Phoenix、DeepEval、Future AGI、Langfuse和Ragas——的回顾表明,虽然它们提供了广泛的预构建指标,但这些指标仅占评估过程的20%的简单部分。这些工具在很大程度上仍未解决的关键挑战是选择与特定故障模式准确对齐的指标以及为结果建立误差范围。作者认为,LLM评估的真正成功取决于理解系统的独特故障分类法并据此选择或创建自定义指标,而不是仅仅依赖提供的商品化指标目录。
-
LLM 治理引擎添加 RAGAS 可靠性评分以对抗幻觉
一位开发者通过集成 RAGAS 可靠性评分增强了 LLM 治理引擎,该评分衡量模型响应与所提供上下文的匹配程度。此新功能是对现有 PII 防火墙的补充,创建了一个两阶段的执行流程。该系统现在在查询到达模型之前检查敏感数据,并在之后根据源材料验证模型输出的准确性。此举旨在对抗模型自信地陈述上下文中不存在的信息的幻觉现象。
-
随着市场蓬勃发展,LLM 可观测性平台在高级功能上出现分化
LLM 可观测性和评估平台市场正在迅速扩张,预计到 2030 年将达到 92.6 亿美元。平台正朝着 AI 原生工具、开源评估库、AI 网关和 APM 扩展等方向多元化发展,并且越来越多地采用 OpenTelemetry 标准以实现互操作性。Langfuse、Helicone、Opik 和 MLflow 等领先平台之间的关键差异化因素在于其高级功能,例如自动跟踪评分、复杂的速率限制规则、用于主题和 PII 检测的集成防护栏,以及具有差…
-
新研究评估用于科学问答的RAG流程 · 已追踪2个来源
研究人员推出了SciRet,一项使用CORD-19数据集研究用于科学问答的检索增强生成(RAG)的研究。该研究评估了一个固定的RAG流程在三种不同语料库规模下的表现,发现混合检索方法比仅稀疏或仅密集的方法更具鲁棒性。然而,在MS MARCO上训练的交叉编码器重排序器在科学语料库上降低了精度,表明可能存在领域不匹配问题。使用RAGAS测量的生成答案的忠实度随着语料库规模的增大而提高。
-
OpenAI收购Promptfoo引发对LLM评估独立性的辩论
OpenAI对Promptfoo的收购促使人们重新评估LLM评估工具,突显了对供应商依赖和成本的担忧。作者提出了一种替代方法,使用自定义训练的分类器,结合Sentence Transformers和逻辑回归,该方法提供离线执行、供应商独立性以及比基于LLM的评分方法更快的评估速度。这种方法需要标记的训练数据,但为CI/CD管道提供了一种经济高效且可控的解决方案。
-
LLM 评估指标在检测 AI 虚假信息方面存在显著差异
一项近期实验比较了两种流行的 LLM 作为评委(LLM-as-judge)的忠实度指标 Ragas 和 DeepEval,揭示了它们在检测虚假信息方面的显著差异。尽管两种指标都应用于使用 GPT-4o 的相同虚假 RAG 系统输出,但 Ragas 将该虚假信息评为 0.0,而 DeepEval 则一致将其评为 1.0,甚至称赞该输出准确无误。实验强调,LLM 评委擅长检测意义的颠倒,但在遗漏方面却表现不佳,例如遗漏关键信息(如药物剂量…
-
AI评估差距被戏称为“西瓜效应”,因实际使用效果不及测试
一位AI开发者发现,其AI导师ARIA在实际使用中的表现与其在测试中的表现存在显著差距,这种现象被他称为“西瓜效应”。虽然DeepEval和Ragas等标准评估指标显示ARIA在忠实度和苏格拉底式合规性等方面的得分超过94%,但实际用户互动显示其苏格拉底式合规率仅为22.2%。这种差异的出现是因为该AI针对可预测的测试用例进行了优化,但未能应对那些挑战其核心行为契约的对抗性或意外用户输入。
-
新工具'muteval'测试LLM评估的鲁棒性
Ashwin Ugale开发了一个名为muteval的新工具,该工具借鉴了软件工程中的变异测试,用于评估大型语言模型(LLM)评估套件的鲁棒性。Muteval通过修改提示、删除文档或替换模型来故意降低系统性能,然后重新运行现有的评估指标,以识别覆盖范围的不足。对open-rag-eval的早期测试表明,引用检查未能发现一个关键的失败案例,即在缺乏上下文的情况下,模型被允许编造答案,这凸显了对更全面的评估策略的需求。
-
LLM法官引入系统性偏见,扭曲评估结果
使用大型语言模型(LLM)作为评判其他LLM输出的法官会引入系统性偏见,例如位置、冗长和自我偏好,这些偏见无法像随机噪声一样被平均掉。这些偏见会扭曲评估结果,导致对模型性能的评估不准确。虽然GPT-4等工具在超过80%的情况下可以与人类偏好达成一致,但其固有的偏见意味着报告的分数可能反映的是法官的特性,而不是模型的真实能力。开发人员在解释评估指标时必须考虑到这些系统性错误,以避免错误地归因性能特征。