PulseAugur
实时 16:05:20
实体 Ragas

Ragas

PulseAugur coverage of Ragas — every cluster mentioning Ragas across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
10
90 天内 42
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 17
层级分布 · 90 天
主题
关系
情绪 · 30 天

8 天有情绪数据

最近 · 第 1/3 页 · 共 42 条
  1. TOOL · CL_206770 ·

    混合 RRF 检索修复了卡纳达语文学作品上的 RAG 故障

    一位开发者详细介绍了为扫描的卡纳达语小说构建检索增强生成(RAG)系统所面临的挑战,并强调检索而非语言模型是主要瓶颈。由于卡纳达语的黏着语性质以及文学文本的稀缺性,最初在 ChromaDB 中使用标准多语言嵌入的方法失败了,导致了不准确和幻觉般的响应。解决方案涉及一种结合了 BM25 和密集嵌入以及倒数排名融合(Reciprocal Rank Fusion)的混合检索系统,以及用于精确页面查询的正则表达式路由器,显著提高了忠实度和上下文召回率。

  2. TOOL · CL_205979 ·

    RAGas框架优化以太坊智能合约的气体效率

    研究人员开发了RAGas,一个旨在优化以太坊智能合约中气体使用量的新型框架。该系统利用检索增强生成(RAG)和大型语言模型来识别并自动纠正导致高执行费用的代码效率低下问题。实验表明,RAGas可以在保持功能等效性的同时,将气体消耗量减少高达11%,解决了持续利用不断变化的 গ্যাস使用模式的不足之处。

  3. TOOL · CL_205410 ·

    研讨会将涵盖使用开源模型的生产RAG和基准测试

    一个专注于使用开源模型进行生产检索增强生成(RAG)的研讨会将于8月29日举行。该活动由人工智能顾问Ben Auffarth主持,将涵盖混合检索方法、重排技术以及使用RAGAS进行评估。参与者将学习如何构建护栏以及对开源模型部署的成本和性能进行基准测试。

  4. TOOL · CL_204828 ·

    学生构建 RAG 评估工具,以捕捉 RAGAS 遗漏的 LLM 故障

    一名一年级 AI 学生开发了 RAG Sentinel,一个用于评估检索增强生成 (RAG) 系统的开源工具,以解决现有工具(如 RAGAS)的局限性。该工具专注于检索-生成对齐、引用准确性、上下文矛盾和置信度校准等关键指标,而 RAGAS 据称会遗漏这些指标。RAG Sentinel 还包括一个生产监控仪表板,并在六周内完成构建和部署,突显了构建生产系统而非简单聊天机器人的价值。

  5. COMMENTARY · CL_195201 ·

    LLM评估工具提供指标,但关键挑战依然存在

    对五个流行的LLM评估工具——Arize Phoenix、DeepEval、Future AGI、Langfuse和Ragas——的回顾表明,虽然它们提供了广泛的预构建指标,但这些指标仅占评估过程的20%的简单部分。这些工具在很大程度上仍未解决的关键挑战是选择与特定故障模式准确对齐的指标以及为结果建立误差范围。作者认为,LLM评估的真正成功取决于理解系统的独特故障分类法并据此选择或创建自定义指标,而不是仅仅依赖提供的商品化指标目录。

  6. TOOL · CL_191854 ·

    LLM 治理引擎添加 RAGAS 可靠性评分以对抗幻觉

    一位开发者通过集成 RAGAS 可靠性评分增强了 LLM 治理引擎,该评分衡量模型响应与所提供上下文的匹配程度。此新功能是对现有 PII 防火墙的补充,创建了一个两阶段的执行流程。该系统现在在查询到达模型之前检查敏感数据,并在之后根据源材料验证模型输出的准确性。此举旨在对抗模型自信地陈述上下文中不存在的信息的幻觉现象。

  7. SIGNIFICANT · CL_190633 ·

    随着市场蓬勃发展,LLM 可观测性平台在高级功能上出现分化

    LLM 可观测性和评估平台市场正在迅速扩张,预计到 2030 年将达到 92.6 亿美元。平台正朝着 AI 原生工具、开源评估库、AI 网关和 APM 扩展等方向多元化发展,并且越来越多地采用 OpenTelemetry 标准以实现互操作性。Langfuse、Helicone、Opik 和 MLflow 等领先平台之间的关键差异化因素在于其高级功能,例如自动跟踪评分、复杂的速率限制规则、用于主题和 PII 检测的集成防护栏,以及具有差…

  8. RESEARCH · CL_183200 ·

    新研究评估用于科学问答的RAG流程 · 已追踪2个来源

    研究人员推出了SciRet,一项使用CORD-19数据集研究用于科学问答的检索增强生成(RAG)的研究。该研究评估了一个固定的RAG流程在三种不同语料库规模下的表现,发现混合检索方法比仅稀疏或仅密集的方法更具鲁棒性。然而,在MS MARCO上训练的交叉编码器重排序器在科学语料库上降低了精度,表明可能存在领域不匹配问题。使用RAGAS测量的生成答案的忠实度随着语料库规模的增大而提高。

  9. TOOL · CL_180041 ·

    OpenAI收购Promptfoo引发对LLM评估独立性的辩论

    OpenAI对Promptfoo的收购促使人们重新评估LLM评估工具,突显了对供应商依赖和成本的担忧。作者提出了一种替代方法,使用自定义训练的分类器,结合Sentence Transformers和逻辑回归,该方法提供离线执行、供应商独立性以及比基于LLM的评分方法更快的评估速度。这种方法需要标记的训练数据,但为CI/CD管道提供了一种经济高效且可控的解决方案。

  10. TOOL · CL_172171 ·

    LLM 评估指标在检测 AI 虚假信息方面存在显著差异

    一项近期实验比较了两种流行的 LLM 作为评委(LLM-as-judge)的忠实度指标 Ragas 和 DeepEval,揭示了它们在检测虚假信息方面的显著差异。尽管两种指标都应用于使用 GPT-4o 的相同虚假 RAG 系统输出,但 Ragas 将该虚假信息评为 0.0,而 DeepEval 则一致将其评为 1.0,甚至称赞该输出准确无误。实验强调,LLM 评委擅长检测意义的颠倒,但在遗漏方面却表现不佳,例如遗漏关键信息(如药物剂量…

  11. COMMENTARY · CL_161426 ·

    AI评估差距被戏称为“西瓜效应”,因实际使用效果不及测试

    一位AI开发者发现,其AI导师ARIA在实际使用中的表现与其在测试中的表现存在显著差距,这种现象被他称为“西瓜效应”。虽然DeepEval和Ragas等标准评估指标显示ARIA在忠实度和苏格拉底式合规性等方面的得分超过94%,但实际用户互动显示其苏格拉底式合规率仅为22.2%。这种差异的出现是因为该AI针对可预测的测试用例进行了优化,但未能应对那些挑战其核心行为契约的对抗性或意外用户输入。

  12. TOOL · CL_157973 ·

    新工具'muteval'测试LLM评估的鲁棒性

    Ashwin Ugale开发了一个名为muteval的新工具,该工具借鉴了软件工程中的变异测试,用于评估大型语言模型(LLM)评估套件的鲁棒性。Muteval通过修改提示、删除文档或替换模型来故意降低系统性能,然后重新运行现有的评估指标,以识别覆盖范围的不足。对open-rag-eval的早期测试表明,引用检查未能发现一个关键的失败案例,即在缺乏上下文的情况下,模型被允许编造答案,这凸显了对更全面的评估策略的需求。

  13. COMMENTARY · CL_157974 ·

    LLM法官引入系统性偏见,扭曲评估结果

    使用大型语言模型(LLM)作为评判其他LLM输出的法官会引入系统性偏见,例如位置、冗长和自我偏好,这些偏见无法像随机噪声一样被平均掉。这些偏见会扭曲评估结果,导致对模型性能的评估不准确。虽然GPT-4等工具在超过80%的情况下可以与人类偏好达成一致,但其固有的偏见意味着报告的分数可能反映的是法官的特性,而不是模型的真实能力。开发人员在解释评估指标时必须考虑到这些系统性错误,以避免错误地归因性能特征。

  14. TOOL · CL_156032 ·

    开发者将单元测试原则应用于AI发布以进行质量控制

    一位开发者为其检索增强生成(RAG)助手项目Atlas实施了“评估门控”发布流程,将质量和成本指标视为代码的单元测试。该系统会阻止合并请求,如果它们在忠实度、引用准确性或成本方面出现回归,从而确保更改是数据驱动的,而不是基于主观评估。开发者提倡在CI作业中从基本的黄金问题和对抗性提示开始,并强调将成熟的软件工程测试原则应用于AI系统对于维护质量和可辩护的决策至关重要。

  15. TOOL · CL_155506 ·

    LLM-as-judge CI门禁产生意外成本;确定性替代方案提供节省

    一位工程师发现,使用LLM-as-judge指标进行CI/CD评估门禁会产生显著的持续成本。这些评估拉取请求的门禁,由于需要对OpenAI等模型进行重复的API调用,可能会产生巨额账单。该工程师发现,像Promptfoo、MLflow和Future AGI这样的确定性评估框架,可以在不进行模型调用的情况下执行类似的门禁功能,因此每个拉取请求的成本为零。这种方法避免了对外部API定价、延迟和速率限制的依赖,为CI/CD质量门禁提供了更具…

  16. TOOL · CL_150490 ·

    构建生产级 LLM 评估流水线:从感觉走向指标 · 跟踪 8 个来源

    这一系列文章详细介绍了为大型语言模型(LLM)构建生产级评估流水线的过程,超越了主观的“感觉检查”,转而实施自动化指标。作者强调了领域特定裁判、CI/CD 集成的速度、回归检测以及健壮的黄金数据集管理的需求。他们提出了一种涉及测试用例、待测 LLM、裁判集合和用于回归检测的指标的架构,并提供了使用 GPT-4o mini 等模型构建自定义 LLM 裁判的示例。

  17. TOOL · CL_150360 ·

    AI 评估系列:从业务目标到系统健康的指标设计

    为 AI 系统设计有效的指标对于确保其实现业务价值至关重要。一个三层框架(L1:业务成果,L2:输出质量,L3:系统健康)有助于组织这些指标,其中 L3 的失败会影响 L2,进而影响 L1。文档问答 (RAG)、代码生成、文档摘要和 Agent 任务完成等特定场景需要定制化的指标,其中 RAG 的上下文召回率和代码生成的测试通过率等关键指标尤为重要。

  18. RESEARCH · CL_147796 ·

    新的 RAG QA 管道提高了前沿模型的引用完整性

    本文详细介绍了 DS@GT ARC 参加 CLEF 2026 LongEval 任务 4 的情况,重点关注检索增强生成 (RAG) 系统。研究强调了标准的自然语言评估指标与 RAG QA 中至关重要的引用完整性方面之间存在差异。通过采用带有纠正性 RAG (CRAG) 和 CiteFix 的纠正性管道,研究发现,虽然前沿模型在答案相关性和流畅性方面表现出色,但它们并不总是严格遵守引用的来源。所提出的管道强制要求生成的声明严格推断自引用…

  19. RESEARCH · CL_145662 ·

    人工智能辅导系统LEA在真实课堂中进行测试,显示出跨课程可扩展性挑战

    一篇新论文详细介绍了学习参与助手 (LEA),这是一个结合了检索增强生成和知识组件模型的人工智能辅导系统。这项研究通过在真实课堂环境中部署LEA并对八名学生进行测试,并评估其在三门不同课程中的可扩展性,从而扩展了先前的工作。虽然LEA的核心编排保持不变,但研究发现仅凭合成评估无法完全预测实际性能,并且随着课程距离的增加,忠实度指标有所下降,这表明需要进一步研究组件课程无关性。

  20. TOOL · CL_141011 ·

    RAG 评估框架 RAGAs 提升 AI 助手可靠性

    本文详细介绍了 RAGAs 的实现,这是一个用于检索增强生成 (RAG) 系统的评估框架,旨在解决幻觉和答案质量差等问题。它强调了三个关键指标:忠实度,确保生成答案得到检索上下文的支持;上下文召回率,验证是否检索到相关信息;以及答案相关性,惩罚过于冗长或无用的响应。该框架使用 LLM 作为裁判的方法,并使用 GPT-4o mini 等模型进行经济高效的评估,显著提高了 AI 助手的可靠性。