DeepEval
PulseAugur coverage of DeepEval — every cluster mentioning DeepEval across labs, papers, and developer communities, ranked by signal.
- competes with Ragas 70%
- competes with Future AGI 70%
- competes with Langfuse 70%
- competes with Braintrust Ai 70%
- competes with Phoenix 70%
- competes with Arize Phoenix 70%
- competes with Confident AI 70%
- other Ragas 50%
- affiliated with Ragas 50%
- other Langfuse 50%
- used by Braintrust Ai 50%
- affiliated with Future AGI 50%
1 天有情绪数据
-
开发者评估论文阅读AI,绕过传统RAG方法
一位开发者详细介绍了评估其论文阅读AI项目Talkit的过程,该项目可以回答有关研究论文的问题。与典型的检索增强生成(RAG)系统不同,Talkit不使用向量存储,因为整篇论文都适合模型上下文窗口。评估包括针对“Attention”论文创建十个问题,使用DeepEval进行评分,并集成OpenTelemetry跟踪与Confident AI以监控答案质量。初步结果显示完全忠实,但揭示了其他问题,例如模型有时未能提供答案。
-
生成式AI测试确保AI输出的准确性、安全性和公平性
生成式AI测试对于确保AI输出的准确性、安全性和公平性至关重要,因为这些模型可能产生错误或有害内容。该过程包括定义测试用例、运行AI模型并将结果与既定标准进行比较,重点关注准确性、安全性、偏见和性能等关键领域。采用提示测试和人工审查等各种技术,并辅以DeepEval、TruLens和Promptfoo等工具,以在部署前识别和纠正问题。
-
研究发现RAG评估套件会忽略提示词回归问题
最近的一项分析探讨了检索增强生成(RAG)评估套件在检测提示词回归方面的有效性。研究发现,像忠实度(faithfulness)和答案相关性(answer-relevancy)等标准指标未能识别出常见的提示词修改,例如颠倒指令或删除提示词的一部分。作者建议,在答案不在上下文中时增加一个特定的弃答检查(abstaining check),并加入一个无法回答的情况,可以显著提高此类回归问题的检测率。
-
AWS Labs 代理评估示例使用相同的模型作为裁判和被评估对象
来自 AWS Labs 的一个名为 Agent-EvalKit 的示例评估套件被发现同时使用相同的 AI 模型来评估和评判 AI 代理。这种裁判模型与被评估模型相同的设置,是在该套件的一个 QA 示例中发现的。作者认为,这种缺乏独立裁判的做法,虽然可能出于成本和延迟的考虑,但并未明确披露,引发了对评估结果有效性的担忧。
-
LLM、RAG管道和AI代理的评估指南
本指南详细介绍了如何评估大型语言模型(LLM)、检索增强生成(RAG)管道和AI代理的性能。它涵盖了从初始设置到生产监控的整个过程,为开发人员提供了一种全面的方法。文章重点介绍了评估AI系统质量的工具和技术,确保其可靠性和有效性。
-
发布工程领域排名前五的LLM评估框架排名
最近的一项分析强调,Promptfoo是发布工程领域领先的LLM评估框架,尤其因其能够阻止构建失败测试的CI/CD集成而备受关注。DeepEval推荐用于基于Python的测试套件,并提供与pytest的无缝集成。LangSmith因其强大的托管可追溯性和实验历史而受到关注,适合优先考虑详细记录的团队。OpenAI Evals因其可重用的评估规范而受到认可,而Ragas则被确定为评估检索增强生成(RAG)质量的专业工具。评估标准侧重于…
-
LLM评估工具提供指标,但关键挑战依然存在
对五个流行的LLM评估工具——Arize Phoenix、DeepEval、Future AGI、Langfuse和Ragas——的回顾表明,虽然它们提供了广泛的预构建指标,但这些指标仅占评估过程的20%的简单部分。这些工具在很大程度上仍未解决的关键挑战是选择与特定故障模式准确对齐的指标以及为结果建立误差范围。作者认为,LLM评估的真正成功取决于理解系统的独特故障分类法并据此选择或创建自定义指标,而不是仅仅依赖提供的商品化指标目录。
-
随着市场蓬勃发展,LLM 可观测性平台在高级功能上出现分化
LLM 可观测性和评估平台市场正在迅速扩张,预计到 2030 年将达到 92.6 亿美元。平台正朝着 AI 原生工具、开源评估库、AI 网关和 APM 扩展等方向多元化发展,并且越来越多地采用 OpenTelemetry 标准以实现互操作性。Langfuse、Helicone、Opik 和 MLflow 等领先平台之间的关键差异化因素在于其高级功能,例如自动跟踪评分、复杂的速率限制规则、用于主题和 PII 检测的集成防护栏,以及具有差…
-
LLM 可观测性工具捕获追踪但限制断言粒度
用于 LLM Agent 的可观测性工具,如 Langfuse、LangSmith 和 Phoenix,提供了捕获生产追踪的方法,但它们在定义输入和断言方面的默认配置可能有限制性。作者认为,捕获 Agent 的失败需要将输入定义为失败点的状态,而不仅仅是初始用户消息,并且断言槽通常捕获单个输出,而不是工具调用的完整轨迹。DeepEval 被强调为一个例外,它提供了可以直接对工具调用序列进行断言建模的模式。
-
新的RAG框架提升了印度最高法院判例的法律AI能力
研究人员开发了一个新的检索增强生成(RAG)框架,专门用于印度最高法院判例的法律问答。该框架纳入了领域特定的增强功能,如基于修辞的块划分、基于融合的检索和交叉编码器重排序,以提高信息检索的相关性。它还通过使用聊天历史和查询重写来考虑对话方面,并考虑法律文件中的结构元素(如法官姓名)来提高检索质量。使用DeepEval框架进行的评估在上下文召回率和答案相关性方面表现强劲,突显了该框架在上下文密集型法律任务中的有效性以及领域特定AI系统开发的重要性。
-
EvalPort 推出 11 种评分器类型,实现灵活的 LLM 评估
EvalPort 开发了一个灵活的评分器系统,旨在适应各种 LLM 评估框架。该系统具有 11 种不同的评分器类型,每种类型都有特定的参数和评估方法,旨在广泛应用于实际场景。这种设计使得评估套件能够自描述,并允许不同的框架使用标准化的评分器 ID 来实现和比较结果。
-
OpenAI收购Promptfoo引发对LLM评估独立性的辩论
OpenAI对Promptfoo的收购促使人们重新评估LLM评估工具,突显了对供应商依赖和成本的担忧。作者提出了一种替代方法,使用自定义训练的分类器,结合Sentence Transformers和逻辑回归,该方法提供离线执行、供应商独立性以及比基于LLM的评分方法更快的评估速度。这种方法需要标记的训练数据,但为CI/CD管道提供了一种经济高效且可控的解决方案。
-
开发者使用 DeepEval 测试 AI 支持应用的决策能力
一位开发者探索了使用 DeepEval 等评估框架来测试 AI 应用,特别是为了确保支持分诊的准确决策。通过为各种客户支持工单创建预期结果的数据集,开发者可以系统地测试提示的更改。这种方法发现,AI 将常规的 API 密钥轮换请求错误地升级为安全事件,从而促使调整提示以区分实际的安全威胁和常见的操作指南查询。
-
LLM 评估指标在检测 AI 虚假信息方面存在显著差异
一项近期实验比较了两种流行的 LLM 作为评委(LLM-as-judge)的忠实度指标 Ragas 和 DeepEval,揭示了它们在检测虚假信息方面的显著差异。尽管两种指标都应用于使用 GPT-4o 的相同虚假 RAG 系统输出,但 Ragas 将该虚假信息评为 0.0,而 DeepEval 则一致将其评为 1.0,甚至称赞该输出准确无误。实验强调,LLM 评委擅长检测意义的颠倒,但在遗漏方面却表现不佳,例如遗漏关键信息(如药物剂量…
-
大型语言模型提示词修改绕过测试,导致准确率显著下降
在对系统提示词进行了一个微小的单词修改后,大型语言模型提取准确率从0.87显著下降到0.78。这暴露了当前大型语言模型应用开发中的一个关键漏洞:提示词的更改通常会绕过代码所经历的严格测试和验证。作者提倡在持续集成(CI)管道中实施一个“提示词回归门”,其中包括一个固定的评估数据集、一个一致的评分指标和一个增量阈值,以防止有害的提示词修改。
-
AI评估差距被戏称为“西瓜效应”,因实际使用效果不及测试
一位AI开发者发现,其AI导师ARIA在实际使用中的表现与其在测试中的表现存在显著差距,这种现象被他称为“西瓜效应”。虽然DeepEval和Ragas等标准评估指标显示ARIA在忠实度和苏格拉底式合规性等方面的得分超过94%,但实际用户互动显示其苏格拉底式合规率仅为22.2%。这种差异的出现是因为该AI针对可预测的测试用例进行了优化,但未能应对那些挑战其核心行为契约的对抗性或意外用户输入。
-
AI代理评估工具现支持分步分析
评估AI代理已不再局限于检查最终结果。截至2026年7月,新的框架支持分步分析,区分不同类型的失败。这些工具现在可以评估特定方面,如正确的工具选择、参数准确性和路径质量,而不仅仅是整体任务完成情况。这些框架的关键区别在于它们依赖LLM裁判进行这些细粒度评估,还是采用确定性的、基于代码的检查。
-
新工具'muteval'测试LLM评估的鲁棒性
Ashwin Ugale开发了一个名为muteval的新工具,该工具借鉴了软件工程中的变异测试,用于评估大型语言模型(LLM)评估套件的鲁棒性。Muteval通过修改提示、删除文档或替换模型来故意降低系统性能,然后重新运行现有的评估指标,以识别覆盖范围的不足。对open-rag-eval的早期测试表明,引用检查未能发现一个关键的失败案例,即在缺乏上下文的情况下,模型被允许编造答案,这凸显了对更全面的评估策略的需求。
-
LLM法官引入系统性偏见,扭曲评估结果
使用大型语言模型(LLM)作为评判其他LLM输出的法官会引入系统性偏见,例如位置、冗长和自我偏好,这些偏见无法像随机噪声一样被平均掉。这些偏见会扭曲评估结果,导致对模型性能的评估不准确。虽然GPT-4等工具在超过80%的情况下可以与人类偏好达成一致,但其固有的偏见意味着报告的分数可能反映的是法官的特性,而不是模型的真实能力。开发人员在解释评估指标时必须考虑到这些系统性错误,以避免错误地归因性能特征。
-
LLM-as-judge CI门禁产生意外成本;确定性替代方案提供节省
一位工程师发现,使用LLM-as-judge指标进行CI/CD评估门禁会产生显著的持续成本。这些评估拉取请求的门禁,由于需要对OpenAI等模型进行重复的API调用,可能会产生巨额账单。该工程师发现,像Promptfoo、MLflow和Future AGI这样的确定性评估框架,可以在不进行模型调用的情况下执行类似的门禁功能,因此每个拉取请求的成本为零。这种方法避免了对外部API定价、延迟和速率限制的依赖,为CI/CD质量门禁提供了更具…