DeepEval
PulseAugur coverage of DeepEval — every cluster mentioning DeepEval across labs, papers, and developer communities, ranked by signal.
- competes with Ragas 70%
- competes with Future AGI 70%
- competes with Langfuse 70%
- competes with Braintrust Ai 70%
- competes with Arize Phoenix 70%
- competes with Confident AI 70%
- other Ragas 50%
- affiliated with Future AGI 50%
- other Langfuse 50%
- affiliated with Braintrust Ai 50%
- used by Braintrust Ai 50%
- used by Future AGI 50%
7 天有情绪数据
-
LLM评估工具提供指标,但关键挑战依然存在
对五个流行的LLM评估工具——Arize Phoenix、DeepEval、Future AGI、Langfuse和Ragas——的回顾表明,虽然它们提供了广泛的预构建指标,但这些指标仅占评估过程的20%的简单部分。这些工具在很大程度上仍未解决的关键挑战是选择与特定故障模式准确对齐的指标以及为结果建立误差范围。作者认为,LLM评估的真正成功取决于理解系统的独特故障分类法并据此选择或创建自定义指标,而不是仅仅依赖提供的商品化指标目录。
-
随着市场蓬勃发展,LLM 可观测性平台在高级功能上出现分化
LLM 可观测性和评估平台市场正在迅速扩张,预计到 2030 年将达到 92.6 亿美元。平台正朝着 AI 原生工具、开源评估库、AI 网关和 APM 扩展等方向多元化发展,并且越来越多地采用 OpenTelemetry 标准以实现互操作性。Langfuse、Helicone、Opik 和 MLflow 等领先平台之间的关键差异化因素在于其高级功能,例如自动跟踪评分、复杂的速率限制规则、用于主题和 PII 检测的集成防护栏,以及具有差…
-
LLM 可观测性工具捕获追踪但限制断言粒度
用于 LLM Agent 的可观测性工具,如 Langfuse、LangSmith 和 Phoenix,提供了捕获生产追踪的方法,但它们在定义输入和断言方面的默认配置可能有限制性。作者认为,捕获 Agent 的失败需要将输入定义为失败点的状态,而不仅仅是初始用户消息,并且断言槽通常捕获单个输出,而不是工具调用的完整轨迹。DeepEval 被强调为一个例外,它提供了可以直接对工具调用序列进行断言建模的模式。
-
新的RAG框架提升了印度最高法院判例的法律AI能力
研究人员开发了一个新的检索增强生成(RAG)框架,专门用于印度最高法院判例的法律问答。该框架纳入了领域特定的增强功能,如基于修辞的块划分、基于融合的检索和交叉编码器重排序,以提高信息检索的相关性。它还通过使用聊天历史和查询重写来考虑对话方面,并考虑法律文件中的结构元素(如法官姓名)来提高检索质量。使用DeepEval框架进行的评估在上下文召回率和答案相关性方面表现强劲,突显了该框架在上下文密集型法律任务中的有效性以及领域特定AI系统开发的重要性。
-
EvalPort 推出 11 种评分器类型,实现灵活的 LLM 评估
EvalPort 开发了一个灵活的评分器系统,旨在适应各种 LLM 评估框架。该系统具有 11 种不同的评分器类型,每种类型都有特定的参数和评估方法,旨在广泛应用于实际场景。这种设计使得评估套件能够自描述,并允许不同的框架使用标准化的评分器 ID 来实现和比较结果。
-
OpenAI收购Promptfoo引发对LLM评估独立性的辩论
OpenAI对Promptfoo的收购促使人们重新评估LLM评估工具,突显了对供应商依赖和成本的担忧。作者提出了一种替代方法,使用自定义训练的分类器,结合Sentence Transformers和逻辑回归,该方法提供离线执行、供应商独立性以及比基于LLM的评分方法更快的评估速度。这种方法需要标记的训练数据,但为CI/CD管道提供了一种经济高效且可控的解决方案。
-
开发者使用 DeepEval 测试 AI 支持应用的决策能力
一位开发者探索了使用 DeepEval 等评估框架来测试 AI 应用,特别是为了确保支持分诊的准确决策。通过为各种客户支持工单创建预期结果的数据集,开发者可以系统地测试提示的更改。这种方法发现,AI 将常规的 API 密钥轮换请求错误地升级为安全事件,从而促使调整提示以区分实际的安全威胁和常见的操作指南查询。
-
LLM 评估指标在检测 AI 虚假信息方面存在显著差异
一项近期实验比较了两种流行的 LLM 作为评委(LLM-as-judge)的忠实度指标 Ragas 和 DeepEval,揭示了它们在检测虚假信息方面的显著差异。尽管两种指标都应用于使用 GPT-4o 的相同虚假 RAG 系统输出,但 Ragas 将该虚假信息评为 0.0,而 DeepEval 则一致将其评为 1.0,甚至称赞该输出准确无误。实验强调,LLM 评委擅长检测意义的颠倒,但在遗漏方面却表现不佳,例如遗漏关键信息(如药物剂量…
-
大型语言模型提示词修改绕过测试,导致准确率显著下降
在对系统提示词进行了一个微小的单词修改后,大型语言模型提取准确率从0.87显著下降到0.78。这暴露了当前大型语言模型应用开发中的一个关键漏洞:提示词的更改通常会绕过代码所经历的严格测试和验证。作者提倡在持续集成(CI)管道中实施一个“提示词回归门”,其中包括一个固定的评估数据集、一个一致的评分指标和一个增量阈值,以防止有害的提示词修改。
-
AI评估差距被戏称为“西瓜效应”,因实际使用效果不及测试
一位AI开发者发现,其AI导师ARIA在实际使用中的表现与其在测试中的表现存在显著差距,这种现象被他称为“西瓜效应”。虽然DeepEval和Ragas等标准评估指标显示ARIA在忠实度和苏格拉底式合规性等方面的得分超过94%,但实际用户互动显示其苏格拉底式合规率仅为22.2%。这种差异的出现是因为该AI针对可预测的测试用例进行了优化,但未能应对那些挑战其核心行为契约的对抗性或意外用户输入。
-
AI代理评估工具现支持分步分析
评估AI代理已不再局限于检查最终结果。截至2026年7月,新的框架支持分步分析,区分不同类型的失败。这些工具现在可以评估特定方面,如正确的工具选择、参数准确性和路径质量,而不仅仅是整体任务完成情况。这些框架的关键区别在于它们依赖LLM裁判进行这些细粒度评估,还是采用确定性的、基于代码的检查。
-
新工具'muteval'测试LLM评估的鲁棒性
Ashwin Ugale开发了一个名为muteval的新工具,该工具借鉴了软件工程中的变异测试,用于评估大型语言模型(LLM)评估套件的鲁棒性。Muteval通过修改提示、删除文档或替换模型来故意降低系统性能,然后重新运行现有的评估指标,以识别覆盖范围的不足。对open-rag-eval的早期测试表明,引用检查未能发现一个关键的失败案例,即在缺乏上下文的情况下,模型被允许编造答案,这凸显了对更全面的评估策略的需求。
-
LLM法官引入系统性偏见,扭曲评估结果
使用大型语言模型(LLM)作为评判其他LLM输出的法官会引入系统性偏见,例如位置、冗长和自我偏好,这些偏见无法像随机噪声一样被平均掉。这些偏见会扭曲评估结果,导致对模型性能的评估不准确。虽然GPT-4等工具在超过80%的情况下可以与人类偏好达成一致,但其固有的偏见意味着报告的分数可能反映的是法官的特性,而不是模型的真实能力。开发人员在解释评估指标时必须考虑到这些系统性错误,以避免错误地归因性能特征。
-
LLM-as-judge CI门禁产生意外成本;确定性替代方案提供节省
一位工程师发现,使用LLM-as-judge指标进行CI/CD评估门禁会产生显著的持续成本。这些评估拉取请求的门禁,由于需要对OpenAI等模型进行重复的API调用,可能会产生巨额账单。该工程师发现,像Promptfoo、MLflow和Future AGI这样的确定性评估框架,可以在不进行模型调用的情况下执行类似的门禁功能,因此每个拉取请求的成本为零。这种方法避免了对外部API定价、延迟和速率限制的依赖,为CI/CD质量门禁提供了更具…
-
构建生产级 LLM 评估流水线:从感觉走向指标 · 跟踪 8 个来源
这一系列文章详细介绍了为大型语言模型(LLM)构建生产级评估流水线的过程,超越了主观的“感觉检查”,转而实施自动化指标。作者强调了领域特定裁判、CI/CD 集成的速度、回归检测以及健壮的黄金数据集管理的需求。他们提出了一种涉及测试用例、待测 LLM、裁判集合和用于回归检测的指标的架构,并提供了使用 GPT-4o mini 等模型构建自定义 LLM 裁判的示例。
-
RAG 管道通过外部数据检索增强 LLM
检索增强生成 (RAG) 管道通过在生成响应之前整合外部数据来增强 LLM,本质上为模型提供了一场“开卷考试”。检索步骤的质量至关重要,因为分块或检索问题通常会导致性能不佳,而不是 LLM 本身的问题。实际实现涉及检索后生成循环,其中获取相关数据块,然后用于指导 LLM 的答案,确保响应基于特定、权威的信息。
-
Promptfoo、DeepEval 在 CI 可靠性方面领先开源 LLM 评估框架
对六个开源 LLM 测试框架的评估显示,在八个月的时间里,只有 Promptfoo 和 DeepEval 能够可靠地通过持续集成 (CI) 检查。成功框架的关键区别在于其确定性,提供一致的通过/失败结果和快速的退出代码,这对于合并队列门禁至关重要。那些严重依赖 LLM-as-judge 指标但没有确定性种子的框架被证明是不可靠的,导致不必要的延迟并训练团队绕过门禁。
-
AI代理:用户寻求可靠的测试和评估方法
r/LocalLLaMA subreddit上的一位用户正在寻求关于如何可靠地测试和评估AI代理的建议,他表示对确保代理能够正确运行感到沮丧,而不仅仅是手动进行的“基于感觉”的检查。他正在向社区征求关于代理评估的方法、工具和设置见解,特别询问固定测试用例与手动测试、技能水平与端到端检查以及首选的评估框架(如DeepEval、LangSmith或Ragas)。
-
新论文评估 RAG 指标与人类评分的对比结果
一项新的研究论文评估了各种检索增强生成 (RAG) 指标的有效性,将其与人类评估和召回率等标准指标进行比较。该研究使用了源自业务数据并由人工标注者评分的问答数据集。它强调了当前方法论的局限性,并提出了未来的研究方向,该研究建立在先前一篇法语出版物的基础上。
-
LLM评估必须权衡失败的严重性,而不仅仅是通过率
最近一次LLM部署中发生了PII泄露事件,一个代理在支持回复中意外包含了客户的账户ID和部分账单地址。尽管评估仪表板显示通过率为94%,但仍发生了此事件。该问题凸显了LLM评估中单一、扁平的通过率指标的不足,因为它未能区分各种失败的严重程度。例如,PII泄露的后果远比措辞冗长或语气不正确等小问题严重得多。