Evals
PulseAugur coverage of Evals — every cluster mentioning Evals across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
Supabase 发布开源基准测试,用于评估 AI 编码代理 · 跟踪 2 个来源
Supabase 发布了一个名为 Evals 的开源基准测试和框架,用于评估 AI 编码代理。该工具在真实的 Supabase 任务(如模式创建和调试)上测试 Claude Code、Codex 和 OpenCode 等代理,并使用容器化环境进行现实测试。初步发现表明,虽然 Opus 5 和 Kimi K3 等顶级模型在没有帮助的情况下表现良好,但较小的模型在获得专业技能后会显著提高,并且所有代理在处理迁移和身份验证验证方面都显示出弱点。
-
LLM法官引入系统性偏见,扭曲评估结果
使用大型语言模型(LLM)作为评判其他LLM输出的法官会引入系统性偏见,例如位置、冗长和自我偏好,这些偏见无法像随机噪声一样被平均掉。这些偏见会扭曲评估结果,导致对模型性能的评估不准确。虽然GPT-4等工具在超过80%的情况下可以与人类偏好达成一致,但其固有的偏见意味着报告的分数可能反映的是法官的特性,而不是模型的真实能力。开发人员在解释评估指标时必须考虑到这些系统性错误,以避免错误地归因性能特征。
-
新的AI工具旨在提高代理的可靠性和开发者的控制力
Agnost AI 推出了旨在识别和修复在真实生产环境中发生的AI代理故障的工具,这些故障常常被Evals等传统测试方法所忽略。该平台分析实时用户数据以精确定位问题,并自动生成代码建议供开发者实施修复,从而为AI代理优化创建了一个闭环。另外,Juggler 为AI编码代理提供了一个可视化界面,打破了线性的聊天交互模式,转变为一种树状结构,使开发者能够更精确地控制和深入了解AI的编码过程。
-
AI工程趋势:Harness和评估先进系统
AI工程领域在Harness工程和评估方法方面正出现显著趋势。这些进展对于开发和完善人工智能系统至关重要。讨论强调了AI工程师使用的工具和技术的演变格局。
-
LLMOps 将 Evals、可观测性和安全性集成到 CI/CD 流水线中
本文详细介绍了 LLMOps 的实现,LLMOps 是专注于管理大型语言模型 (LLM) 的 MLOps 的一种专门形式。它强调将 Evals、可观测性和安全性集成到自动化的 CI/CD 流水线中,每次 GitHub 推送都会触发。该方法将提示视为代码,利用版本管理和自动化评估来确保部署前的质量和安全。与传统 MLOps 的关键区别包括提示版本控制、幻觉监控和成本管理。
-
AI代理通过评估得到增强:测量、分析、改进周期
本文讨论了如何通过使用 Evals 框架的测量、分析、改进和重新测量这一持续循环来提高 AI 代理的质量。它强调了定量评估响应质量以推动开发的重要性。该过程旨在通过系统地评估其性能来改进 AI 代理。