PulseAugur
实时 12:38:08
实体 Evals

Evals

PulseAugur coverage of Evals — every cluster mentioning Evals across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
5
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
关系
情绪 · 30 天

5 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. RESEARCH · CL_176048 ·

    Supabase 发布开源基准测试,用于评估 AI 编码代理 · 跟踪 2 个来源

    Supabase 发布了一个名为 Evals 的开源基准测试和框架,用于评估 AI 编码代理。该工具在真实的 Supabase 任务(如模式创建和调试)上测试 Claude Code、Codex 和 OpenCode 等代理,并使用容器化环境进行现实测试。初步发现表明,虽然 Opus 5 和 Kimi K3 等顶级模型在没有帮助的情况下表现良好,但较小的模型在获得专业技能后会显著提高,并且所有代理在处理迁移和身份验证验证方面都显示出弱点。

  2. COMMENTARY · CL_157974 ·

    LLM法官引入系统性偏见,扭曲评估结果

    使用大型语言模型(LLM)作为评判其他LLM输出的法官会引入系统性偏见,例如位置、冗长和自我偏好,这些偏见无法像随机噪声一样被平均掉。这些偏见会扭曲评估结果,导致对模型性能的评估不准确。虽然GPT-4等工具在超过80%的情况下可以与人类偏好达成一致,但其固有的偏见意味着报告的分数可能反映的是法官的特性,而不是模型的真实能力。开发人员在解释评估指标时必须考虑到这些系统性错误,以避免错误地归因性能特征。

  3. TOOL · CL_142846 ·

    新的AI工具旨在提高代理的可靠性和开发者的控制力

    Agnost AI 推出了旨在识别和修复在真实生产环境中发生的AI代理故障的工具,这些故障常常被Evals等传统测试方法所忽略。该平台分析实时用户数据以精确定位问题,并自动生成代码建议供开发者实施修复,从而为AI代理优化创建了一个闭环。另外,Juggler 为AI编码代理提供了一个可视化界面,打破了线性的聊天交互模式,转变为一种树状结构,使开发者能够更精确地控制和深入了解AI的编码过程。

  4. COMMENTARY · CL_137683 ·

    AI工程趋势:Harness和评估先进系统

    AI工程领域在Harness工程和评估方法方面正出现显著趋势。这些进展对于开发和完善人工智能系统至关重要。讨论强调了AI工程师使用的工具和技术的演变格局。

  5. TOOL · CL_125176 ·

    LLMOps 将 Evals、可观测性和安全性集成到 CI/CD 流水线中

    本文详细介绍了 LLMOps 的实现,LLMOps 是专注于管理大型语言模型 (LLM) 的 MLOps 的一种专门形式。它强调将 Evals、可观测性和安全性集成到自动化的 CI/CD 流水线中,每次 GitHub 推送都会触发。该方法将提示视为代码,利用版本管理和自动化评估来确保部署前的质量和安全。与传统 MLOps 的关键区别包括提示版本控制、幻觉监控和成本管理。

  6. TOOL · CL_64888 ·

    AI代理通过评估得到增强:测量、分析、改进周期

    本文讨论了如何通过使用 Evals 框架的测量、分析、改进和重新测量这一持续循环来提高 AI 代理的质量。它强调了定量评估响应质量以推动开发的重要性。该过程旨在通过系统地评估其性能来改进 AI 代理。