Evals
PulseAugur coverage of Evals — every cluster mentioning Evals across labs, papers, and developer communities, ranked by signal.
8 天有情绪数据
-
AI工程师就业市场要求超越基础路线图的高级技能
AI工程师的就业市场正在迅速扩张,拥有AI技能的职位增长速度远超整体就业市场,并且薪资更高。然而,一个侧重于RAG和Agents等热门词汇的通用路线图可能不足以满足入门级候选人的需求。相反,市场越来越倾向于那些在评估、系统设计和部署等领域展示出高级技能,并拥有真实项目强大作品集的候选人。这种转变表明,市场对专业化、需要大量判断力的专业知识的需求日益增长,而不仅仅是基础知识。
-
Skybridge v2 推出新的 MCP 协议及 Evals 测试框架
Skybridge 发布了 2.0 版本,引入了新的 MCP 协议,该协议经历了重大更改,包括变为无状态并移除了会话 ID。此次更新需要重建服务器架构,从单个 McpServer 实例转向为每个请求实例化新服务器的工厂模式。一个关键的新功能是 Evals,这是一个测试框架,旨在允许开发人员定义和执行涉及 LLM 的测试,以确保他们的应用程序在部署前正常运行。
-
Claude Code 推出技能管理工具以提高 AI 效率
团队正在采用新的策略来管理 AI 技能,重点关注效率和成本效益。Claude Code 推出的 '/skill-doctor' 是一项关键进展,它可以识别未使用或成本高昂的技能,使团队能够对其进行修剪。这补充了将技能存储在 Git 存储库中、将其范围限定在特定工作流以及使用 AI 评估进行测试等实践,最终目标是减少 token 使用量并为团队建立一致的基线性能。
-
AI代理的评估需要新鲜数据和多层测试
确保AI代理在生产环境中的可靠性需要超越简单评分的强大评估方法。作者强调了数据集新鲜度的关键重要性,并警告说静态数据集可能导致代理记住示例而不是真正改进。提出了三个评估层级:用于格式验证的结构断言、用于针对明确标准进行语义分析的 judge LLM,以及用于全面测试的包含人工策划输出的黄金数据集。黄金数据集的持续更新对于反映实际使用情况和防止评估沦为一种形式至关重要。
-
LLM 评估集成到 .NET CI/CD 流水线中作为发布门禁
将评估工具集成到 .NET CI/CD 流水线中,可以作为 LLM 变更的发布门禁,有助于在部署前自动检测回归、安全违规和成本飙升。一个实际案例涉及一个从 GPT-3.5 Turbo 升级到 GPT-4-preview 的金融科技策略机器人,评估门禁成功捕获了一个安全回归问题,即机器人重复了一个占位符策略编号,导致自动回滚。工程师在实施这些门禁时,必须仔细权衡速度、成本和置信度之间的权衡,避免常见的错误,如忽略 token 成本或硬编码阈值。
-
LLM学习路线图:构建机器人、知识助手和顾问
本指南概述了通过实践项目学习生成式AI和LLM工程的实用路线图。建议从构建一个潜在客户分类机器人开始,以理解LLM API和提示工程,然后使用检索增强生成(RAG)来整合外部数据,创建一个公司知识助手。最后一步是通过开发一个医疗顾问来学习微调技术,重点是数据集准备和模型适应。
-
Figma 招聘 AI Models 设计负责人,招募设计推断岗位
Figma 聘请了 Elou,他将领导 AI Models 团队的设计工作。该团队正在积极招聘专注于 evals、judge 和 rubric 开发的岗位,以使 AI 模型能够推断设计元素。此次招聘活动凸显了该团队在构建设计生成和评估模型方面的重点。
-
发布工程领域排名前五的LLM评估框架排名
最近的一项分析强调,Promptfoo是发布工程领域领先的LLM评估框架,尤其因其能够阻止构建失败测试的CI/CD集成而备受关注。DeepEval推荐用于基于Python的测试套件,并提供与pytest的无缝集成。LangSmith因其强大的托管可追溯性和实验历史而受到关注,适合优先考虑详细记录的团队。OpenAI Evals因其可重用的评估规范而受到认可,而Ragas则被确定为评估检索增强生成(RAG)质量的专业工具。评估标准侧重于…
-
AI 供应商 Anthropic、OpenAI 因未宣布的工具关闭而面临用户数据丢失风险
两大 AI 供应商 Anthropic 和 OpenAI 正在逐步淘汰关键的 Prompt 管理和评估工具,但缺乏明确的弃用警告对用户构成了重大风险。Anthropic 更新后的 Workbench 将不支持已保存的 Prompt、变量或评估,如果未导出,数据可能在 8 月 17 日后丢失。OpenAI 的 Evals 工具将在 10 月 31 日变为只读模式,之后完全关闭,这可能会在停止记录结果之前掩盖问题。一个关键发现是,两家供应…
-
AI测试人员抵制传统标签,采用“验证工程”
据报道,AI专业人士正在避免使用传统的测试术语,选择诸如“evals”或“validation engineering”之类的术语,而不是“testers”或“QA/QE”。这种语言上的转变表明了将AI测试视为一个独立学科的愿望,尽管文章认为它与嵌入式设备测试中长期以来处理非确定性结果的既有实践有相似之处。
-
Supabase 发布开源基准测试,用于评估 AI 编码代理 · 跟踪 2 个来源
Supabase 发布了一个名为 Evals 的开源基准测试和框架,用于评估 AI 编码代理。该工具在真实的 Supabase 任务(如模式创建和调试)上测试 Claude Code、Codex 和 OpenCode 等代理,并使用容器化环境进行现实测试。初步发现表明,虽然 Opus 5 和 Kimi K3 等顶级模型在没有帮助的情况下表现良好,但较小的模型在获得专业技能后会显著提高,并且所有代理在处理迁移和身份验证验证方面都显示出弱点。
-
LLM法官引入系统性偏见,扭曲评估结果
使用大型语言模型(LLM)作为评判其他LLM输出的法官会引入系统性偏见,例如位置、冗长和自我偏好,这些偏见无法像随机噪声一样被平均掉。这些偏见会扭曲评估结果,导致对模型性能的评估不准确。虽然GPT-4等工具在超过80%的情况下可以与人类偏好达成一致,但其固有的偏见意味着报告的分数可能反映的是法官的特性,而不是模型的真实能力。开发人员在解释评估指标时必须考虑到这些系统性错误,以避免错误地归因性能特征。
-
新的AI工具旨在提高代理的可靠性和开发者的控制力
Agnost AI 推出了旨在识别和修复在真实生产环境中发生的AI代理故障的工具,这些故障常常被Evals等传统测试方法所忽略。该平台分析实时用户数据以精确定位问题,并自动生成代码建议供开发者实施修复,从而为AI代理优化创建了一个闭环。另外,Juggler 为AI编码代理提供了一个可视化界面,打破了线性的聊天交互模式,转变为一种树状结构,使开发者能够更精确地控制和深入了解AI的编码过程。
-
AI工程趋势:Harness和评估先进系统
AI工程领域在Harness工程和评估方法方面正出现显著趋势。这些进展对于开发和完善人工智能系统至关重要。讨论强调了AI工程师使用的工具和技术的演变格局。
-
LLMOps 将 Evals、可观测性和安全性集成到 CI/CD 流水线中
本文详细介绍了 LLMOps 的实现,LLMOps 是专注于管理大型语言模型 (LLM) 的 MLOps 的一种专门形式。它强调将 Evals、可观测性和安全性集成到自动化的 CI/CD 流水线中,每次 GitHub 推送都会触发。该方法将提示视为代码,利用版本管理和自动化评估来确保部署前的质量和安全。与传统 MLOps 的关键区别包括提示版本控制、幻觉监控和成本管理。
-
AI代理通过评估得到增强:测量、分析、改进周期
本文讨论了如何通过使用 Evals 框架的测量、分析、改进和重新测量这一持续循环来提高 AI 代理的质量。它强调了定量评估响应质量以推动开发的重要性。该过程旨在通过系统地评估其性能来改进 AI 代理。