Every 是一家专注于 AI 评估的公司,正在为其员工开发个性化基准测试,以评估 AI 模型在特定工作任务上的性能。首席执行官 Dan Shipper 解释说,这些由编辑 Kate Lee 和评估主管 Mike Taylor 等人设计的定制评估,超越了通用基准测试,旨在衡量模型在按照个人标准完成文案编辑或创建演示文稿等任务时的表现。这种方法旨在创建一个反馈循环,其中模型失败可以为评估标准的改进提供信息,最终帮助用户识别最适合其特定需求的 AI 模型。 AI
影响 个性化基准测试可以改善针对特定企业工作流程的 AI 模型选择。
排序理由 该公司正在开发一种新的内部工具/方法论来评估 AI 模型。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →