Hugging Face 发布了 EVA-Bench 数据 2.0,这是一个用于评估语音代理的扩展基准。新版本将其范围扩大到三个企业领域:航空公司客户服务管理、企业 IT 服务管理和医疗保健人力资源服务交付。更新后的数据集包含 121 个工具的 213 个场景,比之前版本有了显著增加,并已针对 GPT-5.4、Gemini 3.1 Pro 和 Claude Opus 4.6 等领先模型进行了验证。 AI
影响 为语音代理提供了一个更全面、更现实的评估框架,推动开发朝着更好地处理复杂的企业任务迈进。
排序理由 发布了一个新版本的评估基准数据集,其范围和场景有所扩展。
- Anthropic
- Claude Opus 4.6
- EVA-Bench
- Gemini 3.1 Pro
- GPT-5.4
- Hugging Face
- OpenAI
- Anthropic Claude Opus 4.6
- Google Gemini 3.1 Pro
- OpenAI GPT-5.4
- ServiceNow
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →