EVA-Bench
PulseAugur coverage of EVA-Bench — every cluster mentioning EVA-Bench across labs, papers, and developer communities, ranked by signal.
- 2026-05-13 research_milestone Researchers released EVA-Bench, a new end-to-end framework for evaluating voice agents. 来源
-
xAI 发布 Grok Voice,具备类人性能且成本更低
xAI 发布了 Grok Voice,这是一款新推出的语音 AI 模型, boasting 尖端的性能和类人特质。该模型同时实现了顶级准确性和用户体验,在 EVA-Bench 上超越了竞争对手。xAI 强调,与现有解决方案相比,Grok Voice 的成本效益也显著更高。
-
Hugging Face 将语音代理基准扩展到 3 个领域,121 个工具
Hugging Face 发布了 EVA-Bench 数据 2.0,这是一个用于评估语音代理的扩展基准。新版本将其范围扩大到三个企业领域:航空公司客户服务管理、企业 IT 服务管理和医疗保健人力资源服务交付。更新后的数据集包含 121 个工具的 213 个场景,比之前版本有了显著增加,并已针对 GPT-5.4、Gemini 3.1 Pro 和 Claude Opus 4.6 等领先模型进行了验证。
-
新的EVA-Bench框架评估语音代理性能
研究人员推出EVA-Bench,一个旨在全面评估语音代理的新框架。该系统通过生成逼真的模拟对话并衡量语音特定故障模式的质量来应对关键挑战。EVA-Bench 包含任务完成度、音频保真度和对话体验的指标,能够进行跨架构比较。该框架包括众多场景、口音和噪声的鲁棒性测试,并提供系统性能变化的洞察。
-
新基准和平台推动语音智能体评估与开发
新研究推出了 EVA-Bench,一个用于评估语音智能体的综合框架,解决了模拟真实对话和衡量各种故障模式性能的挑战。同时,发布了新的韩语语音基准(KVoiceBench、KOpenAudioBench、KMMAU),以改进多语言 SpeechLM 的评估,并突显与以英语为中心的模型相比存在的性能差距。此外,Together AI 和 AssemblyAI 正在改进用于构建实时语音智能体的平台,重点关注降低延迟、改善集成和解决生产限制。