研究人员推出了EXAM^2,这是一个旨在评估多语言和多模态音频理解能力的新基准。该基准包含六种语言和多种音频类型,包括语音、声音、音乐和混合音频,以及视觉信息。EXAM^2旨在为大型音频语言模型提供更现实的音频推理和跨模态理解能力评估。初步评估显示,当前模型存在显著的性能差距,而经过微调的Gemma3n-EXAM^2模型在该基准上表现出 substantial 改进。 AI
影响 为评估音频AI建立了新标准,有望推动多语言和多模态理解能力的提升。
排序理由 该集群描述了在arXiv上发布的一项新AI研究基准。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →