开发了一个名为 AcoustiClaim 的新基准,用于评估音频语言模型在陈述声学量数值声明方面的准确性。该基准从文本中提取数值声明,并根据仪器参考对其进行评分,按参考来源对数量进行分类。对包括一个闭源模型在内的五个模型的实验显示,错误率很高,许多模型未能超过恒定预测器的基准。即使使用校准阈值,错误减少也有限,并且一些指标持续保持高位。 AI
影响 凸显了当前音频语言模型准确量化声学特性的能力限制,表明需要改进数值推理和地面实况。
排序理由 该项目是一篇研究论文,详细介绍了用于评估音频语言模型的新基准。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →