一项新的基准测试评估了包括多个Gemini模型和Kimi-Audio-7B-Instruct在内的十一种音频分类方法在声源识别任务上的表现。表现最佳的模型Gemini-3.1-Pro-Preview在类别级F1分数上达到了85.6%,在细粒度F1分数上达到了56.7%。研究还发现,Gemini模型经常给出自信但错误的答案,并且响应长度与准确性不相关。 AI
影响 为音频-语言模型的性能设定了新的基准,突显了Gemini的能力并为未来模型开发提供信息。
排序理由 该集群描述了一篇研究论文,该论文在一个特定的基准测试上评估了多个音频分类模型。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →